Generalist AI 称 GEN-1.5 可通过一次演示学习新机器人任务
📰 全文
Generalist AI 发布的 GEN-1.5 被报道为一款机器人基础模型。公司称,模型可把 3 至 12 秒的人类或机器人演示作为传感器—动作上下文,在无需梯度更新的情况下执行新操作;公司将这种方式称为“physical prompting(物理提示)”。
原文要点
- 报道称,GEN-1.5 同时处理视频、传感器读数、语言指令和本体感觉数据,并以 100Hz 输出动作。
- 在十项操作任务中,公司报告预训练模型的一次演示平均成功率为 59%,并给出正负 10 个百分点的标准差。
- 公司称,以约五分钟任务数据进行十步训练后,平均成功率升至 83%;这属于额外训练,不等同于一次演示的结果。
- 文中涉及开罐、拉开笔袋拉链等任务,结论主要来自公司披露,尚需独立复现和更广泛场景检验。
为什么重要
若机器人确能以短演示而非大规模任务专属数据适应操作流程,部署新任务所需的数据采集和工程周期可能下降。这一方向对制造、仓储等场景有吸引力,但现实环境的安全、失败恢复和任务边界比演示集更复杂,不能仅据发布数据推断可直接规模化落地。
关键要点
- “物理提示”以演示的传感器—动作序列作为上下文,而不是只用文字指令。
- 公司报告的一次演示结果与少量再训练后的结果应明确区分。
- 该能力的稳健性、跨硬件迁移和独立评测仍是关键问题。