返回信息流
新闻事件
量子位
2 个来源

机器人界的GPT-3时刻来了?Generalist AI发布GEN-1.5,看3秒就能学会新动作

Generalist AI发布了机器人基础模型GEN-1.5,该模型通过大规模物理数据预训练,实现了One-shot Learning,机器人只需观看3-12秒的动作示范即可学会新任务,且无需梯度更新或微调。该模型还能将不同演示拼接学习,并具备从模拟器到真实世界的迁移能力,被视为机器人领域的“GPT-3时刻”。

SynthePulse Insight · AI 深度解读

GEN-1.5:单次演示教会机器人新任务,但成功率和验证仍是问号

版本 1 · 1 个来源

机器人初创公司Generalist AI发布GEN-1.5,号称能从单个演示中教会机器人新任务,无需训练。但59%的平均成功率、83%的微调后表现,以及缺乏独立验证,让这一“通用”能力仍需打上问号。

  • GEN-1.5通过将3-12秒的演示作为“物理提示”加载到上下文窗口,让机器人无需训练即可执行任务。
  • 公司报告在十项测试中平均成功率为59%,经过十步训练和五分钟数据后提升至83%。
  • 模型能串联两个提示、使用仿真演示,并部分模仿人类手部动作,这些能力据称在八个月预训练中自发涌现。
  • Generalist声称是首个在广泛任务中实现上下文学习的研究团队,但所有结果均来自公司自身,未经独立验证。
展开章节目录核心机制:物理提示与上下文学习

核心机制:物理提示与上下文学习

GEN-1.5的核心创新在于将演示视频作为“物理提示”加载到模型的上下文窗口,相当于短期记忆。用户只需提供3到12秒的演示,机器人便能直接执行任务,无需额外训练。这种机制类似于大语言模型中的上下文学习,但应用于机器人领域。

据公司介绍,模型能够串联两个提示形成更长序列,并能使用仿真环境中的演示,还能部分模仿人类手部动作。这些能力据称是在超过八个月的交互数据预训练中自发涌现,而非显式训练的结果。

性能数据:从59%到83%

在十项测试中,如打开罐子或从钱包取钱,GEN-1.5的平均成功率为59%。当使用五分钟数据执行十步训练后,成功率提升至83%。这些数据来自公司报告,但未提供具体任务列表或测试条件。

值得注意的是,59%的基线成功率表明,即使没有训练,模型也能在多数简单任务上成功,但仍有近半数失败。而83%的微调后表现虽然显著提升,但训练步骤和数据量相对较小,可能暗示任务本身较为简单。

声称的通用性:首次还是延续?

Generalist声称是首个在广泛任务中实现上下文学习的团队,而其他研究团队此前仅在少数任务类型中展示过类似能力。这一声称需要谨慎看待,因为“广泛”的定义模糊,且公司未提供与其他方法的直接对比。

尽管公司强调其通用性,但展示的任务均为简单短时操作,且所有结果均来自公司内部,缺乏第三方独立验证。因此,这一“首次”的宣称仍属于公司单方面声明,而非已确认的事实。

局限与不确定性

目前,GEN-1.5的演示任务简单且时间短,其能否扩展到复杂、长时程任务尚不清楚。公司未提供失败案例的分析,也未说明模型在真实世界中的鲁棒性。

所有性能数据均来自公司自身,未经独立验证,因此存在选择性报告或过度拟合演示的可能性。此外,模型对演示质量的敏感性、对仿真到现实迁移的依赖程度等关键细节也未披露。

可信度边界

本报道基于THE DECODER的二手报道,所有性能数据和能力声称均来自Generalist AI公司,未经独立验证。因此,这些数据应视为公司声称而非已确认事实。

核心结论

GEN-1.5展示了机器人领域上下文学习的潜力,但59%的基线和83%的微调成功率均来自公司自报,且任务简单、缺乏独立验证。其“通用性”声称需更多证据支持,在独立复现之前,应谨慎看待其实际能力。

主报道

量子位

主报道来源

同一事件报道

另有 1 个来源报道