返回信息流
新闻事件
B标准51
NVIDIA Developer Blog
1 个来源

超越VLA:世界动作模型如何重塑机器人操作

本文探讨了机器人操作中泛化能力的关键挑战,提出超越视觉-语言-动作模型(VLA)的世界动作模型(World Action Models)概念。这些模型旨在通过理解任务背后的物理规律而非简单模仿演示,来提升策略在物体形状、位置或光照变化下的泛化能力。文章强调了世界模型作为机器人策略骨干的重要性。

SynthePulse Insight · AI 深度解读会员精读

世界行动模型:从“描述世界”到“预测世界”的机器人策略革命

版本 1 · 1 个来源

当视觉语言模型(VLM)擅长描述世界却无法预测其演化时,世界行动模型(WAM)以视频世界模型为骨干,为机器人策略带来物理泛化能力,实现零样本迁移。NVIDIA Cosmos 3 作为开放基础模型,正推动这一转变从研究走向多层级部署。

  • WAM 以视频世界模型为骨干,而非 VLM,因此能学习物理动态,实现零样本迁移到新任务、机器人和环境。
  • NVIDIA Cosmos 3 采用 Mixture-of-Transformers 架构,训练数据包含约 7.67 亿张图像、3.48 亿个视频和 800 万个动作样本。
  • 基于 Cosmos 3 的 DROID 策略在 RoboLab 成功率从 28.1% 提升至 36.8%,证明物理先验带来的增益。
展开章节目录VLA 的局限与 WAM 的兴起

VLA 的局限与 WAM 的兴起

传统机器人策略依赖预训练的视觉语言模型(VLM)作为骨干,形成视觉-语言-动作(VLA)模型。VLM 优化目标是生成图像描述,而非预测场景演化,因此 VLA 在语义泛化上表现良好,但在物理泛化上不足——当物体形状、位置或光照变化时,策略可能失效。

世界行动模型(WAM)将骨干替换为视频世界模型,直接建模世界如何演化。NVIDIA 研究员 Jim Fan 在演讲中提出“VLAs 已死,世界行动模型万岁”,这一观点被总结为行业趋势。WAM 的核心优势在于,后训练无需从零学习动态,而是基于已有的物理先验进行特化。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来自 NVIDIA 官方技术博客,属于厂商分析,部分数据(如 RoboLab 成功率)来自其技术报告,未经独立验证。文中“VLAs 已死”等表述为观点,非事实。

主报道

NVIDIA Developer Blog

主报道来源