返回信息流
新闻事件
机器之心
1 个来源

τ0-VLA发布:让机器人学会“先想后做”,迈向长程任务时代

上海创智学院罗剑岚团队与智元机器人联合发布τ0-VLA模型,提出“慢思考-快执行”分层架构,将测试时扩展推理与世界模型推演引入具身智能,使机器人能完成数十步长程任务。该模型使用超4万小时真实世界数据预训练,在多项长程任务中表现优于传统VLA,标志着具身智能从“会动作”向“会做事”迈进。

SynthePulse Insight · AI 深度解读

τ0-VLA:让机器人“先想后做”,具身智能迈入长程任务时代

版本 1 · 1 个来源

上海创智学院与智元机器人联合发布τ0-VLA模型,通过“慢思考-快执行”分层架构和世界模型引导的测试时计算,首次让机器人在执行前进行物理世界推演,在长程任务中成功率从27.5%提升至45.0%。

  • τ0-VLA采用“慢思考-快执行”双系统架构,将高层任务规划与低层动作执行解耦,避免传统VLA反应式决策在长程任务中的误差累积、步骤重复和目标漂移问题。
  • 高层系统引入子任务级束搜索机制,通过Propose Model生成候选、World Model预测未来画面、Value Model打分、Reflective Model决策,首次将测试时计算用于物理世界链式影响评估。
  • 低层系统构建统一40维全身动作空间,支持单臂、双臂、轮式移动人形等多种机器人形态,通过掩码实现跨本体无缝适配。
  • 模型使用40115小时真实世界交互数据预训练,其中超2万小时真机数据,覆盖AGIBOT G1、ARX AC One、Franka等多平台,是当前最大规模真机数据预训练的具身基础模型。
  • 在真实长程任务(全屋清洁、烹饪、制作奶茶等)中,τ0-VLA平均成功率27.5%→45.0%,任务进度80.10%→87.85%,优于π0.5、GR00T N1.7等主流VLA模型。
  • τ0-VLA与团队此前发布的LWD(后训练强化学习系统)和τ0-WM(世界模型)共同构成“大规模预训练+大规模后训练”路线,形成数据闭环,使机器人能力在部署后持续进化。
展开章节目录从“会动作”到“会做事”:长程任务成为具身智能新瓶颈

从“会动作”到“会做事”:长程任务成为具身智能新瓶颈

2026 WAIC上,具身智能的关注点从单点技能Demo转向真实场景下的复杂任务完成能力。然而,当前主流VLA模型本质是反应式决策范式,将当前观测与语言指令直接映射为低层动作,缺乏对任务历史、执行进度与后果的显式建模。这种“看一眼、做一下”的模式在数秒短程任务中表现尚可,但在耗时数分钟、涉及数十个步骤的长程任务中暴露出三个系统性缺陷:误差累积(如夹爪偏移1毫米或底盘角度偏差0.5度逐级放大)、步骤重复与遗漏(如已收杯子又再次执行)、目标漂移(注意力被局部细节吸引,行为逐渐偏离初始指令)。

现实世界任务如“整理房间”“准备一顿饭”往往包含连续数十个步骤,机器人不仅需要精准动作,更需要围绕长期目标持续规划、执行和纠错。这要求具身智能从“让机器人学会一个动作”转向“让机器人完成一项任务”,而τ0-VLA正是针对这一挑战提出的新思路。

双系统架构:慢思考与快执行的协同

τ0-VLA的设计灵感源自人类脑科学双系统理论,将机器人系统拆分为高层规划系统(慢思考)和低层动作系统(快执行)。高层系统负责理解用户目标、将复杂任务拆解为子任务,并通过任务记忆跟踪执行状态,回答“下一步做什么”;低层系统负责将选定的子任务转化为稳定、实时的全身动作。这一分层避免了传统VLA让单一模型同时承担长期规划和实时控制的困境,将昂贵的测试时算力倾斜给高层,同时为低层保留高频、低延迟的动作控制接口。

高层系统由四大模块协同构建子任务级束搜索机制:Propose Model生成多个候选下一步子任务;World Model基于图像编辑模型预测每个候选执行后的环境状态,输出“想象中的未来画面”;Value Model对推演结果进行多维度打分,评估任务完成度、安全性和隐性风险;Reflective Model横向对比所有候选,输出最终决策,若与整体进度冲突则触发重选。这是首次将测试时计算精准投向对真实物理世界“链式物理影响”的前瞻评估。

低层系统构建了统一40维全身动作空间,通过掩码屏蔽无需使用的自由度,实现单臂、双臂、固定底座、轮式移动人形等多种机器人形态的跨本体无缝适配。执行过程中通过视觉反馈以闭环方式生成连续动作,使机器人能根据实时环境变化调整行为,提高面对真实世界扰动时的稳定性。

世界模型引导的测试时计算:让机器人“先想后做”

τ0-VLA将世界模型引导的测试时计算引入具身决策。世界模型不追求生成逼真的未来场景,而是回答“如果执行某个动作,未来世界会发生什么变化”。面对任务,机器人不会立即选择动作,而是先对不同方案进行未来状态预测。测试时计算让机器人具备类似“思考预算”的能力:简单问题保持效率,复杂问题投入更多推理资源。配合深度思考动态路由机制,模型仅在判定为高难度的子任务节点启动深度思考,其余场景直接输出快速决策,兼顾决策质量与推理效率。

这一机制打破了传统LLM在文本空间中单纯重复采样择优的局限,首次将测试时算力用于评估真实物理世界的链式影响。实验表明,引入层级规划系统后,τ0-VLA在AGIBOT G1平台上的平均成功率由27.5%提升至45.0%,平均任务进度由80.10%提升至87.85%,相比π0.5、GR00T N1.7等主流VLA模型在长程任务上表现出明显提升。

大规模真机数据预训练:4万小时物理世界经验

τ0-VLA使用40115小时真实世界机器人交互数据预训练,其中包含超2万小时真机数据,覆盖AGIBOT G1、ARX AC One、Franka等多个机器人平台,以及UMI数据和多个公开数据集。这是当前具身智能领域规模领先的真机数据预训练,数据涵盖固定机械臂、移动机器人、双臂机器人等多种形态,构成多机器人、多任务、多场景的物理世界经验库。

训练采用高层规划系统与低层动作系统协同方式:低层策略从机器人示范数据中学习动作执行能力;高层规划器利用任务分解标注、执行记忆和世界状态变化信息学习任务拆解与预测;同时加入多模态联合训练数据保持视觉语言理解能力。这使得τ0-VLA训练的不只是一个动作模型,而是一套面向真实世界任务的机器人智能系统。

路线图:从单点模型到持续进化的数据闭环

τ0-VLA并非孤立工作。团队此前已发布面向真实世界大规模后训练强化学习系统LWD和预训练具身世界模型τ0-WM。三项工作共同指向“大规模预训练+大规模后训练”路线:预训练提供通用能力,世界模型负责预演行动后果,τ0-VLA完成复杂任务,真实部署产生的数据通过LWD回流训练,形成持续进化的数据闭环。这一路线试图突破静态模仿学习的局限,让机器人在进入真实世界后继续学习、修正和提升。

从行业视角看,τ0-VLA展示了一种从“动作智能”走向“任务智能”的系统架构。早期竞争集中在硬件结构和运动控制,VLA阶段转向指令理解与动作执行,而τ0-VLA提出的“先推演、后执行”范式,让机器人从被动执行走向主动规划。将大模型的泛化能力与真实物理世界的强化学习数据飞轮相结合,被认为是实现具身智能规模化部署的必由之路。

可信度边界

本文信息主要来源于机器之心对上海创智学院罗剑岚团队与智元机器人具身研究中心联合发布τ0-VLA的报道,属于第二手来源。所有具体数据(如40115小时、超2万小时真机数据、成功率27.5%→45.0%等)均来自该报道,未获第三方独立验证。模型架构、性能对比等描述基于论文和项目页面,但本文未直接引用原始论文,因此相关结论应视为来源声明。

核心结论

τ0-VLA通过“慢思考-快执行”分层架构和世界模型引导的测试时计算,首次让机器人在执行前进行物理世界推演,显著提升了长程任务成功率。结合大规模真机数据预训练和持续进化数据闭环,该路线为具身智能从实验室走向真实场景提供了系统化解决方案。

主报道

机器之心

主报道来源