腾讯开源三大具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢
腾讯在WAIC 2026期间开源了三款具身基座模型,并提出了“三层脑”架构,将认知、感知和运动控制分层运行,以解决机器人响应延迟问题。首席科学家张正友强调,物理世界存在不同的时间尺度,分层架构将长期稳定。
腾讯在WAIC 2026期间开源了三款具身基座模型,并提出了“三层脑”架构,将认知、感知和运动控制分层运行,以解决机器人响应延迟问题。首席科学家张正友强调,物理世界存在不同的时间尺度,分层架构将长期稳定。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
腾讯 Robotics X 实验室开源三款具身基座模型,核心思路是让机器人的认知、感知和执行以不同频率运行,以匹配物理世界的时间尺度差异。首席科学家张正友认为,这一分层架构可能在相当长时间内保持稳定。
腾讯 Robotics X 实验室主任张正友指出,当前 VLA 模型的一个痛点是视觉理解和动作生成常在同一频率下执行,但实际物理世界中不同信息对延迟的容忍度差异极大:触觉反馈约 1 毫秒,底层运动控制 500Hz 至 1000Hz,而大模型若以高频运行算力难以承受。
为此,腾讯将具身智能拆分为三个同时在线但运行频率不同的层级:最上层认知系统按需唤醒,负责复杂任务理解和深度推理;中间层感知行动系统以约 15Hz 持续接收多模态信息并快速调整动作;最下层执行系统以更高频率处理碰撞、失衡等突发情况。
张正友判断,这套分层架构可能在相当长时间内保持稳定,因为它对应的不是某一代模型的性能限制,而是物理世界本身存在的时间尺度差异。他强调“分层运行、闭环训练”,不同模型在推理时承担不同职责和频率,训练时仍可联合优化。
腾讯此次发布的认知模型 RxBrain 不仅用语言生成任务步骤和约束,还会预测每个子任务完成后物理世界应呈现的状态,即提前生成“做完以后应该是什么样”。这相当于将视觉状态纳入信息通路,拓宽了认知带宽。
张正友表示,语言只是认知的一种低带宽容通道,视觉信息往往远高于文本信息。例如“整理餐具”任务,用语言描述盘子、酒杯的距离需要大量文字且易产生歧义,而给机器人看一张完成后的照片信息更直接。
RxBrain 被定义为“具身世界认知模型”,结合 Hy-Embodied-VLM(看懂世界)和 Hy-Embodied-VLA(超 1 万小时示教数据,RoboDojo 评测综合第一),试图补齐认知与身体之间过去缺失的信息链路。
张正友强调:“Demo 做到 80 分、90 分,真正没有落地,几乎就等于零。”实验室成功抓取一次与生产线连续完成数万次任务完全不同。在工厂中,模型需面对 SKU 频繁变化、物料随机摆放、节拍要求等挑战。
腾讯披露,Hy-Embodied-VLA 已进入一家日化品工厂进行生产测试,在高混合、小批量、SKU 频繁迭代的产线上,作业成功率超过 95%,单件节拍快于 6 秒;面对新增 SKU,留给数据采集和模型后训练的时间不到 3 天。
腾讯云异构计算研发总监陈煜东透露,具身智能客户开始提出千卡、万卡规模算力需求,相关需求呈现约 200% 至 300% 的增长,部分模型甚至两三天便迭代一个版本。
腾讯选择养老作为技术试验场,展示的“小六”机器人可通过双臂完成按摩动作,目前只学习了四种双臂协同手法。张正友强调,腾讯并不准备销售养老机器人本体,选择养老是因为与人发生物理接触几乎集中了具身智能最困难的问题。
工业抓取力度稍大或可完成任务,但搀扶老人、按摩时力度姿态不能严重偏差。视觉判断、触觉反馈、力觉控制必须紧密结合,安全性不能只做到 95%。张正友表示:“进入家庭这样的非结构性环境,安全性是 100% 一定要保障的。”
养老场景是对分层架构的极限测试:高层模型要理解人的意图,中层系统根据姿态和肌肉状态调整动作,底层在出现异常力道时立即停止。张正友称:“养老不是我喜欢,而是它很重要。”
本文信息主要来自腾讯官方媒体采访,属于第二手报道。所有具体数字和性能指标均为腾讯方面声称,未经独立第三方验证。
腾讯通过分层架构和开源策略,试图解决具身智能中认知、感知与执行的时间尺度不匹配问题,并在工业与养老场景中验证落地可行性。其核心判断是:物理世界的时间尺度差异是固有约束,分层架构可能长期稳定。
主报道
主报道来源