智在无界发布首个隐式触觉世界动作模型Being-H0.8
智在无界发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8,该模型将触觉纳入预测-执行-反馈链路,通过50万小时视频数据训练,使机器人能预判接触并实时调整动作。在真实实验中,模型完成了包中取物、毛笔写字等依赖触觉的高难度任务。
智在无界发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8,该模型将触觉纳入预测-执行-反馈链路,通过50万小时视频数据训练,使机器人能预判接触并实时调整动作。在真实实验中,模型完成了包中取物、毛笔写字等依赖触觉的高难度任务。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
智在无界发布Being-H0.8,首次将触觉纳入隐式世界-动作模型,通过50万小时人类视频和创新的数据管线,让机器人具备“预测-执行-反馈”的触觉闭环能力。
现有世界模型大多以视觉为核心,能观察物体移动和形变,但难以准确判断接触是否发生、发生在哪里以及受力大小。同时,触觉传感器数据形态不统一,大规模人类视频和机器人数据集普遍缺少同步触觉记录。这导致训练具备触觉能力的世界模型既缺乏统一表征,也缺少可规模化获取的训练数据。Being-H0.8正是针对这一问题的解法。
Being-H0.8在Being-H0.7基础上首次将触觉模态纳入隐空间表示,扩展为隐式触觉世界-动作模型。核心模块包括:Mixture of Transformers (MoT) 预测交互后果;慢-快动作专家——慢速流维护整体任务计划,快速流根据最新触觉实时重算下一小段动作;通用触觉编码器将不同传感器信号统一为触觉token;TopoHand对齐人手、灵巧手和平行夹爪的动作空间。训练时,未来触觉token进入MoT后验分支帮助理解状态变化;部署时,MoT提前预测,快速流实时纠偏。
数据底座UniHand-3.0源自超50万小时第一人称视频,经过滤、去重、切分、语言标注和分布再平衡后,通过MANO恢复手部动作。关键创新在于TactoHand:利用手-物三维几何关系,从无触觉标注的视频中预测778个顶点上的接触和邻近度,使用21个数据源共3010万帧训练。此外,约55小时、540万帧压力手套数据补充真实压力信息。通用触觉编码器建立由粗到细的触觉金字塔,将不同粒度的触觉信号映射为固定数量token,并携带有效性标记区分“无传感器”与“读数为零”。
Being-H系列经历了三个阶段:从验证人类视频可用性(H0→H0.5),到规模化使用(H0.5→H0.7),再到H0.8追求高质量利用——通过清洗、动作恢复、触觉标注和表征统一,从海量视频中提取更准确的物理训练信号。团队认为核心壁垒不再是拥有多少视频,而是能否将数据收集、清洗、动作恢复、触觉标注、世界建模与机器人控制接成完整链路。
本文信息主要来自量子位对智在无界发布的报道,属于企业宣传性质,部分性能描述(如“国内规模最大”)为来源方自称,未经独立验证。模型能力(如完成高难度任务)为团队实验声称,未提供第三方复现或对比基准。
Being-H0.8通过创新的隐式触觉世界模型架构和超50万小时数据管线,首次将触觉纳入世界模型的预测-执行-反馈闭环,为机器人精细操作提供了新范式。但其实际泛化能力和数据质量仍需独立验证。
主报道
主报道来源