返回信息流
新闻事件
机器之心
2 个来源

新智具身联合复旦大学发布触觉数据技术报告,补齐具身智能“手感”

新智具身与复旦大学联合发布了三份技术报告,旨在通过3万小时的触觉交互数据解决具身智能中触觉感知缺失的问题。团队提出了统一触觉表征模型NeoForce,以及两种技术路线:-VTLA通过预测未来触觉演变提升操作成功率,-TWAM将触觉融入世界模型,让机器人在执行前进行触觉想象推演。项目数据和模型将开源,有望推动具身智能在精细操作领域的进步。

SynthePulse Insight · AI 深度解读

触觉数据能否成为具身智能的下一个 Scaling Law?

版本 1 · 1 个来源

新智具身联合复旦大学发布系列技术报告,用3万小时触觉数据试图补齐机器人“手感”短板,在插拔、折叠等精细操作中取得显著提升,但数据成本与泛化仍是挑战。

  • 新智具身与复旦大学发布三份技术报告,构建触觉数据底座NeoData(3万小时交互视频、140万操作片段),并提出统一表征模型NeoForce解决跨设备数据融合。
  • -VTLA通过预测未来50步触觉演变,在插插头任务中成功率85%(视觉方案60%),拔钥匙99%(视觉35%),并利用失败数据实现自主进化。
  • -TWAM将触觉融入世界模型,仿真平均成功率84.5%(基线36%),真机8项任务平均46.3%(基线21.9%),消融实验证实触觉不可或缺。
  • 尽管成果显著,但真实场景数据采集成本、跨本体泛化能力及推理实时性仍是工程难题,触觉从“辅助模态”跃升为“核心基建”仍需验证。
展开章节目录触觉缺失:机器人“最后一厘米”的痛点

触觉缺失:机器人“最后一厘米”的痛点

在具身智能落地中,机器人常出现“视觉系统判定无误,但物理交互瞬间翻车”的现象,如插头反复摩擦难以插入、抓取塑料瓶力道失控导致瓶身瘪陷。这些失败指向一个行业共识:决定机器人能否在真实物理世界生存的关键,不只在于视觉感知精度,更在于接触瞬间的触觉反馈。摄像头能确认空间位置,却无法感知“是否接触”、“顶到边缘”、“夹力过载”或“发生滑移”等,缺失这层反馈正是阻碍机器人跨越“最后一厘米”的核心痛点。

NeoData与NeoForce:构建触觉“普通话”

触觉数据的规模化应用长期受制于各类设备输出格式互不兼容。新智具身搭建的NeoData数据集旨在打破这一壁垒:包含超3万小时视觉-触觉交互视频,约140万条操作片段,33亿个时间步,对应80亿帧RGB画面与100亿帧触觉图像,动用Franka、Piper、UR5e等6种机器人本体,覆盖450项真实长程任务,由90位操作员采集,已开源5千小时视觉-触觉交互视频。

团队还提出NeoForce统一表征模型,无论底层传感器硬件如何,都能学习到具备迁移能力、时序结构化的触觉表征,供下游具身智能策略使用,有效解决跨设备数据融合难题。

-VTLA:触觉预判与失败中学习

-VTLA提出不依赖滞后的当前触觉,而是预测未来50步内的触觉演变。该模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。在插插头任务中成功率达85%,而同类视觉方案仅60%;在拔钥匙任务成功率达99%,而视觉方案为35%。

此外,-VTLA突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中实现自主进化。模型结合触觉信息利用部署后数据及human-in-the-loop数据训练进度评估模型,识别任务执行阶段及“退步”与“救场”等复杂行为。通过离线强化学习,机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率分别从50%、35%、20%大幅跃升至95%、80%、75%。

-TWAM:世界模型中的“触觉想象”

-TWAM将触觉放进世界模型,让机器人在动手之前先在“想象”中完整推演操作视角和手感。现有世界模型大多局限于未来视觉图像生成,在驱动真实机器人时面临物理对齐挑战:画面里杯子被抓住了,但手指夹没夹稳?这些触感信息完全缺失。-TWAM同时预测未来的视频、触觉和动作三个相互耦合的序列。

-TWAM采用混合专家架构,内置视频、触觉、动作三个异步专家网络,总参数量72亿,仅相当于全宽方案的一半。在仿真与真机测试中,仿真平均成功率达84.5%(世界模型最强基线为36%);真机8项任务平均成功率46.3%(LingBot-VA为21.9%)。消融实验进一步证实,去除“未来触觉预测”或“当前触觉条件”均会导致性能显著下降,确立了触觉在世界模型中的不可或缺性。

挑战与展望:触觉能否成为新 Scaling Law?

纵观系列三份报告,NeoteAI释放了明确信号:-Foundation验证了触觉模态具备类似视觉的Scaling潜力;-VTLA证明了触觉可自然接入现有VLA架构;-TWAM确立了触觉在世界模型顶层设计中的核心地位。机器人的认知范式正从单一的“视觉驱动”向“视触融合”演进。

然而,距离“随手一摸即知轻重”的通用具身智能仍有长路要走。真实场景下的数据采集成本、跨本体泛化能力以及推理实时性仍是亟待攻克的工程难题。尽管这组工作已实质性地推动触觉从“小众研究方向”跃升为“具身智能核心基建”,但触觉能否真正成为下一个Scaling Law,仍需更多验证。

可信度边界

本文信息主要来源于新智具身与复旦大学联合发布的系列技术报告,经机器之心转载。所有数据、成功率等均为报告声称,未经第三方独立验证。

核心结论

触觉数据在精细操作中展现出巨大潜力,但距离通用化仍有工程挑战,视触融合或将成为具身智能下一阶段的关键方向。

主报道

机器之心

主报道来源

同一事件报道

另有 1 个来源报道