新智具身联合复旦大学发布触觉数据技术报告,补齐具身智能“手感”
新智具身与复旦大学联合发布了三份技术报告,旨在通过3万小时的触觉交互数据解决具身智能中触觉感知缺失的问题。团队提出了统一触觉表征模型NeoForce,以及两种技术路线:-VTLA通过预测未来触觉演变提升操作成功率,-TWAM将触觉融入世界模型,让机器人在执行前进行触觉想象推演。项目数据和模型将开源,有望推动具身智能在精细操作领域的进步。
新智具身与复旦大学联合发布了三份技术报告,旨在通过3万小时的触觉交互数据解决具身智能中触觉感知缺失的问题。团队提出了统一触觉表征模型NeoForce,以及两种技术路线:-VTLA通过预测未来触觉演变提升操作成功率,-TWAM将触觉融入世界模型,让机器人在执行前进行触觉想象推演。项目数据和模型将开源,有望推动具身智能在精细操作领域的进步。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
新智具身联合复旦大学发布系列技术报告,用3万小时触觉数据试图补齐机器人“手感”短板,在插拔、折叠等精细操作中取得显著提升,但数据成本与泛化仍是挑战。
在具身智能落地中,机器人常出现“视觉系统判定无误,但物理交互瞬间翻车”的现象,如插头反复摩擦难以插入、抓取塑料瓶力道失控导致瓶身瘪陷。这些失败指向一个行业共识:决定机器人能否在真实物理世界生存的关键,不只在于视觉感知精度,更在于接触瞬间的触觉反馈。摄像头能确认空间位置,却无法感知“是否接触”、“顶到边缘”、“夹力过载”或“发生滑移”等,缺失这层反馈正是阻碍机器人跨越“最后一厘米”的核心痛点。
触觉数据的规模化应用长期受制于各类设备输出格式互不兼容。新智具身搭建的NeoData数据集旨在打破这一壁垒:包含超3万小时视觉-触觉交互视频,约140万条操作片段,33亿个时间步,对应80亿帧RGB画面与100亿帧触觉图像,动用Franka、Piper、UR5e等6种机器人本体,覆盖450项真实长程任务,由90位操作员采集,已开源5千小时视觉-触觉交互视频。
团队还提出NeoForce统一表征模型,无论底层传感器硬件如何,都能学习到具备迁移能力、时序结构化的触觉表征,供下游具身智能策略使用,有效解决跨设备数据融合难题。
-VTLA提出不依赖滞后的当前触觉,而是预测未来50步内的触觉演变。该模型将当前触觉编码为紧凑的潜在Token,结合视觉上下文预判滑移、受力等趋势,从而指导动作模块提前调整。在插插头任务中成功率达85%,而同类视觉方案仅60%;在拔钥匙任务成功率达99%,而视觉方案为35%。
此外,-VTLA突破了传统模仿学习仅依赖专家成功轨迹的局限,让机器人从失败数据中实现自主进化。模型结合触觉信息利用部署后数据及human-in-the-loop数据训练进度评估模型,识别任务执行阶段及“退步”与“救场”等复杂行为。通过离线强化学习,机器人在毛巾折叠、书包收纳、纸箱折叠等长程任务上的成功率分别从50%、35%、20%大幅跃升至95%、80%、75%。
-TWAM将触觉放进世界模型,让机器人在动手之前先在“想象”中完整推演操作视角和手感。现有世界模型大多局限于未来视觉图像生成,在驱动真实机器人时面临物理对齐挑战:画面里杯子被抓住了,但手指夹没夹稳?这些触感信息完全缺失。-TWAM同时预测未来的视频、触觉和动作三个相互耦合的序列。
-TWAM采用混合专家架构,内置视频、触觉、动作三个异步专家网络,总参数量72亿,仅相当于全宽方案的一半。在仿真与真机测试中,仿真平均成功率达84.5%(世界模型最强基线为36%);真机8项任务平均成功率46.3%(LingBot-VA为21.9%)。消融实验进一步证实,去除“未来触觉预测”或“当前触觉条件”均会导致性能显著下降,确立了触觉在世界模型中的不可或缺性。
纵观系列三份报告,NeoteAI释放了明确信号:-Foundation验证了触觉模态具备类似视觉的Scaling潜力;-VTLA证明了触觉可自然接入现有VLA架构;-TWAM确立了触觉在世界模型顶层设计中的核心地位。机器人的认知范式正从单一的“视觉驱动”向“视触融合”演进。
然而,距离“随手一摸即知轻重”的通用具身智能仍有长路要走。真实场景下的数据采集成本、跨本体泛化能力以及推理实时性仍是亟待攻克的工程难题。尽管这组工作已实质性地推动触觉从“小众研究方向”跃升为“具身智能核心基建”,但触觉能否真正成为下一个Scaling Law,仍需更多验证。
本文信息主要来源于新智具身与复旦大学联合发布的系列技术报告,经机器之心转载。所有数据、成功率等均为报告声称,未经第三方独立验证。
触觉数据在精细操作中展现出巨大潜力,但距离通用化仍有工程挑战,视触融合或将成为具身智能下一阶段的关键方向。
主报道
主报道来源
另有 1 个来源报道