冲刺全球首个100万小时具身数据!三家国产公司联手
黎曼动力联合光轮智能和诺亦腾机器人,共同构建具身智能数据底座,目标在2026年底前完成100万小时机器人训练数据采集,力争成为全球首个突破该规模的企业。此举旨在解决具身智能领域数据量不足和质量参差的问题,推动机器人能力的规模化发展。
黎曼动力联合光轮智能和诺亦腾机器人,共同构建具身智能数据底座,目标在2026年底前完成100万小时机器人训练数据采集,力争成为全球首个突破该规模的企业。此举旨在解决具身智能领域数据量不足和质量参差的问题,推动机器人能力的规模化发展。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
黎曼动力联合光轮智能、诺亦腾机器人,计划到2026年底完成100万小时机器人训练数据采集,试图验证具身智能的Scaling路径。
具身智能的Scaling迟迟未发生,行业共识是数据问题。机器人训练数据无法像大语言模型那样从互联网获取,目前普遍停留在数千到数万小时,达到数十万小时的模型屈指可数。
Physical Intelligence训练π0时使用了超过1万小时数据,英伟达GR00T 1.7公开数据约4万小时,谷歌DeepMind联合20多家机构才凑出100多万条轨迹。这些规模在大模型世界只是起步。
数据不仅量不足,质的要求也更高。真机数据、人类视频、仿真数据各有短板,且分散在不同玩家手中,导致采集、训练、评测脱节,难以形成闭环。
黎曼动力、光轮智能、诺亦腾机器人宣布共建具身智能数据底座,将采集、仿真、训练和评测连成一线。黎曼动力负责模型训练,诺亦腾提供真实动作数据,光轮智能提供仿真与评测。
黎曼动力前身是昆仑万维的Matrix世界模型团队,曾开发Matrix-Game系列,最新版本支持720p长时序交互。团队发现游戏世界模型与机器人World Action Model研究的是同一道题,即动作如何改变世界。
Riemann-1.0延续了Matrix的建模能力,将机器人动作纳入统一框架,能在开放世界中规划行动。但要从23.2万小时数据推向100万小时,需要产业链配合,而非单靠算法。
黎曼动力目标到2026年底完成100万小时数据采集,力争成为全球首个突破这一规模的企业。据亿欧智库报告,当前全球高质量具身交互数据仅约50万小时,目标为现有存量的两倍。
昆仑万维董事长方汉表示,具身智能模型的能力分化在于谁能率先把训练数据采集到百万小时、千万小时甚至亿小时级别。百万小时不是终点,而是起点。
这一目标更像一次行业实验:验证数据真正开始Scaling后,机器人能力能否跟着Scaling。
自动驾驶行业早期拼里程,后来发现真正拉开差距的是长尾场景能否快速变成训练数据。Waymo通过内部闭环,真实道路经验超2亿英里,仿真里程数十亿英里。
机器人行业难以照搬Waymo模式,因为机器人尚未大规模进入家庭和工厂,缺乏天然数据入口,且失败成本高。因此联合建设闭环成为更现实的选择,英伟达已联合Google DeepMind等建设Physical AI Data Factory。
黎曼动力等三方的合作遵循同一逻辑,且将共建数据规范、标注标准和评测基准,部分数据开源,推动行业共同加速。
本文信息主要来自量子位的报道,其中行业数据(如全球50万小时)来自亿欧智库报告,属于第三方估算;Physical Intelligence和英伟达的数据为公开披露;黎曼动力的目标为官方宣布。部分细节如团队历史来自创始人访谈,可信度较高。
百万小时数据冲刺不仅是规模竞赛,更是对具身智能Scaling路径的一次行业级实验,其成败将影响机器人能否真正走进家庭和工厂。
主报道
主报道来源