返回信息流
新闻事件
A重点83
AI前线
1 个来源

大晓开源L5级具身数据集ACE-Data-0,含1700万帧真实家庭交互数据

大晓机器人联合南洋理工大学S-Lab开源了L5级多模态具身物理智能数据集ACE-Data-0,包含1700万帧视频、200个任务类别,覆盖真实家庭场景。该数据集通过环境式采集引擎ACE同步采集多模态数据,旨在为具身模型提供高质量数据底座,推动通用物理智能发展。

SynthePulse Insight · AI 深度解读

ACE-Data-0:把真实家庭变成机器人物理世界的教材

版本 1 · 1 个来源

大晓机器人联合南洋理工大学 S-Lab 开源 L5 级具身数据集 ACE-Data-0,以 1700 万帧视频、200 个任务类别和 7.5 万个交互片段,尝试为具身智能提供高密度、多模态、长时序的真实交互数据底座。

  • ACE-Data-0 包含 1700 万帧视频、200 个任务类别、50 名参与者、2 个真实家庭场景和 7.5 万个交互片段。
  • 数据采集采用桌面尺度与房间尺度两套互补系统,覆盖精细手部操作与长程家庭活动。
  • 所有模态(视频、运动、触觉、音频等)通过时间同步与空间标定统一到同一时空框架。
  • 采用目标级指令而非脚本式采集,保留真实行为中的犹豫、调整和恢复过程。
  • 基于数据集构建三级评测基准,评测 30 多种方法后发现现有模型在接触、遮挡等场景存在明显能力缺口。
展开章节目录数据缺口:从“看见动作”到“理解行动”

数据缺口:从“看见动作”到“理解行动”

具身智能进入物理世界后,面临的基础问题是从什么数据中学习人类行动能力。普通视频能记录发生了什么,却难以呈现接触时机、力度变化、物体运动以及任务间的前后依赖。现有第一人称视频常缺少精确的人体、手部和物体状态;动作捕捉数据多来自理想化实验室,缺乏自然遮挡、第一人称视角、音频和触觉。大量数据停留在数秒的单步动作,难以描述真实家庭场景中的长期依赖。

ACE-Data-0 的提出正是针对这一缺口:不再把活动切割成孤立短片,而是连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程。其核心特点可概括为完整感知、长时序任务、多模态同步。

两套采集系统:从桌面到房间的互补设计

精细手部操作与房间尺度活动对采集系统要求不同。指尖接触、抓握变化需要近距离密集传感器;人在厨房、客厅、卧室间移动则需要大范围覆盖和统一空间坐标。为此,环境式采集引擎 ACE 设计了桌面尺度与房间尺度两套互补配置。

桌面尺度系统面向精细化手-物交互,布置多视角摄像机、光学动作捕捉和触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。房间尺度系统覆盖完整家居空间,通过广基线摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动和连续交互。

两套配置共享统一的数据采集、同步、标定、质检和标注流程。参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机补足遮挡信息。此外还记录物体运动、全手掌触觉压力和多通道音频。

时空统一:多模态数据的关键难点

多模态数据真正的难点不是设备数量,而是不同设备数据的准确对应。摄像机、动作捕捉、触觉手套和音频设备通常有独立时钟与不同采样频率,几毫秒偏差就可能导致画面中手未接触杯子而触觉信号已产生;没有统一空间基准则无法建立几何关系。

ACE-Data-0 通过时间同步与空间标定,将视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并将外部摄像机、第一人称设备、人体、双手和物体配准至共享世界坐标系。这样,每次采集成为对同一物理过程的统一记录,研究者可直接找到某帧对应的人体姿态、物体位置、接触压力和声音变化。

数据集还提供相机参数、同步时间线、人体及手部状态、物体网格与六自由度位姿、边界框、运动轨迹、手-物接触信息,以及与物理时间线对齐的自然语言描述。大量标注直接来自经过标定的采集系统,而非完全依赖模型事后估计,从而在遮挡、快速运动和长期任务中保持一致性。

目标级指令:保留真实行为差异

ACE-Data-0 覆盖三类任务:原子级人-物交互(单次约 3 分钟,如倒水、清洗、擦拭、切割、折叠等);长时序家庭场景活动链(可持续 20-30 分钟,如从打开冰箱到收拾的完整流程);人-场景交互(约 5 分钟,包括移动、坐下、锻炼、开关家具等)。

与脚本式采集不同,ACE-Data-0 采用目标级指令:参与者只被告知最终任务,可自由选择物品、顺序和路径,过程中可能犹豫、改变计划、返回上一步或处理意外。这些差异在标准化采集中可能被视为噪声,但对进入家庭场景的机器人而言正是必须理解的现实。

长时序任务的难点不只是“视频更长”:此前的决定会改变后续可执行动作,物体可能离开并重新进入视野,子任务可能中断、重排或在其他位置继续。模型必须持续记住任务目标、物体状态和已完成步骤,而不能将活动视为独立动作的串联。

三级评测基准:定位模型失效环节

基于 ACE-Data-0,大晓构建了三级具身感知评估基准:第一级是底层信号推断,研究模型能否从视觉观测预测接触与触觉信息;第二级是场景组成要素恢复,评估模型在遮挡、复杂姿态和持续运动下恢复人体与手部运动状态的能力;第三级是具身交互理解,要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整手-物交互过程。

研究团队评测了 30 多种代表性方法,结果显示现有模型在接触、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显能力缺口。这套基准不只判断任务是否成功,更试图回答模型究竟在哪一步失效——是未感知到接触、物体状态估计错误、任务上下文丢失、动作顺序理解偏差,还是手部运动恢复不准确。

ACE-Data-0 的价值不止于评测。由于多模态数据处于统一时空框架,它可服务于模仿学习、机器人策略学习、世界模型、VLA,以及人类示范向不同机器人本体的迁移。

可信度边界

本文信息主要来自 AI 前线对 ACE-Data-0 发布的中文报道,属于二手来源。文中关于数据集规模、采集方法、评测结果等具体数据均以该报道为准,未经第一方(大晓机器人或南洋理工大学)直接确认。部分表述(如“L5 级”“信息密度定律”)为项目方宣称,需谨慎对待。

核心结论

ACE-Data-0 试图以高密度、多模态、长时序的真实家庭交互数据,为具身智能提供更接近物理世界的数据底座,但其实际效果仍需独立验证。

主报道

AI前线

主报道来源