📄 ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
标签:#音视频理解 #多模态模型 #数据集 #基准测试 #音频理解
8.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5
🔥 8.3/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频理解 | #多模态模型 | #数据集 #基准测试 | arxiv
👥 作者与机构
- 第一作者:Yukang Cao (S-Lab, Nanyang Technological University)、Haozhe Xie (S-Lab, Nanyang Technological University)、Beichen Wen (ACE Robotics)
- 通讯作者:Dacheng Tao (ACE Robotics)、Xiaogang Wang (ACE Robotics)、Liang Pan (ACE Robotics)、Ziwei Liu (S-Lab, Nanyang Technological University)
- 作者列表:Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu
💡 毒舌点评
本工作搭建了首个在真实家居中同步捕获视觉、全身运动、物体6D轨迹、触觉与音频的大规模数据集,传感器同步与标定硬核,双尺度设计巧妙,彻底告别了具身数据碎片化。然而音频部分彻底沦为花瓶,基准评测仅涉及视觉、触觉和运动,多通道音频信号未被任何下游任务利用,对语音/音频领域而言几乎只是硬件陈列。触觉手套和全身标记的侵入性也可能让“自然行为”打了折扣,数据集的价值能否泛化到无穿戴场景存疑。
📌 核心摘要
本文针对具身智能数据瓶颈,提出环境捕获引擎 ACE,通过桌面级与房间级两种配置,同步记录自我中心视频、多视点外部视频、全身及手部运动、物体6D位姿、多通道音频与触觉信号,所有流在统一时空坐标系中严格对齐。基于此系统构建了 ACE-Data-0,包含 150 小时、17M 帧、200 种任务类别,由 50 名参与者在 2 个真实家居环境中完成 75,000 次交互片段,并提供大量测量驱动的标注。论文进一步构建了从触觉视觉预测、人体运动恢复到视角内外手部运动估计的分层基准,评测超过 30 种现有方法。核心实验结果以四个基准表格呈现,触觉预测中 TouchAnything 取得最优 C-IoU 0.1646,但总体绝对精度仍低;人体运动估计表明全球轨迹误差显著高于局部姿态误差,视频方法在长程漂移上问题突出;手部运动估计中外固定相机视角下的轨迹误差(63.0 mm)远低于第一人称视角(98–102 mm),揭示自我运动估计为主要瓶颈。数据集为模仿学习、世界模型等具身 AI 提供同步多模态训练信号,但当前仅覆盖 2 个站点,音频尚未融入基准任务,且侵入式穿戴可能引入实验特异性。
🔗 开源详情
- 代码:未提供(论文中无代码链接)。
- 模型权重:未提供。
- 数据集:ACE-Data-0,https://huggingface.co/datasets/ACERobotics/ACE-Data-0 (通过 Hugging Face 发布)。
- Demo:项目主页 https://ace-data-engine.github.io/ACE-Data-0/ (可能包含演示,但未明确标明为 Demo)。
- 复现材料:论文中未提供训练配置或检查点。
- 论文中引用的开源项目(均未提供具体链接):PressureVision, EgoPressureDiff, TouchAnything, Multi-HMR, Multi-HMR2, SAM-3D-Body, PyMAF-X, PARE, CameraHMR, OSX, SMPLer-X, SMPLest-X, Humans-in-4D, GVHMR, WHAM, EasyMoCap, Phy-SIC, UniSH, JOSH, Human3R, MAMMA, U-HMR, HSfM, EgoEgo, EgoAllo, WildHands, Dyn-HaMR, HaWoR, HaMeR, WiLoR, OmniHands, HaPTIC, HORT, AprilTag 等。
🏗️ 方法概述和架构
ACE 系统架构围绕“双尺度、全同步、测量驱动”展开,旨在将真实家居转化为时空一致的录制棚。整体流程为:环境搭建与传感器部署 → 参与者穿戴标记服及头显/手套 → 目标级指令任务执行 → 多模态流同步采集 → 离线时空对齐与标定 → 自动标注与人工校验。
下图展示了 ACE 数据引擎的整体流程,涵盖数据采集、导出同步与自动标注三个核心阶段。

采集阶段部署了 OptiTrack 红外相机、ZED One RGB 相机、自我中心相机和 Manus 触觉手套等多类传感器;同步阶段将 Ego-View、Exo-View、音频、人体运动和物体运动各流对齐至统一时间线;标注阶段由测量数据自动派生人体姿态、手部关节、物体位姿与语言描述等标签。
双尺度配置:桌面尺度在 30 平方米工作区布置 8 台近场 GoPro RGB 相机(1920×1080, 30 fps)和 16 台 OptiTrack PrimeX 22 红外相机,距操作区 0.3–0.5 米,捕捉精细手物交互;房间尺度覆盖约 200 平方米全装修公寓(厨房、餐厅、客厅、卧室),利用悬吊桁架安装 8 台 ZED One RGB 相机和 12 台 OptiTrack 相机,保证任何点位至少有 4 个视图覆盖。
第二个采集站点的平面布局与相机部署如下图所示,两站点合计覆盖多样化的家居场景。

该站点包含厨房、卧室、书房、阳台等功能区,外部相机沿房间四周等间距布置,为长时间跨度的链式人-物交互任务提供连续视角支撑。
房间尺度配置覆盖约 200 平方米的全装修公寓,其平面布局与相机部署如下图所示。

图中蓝色圆点代表 OptiTrack PrimeX 22 红外相机,绿色圆点代表 ZED One RGB 相机,两者沿墙面及天花板桁架分布式安装,确保厨房、餐厅、客厅、卧室等区域均有多视角覆盖。
传感器同步:以 OptiTrack 60 Hz 时钟为全局基准。房间配置中的 ZED One 通过 GMSL2 连接至单台 Jetson Orin,共享帧触发,但存在二次延迟(约 0.29 s 偏移),通过拍摄显示器上纳秒级时钟的 QR 码建立逐帧线性矫正,残差控制在 1 ms 内。桌面配置中的 GoPro 通过音频对齐互相同步,再借助同一 QR 码时钟与头显对齐,头显又通过 AprilTag 位姿与 OptiTrack 标记体对齐,构成完整同步链。第一人称摄像头无法直接观测时钟,采用每次录制开头的“扫视”动作拍摄时钟画面建立偏移。触觉手套通过 IMU 运动模板与头显 IMU 对齐。同步最终输出为每帧相机与 60 Hz 运动捕捉帧的映射表。
下图展示了经同步校正后各模态在同一时间轴上的对齐结果,直观呈现了多流数据的时间一致性。

Ego-View 4 路鱼眼视频、Exo-View 8 路外部视频、16 通道音频、41 关节人体运动及物体 6-DoF 状态在四个采样时刻严格对齐,各模态波形与动作帧之间无可见时间偏移,验证了亚毫秒级同步精度。
空间标定:外部相机之间缺乏共视区域,借助 ArUco 板四角加装反射标记,使其同时被 RGB 和红外相机观测,将 RGB 相机注册到 Motion Capture 世界系,并联合优化板角点位置与相机参数。第一人称头戴相机通过 5 个跟踪标记实时给出 6D 位姿,再结合手眼标定求解各鱼眼相机到刚体的外参,并使用联合捆集优化折射模型和时间偏移,使重投影中位数误差约 2 px。
数据采集与标注管道:每次录制包含场景随机初始布局、参与者穿戴并 T-pose 注册、目标级(而非动作级)指令下的自然执行,以及事后同步与跟踪质量检查。标注完全由测量数据派生:物体通过扫描或 2DGS 生成网格并绑定标记点,6D 位姿由 OptiTrack 驱动;人体关节由全身 41 个标记点重建并转化为 SMPL-X 参数;手部关节由 Manus 手套或基于外视 2D 关键点的 RANSAC 三角化加手工精化提供;触觉由手套传感器映射为压力图;音频与描述文字对齐。唯一需要生成的标注是自然语言叙述,由 Gemini-3.1-pro-preview 根据第一人称视频片段输出,并经人工修正。
这一自上而下的测量驱动标注策略从根本上避免了估计模型在遮挡与快速运动下的失败,同时提供了跨模态、跨视图的一致监督信号,是 ACE-Data-0 区别于以往伪标注数据集的核心技术特质。
💡 核心创新点
- 全模态时空同步的居住环境捕获:首次在保留日常真实杂乱度的家居中,将自我中心/外部视频、全身及手部光学运动、物体6D轨迹、多路音频和全掌触觉同步到同一个毫秒级时钟与度量世界坐标系中,超越了过去单一模态或实验室伪标注数据集的局限,为完整感知-行动环提供了物理一致的地面真值。
- 双尺度互补架构:桌面密集近场相机与房间宽基线覆盖的组合分别解决精细操控与全屋行为记录,两者共用统一同步与标定管线,使局部与全局行为可在同一描述体系下联合研究。
- 测量驱动的自动标注流水线:绝大多数标签(人体/物体位姿、2D投影、触觉)直接从光学及触觉传感器测量值导出,无需依赖图像估计器,从而在严重遮挡、极端视角和运动模糊条件下保持可靠,大幅降低了人工标注成本并提升了真值质量。
- 分层基准设计与交叉视角诊断:从触觉视觉跨模态推断、人体运动恢复到第一/三视角手部运动估计,逐层揭示接触推理、长程轨迹漂移、自我运动估计等关键瓶颈,其内外视角配对评测直接量化了视角与自我运动带来的误差来源。
📊 实验结果
在桌面级第一人称视频上,评测了三种视觉到触觉的推定方法,结果如下表。TouchAnything 在四项指标上均最优(Temp Acc 0.7095,C-IoU 0.1646,V-IoU 0.1357,CoP 6.5846),但 C-IoU 与 V-IoU 仍远低于理想值,说明压力空间分布重建极难。PressureVision 几乎无法提供有效的接触预测。
| Method | Temp Acc. ↑ | C-IoU ↑ | V-IoU ↑ | CoP ↓ |
|---|---|---|---|---|
| PressureVision [32] | 0.0093 | 0.0007 | 0.0000 | 10.9807 |
| EgoPressureDiff [109] | 0.2912 | 0.0197 | 0.0025 | 8.5152 |
| TouchAnything [115] | 0.7095 | 0.1646 | 0.1357 | 6.5846 |
人体运动估计(Table 4)
在房间级视频上,22种方法分四个设置评测,结果汇总如下表。OSX 在单帧外视中 PA-MPJPE 59.2 mm 最优;SMPLest-X 在时序处理中 PA-MPJPE 55.7 mm 最优,但全球轨迹指标 WA-MPJPE 显著升高(GVHMR 217.1 mm,WHAM 243.1 mm)。场景感知方法(Human3R 60.1 mm PA-MPJPE, WA-MPJPE 180.2 mm)对全局漂移改善有限。第一人称方法(EgoEgo, EgoAllo)全部指标明显落后。多视点方法并未超越最强单视点方法。
| Method | PA-MPJPE ↓ | PA-PVE ↓ | MPJPE ↓ | PVE ↓ | WA-MPJPE ↓ |
|---|---|---|---|---|---|
| Single-view exocentric, per-frame | — | — | — | — | — |
| Multi-HMR [4] | 110.5 | – | 115.3 | – | – |
| Multi-HMR2 [24] | 85.5 | – | 92.8 | – | – |
| SAM-3D-Body [103] | 71.0 | – | 76.4 | – | – |
| PyMAF-X [111] | 94.7 | 177.5 | 99.9 | 177.0 | – |
| PARE [51] | 98.7 | 132.3 | 102.0 | 134.8 | – |
| CameraHMR [70] | 78.7 | 98.7 | 85.7 | 105.2 | – |
| OSX [59] | 59.2 | 73.7 | 62.5 | 76.6 | – |
| Single-view exocentric, temporal | — | — | — | — | — |
| SMPLer-X [11] | 57.0 | 70.2 | 59.8 | 71.7 | – |
| SMPLest-X [107] | 55.7 | 65.8 | 58.8 | 67.6 | – |
| Humans-in-4D [31] | 77.1 | 94.4 | 79.6 | 96.4 | – |
| GVHMR [84] | 88.0 | 104.1 | 96.3 | 112.0 | 217.1 |
| WHAM [85] | 131.1 | 160.2 | 144.0 | 166.4 | 243.1 |
| EasyMoCap [21, 86] | 103.4 | 155.8 | 106.0 | 156.1 | 256.2 |
| Single-view exocentric, scene-aware | — | — | — | — | — |
| Phy-SIC [68] | 64.3 | 78.9 | 71.3 | 84.6 | – |
| UniSH [55] | 80.0 | 111.2 | 82.8 | 114.0 | 196.3 |
| JOSH [62] | 64.0 | 89.2 | 69.9 | 95.0 | 245.1 |
| Human3R [16] | 60.1 | 75.4 | 63.5 | 80.6 | 180.2 |
| Multi-view exocentric | — | — | — | — | — |
| MAMMA [18] | 70.1 | 86.8 | 74.8 | 89.6 | 230.8 |
| U-HMR [57] | 134.4 | 176.0 | 150.2 | 179.2 | – |
| HSfM [67] | 92.8 | 133.8 | 93.8 | 134.8 | – |
| Egocentric | — | — | — | — | — |
| EgoEgo [53] | 159.6 | 245.3 | 163.4 | 263.9 | 306.2 |
| EgoAllo [106] | 131.7 | 196.8 | 147.9 | 220.3 | 252.2 |
手部运动估计
第一人称视角(Table 5)
WildHands 在 PA-MPJPE 上达 11.2 mm,但视频方法 Dyn-HaMR 和 HaWoR 的轨迹误差高达 98.2、102.1 mm,揭示自我运动估计是最大拖累。
| Method | PA-MPJPE ↓ | MPJPE ↓ | F@5 ↑ | F@15 ↑ | AUCJ ↑ | Traj. err. ↓ |
|---|---|---|---|---|---|---|
| WildHands [76] | 11.2 | 12.6 | 0.175 | 0.774 | 0.776 | – |
| Dyn-HaMR [108] | 18.9 | 21.1 | 0.042 | 0.413 | 0.624 | 98.2 |
| HaWoR [112] | 13.8 | 17.4 | 0.130 | 0.666 | 0.729 | 102.1 |
外固定视角(Table 6)
WiLoR 取得 9.1 mm PA-MPJPE,HaPTIC 在维持 10.0 mm 局部精度同时,轨迹误差大幅降至 63.0 mm,证实静态相机极大地稳定了世界轨迹估计。
| Method | PA-MPJPE ↓ | MPJPE ↓ | F@5 ↑ | F@15 ↑ | AUCJ ↑ | Traj. err. ↓ |
|---|---|---|---|---|---|---|
| HORT [17] | 10.8 | 12.3 | 0.276 | 0.776 | 0.784 | – |
| HaMeR [72] | 9.6 | 10.4 | 0.281 | 0.848 | 0.812 | – |
| HaPTIC [105] | 10.0 | 10.7 | 0.247 | 0.838 | 0.804 | 63.0 |
| WiLoR [75] | 9.1 | 9.9 | 0.313 | 0.854 | 0.819 | – |
| OmniHands [58] | 10.7 | 11.5 | 0.211 | 0.814 | 0.791 | – |
跨视角分析显示,尽管第一人称视角离手更近,但外视方法在关节精度和轨迹估计上均更优,自我运动估计是最大误差源。
🔬 细节详述
- 训练数据:本文系数据集发布,不涉及新模型训练。数据集包含 150 小时,200 任务类,50 名参与者,2 环境,17M 帧,75K 交互片段。物体实例 50 个,均经扫描或 2DGS 重建网格。
- 损失函数:未说明(无新模型训练)。
- 训练策略:未说明。
- 关键超参数:未说明。
- 训练硬件:提及 Jetson Orin 作为采集主机,两台 Motive 主机,28 台 OptiTrack PrimeX 22,8 台 ZED One,8 台 GoPro,ACE-Ego-Head-V02 Lite,Manus 手套,触觉手套等。
- 推理细节:基准测试使用各基线官方预训练权重。
- 正则化或稳定训练技巧:未说明。
- 同步精度:跨设备时间残差 < 4 ms,外部相机重投影中位数误差 < 3 px,第一人称重投影误差约 2 px。
- 标注:物体名称、6D 位姿、2D/3D 边界框、运动轨迹;人体 SMPL-X 位姿及每帧每个视图的投影;手部关节;触觉压力图对齐;Gemini 生成时间对齐文本描述并经人工修正。
⚖️ 评分理由
创新性 (1.2/2):首次在真实家居中实现双尺度全模态时空同步数据集,覆盖视觉、运动、触觉与音频,采用测量驱动的自动标注流水线,突破碎片化局限。 [A_SUMMARY] [A_METHOD]
技术严谨性 (1.2/1.5):多传感器同步通过光学时钟与QR码对齐,残差达毫秒级,标定重投影误差中位数约2px,测量驱动标注避免估计器错误。但侵入式穿戴和物体标记依赖限制了扩展性与自然性。 [A_METHOD] [A_LIMITS]
实验充分性 (1.1/1.5):基准涵盖触觉预测、人体运动估计与手部运动估计三个层次,评测超30种方法,揭示关键瓶颈。但音频未纳入任何任务,缺乏统计显著性检验与阶段细分,参与者多样性及数据泄漏风险控制不足,削弱实验说服力。 [A_RESULTS] [A_LIMITS] [A_SUMMARY]
清晰度 (0.9/1):系统架构、同步标定与基准设计描述详尽,图表清晰,整体组织良好,便于读者理解。 [A_METHOD] [A_SUMMARY]
影响力 (0.5/1.5):数据集主要服务具身AI的视觉、运动与触觉研究,音频仅被捕获而未用于基准,对语音/音频领域的直接影响有限。 [A_SUMMARY] [A_LIMITS]
开源 (1.5/1.5):核心数据集ACE-Data-0已在Hugging Face完整公开发布,并提供项目主页,文档完备,符合数据集论文完全开放标准。 [A_OPEN]
可复现性 (0.5/0.5):明确划分测试集,定义各项指标,采用官方预训练权重评测基线,评测协议透明;结合已发布的数据集,复现基准结果具有可行性。 [SCORING_SOURCE_28/38] [A_RESULTS]
工程/实践价值 (1.4/1.5):在真实家居中集成超28台OptiTrack、多视角RGB相机、头显与触觉手套,实现双尺度全同步采集与测量驱动自动标注流水线,工程复杂度高,提供可复用的数据引擎。 [A_METHOD]
🚨 局限与问题
论文明确承认的局限:仅覆盖两个站点,布局、家具和光照多样性有限;地面真值仅适用于预先装备标记的物体,不涵盖铰接机构、流体或可变形材料的状态变化;动作捕捉服、手套、头显及标记点仍存在于录制画面中,可能引入数据集特有的视觉线索。
审稿人发现的潜在问题:
- 音频虽被捕获但未参与任何基准任务,数据集的“多模态”实际仅展示为视觉-运动-触觉,音频挖掘缺失,削弱了“全模态”宣称的完整性。
- 触觉手套与全身标记的侵入性可能显著改变自然抓握力、动作幅度和运动策略,但论文未进行行为影响分析。
- 物体 6D 轨迹依赖标记约束,限制了可交互物体的多样性,将自然场景中的大部分日常物品排除在外,扩展性存疑。
- 基准评测未报告统计显著性检验,难以判断方法间差别是否超出随机波动;也未对较长任务的不同阶段进行细分性能分析。
- 参与者人群的变异性(左右手习惯、年龄、身体能力)未被控制或分析,可能影响泛化性结论。
- 未明确讨论数据泄露风险:在相同环境采集的数据用于基准评测时,模型可能过拟合特定场景的视觉线索。