第一人称视觉+全身动捕+手部精细操作+物体6D位姿+触觉音频,全方位数据对齐

——首款真实全屋全模态触觉同步具身数据集

当下绝大多数数据集往往只能捕捉单一视角或单一模态,无法反映真实世界中视觉、运动、触觉、声音等多通道信息如何随人类目标协同演化:

  • 要么只提供单视角视觉画面,缺失触觉、人体动捕真值;

  • 要么局限于桌面狭小实验室,无法还原全屋长时序家务流程;

  • 各传感器时钟不同步,视觉触碰画面和压力信号对不上,模型学不到真实物理因果。

南洋理工大学大晓机器人联合推出ACE采集引擎+ACE-Data-0大型数据集,首次把真实居家公寓改造为全域同步动捕采集空间:

同时覆盖桌面精细操作、全屋全身活动两大尺度,集齐第一/第三人称影像、人体手部动捕、物体6D轨迹、音频、触觉五类对齐信号,整套数据集150小时、75000条交互片段,配套三层递进式标准化评测基准,填补长时序、多模态、真实家居交互数据空白。

ACE双尺度同步采集引擎完整架构

ACE采集系统分为桌面精细采集、全屋房间采集两套可复用硬件配置,共用统一时空标定、多传感器同步管线,全部设备统一映射至全局世界坐标系,所有数据流时序误差控制在毫秒级。

双场景硬件差异化布局

  • 房间尺度配置:

整套200㎡完整居家空间,包含厨房、客厅、卧室,顶部桁架挂载12台OptiTrack动捕相机+8台广角外视RGB相机,覆盖全屋全部活动区域,捕捉行走、搬物、跨房间长时序全身交互。

  • 桌面尺度配置:

小型操作台搭配16台近距离动捕相机、8台近距GoPro,密集覆盖桌面毫米级手部操作,专门解决餐具、小件工具精细抓取、拆装等近距离交互捕捉。

  • 两类场景统一配套采集硬件:

ACE头戴四目第一人称相机、Manus手部动捕手套、ACE触觉压力手套、多通道收音设备。

ACE全套采集硬件参数统计表©【深蓝具身智能】编译

毫秒级全局时序同步机制

不同相机、动捕、触觉设备拥有独立时钟,轻微时间偏移就会出现“画面手已经握住物体,触觉无压力读数”的因果错位问题。

ACE以OptiTrack动捕系统全局时钟为基准完成全设备对齐:

  1. 外视相机通过屏幕动态QR时间码读取全局纳秒时间戳,批量修正录制偏移;

  2. 头戴设备执行定点时钟对准流程,录制前镜头对准计时屏幕完成单目校准,同步传导至其余三路鱼眼镜头;

  3. 触觉手套依靠IMU运动模板与头戴设备时序匹配,完成压力流与视觉流对齐。

ACE数据采集、同步、标注全流程©【深蓝具身智能】编译

整套同步流程完成后,所有模态单帧时间偏差小于4ms,任意视频帧可精准匹配对应人体、手部、物体姿态与接触压力。

统一空间多设备标定

全模态同步时序样例图©【深蓝具身智能】编译

多相机无公共重叠视场是传统动捕标定最大难点,ACE采用带反光标记点的ArUco标定板作为通用中介:

动捕红外相机识别标记三维坐标,RGB相机识别棋盘图案,一次性将所有外视、头戴、动捕设备绑定至同一世界坐标系,单台相机重投影误差控制在3像素内。

头戴设备通过手眼标定求解相机与头部动捕刚体变换,每一帧头显6DoF位姿可直接解算,全程无漂移。

ACE-Data-0数据集规模与任务分层设计

依托ACE采集引擎产出ACE-Data-0完整数据集,全部任务仅给参与者目标级指令,不规定分步动作,保留犹豫、绕行、物品替换等自然人类行为,规避脚本化僵硬交互。

数据集分为三类交互任务:

  1. 原子手部交互(Atomic HOI):单次短时间单一操作,倒水、收纳、切菜等基础动作,总计620万帧;

  2. 长链式家务交互(Chain HOI):数十分钟连贯多步骤家务,做饭、全屋整理等跨子任务流程,730万帧;

  3. 人-场景交互(HSI):无小件操作,坐卧、走动、拉伸等全身环境交互,350万帧。

ACE数据集任务分类与数据占比统计图©【深蓝具身智能】编译

整套数据集覆盖50名受试者、50类交互物体、200种任务大类,75000条独立交互片段。

ACE-Data-0与主流同类数据集横向对比表©【深蓝具身智能】编译

表格指标客观区分各家数据集模态完整度:绝大多数数据集缺少触觉、完整第一视角、长时序任务,ACE是唯一同时集齐五类同步数据流的居家场景数据集。

但指标仅代表采集硬件配置,不代表模型训练效果,数据集规模大不代表泛化能力更强,真实机器人仿真迁移仍受人类与本体形态差异约束。

全套自动化分层标注体系

ACE绝大多数标注无需人工手绘,由动捕测量数据直接导出,大幅降低标注成本:

  • 物体标注:每件物品3D扫描网格+逐帧6DoF轨迹、2D/3D包围盒、运动轨迹

物体多视角标注样例图©【深蓝具身智能】编译

  • 人体标注:41关节全身SMPL-X网格、每帧投影至所有相机画面

人体姿态标注样例图©【深蓝具身智能】编译

  • 手部标注:MANO精细手指关节、双手逐帧三维轨迹

手部姿态标注样例图©【深蓝具身智能】编译

  • 触觉标注:全手掌压力热力图、左右手握持时序标签

全手掌压力热力图、左右手握持时序标签©【深蓝具身智能】编译

  • 音频+文本标注:多通道环境音,Gemini生成同步分段自然语言任务描述

音频与文本对齐标注样例图©【深蓝具身智能】编译

所有标注与视频时序严格绑定,任意时间戳可一键调取对应视觉、运动、接触、文本信息,省去跨模态匹配二次开发成本。

三层递进标准化评测基准

研究基于数据集搭建分层评测赛道,模拟机器人从感知到交互的完整能力链路,三层难度逐级提升,同时测试30余款主流SOTA方法,暴露现有模型普遍存在的遮挡、长时序漂移缺陷。

第一层:底层信号推理(触觉预测赛道)

任务仅输入图像,预测同步手掌压力分布,指标包含时序准确率、接触交并比CoP压力中心误差。主流TouchAnything方法综合表现最优,但遮挡场景IoU依旧偏低。

该任务核心价值:验证视觉能否反推物理接触,解决机器人无触觉硬件时的感知补充需求。指标局限:仅桌面近距离有效,远距离全身交互无接触预测参考意义。

触觉预测定量结果对比表©【深蓝具身智能】编译

第二层:场景组件重建(人体全身位姿估计)

分为单目第三人称、单目第一人称、多视角三类测试条件,采用MPJPE、全局轨迹WA-MPJPE作为评价指标。

实验结果清晰体现两类差距:多视角观测精度显著优于头戴第一视角,第一人称因身体大面积出画面,全局轨迹漂移严重,是现有人体重建算法核心痛点。

多视角/自视人体重建误差对照表©【深蓝具身智能】编译

第三层:人机交互手部分解(第一/第三人称手部重建)

分别从两种视角预测MANO手部关节,PA-MPJPE、轨迹误差为核心评判标准。第三人称固定相机视野稳定,手部重建误差低至9.1mm;第一人称受镜头畸变、手部频繁出框影响,全局轨迹误差接近100mm。

跨视角对比证明单一相机无法兼顾全身与精细手部感知,多模态融合是优化关键。

第一/第三人称手部重建定量表©【深蓝具身智能】编译

现有SOTA模型在遮挡、长时序、自运动模糊场景误差爆发,即便在ACE高真值标注数据集上,真实居家环境下交互重建仍存在巨大性能缺口,数据集明确指出未来感知模型优化方向。

工程落地实际收益与固有局限

整套采集方案与数据集产业价值清晰,无需自建动捕实验室,可直接复用ACE分层数据配比:

先用海量低成本第一人称视频做预训练,搭配少量同步动捕片段微调手部、物体感知;

统一标注格式降低算法迭代试错成本,触觉、长时序家务数据填补现有训练素材空白,人形机器人、家用服务机器人研发可大幅缩减真机采集开销;

三层基准可作为内部算法迭代统一评测标准,横向对比自研模型与开源方案。

同时存在不可忽视的短板:

整套采集硬件门槛高,中小企业难以复刻采集环境;

数据仅采集人类交互,无机器人本体演示样本,人机本体域差仍需额外仿真数据弥补;

未集成动态物体、大量移动物体标注,复杂室内动态场景适配性有限,所有评测基于静态家居序列,真实持续动态环境下模型性能会出现明显衰减。

写在最后

ACE采集引擎与ACE-Data-0解决了长期以来具身AI数据模态割裂、场景失真、时序错位三大核心行业难题,首次把完整全屋居家生活转化为可量化、同步化、全维度多感官训练素材。

区别于只堆视频的通用数据集,它以动捕、触觉、音频作为物理监督锚点,建立起“视觉-运动-接触-声音”完整感知动作闭环,三层分层基准也给领域提供统一的模型验证规范。

房间尺度场景中标定完成的相机布局示意图©【深蓝具身智能】编译

该数据集不会完全替代仿真、机器人自采集数据,但补齐了人类自然长时序交互这块核心数据短板,为VLA、触觉感知、4D重建、人形模仿学习提供高质量训练与评测底座,后续多模态融合、跨本体迁移、接触推理类研究均可依托该数据集开展完整对照实验。

编辑|小小怪博士

审编|具身君

Ref:

论文标题:ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!

扫码关注公众号,底部菜单申请进群

作者 ab, 808