SOURCEMIND取源头之知,成未来之智

💡 一句话总结:RoboCap 是一顶面向机器人数据采集的六相机帽子:人戴着它完成日常操作,配合 Grounded API,就能把录像加工成头部轨迹、场景深度和三维手部动作,为机器人学习提供更完整的示范数据。

发布团队:Grounded Superintelligence(GSI)& BitRobot

原文:The RoboCap, for Robot Learning[1]

配套技术报告:RoboCap: A New Platform for Egocentric Robot Learning[2]

项目页RoboCap[3]

SECTION / 01RoboCap 是什么,谁会用它01

RoboCap 是一套面向机器人和具身 AI 团队的第一视角数据采集产品。它的前端是一顶约 250 克、带六个相机和两个惯性测量单元(IMU,用来感知运动)的帽子;后端可以配合 GSI 的 Grounded API,把记录下来的画面和运动数据加工成三维轨迹与姿态。团队可以让人直接演示操作,再把示范整理成模型训练所需的数据。

这套产品的分工也很清楚:RoboCap 官网[4]将硬件开发方列为 FrodoBots;BitRobot 的发布帖[5]则说明,己方提供采集硬件,GSI 推出将采集内容转成训练信号的 Grounded API。理解 RoboCap,需要把帽子和配套数据处理服务放在一起看。

一个人戴上帽子整理货架、做饭或者使用工具,可以自然地演示大量操作。机器人要从这些录像里学动作,还需要知道手位于哪里、朝向哪里、距离物体多远,以及这些位置如何随时间变化。佩戴者的头也在动,同一只手在画面里移动,可能来自手臂动作,也可能来自相机转动。

RoboCap 要解决的就是从“拍到人做事”到“量出人怎么做事”的这一步。系统同时估计头部运动、场景深度和手部姿态,将它们放到具有真实尺度的共同坐标系里,随后才有条件把人的动作重定向到机器人上。“重定向”就是把人的身体和关节动作映射到机器人的机械结构;手部位置估计有偏差,这种偏差就会进入训练标签。

在作者比较的几条数据路线中,仿真需要持续建设环境,遥操作依赖机器人硬件,UMI 式手持夹爪则围绕较低自由度的末端执行器采集。第一视角采集让人直接完成任务,扩展空间来自真实操作者与真实环境;与此同时,动作标签需要从传感器观测中恢复,精度会受到遮挡、模糊、光照和设备形变的共同影响。

RoboCap 的帽体与传感器组件爆炸图
RoboCap 的帽体与传感器组件爆炸图

SECTION / 02戴上之后,怎样把一次操作变成数据02

采集端的操作比较直接:连接外置移动电源、调整帽子、开机,然后按键开始或停止录制。录制结束并保存完成后,通过 USB-C 连接电脑,就能按录制场次读取视频和传感器文件。帽子会用指示灯提示录制与保存状态,具体操作见官方使用指南[6]

设备交出的原始材料包括六路 MP4 视频、两路 IMU 的 DB 数据,以及每顶帽子对应的标定文件;这些文件记录了多视角画面、运动信息和相机几何关系。官网列出了这三类输出[4]。在此基础上,Grounded API 的三项主要能力分别回答三个问题:

处理能力
得到什么
对理解操作有什么用
SLAM:定位与建图
头部在环境中的运动轨迹和场景结构
区分相机在动还是手在动,把动作放回同一个空间
深度估计
画面中物体和表面的实际距离
判断手离物体多远,恢复操作的真实尺度
手部追踪
三维手部姿态及随时间变化的轨迹
描述手伸向哪里、手指怎样弯曲、动作如何持续变化

对 AI 团队而言,RoboCap 承担的是采集和训练前的数据加工环节。拿到这些三维结果之后,还需要结合目标机器人的结构和任务做动作映射与策略训练。原文展示的厘米级、毫米级结果,衡量的是这条数据生产流程的测量能力。

如果团队已有自己的数据工具,也可以使用 FrodoBots 的开源 MCAP 转换器[7]:它接收同一场录制的相机 MP4 和 IMU SQLite 数据库,检查数据完整性与时间同步,再按片段打包为 MCAP 文件。这里提供的是多路传感器数据的整理与转换能力,三维姿态仍由后续算法生成。

SECTION / 03六个相机,为什么要从不同方向拍03

以下布局参数采用 GSI Blog 和技术报告介绍的全局快门版本。它的六路相机以 1920×1080 分辨率、30 Hz 帧率采集,但镜头与朝向分工不同:正前方和眼位附近各有一组标定好的双目相机,另外两路面向侧方。

双目利用两个已知位置的相机观察同一个点,通过图像中的位置差恢复距离;相机之间的距离,也就是基线,为测量提供了实际尺度。对使用者而言,这种布局既要量准前方的操作距离,也要尽量跟住伸向侧面的手。

相机组
基线或朝向
单相机视场
设计用途
前方双目
基线 86.8 mm
180°×112° 鱼眼
覆盖前方近距离操作,提供双目几何
眼位双目
基线 106.2 mm
180°×112° 鱼眼
补充操作区域的双目观测
两路侧向相机
各偏离前向轴 85°,向下俯视 30°
161°×98° 广角
观察离开前方双目区域的伸手动作,为定位保留环境特征

前方和眼位双目的重叠视场分别为 157°、154°,这是按无穷远处计算的双目重叠角度。设计目的很具体:手臂在近距离操作时,尽量让手同时落入两个能够测距的视角;手移到侧面,或靠近脸部挡住前方景物时,侧向相机仍能提供观测。侧向相机没有各自配对的专用双目伙伴,但它们可以在 SLAM 中维护自己的环境路标。

RoboCap 的前方双目、眼位双目与侧向相机覆盖范围
RoboCap 的前方双目、眼位双目与侧向相机覆盖范围

多路画面还必须拍在同一时刻。快速移动的手如果在不同相机中被先后拍到,系统就可能把运动造成的位置变化误当成测距线索。RoboCap 用同一个触发信号控制六路曝光,具体通过 PWM 信号和一分六缓冲电路实现;全局快门则避免一张图像中各行依次曝光产生的形变。两个 IMU 以 200 Hz 记录惯性信息,相机与 IMU 的时间偏移也在标定范围内。

一次货架操作中的六路同步相机画面
一次货架操作中的六路同步相机画面

帽子需要连接外置电源。技术报告给出的典型功耗为 4–6 W,10,000 mAh 移动电源约支持六小时连续录制;214.5 GB 内置存储可容纳十小时以上录像。这两个时长分别对应供电和存储容量。当前官方使用指南[6]给出的 10,000 mAh 续航参考为约 5–5.5 小时,并说明内置电池主要用于备用。安排采集时,应按所用版本和供电条件规划时长,不能把十小时存储容量直接当成续航。

需要补充近距离手部画面时,官方还提供搭配 RoboWrist 的套装[8],让帽载第一视角与腕部相机同步采集。本文后续介绍的六相机布局和实验结果,仍对应 GSI 报告中的 RoboCap 系统。

SECTION / 04自动校准:戴上之后,距离也要量得准04

产品要持续产出可靠数据,还得处理佩戴带来的细小变化。即使所有相机在出厂时都经过标定,实际佩戴、机械应力和温度变化仍会让它们发生微小的相对旋转。对于远距离场景,这类偏移可能不显眼;对于伸手可及的物体,它会直接改变深度测量。

可以用经过图像校正后的双目近似关系理解这个问题。设焦距为 f、基线为 b、左右图像中的视差为 d,则深度 z 近似满足:

这说明深度误差会随距离的平方增长,也会受到基线和视差精度影响。报告给出的量级是,在约 0.65 米处,一个像素的视差误差就对应大约一厘米的深度偏差。相机之间只偏转一点,深度图仍可能边缘清晰、表面完整,却在尺度或形状上出现系统性失真。

RoboCap 的做法是在每段录制中,从自然场景里找到跨相机对应点,重新估计相对旋转。流程不要求操作者再拍一次标定板。由于作者观察到漂移主要来自旋转,平移保持出厂值;左前相机作为固定锚点,各相机对独立拟合。

校准时,系统会检查两台相机拍到的同一个点是否符合应有的几何关系,使用的指标叫 Sampson 极线距离。可以把它理解为:相机关系如果准确,一个视角中的点,在另一个视角中就应落在特定的线附近。新的修正必须在另一批未参与拟合的对应点上也表现更好,而且相对该设备出厂值的变化约在 1° 以内,才会被接受。

自标定前后的极线与跨相机对应点,上排为修正前,下排为修正后
自标定前后的极线与跨相机对应点,上排为修正前,下排为修正后

在 150 台已部署设备的统计中,前方双目的极线残差中位数从 3.8 像素降到 0.56 像素。切换标定参数后,各设备近距离深度变化的中位数为 3.6%,第 90 百分位为 11%;近距离区域有 31% 的像素,其深度变化超过 5%。这些数字描述标定修正对输出的影响,深度精度则由下面带独立参照的实验衡量。

SECTION / 05深度估计:手和物体到底有多远05

深度模块负责把双目画面变成距离。配套技术报告说明,系统在两组双目上使用 Fast-FoundationStereo(FFS),它是 FoundationStereo(FS)的轻量蒸馏模型。模型先找出左右画面中相互对应的点,再利用已经校准的相机关系计算距离;因此,模型匹配得好和硬件几何准确,缺一不可。

在合成第一视角双目数据集 UnrealEgo2 上,两种模型都以零样本方式评估。对于距离 0.3–1.0 米、左右相机都能看到并存在对应关系的表面,FFS 的绝对相对误差 AbsRel 为 0.016,FS 为 0.015。AbsRel 是预测深度与真值之差的绝对值除以真值,再取平均;这里分别约为 1.6% 和 1.5%。

这个结果对应的是双目可匹配区域。对仅在一个视角可见、没有对应点的像素,FFS 和 FS 的 AbsRel 分别为 0.297 和 0.171;在全像素口径下分别为 0.455 和 0.278。FS 借助上下文补全的表现更好,但报告称其推理成本超过 FFS 的十倍。作者据此选择轻量模型,并将部署设备上的精度改进重点放到标定上。

标定实验使用同一台设备的七次录制,共 1,277 帧、106,602 个 ChArUco 标定板角点。真值由标定板位姿获得,独立于被检验的双目外参;两种标定使用相同帧。因此,这组比较能够直接观察更新标定参数带来的深度变化。

测量距离
出厂标定 AbsRel
每段录制自标定 AbsRel
小于 0.8 m
0.023
0.011
大于等于 0.8 m
0.029
0.016
全部
0.025
0.012

在这组近距离测量中,误差从约 2.3% 降至 1.1%,支撑了原文“深度误差减半”的表述。它也解释了为什么检查图像是否清晰还不够:视觉上都很完整的深度图,仍可能给出不同的操作距离。上述模型比较与标定实验见配套技术报告[2]

出厂标定与自标定得到的 FFS 深度图,最右列显示两者的相对深度差异
出厂标定与自标定得到的 FFS 深度图,最右列显示两者的相对深度差异

SECTION / 06头部定位:让转头和伸手分得开06

佩戴者转头时,整幅画面都在动。要还原手在房间里的实际运动,就必须先知道相机去了哪里。RoboCap 用多相机视觉惯性 SLAM(同步定位与建图)完成这件事:图像负责辨认环境中的位置,IMU 提供运动线索,六路相机共同参与同一个位置估计。前方被手挡住时,侧向视角仍能提供可追踪的环境路标。

系统会跟踪画面特征、保留有代表性的关键帧,并辨认是否回到了来过的地方。对应的技术组件是 GPU 特征跟踪、带边缘化的关键帧图估计器和基于外观的地点识别;边缘化就是把较早状态压缩成约束,控制计算规模。它还会保留离开当前估计窗口的路标身份,让重访时认出的旧位置直接参与同一个视觉惯性估计器的优化。

这样,当佩戴者绕了一圈回到原处,系统可以用旧路标纠正途中累积的漂移。录制完成后,它还会利用整段数据中的全部重访关系,对关键帧进行全局束调整,也就是联合细化相机位姿与场景几何。原文主表报告的是完成这一步之后的离线轨迹。

四次 RoboCap 录制得到的场景点云及轨迹,经过跨录制对齐后显示在共同坐标系中
四次 RoboCap 录制得到的场景点云及轨迹,经过跨录制对齐后显示在共同坐标系中

评估覆盖 EuRoC、TUM-VI 室内序列、VECtor、Monado、ADT 和 HOT3D。作者使用同一套配置,接入各数据集提供的 SLAM 相机,不为每个数据集单独调参。比较对象包括 ORB-SLAM3、Basalt、OKVIS2 和 cuVSLAM;适用时采用已发表结果,否则运行其发布代码和公开配置。

下表为离线绝对轨迹误差的均方根值,即 ATE RMSE,单位为厘米,每格写作“序列均值 / 中位数”。括号中的数字是失败序列数:程序崩溃或 ATE 超过一米计为失败,计算均值时排除,计算中位数时按无穷大纳入。

数据集
ORB-SLAM3
Basalt
OKVIS2
cuVSLAM
GSI
EuRoC
3.5 / 3.3
5.8 / 5.5
3.1 / 2.3
6.6 / 8.4(4)
2.7 / 2.4
TUM-VI rooms
0.9 / 0.9
9.2 / 6.3
0.9 / 0.9
2.0 / 1.7
0.9 / 0.9
VECtor
14.7 / 23.0(5)
28.0 / 71.1(7)
25.7 / 16.8(3)
16.5 / 36.0(7)
10.5 / 4.0(4)
Monado
— / 2.5
— / 11.2
— / 2.2
11.5 / 11.5(20)
3.0 / 2.2
ADT
2.0 / 1.8(3)
11.2 / 6.5(3)
5.4 / 3.0(4)
15.9 / 6.9(12)
2.0 / 1.8
HOT3D
1.3 / ∞(18)
4.5 / 4.7(4)
1.7 / 1.7(6)
46.9 / 55.4(6)
0.4 / 0.3

Monado 的前三个基线采用数据集作者报告的非因果聚合中位数,未提供均值。在 Monado、ADT 和 HOT3D 上,GSI 完成全部序列;VECtor 仍有四次失败,但其中位误差为 4.0 厘米,最近的对比结果为 16.8 厘米。EuRoC 与 TUM-VI 上则更接近已有强基线的水平。

ADT、HOT3D 的轨迹参照来自 Aria MPS,是系统生成的伪真值。作者明确将这些结果解释为与 MPS 的一致程度,因此 HOT3D 的 0.3 厘米中位数应放在这一参照条件下理解。采集时使用的因果在线估计只能看到当前及过去观测,其误差据作者报告约在离线结果的两倍以内,主表中的最终精度依赖录制后的全局优化。

SECTION / 07手部追踪:多路画面还原同一双手07

从操作视频里恢复手部姿态,难点包括手指相互遮挡、物体挡住关节、手套改变外观,以及单个视角看不到整只手。把每个相机交给一个单目模型,再将输出拼起来,也会遇到几何冲突:各视角分别根据图像猜测手的大小和深度,输出不一定描述同一只三维手。

GSI 从一开始就按多视角问题处理。它先用 RoboCap 采集包含不同肤色、手套、物体遮挡和运动模糊的真实场景录像,再通过离线多视角优化生成标签。这一标签生产流程不使用外部动作捕捉装置,采集地点因而不必安装动捕相机。

这套流程先借助单视角模型提供手部初始估计,再逐步建立多视角重建模型,最后用一套共享的 MANO 参数进行可微优化。MANO 可以理解为一个用形状和姿态参数控制的三维手部模型;多个相机必须共同解释这只手,而不能各自猜出不同的大小和位置。系统会把三维手投回各路画面,检查外观是否匹配,同时考虑整段运动是否自然。

用于推理的模型则是前馈多视角 ViT,即基于视觉 Transformer 的一次前向预测。它接收各视角的原始手部裁剪图像和相机参数,直接输出一个跨视角共享的手部姿态。离线优化负责制作训练标签,前馈模型负责学习从观测到姿态的映射,两者承担不同的计算任务。

多路 RoboCap 图像共同约束同一对三维手部网格
多路 RoboCap 图像共同约束同一对三维手部网格

这条路线把采集范围与固定动捕场地解开。作为背景,Blog 引用的 SHOW3D[9] 也在扩展真实场景采集:其论文使用背负式多相机装置,结合头戴设备和第一、第三视角追踪产生标注。RoboCap 在本文中探索的是利用帽载多视角观测与离线优化建立自己的预训练数据。

SECTION / 08数据是否有用:换设备后的手部追踪表现08

RoboCap 采来的数据,能不能帮助模型理解其他设备拍到的手?作者用两组实验检验手部模型。第一组固定网络结构,只改变初始化方式:从随机权重开始,或先在 RoboCap 数据上预训练,再适配 HOT3D、UmeTrack、SHOW3D。适配训练为 10,000 步,表中选择的是留出人物上的最佳验证结果;MPJPE 表示平均关节位置误差,越低越好。

三套数据的相机数量、布局和镜头与 RoboCap 不同。由于公开发布版本不提供可直接使用的私有测试集,作者自行划分尽量接近官方协议的留出人物:UmeTrack 留出四人,HOT3D 留出两人,SHOW3D 留出六人。下面的比较对应这组跨人物验证设置。

数据集
随机初始化 MPJPE
RoboCap 预训练后 MPJPE
相对下降
HOT3D
17.41 mm
14.47 mm
约 16.9%
UmeTrack
19.00 mm
11.49 mm
约 39.5%
SHOW3D
19.34 mm
13.68 mm
约 29.3%

这里比较的是 21 个 MANO 关节在第一相机坐标系中的绝对位置误差,整只手放错位置也会算进去。评估不预先把根关节对齐,也不通过旋转、平移、缩放把预测结果尽量贴合真值,即不做 Procrustes 对齐。训练与评估均假设相机内外参已知;SHOW3D 没有 MANO 参数标注,使用关节点监督和评估。

按两列数据计算,预训练带来的绝对改善为 2.94–7.51 毫米,相对下降约 17%–40%。这说明在相同架构和对应训练协议下,RoboCap 数据能为不同设备上的手部追踪提供更好的训练起点。这里的收益包含后续适配训练,不能直接理解为模型换上任意设备就有同样精度。

第二组实验比较第三视角多相机手部估计,基线为 POEMv2。作者将一个检查点在 DexYCB-Mv、OakInk-Mv、HO3D-Mv 三个训练划分的并集上微调 20,000 步,再分别评估;没有为每个测试集单独做一个模型。按所采用的协议,训练只使用右手,评价仍是绝对 MPJPE。划分与评价细节见技术报告附录[2]

第三视角数据集
POEMv2
GSI 手部模型
DexYCB-Mv
6.69 mm
5.70 mm
OakInk-Mv
8.34 mm
7.34 mm
HO3D-Mv
7.72 mm
15.16 mm

GSI 在前两组上误差较低,在 HO3D 上则明显较高。作者将退步与部分测试序列移除五个相机中的两个联系起来:主要在单一固定装置上预训练的模型,需要更多适配才能应对相机配置变化。报告还说明双方训练数据混合和训练步数不同,因此这张表呈现的是各自训练流程下的结果,前一张初始化消融表才直接隔离了预训练因素。

最后,作者按真实 RoboCap 的内外参渲染内部合成测试集,获得 9.2 毫米 MPJPE。这个亚厘米数字对应具有精确真值的合成场景;作者同时指出,合成数据和动捕数据都难以完整再现野外手部追踪的视觉难度。真实场景部分还提供了运动模糊、镜头雾化、手套、小物体和工具遮挡下的定性结果。

真实场景手部追踪示例,覆盖模糊、手套、遮挡、复杂姿态及工具操作
真实场景手部追踪示例,覆盖模糊、手套、遮挡、复杂姿态及工具操作

SECTION / 09使用时要知道的能力范围09

硬件的工作空间受相机基线与视场限制,手离开所有相机视锥后无法恢复;外接电源也更适合有计划的采集活动。SLAM 在长距离、外观高度相似的回环中仍会遇到困难,作者将其归因于地点识别漏掉了足够多的重访机会,累积漂移因而未得到充分校正。需要最终精度的使用者还要考虑离线优化这一处理阶段。

手部评估的边界来自数据条件。作者指出,公开数据集尚未同时提供短基线校正双目、头戴视角,以及覆盖多种困难视觉条件的密集独立真值,所以采用其他设备上的迁移结果来间接衡量方法。跨设备验证、第三视角对比与内部合成测试,各自对应不同的观测条件。

对于机器人学习,作者明确承认本次工作测量了三维精度,尚未量化“标签精度提高一厘米,策略表现能提高多少”。用这套系统产生的数据大规模训练策略,是团队正在进行的工作。因而,理解产品能力时要把两件事分开:目前展示的是标定、轨迹和手部估计的精度,机器人最终完成任务的表现还需要下游训练来检验。

SECTION / 10怎样把 RoboCap 放进自己的工作流程10

产品官网[4]提供了几种使用入口:购买设备组织自己的采集,参与 BitRobot 的众包数据采集,或者联系官方获取数据授权。对已有机器人项目的团队,RoboCap 对应的需求是扩大真实操作示范的来源,再通过配套处理服务恢复三维动作信息。

截至本文日期,企业与科研商品页[10]提供全局快门版本的预订,同时提及滚动快门版本和不同交付批次。选型时需要核对具体版本、是否搭配 RoboWrist,以及展示的金额属于订金还是整机价格;本文技术参数采用 GSI 报告中的版本,不能直接套用于所有在售配置。

从使用流程看,人戴上帽子完成自然操作,同步相机与 IMU 留下原始记录;每段录制修正相机几何,SLAM 恢复头部运动,双目模型计算场景距离,多视角模型还原手部动作。硬件、自动处理和数据输出共同构成 RoboCap 的产品价值:让团队能持续收集真实场景里的示范,并将它们整理成带空间尺度的机器人学习数据。

FOLLOW / SOURCEMIND

关注 SourceMind

取源头之知,成未来之智

参考链接

[1] The RoboCap, for Robot Learning: https://www.gsi.company/blogs/the-robocap-for-robot-learning

[2] RoboCap: A New Platform for Egocentric Robot Learning: https://www.gsi.company/blogs/robocap/robocap-technical-report.pdf

[3] RoboCap: https://robocap.io

[4] RoboCap 官网: https://robocap.io/

[5] BitRobot 的发布帖: https://x.com/BitRobotNetwork/status/2100279940986147035

[6] 官方使用指南: https://intercom.help/frodobots/en/articles/13512443-how-to-use-robocap

[7] 开源 MCAP 转换器: https://github.com/frodobots-org/robocap-mcap-converter

[8] 搭配 RoboWrist 的套装: https://shop.bitrobot.ai/products/robocap-robowrist-bundle-enterprise-research-only

[9] SHOW3D: https://arxiv.org/abs/2603.28760

[10] 企业与科研商品页: https://shop.bitrobot.ai/products/robocap-enterprise-research-only

https://mp.weixin.qq.com/s/L1Z9wTWwqOsyZ-aOQgIyjw

2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!

扫码关注公众号,底部菜单申请进群

作者 ab, 808