Ego-Exo4D 数据集介绍

Ego-Exo4D 是 Meta FAIR 联合 15 家研究机构发布的技能型活动多模态、多视角视频数据集与基准套件。每条序列同步采集佩戴者 egocentric 视频与 4–5 路固定 exocentric 视频,面向技能理解、跨视角迁移与姿态估计等研究,不是机器人遥操示范库。 

1 Ego-Exo4D:技能活动 ego + 多路 exo 同步采集

数据集规模

·1,422 小时视频(ego + exo 合计)

·5,625 条 take / instance;单条 1–42 分钟,平均约 3 分钟

·839 名佩戴者;131 个自然场景;13 个城市

·8 类技能场景:烹饪、音乐、足球、健康护理、篮球、舞蹈、自行车维修、抱石/攀岩

·佩戴者技能水平从新手到专家;同一类活动在不同环境中重复采集

·标注总投入>200,000 人时

2 8 类技能场景与全球 131 个采集场景分布

采集与多视角设置

Ego4D 聚焦未脚本化日常生活不同,Ego-Exo4D 专门采集技能型活动(程序性 + 体能性),并要求不同技能水平的参与者在相近任务设定下于新环境中执行。场景多为可控封闭环境(如厨房、球场、舞蹈室、修车铺)。

3 13 个城市采集点分布 

4 佩戴者人口统计(自愿自报部分)

硬件与模态

Ego 端统一使用 Project Aria 眼镜,与 4–5 台三脚架固定 GoPro 标定并时间同步;所有视角在度量、重力对齐坐标系中精确定位。

·Aria(ego):8 MP RGB、2 路 SLAM 灰度相机、7 路麦克风、双 IMU(800 Hz / 1000 Hz)、气压计(50 fps)、磁力计(10 fps)、眼动追踪

·GoPro(exo):4–5 路固定第三人称视角;数量与摆放按场景调整

·Aria MPS 衍生:6DoF 定位、眼动、环境点云、GoPro 6DoF 定位 

5 Aria 眼镜传感配置

语言标注

·Expert Commentary:52 名教练/教师对视频做点评,共 41,087 条时间戳解说;含转写、原始音频、空间标注与技能评分

·Narrate-and-Act:参与者自述教程式讲解,覆盖约 10% 的 take

·Atomic Action Descriptions:第三方标注的原子动作短句,全量约 150K 句

6 三类语言标注与 ego-exo 视频对应关系

其他标注

·Keystep 关键步骤分段与程序依赖

·技能水平(proficiency)评分

·3D 人体 + 手部姿态(ego 端 17 个身体关节 + 每只手 21 个关节,MS COCO 约定)

·Ego-exo 物体对应分割(correspondence 任务约 2,367 个物体、647K 掩码)

基准套件(4 大家族)

·Ego-Exo Relation:跨视角物体对应(correspondence)与视角翻译(translation)

·Keystep Recognition:细粒度 keystep、能效多模态 keystep、程序理解

·Proficiency Estimation:估计参与者技能水平

·Ego Pose:从 ego 视频恢复 3D 人体与手部姿态

7 Ego-Exo Relation:对应与翻译 

8 Keystep Recognition 任务 

9 Proficiency Estimation 任务

数据组织与获取

·许可:Ego-Exo4D 专用协议;

·下载:官方CLI;文档站 Getting Started 有完整流程

·测试集标注通过评测服务器提交,不公开下载

链接

·官网:https://ego-exo4d-data.org/

·论文:https://arxiv.org/abs/2311.18259

·文档:https://docs.ego-exo4d.org/

来源:https://mp.weixin.qq.com/s/9HoijOLrGVBrpiQAFKF0pQ

2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!

扫码关注公众号,底部菜单申请进群

作者 ab, 808