Ego-Exo4D 数据集介绍
Ego-Exo4D 是 Meta FAIR 联合 15 家研究机构发布的技能型活动多模态、多视角视频数据集与基准套件。每条序列同步采集佩戴者 egocentric 视频与 4–5 路固定 exocentric 视频,面向技能理解、跨视角迁移与姿态估计等研究,不是机器人遥操示范库。

图1 Ego-Exo4D:技能活动 ego + 多路 exo 同步采集
数据集规模
·1,422 小时视频(ego + exo 合计)
·5,625 条 take / instance;单条 1–42 分钟,平均约 3 分钟
·839 名佩戴者;131 个自然场景;13 个城市
·8 类技能场景:烹饪、音乐、足球、健康护理、篮球、舞蹈、自行车维修、抱石/攀岩
·佩戴者技能水平从新手到专家;同一类活动在不同环境中重复采集
·标注总投入>200,000 人时

图2 8 类技能场景与全球 131 个采集场景分布
采集与多视角设置
与Ego4D 聚焦未脚本化日常生活不同,Ego-Exo4D 专门采集技能型活动(程序性 + 体能性),并要求不同技能水平的参与者在相近任务设定下于新环境中执行。场景多为可控封闭环境(如厨房、球场、舞蹈室、修车铺)。

图3 13 个城市采集点分布

图4 佩戴者人口统计(自愿自报部分)
硬件与模态
Ego 端统一使用 Project Aria 眼镜,与 4–5 台三脚架固定 GoPro 标定并时间同步;所有视角在度量、重力对齐坐标系中精确定位。
·Aria(ego):8 MP RGB、2 路 SLAM 灰度相机、7 路麦克风、双 IMU(800 Hz / 1000 Hz)、气压计(50 fps)、磁力计(10 fps)、眼动追踪
·GoPro(exo):4–5 路固定第三人称视角;数量与摆放按场景调整
·Aria MPS 衍生:6DoF 定位、眼动、环境点云、GoPro 6DoF 定位

图5 Aria 眼镜传感配置
语言标注
·Expert Commentary:52 名教练/教师对视频做点评,共 41,087 条时间戳解说;含转写、原始音频、空间标注与技能评分
·Narrate-and-Act:参与者自述教程式讲解,覆盖约 10% 的 take
·Atomic Action Descriptions:第三方标注的原子动作短句,全量约 150K 句

图6 三类语言标注与 ego-exo 视频对应关系
其他标注
·Keystep 关键步骤分段与程序依赖
·技能水平(proficiency)评分
·3D 人体 + 手部姿态(ego 端 17 个身体关节 + 每只手 21 个关节,MS COCO 约定)
·Ego-exo 物体对应分割(correspondence 任务约 2,367 个物体、647K 掩码)
基准套件(4 大家族)
·Ego-Exo Relation:跨视角物体对应(correspondence)与视角翻译(translation)
·Keystep Recognition:细粒度 keystep、能效多模态 keystep、程序理解
·Proficiency Estimation:估计参与者技能水平
·Ego Pose:从 ego 视频恢复 3D 人体与手部姿态

图7 Ego-Exo Relation:对应与翻译

图8 Keystep Recognition 任务

图9 Proficiency Estimation 任务
数据组织与获取
·许可:Ego-Exo4D 专用协议;
·下载:官方CLI;文档站 Getting Started 有完整流程
·测试集标注通过评测服务器提交,不公开下载
链接
·官网:https://ego-exo4d-data.org/
·论文:https://arxiv.org/abs/2311.18259
·文档:https://docs.ego-exo4d.org/
来源:https://mp.weixin.qq.com/s/9HoijOLrGVBrpiQAFKF0pQ
2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!
扫码关注公众号,底部菜单申请进群


