绝大多数机器人项目失败的根源不在于模型架构,而在于数据:数据类型选错、数据分布不匹配、标注看似合格,训练时却暴露大量缺陷。

本文完整覆盖机器人学习数据全链路:机器人学习用到的数据分类、低成本采集方案、不破坏模型的标注规范、部署后可持续迭代的数据训练pipeline。
本文面向熟悉机器学习、但从未从零搭建机器人数据训练pipeline的工程师与技术负责人。
一、机器人实际学习需要哪几类数据?
一切工作从这里起步:机器人训练数据并非单一类型。仓储导航机器人与灵巧操作机械臂所需的数据格式、标注要求完全不同。将所有机器人数据简单归为“待标注传感器记录”,是项目早期成本最高、最致命的失误——你会耗费大量成本产出一套庞大但完全不匹配训练目标的数据集。

宏观来看,机器人学习依赖三类数据,每一类分工明确:
1. 原始传感器数据(Raw sensory data)
包含相机画面、激光雷达点云、麦克风音频,是机器人硬件输出的未处理原始信号。用于训练感知模型:目标检测、语义分割、深度估计。按数据体量计算,这类数据的标注工作量最大。
2. 底层循环时序数据(Low-level cyclic data)
控制环路持续输出的信号流:关节角度、电机扭矩、力传感器读数,采样频率30–1000Hz。用于动力学模型与底层控制器训练。标注需求极低——信号自身时序结构已承载绝大部分有效信息。
3. 任务级遥测数据(Task-level telemetry)
完整任务片段记录:机器人从启动到任务完成/失败的全流程日志,是模仿学习与RL的核心输入。标注密度要求最高:需要划分任务阶段边界、标注成功/失败标签、记录物体状态,有时还需标注操作员操作意图。
仅做固定拾取放置的工业机械臂,通常只需要前两类数据;需要从人类演示中学习操作的灵巧机器人,则三类数据缺一不可。若在采集前选错数据类别,会造成巨额成本浪费。
机器人感知学习用到的各类传感器数据
每种传感器模态为感知栈提供独特信息,每种模态对应的标注需求,需要在设计pipeline前理清。

-
RGB相机:数据体量最大、标注成本最高,每一帧都需要目标级标注,通常还需位姿标注。
-
激光雷达&深度传感器:生成三维点云,用于空间建图与障碍物检测;标注不再是2D包围框,而是3D长方体、多边形掩码。
-
IMU惯性与运动传感器:捕捉位置、朝向、加速度,是移动机器人、空中机器人的核心依赖。
-
触觉/力传感器:记录接触事件与压力分布,所有精细抓取任务的关键信号。
-
音频传感器:处理语音指令与环境声学信息。
落地生产的现实情况:绝大多数机器人系统至少融合两种传感器模态。多模态融合带来硬性标注约束:所有数据流的标签必须时间戳同步——第N帧相机标注,必须对应同一时刻的激光雷达扫描帧。如果一款标注工具仅能处理单一模态、忽略跨流时间对齐,不仅会增加人工工作量,还会向训练信号中引入大量噪声。
理清机器人所需传感器数据后,下一个核心问题:数据从哪里来?真实采集数据与仿真生成数据的配比该如何规划?
二、真实世界数据 vs 合成数据:你该如何选择?

两类数据都不可或缺,核心要确定配比比例与使用阶段——这一步会直接决定项目不可逆转的预算分配。

合成数据用于预训练、扩充场景覆盖;真实数据用于微调与模型验证。完全依赖合成数据会大幅增加硬件测试阶段的调试工作量;完全依赖真实数据会限制预训练场景多样性,往往在采集足量数据前就耗尽预算。
什么是Sim-to-Real Gap?如何缩小差距?
Sim-to-Real Gap,指在仿真环境中表现优异的策略,部署到实体硬件后性能大幅下滑。该问题只会在首次硬件实测时暴露,无法在仿真阶段提前发现,因此调试成本极高。
鸿沟产生根源:物理仿真器只能近似模拟接触动力学、摩擦力、传感器噪声、光照,无法完全复刻真实世界。完全在仿真中训练的抓取策略,部署到真实物体上会出现典型缺陷:动作时序偏差、机械臂关节形变未纳入抓取角度计算、反光物体视觉特征与训练分布完全不符。

5套落地有效的优化方案:
-
域随机化(Domain randomization)仿真训练时随机调整光照、纹理、物理参数、物体摆放位置,让策略学习泛化能力,而非拟合仿真环境固定特征。
-
定向真实数据验证小规模采集真实场景数据,精准定位分布差距最大的场景,针对性修复,而非一次性优化全部问题。
-
基于合成预训练权重迁移学习用大规模合成数据集预训练模型,再用真实数据微调;相比从零训练,所需真实数据量大幅降低。
-
硬件参数匹配仿真环境实测真实执行器延迟、摩擦系数,在仿真训练启动前完成参数对齐,而非鸿沟出现后再补救。
-
交错混合训练训练全程混合合成样本与真实样本,而非分两段串行训练;相比分段训练,模型跨域迁移效果更平滑。
以上方案均无法彻底消除仿真现实鸿沟,但可以缩小差距、让性能波动变得可预测。
工程落地:混合数据训练pipeline该如何搭建?
合成数据预训练会生成可跨域迁移的特征表征,这是混合方案成立的核心,单纯调整数据配比无法实现同等效果。
在大规模合成数据集上预训练的网络,会学习几何结构、物体交互、物理规律的通用表征,可跨视觉域迁移。微调真实数据时,模型仅需将表征适配至部署环境分布,而非从零学习基础特征。最终效果:相比冷启动训练,所需真实世界数据量大幅减少。
工程落地难点:数据格式标准化。合成数据集与真实数据集几乎不会共用同一套坐标规范、时间戳格式、帧率、标签体系。若缺少统一标准化层做数据对齐,送入模型的两类数据分布完全割裂,会造成模型两边都欠拟合。
针对操作抓取任务实操方案:先在合成数据上预训练,直至仿真性能达到瓶颈;再将真实数据预算倾斜至仿真迁移效果最差的场景。仿真验证结果可精准定位薄弱场景。
三、机器人训练数据该如何采集?
采集方案必须服务于训练目标,而非仅考虑采集流程便利。我们见过大量项目先敲定采集方案、规模化采集后,才发现数据无法支撑目标模型训练,此时预算已全部消耗。
正确执行顺序:明确机器人任务目标 → 确定任务所需数据类型 → 选择可产出对应数据的采集方案。
众包采集与受控采集分别适用什么场景?
选择标准仅有一条:模型需要多大范围的环境多样性。
-
众包采集适合需要海量真实环境变体的场景:家用机器人需要适配不同厨房、光照、家具布局,单一实验室受控采集无法覆盖完整分布。
优势:场景覆盖广;劣势:数据一致性差——录制质量、标注准确度、流程合规度参差不齐。
管控方案:标准化采集软件,标注前自动化质量过滤,人工复核仅针对模糊样本。
-
受控采集适合部署环境固定、任务精度优先级高于环境多样性的场景:手术器械交互数据集需要高可复现性与标注精度,厨房光照多样性无任何意义。
劣势:数据集分布人工收窄,固定场景任务效果良好,但泛化能力存在缺陷。
实操起步建议:先用受控采集验证整套数据pipeline,建立合格数据质量基准;确认标准后,再通过众包采集做规模化拓展。
如何采集高质量人类演示数据?
人类操作员示范操作是模仿学习的核心数据源。模型训练信号完全来自操作员动作,因此采集质量直接决定策略效果。

三类采集方案各有取舍:
-
远程操控Teleoperation:适合精细电机高精度操作任务
-
示教拖动Kinesthetic teaching:简单动作采集速度更快
-
第一视角VR+动作捕捉Egocentric VR + motion capture:全屋家务类全身动作采集

注意缺陷:手部被物体遮挡时,位姿数据会失真甚至丢失。
机器人模型训练应当如何采集 egocentric data?硬件、标注到落地全流程解析
用 iPhone 稳定采集1小时以上的egocentric 数据
EgoKit:支持多类设备的低成本 Egocentric 数采
重点讲解Egocentric采集方案:当前数据集项目中,我们采用Pico 4 Ultra VR头显搭配iPhone 15 Pro录制日常居家场景:备餐、厨具操作、清洁整理。头戴设备可全程保证手部在画面内;搭配动作追踪器可同步输出全身骨骼、单指关节位姿与视频,为需要理解人体全身动作逻辑的模型提供更丰富的训练信号。
该方案短板需要提前规划:手部位姿追踪依赖头载相机,抓取杯子等手部被物体遮挡的场景,位姿数据会失效。解决方案并非更换采集方案,而是设计采集场景时尽可能减少遮挡,同时在标注阶段对遮挡帧做特殊标记,不将其作为干净训练样本。

决定演示数据集能否训练出可用策略的核心要点:
-
场景覆盖度远重于数据总量1000份完全相同起始位置、相同机械臂开合角度的演示数据,无法让机器人适配部署环境中的变量;仅200份、包含多种起始角度、物体摆放、抓取方式的演示数据,可让机器人处理环境变化、自主修复轻微操作失误。训练数据分布单一,机器人遇到微小位置偏移就会直接失效。
-
故障修复类演示不可或缺必须录制操作出错后的补救动作:抓取闭合不全、物体滑落、放置偏移等场景。模型只能学习你展示过的故障处理逻辑。仅采集成功案例的团队,最终机器人可完成90%标准流程,但遇到轻微故障会直接卡死、任务失败。
-
采集前切勿锁定固定数据总量任务结构、硬件、采集方式都会影响所需演示数量,无法提前预估。正确流程:先采集小批量演示、训练模型、定位失效场景,再针对性补充缺失场景数据。采集前固定大规模数据量,会浪费大量预算采集无效样本。
除采集质量外,一个技术选择会极大影响训练稳定性:动作表征方式(关节角度 vs 末端执行器位姿、绝对坐标 vs 增量坐标),其影响远超多数团队预期。务必在数据采集前与模型架构对齐。
四、如何标注机器人数据,避免模型失效?
标注是整套数据训练pipeline的核心瓶颈。模型会完全复刻标签编码的信息:标签不一致、空间精度不足、关键信息缺失,都会直接转化为模型缺陷。
机器人标注存在普通图像标注工具无法适配的特殊需求:视频帧时序一致性、点云三维空间精度、多传感器流时间同步。用2D图像标注工具处理机器人数据,产出的数据集看似完整,实则内置系统性标注误差。
机器人标注区别于普通计算机视觉标注的五大硬性要求
-
全视频帧内物体ID保持一致所有追踪物体在完整视频序列中分配固定唯一ID;物体互相遮挡时,自动ID追踪会断裂,必须人工校正。ID频繁切换会生成矛盾的追踪目标,直接干扰模型训练。
-
点云标注三维空间精度激光雷达长方体标注必须贴合物体三维边界,几厘米的标注误差会直接导致抓取预测出错。标注界面必须提供3D可视化功能;仅在2D投影上标注点云,会带来系统性精度偏差。
-
跨模态毫秒级时间戳同步第N帧相机标签,必须对齐同一时刻激光雷达扫描数据。50毫秒以内的微小偏移,都会给多模态融合感知模型引入训练伪影。该问题无法在后处理阶段修复,必须依靠标注工具原生支持时间对齐。
-
物体功能关联标签任务级学习不仅需要标注物体类别,还要标注物体交互关系:容器、支撑平面、操作工具。缺少关系标签,模型只能识别物体,无法理解完整任务逻辑。

-
任务阶段与操作意图边界标注模仿学习必须划分帧所属任务阶段:接近、抓取、移动、放置。阶段边界是策略判断下一步动作的依据。Label Studio等工具支持插件式3D标注、多模态时间对齐,相比分开标注各类传感器,可大幅降低同步误差。
对训练负面影响最大的标注误区

实际项目中破坏性最强的错误:任务阶段标签标准不统一。标注员A将抓取阶段起点定为手部接触物体,标注员B定为机械爪闭合。混合两类标签训练出的策略,阶段切换决策边界模糊,在最需要高精度的抓取环节频繁失误。
规模化标注前,用Cohen's kappa系数校验阶段标签标注一致性;kappa值低于0.7,代表模型收敛效果极差,必须先统一标注规范,再大规模标注,不要等5万帧错误标注完成后再整改。
五、你的业务场景真正需要什么数据?
适用于某一类机器人领域的数据策略,放到另一领域会完全失效。不同赛道需求差异极大,通用化方案只会产出无法匹配模型需求的数据集。

1. 工业机器人
运行环境固定、任务已知。核心需求:高精度任务演示数据,以及产线高频故障的修复演示。标注精度优先级高于场景多样性。
本领域错误标注的成本远高于其他赛道——机器人无额外环境信息兜底,标签错误会直接导致生产事故。
2. 家用服务机器人
环境持续动态变化:光照、物体摆放、人员行为无固定规律。核心需求:海量多样化真实居家采集数据,场景覆盖优先级高于标注精度。
众包采集是规模化落地唯一可行方案,同时标注与质量管控工作量大幅提升。
实操经验:用于搭建仿真厨房环境的3D扫描硬件,同样可采集居家第一视角演示数据;但两类场景的扫描内容、标注标准完全不同,部署场景决定数据质量标准,而非采集工具。
3. 自动驾驶车辆
核心需求:大规模极端场景覆盖——特殊天气、模糊路口、非常规行人行为,安全事故高发场景。全机器人领域标注工作量最大:多传感器同步、精准轨迹标注、海量语义分割任务。
4. Humanoid人形机器人
当前机器人数据领域最难赛道。机器人需要在人类专属环境中完成全品类人类操作任务,需要全身运动数据、多步骤演示、人机交互序列,绝大多数项目前期都低估了数据规模需求。 Open X-Embodiment数据集(由Google DeepMind联合33家研究机构搭建,包含22种机器人硬件、超百万任务片段)代表当前通用操作机器人训练数据的行业基准。该数据集仅作科研基准,无法直接照搬,但清晰展示通用操作模型所需的数据量级。
敲定采集方案前必须回答的三个核心问题
三个问题可快速对齐团队数据需求,效率高于各类框架:
-
你最无法承受哪一类故障?外科机器人安全故障与物流机器人任务失败,对应的数据覆盖优先级完全不同。优先采集可规避核心故障前置场景的数据。
-
部署环境变动幅度多大?固定可控环境优先受控采集;多变不可预测环境优先众包采集。该问题直接决定整套采集策略。
-
任务要求的最低标注精度是多少?低于该精度阈值,无论数据总量多大,模型都无法完成任务。在设计标注pipeline前提前确定精度下限,而非首轮训练失败后再补救。
六、如何搭建可规模化稳定运行的数据训练pipeline?
机器人数据训练pipeline是闭环循环,而非线性一次性流程:采集→处理→标注→校验→训练→部署→线上监控→基于线上问题补充采集。将其视作一次性ETL任务的团队,半年后都会在项目压力下重构整套流程。
规模化后极易崩溃的三类问题:
-
多套采集设备无统一数据格式标准,每次采集结束都需要人工统一格式,才能进入标注流程;
-
标注前缺少自动化质量筛选,标注人员耗费大量时间处理无效录制数据;
-
无机制将线上部署故障回流至训练数据集。
多传感器数据流如何管理,避免格式混乱?

首批采集前敲定的格式规范,决定后续每一轮数据的整理工作量;采集50组数据后修改格式,意味着全部历史数据重新处理。
原始传感器数据统一存储格式,内置跨模态对齐元数据:行业标准为ROS 2 bag文件、带同步时间戳索引的HDF5。所有采集设备统一一套坐标系定义;不同坐标系采集的数据会引入额外转换步骤,误差持续累积。
预处理(点云降采样、深度图生成、图像校正)支持分布式并行计算;数据达到TB级后,串行处理效率极低。Ray等分布式框架可低成本实现并行预处理。
原始数据与预处理衍生数据分开存储、版本管理。预处理逻辑会持续迭代,迭代后必须基于原始数据重新处理;同时需要记录每版模型对应的预处理数据版本。
线上部署反馈闭环完整流程

机器人项目中价值最高的数据,大多来自上线部署后,而非前期采集。量产机器人会遇到仿真、实验室采集完全无法覆盖的分布偏移场景。
线上最低日志采集标准:单次推理模型置信度、任务完成/失败事件、人工干预操作。低置信度帧、任务失败片段自动进入标注队列,无需周期性人工筛选。从“模型识别场景失效”到“模型基于该场景重训”的周期控制在数天,而非数月。
重训模型重新部署硬件前,必须针对触发重训的故障场景做人工校验,不能仅依靠自动化指标。修复原有缺陷的模型,有时会引入新问题。所有模型强制版本管理,支持分钟级回滚;安全敏感场景下,快速回滚是硬性要求,而非附加功能。
七、当前机器人数据领域正在发生哪些变革?
行业核心变化:基础模型改变了数据人力投入的分配方向,而非减少数据总量。基于互联网海量视觉、文本数据预训练的大模型,仅需少量任务演示数据即可微调,无需从零训练。RT-2验证了视觉语言动作跨域迁移;π0(Physical Intelligence,2024)证明基于Flow Matching的VLA模型,跨多任务预训练后,仅需少量额外数据即可适配全新操作技能。
落地层面变化:演示数据价值持续提升,并未贬值。预训练简化通用感知能力;任务专属演示数据成为模型差异化核心。随着基础模型成为行业标准,具备高效高质量演示采集基建的团队将形成核心优势。

2025–2026年重塑机器人数据行业的五大趋势:
-
自监督学习降低感知任务标注需求量,从原始传感器信号中自主提取训练特征;MAE类模型从无标注视频学习空间表征,下游任务所需标注数据量大幅缩减。
-
VLA模型(RT-2、π0、OpenVLA)让演示数据跨任务泛化落地可行;数据团队的工作重心从单一任务深度采集,转向多场景演示广度覆盖。
-
Open X-Embodiment彻底改写“从零训练”的定义:22类机器人硬件、超百万任务片段开源可用;基于该底座微调的团队,相比从零训练,所需任务演示数据大幅减少。
-
LeRobot(Hugging Face,2024)内置Diffusion Policy、ACT算法实现与完整数据采集工具库;团队从零搭建实体机器人模仿学习实验的周期从数周缩短至数天。
-
机器人集群联邦学习从科研走向工程落地;核心难点并非算法,而是采集基建——原始环境数据本地留存,仅汇总模型更新参数至中心服务器。
当前值得投入的工具选型指南
先定位自身瓶颈,再选择工具;无法解决你核心痛点的工具无任何价值。
-
标注吞吐量不足3D点云标注首选CVAT,原生适配该格式;其余多模态机器人标注场景,Label Studio是最灵活开源方案,支持视频序列、文本、音频、自定义标注规范,社区维护完善。两款工具均可无大量定制接入主流机器学习训练pipeline。
-
合成数据生成量不足Isaac Lab支持GPU加速仿真,可单集群并行数千仿真环境,适配规模化训练域随机化;MuJoCo仍是学术基准,物理仿真精度最高,适合操作抓取基准实验。
-
核心训练范式为模仿学习Diffusion Policy、ACT是当前行业基准,二者在实体硬件上仅需少量演示数据即可取得优秀效果,LeRobot内置完善可直接运行的代码实现。
通用避坑提醒:基于2D静态图像标注工具改造而来的机器人标注软件,几乎都存在时序同步缺陷;后续持续维护成本会远超初期节省的开发成本。
八、总结
机器人项目中,硬件、模型架构往往获得最多关注;数据策略总是延后规划,预算余量不足。这种工作顺序,是绝大多数高成本项目失败的根源。
能稳定交付可靠机器人学习系统的团队,会同步规划数据策略与模型架构,而非后置处理。采集前明确核心故障风险、任务要求标注精度、线上部署数据回流闭环;其余架构、工具、基建全部围绕数据策略搭建。
如果你正在解决项目落地难题:演示采集方案规划、特定任务标注精度标准、可迭代优化的规模化数据训练pipeline,以上正是Unidata提供的核心服务。
常见问答FAQ
1. 训练机器人会用到哪些类型的数据?
机器人训练数据分为三类:原始传感器数据(相机画面、激光雷达点云、音频)、底层循环时序数据(关节状态、电机扭矩、30–1000Hz控制信号)、任务级遥测数据(带成功/失败标签的完整任务片段)。绝大多数落地系统会同时使用三类数据,配比取决于模型学习目标:感知、底层控制、任务行为。
2. 已有合成数据,为什么真实世界数据依然不可或缺?
仿真器仅能近似模拟部署环境,无法完全复刻真实场景。硬件实测暴露的故障(接触打滑、反光材质、传感器偏移噪声)仅能在真实采集数据中体现。合成预训练可扩充场景覆盖、降低成本,但正式硬件部署前,必须使用真实数据微调与验证。
3. 合成数据训练机器人的核心局限是什么?
核心瓶颈是仿真现实鸿沟:完全仿真训练的策略部署实体硬件后出现分布偏移。接触动力学、材质摩擦力、传感器噪声是最常见失效点。域随机化可缩小鸿沟,但无法彻底消除;安全敏感场景,无论合成数据规模多大,都必须搭配真实验证数据。
4. 训练一台可完成有效任务的机器人,需要多少数据?
完全取决于任务复杂度与训练范式。使用Diffusion Policy、ACT算法,简单抓取操作仅需50–200份演示数据;通用跨场景操作机器人是完全不同量级:Open X-Embodiment开源底座包含22类机器人、超百万任务片段。基础模型会降低单任务所需演示数据,但预训练底座本身需要海量数据支撑。
5. 机器人数据标注和普通图像标注有什么区别?
三大硬性需求是普通工具无法适配的:时序一致性(遮挡场景下全视频统一物体ID)、点云三维空间标注精度、多传感器毫秒级时间戳同步。模仿学习还额外需要任务阶段、操作意图标注。用2D图像标注工具改造做机器人标注,会生成带同步系统误差的数据集。
6. 机器人训练中合成数据与真实数据的区别?
合成数据:仿真环境生成,采集快、成本低、可批量生成极端场景、无隐私风险、自动生成真值标签;缺陷是无法复刻真实世界细微特征,仅适合预训练、扩充场景。 真实数据:实体机器人在真实环境采集,贴合部署场景真实分布;缺陷是采集慢、成本高、依赖人工标注。 混合训练pipeline效果优于单一数据源。
7. 人类演示数据在机器人训练中起到什么作用?
演示数据是模仿学习的核心训练输入,机器人复刻操作员动作,无需人工设计奖励函数。采集方式分为远程操控、示教拖动、动作捕捉第一视角录制,最终处理为观测-动作配对用于策略训练。场景覆盖多样性比单纯数据总量更关键;仅采集标准成功动作,机器人遇到微小环境变化就会失效。
8. 训练范式如何决定所需数据类型?
RL强化学习基于仿真交互、自定义奖励函数生成数据,无需人工采集;模仿学习依赖人工演示片段,整套数据pipeline围绕采集、标注录制内容搭建;感知监督学习需要带标注传感器数据:画面、点云、物体位姿标签。绝大多数落地项目混合多种训练范式,对应数据pipeline需要兼容多格式、多标注规范。
拓展阅读与参考文献
[1] Kroemer, O., Niekum, S., & Konidaris, G. A Review of Robot Learning for Manipulation — Journal of Machine Learning Research — 2021
[2] Pierson, H. A., & Gashler, M. S. Deep Learning in Robotics: A Review of Recent Research — Advanced Robotics — 2017
[3] Peng, X. B., et al. Sim-to-Real Transfer of Robotic Control with Dynamics Randomization — ICRA — 2018
[4] Tobin, J., et al. Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World — IROS — 2017
[5] Andrychowicz, M., et al. Learning Dexterous In-Hand Manipulation — International Journal of Robotics Research — 2020
[6] Argall, B. D., et al. A Survey of Robot Learning from Demonstration — Robotics and Autonomous Systems — 2009
[7] Liao, Z., et al. A Survey on Data Collection for Machine Learning — IEEE Transactions on Knowledge and Data Engineering — 2022
[8] Tkachenko, M., et al. Label Studio: Data Labeling Software — Heartex Inc. — 2020
[9] Padalkar, A., et al. Open X-Embodiment: Robotic Learning Datasets and RT-X Models — CoRL — 2023
[10] Quigley, M., et al. ROS: An Open-Source Robot Operating System — ICRA Workshop on Open Source Software — 2009
[11] Amodei, D., et al. Concrete Problems in AI Safety — arXiv — 2016
[12] Zitkovich, B., et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control — CoRL — 2023
[13] Black, K., et al. π0: A Vision-Language-Action Flow Model for General Robot Control — Physical Intelligence — 2024
[14] He, K., Chen, X., Xie, S., Li, Y., Dollár, P., & Girshick, R. Masked Autoencoders Are Scalable Vision Learners — CVPR — 2022
[15] Chi, C., et al. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion — IJRR / RSS — 2023
[16] Cadène, R., et al. LeRobot: State-of-the-Art Machine Learning for Real-World Robotics — Hugging Face — 2024
[17] McMahan, B., et al. Communication-Efficient Learning of Deep Networks from Decentralized Data — AISTATS — 2017
[18] NVIDIA. Isaac Lab: GPU-Accelerated Robot Learning — NVIDIA Developer — 2024
[19] Todorov, E., Erez, T., Tassa, Y. MuJoCo: A Physics Engine for Model-Based Control — IROS — 2012
[20] Zhao, T., et al. ACT: Action Chunking with Transformers for Robotic Manipulation RSS 2023
[21] Kim, G., et al. OpenVLA: An Open-Source Vision-Language-Action Model for General Robot Control arXiv 2024
2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!
扫码关注公众号,底部菜单申请进群
