为什么一双数据采集手套,会卖到几万元?
这可能是很多人第一次接触具身智能数据采集时,最自然的问题。
目前,MANUS手套是数据采集领域的主流产品之一。一双高性能的MANUS手套,在中国的售价接近10万元。这样的手套,正在越来越多地出现在具身智能的前沿研发中。英伟达在EgoScale中使用MANUS手套进行高精度手部数据采集;Meta、斯坦福大学、伯克利大学等科技公司和研究机构的具身智能和机器人项目中,也能看到MANUS手套的应用。
几万元一副的数据采集手套,为什么会被这些具身智能公司和研究团队大量采用?答案,要从机器人正在面对的一道难题说起。
01 机器人已经跑得很快了,下一步呢? 2026年8月,在北京举行的第二届世界人形机器人运动会上,天工Ultra在100米大型组比赛中以8.64秒夺冠。几年前,我们还在讨论人形机器人如何稳定站立、正常行走。今天,它们已经开始在赛道上高速奔跑。
但如果希望机器人真正进入工厂、实验室和家庭,仅仅“会走、会跑”还远远不够。机器人最终还要干活,拿起工具,拧紧螺丝;装配零件,整理线束;打开瓶盖,处理食材;甚至连续完成十几步、几十步复杂任务。
2026年5月,Genesis AI发布的GENE-26.5展示了另一幅画面:机器人利用双臂和双五指灵巧手完成烹饪、实验室操作、整理线束、转魔方、弹钢琴等任务。
2026年世界人形机器人运动会百米赛跑(图片来源:xinwen.bjd.com.cn/content/s6a8ee42de4b03fa51a836bbc.html)
GENE-26.5利用双臂和双五指灵巧手完成复杂操作。从“会运动”走向“会干活”,灵巧操作正在成为人形机器人继续突破的重要方向。(图片来源:www.genesis.ai/blog/gene-26-5-advancing-robotic-manipulation-to-human-level)
两幅画面放在一起,能够看到人形机器人发展的两个方向:一边,是越来越强的全身运动能力;另一边,是越来越复杂的双手操作能力。而真正进入生产和生活,后者尤其关键。因为人的手做的很多事情,看起来很简单,对机器人却很难。
拧一个瓶盖,不只是让手指运动到正确的位置。还要知道:在哪里接触?什么时候开始用力?用了多大的力?物体有没有滑动?什么时候应该继续压,什么时候应该松开?人的手不只是在运动,也在每时每刻地感受世界。
更复杂的是,真实工作通常不是完成一个动作,而是连续完成很多动作。假设一个任务需要连续20个步骤,即使机器人每一步都有90%的成功率,20步全部成功的概率也只有大约12%。所以机器人真正困难的,不只是:“这次能不能成功?”而是:“能不能连续把一件事情做完,而且足够稳定?”
这时候,问题就从机器人的身体,进入了机器人的学习能力。
02 机器人想学会干活,需要什么“教材”? 大语言模型之所以能够掌握大量知识,是人类已经把大量知识写进了数字世界。书籍、网页、图片、代码,都可以成为模型学习的材料。但是轮到机器人时,情况并不一样。
互联网记录了大量人类“说过什么”,却很少完整记录人类“手是怎么干活的”。一个熟练的装配工人,可以很自然地把零件装到正确位置;一个厨师不用计算,也知道什么时候应该收刀、什么时候应该加力。这些经验大量存在于现实世界,却很少被全面记录下来。
你问一个人:刚才拧瓶盖时,你的食指弯了多少度?拇指用了多大的力?他大概率回答不出来。但他的手知道。
因此,具身智能要解决的一个重要问题,就是:怎样把这些原本存在于人手里的操作经验,变成机器人能够学习的数据。
03 为什么偏偏是现在? 因为机器人获取数据的方式正在变化 获取机器人数据的一种方式是让人遥控机器人。操作人员通过VR设备或其他遥操作系统,控制机器人完成任务。机器人的摄像头、关节、电机和传感器同步记录整个过程。这种数据非常重要,因为它直接来自机器人本体,与机器人最终执行任务的状态高度一致。
但它也有一些局限。首先是贵。一台用于数据采集的机器人价值几十万元。如果要同时让100个人采数据,就意味着需要100套机器人系统。第二是慢。遥控机器人不像我们自己伸手拿杯子那么自然,操作人员必须迁就机器人的运动速度、控制延迟以及硬件能力。第三是很难扩大规模。这条路线的扩产单位是机器人,想多采一倍数据,就得多买一倍机器人。数据的天花板,被卡在机器人的产能上。而这个世界上,每天都在真实地干着活的人,有几十亿——他们的手一直在动,只是从来没有任何东西在记录。
这就带来了一个很自然的问题:为什么一定要让机器人做,来产生机器人学习的数据?现实世界里,每天本来就有大量的人在做饭、装配、维修和操作设备。如果能够把这些人工作的过程记录下来,再让机器人学习,会怎么样?
近年来,这条“以人为中心”的数据路线开始快速发展。2026年2月发布的NVIDIA EgoScale使用了20,854小时带动作标注的第一视角人类视频进行预训练;同年8月发布的Dyna-2,预训练的人类第一视角视频规模进一步超过100万小时。
这背后真正重要的变化是:大规模人类操作数据,开始成为机器人学习的重要数据来源。同时,机器人真机数据并没有因此失去价值,不同数据正在形成更明确的分工。 机器人数据金字塔:机器人训练需要多类数据协同
仿真数据,可以低成本、大规模生成,适合扩大场景覆盖和反复训练;人类数据,可以把真实世界中丰富的操作经验带入模型;机器人真机数据,则直接包含目标机器人的视觉、关节运动等,在本体对齐以及最终验证中依然很难被替代。
未来更可能出现的是一种协同关系:用更容易规模化的数据,学习广泛的世界知识和操作经验,再用贴近目标机器人的数据,把这些能力转移到机器人身上。
04 视频可以看到动作,但还“摸”不到世界 如果要大量记录人的操作,最简单的方法是拍摄视频。人在头上佩戴一台第一视角相机,正常工作,数据就会持续产生。这种方式便宜、自然,而且容易扩大规模。但在精细操作中,视频有两个局限:看不完整,以及摸不到。
人在抓取、旋拧、插拔物体时,真正发生接触的手指,经常被物体本身挡住。摄像头可能知道“这个人正在拧瓶盖”,却未必能够准确看到此刻每一根手指的姿态。而且它可以看到手抓住了杯子,却不能直接测量接触和力的数据。
我们可以把人类操作的信息分成三个层次:摄像头回答:“人在做什么?”手部位姿回答:“手到底怎么动?”触觉回答:“手是怎样与物体发生接触的?”这三者描述了同一件事情的不同角度的信息。
这对于正在快速发展的世界模型很重要。世界模型要学习的不只是“眼前看到了什么”,还要理解一个动作发生以后,物体和环境接下来会怎样变化:手向前推,杯子会移动;手指加力,物体可能变形;摩擦不足,物体可能滑落。它让模型学习现实世界运行的规律,并预测动作带来的结果。视频能够提供丰富的时空变化,而更准确的手部运动和接触信息,则让模型进一步理解“人做了什么”与“世界为什么这样变化”之间的关系。
英伟达的EgoScale先利用超过2万小时第一视角人类视频学习大规模操作经验,然后在人机对齐阶段,使用MANUS手套记录高精度手部运动,使人的动作和机器人的动作空间能够更准确地建立对应关系。GENE-26.5把手套数据中的高保真手部运动和触觉信号作为其人类数据引擎的一部分。
数据采集的价值在于,当一个人戴着这样的手套拿起物体、拧瓶盖或者操作工具时,人仍然可以按照比较自然的方式完成动作。与此同时,他的手正在被“数字化”。手指在哪里,关节怎样运动,什么时候发生接触,接触在哪里,触觉信号如何变化,这些信息在同一个时间轴上准确对应和记录。
一次原本稍纵即逝的人类操作,由此变成一段可以保存、分析和反复用于模型训练的数据。
05 所以,一副几万元的手套,真实的价值是什么? 现在,我们回到文章开头的问题。一双数据采集手套,为什么价值几万元?因为数据采集手套本质上是一套穿戴式精密测量和数据采集系统。
真正需要关注的,不是里面用了什么材料,而是它能不能准确记录手的运动?能不能稳定记录接触?不同信号能不能严格同步?长期工作时数据是否稳定一致?产生的数据最终能不能被模型有效利用?
客户真正购买的并不只是硬件本身。更重要的是生产高质量机器人训练数据的能力。这像是评估一台工业设备,我们不会只问一台设备用了多少公斤钢材,而会问:它生产什么样的产品?一天能生产多少产品?精度是多少?是否能够稳定工作?
对于数据采集设备,更有意义的问题是:获得一小时“有效训练数据”,到底需要付出多少成本?在传统真机遥操作中,数据生产往往与机器人本体强绑定:采集人员需要占用机器人系统,并按照机器人的运动能力完成操作。而以人为中心的数据采集,可以在一定程度上把“采数据”与昂贵的机器人硬件解耦。人可以直接在真实工作场景中完成任务,同时记录视觉、手部位姿乃至触觉信息。
把总投入除以采到的数据量之后,你会发现一个反直觉的结论:在具身智能的数据账本上,几万元一双的手套,是最便宜的那一项。它贵在单价,便宜在单位成本。这也是为什么,今天愿意为它掏钱的公司越来越多。
一双数据采集手套的核心,不是布料和传感器,而是把现实世界里人的操作经验,持续变成AI训练数据的能力。
06 为什么福莱能把人的“手感”教给机器人? 还有一个关键问题:人的手,和机器人的手,根本不是一回事。人戴着手套捏起一颗鸡蛋,记录下一组触觉信号。机器人如果直接照着这组数据执行,凭什么就不会把鸡蛋捏碎?
人的手和机器人的手,在尺寸、结构、材料和接触方式上都不同;传感器的位置、量程和灵敏度,也不同。所以,人手数据传给机器人,中间一定需要“翻译”。
文字的翻译,不可避免会出现信息损失。把一份中文菜谱翻译成另一种语言,菜名可能还在,步骤也可能还在,但火候、手法和口感这些决定结果的细节,很容易在翻译过程中损失。人类数据迁移到机器人时,也会产生信息损失。
减少这种翻译损失,一个重要办法,就是让两端从一开始就尽可能接近。我们把这种思路称为“同源同构”:人的手 → 数据采集手套 → 机器人灵巧手。在几何结构和触觉感知上,尽可能建立对应关系。
这恰恰是福莱的一个重要优势。过去几年,福莱已经为市面上多款主流灵巧手提供触觉传感方案,并实现批量应用。我们不仅懂触觉传感本身,也长期在解决机器人指尖、指腹、掌心应该在哪里布置触觉,需要什么量程、灵敏度和响应特性等具体问题。
数据手套端和机器人端的触觉如果由同一套技术体系设计,两边就不是彼此陌生的“黑盒”。手套上的触觉怎么设计,机器人手上的触觉是什么特性,福莱对两端都有深入的认知。甚至在设计时,可以同时考虑两边的传感位置、量程、灵敏度和响应特性,让它们尽可能接近、尽可能对应。这样,人手上某个位置采到的接触信息,在机器人手上就更容易找到相应的感知区域和信号。两端越接近,需要跨越的数据鸿沟就越小,人手最重要的触觉信息,也越有机会被完整地传递到机器人这一端。
2026年5月,福莱推出了触觉数据采集手套,把机器人端长期积累的触觉传感能力向数据采集延伸。
仅有触觉还不够。机器人不仅要知道“这里产生了力”,还要知道在同一个瞬间,人的哪根手指在哪里、是什么姿态。因此,2026年8月,福莱与灏存科技合作,推出兼具“手部位姿+触觉”的数据采集手套。 2026年8月,福莱与灏存科技合作推出融合手部位姿与触觉感知的数据采集手套
福莱带来的是对触觉传感的长期积累,灏存带来的是手部位姿采集能力。两者结合以后,我们希望记录的,就不再只是“人的手怎么动。”而是“人的手在运动过程中,究竟是怎样与物体发生接触的。”我们想采集的不只是“人的动作”,而是:“人手的经验和技能。” 人佩戴福莱数据采集手套进行操作时,系统同步记录手部位姿 与触觉信号
07 当人类的“手感”开始被记录 技术史上,很多重要的变化,都始于一种新的信息被记录下来。
文字记录语言,录音记录声音,相机记录影像。
数据采集手套正在记录一种新的信息:人类双手与世界互动的经验和技能。
一双手,是几百万年进化的结果;使用这双手的无数技能,则来自几千年文明的积累。
当这些经验和技能第一次能够被数字化,一个新的可能性也随之出现。
我们开始把这些技能,教给机器人。
*本文作者:福莱新材首席科学家 陈书厅博士
2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!
扫码关注公众号,底部菜单申请进群


