机器人换个触觉传感器就变傻:3000 小时数据训出的“通用手感”,没见过的硬件也涨 31.6%

FTP-1:全球第一个"通用触觉基础策略"。清华、上海期智研究院、Sharpa、上海交大等团队把 21 种触觉传感器、约 3000 小时数据塞进一个模型——见过的传感器涨 17.2%,完全没见过的传感器涨 31.6%。论文已被 CoRL 2026 接收。

一个机器人学会了拧瓶盖、插 USB、擦盘子。然后你给它换了一块触觉传感器——它的"手感"就全丢了,动作开始发抖、按压失力、插入对不准,得从头再训一遍。

这不是假设,而是触觉机器人领域的常态。视觉大模型已经能跨摄像头、跨机器人泛化,触觉却始终被锁死在"一个传感器配一套模型"的格子里。原因很直白:触觉信号太杂了——有的是一张凝胶形变图像,有的是一排压力数值,有的是六维力读数,分辨率、形态、响应特性全不一样,就像每种传感器都在说自己的方言。

清华大学、上海期智研究院、Sharpa、上海交通大学、UC Berkeley、ETH Zurich 等机构联合提出的 FTP-1(Foundation Tactile Policy),第一次尝试打破这堵墙。

图1|FTP-1 的整体架构:图像型、阵列型、状态型三类触觉信号先经各自的异构编码器,投影成统一的"功能区域 token",再由一个独立的 300M 参数触觉 Transformer 专家统一处理,与视觉-语言专家、动作专家协同输出动作|图源:Yuan C. et al., CoRL, 2026,Fig. 2

关注我,你将持续得到:每周拆解一篇顶刊 AI 论文,用普通人能听懂的话,讲清楚机器是怎么"看"和"想"的。

一、给 21 种触觉信号定一套"通用语法"

FTP-1 的第一个关键设计叫 MTTS(Morphology-Aware Tactile Token Space,形态感知触觉 token 空间)

思路很像给人手做解剖学分区:不管你用的是哪种传感器,先把它的信号按"长在哪个部位、负责什么功能"归类。论文定义了 24 个功能槽位

  • 0 到 14 号:手上的 15 个功能区域,比如拇指尖、食指尖、掌心;
  • 15 到 20 号:手腕和手指上的力/力矩信号;
  • 21 到 23 号:先留空,给未来的传感器。

平行夹爪只有两个接触面,论文把它们映射到"拇指尖"和"食指尖"——功能上,夹爪就是在做两指捏取。每个 token 还会加上一个可学习的功能区编码,告诉模型"这个信号来自哪个部位",左右手用不同编码区分。这样一来,GelSight 的图像和 Contactile 的阵列,只要都来自"食指尖",就会被塞进同一个槽位,说同一种语言。

二、三种触觉,三套编码器

光有统一接口还不够,原始信号的形状和模态天差地别。FTP-1 用异构编码器分头处理:

  • 图像型(如 GelSight、Sharpa DTC):先过一个轻量的传感器专属 ViT,再接一个所有传感器共享的预训练 T3 Transformer,取最后的 CLS token 作为触觉 token;
  • 阵列型(如 Contactile、uSkin):用 CNN 抓空间结构,把每个功能区域压成一个 token;
  • 状态型(如六维力/力矩):先做傅里叶编码,再用一个三层 ReLU MLP 映射。

同一个传感器如果有多个形状相同的功能区,就共享同一个编码器——既省参数,也逼着模型去学这些区域共通的触觉动力学。

三、为什么不让触觉直接进大模型?

这是论文里最有意思的一个设计选择。

此前不少触觉 VLA 的做法是:加个轻量适配器,把触觉 token 塞进已经预训练好的视觉-语言模型里。听起来省事,FTP-1 却特意开了一条独立的触觉通道——一个 300M 参数的 Transformer 触觉专家,专门处理触觉 token;动作专家会去"看"触觉专家的输出,但触觉专家不反过来关注动作。

这么做有三个好处:换到没见过的传感器时,这个预训练好的触觉专家可以直接复用;不去扰动已经学好的视觉-语言知识;处理效率也更高。

数据支持这个选择。在真机实验里,把触觉直接注入视觉-语言模型的 Tactile-VLA 平均成功率只有 35.8%,反而低于完全没有触觉输入的 π0.5(45.3%)——加错位置的触觉,比不加更糟。而 FTP-1 拿到了 62.5%

论文还试过更复杂的 MoE 融合方案,没拿到一致收益,最后用了最简单的多专家结构。另一个插曲是优化器:Muon 收敛更快、离线误差更低,但真机泛化反而变差,最终选了 AdamW。这些"失败实验"往往比成功更值得看。

四、3000 小时、21 种传感器的数据家底

图2|FTP-1 预训练数据集构成:26 个数据源、21 种触觉传感器(7 图像型 / 5 阵列型 / 9 状态型),约 3000 小时;重采样后人手数据占 20%、灵巧手 30%、夹爪 50%|图源:Yuan C. et al., CoRL, 2026,Fig. 4

要训出能迁移的触觉能力,得先有足够杂的数据。团队聚合了 26 个数据源,覆盖 21 种触觉传感器,总计约 3000 小时操作数据,既有机器人演示,也有戴触觉手套采集的人类演示。团队还新采集了一个 Sharpa North-FTP-1 数据集,包含约 4000 条长程灵巧操作演示。

不同数据源规模差异极大,所以他们按来源调整采样比例,最终混合成人手 20%、灵巧手 30%、夹爪 50%。训练上,预训练在 48 张 NVIDIA H20 上跑 5 万步、全局批量 768;下游微调用 8 张 A800、2 万步。论文提到 5 万步之后性能就饱和了,推测是触觉数据的多样性还不够。

五、见过的 +17.2%,没见过的 +31.6%

图3|两个"未见过"的传感器测试台:FlexivXense(Xense 图像型触觉,做 Insert Hanoi 和 Insert USB)与 TactileUMI(Contactile 阵列型触觉,做 Wipe Board)|图源:Yuan C. et al., CoRL, 2026,Fig. 6

最硬的一组数字在这里。团队把预训练好的模型分发给 5 家机构,各自在完全不同的硬件上微调,共 14 个任务。

预训练见过的传感器(GelSight-Mini、Sharpa DTC):仿真 UniVTAC 基准上 FTP-1 平均成功率 66.66%,比最好的基线高出约 17.5 个百分点;真机上 62.5%,比 π0.5 的 45.3% 高 17.2 个百分点。

完全没见过的传感器:这才是真正的考验。两个新机构、两套新硬件——FlexivXense(Xense 图像型)和 TactileUMI(Contactile 阵列型)。此时传感器专属编码器要从头训练,只能复用共享的触觉专家、T3 Transformer 和功能区编码。

方法
Insert Hanoi
Insert USB
Wipe Board
平均
π0.5(无触觉)
25
0
20
15.0
Tactile-VLA
0
10
15
8.3
FTP-π0.5(同架构无预训练)
5
10
30
15.0
FTP-1 55 30 55 46.6

数据来自 Yuan C. et al., CoRL 2026, Table 3

46.6% 对 15.0%,涨了 31.6 个百分点。没触觉的 π0.5 和"有触觉架构但没预训练"的 FTP-π0.5 打平——说明光加一条触觉分支没用,关键是这条分支里得有预训练出来的真本事。

论文还记录了一个细节:插汉诺塔时,如果圆片没对准柱子,FTP-1 会根据触觉反馈主动放慢插入速度,而 π0.5 不会,经常直接顶歪失败。这种"手感带来的反应式控制",正是预训练最值钱的部分。

六、涨点真的来自"触觉知识"吗?

这里有个合理的质疑:会不会只是因为预训练数据碰巧更接近下游任务分布,微调变简单了而已?

团队做了一个干净的对照:训一个 NTP-1 检查点——用完全相同的预训练数据、相同的优化设置、相同的架构,只是把触觉输入和触觉相关模块全部去掉。微调时再加回同样的触觉结构。

图4|FTP-1 与 NTP-1 的对比。NTP-1 使用相同数据与架构预训练,但全程不含触觉|图源:Yuan C. et al., CoRL, 2026,Fig. 7

结果:在见过的 UniVTAC 上,NTP-1 拿到 50.0%,确实比 FTP-π0.5(45.16%)好——数据分布的帮助是真的;但它仍明显低于 FTP-1 的 66.66%。而在没见过的 FlexivXense 上,FTP-1 比 NTP-1 高出 37.5 个百分点,差距悬殊。

结论很清楚:触觉预训练带来的可迁移知识,是涨点的主要来源,不只是数据分布恰好对味。

七、这事儿为什么重要

机器人领域这几年反复验证了一个范式:大规模预训练 + 下游微调。视觉端早已跑通——π0、GR00T、OpenVLA 都走这条路。但触觉一直缺席,因为硬件碎片化太严重,谁也攒不出覆盖所有传感器的数据集。

FTP-1 的价值不在于把某个任务刷到了多高的成功率,而在于它证明了:触觉也可以有"基础模型"。它给出了一个共享的模型级起点——以后做触觉策略,不必再从零开始,可以站在这个预训练权重上继续走。

作者也很坦诚地写了局限:目前主要解决触觉感知,还没触及基于触觉或力反馈的伺服控制;预训练数据的规模和多样性仍然有限。

从"一个传感器一套模型",到"一套模型适配几十种传感器"——这条路 FTP-1 走出了第一步。机器人的"手感",第一次有了通用的可能。

论文信息:Yuan C., Zhang Z., Zhou M. et al., FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation, CoRL, 2026。第一作者袁成博(共同一作张自成、周明杰),通讯作者杨高,来自清华大学、上海期智研究院、Sharpa、上海交通大学等机构。

来源:https://mp.weixin.qq.com/s/XMzVYCenOjHGqhY2CzJXSg

2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!

扫码关注公众号,底部菜单申请进群

作者 ab, 808