
具身全光深度解析
随着人形机器人产业从行走验证阶段进入操作能力建设阶段,触觉感知已成为制约机器人落地应用的核心瓶颈。在现有触觉技术路线中,视触觉传感器(Vision-Based Tactile Sensor)因超高分辨率与多模态信息输出能力,成为产业关注度最高的方向。国内一目科技估值突破百亿元,戴盟机器人、千觉机器人、纬钛机器人、拾玥科技、汇光创新等企业相继完成融资,赛道持续升温。
本文系统梳理视触觉传感器的工作原理、技术演进路径、主流变体的异同、固有局限与核心优势,并对其未来发展方向及产业价值进行分析。
一、基本原理
弹性体形变与光学成像的结合
1.1 核心架构
视触觉传感器的基本结构由三层核心组件构成:透明弹性体(通常为硅胶)、反光涂层或标记层、以及内置微型摄像头与LED照明模块。其工作机制为:当物体接触弹性体表面时,弹性体产生形变,涂层或标记层随之发生位移或光影变化;摄像头从背面采集形变图像,经算法处理后还原为三维形貌、压力分布及剪切力等触觉信息。
该架构无需在接触面布设电极阵列,亦无需大量独立导线,仅通过单一摄像头即可实现高密度触觉信息采集。

图1:视触觉传感器基本原理——接触、形变、成像三步完成触觉信息采集
1.2 工作流程
接触阶段:物体与弹性体表面接触,弹性体因受压产生局部凹陷,凹陷的几何形态与物体表面形状及施加力的大小直接相关。
形变阶段:弹性体背面的反光涂层或标记层随基体同步变形,原平整表面转化为包含高度梯度信息的微结构,完整记录接触面的拓扑变化。
成像阶段:内置LED以特定角度照射形变表面,不同倾角区域反射不同亮度或色光的信号;摄像头采集该光影图像后,通过光度立体法或标记点追踪算法重建三维形貌与力学分布。
1.3 范式特征
视触觉传感器的核心创新在于将力学测量问题转化为图像处理问题。传统触觉传感器需在每个传感单元配置独立电极与导线,而视触觉方案以摄像头的数百万像素同时充当虚拟传感单元,实现了传感密度与布线复杂度的解耦。这一范式转换是其后续各项技术优势与局限的根本来源。
二、技术独特性
与传统电类触觉方案的本质差异
2.1 传统电类方案的布线瓶颈
压阻式、电容式及压电式等传统触觉传感器,均采用电极阵列架构:每个电极为一个独立传感点,需通过单独导线连接至采集电路。该架构存在固有矛盾——空间分辨率的提升要求增加电极数量,进而导致导线数量同步增长。以100×100阵列为例,需布设约一万根导线,在机器人指尖的有限空间内难以实现。受此制约,传统电类触觉传感器的空间分辨率长期维持在每平方厘米约100个触点的水平。
Traditional tactileVisuotactilemany wiresone camera图2:传统传感器需大量独立导线,视触觉方案仅需单一摄像头与数据线
2.2 虚拟传感阵列机制
视触觉方案通过将接触面转化为可成像的形变介质,以摄像头像素作为虚拟传感单元,彻底规避了布线瓶颈。以320×240分辨率为例,单帧图像即可提供76800个采样点,且所有像素数据通过单一数据线输出。分辨率的提升仅依赖摄像头规格,与布线复杂度无关。
这一机制的核心价值在于:传感密度与布线复杂度实现了完全解耦。传统方案中二者呈线性绑定关系,视触觉方案中二者相互独立。
2.3 数据格式差异
传统电类传感器输出离散数值信号,由各点测量值组成稀疏矩阵;视触觉传感器输出标准图像格式,包含形貌、纹理、梯度等丰富的空间信息。

图3:传统传感器输出稀疏离散信号,视触觉输出密集图像,可直接接入视觉模型
在当前具身智能以VLA(视觉-语言-动作)模型为主流架构的背景下,图像格式的触觉数据可与外部视觉图像共享同一编码器,无需额外的信号转换层。传统离散信号则需经过专门的编码模块方可接入神经网络,增加了系统复杂度与开发成本。
综上,视触觉传感器是现有方案中唯一以摄像头作为传感阵列的技术路线,在空间分辨率、布线复杂度及AI模型适配性三个维度上,与传统电类方案存在代际差异。
三、技术演进与主流变体
2009年至今,从桌面级设备到四大技术流派

图4:视触觉传感器技术演进时间线
3.1 初代技术(2009):GelSight
2009年,麻省理工学院Edward Adelson教授与Micah Kimo Johnson提出GelSight方案。该技术最初被命名为"逆图形传感器"(retrographic sensor),其核心目标为通过光学方法逆向重建接触面的三维形貌。初代产品体积约为易拉罐大小,主要应用于桌面级高精度表面测量,分辨率达到微米级,超越人类指尖触觉分辨率。2011年,GelSight Inc.自MIT分拆,启动商业化进程。
3.2 小型化阶段(2014):Fingertip GelSight
2014年,MIT团队推出Fingertip GelSight,将传感器尺寸缩减至可集成于机器人指尖的规格,分辨率维持在10微米级。该成果首次验证了视触觉传感器在机器人精细操作中的可行性,相关演示包括USB接口插入等任务,推动了该技术在机器人领域的学术研究。
3.3 开源与产业化拐点(2020):DIGIT
2020年,Meta AI实验室开源DIGIT传感器的完整硬件设计。该产品尺寸为20×27×18毫米,输出规格为320×240@60fps。开源显著降低了视触觉技术的研发门槛,推动全球实验室广泛采用该方案开展触觉研究。2021年,Meta与GelSight达成合作,由后者负责DIGIT的量产与商业化。
DIGIT采用标记点法替代GelSight传统的反光涂层加光度立体法方案,标志着视触觉技术开始分化出不同的实现路径。
3.4 四大主流变体
经过十余年发展,视触觉传感器已形成四大主流变体。各变体共享"弹性体形变加光学成像"的核心架构,但在照明方式与信号读取机制上存在显著差异。
变体一:反光涂层与光度立体法(代表:GelSight、GelSlim、GelTip)
该方案在弹性体背面涂覆不透明反光涂层,以红、绿、蓝三色LED从侧面低角度照射。不同倾角的表面反射不同色光,摄像头采集单帧RGB图像后,通过光度立体算法重建三维形貌。其优势为分辨率极高,可精确还原表面纹理;局限在于需配置三色LED系统,算法复杂度较高。

图5:反光涂层与光度立体法原理——RGB LED低角度照射,不同倾角反射不同色光
变体二:标记点法(代表:DIGIT、TacTip)
该方案在弹性体内表面印制规则排列的黑色圆点阵列。当弹性体受压力或剪切力作用时,标记点产生位移,算法通过追踪各点位移向量计算变形场:垂直位移对应法向力,水平位移对应剪切力与滑移。其优势为算法逻辑清晰、计算效率高、算力需求较低;局限为分辨率受标记点密度制约,纹理重建能力弱于光度立体法。

图6:标记点法原理——追踪圆点位移,垂直位移对应法向压力,水平位移对应剪切滑移
变体三:全内反射法(TIR-based)
该方案不涂覆反光涂层,直接采用透明弹性体。LED光从侧面入射,在弹性体内部以全内反射方式传播;当物体按压表面时,接触点的全内反射条件被打破,光线自接触点逸出,摄像头从下方采集到明亮的接触图案。其优势为结构简洁,可实现较薄的传感器厚度;局限为信息维度较低,主要输出接触区域与大致压力分布,精细形貌重建能力有限。
TIRTIRLEDContact breaks reflection图7:全内反射法原理——接触点打破全反射条件,形成明亮的接触图案
变体四:多目与360度感知(代表:OmniTact、DIGIT 360)
前述三种变体均为单目平面感知,仅覆盖指尖正面区域。在实际抓取任务中,物体可能接触手指侧面及整个指尖曲面。OmniTact采用5个微型内窥镜摄像头环绕指尖内部布置,实现多面同时感知;DIGIT 360则以超广角鱼眼镜头覆盖整个指尖曲面。其优势为实现全向触觉覆盖;局限为结构复杂、成本较高、标定难度较大。

图8:多目360度感知原理——多摄像头环绕布置覆盖指尖曲面

图9:四大变体对比——共享核心架构,照明与读取方式各异
3.5 变体异同归纳
共同特征:
· 均以弹性体(硅胶)作为接触介质
· 均通过光学成像读取形变信息
· 均输出图像格式的触觉数据
· 均需算法将图像还原为力学量与形貌信息
主要差异:
· 照明方式:RGB三色 / 单色 / 侧面入射
· 读取机制:反光涂层光影 / 标记点位移 / 全反射亮斑
· 信息维度:形貌加纹理 / 力加滑移 / 接触区域
· 覆盖范围:单平面 / 多面 / 360度曲面
· 算力需求:光度立体法较高 / 标记点法中等 / 全内反射法较低
四、固有局限
由基本架构决定的结构性约束
视触觉传感器的各项优势均源于"内置摄像头"这一基本架构,而该架构同时带来了若干结构性局限。这些局限并非单纯的工程优化问题,而是由物理原理与系统架构共同决定的。
4.1 体积约束
由于必须在弹性体后方配置摄像头及镜头,传感器厚度难以大幅缩减。传统柔性电子皮肤可实现1毫米以下厚度,以贴附方式集成于手指表面;视触觉传感器即便采用最薄方案(如汇光创新LIGHT TILE),厚度仍为3至4毫米,主流产品厚度在8至15毫米区间。

图10:体积约束——摄像头需占用手指内部空间,电子皮肤则可薄型贴附
在灵巧手设计中,指尖内部空间需容纳驱动电机、减速器、肌腱及关节等部件。厚度较大的传感器会显著挤压其他组件的布置空间,这也是当前视触觉传感器主要集中于指尖、难以扩展至全指及全掌的根本原因。
4.2 遮光要求
视触觉传感器依赖内部LED照明与摄像头成像,环境光干扰会直接影响测量精度。因此传感器外壳需具备遮光性能,接缝处需密封处理。这一要求增加了结构设计复杂度,同时限制了传感器外形设计的自由度。
4.3 弹性体老化与维护
硅胶作为粘弹性材料,存在迟滞与蠕变两种固有特性。迟滞指加载与卸载过程中形变曲线不重合,即相同作用力下压缩与回弹阶段的形变量存在差异;蠕变指在恒定压力作用下,形变随时间缓慢增大的现象。

图11:弹性体迟滞与蠕变特性——加载与卸载曲线不重合,恒力下形变缓慢增长
上述特性导致传感器零点随时间漂移,需定期重新标定。此外,硅胶表面在反复摩擦过程中会出现磨损、划伤及油污附着,直接影响成像质量。在工业应用场景中,硅胶套可能需每隔数周更换一次,维护成本较高。
4.4 算力与带宽需求
单台视触觉传感器以60fps输出320×240图像时,数据速率约为每秒14MB。五指灵巧手的总数据速率可达每秒70MB。这些图像需经实时处理,包括光度立体重建、标记点追踪、力估计及滑移检测等环节,各步骤均消耗计算资源。
在人形机器人系统中,算力资源需同时分配给视觉、语音及运动控制等模块,触觉图像处理进一步加剧了算力负担。标记点法的算力需求虽低于光度立体法,但相较仅输出离散数值的传统电类传感器,仍存在数量级差距。
4.5 其他局限
温度漂移:硅胶弹性模量随温度变化,不同环境温度下传感器灵敏度存在差异。
大压力饱和:当压力达到使弹性体完全压实的程度时,形变不再随压力增加,传感器进入饱和区,无法继续测量更大作用力。
标定复杂度:各传感器的硅胶厚度、涂层均匀性及摄像头位置存在微小差异,需逐个标定,量产一致性控制难度较大。
绝对力测量精度有限:视触觉传感器直接测量的是形变量,作用力需通过形变间接估算,其精度依赖标定质量与材料一致性。
五、核心优势
多项关键能力的同时满足
视触觉传感器的竞争力并非体现于单一性能指标的领先,而在于其同时满足了机器人触觉感知的多项关键需求。以下从七个维度进行分析。
5.1 超高空间分辨率
传统电类触觉传感器的感知密度约为每平方厘米100个触点,视触觉传感器可达每平方厘米约4万个单元,空间分辨率为25至50微米,二者相差约400倍。该分辨率已超越人类指尖约0.1毫米的触觉分辨率。

图12:触觉分辨率对比——视触觉感知密度约为传统方案的400倍
该分辨率使机器人能够感知物体表面纹理、刻字及微小凸起等传统方案无法检测的细节,在精密装配、材质识别及微小物体操作等场景中具有不可替代的价值。
5.2 多模态信息同步输出
传统传感器通常仅能输出一至两种信息,视触觉传感器可从单帧图像中同时提取三维表面形貌、法向压力分布、剪切力分布、滑移状态及表面纹理五类信息。上述信息源自同一传感器,天然具备时间同步与空间对齐特性。

图13:多模态输出——单帧图像同步提供形貌、法向力、剪切滑移及纹理信息
其中滑移检测对机器人稳定抓取尤为关键。当物体开始滑动时,标记点产生水平位移,视触觉传感器可在数毫秒内检测到该变化并触发抓力调整。传统方案实现同等功能需额外配置传感单元及复杂信号处理链路。
5.3 布线简洁
视触觉传感器仅需单一数据线即可输出全场触觉信息。在灵巧手设计中,手指关节需反复弯曲,导线数量直接影响系统可靠性与机械设计复杂度,简洁的布线方案具有显著工程优势。
5.4 抗电磁干扰
视触觉传感过程为纯光学机制,包括弹性体形变、LED照明及摄像头成像,不涉及电信号的直接测量,因此不受电磁干扰影响。在存在电机、变频器及焊接设备等强电磁源的工业环境中,传统电类传感器易出现信号噪声,视触觉方案则可稳定工作。
5.5 成本下降空间
视触觉传感器的核心组件为消费级微型摄像头、LED及硅胶,均为已实现大规模量产的成熟产品,基础成本较低。随着应用规模扩大,BOM成本有望降至百元级别。相较之下,高精度MEMS触觉传感器的成本下降空间较为有限。
5.6 AI原生适配
当前具身智能的主流模型架构为VLA(视觉-语言-动作)模型,其输入格式天然为图像。视触觉输出的触觉图像可与外部视觉图像共享同一编码器,无需额外的信号转换模块。触觉图像所包含的接触力、滑移及纹理信息,是外部视觉无法获取的物理交互数据,二者融合可显著提升模型对物理世界的理解能力。Figure等企业已开始将触觉信号直接接入控制模型。
5.7 数据资产价值
由于输出为标准图像格式,视触觉数据的采集、存储、标注及训练可直接复用计算机视觉领域的成熟工具链。在具身智能领域,高质量交互数据是模型训练的核心资产,视触觉传感器为触觉数据的规模化采集提供了可行路径。部分企业已将触觉数据作为核心业务方向,传感器硬件本身的盈利则居于次要位置。
六、发展趋势
从指尖感知到全掌覆盖,从单模态到AI原生

图14:未来发展方向——超薄化、全掌化、多模态融合及AI原生设计
6.1 超薄化
厚度是视触觉传感器当前最主要的工程瓶颈,亦是研发投入最集中的方向。现有最薄方案已达到3至4毫米,未来通过光纤导光、微透镜阵列及超薄CMOS等技术,厚度有望进一步压缩至2毫米以内。当厚度降至2毫米以下时,传感器可采用表面贴附方式集成,而非嵌入手指内部,从而显著拓展应用范围。
6.2 全掌覆盖
当前视触觉传感器主要集成于指尖,而实际抓取过程中指腹、指节及手掌均会与物体接触。未来的发展方向包括:以多个小型视触觉单元模块化拼接覆盖手部表面,或采用大面积柔性光学结构实现全掌感知。DIGIT 360与OmniTact等方案已在曲面覆盖方向进行探索。
6.3 多模态融合
人类皮肤可同时感知压力、温度、振动及湿度等多种信息。视触觉传感器当前以压力与形貌检测为主,未来将在弹性体中集成温度传感器、压电振动传感器及湿度传感器,构建多模态仿生皮肤。相关前沿研究已开始探索HapticVLM等多模态大模型架构。
6.4 AI原生设计
传统开发流程为传感器硬件先行、算法随后适配。AI原生设计则反向推进:根据AI模型的实际信息需求定义传感器规格。例如,若模型仅需接触区域与滑移信息,则可采用结构更简单、算力需求更低的全内反射方案,而非高分辨率光度立体法。戴盟机器人提出的VTLA(视觉-触觉-语言-动作)架构,即将触觉提升至与视觉同级的模态地位,实现从传感器到模型的端到端优化。
6.5 标准化与成本下探
当前视触觉行业尚未形成统一的接口标准与数据格式,各厂商产品输出规范不一,算法难以跨平台复用。随着产业成熟,统一的接口标准、标定流程及数据格式将逐步建立,传感器有望实现类似USB摄像头的即插即用体验。成本亦将从当前数千元级别降至数百元甚至更低。
七、产业价值与前景判断
基于技术特性的阶段性评估

图15:视触觉传感器为灵巧手提供高分辨率指尖感知能力
7.1 短期评估:指尖场景的最优方案
在未来2至3年内,机器人指尖场景下视触觉传感器为最优技术方案,暂无具备同等综合能力的替代路线。其核心依据为:现有技术中,视触觉是唯一可同时提供微米级分辨率、多模态信息输出、简洁布线及AI原生输入的方案。对于需执行精细操作的人形机器人指尖,视触觉感知已成为刚需配置。
7.2 中期评估:混合架构为可行路径
在3至5年周期内,视触觉传感器的覆盖范围将从指尖扩展至指腹与指节,但全掌覆盖仍受摄像头体积制约。更具可行性的方案为视触觉与柔性电子皮肤的混合架构:指尖采用视触觉传感器实现高精度感知,手掌及指背采用薄型电子皮肤实现大面积接触检测。二者为互补关系,而非替代关系。
7.3 长期评估:多技术融合为终局
5年以上周期内,机器人触觉系统将走向多技术融合:视触觉提供高分辨率形貌与力学信息,电子皮肤提供大面积覆盖与温度感知,压电传感器提供振动与滑移的高频响应。最终的机器人皮肤将类似人类皮肤,为多种传感机制的复合体,而非单一技术路线的垄断。
7.4 产业关注度的驱动因素
视触觉传感器获得大量企业与资本关注,可归结为以下五方面因素:
其一,操作能力是人形机器人的核心价值。行走能力仅为基础功能,操作能力决定机器人的实际应用范围。触觉感知是操作能力的必要前提,缺乏触觉的机器人仅能依赖视觉进行开环抓取,稳定性与适应性均存在显著局限。
其二,视触觉的综合能力无替代方案。在现有技术路线中,视触觉是唯一可同时输出高精度形貌、多轴力及滑移信息的方案。其他路线或分辨率不足,或信息维度单一,或布线复杂度过高。
其三,AI原生适配构成时代红利。VLA模型的快速发展使图像输入的价值显著提升。视触觉输出的图像数据可直接接入大模型,传统传感器则需额外编码层。在AI驱动的具身智能浪潮中,与AI架构的兼容性本身即为核心竞争力。
其四,成本下降路径明确。核心组件均为消费级成熟产品,规模效应可快速推动成本下行,从万元级至千元级再至百元级的路径清晰。
其五,触觉数据具备资产价值。高质量交互数据是具身智能模型训练的核心资源,视触觉传感器为触觉数据的规模化采集提供了可行工具。数据与模型的长期价值可能超越硬件本身。
7.5 风险提示
视触觉传感器并非万能方案,其体积约束、弹性体老化及算力消耗等问题均为真实存在的工程挑战。当前产业仍处于早期阶段,量产一致性、长期可靠性及标准化等问题尚未完全解决。合理的预期为多种技术路线长期共存,各自在适配场景中发挥作用,而非单一路线的全面替代。
核心结论
视触觉传感器并非完美的触觉方案,却是当前唯一可在指尖场景同时提供超高分辨率、多模态信息及AI原生输入的技术路线。其优势与局限均由"内置摄像头"这一基本架构所决定。在人形机器人从行走验证迈向操作能力建设的关键阶段,视触觉传感器恰好契合了产业对高精度触觉感知的迫切需求,这是其获得广泛关注的根本原因。
参考来源:
· Johnson & Adelson, "GelSight: High-resolution tactile sensing", MIT, 2009
· Lambeta et al., "DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor", Meta AI, 2020
· "Classification of Vision-Based Tactile Sensors: A Review", arXiv, 2025
· 传感器专家网、36氪、界面新闻、钛媒体等行业报道
· 一目科技、戴盟机器人、纬钛机器人、汇光创新等企业公开资料
2025年,人形机器人产业迎来爆发拐点。特斯拉Optimus量产在即,华为、宇树等企业加速技术突破,行业正从“实验室研发”向“规模化落地”跃迁为打通产业链上下游协作壁垒,艾邦机器人正式组建"人形机器人全产业链交流群",覆盖金属材料、复合材料、传感器、电机、减速器等全硬件环节,助力企业精准对接资源、共享前沿技术!
扫码关注公众号,底部菜单申请进群


