导语:你有没有注意过一个细节?你拧瓶盖的时候,根本不需要看。手指摸到螺纹那一刻,你就知道“对上了没”,力道稍不对,你会本能地调整角度。整个过程,眼睛是多余的——全靠手感。但机器人不行。现在的机器人做这类接触密集的操作,基本就是“盲摸”——眼睛看着大概位置,手伸过去,能不能成功全靠运气。换个角度、换个高度、换个瓶子,成功率直接腰斩。为什么?因为它们缺少一种人类习以为常的能力:在摸到之前,就已经“预判”了接下来会发生什么。

一、视觉神话的裂缝:为什么VLA在“使劲”时掉链子?

过去几年,机器人操作领域最火的方向是VLA(视觉-语言-动作模型)。让机器人“看一眼就知道怎么做”——抓杯子、拿盒子,看起来有模有样。

但一碰到需要持续感知力道变化的任务,这套范式的裂缝就暴露了。

拧瓶盖需要感知螺纹阻力的实时变化;插线缆需要感觉到“卡进了没有”;擦桌子需要控制下压力道。这些任务的共同点是:成功与否不取决于你看到了什么,而取决于你感受到了什么。 光看,根本不够。

有人想到加传感器。在机器人手指上装触觉传感器,就像给人装上皮肤。这条路方向没错,但立刻遇到第二个问题:传感器给了你一帧一帧的数据,你怎么用?

最直接的做法是把触觉数据和视觉“一锅炖”——拼在一起喂给策略网络。结果呢?效果平平。

根本原因在于:力觉和触觉的信息节奏完全不同。 手腕上的力/力矩传感器以120Hz高频采集,反映的是“整体受力趋势”——就像开车时感受到的推背感。手指上的触觉传感器以30Hz采集,捕捉的是“局部接触细节”——就像方向盘传来的路感。一个是宏观,一个是微观;一个是高频,一个是低频。把它们混在一起不加区分,就像让听交响乐的人同时看五线谱——信息量太大,反而抓不住重点。

二、换个思路:让力给触觉“打前站”

来自TARS Robotics、新加坡国立大学、上海交通大学、中科院和复旦大学的研究者,在一篇题为《TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation》的论文中,提出了一个截然不同的思路。

不让力和触觉“并排走”,而是让力先探路,触觉再跟上。

想象你在黑暗中摸索一个门把手。手还没碰到,但手臂已经感受到了运动轨迹的变化——你的大脑会预判:“快碰到了,准备好抓握。”

TacForeSight做的就是类似的事。整套系统分成两步:

第一步:用“力”建一个触觉预言机

手腕力/力矩传感器的120Hz高频数据,被用来训练一个轻量级世界模型——TacForceWM。这个模型只有11.8M参数,用Transformer架构,任务很专一:给定力信号,预测接下来手指会感受到什么样的触觉。

注意,它预测的不是触觉原始图像,而是压缩后的“潜空间”表示。这样计算量小、速度快。就像一个老司机,方向盘还没动,他已经知道车会往哪偏。

第二步:用“预判”指导动作

有了预测的触觉信息,策略网络就不再是“摸到再反应”,而是“还没摸到就准备好了”。

这里有两个精妙的设计:

交叉注意力机制:让当前真实触觉和预测的未来触觉在潜空间里“对话”。机器人同时知道“现在摸到什么”和“接下来会摸到什么”。

自适应视觉-触觉门控:一个可学习的门控机制,动态决定这一刻该更相信眼睛还是手感。有些阶段需要视觉主导(对准位置),有些阶段需要触觉主导(拧入螺纹)。让网络自己学“什么时候听谁的”,比人为规定强得多。

三、真能拧瓶盖了,而且不怕变化

研究者没有只测标准场景。每个任务都加了“扰动”测试——故意改变高度、角度、位置,模拟真实世界中“瓶子没放在同一个地方”的情况。

实验涉及5个典型的“靠手感”任务:

任务

核心难点

花瓶擦拭

持续接触,控制下压力

卡片刷卡

精确角度插入

管路调整+插入

多步骤衔接

灯泡插入+旋转

螺纹对齐

线缆插入

软线穿孔,线缆会变形

结果非常有说服力:

与现有方法的对比,差距是碾压级的:

方法

核心思路

标准场景

扰动场景

DP

纯视觉扩散策略

32%

0%

DP+触觉+力

一锅炖

37%

20%

KineDex

触觉+运动学

33%

2%

FoAR

力+触觉融合

36%

18%

RDP

动力学+触觉

43%

33%

TacForeSight

力预判触觉

79% 87%

一个反直觉的细节尤其值得注意:扰动场景下的平均成功率(86.7%)反而高于标准场景(79%)。

这恰好证明了“手感”的不可替代性。当位置变了,纯视觉方案立刻失效(DP从32%跌到0%),但有力觉预判的方案反而能更好地适应——因为扰动让任务更依赖力反馈而非视觉记忆。环境越不确定,力觉的价值越凸显。

四、拆开看:哪个组件最关键?

论文的消融实验直接回答了“这个系统里到底哪个部分在真正起作用”:

拆掉什么

标准擦拭

扰动擦拭

扰动刷卡

不用力信号

70%

50%

75%

不用预测触觉

65%

15% 15%

不用交叉注意力

100%

65%

0%

不用自适应门控

90%

65%

75%

完整版 100% 85% 90%

“不用预测触觉”的破坏力最大:扰动场景下的擦拭从85%直接跌到15%。这确凿地证实了论文的核心论点——让机器人“提前知道”即将发生什么,远比“摸到了再反应”重要得多。 缺少这个预判能力,整个系统的鲁棒性就崩溃了。

另一个有趣的发现来自“不用力信号”:标准场景下降不多,但扰动场景反而更差。这说明力信号在视觉失效时是最关键的救命稻草。

世界模型预言力:力信号完胜视觉

研究者还做了一个非常直观的对比实验:用不同类型的信号作为世界模型的条件输入,看谁的触觉预测最准确。

条件信号

MSE↓

余弦相似度↑

KL散度↓

无条件

0.027

0.954

0.014

RGB图像

0.025

0.973

0.013

机器人状态

0.022

0.975

0.011

手腕力/力矩 0.017 0.992 0.009

手腕力/力矩信号在所有指标上都碾压了其他条件。这很符合直觉:力的变化最直接地预示着接触状态的变化,比视觉或关节角度都更“即时”。就像你蒙着眼睛用手摸东西,手臂传来的推力感比任何画面都更能告诉你接下来会感受到什么。

五、更大的图景:从“被动应激”到“主动预判”

TacForeSight的核心贡献,不只是“在系统里加了个力传感器”这么简单。

它提出了一种范式转变:从“摸到了→反应”变成“还没摸到→预判→提前准备”。

这个转变看似微小,但意义深远——就像从“被动应激”变成了“主动规划”。在具身智能领域,行业投入了大量精力让模型“看更多、学更多”,但TacForeSight揭示了一条被忽视的路径:让机器人利用已有的高频力信号,在内部构建接触预测能力,而不是等触觉来了再手忙脚乱。

这个思路对自动驾驶也有启发:车上的IMU、轮速传感器、悬架压力——这些“力觉”信号能不能用来预判摄像头即将看到什么?在恶劣天气或传感器故障时,用“手感”代替“视觉”,可能比多装几个摄像头更靠谱。

当然,目前的工作也有边界:训练需要2700个episode的力-触觉交互数据,采集成本对没有合适硬件的小团队是个门槛;只在一种机器人(UFactory xArm7 + Robotiq夹爪)上验证过;传感器绑定特定配置,换了可能需要重新训练。但这些边界恰恰是下一步研究可以突破的方向。

六、结语

当你拧开下一个瓶盖时,可以留意一下——你的手在摸到瓶盖之前,其实就已经“知道”接下来会发生什么了。

这不是玄学。是你手臂上的力感受器提前向大脑发送了信号,大脑提前准备好了抓握策略和力道控制。整个过程中,视觉只是辅助,不是主角。

过去机器人缺的,正是这种“力觉预判”能力。它们要么纯靠视觉硬猜,要么把各种传感器信息混在一起不加区分。TacForeSight的启示是:力觉和触觉不该是平起平坐的伙伴,而应该有力觉做前锋、触觉做主攻。

对机器人来说,学会“摸到之前就准备好”,或许是比学会“看”更重要的一课。

论文信息

  • 标题:TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation

  • 作者:Yujie Zang, Yuhang Zheng, Xian Nie等

  • 机构:TARS Robotics, 新加坡国立大学, 上海交通大学, 中科院, 复旦大学

  • 链接:https://arxiv.org/abs/2606.11184

Logo

电影级数字人,免显卡端渲染SDK,十行代码即可调用,工业级demo免费开源下载!

更多推荐