拧个瓶盖就暴露了机器人的“通病”:不是手笨,是缺这种预判能力
导语:你有没有注意过一个细节?你拧瓶盖的时候,根本不需要看。手指摸到螺纹那一刻,你就知道“对上了没”,力道稍不对,你会本能地调整角度。整个过程,眼睛是多余的——全靠手感。但机器人不行。现在的机器人做这类接触密集的操作,基本就是“盲摸”——眼睛看着大概位置,手伸过去,能不能成功全靠运气。换个角度、换个高度、换个瓶子,成功率直接腰斩。为什么?因为它们缺少一种人类习以为常的能力:在摸到之前,就已经“预判”了接下来会发生什么。
一、视觉神话的裂缝:为什么VLA在“使劲”时掉链子?
过去几年,机器人操作领域最火的方向是VLA(视觉-语言-动作模型)。让机器人“看一眼就知道怎么做”——抓杯子、拿盒子,看起来有模有样。
但一碰到需要持续感知力道变化的任务,这套范式的裂缝就暴露了。
拧瓶盖需要感知螺纹阻力的实时变化;插线缆需要感觉到“卡进了没有”;擦桌子需要控制下压力道。这些任务的共同点是:成功与否不取决于你看到了什么,而取决于你感受到了什么。 光看,根本不够。
有人想到加传感器。在机器人手指上装触觉传感器,就像给人装上皮肤。这条路方向没错,但立刻遇到第二个问题:传感器给了你一帧一帧的数据,你怎么用?
最直接的做法是把触觉数据和视觉“一锅炖”——拼在一起喂给策略网络。结果呢?效果平平。
根本原因在于:力觉和触觉的信息节奏完全不同。 手腕上的力/力矩传感器以120Hz高频采集,反映的是“整体受力趋势”——就像开车时感受到的推背感。手指上的触觉传感器以30Hz采集,捕捉的是“局部接触细节”——就像方向盘传来的路感。一个是宏观,一个是微观;一个是高频,一个是低频。把它们混在一起不加区分,就像让听交响乐的人同时看五线谱——信息量太大,反而抓不住重点。
二、换个思路:让力给触觉“打前站”
来自TARS Robotics、新加坡国立大学、上海交通大学、中科院和复旦大学的研究者,在一篇题为《TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation》的论文中,提出了一个截然不同的思路。
不让力和触觉“并排走”,而是让力先探路,触觉再跟上。
想象你在黑暗中摸索一个门把手。手还没碰到,但手臂已经感受到了运动轨迹的变化——你的大脑会预判:“快碰到了,准备好抓握。”
TacForeSight做的就是类似的事。整套系统分成两步:
第一步:用“力”建一个触觉预言机
手腕力/力矩传感器的120Hz高频数据,被用来训练一个轻量级世界模型——TacForceWM。这个模型只有11.8M参数,用Transformer架构,任务很专一:给定力信号,预测接下来手指会感受到什么样的触觉。
注意,它预测的不是触觉原始图像,而是压缩后的“潜空间”表示。这样计算量小、速度快。就像一个老司机,方向盘还没动,他已经知道车会往哪偏。
第二步:用“预判”指导动作
有了预测的触觉信息,策略网络就不再是“摸到再反应”,而是“还没摸到就准备好了”。
这里有两个精妙的设计:
交叉注意力机制:让当前真实触觉和预测的未来触觉在潜空间里“对话”。机器人同时知道“现在摸到什么”和“接下来会摸到什么”。
自适应视觉-触觉门控:一个可学习的门控机制,动态决定这一刻该更相信眼睛还是手感。有些阶段需要视觉主导(对准位置),有些阶段需要触觉主导(拧入螺纹)。让网络自己学“什么时候听谁的”,比人为规定强得多。
三、真能拧瓶盖了,而且不怕变化
研究者没有只测标准场景。每个任务都加了“扰动”测试——故意改变高度、角度、位置,模拟真实世界中“瓶子没放在同一个地方”的情况。
实验涉及5个典型的“靠手感”任务:
|
任务 |
核心难点 |
|---|---|
|
花瓶擦拭 |
持续接触,控制下压力 |
|
卡片刷卡 |
精确角度插入 |
|
管路调整+插入 |
多步骤衔接 |
|
灯泡插入+旋转 |
螺纹对齐 |
|
线缆插入 |
软线穿孔,线缆会变形 |
结果非常有说服力:
与现有方法的对比,差距是碾压级的:
|
方法 |
核心思路 |
标准场景 |
扰动场景 |
|---|---|---|---|
|
DP |
纯视觉扩散策略 |
32% |
0% |
|
DP+触觉+力 |
一锅炖 |
37% |
20% |
|
KineDex |
触觉+运动学 |
33% |
2% |
|
FoAR |
力+触觉融合 |
36% |
18% |
|
RDP |
动力学+触觉 |
43% |
33% |
| TacForeSight |
力预判触觉 |
79% | 87% |
一个反直觉的细节尤其值得注意:扰动场景下的平均成功率(86.7%)反而高于标准场景(79%)。
这恰好证明了“手感”的不可替代性。当位置变了,纯视觉方案立刻失效(DP从32%跌到0%),但有力觉预判的方案反而能更好地适应——因为扰动让任务更依赖力反馈而非视觉记忆。环境越不确定,力觉的价值越凸显。
四、拆开看:哪个组件最关键?
论文的消融实验直接回答了“这个系统里到底哪个部分在真正起作用”:
|
拆掉什么 |
标准擦拭 |
扰动擦拭 |
扰动刷卡 |
|---|---|---|---|
|
不用力信号 |
70% |
50% |
75% |
|
不用预测触觉 |
65% |
15% | 15% |
|
不用交叉注意力 |
100% |
65% |
0% |
|
不用自适应门控 |
90% |
65% |
75% |
| 完整版 | 100% | 85% | 90% |
“不用预测触觉”的破坏力最大:扰动场景下的擦拭从85%直接跌到15%。这确凿地证实了论文的核心论点——让机器人“提前知道”即将发生什么,远比“摸到了再反应”重要得多。 缺少这个预判能力,整个系统的鲁棒性就崩溃了。
另一个有趣的发现来自“不用力信号”:标准场景下降不多,但扰动场景反而更差。这说明力信号在视觉失效时是最关键的救命稻草。
世界模型预言力:力信号完胜视觉
研究者还做了一个非常直观的对比实验:用不同类型的信号作为世界模型的条件输入,看谁的触觉预测最准确。
|
条件信号 |
MSE↓ |
余弦相似度↑ |
KL散度↓ |
|---|---|---|---|
|
无条件 |
0.027 |
0.954 |
0.014 |
|
RGB图像 |
0.025 |
0.973 |
0.013 |
|
机器人状态 |
0.022 |
0.975 |
0.011 |
| 手腕力/力矩 | 0.017 | 0.992 | 0.009 |
手腕力/力矩信号在所有指标上都碾压了其他条件。这很符合直觉:力的变化最直接地预示着接触状态的变化,比视觉或关节角度都更“即时”。就像你蒙着眼睛用手摸东西,手臂传来的推力感比任何画面都更能告诉你接下来会感受到什么。
五、更大的图景:从“被动应激”到“主动预判”
TacForeSight的核心贡献,不只是“在系统里加了个力传感器”这么简单。
它提出了一种范式转变:从“摸到了→反应”变成“还没摸到→预判→提前准备”。
这个转变看似微小,但意义深远——就像从“被动应激”变成了“主动规划”。在具身智能领域,行业投入了大量精力让模型“看更多、学更多”,但TacForeSight揭示了一条被忽视的路径:让机器人利用已有的高频力信号,在内部构建接触预测能力,而不是等触觉来了再手忙脚乱。
这个思路对自动驾驶也有启发:车上的IMU、轮速传感器、悬架压力——这些“力觉”信号能不能用来预判摄像头即将看到什么?在恶劣天气或传感器故障时,用“手感”代替“视觉”,可能比多装几个摄像头更靠谱。
当然,目前的工作也有边界:训练需要2700个episode的力-触觉交互数据,采集成本对没有合适硬件的小团队是个门槛;只在一种机器人(UFactory xArm7 + Robotiq夹爪)上验证过;传感器绑定特定配置,换了可能需要重新训练。但这些边界恰恰是下一步研究可以突破的方向。
六、结语
当你拧开下一个瓶盖时,可以留意一下——你的手在摸到瓶盖之前,其实就已经“知道”接下来会发生什么了。
这不是玄学。是你手臂上的力感受器提前向大脑发送了信号,大脑提前准备好了抓握策略和力道控制。整个过程中,视觉只是辅助,不是主角。
过去机器人缺的,正是这种“力觉预判”能力。它们要么纯靠视觉硬猜,要么把各种传感器信息混在一起不加区分。TacForeSight的启示是:力觉和触觉不该是平起平坐的伙伴,而应该有力觉做前锋、触觉做主攻。
对机器人来说,学会“摸到之前就准备好”,或许是比学会“看”更重要的一课。
论文信息
-
标题:TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation
-
作者:Yujie Zang, Yuhang Zheng, Xian Nie等
-
机构:TARS Robotics, 新加坡国立大学, 上海交通大学, 中科院, 复旦大学
-
链接:https://arxiv.org/abs/2606.11184
更多推荐





所有评论(0)