机器人“手感”从何而来?触觉感知如何打通具身智能最后环节

机器人“手感”从何而来?触觉感知如何打通具身智能最后环节
李飞飞团队让机器人摸麻将、挤牙膏的消息初看像一段趣味视频细看却是一个信号机器人终于开始“有手感”了。过去我们见过太多机械臂精准搬运、分拣、焊接动作很标准但它们是“看不见”的更“摸不着”。它们靠预设点位和视觉定位执行任务一旦物体软一点、表面纹理浅一点、状态稍微不确定就容易翻车。摸麻将和挤牙膏恰好把这两类最典型的“不确定接触”摆到了台面上麻将需要靠触觉确认牌面牙膏需要靠触觉控制力度。这篇博客想聊清楚一个问题这种“手感”到底是怎么来的它突破的难点在哪里以及从演示到真实落地中间还隔着什么。1. 摸麻将和挤牙膏为什么是机器人操作的老大难1.1 机器人过去不是没有“手”而是没有“触觉”很多人提到机器人操作第一反应是机械臂的精度和自由度。比如六轴机械臂可以重复定位到 0.02 毫米听起来非常厉害。但这类高精度更多体现在“按固定轨迹移动到固定点位”这件事上。真实世界里物体不是每一件都摆在精确位置也不是每一件都很坚固。传统工业机械臂的工作模式可以理解成“盲人按照盲道走路”。它依靠示教器记录一系列路径点再靠视觉系统做粗略定位最后用末端执行器去夹取。整个过程里机械手本身并没有“感觉”——它不知道夹紧力是否合适不知道物体是否在滑动也不知道接触面是硬的还是软的。碰上刚性、规则、摆放整齐的零件这套系统可以稳定跑很久但碰上麻将牌、牙膏管这种状态不稳定的物体就会失效。麻将牌的难点在于视觉信息不等于全部信息。牌面可能反光、部分被遮挡、角度不对只靠相机很难在一瞬间判断出花色。人拿到一张牌时会用手指去摸一下确认牌面的凹凸纹理这个动作本质上是视觉之外的“二次确认”。机器人要模仿这种确认就必须在指尖或夹爪上安装触觉传感器实时感知接触力、压力分布、表面纹理。没有触觉机械手连“摸”这个动作都做不出来。牙膏管的难点则在于“软”和“变形”。传统抓取逻辑会先预设一个夹取力但牙膏管在受力后会被压缩夹得太紧会喷射夹得太松会滑落。更复杂的是挤牙膏的动作需要控制力度变化刚接触时轻轻压住然后逐渐增加压力挤出适量膏体后马上停止。这个过程中视觉只能看到牙膏管的外部形变但真正决定挤多快、多慢的是手与物体之间持续变化的接触力。1.2 麻将和牙膏一个考“辨识”一个考“力度”把摸麻将和挤牙膏放在一起恰好覆盖了机器人触觉感知的两类核心能力辨识与调控。摸麻将属于“触觉辨识”。它要求机器人能从接触信号中提取出足够区分性强的特征比如牌面的纹理、凹凸结构、边界形状。这个任务的难点不是“摸到”而是“摸完能判断”。触觉传感器采集到的压力分布数据可能包含大量噪声需要经过模型处理才能把“指尖的压力分布”映射成“这是麻将牌的九筒”。这种跨模态识别本质上和图像识别很像但输入数据从像素变成了力分布。挤牙膏属于“触觉调控”。它要求机器人根据实时反馈调整动作而不是一次性算好就执行。这里涉及力控、阻抗控制、速度规划等一堆底层问题。简单说机器人不能把“挤牙膏”当成一个开环动作它必须在挤的过程中不断感知压力变化随时决定要不要继续加力。这种能力已经接近人类做事时的“手感”了——你知道该用多大力气不是因为脑子里有个精确数值而是在接触过程中不断微调出来的。1.3 为什么“触觉”过去没有被认真对待一个很现实的原因触觉传感器一直没有像摄像头那样便宜、稳定、好用。摄像头可以大量部署图像数据可以用互联网图片来预训练触觉传感器则需要贴近物体、经受磨损而且每一家的数据格式还不统一。过去很多机器人团队宁愿在视觉上堆算力也不愿意碰触觉因为硬件贵、数据难标、模型难训练。还有一层原因是过去的机器人场景相对封闭。工厂里零件都固定好夹具都校准过视觉定位基本够用触觉更像锦上添花。但这两年机器人开始从工厂走向家庭、医院、门店要面对的是没摆好的麻将、各种软硬不一的日用品、随时可能滑动的杯子。这时候光靠视觉就不够了触觉才从“可选件”变成了“必选项”。2. 从“看得见”到“摸得着”触觉才是具身智能的隐藏拼图2.1 视觉告诉机器人“是什么”触觉告诉机器人“手感怎么样”过去几年的具身智能浪潮很大程度上被大模型推动了。视觉语言模型让机器人能理解图片里的物体、场景甚至能根据自然语言指令生成下一步动作。但这套逻辑里有一个巨大的空缺模型能认出牙膏但它不知道牙膏管捏起来是什么感觉模型能认出麻将牌但它不知道牌面的纹理有多深。换句话说智能体开始有了“眼睛”却还没有“皮肤”。把触觉补进来最大的变化不是多了一个传感器而是机器人的决策方式从“看一步做一步”变成了“边接触边确认”。例如机器人拿取牙膏视觉模型先定位牙膏管的位置和姿态这是第一步。到了真正捏住牙膏管的时候视觉已经不那么重要了真正起作用的是手指感受到的弹性和正在变化的压力。如果没有触觉反馈模型只能靠猜猜错了就会挤多、挤少或者打翻牙膏管。2.2 李飞飞团队这波操作真正动了哪块“奶酪”从公开演示看李飞飞团队这次展示的能力不是某一只机械手有多精巧而是一套“视觉语言模型 触觉感知 动作规划”的闭环系统。李飞飞过去做 ImageNet本质上是让计算机学会“看见”现在她转向具身智能重点变成了让智能体不仅能看见还能把视觉理解变成物理世界的行动。触觉在这个链条里扮演的角色是“最后几厘米的确认”。大模型可以告诉机器人“接下来要轻一点”但“轻到多少”必须靠触觉传感器来实时回答。这相当于给机器人装了一个“闭环最后一棒”。这套思路的高级之处在于它不试图用触觉数据替代所有感知而是把触觉安插在视觉最不可靠的环节。比如识别麻将牌视觉先给出候选类别触觉再通过纹理信息给出最终判断比如挤牙膏视觉先判断牙膏管的位置和朝向触觉再负责控制挤压力度。两种感知各司其职而不是简单叠加。2.3 关键不是“模拟人类”而是让机器人处理“非标准状态”有人可能会问让机器人摸麻将、挤牙膏是不是在刻意模仿人类我觉得不能这么理解。这类演示的真正价值是让机器人从“只能处理标准化物体”进化到“能处理非标准状态”。标准化物体意味着位置固定、形状固定、刚度固定。真实世界里的日用品几乎没有完全相同状态的牙膏管被挤掉一半管体已经凹陷麻将牌摆放角度偏了还带着反光。触觉让机器人面对这些“非标准状态”时不再需要穷举所有可能性。它可以像人类一样在接触中掌握物体当前的状态然后动态调整动作。这种能力恰恰是服务机器人在家庭和商业场景里大规模落地的前提。3. 重新理解“手感”从传感器信号到动作闭环3.1 触觉不是一种信号而是一组信号说到触觉很多人以为就是“压力大小”。实际上机器人所需要的触觉信息远不止一个力值。为了让你更直观地理解我把常见的触觉感知维度整理成了一张表感知类型典型传感器能获取的信息适合场景常见局限接触力六维力/力矩传感器三个方向力与力矩装配、打磨、力控只能感知整体受力无法知道接触面的细节分布压力分布阵列式触觉传感器接触区域的压力云图抓取判断、纹理识别空间分辨率有限数据格式不统一滑觉振动/摩擦传感器物体是否开始滑动抓取易滑物体容易受环境振动干扰接近觉电容/红外传感器物体靠近但未接触时的距离预抓取、避碰精度受材质影响软度/弹性仿生指尖传感器物体局部刚度、形变软物体操作、医疗标定复杂重复性有待提升从这张表能看出触觉并不是单一维度的信息而是“力 分布 滑动 时间序列”的组合。摸麻将更多依赖压力分布和纹理信息挤牙膏则需要实时力控和滑觉检测。任何一个维度缺失机器人都可能失去“手感”。3.2 从“摸一下”到“知道是什么”需要跨模态对齐触觉传感器返回的是高维的力分布序列模型不能直接把它变成“九筒”这个类别。这里就需要“跨模态对齐”视觉模型先给物体一个初步类别假设比如“这可能是张麻将牌”。触觉模型从压力分布中提取纹理特征比如“牌面有凹陷花纹中间有图案”。两个模态的特征被送进同一个分类或决策模块最终输出“这张牌是九筒”。这个过程看起来简单实际上非常依赖数据。视觉数据可以用互联网图片来预训练触觉数据却只能通过真实接触采集。采集一块麻将牌的纹理数据机器人可能要反复摸几百次每种材质、每种握持角度都会产生不同的压力分布。数据量不够跨模态对齐就很容易过拟合。3.3 真正难的是“摸的时候还要调整动作”如果只是“摸一下然后判断”这还是一个感知任务。但挤牙膏这样的任务要求机器人在接触过程中不断调整动作这就进入了“触觉闭环控制”的范畴。一个典型的触觉闭环流程可以简化成下面这个伪代码结构# 伪代码示例触觉引导的挤牙膏动作闭环 state initialize() while not task_done: tactile sensor.read() # 读取当前触觉信号 vision camera.read() # 读取当前视觉信号 state update_state(state, tactile, vision) # 更新物体状态 action policy.select_action(state) # 根据状态选择调整动作 robot.execute(action) # 执行微小调整 task_done check_finish(tactile) # 检查是否完成这里最关键的一步是update_state。机器人必须把连续变化的触觉信号变成对当前状态的估计比如“牙膏管已经被压缩了 2 毫米压力开始上升”然后再决定下一步是继续加大压力还是停止。这个逻辑听上去和 PID 控制有点像但难点在于状态空间非常复杂牙膏管哪种状态算正常触觉信号怎么和视觉画面对齐压力达到多少会导致爆管这些都需要模型去学习而不是简单设定一个阈值。3.4 为什么触觉的“Sim-to-Real”比视觉更难迁移很多做机器人强化学习的人习惯先在仿真环境里训练策略再迁移到真实机器人上。视觉任务里仿真图片可以和真实图片做风格迁移策略往往还能用。但触觉任务不一样仿真里的接触力、摩擦力、材料软硬度和现实差距很大。你在仿真里训练出来的“挤牙膏手感”到现实里碰到真实牙膏管传感器读数可能完全对不上。这也是为什么目前很多团队更倾向于“真机采集数据 预训练模型微调”。先让机器人做大量真实接触动作把采集到的触觉数据拿去训练或者微调一个基础模型然后再回到真实场景验证。这个方法比较慢但至少数据是真实分布。对大多数机器人团队来说不要一开始就指望仿真触觉模型能完美迁移到真机。4. 别高兴太早从演示到产品中间隔着“工程化”四个字4.1 能演示一次不等于能稳定跑一万次实验室里的机器人演示往往是在精心校准过的环境下完成的。传感器可能刚标定过物体的位置、材质、温度都刚好合适光照条件也很好。但真实产品需要考虑的是传感器会不会用久了有磨损线缆会不会因为频繁运动而接触不良物体从冰箱里拿出来和从柜子里拿出来温度不同会不会导致触觉信号漂移这些看起来不起眼的问题才是工程化的真正挑战。如果你准备在真实项目里引入触觉感知我的建议是先做一个“压力测试”。让同一套系统连续运行数百次统计成功率、失败模式、传感器漂移情况。不要只看一次演示效果要重点关注失败样本集中在哪个环节是感知判断错了还是执行动作超调了。4.2 触觉数据的采集和标注比视觉数据贵得多视觉数据可以爬虫、可以众包、可以公开数据集。触觉数据几乎只能一台真机、一个传感器、一个场景地采集。更麻烦的是标注视觉图像可以画框、打标签触觉信号怎么标注你得告诉模型“这个压力分布属于麻将九筒”这个过程高度依赖传感器分辨率主观性也更强。所以在启动一个触觉项目前先问自己一个问题这个任务是不是必须用触觉牌面识别能不能用高分辨率相机从多个角度拍照解决牙膏管能不能通过加一个固定夹具避免滑移如果视觉或机械结构方案能够解决 80% 的问题就不必急着上触觉。触觉应该用在视觉确实解决不了的场景里而不是作为一种炫技。4.3 触觉模型的评估不能只看准确率很多团队评估触觉模型时习惯看识别准确率或任务成功率。但实际操作场景里更重要的指标是“失败时的代价”。比如摸麻将识别错了损失也就是一张牌重来一次即可挤牙膏如果压力控制失效可能喷得到处都是。换句话说你需要评估的不是平均成功率而是最坏情况下的安全边界。我一般会建议团队为每个触觉任务建立“失效模式清单”机器人用力过猛会导致什么传感器信号丢失会导致什么模型给出错误判断的风险有多高只有在这些问题都明确之后触觉系统才可能进入真实场景。4.4 落地前的五步检查清单如果你看完上面的内容仍然觉得自己的项目需要触觉可以试试下面这个五步框架它会帮助你少走一些弯路。划定任务边界不要一开始就做一个“万能机器人”。先定义清楚要摸什么、要挤什么、场景里的物体范围是什么。边界越清晰数据采集和模型训练越容易。选对传感器根据任务选择压力分布、六维力、滑觉或接近觉。不要追求大而全。摸麻将优先要空间分辨率高的阵列触觉挤牙膏优先要力控响应快的传感器。设计数据采集流程规定好接触角度、力度范围、物体状态变化。尽量把各种边界情况都覆盖到比如牙膏管剩一小半的情况、麻将牌表面有水渍的情况。构建闭环策略不要把触觉当成“事后判断”要把它嵌入到控制回路里。让机器人能够根据触觉信号在线调整动作而不是摸完再决定下一步。小批量试运行与复盘先在真实场景里跑 50 次、100 次记录所有失败样本。分析失败原因是感知、控制还是硬件然后再迭代。4.5 什么人适合关注这类技术触觉感知不是所有项目都需要的。如果你是做固定工位的工业分拣物体规则、背景可控视觉抓取已经足够触觉可以先不碰如果你在做服务机器人、医疗辅助、复杂装配、老年人陪护或者任何需要与柔软、不确定、易损伤物体打交道的场景触觉就值得重点关注。从行业趋势看触觉感知会成为具身智能的下一个竞争点但它不会取代视觉。更准确的描述是视觉负责“看懂世界”触觉负责“感受世界”。两者结合机器人才真正从“远程遥控的机械臂”变成“能自己做事的工作伙伴”。回到李飞飞团队这次演示。摸麻将、挤牙膏看起来是日常小事但背后是机器人在“知道该做什么”之外开始“感觉到做得怎么样”。这个跨越比多装一个传感器更重要。它意味着机器人的决策不再只依赖外部观察也开始依赖自身与物理世界的接触。未来几年触觉传感器会更便宜、更稳定触觉数据和闭环策略也会越来越好。但真正决定一款机器人能不能落地的不是它摸出了多少麻将牌而是它在每一次接触中能否安全、稳定、可预期地完成任务。如果你正在做机器人开发不妨从现在开始先把手边任务按“是否需要触觉”分个类然后挑一个最小的感知闭环从摸清第一件物体开始。

最新新闻

日新闻

周新闻

月新闻