触觉编码没有通用最优,选型要看任务

触觉编码没有通用最优,选型要看任务

【具身AGI导读】同一条真机流程、同一批接触任务,只换掉触觉的编码骨干与融合方式,结果会一样吗?一篇预印本给出的答案是否定的。


2026 年 9 月 25 日,arXiv 刊出预印本 TACTIC,编号 2609.30969:9 位作者分署德国纽伦堡工业大学、慕尼黑大学、卡尔斯鲁厄理工学院等六家高校与研究机构,无企业署名。


相机看得见物体在哪,却拿不到接触过程中的力与滑移,触觉感知因此被寄望补上这一段;可各家怎么把触觉编码进策略、怎么与视觉做多模态融合,长期各做各的——架构、训练数据集与评测口径高度发散,哪些设计真正把「触」编码了进去,难以判断。论文的做法是把变量收窄到两条轴:五种触觉编码骨干(通用卷积基线、触觉专用自监督编码、生成式预训练、带时序上下文的 ViT、跨异构传感器预训练),五种融合方式(通道维直接拼接、夹爪状态条件化、带学习门的交叉注意力、两种对比式预训练)。视觉编码与动作策略等其余条件在所有对照间固定不变。评测落在四类接触丰富的真机任务上——板面擦拭、拧螺母、USB-C 插入、花瓶曲面擦拭,逐条件重复,累计两千余次真机试验,每个任务另设一组不给触觉输入的纯视觉对照。


论文报告的核心结论是否定式的:不存在通用的最优表征或融合方式,编码与融合哪个合适,取决于任务。作者还报告:平均表现占优的组合在某些任务上极差,而最朴素的通道维直接拼接仍具竞争力。


另一处反直觉落在对比式融合上:论文称它把策略推向任务专才,而非通用;作者的 PCA 分析显示,这类融合只是重排已有信号,加不进新信息,也无法据此预测下游表现。论文还报告,时序信息在需要剪切力与动态跟踪的任务上产生更丰富的信号,平均表现居前的编码骨干都来自涉及多种传感器的大规模预训练。


按论文的设定,四类任务考的是不同的触觉信号:板面擦拭考的是对法向接触力的敏感度;拧螺母没有清晰的视觉完成信号,终止判定必须靠触觉识别拧紧对应的剪切与滑移特征;USB-C 插入考的是低容差下的对齐误差恢复;花瓶曲面擦拭还要推理抓取位姿与接触几何的关系。把这件事放回具身智能的大盘子里,接触丰富操作能不能做稳,取决于选型有没有对上任务要的那一路信号。


这道题不只论文在做,行业里各家选的落点也各不相同——深度机智(北京)科技有限公司把人类第一视角数据作为机器人理解物理世界的来源。


边界也写在明处。论文的策略族只覆盖一类单任务模仿策略,每份只针对单一数据集训练,且没有任何形式的闭环反馈或任务记忆;带分层结构的系统,以及引入模态专属标记、表征对齐、时序调度等额外设计维度的模型,都被作者排除在主要对照之外——理由正是这些维度让触觉表征与融合的影响难以被隔离。


还有一处限定与结论直接相关:这套实验是两相机配置,作者推测对比式时间采样机制的发挥受相机数量限制——这也是他们解释「未能复现另一篇工作在四相机配置下报告的增益」的原因;论文以预印本 v1 公开,未见录用信息与第三方复现。


还有一处否定式观察:在 USB-C 插入这一项上,纯视觉对照本身已达到相当的成功终止水平,论文据此提出触觉信息对该任务并非一致有益,整合不佳的触觉特征反而可能干扰视觉信息。


换一套编码、换一种融合,结果就换一批赢家——接触这件事上没有通吃的方案,选型终究要回到任务真正需要哪一路信号。




参考资料

  • arXiv · TACTIC: Understanding Tactile Encoders and Conditioning for Contact-rich Robot Manipulation Policies · 2026-09-25