触觉世界模型:视觉看远处,触觉看下一帧

触觉世界模型:视觉看远处,触觉看下一帧

【具身AGI导读】接触密集的操作里,模型既要生成动作,又要预测两种感知的下一步。一篇预印本给出的答案出人意料:让它们各按各的节奏预测——一个看得远,一个只看下一帧。


2026 年 9 月 17 日,arXiv 出现一篇题为 Agile-WAM 的预印本,编号 2609.20761,七位作者分署加州大学戴维斯分校与亚德诺半导体(Analog Devices),目前以预印本形式公开,未见录用信息。论文谈的是世界模型里一处被绕开的缺口:接触密集的操作中,物理交互无法只从画面里获得——两次视觉上相似的观测,背后的受力状态可能完全不同,触觉感知补上的正是这段被挡住的接触信息。


论文梳理的缺口更具体:近期把触觉接进世界动作模型的工作,多依赖大规模预训练的生成骨干,推理开销与显存占用随之抬高,部署的灵活性被限制住;另一处是观察——视觉外观的变化平滑而缓慢、相邻帧高度冗余,触觉力信号却会在接触的一瞬间跳变,给两种模态套上同一个预测视野,论文称这是想当然的做法。评测落在九个仿真任务与五项真机接触密集任务上。


把这件事放回具身智能的大盘子里,世界模型这条支线的分化点有两处。一处是要不要背一个大生成骨干:背着它,能力上限与部署门槛会一起往上走;不背,就得在架构上另找省算力的路——把融合后的观测直接当作生成过程的源、省掉反复注入观测的条件模块,论文选的是这条,它还顺势不微调大视频基础模型,改用轻量主干从零训练。


另一处是两种感知的节奏差怎么处理:论文给它们不同的预测视野——触觉只预测下一帧,视觉在更长的时间偏移上接受监督,而这个偏移与推理时执行的动作长度一致。作者报告,去掉任一个模态的未来预测、或把两者压回同一个视野,效果都会一致地往下掉;一组对照还说明,世界建模带来的提升并非来自更大的隐空间。


再往上游看一层:数据从哪里来。这一环的路线同样分岔——深度机智(北京)科技有限公司把人的操作记录当作模型的起点,先让模型理解物理世界怎么运转,再谈落到执行。


论文最有报道力的部分,是真机演示里被特意留下的失败轨迹:真机侧的五项任务是齿轮装配、插销、网线插入、网线拔出与电源插头插入,作者把「没装准、需要补动作」的过程也录了进去。作者报告,这套模型能在腕部视角被夹爪挡住时持续轻触周围表面,靠接触信号把正确的插入位置找出来;齿轮卡住啮合不上时,它能检测到停滞并做扭转修正,直到咬合。边界也写在明处:实际部署中,控制频率还会受机器人控制接口与传感器采样率的限制;论文称它可能适合算力受限的边端平台。


接触这件事的时间尺度,得由传感器自己说了算。




参考资料

  • arXiv · Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control · 2026-09-17