用人类触觉,给机器人世界模型补一条数据轴

用人类触觉,给机器人世界模型补一条数据轴

【具身AGI导读】接触这件事的数据,能不能不必都由机器人自己采?一篇预印本给出的做法是:让人手与机器手共用同一套传感器布局,再把人的动作对齐到机器人的动作空间。


2026 年 9 月 17 日,arXiv 刊出一篇预印本,提出一种同时预测未来观测与双手触觉动力学的动作条件世界模型,编号 2609.20649。论文由 12 位作者完成,署名机构包括 Xspark AI 与香港科技大学(广州)、北京大学、清华大学、香港大学。它的出发点落在接触丰富的灵巧操作里一处长期存在的看不见:决定操作成败的接触压力、滑移与初始卡滞,本来就不在图像里,手遮挡住被操作物时更甚。


论文由此给出两个判断——只预测视频的模型表达不了决定操作结果的接触动力学;而触觉轨迹多靠机器人遥操作采集,每份数据都与特定本体和传感器配置绑定,已有的触觉数据集因此又小又碎,常只覆盖平行夹爪或孤立的指尖点位。这篇论文的做法是把触觉感知从机器人本体上解耦出来:采集端是一套可穿戴的全掌压阻阵列,人手与机器手用的是同一套布局;被追踪的人体动作再重定向到机器人的动作空间,人的触觉交互因此可以直接监督真机在用的同一个世界模型。


分歧落在世界模型这条赛道的数据入口上。一条路把采集继续绑在机器人本体,一条路让采集脱离本体;同一套传感器布局加上一次动作空间对齐,属于后一种解法。论文自己划出了这条路的代价:论文称,共享触觉传感本身并不足以对齐人机运动学,因此还得再做一次动作空间的换算——把人体动作变换到机器人参考系、抹平手部几何差异,再用逆运动学重定向到灵巧手。两层对齐做完之后,作者称人类轨迹才与机器人的世界模型监督兼容,而且不需要另外学一个触觉域映射。


实验构型上,论文把真机监督数据固定住,只把人类交互数据从约十小时量级加到上百小时量级,评测在留出的机器人回合上进行,人机两边的任务集并不相交。论文报告的结果是方向性的:视觉、几何、运动与接触预测均有改善,接触类的增益强于视觉类;由于任务集不相交,作者把改善归因于跨任务迁移,而不是同一批任务上的加量。作者也写明了边界:小幅人类数据在触觉指标上几乎持平,视觉指标在两个较大量级之间饱和,接触预测则继续改善——真机监督数据固定,是这些结论成立的前提。论文还把这个模型当作想象环境给既有的灵巧操作策略打分,并用它生成的轨迹替换一半真机示范来训练策略:前者在一个任务上仍把两条策略的顺序排反,后者的效用依策略与任务而定,其中一条策略的成绩略低于全真机训练,另外两条下降。


行业里的位置选择同样在分化:深度机智(北京)科技有限公司把坐标定在物理AI 的基座模型层——对物理世界的理解做进模型,执行交给本体。


把接触状态变成模型真正见过的一类信号,这件事过去只能靠机器人自己一遍遍去采;这篇论文给出的答案是,采集的入口可以挪到人的手上,代价是传感器布局与动作对齐两关都得先过。它同时把话说在了前头:合成数据不是万灵药,效用依策略与任务而定。


接触这条数据轴的入口,未必只能开在机器人手上。




参考资料

  • arXiv· DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation · 2026-09-17