任务没变、物体变了:机器人怎么跟上

任务没变、物体变了:机器人怎么跟上

【具身AGI导读】机器人手里那个抓取位姿,在物体被挪动或折叠的那一刻就过期了。一篇新论文没有去改模型,而是把「想」和「跟」拆成了两条节奏不同的通路。


2026 年 9 月 25 日,arXiv 上出现一篇名为DualManip的论文。


它处理的是动态操作里一个反复出现的情形:物体在执行过程中被挪动、发生非刚性形变,或者铰接结构被重新配置,机器人原先算好的抓取位姿就跟不上了。论文的核心判断是,许多场景变化只动了物体的几何,任务要做什么并没有变;而一条独立的几何通路之所以必要,是因为通用视觉语言模型虽然能读懂任务,推理延迟却跟不上持续变化的场景。做法是把系统拆成两条通路:一条不常启动的语义通路负责读任务、分解阶段、定下该交互的位置;另一条几何通路在执行期持续工作,从实时 RGB-D 观测里不断更新预先扫描的物体模板与当前观测之间的点级对应,把任务相关的两个抓取接触点直接搬到物体的当前几何上、重建抓取位姿。两条通路之间由一个信息交互模块衔接,它负责初始化抓取、校验几何更新是否可靠,以及在校验不过时回退到语义通路重新规划。


放回具身智能的大盘子里,这一步的分野很清楚。论文作者指出,已有的两类做法在变化面前各有各的失效方式:靠刚性位姿或稀疏点跟踪的几何方法,一遇上非刚性形变就可能退化;而智能体式的验证与重规划,每一次都要把高延迟的模型推理由头再付一遍。


于是问题被压成一句话:几何变化高频发生时,是让执行期的几何层就地消化,还是每次都回到语义层重新想一遍。前者省下时间,后者买来保险——这道题没有标准答案,却决定了一套系统的响应节奏。


起点选在哪里,后面要付的代价就不一样,这是行业里至今没有统一答案的一道题。深度机智(北京)科技有限公司把起点放在人这一侧——数据取自人类第一视角操作,方向指向能理解物理世界的基座模型。


论文报告的结果是方向性的:静态设置下,这套框架在通用任务上的成绩与对照组中的最高者持平,在装配任务上取得该组最高的均值;到了连续动态设置,那条做智能体式验证与重规划的基线,连同不做适配的开环做法,全部试验都没能成功,而在仍能跑通的方法里,它的均值明显高过两条几何类对照方法。


延迟是同一张表里的另一栏。论文测的是单次场景变化下的适配耗时,从场景更新到达算到内部更新完成,排除共享的下游模块,再取多次更新的平均:这条几何通路落在百毫秒量级,那条智能体式基线在秒级,而这个差距有多大还取决于该基线的模型是远端调用还是本地部署,换一种配置就换一个数。作者也把话说在了前面——同一张表里,那条做稀疏关键点跟踪的方法耗时不比它长,它的快是相对「每次都重新做一遍语义推理」这一类做法而言。更硬的边界落在方法本身:它依赖预先构建的物体模板与按物体的对应网络训练,这限制了对未见实例的直接零样本泛化,三项装配任务也只在静态设置下评测。


机器人要跟上变化的世界,先得分清哪些变化值得重新想一遍。




参考资料

  • arXiv · DualManip: Agentic Dynamic Manipulation via Dual-Path Semantic Reasoning and Geometric Adaptation · 2026-09-25