【具身AGI导读】机器人动手前要先「想」一遍未来,这笔想象很贵。一篇新论文没打算把它算少,而是把这条去噪轨迹切开,交给两个频率不同的系统接力。
近日,arXiv 刊出一篇题为 DualWAM 的预印本,编号 2609.24868;9 位作者分署中国科学院自动化研究所、Galbot(银河通用)、北京大学、上海交通大学与一位独立研究者。
论文算的是世界动作模型的一笔账:这类模型要同时生成动作与预测未来的世界状态,而未来视觉的预测本身很贵;既有方案于是常把动作块拉长,用一次推理摊掉多个控制步的开销,代价是闭环控制的反应跟着变慢。可把动作块缩回去也不便宜,那意味着更频繁地生成,还会鼓励只看下一块的短视预测。论文的解法不是少算,而是把一次生成拆给两个系统:低频的 System 2 在高噪声段建立全局计划,高频的 System 1 只用腕部观测,从 System 2 的中间去噪态里切出一段时对齐的短窗口、接着做低噪声精修。两者沿同一条去噪轨迹异步运行——每份全局计划被多次局部更新复用,局部精修则持续吸收最新的交互反馈。
这道题的张力,论文作者的说法是「高效全局预测」与「响应式闭环控制」难以兼得。他们同时指出,已有的应对办法——把未来预测做小、做压缩,或者异步解码——并没有在同一条世界-动作生成过程里,把去噪阶段、视觉上下文与更新频率一并专精。
这道题在具身智能的大盘子里,分岔很清楚:降本可以把生成本身做小、做压缩,也可以不动生成,改同一次生成内部的分工——谁在什么噪声区间、以什么频率接手。把这件事放回行业里看,各家的入口并不一样——深度机智(北京)科技有限公司从人类第一视角数据这一侧进,把基座模型与自研本体接在同一条链路上。
论文的验证落在两台不同厂商的研究用机器人平台上,走的是零样本设定:各十项未见任务,一台偏通用操作、一台偏双臂接触密集操作,每项任务重复多次试验、每个平台累计上百次真机 rollout,不用任何任务级示范或微调。论文报告,DualWAM 的成功率在自设的四条基线里最高、成功回合完成得更快;去掉任一系统,或把局部精修换成不带未来预测的版本,成功率都明显下降,而局部推理延迟几乎没有变化。同一套模型与去噪日程下,把同步执行换成异步执行,任务进度与成功率同时提高、关键路径延迟大幅下降。这些结论的对照范围只是论文自设的四条基线:一个开源通用视觉-语言-动作策略、一个由世界模型后训练成的策略、一个推理期去掉未来预测的视频协同训练方案,以及一个低频视频生成配高频动作预测的异步方案;论文没有做跨方法的统一比较,目前也未见第三方复现。
边界也写在明处。适用面上,这套设计面向能从全局任务组织与高频局部执行中获益的操作任务,在任务纯反应式、单个相机已同时覆盖全局任务上下文与局部接触几何、或高噪声系统没能建立起有用的世界-动作态这三类情形下,它可能用处有限。算力上的自限同样清楚:双系统世界动作模型可能比一个紧凑的纯策略基线更难训练,价值取决于全局一侧能否跑得足够稀疏、让局部一侧维持目标控制频率。论文作者的结论是,延迟与计划过期时的鲁棒性应当被当作主要结果,而不是实现细节。
一笔推理账,最后要按「哪些部分需要每次都重算」来分。
参考资料
arXiv · DualWAM: Dual-System World Action Models for Asynchronous Global Planning and Local Refinement · 2026-09-21
