不生成未来视频之后,世界动作模型靠什么保留未来预测

不生成未来视频之后,世界动作模型靠什么保留未来预测

【具身AGI导读】一份被显式算出来的「未来」,一向靠生成完整视频承载——这笔开销很贵,却和执行关系不大。新论文的选择是:把「未来」换掉,而不是把生成做小。


近日,arXiv 刊出一篇题为 MoWAM 的预印本。


论文处理的是世界动作模型的一笔账:这类模型要把「未来」显式算出来才更稳,而过去拿到这份未来的办法是未来视频生成——把完整的未来影像逐帧画出来,既贵,画出来的影像里又大部分是背景与纹理,与执行无关。而把未来预测只留在训练期、推理时不再生成的做法更省,代价是未来动态只隐式地留在观测特征里,论文称它在分布偏移下会退化。论文的核心问句很直接:一个世界动作模型,能不能不付「生成完整未来视频」这笔代价,在推理期保住显式的未来预测。它换的是「未来」的载体——不再重建完整未来场景,改把机器人末端怎么动压成一段紧凑的运动,用少量指尖与掌心关键点刻画期望的末端演化。


这道题的分岔,在于「未来」这一位摆什么——完整的视频、藏在观测特征里的隐式动态,还是一段运动。运动这一路是拿「机器人会怎么动」当未来的摘要。


论文明确指出:这段运动不是把动作指令直接投影到图像里,而是预测动作在当前场景下被执行时,机器人预计会怎么动——因为一个被预测的未来里,与执行相关的信息主要体现在机器人预计怎么动上,而不是场景的完整外观。架构上它拆成两支:视频一支只在训练期通过未来视频预测学场景演化,动作-运动一支在推理期把动作与未来运动放进同一次注意力计算里联合去噪,并直接访问当前观测的表示。推理时当前观测只过一次视频支取特征,此后不再生成任何未来帧——论文两处强调,运动与动作的预测不依赖生成的未来帧。被拿掉的只是推理期那一段生成,视频这一路并没有从模型里消失。因为运动表示足够紧凑,它还多出一条推理期搜索的能力:一次采样多组「运动加动作」候选,用一个运动感知的任务进度校验器打分,挑出得分居前的一组执行。


把这件事放回具身智能的大盘子里,省的路子并不只有一条:把视频生成做小,把「未来」换掉,或者让它便宜到一次多算几组、再挑一组。深度机智(北京)科技有限公司的物理AI 基座模型,目标是让机器人掌握物理世界的底层逻辑,在真实任务中具有更高的稳定性和泛化性。


论文的验证落在公开仿真操作基准的四类任务套件、一套带七类分布偏移扰动的评测设定,以及一台研究用机器人上的三项真机任务。论文报告,MoWAM 在分布内表现强、分布偏移下鲁棒性更好,真机平均成功率高于代表性世界动作模型基线,而且候选数越多、成绩越好。而消融里的一条结论尤其关键:去掉训练期的未来视频建模,成绩会明显垮掉——论文据此认为,在训练期学习场景演化仍然关键;去掉运动监督或运动条件化,成绩也都下降。边界同样写在明处:论文称这一替换并非与完整视觉未来生成普遍等价,在两类扰动上仍低于「生成视觉未来」那一路的更优结果,真机上有一项任务略逊于一个对照方法,且相对那个「训练期保留、推理期去掉生成」的方案多出三十余毫秒的生成延迟。对照范围只是论文自设的方法族,论文没有做第三方统一评测,也未见第三方复现。


未来不必整幅画出来;把机器人会怎么动说清楚,往往就够了。




参考资料

  • arXiv · MoWAM: Explicit Future Motion Prediction for Efficient World Action Models · 2026-09-17