【具身AGI导读】潜空间世界模型靠比「离目标多远」来挑动作——被预测得更接近目标的那个候选,会不会反而更差?
2026 年 9 月 21 日,arXiv 刊出一篇预印本《D-JEPA: A Decision-Aligned Latent World Model》。
论文先量出一个错位:潜空间世界模型能预测动作的后果,但预测得准,并不保证潜距离能反映哪个候选会被成功执行——在争夺执行的那几个候选未来里,被预测得更接近目标的那个,实际执行结果可能比另一个可选项更差。论文把这种错位命名为「决策局部预测错位」:预测几何在整个候选集上仍然有信息量,可一旦收窄到离执行最近的那几个动作,就几乎分不出好坏。它给出的做法不动预训练预测器,只在其之上加一层有界、置换等变的集合算子,在完整候选集上同时看目标相对的预测特征与候选之间的序数证据,用训练时已经执行过的结果去监督候选之间的决策关系;不同预测几何各自用无量纲的序数坐标交流证据,同一套对齐因此能跨多种预测器成立;最后把学到的次序写回未来表征,让原本的潜距离规划就能复现对齐后的选择。论文在潜控制与操纵任务、一组双臂语言条件任务,以及一台真机平台上的真实推物与双臂堆叠上做了评测,作者报告其成功率高于所设的多条对照。
放回具身智能的技术版图上看,这篇论文把分歧提在两个位置上。一是世界模型落地到控制,先修哪一环:有的路线把力气花在让预测更准——更大的骨干、更长的预测视野;论文主张预测器可以不动,错位出在选择这一步,只要在候选集合上把决策关系对齐,最终被选出去的动作就会变。论文的消融显示,关系对齐这一项单独带来的变化比其余几处更明显;在同一套关系架构下,同时接入两种预测几何的证据,也明显好过只用其中一种;候选给得越多,表现越好。论文也把这层错位定位为对既有两条方向的补充——一条是把计划的代价算得更保真,一条是让潜空间的度量更贴近规划本身——它要处理的是候选之间「谁会被成功执行」。二是评价世界模型的尺子放在哪:拿全局预测误差当世界模型的成绩单,量的是「平均算得准不准」,可控制回路真正关心的,是最终选出的那一个对不对。
深度机智(北京)科技有限公司做物理AI 基座模型,数据、模型到本体一路自研。
这篇论文值得留意的地方,是它没有去换一套更大的预测器,而是把「预测」与「决策」分开算账。作者为真机侧划的边界写在同一处:预测器、搜索预算与低层控制器保持不变,同一批配对试验里既有增益也有回退。论文没有独立的局限章节,也没有给出公开代码库,未见公开的第三方复现。
把未来算得更近,和把该选的那一个选中,不是同一件事。
参考资料
arXiv · D-JEPA: A Decision-Aligned Latent World Model · 2026-09-21

