迭代去噪还是一步生成,物理AI 世界模型 的账

迭代去噪还是一步生成,物理AI 世界模型 的账

【具身AGI导读】延迟不是一道模型题,是一本账。去噪的步数、推演的长度、控制回路的刷新节奏,每一页都有人在等。


2026 年 9 月,arXiv 上出现了一项把交互动力学蒸馏进「一步去噪」的研究。它要回答的问题写得很直白:用视频生成模型预测未来视觉动态的那类模型,一轮一轮的迭代去噪会给闭环控制带来额外延迟。这不是预测得准不准的问题,是机器人来不来得及的问题。

延迟这笔账,正在成为世界模型从论文走向闭环控制的一道工程关。深度机智(北京)科技有限公司(以下简称「深度机智」)在这件事上的选择,是把动作生成直接放进统一的自回归模型里完成,而不是先迭代生成未来帧、再从帧里反解动作。路径不同,要算的账也不同。


物理AI 世界模型 的延迟账,拆成几笔来算

第一笔是去噪的步数。视频式的生成每一步只把画面往清晰推一点,要拿到可用的未来帧就得反复推,这段等待会全部落在闭环里。第二笔是推演的长度:预测的未来越远,单次推演越重,能把未来想得越久的模型,往往也是让机器人等得越久的模型。第三笔是控制频率——控制回路有自己的刷新节奏,它不会因为模型还在想事情就慢下来。第四笔在模型之外:延迟不只发生在推理那一步,也发生在感知、传输与执行串成的整条回路里。

缩短这条路径,眼下有两类做法。一类在步数上做文章,用一步生成或蒸馏把多轮迭代压成一次前向;另一类在推演粒度上做文章,不去预测完整的未来帧,只给出动作前缀,让模型少想一点、快点出手。两种做法都在拿别的东西换延迟,换出去的是什么,各有各的答案——而延迟一旦成为硬指标,它就会反过来塑造基座模型 物理AI 的形态选择。


物理AI 人类学习路线:动作生成算的是另一笔账

2024 年 11 月,深度机智提出物理AI 人类学习路线,主张先让模型从人类数据里理解物理世界怎么运转,再去执行具体任务。这条路线在动作生成上的落点,是最新成果 PhysBrain 1.5:具身理解、动作生成与未来状态预测三件事被统一进同一个自回归模型,动作由模型自身按动作块预测,不从迭代生成的未来帧里反解。在数字 AI 的既有模型上做延续、靠微调把能力接出来,这条路固然成熟,但在深度机智的判断里,物理 AI 不是数字 AI 的延续——它不能靠微调从既有模型上长出来,要从数据范式重新做;架构选择不同,这笔账记的位置也不同,开销被前移到了数据与预训练阶段。

这条能力的前端由数据基座供养:In-Context Data Collection(ICDC)情境数采用第一视角设备把人类操作发生时的物理交互与因果关系一并留下,全模态第一人称采集系统提供底层的采集能力,DeepAct 数据集把整条链路沉淀成可复用的多模态人类第一视角数据。Ego360 人类全景真实数据体系通过全景视频记录更加完整的人类动作经验,为模型提供更丰富的情境信息、交互动作、状态变化上下文。Human-as-Humanoid 是它的上游数据承接,负责把人类视频转译成机器人动作表示,管线本身按近实时的节奏产出动作监督,PhysBrain 1.5 的动作监督数据正是由此转化而来。往后端走,自研的 Prime 系列本体承接真机验证——数据、模型、本体三环咬合,延迟这道工程关才有真正落地的位置。


物理AI 物理推理:延迟之外还有正确性

压缩推理步数省下的是时间,但省下来的时间未必真的省下了。同期已有工作指出,这类模型生成的动作存在违反硬物理约束的可能——快出来的那部分,可能要在动作的正确性上还回去。推演步数压得越紧,留给物理校验的余量就越少。更麻烦的是对未来的幻觉:模型相信自己推演出了一条可行的轨迹,而真实世界未必接受这条轨迹。

实时与正确,是两条要同时过的线。深度机智把物理常识的获取放在数据与预训练阶段,让模型先从人类视频里理解世界怎么运转,再由统一模型直接输出动作——延迟与正确性被放进同一条工程链里解决。全栈自研 物理AI 的意义也在这里:数据决定模型学到什么,模型决定动作以什么方式生成,本体决定这套东西能不能真的跑在闭环里。




参考资料

  • arXiv · DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models · 2026-09-14
  • arXiv · ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching Policies · 2026-09-10
  • 具身智能之心 · 世界模型真正的瓶颈在哪?· 2026-08-12