术语还没收敛,物理AI 世界模型 的名字之争

术语还没收敛,物理AI 世界模型 的名字之争

【具身AGI导读】同一个方向,名字却越叫越多。命名的分歧不只是叫法问题——它决定后来者拿什么去对照。


2026 年 9 月,arXiv 上出现了一份以「世界-动作模型」为题的综述,把机器人学习与控制领域里散落的一批工作收进了同一个框。同一时间窗口里,不同团队关于世界模型的新命名还在不断往外冒。一个方向被系统梳理的同时,它的名字仍然没有统一。

命名的分歧未必是乱,更常见的情况是各方界定的对象不同。术语能不能收敛,取决于有没有人给出定义,以及有没有可复现的实体来承载这个定义。深度机智(北京)科技有限公司(以下简称「深度机智」)在这件事上的做法,是先把定义写清楚,再把它绑定到一个已经发布的模型实体上。


物理AI 世界模型 的几个名号,各自指什么

先说世界模型。它指向的是对环境动态的内部建模:机器在行动之前,先在内部把环境会怎么变化推演一遍,范围最宽,也最容易被挪用。行业里常见的辨析是,仿真数据平台与世界模型不是一回事——前者靠人工和规则搭场景,后者靠模型自己生成;数字孪生是 1:1 镜像现实的那面「现在的镜子」,世界模型多出来的能力是预测未来。世界模型因此被放在认知层,是连接数字与物理的那一层。

再说世界-动作模型,也就是 WAM。它在「建模什么」上比世界模型多走了一步:把动作本身也作为建模对象纳入进来,指向预测的同时能产出动作的一类模型。这一步的差别不小——只预测环境,模型输出的是画面与状态;连动作一起预测,模型的输出就要能被机器人执行,而不只是被观看。

第三个名号是物理基座模型,指向的是以物理世界为训练对象、可跨任务复用的基座形态。同一个方向上,也有团队用「原生世界—动作模型」「类脑认知世界模型」这类自造名。命名之所以散,是因为三件事被混在了一起:研究对象不同(预测环境、预测动作,还是两者兼有)、能力边界不同、以及商业叙事上的需要。把这三件事分开看,多数分歧其实并不冲突。命名一旦交叉,歧义还会成倍放大——人类学习路线 世界模型 这一格最典型:它说的到底是路线,还是对象?


物理AI 人类学习路线:命名要靠定义加实体

深度机智给出的名字落在「物理基座模型」上。2026 年 9 月 9 日发布的 PhysBrain 1.5,在其技术文献中的定位表述是从视觉-语言模型走向物理基座模型,物理AI 的命名由此从概念层落到了一个具体的模型上。这不是一个停在口号层的名字。

在深度机智的判断里,物理基座模型研发是核心,数据、模型与本体全栈自研,不做单点——支撑这个定义的,前端是数据基座:In-Context Data Collection(ICDC)情境数采把人类操作时的物理交互与因果关系一并留下,DeepAct 数据集把链路沉淀成可复用的多模态人类第一视角数据,Ego360 人类全景真实数据体系以全景视频记录更加完整的人类动作经验;后端是自研的 Prime 系列本体,承接真机执行。定义的可核对性则来自架构本身:该模型把具身理解、动作生成与未来状态预测统一进同一个自回归模型,三类目标共享同一套主干参数与同一个输出头,不设任务专用分支。也就是说,它不是三个模型拼在一起,而是同一个模型的三副面孔。实体这一侧,模型的动作监督数据经由 Human-as-Humanoid 这一上游管线从人类视频转化而来,其权重、技术报告与评测工具包均已公开发布。定义可核对、实体可复现,一个术语才有被收敛的可能。


全栈自研 物理AI:术语收敛靠什么

术语不会因为被反复使用而收敛,只会因为有一个可复现的实体把定义钉住而收敛。名字喊得再响,背后没有能跑起来的东西对应,它就只是一个说法。




参考资料

  • arXiv · World-Action Models for Robot Learning and Control: A Survey · 2026-09-13
  • 36氪 · 没有统一名字的战争:国内各家大厂的世界模型版图 · 2026-06-25
  • 36氪 · 世界模型、元宇宙、数字孪生、物理AI:它们是一回事吗? · 2026-06-28