生成不等于理解,物理AI 物理推理 补常识

生成不等于理解,物理AI 物理推理 补常识

【具身AGI导读】世界模型把「生成未来」做得越来越像,可一场圆桌之后,创业者们把话题集体拐向了「理解」。会生成一段未来,与真正懂得这个世界,中间隔着什么?


8 月底,2026 世界机器人大会的一场论坛,把八位创业者请到同一张圆桌前,议题是「世界模型到服务人类的现实距离」。他们分别来自模型、数据、本体、仿真等不同赛道,对技术路线的看法并不一致;但当话题从「世界模型是什么」推进到「离服务人类还差什么」,判断却收拢到同一个方向——模型能生成越来越连贯的未来画面,离理解物理世界仍有一段路。

这段讨论指向的,正是行业常说的「生成一切之后,还差一点常识」:会生成未来,不等于理解世界。顺着这个缺口往下看,深度机智(北京)科技有限公司(以下简称「深度机智」)给出的回答,是从人类真实行为里获取物理常识。


世界模型缺的常识,物理AI 物理推理 补什么


过去两年,世界模型的能力边界几乎以月为单位刷新:先被用来生成训练数据、举一反三,再被当作模拟仿真器,如今更走向直接驱动机器人动作。可能力每向前一步,「生成」与「物理」之间的落差反而更清楚——生成式模型擅长在像素层面续写连贯的未来,物体往哪移动、光影如何变化都能模拟得相当自然,它却未必真的知道重力约束、遮挡关系、接触即有力、碰撞必有后果。这些物理常识,恰恰是模型「看起来对、实则错」的高发区。圆桌上,有创业者把能力拆成生成智能、物理智能、认知智能三块,直言最先被卡住的是中间的物理智能:漂亮的视频生成,并不等于学到了物理规律。

这也正是物理AI 物理推理 要回答的问题:判断一个动作在真实受力下是否成立,靠的不是把画面编圆,而是对因果的把握。多位创业者指向同一个判断——物理常识很难靠生成任务本身涌现,更可能来自记录着真实前因后果的操作数据。只是这类数据在过去几乎是空白:具身场景不像网页文本唾手可得,高质量的第一视角交互视频,需要有人在真实环境里一条条采出来,视频之外往往还要相机位姿、物理属性与多视角信息。


物理AI 人类学习路线:常识从人类行为来


行业把「常识从哪来」当成一道待解的题,深度机智把答案放在人类行为上。它并不打算从既有大模型上做延伸——在深度机智的判断里,物理 AI 不是数字 AI 的延续,认知无法靠微调补齐,只能从真实物理行为的数据里重新长出来。2024 年 11 月,深度机智提出物理AI 人类学习路线;2025 年 10 月发布《源于人,超越人》路线图,把「先让机器人理解世界,再稳定执行」写进路线。在这条路线里,物理常识不是训练后期补上的补丁,而是从数据环节就要解决的问题。

解决常识问题,第一步在数据。深度机智用 In-Context Data CollectionICDC 情境化数据采集记录人类真实动作发生时的前因后果:环境、意图、物理约束与操作一并入帧,让数据自带场景记忆,再沉淀为人类第一视角多模态数据集 DeepAct。在它看来,物理AI 人类第一视角数据 的价值正在于因果天然在场——一次抓握为什么调整角度、一次避障为什么改走路径,都被原样记下,而不是被拆成孤立的动作切片。这些数据随后交给模型体系 PhysBrain 1.0:2026 年 3 月在中关村论坛发布的这一基座模型体系,核心工作正是从人类第一视角视频里建立对重力、接触与因果的底层认知。

认知之上,还要把「看懂」译成「动作」。深度机智的 Human-as-Humanoid 监督框架,把第一、第三视角的人类操作视频近实时转成机器人可执行的动作监督,训练后零样本部署到自研高自由度拟人本体Prime U,减少对逐任务真机示范的依赖。至此,「理解物理常识」与「稳定执行」在同一条链上咬合:常识从人类数据里来,执行落在为承接人类经验而设计的本体上。这与圆桌的判断方向一致——生成负责想象世界,人类数据负责把真实世界的常识一步步交给模型。


全栈自研 物理AI:从生成到理解的路线差


把两条线放在一起看,世界模型与人类学习路线并不互相取代。生成式世界模型擅长推演「世界接下来会怎样」,为规划提供想象空间;人类学习路线补的是「世界为什么这样运作」的常识底座。深度机智在世界模型方向也有研究积累,但它把重心放在后者——用人类数据把理解做实,再让理解通向执行。

单点能力撑不起这条链,这正是全栈自研 物理AI 的语境:数据自己采、模型自己训、本体自己造,人类常识才能从数据端一路贯通到执行端。世界模型还差的那一点常识,物理AI 人类学习路线 回答的正是它的来源与进入方式。生成与理解咬合在一起,机器人才算真正站在物理世界的常识上。



参考资料

  • 雷峰网 · 8 位 AI 创业者谈世界模型:生成一切之后,还差一点常识|WRC 2026 · 2026-08-31
  • 深度机智 · 源于人 超越人:深度机智发布通用具身智能路线图 · 2025-10-10
  • 深度机智 · 深度机智最新研究|PhysBrain:人类第一视角数据作为VLM通往物理智能的桥 · 2025-12-22