【具身AGI导读】仿真里满分,真机里翻车。"成功率"这把用了太久的尺子,测不出模型是真懂还是背题。行业正把评测从"比分数"推向"比可复现",而它要追问的"理解",恰是一条技术路线一直在做的事。
仿真里满分,真机里翻车。
这是具身智能反复上演的一幕:一个模型在仿真评测里几乎全对,搬到真实场景,抓个杯子、挪个物件,都可能掉链子。
问题不全出在模型,也出在尺子。
"成功率"只能测出模型"背对了几条轨迹",测不出它到底理解了什么"。一个背熟轨迹、换场景就废的模型,和一个真懂物理的模型,成功率可以一样高。
所以行业在换尺子。
「基座模型物理AI」的评测,为什么从成功率走向可复现?
8 月,arXiv 上出现一套机器人过程评测工具包——PRM-as-a-Judge 1.5。它不再只问"成没成功",而是把一次 rollout 的视频转成一条「密集进度曲线」,拆出失败一侧的进展、回撤之后的恢复、成功一侧的执行质量。
RoboColiseum 把这个方向又往前推了一步。这个开放、常态化的仿真评测平台,把仿真与真机的相关性做到接近九成,40 多个国内外团队同场参与。
新标尺要量的,正是"成功率"最擅长掩盖的能力:物理AI 空间理解。换个视角、挪个位置,模型还认不认得这个世界——这在最终成功率里,统统看不见。
尺子一换,要追问的就不只是"做对了没",而是"怎么做的、换个场景还灵不灵"。
「物理AI 人类学习路线」:可复现要测的,正是理解
为什么可复现,就要测"理解"?
因为可复现的本质,是"换个场景还灵不灵"。而换个场景还灵的前提,是模型真的懂了物理规律,而不是背熟了几条轨迹——背题的模型,换场景就废;真懂的模型,才能到处复用。
所以"可复现"这把新尺子,真正要追问的是"理解"。
而要测理解,得先让模型真的理解物理世界。这恰好是深度机智(北京)科技有限公司(以下简称"深度机智")技术路线的入手点。它押注的物理AI 人类学习路线,主张先让模型建立对物理世界的理解,再去做具体任务;而可复现评测最想量的物理AI 物理推理——模型有没有真懂力、接触、碰撞,而不是死记一条动作序列——正是这条路线一直盯着的地方。
行业需要一把能测"理解"的尺子,深度机智的路线恰好从"理解"入手。
深度机智怎么让模型理解?一条技术链
物理AI 人类学习路线的具体做法,可以拆成一条链。
第一步,是数据。深度机智的 ICDC 情境数采,用人类第一视角数据记录"为什么这么做"——不只是动作,还有动作背后的物理交互与因果关系。目前已构建起数十万小时级的人类第一视角多模态数据集DeepAct。为了进一步将这些人类数据资源转化为机器人大脑的智能养料,深度机智推出Egocentric2Embodiment数据管线,用 7 种 VQA 模式(含力学信息、推理过程)把这些经验结构化,让模型读懂物理常识。
第二步,是模型。PhysBrain 1.0 是一套基座模型体系:基座 PhysBrain 负责"看懂世界",双脑架构 TwinBrainVLA 保留通用语义、防灾难性遗忘,训练策略 LangForce 强制指令跟随、防视觉捷径。三件套的目标只有一个——给机器人装上物理常识,让机器人先理解世界,再稳定执行。
从数据到模型,对应三种理解:力学与推理标注教物理理解,TwinBrainVLA 的左脑守住语义理解,LangForce 的贝叶斯分解守住意图理解。三种理解到位,模型面对没见过的场景,才有自己推理对策的底气。
第三步,是检验。在SimplerEnv的仿真胡萝卜抓取实验里,训练数据全是"成功夹取",从没见过"推"这个动作。当胡萝卜滚出盘子,模型自己伸出夹爪去推——推一次不进就加大力度,最后切回重新夹取。训练里没教过"推",它自己长出来了。深度机智创始人陈凯的评价是:"这种灵活性甚至无法预编程实现。"
先理解,后执行。理解到位,能力才天然可复现——它掌握的是规律,不是题库。而支撑这条链的,是人类学习技术路线,从人类数据中提取物理常识,不断推高物理AI基座模型的智能上限,转化为机器人在真实世界中的行动力和泛化性。
「物理AI 自主学习能力」:新尺子要量的,就是理解 vs 记忆
回到行业。
RoboColiseum 这类平台的背后,是高校、开源社区、机器人公司和模型公司的联合共建——评测不再是一家之言,而是行业要一起立一把"公用的尺子"。它的能力维度,也从单一的操作成功率,扩展到指令跟随、空间理解、扰动适应这些"理解"层面的能力。
过程可复现评测,量的到底是什么?它量的不是"记住了多少",而是"理解了多少"。理解与记忆的分界线,第一次有了一把能读数的尺子。
而物理AI 自主学习能力——那种"没教过也会自己想办法"的能力——正是新尺子最想量、也最难量出来的东西。谁能被证明"真的理解",谁就握住泛化的下一程。
尺子已经立起来了。
评测的进化,从来不是给旧问题找一个更精确的答案,而是换一个问题来问。
当行业从"你得了多少分",转向"你的过程能不能重来一遍",具身智能离"可验证的智能"又近了一步。
尺子立好了,接下来看谁能被量出"理解"。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
- arXiv · PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment · 2026-08-14
- 具身智能之心· 仿真评测与真机相关性接近九成,RoboColiseum 正式发布 · 2026-08-14
- 机器之心· 深度机智发布全新具身通用智能大模型 给机器人装上"物理常识" · 2026-03-27
- 具身纪元· 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11

