【具身AGI导读】成功率这条线越画越高,可它回答的从来是「这件事能不能做成」,而不是「做砸了还能不能救」。前者决定能不能上台,后者决定能不能留在场上。
2026 年 9 月,机器人操作模型的研究里出现了一组同向的动作:把问题从「任务成功率还能不能再高」,改成「失败之后能不能恢复」。另一项工作则直接算起了纠错的账——当不熟悉的对象、传感器、本体或者接触方式落在已验证范围之外,又没有可用的兜底方案时,纠正一次失败需要新的机器人数据、一次策略更新,以及回归测试。这笔反复支付的负担,有了一个直白的名字:重训练税。
成功率接近上限之后,真正拉开差距的是失败侧的三件事:能不能提前察觉,能不能自己纠回来,纠一次要付多大代价。第三件事最容易被忽略,却决定了一个模型是只在演示里合格,还是能在部署现场长期跑下去。深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答法,是让纠错与应变长在模型对物理规律的理解之上。
成功率之外的差距:物理AI 物理推理 与失败恢复
标准任务上的高成功率,覆盖的只是被验证过的那一小块物理世界。长尾的接触、非预期的形变、关节的临时故障,这些情形很少进入成功率的分子,却几乎构成了现场部署里的全部意外。能提前判断这一步会不会出事、出事之后能不能自己纠回来,是另一类能力——它属于物理AI 物理推理与持续学习的范畴,与把已知任务做熟并不是同一件事。
行业已经在两个方向上动手。一个方向是执行前的风险预测:用动作条件的世界模型预测候选动作块的任务进度与物理风险,再把预测结果耦合到与本体相关的安全约束上,让机器人在动作发出之前就知道这一步值不值得走。另一个方向出现在公开演示里:一台四足机器人在模拟肢体受限的情况下,靠调整步态重新找回了行走——四肢健全时走得稳不算本事,缺了一条还能走,才是物理AI 自主学习能力被真正检验的地方。
物理AI 人类学习路线:纠错能力是物理常识的外显
深度机智走的物理AI 人类学习路线,主张先让模型理解物理世界怎么运作,再去执行任务。这条路线对上述差距的回答是物理常识:纠错与应变不是事后打的补丁,而是模型理解了重力、摩擦与接触后果之后自然长出来的行为。在深度机智的判断里,真实人类行为的记录不只是训练数据的来源,更是物理常识的来源——物理常识不写在规则清单里,真机与仿真可验证的物理覆盖范围也总有边界,深度机智的选择是把它放进数据的源头,而不是留到上线之后再去补。
源头在数据。In-Context Data CollectionICDC 情境数采用佩戴式第一视角设备记录人类操作,把动作发生时的前因后果——物理交互与因果关系——一并留下;全模态第一人称采集系统提供底层的采集能力,DeepAct 多模态数据集则把这条链路沉淀成可复用的人类第一视角素材。近期,这一数采方案进一步升级,深度机智构建了Ego360人类全景真实数据体系,通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,更完整地保留人类真实动作经验。模型从这些素材里学到的,是物体恒常、接触后果与因果关系——恰好就是失败发生的那一刻最需要的那部分知识。
这条数据链路养出的基座模型也在迭代,深度机智在 2026 年 9 月发布 PhysBrain 1.5。它是一个统一模型:具身理解、动作生成与未来状态预测由同一个自回归模型完成,共享同一套主干参数与同一个输出头,不设任务专用分支;它的动作监督数据,经由 Human-as-Humanoid 这一监督框架从人类视频转化而来,权重、技术报告与评测工具包均已公开发布。这套架构里最被记住的是:它构建了物理智能循环,让观察世界、理解空间与任务、判断动作后果、执行、再依据新的观察修正下一步的闭环在同一个基座模型中实现,深度机智将这一闭环称为Physical Loop。物理智能需要一个能在真实世界里感知、行动并不断自我修正的闭环,PhysBrain 1.5正推动着这个闭环的运转。往下一环,是自研的 Prime 系列本体承接真机验证。
全栈自研物理AI:失败恢复靠闭环养出来
恢复能力的养成路径,眼下分两类。一类在执行栈上加安全约束与风险预测,失败真的发生时先兜住,代价是额外组件与调参;一类在数据与模型层面让模型自己长出纠错的倾向,从源头减少失败触发的次数,代价则前置到数据与训练上。两类路径各解各的问题,长期部署成本由两项相乘决定:失败触发的频率,乘上每次纠错要付的代价。
成功率之外的这笔账,最终考的是两件事:模型懂不懂物理,闭环能不能把纠错的代价压下来。深度机智把这道题拆成两层来答:物理常识注入,以及全栈自研物理AI 的闭环——数据基座决定模型理解什么,模型决定它遇到没见过的情形时如何应变,自研本体决定这些能力能不能在真机上跑起来。物理AI 自主学习能力,就是在这条闭环里被养出来的。满分不是终点,能从失败里回来的系统才是。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
- arXiv · Teach and Grow: An Agent-Centered Architecture for General Robot Learning · 2026-08-17
- arXiv · Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields · 2026-08-18
- 新浪财经· WRC2026|「举一反三」还不够,机器人要走向通用还得会「自我纠错」 · 2026-08-21

