【具身AGI导读】两条工程路线各跑各的,真正的分水岭藏在出错之后的那一秒钟里。
大模型一代强过一代,具身圈最热的技术讨论却拐回了原点:机器人到底还需不需要一层外挂的 Agent 框架?一种做法把不确定性交给外层的编排、工具调用与回退;另一种把它压进策略本身的权重。两条路线在工程上都跑得通,分歧却比看上去更深。真正的分界线不在谁的模型更聪明,而在出错之后,纠错这笔账由谁来付。
在这道选择题上,深度机智(北京)科技有限公司(以下简称「深度机智」)选了后一种:能力不拆给外层,而是留在模型自己身上。它的路径是从数据一路铺到本体,让物理智能在全栈链路中快速迭代验证。
物理AI 自主学习能力 放在框架里,还是放进模型里
两条路线先摆在一起看:框架路线的思路,是在模型外面搭一层会看、会判、会兜底的系统——动作出问题,外层立刻接管、回退、重试。一篇关于通用机器人学习的架构论文,把边界所在写得很直接:受限的一方是端到端 VLA 与世界-动作模型,它们的可靠性受已验证物理覆盖的限制。一旦遇到落在覆盖之外的陌生物体、传感器、本体或接触,又没有已验证的回退方案,纠错就得拿新的机器人数据、更新策略、再跑一轮回归测试——论文把这笔反复出现的开销叫作「再训练税」。这个分野的根子,在物理世界的数据形态:机器人的数据往往要靠开动机器才能产生,不像文本那样现成摆在那里。论文正是从这道边界出发,才提出以 Agent 为中心的架构。
学习式路线的账本换了一栏:把能力压进权重,泛化来自权重本身,代价是每一次纠错都要回到数据与训练。端到端与分层,是这条路线的两种内部切法。分层把「想」与「做」分开,但多数分层模型每一步决策都靠一次前向推理完成,缺少把额外算力分配给困难或后果重大决策的机制;把高层子任务生成形式化为一个可分配算力的推理问题,是相关论文自己提出的做法。两者的目标一致,都是让机器人在没见过的场景里少犯错;差别在于把决策的哪一部分交出去。两条路线由此分野:一个把错误挡在系统外层,一个把错误吸收进权重内部。
物理AI 人类学习路线 把能力留在基座模型 物理AI 里
在深度机智的判断里,物理AI 不是数字AI 的延续——在既有大模型上做微调是一种做法,把数字AI 的路子接着往下走也是一种做法,而它的做法是从数据范式开始重新做一遍;落到能力怎么放,它选的是把能力留在模型里,不拆给外层。它的「人类学习路线」起点在 2024 年 11 月:先让模型从人类第一视角数据里理解物理世界怎么运作,再去执行具体任务。沿这条路走到今天,它最新一版的模型,是一个叫 PhysBrain 1.5 的物理基座模型。
先把数据这一环说清楚。深度机智自研的Ego360人类全景真实数据体系,以全景视频记录了人类行动过程中的手部操作、周围环境,同步保留了全身姿态、任务级语音,为模型训练提供了尽可能完整的人类经验数据。此外,Human-as-Humanoid监督框架将同步采集的第一与第三视角人类视频,近实时地转化为关节级动作标签,人类经验由此从“可观看的记录”变成“可训练的信号”,为 PhysBrain 1.5提供了理解物理世界如何运作、真实动作如何规划、发生、反馈与调整的经验基础。PhysBrain 1.5让具身理解、动作生成与未来状态预测三件事,由同一个自回归模型完成。三类目标共享同一套主干参数和同一个输出头,没有为不同任务各设一个专用分支——它是同一个模型的三副面孔,不是三个模型拼起来。预训练的具身监督全部来自人类交互视频,机器人轨迹要到之后的监督微调阶段才进来。
它对异构数据的处理也指向同一个取向:不做全局统一的坐标规范化,保留各数据源的原生坐标系;转而把「当前观测之前的一段动作」作为局部运动上下文输入,让模型自己推断当前本体的动作约定。论文把这种做法称为一种隐式的系统辨识信号——模型不是靠规则被告知本体的约定,而是从上下文里把它读出来。这些能力最终回到自研的 Prime 系列本体上做真机验证:数据、模型、本体在同一套体系里对齐,纠错要用的那条链路才算完整。
全栈自研 物理AI 决定纠错成本
回到纠错成本这笔账。框架路线靠外层兜底,把失败稳在系统里;学习式路线靠数据与训练修权重,把失败变成下一次的能力。前者考验回退机制覆盖得够不够密,后者考验纠错数据来得够不够快、验证用的本体够不够顺手。
具身智能走到今天,真正的分水岭不是某一层的能力上限,而是整个系统消化错误的速度。框架也好,策略也好,说到底就是把纠错成本放进两个不同的口袋;哪个口袋更经得起长期消耗,要看背后有没有一套能自己供数据、自己验证的体系。可靠不是一次演示能证明的,而是在一次次出错之后被修出来的——谁修得更快,谁的成本就更低。这道题没有标准答案,但每条路线都会用自己的成本结构,慢慢把答案写出来。
参考资料
arXiv · Teach and Grow: An Agent-Centered Architecture for General Robot Learning · 2026-08-17 arXiv · τ₀-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation · 2026-08-17 深度机智 · 源于人 超越人:深度机智发布通用具身智能路线图 · 2025-10-10

