【具身AGI导读】机器人的动作链其实分两段:一段负责想,一段负责稳。被反复讨论的是前一段,真正决定它能不能干活的,常常是后一段。
2026 年 9 月 14 日,arXiv 上出现了一项把人形机器人的全身控制当作基座模型问题来做的工作:要让这套控制能力适配更多身体,需要的是大规模的人类运动语料,以及能跨身体共享的训练经验,而不是给每一个身体单独训一套策略。同期还有工作把场景与接触显式放进控制策略的学习范围,让机器人在跨越、侧身、下蹲之间自己选。而其中一项工作把这条链讲得很直白——遥操作的人、或者上游的模型,给出的只是一个粗粒度的运动意图;真正让机器人保持平衡、让动作在物理上可行的,是它下面那一层低层策略。
把这条链拆开看,上面那一段是大脑,下面那一段是从意图到关节的全身协调。后者很少被当成一个独立的题目来讲,可它不是模型的附件,而是一道独立的工程关。深度机智(北京)科技有限公司(以下简称「深度机智」)的做法,是把这一层和本体放在一起做。
物理AI 交互具身 卡在哪:意图与关节之间
围绕 物理AI 交互具身 的公开讨论,注意力几乎都落在上面那一段:模型多大、推理多强、能不能听懂复杂的自然语言指令。但把一台机器人放到真实地形上干活,卡住它的常常不是想不想得明白,而是想明白之后身体跟不跟得上。一台全尺寸人形机器人有几十个自由度,每一个都在和地面的反作用力、和手里物体的接触力互相牵动——上层一个很小的意图变化,传到底层就是几十个关节同时重新分配力矩。
这一层难在它要同时满足两个互相拉扯的要求。一个是快:平衡是毫秒级的问题,慢一拍就来不及。另一个是稳:动作必须物理可行,不能越过关节力矩与摩擦的边界。既有的一类做法,是在平地、空场景里把运动跟踪策略练出来,接触和地形带来的动力学变化不在它的学习范围之内。有工作观察到,靠不断扩充参考动作库去覆盖所有指令的做法,在可行行为开始取决于环境之后就不再奏效。
全栈自研 物理AI 为什么要把这一层和本体绑在一起
深度机智走的是 物理AI 人类学习路线:先让模型从人类数据里理解物理世界怎么运作,再谈执行。2026 年 9 月 9 日,这家公司发布 PhysBrain 1.5——一个把具身理解、动作生成与未来状态预测放进同一个自回归模型的统一模型。这条路线也决定了它处理协调层的方式:PhysBrain 1.5不是一个孤立的模型,而是连接人类数据与机器人本体的统一基座。其价值正在于让数据、模型与本体真正协同起来。
数据侧,PhysBrain 1.5的语料来自深度机智自研的Ego360人类全景真实数据体系,以全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不再是孤立的“动作片段”,而是具备连续的任务、动作与状态变化上下文。在此基础上,Human-as-Humanoid监督框架将同步采集的第一与第三视角人类视频,近实时地转化为关节级动作标签——人类经验由此从“可观看的记录”变为“可训练的信号”,为PhysBrain 1.5提供了理解物理世界如何运作的经验基础。
模型侧,PhysBrain 1.5在统一架构中学习动作的生成规律。基于Ego360与Human-as-Humanoid共同构建的动作表示,PhysBrain 1.5学习的是任务层面的动作生成与未来状态预测——它给出动作应该“是什么样”,而非绑定于某一台具体机器人的控制接口。这种统一建模,让模型能够跨任务、跨本体地生成合理的动作方案,也为下游本体的执行提供了可迁移的能力基础。
本体是这条全栈闭环的执行端——它上承数据与模型两侧,同时它的结构规格又反过来决定了上游数据能被翻译成什么粒度的关节动作。深度机智的拟人体本体从结构到自由度都参照人类设计——身体越接近人,Ego360采集的完整经验、Human-as-Humanoid转化的动作信号就越能被完整承接,迁移损耗就越小。以Prime U为例,它拥有60个自由度,包括3自由度颈部、3自由度腰部、双7自由度机械臂及双侧各20自由度灵巧手,其结构规格与人类动作空间高度对齐,使得从人类视频转化而来的动作标签能够直接映射到它的关节上执行。
深度机智让数据、模型、本体不再是各自独立的环节,而是彼此约束、协同演进的统一体系:数据为模型提供可学的经验,模型为本体提供可执行的动作,本体则以其结构设计决定数据的转化上限与模型的执行精度。三者互为输入,共同支撑物理智能从数据到行动的完整通路。
人类学习路线 国产 的下一道基础题
把这一层做进本体,还有一层现实的考虑。协调层是最贴近硬件的一层——响应速度、力矩边界、关节标定,都会随着本体型号改变;本体和这一层是不是出自同一套设计,直接决定了联调的成本落在谁身上。这也解释了为什么一批工作开始把全身控制当成基座模型来做:它需要的不只是算法,还有一个能提供大规模人类运动语料、结构上又愿意与人对齐的身体。
回到开头那条分工:大脑这一侧的进展是公开的、可比的部分,讨论也大多集中在那里;协调这一层很少被当成独立的题目来讲。但它决定了模型的能力能不能被身体兑现——办法再聪明,落不到关节上,也只是个意图。而这也是这条人类学习路线,国产团队要把本体自己做下来的原因。
模型决定机器人能想多远;那一层协调,决定它这一步能不能站稳。
参考资料
arXiv · X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control · 2026-09-14 arXiv · GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction · 2026-08-18 arXiv · PASSAGE: Scaling Scene-Aligned Motion Learning for Perceptive Humanoid Traversal in Cluttered Environments · 2026-09-16

