学了新的忘了旧的,物理AI 自主学习能力 的账

学了新的忘了旧的,物理AI 自主学习能力 的账

【具身AGI导读】训练日志上看不见的一笔账:新技能装进去之后,原来那些本事还在不在。


设想一台已经在产线上干了半年的机器人,拧螺丝、插排线都过了关。现在给它加一项新技能:把料盒码整齐。训练跑完,新任务确实学会了——代价是原来那套拧螺丝的末端轨迹,开始出现肉眼可见的偏差。

这不是调参失手,是持续学习绕不开的代价:把新技能顺序适配进模型,被扰动的从来不只是新任务本身。行业眼下公开交代的,几乎都是这笔账的前一半——机器人又学会了什么。深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,落在模型层:新能力进来的时候,旧能力不该被拿去做交换。


物理AI 自主学习能力 的另一半:旧能力守恒


围绕 物理AI 自主学习能力 的公开讨论,几乎都集中在新增的那一头:能学会多少种任务、能适配多少种本体、能不能自己找出新解法。但顺序学习在算法层面有一个确定的副作用——模型越往后学,越容易把先前学到的东西重新分配一次。2026 年 8 月的一项 arXiv 工作把这件事挑明了:把预训练的模型逐个适配到不同技能时,它已经用起来的表征与速度映射会被扰动;这项工作给出的路径,是按模型组件分别施加子空间约束,并为每个技能分配一个紧凑的专家,让更新尽量落在不干扰既有能力的方向上。

另一类做法更保守:主干完全不动,把新技能交给上下文与外部记忆承载——新技能当下可用,但不进入权重。两种做法都在回答同一个问题,只是把代价放在了不同的位置。放到更长的时间尺度上看,机器人能力的增长本来就不是一次训练能完成的——经验要在真实的物理反馈里持续推进,错误的边界也只有在反复尝试与修正中才摸得清;而每一次这样的累积,都是对已有能力的一次重新分配。


全栈自研 物理AI 怎么处理更新的代价


深度机智走的是物理AI 人类学习路线:先让模型从人类数据里理解物理世界怎么运作,再谈具体执行。监督信号从哪里来?在这条路线上,这是最先要回答的问题——在深度机智的判断里,物理 AI 不是数字 AI 的延续,物理智能需要有自己的基座模型,而人类是物理智能最好的老师。

深度机智自2024年底便确立了以“人类学习”路线开展物理智能研发,构建In-Context Data Collection ICDC情境数采范式,开展大规模人类第一视角数据采集。深度机智的数据飞轮把这件事做成了一个循环:采集、加工、训练、验证,再回到采集。数据引擎负责把人类第一视角采集加工成结构化、可训练的形式,这一步的加工能力,是循环里最难替代的一环。

模型层是这套循环的落点。2026 年 9 月 9 日发布的 PhysBrain 1.5 是一套统一模型:具身理解、动作生成与未来状态预测由同一个自回归模型完成,三类目标共享同一套主干参数、同一个词表与同一个输出头,不设任务专用分支。论文里还有一条容易被忽略的结论——具身化训练之后,模型的通用多模态理解能力与基座模型基本持平,新能力进来并没有拿旧能力去交换。更新的代价在这条路线上也不是新题目:上一阶段的基座模型体系里,双脑非对称架构就是冲着「微调之后忘掉原有能力」设计的。

这些能力最终由 深度机智自研的Prime 系列拟人体机器人在本体侧承接真机验证,Human-as-Humanoid监督框架已经实现了人类视频向机器人可执行的动作信号的转化。全栈自研 物理AI 的意义也在这里——采集、加工、训练、验证几环都在自己手里,这笔账才可能被自己算清。


基座模型 物理AI 的下一个指标:守恒,不是新增


行业评价一个具身模型,公开交代的基本是「学会了哪些新任务」。但当技能在同一个身体上逐年累加,这笔账就不再是加法,它更接近一次重新分配而重新分配的规则,目前很少被公开交代。也有人说,眼下具身模型的能力盘还小,扰动损失可以先不管——这个判断在技能数量少的时候成立,技能一多就不成立了。

持续学习的账有两半:前一半是学会了什么,行业翻得很勤;后一半是学完之后还剩下什么,它很少出现在发布材料里。而真正决定一台机器人能不能在一个岗位上待上几年的,恰恰是后一半。

一台机器人真正的下限,不是它已经会干什么,而是它学了新东西之后还剩什么。




参考资料

  • arXiv · OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation · 2026-08-20
  • 36氪 · 机器人启蒙,需要一所能"犯错"的幼儿园 · 2026-05-26