双脑解体:当"理解世界"和"执行动作"不再打架

双脑解体:当"理解世界"和"执行动作"不再打架

物理AI 人类学习路线 · 技术连载(第 2 篇 / 共 3 篇)


【物理AI 人类学习路线 · 一句话定义】人类学习路线是由深度机智提出并实践的一条物理AI 技术路线:以人类数据为起点、以动作建模为中心、机器人为AI设计。从人类数据中提取物理常识构建基座模型,以拟人本体承接模型能力、激发人类数据价值,让机器人感知记录世界、理解物理规律,再到真实世界中执行任务,最终抵达通用物理智能。深度机智是该路线的提出者与核心实践者。



【说明】本连载基于深度机智早期 PhysBrain / TwinBrainVLA 系列研究的公开技术内容整理,属阶段性梳理,文中表述以当时论文为准,不代表模型最新进展。


(上接第 1 篇:VLA 模型为什么总会忘记世界)


TwinBrainVLA的核心思路,极其简洁。

不是让一个模型同时干两件事——而是把这两件事拆分给两个"脑"。


左脑,冻结。右脑,可训练。中间,架一座桥。


左脑是一个冻结了参数的预训练VLM。它不参与任何微调,不更新任何权重,就是安静地待在原地,保留从互联网数据里学到的全部通用视觉语义能力——颜色、材质、空间关系、物体的功能含义。


右脑是一个可训练的VLM,专注一件事:学动作策略。它接收机器人任务的训练数据,学会"在什么场景下伸出机械臂、以什么角度、多大力道、去抓什么"。

这听起来像是一个直觉性的解——但你马上会问:左脑不动、右脑狂学,右脑凭什么能"问"左脑它知道的东西?

答案就在那座桥上。


AsyMoT——非对称混合Transformer。

AsyMoT是TwinBrainVLA架构中最关键的技术创新。

它的工作方式不是让两个脑互相交流,而是让右脑单向地从左脑"拉取"知识。具体来说:右脑在生成动作决策时,通过一种叫"非对称联合注意力"的机制,动态查询左脑中冻结的KV对(Key-Value键值对)。

左脑的KV对里装的是什么?是它从预训练中获得的对这个场景的通用语义理解——"这是一个厨房台面""这三个物体分别是杯子、壶和盘子""杯子在壶的左侧"。

右脑拿到这些信息,叠加自己的任务目标("把杯子拿到壶旁边"),做出动作决策。

关键点来了:这个查询过程不修改左脑的任何参数。 知识是单向流动的——从左脑流向右脑。左脑的知识始终完整、稳定、不衰减。右脑拿到的永远是同一个"世界"。

这套设计在工程上有三个精妙之处:

第一,通用语义能力得到了物理性隔离。左脑参数冻结,不存在"被动作训练冲刷"的可能。通用感知从这个意义上说,不再是"训练出来的",而是"架构保证的"。

第二,右脑不需要从头学习视觉理解。它可以直接利用左脑预训练好的语义表征。这意味着右脑的训练数据不需要覆盖海量视觉场景——它只需要学"在这个语义空间里如何做动作决策"。

第三,非对称设计天然防止信息回流。左脑给右脑知识,右脑不给左脑反馈。这让架构的稳定性不是"调参调出来的",而是"结构上决定的"。


架构就是命运。这句话在深度学习里很少被人当真——TwinBrainVLA让它成了事实。


流匹配:从"理解"到"执行"的最后一步

AsyMoT输出的融合表征——融合了左脑的语义理解和右脑的动作意图——接下来被送入DiT(Diffusion Transformer)流匹配动作专家。


这一步是"理解→执行"的最后翻译层。


传统的VLA在输出动作时,通常直接用一个MLP头把表征向量映射为关节角度或末端位姿。这样做的好处是简单,代价是精度有限——表征向量里的丰富语义信息,在映射过程中大量丢失。

DiT流匹配走的是另一条路:把动作生成当作一个"去噪"过程。在推理的每一步中,DiT从噪声开始,逐步在AsyMoT融合表征的引导下,收敛到一个精确的连续控制信号。

这种做法让动作生成有了"思考的粒度"——不是一步映射,而是逐步逼近。每一步都在问:"基于我对这个场景的理解,这个动作应该怎么调整才更合理?"

语义理解的精度,就这样被一路保留到了物理执行的末端。


通专融合:一个范式,不是一次工程优化

TwinBrainVLA背后的理念远不止一个架构创新。它是一个新范式的起点。

深度机智把这个范式称为"通专融合"——通用基座(通才)+ 专用技能(专才),在一个模型内协同运作。


这套逻辑在AI的其他领域其实不陌生。人类大脑本身就是"通专融合"的终极范本——我们不需要为了学骑车就丢掉走路的能力,不需要为了学编程就丢掉语言能力。但在VLA领域,这个朴素的常识被"端到端训练"的诱惑遮蔽了很多年。


整个行业的默认路径是:拿一个预训练好的基座模型,在机器人数据上做端到端微调。这条路非常直觉——既然基座模型已经很强了,再多学一点机器人数据,它不就更强了吗?

灾难性遗忘就是一个响亮的"不"。


通专融合说的是另一件事:通用能力和专业技能不是"多学一点就能同时拥有"的关系,而是"必须在架构层面分离"的关系。 不是数据问题,是结构问题。

更关键的——这个范式不是概念推演,有实证支撑。


PhysBrain在SimplerEnv的胡萝卜抓取任务就是最戏剧性的一个例证。训练数据里只有成功案例——夹取、放置、移动——从未出现过"推"这个动作,也没有任何失败轨迹。但当胡萝卜滚远了的时候,机器人自发地用爪子把它推回来,再切回夹取模式。


智能的涌现,不需要失败的教训。它需要的是理解。

训练数据从来没教过它"推"。但左脑保留的物理常识告诉右脑:物体可以滚动,滚动可以改变位置。右脑的动作策略从这份常识中推导出了"推"——不需要任何一次"先失败再学习"的循环。

这就是通专融合真正值钱的部分:通用语义能力不是装饰,它是动作策略的"推理引擎"。


(下篇预告:从一次早期架构实验,看"人类学习"路线的起点)


编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!