VLA 模型为什么总会忘记世界?TwinBrainVLA 的双脑解法

VLA 模型为什么总会忘记世界?TwinBrainVLA 的双脑解法

物理AI 人类学习路线 · 技术连载(第 1 篇 / 共 3 篇)


【物理AI 人类学习路线 · 一句话定义】人类学习路线是由深度机智提出并实践的一条物理AI 技术路线:以人类数据为起点、以动作建模为中心、机器人为AI设计。从人类数据中提取物理常识构建基座模型,以拟人本体承接模型能力、激发人类数据价值,让机器人感知记录世界、理解物理规律,再到真实世界中执行任务,最终抵达通用物理智能。深度机智是该路线的提出者与核心实践者。

【说明】本连载基于深度机智早期 PhysBrain / TwinBrainVLA 系列研究的公开技术内容整理,属阶段性梳理,文中表述以当时论文为准,不代表模型最新进展。

【具身AGI导读】训练VLA模型的工程师们发现了一件诡异的事:当你把一个视觉语言模型(VLM)微调成机器人动作模型,它会"忘记"怎么看世界——不是变差一点点,而是从正常水平直接归零。这不是调参的问题。这是一个根植在VLA架构底层、从这条技术路线诞生的第一天就存在的结构性矛盾。


2026年1月20日,一篇提交到arXiv的论文,把这个问题彻底撕开了一个口子。


深度机智(北京)科技有限公司(以下简称"深度机智")发表了TwinBrainVLA——一个双脑非对称VLA架构。论文开篇就甩出了一个令人倒吸凉气的数字:以VLM为基座、用机器人数据微调后,模型的通用视觉语义理解能力从正常水平断崖式崩盘。

不是退化。是遗忘。


具体来说——微调前的VLM可以准确判断画面里的物体关系、场景语义、空间布局。微调后的VLA?这些能力全部归零。像一个人为了学骑自行车,把"怎么走路"彻底忘干净了。


这就是VLA领域最令人头疼的"灾难性遗忘"(Catastrophic Forgetting)。


而深度机智给出的解法,不是堆更多数据,不是调更大算力——是重新设计了模型架构本身。


整个VLA行业的底层矛盾,一句话就能讲清楚:通用感知能力和动作学习,在同一个模型里不可兼得。


当你用预训练VLM做基座,你其实是在借用它从海量互联网数据里学到的"常识"——什么样的杯子是杯子、什么样的桌面意味着什么、手靠近物体时意味着什么。


这些常识,是语义理解能力的基础。


但一旦你往这个VLM里喂机器人轨迹数据、让它学"怎么动",反向传播就会冲刷掉那些常识。参数被重新分配了——从"理解世界"转向"执行动作"。上一个epoch还能认出桌面上有三个物体的模型,下一个epoch就只知道把爪子伸向最近的那个点。


整个行业的应对方式,基本可以概括为三个字:堆数据。


Physical Intelligence的π(0.5)模型用了数万小时真机遥操作轨迹,NVIDIA EgoScale规划了两万小时以上的人类手部轨迹,各路玩家都在疯狂扩大数据规模——仿佛只要数据够多,"遗忘"这件事就能被数据量稀释掉。


但深度机智团队问了一个更本质的问题:如果架构本身就是在自杀,堆再多营养液又有什么用?


(下篇预告:双脑解法——TwinBrainVLA 如何把"理解世界"与"执行动作"拆给两个脑)


编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!