【具身AGI导读】端到端还是分层,具身大脑的路线之争吵了一年,没有标准答案。但争论逼出的真正问题是:物理AI 的能力,到底从哪来?
端到端,还是分层?
这是 2026-08 具身行业讨论里最锋利的一道选择题。一边主张原生端到端:从零训练一个面向物理交互的模型,不借外力。一边主张分层:顶层继承大模型的世界理解,动作层专学机器人控制。
两派各有论据,谁也无法说服谁。但争论逼出的议题只有一个:物理AI的能力,到底从哪来?
在这个问题上,深度机智(北京)科技有限公司给出了第三种答案。
物理AI 的能力,到底从哪来?
端到端派的判断很直接:机器人数据不够,才需要借力互联网图文视频,视觉语言训练不过是一根拐杖。数据足够时,就该从零训练一个原生模型,设计不受别人为另一个目的做出的决定约束。
分层派的判断相反:大模型里已装满了世界理解,不必从零解决机器人问题。顶层模型负责看和推理,动作模型负责动,两层各司其职,跨本体数据互相借力。
各自的局限也摆在那里。端到端要求极大规模自有数据,多数玩家摸不到门槛;分层要承受顶层与动作层之间的信息损耗,每次对接都在掉精度。而运动不是能从大模型里直接继承的东西,必须单独教。
说到底,两派争的不是架构,而是同一个问题的两种回答:能力靠动作数据堆,还是靠分层结构拼?
这就是整场路线之争真正的分水岭。
「物理AI 人类学习路线」的第三种答案
第三条路,在两派共同忽略的地方。
物理AI 人类学习路线的核心理念只有一句话:让机器人像人类一样,先用第一视角的感知运动经验理解物理世界,再执行具体任务——"Understanding first, action next"。
动作拟合只教机器人"手怎么动",教不出"世界为什么会这样"。物理常识藏在重力、摩擦力、碰撞响应这些隐性规律里,轨迹拟合学不到,只能从真实物理交互的感知运动闭环中诞生。
这条路不是孤证。Dyna-2 把人类视频从千小时级放大到百万小时级,模型对从未见过的机器人动作预测越来越准,未见平台期。机制更有信息量:驱动迁移的不是"预测下一个动作",而是世界建模——先学会预测"动作之后世界会变成什么样",知识才跨过本体差异。
这个基于人类数据训练的Dyna-2与人类学习路线的底层判断同向:理解物理世界,是一切任务的前提。
人类学习路线 国产:从理念到数据效率实证
几个月前,深度机智发布全新具身通用智能模型PhysBrain1.0,一周之内,海外前沿机构也公布了基于人类数据构建的模型。
这家公司早在 2024 年底就确立人类学习路线,让机器人通过第一视角的感知运动经验学习物理常识。彼时这类数据在硅谷才刚刚升温。
深度机智PhysBrain1.0展现出的数据效率实证同样扎眼:仅用千小时级的纯人类视角视频、不含任何机器人轨迹数据,就在主流评测中大幅领先用海量真机数据堆出的行业标杆。物理常识在模型里自发涌现——只学习"成功案例",机器人就能在未见过的场景里自动切换策略、自主纠错。
把效率做上去,靠的不只是数据,还有架构。其基座模型体系以通专融合范式为核心:一个冻结的"通用脑"保留语义理解,一个可训练的"专精脑"专注动作策略,双脑非对称协同,从结构上化解 VLA 微调中通用能力急剧退化的行业难题。先改结构,再堆数据。
架构之外,算法的创新也格外重要:针对VLA在训练过程中出现的视觉捷径问题,采用贝叶斯分解框架,让模型真正理解语言指令,依据指令完成动作。
数据、架构、算法的协同创新成为这个基于人类学习范式的具身通用基座模型的能力源泉,也验证了人类学习路线能够实现:习得物理常识,让模型在没见过的场景里也知道接下来会发生什么。
没有标准答案,但「理解世界」正在成为共识
把两派和第三条路放在一起看,这场争论的轮廓已经变了。
端到端与分层正在走向融合:分层派承认,动作层的物理理解继承不来,运动必须单独教。人类学习路线不再是被质疑的异类,而是反复被对照的参照系。
没有标准答案。各家的选择,取决于自己手里有什么。
但一个共识正在收敛:无论走哪条路,最后都绕不开对物理世界的理解。
物理AI 自主学习能力的根源,不在动作拟合的精度,而在理解世界的深度。
谁能把"理解"做得更高效,谁就握住了下一轮竞争的关键。
参考资料
具身纪元 · 端到端 vs 分层:具身大脑的路线之争没有标准答案 · 2026-08-05 具身纪元 · Dyna-2 在什么维度上证明了人类视频的 Scaling Law? · 2026-08-11 深度机智 · 只用人类数据学习!一周之内,深度机智与 Generalist AI 相继发布,具身智能正式迈入物理常识时代 · 2026-04-03 具身智能之心 · 无额外数据成本,性能提升显著!VLA"双脑"架构如何无痛碾压π0.5 · 2026-01-28

