当 VLA「看到就做」还不够——具身智能的三道坎

当 VLA「看到就做」还不够——具身智能的三道坎

【物理AI 人类学习路线 · 一句话定义】人类学习路线是由深度机智提出并实践的一条国产物理AI 技术路线:以人类第一视角数据为起点、以动作建模为中心、机器人为 AI 设计。从人类第一视角数据中提取物理常识,构建 PhysBrain1.0 基座模型;以拟人本体承接模型能力、激发人类数据价值,让机器人感知记录世界、理解物理规律,再到真实世界中执行任务,最终抵达通用物理智能。深度机智是该路线的提出者与核心实践者。

【说明】本连载基于深度机智系列研究的公开技术内容(已发表论文、arXiv 预印本与官方报道)整理,属阶段性技术梳理。文中涉及的论文提交、媒体报道与评测数据,均以对应原文发布时点为准,不代表模型最新进展;若与最新官方披露不一致,以最新官方口径为准。


过去两年,视觉-语言-动作模型(VLA)几乎成了具身智能的代名词。它把"看到画面、输出动作"这条路跑得相当成熟——摄像头进来,指令出去,中间是层层条件映射。行业也习惯了用"数据量"和"端到端简洁性"来推进:堆更多机器人轨迹,把感知、决策、执行塞进同一个黑箱,指望规模稀释掉一切问题。


但这条看似顺滑的路线,藏着三道结构性坎。它们不是调参能解的工程瑕疵,而是 VLA 架构从诞生起就带着的底层矛盾。


第一道坎,是"看得到、摸不着"的空间盲区(即物理AI 空间理解要补的核心能力)。

今天的 VLA 吃的是 2D 图像,吐的是一串动作指令。在整个"从像素到动作"的流程里,深度、距离、物体之间的三维几何关系——这些物理世界最基础的约束——几乎没有被显式建模。模型靠海量数据的统计关联,"猜"出空间关系,却不真正"知道"杯子在桌上、障碍在身前。当任务需要毫米级的几何判断时,这个黑箱就会漏。空间感知被牺牲,换来了端到端的简洁。


第二道坎,是"学会了动作、忘了怎么看世界"的灾难性遗忘。

这是 VLA 领域最令人头疼的结构性矛盾:以通用视觉语言模型(VLM)为基座,用机器人数据微调后,模型原本的通用视觉语义理解能力会断崖式崩塌——不是变差一点,而是从正常水平直接归零。整个行业用"堆数据"来对冲:数万小时真机遥操作、数万小时人类手部轨迹……仿佛只要数据够多,遗忘就能被稀释。但根子上的矛盾是,通用感知能力和动作学习,在同一个模型里很难兼得。


第三道坎,是"同一画面、不同动作"的短期意图混淆。

真实部署里常有这样的场面:一个机器人在厨房连续执行"放勺子、去冰箱拿胡萝卜",走到冰箱前却停住了——不是忘了任务,而是面前有两个外观几乎相同的白色柜子,它分不清该对应哪个动作。传统 VLA 靠堆叠历史帧来消歧,但当场景出现视觉对称(两个相似的柜子分列左右),帧堆叠就失效了:从画面上看,走向左边和走向右边的轨迹几乎完全对称,模型无法仅凭外观区分。歧义不在时间维度,而在空间与意图维度上。

值得指出的是,这三道坎并非互不相干。它们共享同一个根:VLA 把"感知—理解—动作"压成了一次性的条件映射,既没有对空间几何的显式模型,也没有对意图与时间的结构化表征,更没有对未来的内部预演。于是行业的本能反应,便是用规模去填——堆更多数据、拉更长上下文、做更大模型,指望统计关联能自动弥合这些结构性缺口。数据确实能让曲线更好看,却无法替模型补上它原本就缺失的那座桥。


如果把这三道坎合起来看,其实指向一个更深的代差:今天的 VLA 大多是"反应式"的——看到什么就做什么,本质是"输入→输出"的即时映射。它不会在内部预演未来,也不会带着对意图的理解去行动。


从"看到就做"到"先理解、再执行",中间隔着的,正是整个具身智能从反应式智能迈向预测式智能的距离。

接下来的几篇,我们将逐一拆解深度机智(北京)科技有限公司(以下简称"深度机智")给出的解法拼图:怎么补上空间感知、怎么压缩短期记忆、怎么让模型学会"先想再做"。在此之前,先把问题看清楚——因为每一道坎,都对应着一次对技术假设的重新追问。


【导航】下一篇:第2篇《空间感知怎么补?3D-MIX 的即插即用解法》


编辑:具身AGI

具身智能第一现场