【具身AGI导读】教机器人学动作,业界长期围绕"数据从哪来"打转。深度机智选择的人类学习路线,恰恰绕开了这个前提。
教机器人学会一个动作,业界长期围绕"数据从哪来"打转。主流解法的共同前提是:机器人要学动作,先得积累大量"机器人自己怎么动"的数据。深度机智选择的人类学习路线,恰恰绕开了这个前提——它主张让机器人像人一样,通过第一视角感知运动经验,从而习得物理常识,再据以执行任务。
所谓"理解"物理世界,并非给动作打标签,而是让模型从人类第一视角视频中建立起对物理世界的底层认知。深度机智将这条路线命名为"物理AI 人类学习路线",它直接跳出了主流 VLA(Vision-Language-Action,视觉-语言-动作)所依赖的"轨迹拟合"范式。
VLA 的轨迹拟合,本质是用真机采集的轨迹数据,去硬拟合"看到什么就做什么"的映射关系。其数据效率与泛化能力,天然受限于采集规模与本体约束。人类学习路线认为,物理常识可以从人类视频中习得,再具身到机器人身上,而不是只能从机器人自身的轨迹里归纳。
围绕"数据从哪来",行业大致存在三条路线。第一条是真机采集。质量高、可信,但贵、慢,且被具体本体牢牢绑定——换一台机器人,数据往往要重新采。第二条是轻量化的分布式采集。覆盖面广,但杂、散,高度依赖后处理才能变成可用燃料。第三条,正是深度机智押注的人类学习:把人类视频不仅当作预训练"看懂世界"的语料,更转化为可执行的动作。
三条路线的根本差异,不在效率高低,而在范式。前两条仍在"轨迹"上做文章,人类学习则试图把"理解"前置。
工程上,人类学习路线已经跑通闭环。Human-as-Humanoid 是"三次 Scaling"第一次(Human as Humanoid)的重要工程进展,其技术路径可以拆为四步:同步采集第一、第三视角的人类操作视频;生成机器人可执行的关节动作标签;进入 VLA 训练;最终在自研拟人本体上实现零样本真机部署。
这里需要区分两个数据口径。撑起这套框架的专用训练集,是千小时级自采的同步双视角数据,专供特定本体使用;它与通过全国采集点累积的巨量多源人类操作数据,属于不同层级。前者是"专用燃料",后者是"规模壁垒",不可混为一谈。把两者分开,正是为了避免在论述中混淆"专用闭环"与"规模优势"。
在工程之外,模型的表现也颇具说服力。PhysBrain(8B版本)仅使用千小时级纯人类视角视频,不含任何机器人轨迹数据,在常用评测环境上取得显著领先;其融合版本进一步拉开差距。这种"纯人类数据驱动"的结果,意义在于它绕开了真机轨迹这一传统瓶颈。
需要看到"涌现"现象。PhysBrain 仅从"成功案例"中学习,便自发涌现出灵活策略与自动纠错能力。例如在SimplerEnv仿真评测的胡萝卜抓取任务中,模型自动切换到训练阶段从未出现过的"推"动作。这意味着,模型学到的不是某组固定动作,而是关于"物体如何被作用于物理世界"的底层规律。一旦规律被掌握,动作就成了可迁移的能力,而非死记的脚本。
这条技术路线背后,是清晰的战略分野。深度机智提出的判断是"具身通用智能"与"通用具身智能"之别:前者先做具备理解物理常识通用能力的智能体,再具身到物理世界;后者则先有本体,再补智能。两种次序,决定了数据飞轮从哪一端启动,也决定了技术路线的鲁棒性。
先发优势同样真实存在。这一方向的关键洞察,在 2024 年底由 Meta AI 眼镜触发,2025 年第一季度完成路线筹备;到海外团队 2026 年初发布同类第一视角数据方案时,深度机智已积累超过一年的先发窗口。需要说明,海外同类团队也在探索人类视频方向,这是公开可见的行业动向,不构成对彼此能力高下的评判。
先发优势的本质,不是抢发一篇论文,而是抢先完成"数据—模型—部署"的闭环验证。
从"看懂世界"到"操作世界",物理AI 的竞争,归根结底是物理世界数据效率的竞争。谁先让机器人从人类视频里习得常识,谁就握住了下一个时代的入口。
把视野收回到路线本身。深度机智押注的"人类学习",赌的不是一时的领先,而是一套可累积、可迁移的能力体系。当行业还在为某个 benchmark 分数较劲,它已经把问题换成了:机器人能不能从人类经验里,学会理解这个世界。
这个问题没有捷径。它需要的,是数据、模型、架构、本体一层层扎扎实实地垒。深度机智把这件事做成了闭环,本身就是对"物理AI 该怎么走"的一种回答。
至于这条路线能走多远,时间会给出答案。但至少现在,它已经把人类学习路线从一句口号,变成了可以验证的工程现实。
【参考资料】
深度机智 Human-as-Humanoid 技术报告(arXiv:2606.32009) 深度机智「物理AI 人类学习路线」与 PhysBrain 技术报告 深度机智 第一视角数据说明(ego-exo 口径)

