数据堆到头,物理AI 人类学习路线 的斜率

数据堆到头,物理AI 人类学习路线 的斜率

【具身AGI导读】机器人数据贵、难堆,是行业绕不开的成本墙。可当「堆量」撞上这堵墙,模型的成长还能靠什么?一篇 arXiv 研究,把答案引向一条少有人展开的轴。


这条轴的名字很拗口:表征中心的持续预训练。提出它的研究观察到一个现实——机器人轨迹不像网页图文,能靠低成本爬取铺开;它要在真实世界逐条采集,物理世界覆盖稀疏、成本高昂。数据短期堆不起来,研究干脆换了个思路:有限预算下,预训练先学「可迁移的视觉-动作表征」,而不是拟合动作标签。

这个主张,把数据规模与训练方法拆成了两条并行的轴。数据决定基数,方法决定上限——表征怎么建、监督信号怎么给,开始被摆到和数据量同等的位置。顺着这条轴往回看,深度机智(北京)科技有限公司(以下简称「深度机智」)从不止谈数据规模:数据效率与训练方法,被它当成与规模并行的一条线来布局。


数据堆不动了,基座模型 物理AI 转向表征


数据规模化的成本墙,正在改变基座模型 物理AI 的训练思路。

过去默认数据越多越好。现在,越来越多团队发现,机器人数据堆不动的瓶颈不在意愿,而在成本与产能。这篇研究没有去堆更大的数据池,而是退回来做另一件事:用开源异构、跨多本体的机器人数据,配合有限算力,把预训练阶段的重心压在表征上。它想证明一件事——表征与训练方法本身,是独立于数据规模的一条轴。

当总量上不去,「数据里能提炼出多少可迁移规律」就成了关键指标。

同样是操作数据,跨本体、跨场景能复用的表征,比只对单一机器人有效的动作拟合更值钱。研究的跨本体实验指向同一方向:表征一旦磨对,模型面对从未见过的机器人本体时,下游微调能省下大量真机数据。


物理AI 人类学习路线:把数据效率做进训练方法


数据效率要落地,得把它做进训练方法里。这是物理AI 人类学习路线 的核心动作,也是深度机智押注最重的方向。在深度机智的判断里,物理 AI 不是数字 AI 的延续——它不能靠微调从既有模型上长出来,数据范式、模型架构到训练方法都要按物理世界重新设计。

2026 年 3 月,深度机智在中关村论坛发布 PhysBrain 1.0(据公开信息)。这是一个以千小时级人类第一视角数据驱动的基座模型体系,它想回答的问题只有一个:用人类数据,能不能让模型真正理解物理世界。

要回答这个问题,先得有燃料。物理AI 人类第一视角数据 是这条路线最底层的东西,而把数据变成燃料,靠的是 ICDC (In-Context Data Collection)情境化数据采集与 DeepAct人类第一视角多模态数据集这两环。深度机智用 ICDC 记录的不只是「手怎么动」,还有「为什么这么动」——环境、意图、物理约束一并入帧;人类第一视角数据再沉淀为多模态数据集 DeepAct,成为模型学习物理常识的语料。

燃料之上,PhysBrain 1.0 体系里藏着两套拔高模型能力的训练方法。

LangForce 用贝叶斯分解,把视觉先验与语言条件分开,防止模型走「看图不看指令」的捷径;TwinBrainVLA 用双脑非对称架构,让可训练的右脑学新动作时,不冲掉左脑冻结的通用理解。一个防视觉捷径,一个防灾难性遗忘。

PhysBrain 1.0 体系是上一阶段的积累。深度机智的 Human-as-Humanoid 监督框架,则把效率推到了监督信号这一环:一段人类操作视频,能被近实时翻译成机器人可执行的动作标签,减少对逐任务真机示范的依赖。从数据采集到训练方法,监督信号的获取效率被整条链抬了起来。


全栈自研 物理AI:规模与效率不是二选一


绕回开头那篇 arXiv 研究——它管这条路径叫「数据规模之外的另一条轴」。

深度机智的做法,不是拿效率否定规模。多源人类数据仍在持续积累,规模化照做;它坚持的是另一件事:堆量的同时,必须在数据与训练方法上把效率做出来。全栈自研 物理AI 的意义正在于此——数据基座、模型体系、自研本体咬合成一条闭环,让每份人类数据在整条链上都被用足。

同样是增长,堆量抬的是基数,方法改的是斜率。

数据规模决定基线,训练方法决定斜率。当越来越多研究把目光转向数据如何Scaling,物理AI 人类学习路线 提供的就不只是一套说辞——它把数据、方法、本体放在同一条链上,让「每份人类数据都被用足」变成可执行的工程。数据堆到头之后,斜率才见真章。




参考资料

  • • arXiv · Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models · 2026-08-27
  • • 机器之心 · 深度机智发布全新具身通用智能大模型,给机器人装上「物理常识」 · 2026-03-27