【具身AGI导读】当行业开始给物理能力算成本账,规模化就变成了一道算术题:让机器人学会下一项能力,还得再花多少钱?这笔账,可能改写整个赛道的玩法。
能力开始按 Token 计价
机器人学会一项新技能,到底要花多少钱?
最近,行业里兴起一个词——Physical Token 经济学。
它说的不是机器人将来按 Token 收费,而是把物理智能体的能力,拆成「单位可靠物理智能」来算账。
这笔账问的是:以通用物理智能为目标,生产一单位可靠物理智能,需要多少人力、数据和算力?
要算清这笔账,得看三件事:基础设施能不能从重复投入沉淀为长期资产;能不能用更少的昂贵真实数据,换回更多训练经验;数据和模型能不能跨本体、跨场景复用。
过去,大家只盯一件事——模型能做多少。
如今风向变了。衡量标准转向另一个指标:获取新能力的边际成本。
如果机器人从第 1 项能力扩展到第 100 项,每一项都要付出相近的数据、算力和工程,那能力再多,也只是项目数量的增加。
只有当新增一项能力的成本,随着积累不断下降,物理智能才算真正有了规模经济。
能力,开始按成本计价。
成本账的核心,是「单位能力的数据成本」
成本账的关键,藏在数据里。
机器人需要的动作、接触、受力和失败经验,大多要在真实世界里通过交互获得。每一次采集和试错,都是设备、算力和人力的投入。
所以成本账的核心,落在一句话上:单位能力的数据成本。
真机轨迹数据贵、慢、受本体约束,规模化难。要压低这笔账,得回答同一个问题——能不能用尽可能少的昂贵真实数据,换回更多有效训练经验。
这是国产玩家正在面对的分水岭。过去拼的是能不能做出来,现在拼的是做出来要花多少。
物理AI 国产 玩家也在算这笔账。基座模型物理AI的竞争,表面比的是模型能力,底层拼的其实是这笔数据成本账:谁的单位能力数据成本更低,谁才跑得动规模化。
物理AI 人类学习路线:千小时换数万小时
在这笔账上,深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,落在物理AI 人类学习路线的效率上。
PhysBrain1.0基座模型证明了:千小时人类视频,能换回数万小时真机轨迹才能达到的效果。
效率从哪来?从数据的「含金量」里来。
真机轨迹拟合的是动作本身,换一个场景就失效。人类第一视角视频里装的是物理常识——一条数据,同时装着看什么、做什么、为什么做。
同样是采集一小时,真机轨迹得到的是一条动作序列,人类第一视角视频得到的是一段有前因后果的经验。
所以关键是让每一小时数据的价值变大。物理AI 人类第一视角数据,天然带着人对物理世界的潜在认知:我看到什么、我怎么做、我为什么这么做,全被记录下来。
这靠两件事撑起来。
第一件,是数据采集。深度机智自研的 ICDC(In-Context Data Collect)情境数采,让数采不再专门搭建数采工厂,而是真正进入工厂车间、商超等真实场景,记录真实情境下人类的操作过程。为了让采集过程不干扰人类正常活动,深度机智自研轻量化、非侵入式的分体式采集硬件,让数据采集发生得更加自然无障碍,采集门槛和成本均大幅降低。
第二件,是数据翻译管线,深度机智用 Egocentric2Embodiment 数据管线,把人类第一视角视频翻译成结构化的训练信号。摒弃传统轨迹拟合的思路,而是从人类数据中提取物理常识,认知理解物理世界后稳定执行,而非机械地复制轨迹,大幅提高了训练效率。
今年3月,深度机智发布PhysBrain1.0基座模型,仅使用三千小时人类数据训练,性能便超越了行业基于万小时级真机训练的模型,充分证明了人类数据用于物理AI模型训练的巨大潜能。为了持续以人类数据赋能基座模型建设,深度机智一直在推动人类数据的采集与积累。截止去年年底,数据沉淀了成数十万小时级人类第一视角多模态数据集 DeepAct。
规模化的前提,是效率不是堆数据
所以 Physical Token 这笔账的答案,不是堆数据,而是效率。
人类学习路线国产的实践说明了单位能力成本能一路向下。
这背后,是深度机智坚持的人类学习技术路线——从人类数据里提取物理常识,推高智能上限,再把它转成真实世界的行动力和泛化性。
当下一项能力,比上一项更便宜,机器人才算真正跨过规模化的门槛。
参考资料
机器之心 · Physical Token 经济学:下一项能力更便宜,机器人才能真正规模化 · 2026-08-19 机器之心 · 深度机智发布全新具身通用智能大模型:给机器人装上「物理常识」 · 2026-03-27

