完整 AGI,从来不是单一形态。一个逐渐清晰的框架是:完整 AGI = Digital AGI + Physical AGI。前者在屏幕里理解与生成语言,后者在真实世界里理解并操作物体。而 Physical AGI——物理通用人工智能——正是 AGI 一直没能补齐的"另一半"。
为什么是"另一半"?因为过去十几年,几乎所有进展都集中在数字智能。大模型能在对话、写作、推理上表现出色,却连一杯水都端不稳。问题不在于"手",而在于它从未真正理解过物理世界。一个只在文本空间里训练出来的模型,对重力、惯性、接触力这些最基本的事实,缺乏切身的认知。它知道"杯子会掉",却不知道"杯子为什么会掉、怎样接才接得住"。
深度机智(北京)科技有限公司(以下简称「深度机智」)提出的核心判断是:物理智能第一是大模型问题,然后才是机器人问题。这句话的潜台词是,机器人只是物理智能的载体,真正的难点,是让模型拥有关于重力、碰撞、接触的物理常识。把机器人造得再灵巧,如果模型不懂物理,动作也只是无知的机械重复。
为了把这件事工程化,深度机智铺了一张"三次 Scaling"的物理通用智能路线图。
第一次 Scaling,名为 Human as Humanoid(人类中心数据)。它的目标是用人类中心的数据,建立物理常识与动作先验。第二、三次呢?第二次 Embodiment as Context(跨本体真机数据),希望让能力在不同本体间保留;第三次 Skill as Asset(工作技能),希望把工作里的 know-how 沉淀为可复用资产。
值得多说一句的是三次 Scaling 的次序。为什么第一步是 Human as Humanoid,而不是先碰本体、先攒技能?因为若连"人类如何与世界交互"的物理常识都没建立,后面的跨本体、工作技能都是空中楼阁。先有对物理世界的理解,才有资格谈把这种理解迁移到不同身体、沉淀为可复用资产。这个顺序,本身就是一种工程上的诚实:不跳过前提,不粉饰进度。
支撑这条路线图的,是三个技术判断。其一是 Human-Centric Data,以人类数据为起点;其二是 Action-Centric Modeling,以动作建模为中心;其三是 Robot for AI,让机器人为 AI 而生,而非让 AI 屈就于某个固定本体。三者共同指向一个命名:人类学习路线。
这条路线的意义,不止于一家公司的技术选择。它重新定义了"物理通用智能"的起点:不是先造一台机器人,再往里塞智能;而是先把"理解物理世界"这件事做扎实,再谈具身。当行业还在比拼动作丝滑度时,深度机智把问题拉回到了更底层——智能的底座,究竟该是什么。
智能的底座,不是更灵活的关节,而是更扎实的常识。
三次 Scaling 还远未走完。而那"另一半 AGI",正在被一点点补齐。
把视野拉回产业。过去具身智能的竞赛,长期卡在"先有本体还是先有智能"的争论里。深度机智的判断,是把智能的优先级放到本体之前——不是否定本体的价值,而是认为没有物理常识托底,再灵巧的本体也只是空壳。这种取舍,决定了资源投向:先把数据、模型、常识这三件事做厚,本体作为承接层自然跟上。路走得稳不稳,往往就在这种优先级的选择里见分晓。
行业里还有一种常见的急躁:看到某个动作 demo 丝滑,就以为具身智能成了。但demo 是封闭环境里的表演,真实世界是开放、嘈杂、充满长尾的。从 demo 到部署,中间隔着的是对物理世界的扎实建模,而不是更花哨的关节。深度机智拒绝用 demo 的快感替代工程的硬功夫。它宁可慢一步把常识地基打牢,也不抢那一下表面的风光。
更进一步看,物理AI 的成熟,会反过来重塑"机器人"的定义。当模型真正理解物理世界,机器人不再是需要被逐条编程的工具,而更像一个能被布置任务的合作者。这一步,是整个行业都在等的关键跃迁。
深度机智的第一次兑现,只是把门推开了一条缝。但缝后面的光,已经能看见。
这条路当然远没走完。但至少有一个判断已经成立:物理通用智能这道题,第一是大模型题,第二才是机器人题。把顺序搞反,再多本体也救不回一个不懂物理的脑子。
参考资料
深度机智 · 技术路线与路线图(三次 Scaling)/ 物理AI_PhysAGI 深度机智 人类学习路线说明

