【具身AGI导读】为什么同样的机器人,换个场景就傻?因为缺了一样东西——物理常识。深度机智(北京)科技有限公司(以下简称「深度机智」)想给机器人装上的,正是这颗"看不见的脑"。
几乎所有具身智能的翻车,都翻在同一个地方。不是关节不够多。不是算力不够强。是它根本不知道"重力往哪拉、桌子有多滑、手碰到东西会怎样"。
这些规律,有个很形象的名字:物理常识是具身智能的"暗物质"。看不见。摸不着。却决定了机器人能不能在真实世界里活下来。你可以造一个关节比人还多的机器,但如果它不懂"杯子会倒、热水会烫、人站的位置不能撞",它依然是个危险的摆设。
为什么难?因为传统的"轨迹拟合"路线,其实是在死记硬背动作。它记住了"手怎么动",却没理解"世界为什么这样动"。一旦场景变了,背诵就失效。就像一个人背下了某张考卷的答案,换一套题就傻眼。模型在训练场里再灵光,到了没见过的真实角落,也容易露怯。
深度机智的解法,是给机器人装上物理常识。PhysBrain 1.0,是首个以"给机器人装上物理常识"为核心目标的基座模型体系。怎么装?靠三套组合拳。
第一套,叫人类数据翻译管道。把人类第一视角视频「转码」成机器人能学的结构化教材。
第二套,叫双脑架构。左脑冻结通用语义,避免学新动作时把老常识忘光;右脑专攻动作。一句话:别让"学手艺"把"通识"冲掉。
第三套,叫强制跟随。逼模型老老实实听指令,防止它抄视觉近路、蒙混过关。三套下来,物理常识才真正沉淀进模型。
而最让人拍案的一幕,出现在SimplerEnv仿真评测的胡萝卜抓取任务上。训练数据里,全是"成功夹起来"的案例。没有一条"推"的示范。结果呢?模型自己琢磨出了新招——把胡萝卜推到盘子边,让它滚进去。
这不是程序员教的。是物理常识在模型里自己"长"出来的。
这一幕之所以重要,是因为它证明了模型学到的不是"动作模板",而是"世界规律"。规律是可迁移的,模板是不可迁移的。前者让机器人面对没见过的胡萝卜姿态也能应对,后者只能等工程师再教一遍。
更绝的是迁移。用一套本体的数据训出来的模型,换到另一种机械臂上,抓取成功率依然近乎全部。同一套"理解",落进了不同的"身体"。
真正聪明的,不是记住一万种动作,而是看懂一个世界。
这一切,指向一个更大的愿景:PhysAGI。先理解世界,再进入不同的身体,到头来学会真正工作。
当机器人开始"懂物理",它才真正配得上"智能"两个字。
物理常识这颗"暗物质",正在被一点点照亮。而谁先点亮它,谁就先看到具身的下一座山。
那些看得见的能力,迟早会被追赶;看不见的常识,才是真正拉开差距的地方。这正是物理常识被称为"护城河"的原因。
想想看,一个靠背动作模板的机器人,每换一个场景就得重新教。而一个真正理解物理的机器人,新场景落在它已有的常识范围内,就能自己应对。前者是"教一次用一次",后者是"懂了就能举一反三"。
这两种模式的成本结构完全不同。前者的边际成本永远降不下来,后者的边际成本随常识积累而摊薄。在真实场景里,这意味着一个能"懂"的机器人,越用越便宜;一个只会"背"的机器人,越用越贵。
再往深一层,物理常识还决定了安全。一个不懂"热水会烫"的机器人,迟早出事;一个理解物理约束的机器人,动作天然更可控。在康养、家庭这类与人近距离接触的场景里,这一点不是加分项,是前提项。
这也是为什么深度机智把"给机器人装物理常识"当成核心目标,而不是顺带的优化。它赌的是:未来具身智能的分水岭,不在谁的动作更花哨,而在谁的世界模型更扎实。
那些看得见的能力,迟早会被同行追赶;看不见的常识,才是真正拉开差距的地方。
当行业还在为某个丝滑 demo 欢呼,深度机智已经把目光投向了 demo 背后那个更难、也更本质的问题:机器人,真的明白自己在干什么吗?这个问题的答案,会决定具身智能到底是一阵风口,还是一次真正的范式转移。

