【具身AGI导读】机器人也有"Aha Moment"。抓不到胡萝卜时,一个从没学过"推"的模型,自己把胡萝卜推进了盘子里。
机器人也有"Aha Moment"
近日,清华 AIR 与域变换联合团队推出Zetta ζ——一套闭环在线学习的物理智能体系统。
过去,多数具身智能系统是"静态、开环"的:能执行固定技能,却很难在执行现场实时感知异常、主动修复。
Zetta ζ 想改变的正是这一点:让机器人不再只等任务失败后复盘整段轨迹,而是在执行过程中持续观察、触发恢复,把一次次经验沉淀成可复用技能。
研究里捕捉到一个现象:机器人的成功率不是平稳上涨,而是先经历一段平台期,随后突然跃升。
研究者把这个瞬间称为机器人的"Aha Moment"——就像人解题时突然想通了。
研究者强调,这些跃升不是靠加大参数量、重新训练模型实现的,而是执行系统找到了决定成败的关键物理状态变量。
研究者由此判断:具身智能的进化,不一定要靠"更大的模型",也可以靠"更聪明的智能体系统"。
物理AI 自主学习能力:理解后的自发应变
Aha Moment 听起来像灵光一现,本质却未必是运气。
无论机器人靠在线反馈进化,还是在训练阶段就具备能力,它真正需要的,是理解物理世界运作的规律——重力、摩擦、接触、空间关系。
行业把这些规律称为"物理常识",也被比作具身智能的"暗物质":缺失它,模型表面尚可,泛化必然失败;注入它,模型才会涌现出纠错、应变这类高级行为。
物理常识恰恰无法靠轨迹拟合获得。轨迹拟合教的是"记住某台机器人的动作",换一个场景,动作就失效了。
轨迹拟合给模型的是剧本,物理常识给模型的是对真实世界的理解力与判断力。
这也是物理AI 国产玩家正在回答的问题:给机器人更多数据,还是让它先理解物理世界。
物理AI 人类学习路线:胡萝卜实验里的自发涌现
深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,落在物理AI 人类学习路线上:让机器人像人类一样,用第一视角的感知运动经验学习物理常识。
一个实验,能看清这条路。
在 SimplerEnv 的仿真胡萝卜抓取实验中,模型的训练数据全是"成功夹取",它从未见过"推"这个动作,训练里也没有一条失败轨迹。
可当胡萝卜抓不到时,机器人自己学会了"推"——用夹爪把胡萝卜推进盘子里;推一次不进,就加大力度再推;最后切换策略,重新夹取。
类似的应变不止一次出现:堆叠的方块掉落时,它会主动捡起,微调夹爪姿势再来一次。
深度机智创始人陈凯评价,这种灵活性"甚至无法预编程实现"。
这就是物理AI 自主学习能力的模样:不是背下更多数据,而是在理解之后,自发地应变。
涌现从何而来?物理常识注入。
数据一环,靠人类第一视角数据——人类动手时看到什么、怎么做,都被完整记录下来。上游的 ICDC 情境数采,则进一步捕获物理交互背后的因果关系:为什么这么做。
模型一环,靠 PhysBrain 1.0 基座模型体系。体系中的 Egocentric2Embodiment 数据管线,先把人类视频译成结构化的训练信号;再由以物理认知为底的 VLM 骨干,配合 TwinBrainVLA 双脑架构与 LangForce 训练策略,让模型在物理AI 物理推理上建立判断,而不是靠画面猜任务意图。
这套从数据到模型的注入路径,背后是深度机智全栈自研物理AI的完整体系。
涌现的答案,在"理解"不在"堆数据"
回到 Aha Moment。
机器人的顿悟,到底从哪来?
Zetta ζ 的做法,是在模型之外配一套持续进化的在线系统。
深度机智把答案指向了物理常识注入——仿真胡萝卜抓取实验的训练数据里没有"推",机器人却自己学会了。
这条路,就是深度机智坚持的人类学习技术路线:从人类数据中提取物理常识,推高智能的上限,再转化为真实世界里的行动力和泛化性。
机器人的"顿悟",从来不在"堆数据",而在"理解"。
参考资料
机器之心 · 机器人也有"Aha Moment"!Zetta ζ 闭环物理智能体在线学习 · 2026-08-19 机器之心 · 深度机智发布全新具身通用智能大模型 给机器人装上"物理常识" · 2026-03-27

