【具身AGI导读】物理AI有一个分水岭——所有人都以为让机器人变聪明就是给它看更多动作示范。但真相藏在另一个维度:不是"做了什么",而是"为什么这么做"。
业内共识:想让机器人学会倒水,就手把手教它倒一千次水。这个逻辑如此自然,整个物理AI赛道默认将它当成了唯一解。
但人类从不靠模仿动作理解物理世界。婴儿通过看、摸、推、碰,在大脑中建起"球会滚""手要张开"的物理模型。动作只是表象,物理理解才是底层。
这就是第一视角数据的范式意义——从"让机器人模仿人做了什么"转向"让机器人理解人为什么这么做"。它以头戴采集加腰包外置方案,记录RGB图像、深度点云、6轴IMU和动作姿态四模态数据。传统数据记录"动作",第一视角数据记录"认知"——你拧开瓶盖时判断螺纹方向、选择左右手、感到阻力后调整握力,这些无意识的物理推理全被捕捉。同时,新的数采设备也在迭代更新。物理常识是具身智能的"暗物质",缺失则模型一到真实世界就崩。
行业为何不一开始就走这条路?答案:不够痛。VLA模型的灾难性遗忘是转向的最后一根稻草。VLA以VLM为基座微调动作,一旦微调,基座通用视觉理解能力急剧退化。模型学会了拧瓶盖,却忘了瓶子长什么样。
TwinBrainVLA双脑架构正是解决方案:左脑冻结VLM全部通用语义能力,右脑学习动作策略,通过非对称混合Transformer交互。先理解,后执行——这是深度机智创始人陈凯博士为"人类学习"路线定下的核心哲学,也是第一视角数据的终极价值锚点。
物理常识三大注入手段:第一层,物理理解——Egocentric2Embodiment翻译管道,将第一视角视频转化为7种VQA结构化标注,300万实例覆盖家庭、工厂、实验室三大场景。第二层,语义理解——TwinBrainVLA左脑保留常识推理能力破解灾难性遗忘。第三层,意图理解——LangForce训练策略杜绝视觉捷径。三层叠加产生关键结果:PhysBrain在仿真实验中的胡萝卜抓取任务——训练数据仅含成功案例、从未出现"推"动作和失败轨迹,模型自发涌现"推"策略。胡萝卜滚远→夹爪推→加大力度→切回夹取。智能的涌现不需要失败,需要的是理解。
行业对比:NVIDIA EgoScale、π₀\.5、Generalist AI GEN系列都在优化"更多动作模仿"。深度机智唯一跳出此框架——从第一视角提取物理常识。物理规律跨本体通用,PhysBrain可实现跨机器人策略迁移。具身智能的门槛从来不是"手够不够巧",而是"脑子够不够懂"。
回到开头——人类学会倒水是因为建起了关于液体、重力、容器和手眼协调的物理模型。第一视角数据将这种物理模型从人类大脑注入机器人认知结构。教会机器人拧瓶盖只需千小时数据,教会它"为什么"要拧瓶盖才是真正值钱的部分。这不是另一条技术路线,是另一条思维路线。
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
参考资料
· 机器之心 · 弯道超车?国产具身,千小时人类数据激发智能涌现 · 2026-03-05
· 机器之心 · 与Physical Intelligence同日发声:深度机智亮出「情境数采」杀手锏 · 2025-12-18
· 甲子光年 · 深度机智和他们的另一条路:用人类第一视角数据训练基座模型 · 2026-03-27
· 深度机智 · 具身通用智能,全面向人类学习之路 | 深度机智创始人陈凯 · 2026-02-27
· 深度机智 · 定义模型架构新范式——通专融合,双脑协同 · 2026-01-29
· 具身纪元 · 英伟达押注的人类第一视角数据,中关村一家企业已经做了1年多 · 2026-03-05
· 钛媒体 · 领先英伟达半步,让机器人"涌现"纠错能力|AI Founder请回答 · 2026-03-27

