【具身AGI导读】 这两篇论文都发表于2025年下半年,是深度机智(北京)科技有限公司(以下简称「深度机智」)为物理AI基座打下的早期理论地基。一篇让VLA模型刷几何题,一篇论证人类第一视角数据的桥梁价值。当时看起来是两条独立的技术线,回头看才发现——它们在回答同一个问题:物理AI的基座,到底应该怎么建。
好的技术路线不是一天想出来的。它是一篇论文叠另一篇论文,一个实验结果证另一个假设,慢慢拼出来的。
2025年9月29日,Euclid’s Gift发布。2025年12月,PhysBrain Bridge发布,并登上 Hugging Face Daily Papers(当日 AI 论文榜单)。间隔不到三个月。
这两篇论文单独看都是“有趣的技术探索”:Euclid’s Gift 用约三万道几何题,让模型学会“上面/旁边/后面”这类空间关系,并在零样本下迁移到空间推理基准;PhysBrain 则证明,仅用人类第一视角视频、不依赖任何机器人轨迹,模型就能在 SimplerEnv、RoboCasa 等基准达到领先水平——也就是“人类数据可以替代真机数据”。放在一起看,它们回答的是一个更大的问题:一条不依赖真机轨迹数据的技术路线,从理论到工程,到底需要解决哪些前置问题。
答案藏在两个追问里。
第一问:空间怎么理解?
Euclid's Gift的思路很直白,甚至有点"做题家"的味道——建立Euclid30K数据集,约三万道平面与立体几何题,让VLA模型系统性地练习空间关系推理。
为什么是几何题?因为几何天然是对空间关系的抽象压缩。点与点、线与面、体与体之间的关系,在几何题里被剥离了所有无关变量,只剩下纯粹的空间逻辑。
结果证明这条路径是对的。几何训练后的模型在零样本迁移到VSI-Bench和MindCube两大空间推理基准时展现出系统性提升——不只是在某一个指标上好一点,而是在全模型序列上保持一致性增益。
更关键的结论是:紧凑几何课程比堆广义空间数据更具可迁移性。 30K精选几何题的效果,超越了120K通用空间样本。
这不是"做大"的思路。这是"做对"的思路。
第二问:数据怎么来?
PhysBrain回答的是一个更根本的问题。
如果说Euclid's Gift在解决"理解什么",PhysBrain在解决"从哪学"——大规模人类第一视角视频,能不能作为具身智能训练的数据桥梁?
论文系统论证了可行性:仅用人类第一视角视频训练,无需额外机器人轨迹数据,模型在SimplerEnv和RoboCasa上的表现与依赖真机数据训练的模型相当。
关键差异不在于性能高低,而在于证明了一件事:人类数据可以替代真机数据。 如果这条路径成立,意味着数据采集不再受限于机器人部署的速率和成本——一台相机就够了。
地基上的建筑
回头看这两篇论文的时间线很有意思。
2025年9月,Euclid's Gift解决空间理解——模型需要知道什么叫"上面"什么叫"旁边"什么叫"后面",不然连杯子放在桌子上这个动作都拆解不了。
2025年12月,PhysBrain 解决数据来源——如果人类视频可以替代真机轨迹,那整个数据飞轮的启动成本和扩展速度就完全不一样了。
智能是原生的,具身是延伸。 两篇论文,一个回答"理解什么",一个回答"从哪学"。加在一起,就是一条技术路线的理论地基。
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
参考资料
• 机器之心 · 数亿元融资落地!国内最早布局"人类学习"路线的具身公司 · 2026-05-15
• 北京中关村学院 · 中关村两院发布科研成果 @2026中关村论坛 · 2026-03-27

