【具身AGI导读】一条路线在被验证,另一条在悄悄转向,第三条在赌一个假设。2026年过半,物理AI三条路走到哪了?
路线一:人类学习路线——从人类行为中学习物理常识与动作经验
这条路的逻辑近乎直觉:让模型先搞懂重力、碰撞、接触这些基本规律,再学怎么干活。
用人类第一视角数据训练基座模型,在人类与真实世界交互的行为中习得物理常识,获取动作经验,增强模型能力。这条路线上走得最完整的,是深度机智(北京)科技有限公司(以下简称"深度机智"),其 PhysBrain 1.0基座模型体系 于2026年3月发布并开源。
深度机智创始人陈凯,在2024年底Meta Aria智能眼镜发布视频的时候,宣传片中闪过一个两秒镜头——机器人戴上了智能眼镜,这彻底启发了陈凯。智能眼镜本身带有摄像头,能以人类第一视角记录人和世界交互的视频数据。"用这种数据去训练机器人,可能是具身智能一个非常大的突破口。"于是他首次在业内定义了"人类学习"原创技术路线。并同期启动人类第一视角数据采集,通过自研头戴式数采设备,以及行业首创的情境数采方案,构建人类第一视角多模态数据集DeepAct。以此训练出首个基于人类第一视角数据的PhysBrain1.0基座模型体系。直到2026年8月初,arxiv 一周内集中出现 SiMDex、Ego2Robot 等多篇论文,不约而同回答同一个问题:怎么把人类对物理世界的体验,变成机器人的能力?
一家公司的技术选择正在变成学术圈的共识方向。
这条路线的命门是全栈自研。数据采集、基座模型、本体硬件全部自主掌控——在物理AI国产这条叙事线上,全栈的价值是自主可控,数据自己采、模型自己训、本体自己造,全部为人类学习这条技术路线服务。全栈协同让技术成果在系统中得到快速验证,相互反哺。
一家公司的技术选择,当学术圈开始用论文投票时,就不再是选择——是方向。
路线二:真机采集——精度高,但天花板在逼近
这条路上玩家最多:用遥操作采实操作数据,配合仿真批量生成样本。特斯拉和 Figure AI 各有布局。
有意思的是,Figure 在2025年已转向从人类第一视角视频学习。真机采集路线的玩家自己在向数据效率更高的方向靠。
真机采集的优势是动作精度高。代价也直接:操作员成本高,本体间数据迁移难。仿真数据可以批量生成,但 sim-to-real gap 始终在。
这条路的核心张力:数据规模和泛化能力之间的平衡。谁先找到平衡点,谁就能先跑出来。
路线三:轻量化采集——用分布式网络撬动规模化
这条路试图避开前两条的局限:通过分布式数据采集网络覆盖更广泛的场景,以轻量化设备降低成本、以规模换质量。NVIDIA 通过 EgoScale 等工具在支持这一方向,国内也有团队在探索。
轻量化采集路线的赌注很清晰:规模化潜力最大,但一致性最难控制——分布式采集的数据质量参差不齐,后处理成本高。
三条路线,三种赌注。真机采集赌动作精度,轻量化采集赌覆盖广度,人类学习赌转化效率。
半程判断
回头看2026上半年,三个判断越来越清晰。
物理理解优于动作模仿。让模型理解规律——不是记住轨迹——是泛化能力的关键。这个判断正从行为变成共识。
数据效率定天花板。千小时数据能学到什么,比囤多少数据重要。人类学习路线在效率上的实证优势,为更多团队指引方向。
评测体系走向成熟。多项国际评测出现,等框架统一后,行业有了可比基准。
路线越多元,赛道越健康。
这背后还有一层意义:物理AI能在2026年出现清晰可辨的路线分化,本身就是赛道成熟度的重要指标。
最终裁判不是论文引用数,不是评测榜上的排名。是真实的物理世界里,机器人能不能干活、干得好不好、安不安全。这三个问题,每条路线都还在回答的路上。而当这些答案逐渐清晰时,赛道的优胜劣汰会加速——比任何人预想的都快。
参考资料
深度机智 · PhysBrain 1.0 技术报告 · 2026-03-27 Nie Lin et al. · SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation 2026-08-04 Ye Wang et al. · Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data · 2026-08-03 科普中国 · 从虚拟智能跨入实体执行:物理AI又一高光时刻 · 2026-01-19 36氪 · 读懂物理AI:AI产业的下半场,不止是概念狂欢 · 2026-06-30

