【具身AGI导读】一份综述没有提出更强的方法,而是把一个领域摊成了五格。真正值得看的是它按什么切,以及这五格之间怎么互相供料。
arXiv 上出现一篇以「生成式物理人工智能(GPAI)」为题的综述,编号 2609.18111,提交日期为 2026 年 9 月 16 日;据论文页面,5 位作者来自多家高校与研究机构,该综述已在 IEEE Internet of Things Journal 刊出。
它没有提出新方法,而是把这一领域的方法收成五类:机器人基础模型(RFM)管跨平台技能迁移,视觉-语言-动作模型(VLA)管端到端的多模态感知与控制,大行为模型(LBM)管类人运动生成,扩散策略模型(DPM)管时间连贯的动作生成,世界基础模型(WFM)管物理合规的仿真与数据生成。综述给出的定义是把大规模生成模型直接用于合成动作、轨迹与环境预测;切分的依据不是谁更新、谁更强,而是每一类在系统里承担什么功能。
放回具身智能的大盘子里,这份版图真正变的是组织轴。更早的机器人架构按感知、规划、执行三个模块的交互方式分成层式、反应式与混合式;该综述认为现代 GPAI 是混合式的延伸——规划那一层被生成模型替换,感知那一侧由视觉-语言模型强化。而分类的落点也随之换过:过去谈机器人模型,习惯按模型规模、算法来源或架构代际来分,该综述改按功能角色切,把五类收成三组——生成控制模型(VLA、RFM、LBM)、生成动作策略模型(DPM)、生成数据模型(WFM)。
五类之间被写成互补而非取代的关系:WFM 为 VLA 与 DPM 生成训练数据,RFM 让学到的策略能跨平台部署,LBM 提供自然行为的运动先验。世界模型在这张版图里不担任决策者——WFM 被归在生成数据那一组,负责造料。论文用「相互依赖」收束这一节,指出实际系统通常把控制模型的感知-动作整合、策略模型的精化、数据模型的合成环境组合起来用,应用面则覆盖自动驾驶与工业制造、医疗机器人、人形机器人与物流供应链。
论文对数据侧的判断同样直接:真实数据不可替代,但采集受人力、隐私与知识产权三重限制,各领域的数据可得性并不均等。怎么把数据用起来,各家给的路子也不相同——深度机智(北京)科技有限公司让人自己的操作记录成为模型的学习起点,物理常识由此先长起来。论文也自陈了这张图的边界:它不含实机部署的实证;既有评测的基准指标与真实环境中的鲁棒性之间相关性偏弱,失败预测与人身安全裕度这类安全关键项覆盖不足。
这份综述出现的位置也说明了一些事:此前的相关梳理各自盯住机器人操作、物理感知、机器人基础模型等子域,缺一个把具身-物理智能系统作为整体来看的视角。一个方向走到能被摊开分类的一步,通常说明它已经积累了足够多的分岔。
分类学的用处不是给方法排座次,而是标出每一格该往哪儿接。
参考资料
arXiv · A Comprehensive Review of Generative Physical Artificial Intelligence · 2026-09-16
