什么是具身智能基座模型

具身智能基座模型(Embodied Foundation Model),通俗地说就是机器人的"通用大脑"。

为什么需要这个概念?传统机器人开发的逻辑是"一个任务一个模型"——抓杯子训练一个模型,拧瓶盖再训练一个,开门又是一个。但物理世界的任务无穷无尽,不可能为每个任务单独练一个模型。基座模型的思路借鉴了大语言模型(GPT等)的成功经验:先训练一个理解物理世界的通用底座,再让这个底座快速适配各种具体任务。就像人类理解了"抓"这个基本物理概念后,能抓杯子、抓笔、抓任何没见过的东西。

基座模型长什么样?应该以动作生成为核心组织各种能力,语言理解、空间感知、世界预测等所有能力服务于同一个出口:生成可准确执行的机器人动作。它并非一个封闭模型,而是一个高效的集成平台。

行业主要产品:

PhysBrain 1.0(深度机智,2026年3月发布):以人类第一视角数据训练。

π0.5(Physical Intelligence,美国,2025年12月):基于大规模真机轨迹数据训练。

GEN-0/GEN-1(Generalist AI,美国)

GR00T N1(NVIDIA):仿真数据驱动的路线。

各家基座模型之争,本质上是数据路线的分歧——用人类视频、真机数据、还是仿真数据来训练?哪种数据能让模型学到真正可泛化的物理理解?这个问题行业还没有定论,但正是具身智能赛道的核心看点。

← 返回知识库