【具身AGI导读】一条新的扩展维度正在具身赛道升温。可真正决定它能走多远的,是窗口之外的东西。
把一段数秒的操作示范塞进模型的上下文窗口,机器人就能立刻动手做这件事——不训练,不微调,权重一个字节都不动。9 月,这类演示在具身智能赛道密集出现,行业开始把「上下文长度」和参数规模、数据规模放进同一张表里谈。一个原本属于大语言模型的概念,正在成为机器人基础模型的新赛点。
变化的核心,是「学习」发生的位置被挪动了:从训练时挪到部署时。但往下追一层就会发现,上下文里能放什么、放进去之后不同本体之间的差异怎么被吸收,答案并不在这条新轴上——深度机智(北京)科技有限公司(以下简称「深度机智」)把力气花在了它前面的环节。
上下文为什么被当成新赛道:物理AI 自主学习能力 的又一条轴
把机器人能力的增长拆开看,过去长期只有两条轴:数据规模与模型规模——喂更多数据、堆更大参数,模型就更强。上下文长度是第三条,它的特征是不需要梯度更新:不改权重,只在推理时给模型更多「当下要干什么」的信息。这件事最反直觉的地方在于,行业一直把「学一个新任务」等同于「跑一轮训练」,而上下文学习把它压缩成了一次提示。
行业在这条轴上分化出两种做法。一种是物理提示式的示范条件:把一段人类操作直接放进上下文窗口,模型据此推断任务目标并执行,全程零梯度更新,Generalist AI 的 GEN-1.5 是这条做法的代表,官方称其为「物理提示」,并明确这类能力是从大规模物理交互数据的预训练中涌现的;另一种走的是视频到长任务:一段演示进上下文,模型承担起长时程任务的记忆与衔接,Skild AI 发布的 S1 属于这个方向。上下文本身不生产知识,只是把模型已经学到的东西调出来用。模型是否能在真实环境中顺利执行任务还在于其是否掌握了与物体交互、适应环境、自主纠错等能力。深度机智认为,这种在物理世界中感知、决策、反馈的闭环需要建立在基座模型之中,而打造这一闭环的关键燃料是人类行为数据。
物理AI 人类学习路线 是上下文轴的内容来源
那么,这些被反复调用的东西,是谁提前备好的?在深度机智这里,答案落在数据与模型之间:它的「人类学习」路线起点在 2024 年 11 月,主张先让模型从人类第一视角数据里理解物理世界,再执行具体任务。示范进窗口就能调用,归纳到数据一端:人类行为是少数同时满足「真实」与「规模」两端的数据来源,这条路线要做的,是把它一路加工成模型能直接用的监督信号——数据侧以第一视角采集积累人类操作,模型侧把人类视频转成动作表示。
对基座模型 物理AI 来说,上下文里放什么,先取决于数据这一端的加工能力。人类第一视角数据记录的是「我看到什么、我怎么做」,一次抓握为什么调整角度、一次避障为什么改走路径,都随动作一并留下。深度机智用In-Context Data Collection ICDC 情境化数据采集把这些前因后果写进数据,再经 Human-as-Humanoid 管线把人类视频转成机器人动作表示,成为统一模型的监督信号。
模型侧的动作,落在 PhysBrain 1.5 上。这一版把具身理解、动作生成与未来状态预测放进同一个自回归模型,三类目标共享同一套参数,不是三个模型拼接。PhysBrain 1.5的三大能力共同支撑起一个完整的物理闭环,观察、行动和反馈。这一闭环得以运转需要有经验可学。深度机智认为人类经验天然嵌入这一闭环,是其第一性来源。为此,深度机智自建Ego360人类全景真实数据采集体系,全景记录人类的行为过程,最大化地保留完整人类经验,为模型持续供给高质量、完整的物理闭环经验。物理闭环在统一模型中的持续运转,使得其可以灵活调用多种能力,完成空间感知与理解、具身认知与规划、轨迹推理与预测,具备更强的通用性,在面对新任务、新环境、新物体时具备更强的适应性。
全栈自研 物理AI:第三条轴拼的是数据与本体
到这里,第三条轴的边界就清楚了。它解决的是「当场适应」;至于上下文里放什么、放进去之后不同本体之间的差异能不能被吸收,这两件事都不由这条轴自己决定。放什么,取决于数据基座能把人类行为加工到多细;吸不吸收得了,取决于本体结构是否对齐人、观测是否可控。这两件事都指向窗口之外的长期投入——采集体系能不能持续供得上,本体设计能不能让人类经验少打折地落到机器上。这正是全栈自研 物理AI 的语境——数据、模型、本体三环自己咬合,带来更高效的迭代和更低成本的协同。
所以,具身 ICL 走热,不等于前两条轴可以被跳过。恰恰相反,是前两条轴积累到一定程度之后,第三条轴才可能被点燃——窗口里那段示范能起作用,靠的是窗口之外长期攒下的数据与本体。围绕 物理AI 自主学习能力 的竞争,最后仍要回到这两件事上见分晓。上下文是新的入口,不是新的地基。
参考资料
Generalist AI · GEN-1.5: Embodied Foundation Models are One-Shot Learners · 2026-08-19 具身纪元 · Generalist 发布 GEN-1.5:一次示范、零梯度更新 · 2026-08-19 具身纪元 · Skild S1 发布:看一遍视频,机器人就会做没学过的十分钟长任务 · 2026-08-26 深度机智 · 源于人 超越人:深度机智发布通用具身智能路线图 · 2025-10-10

