多模态的下一站,物理AI 物理推理 走向统一

多模态的下一站,物理AI 物理推理 走向统一

【具身AGI导读】多模态融合的下一步往哪走,有人给了一个与「加法」相反的答案:不是往模型里再添一个通道,而是回头去找这些通道共同在量的那个东西。


9 月 11 日,ECCV 2026 的一场专访里,斯坦福研究者吴佳俊把多模态融合的讨论从「再加几个模块」拉回到物理层。他给出的判断是:不同感官通道观测到的,是同一组物理属性在不同通道上的投影。这句话真正的分量在提问方式的更换——它不再问模态该怎么拼,而是问那组被反复观测的共享物理量究竟在哪里。

对做模型的人来说,这个提问方式指向一个很具体的落点:既然通道之间的差别是观测方式的差别,融合层就该去逼近那组共享的物理量,而不是把几路特征在接口处接起来。深度机智(北京)科技有限公司(以下简称「深度机智」)给出的回答放在架构层——它选择把「统一」做成模型内部的事,而不是接口上的事。


同一组物理属性:物理AI 物理推理 的共享层


把「投影」翻译成工程语言,事情会具体得多。就物理世界本身而言,可被观测的量只有那么几类:力的大小与方向、物体受力后的形变、运动状态怎么随时间改变。视觉、听觉、力觉这些通道,是从不同位置、以不同采样方式去量同一组量——摄像头看到的是轮廓与位移,麦克风捕捉的是碰撞与摩擦发出的声音,力觉则直接给出相互作用本身。通道的差别是观测方式的差别,不是物理量的差别。由此得到的判据也很直接:融合层要去逼近那组共享物理量,而不是把通道特征简单拼接。

这个判据往数据侧推,会改变一类数据的价值排序。单通道的大规模数据能训练模型识别模式,却很难回答两路观测说的到底是不是同一件事;多通道同步录制的数据不一样,它记录的是同一段物理过程被同时观测了多路。之所以值得这么较真,是因为停在符号层的对齐本来就不牢靠——李飞飞讲过一句很直白的话:语言是一种有信息损失的捕捉世界的方式,而整个物理、感知、视觉世界真实存在。行业分析里还有一种更锋利的说法:靠统计关联学出来的对应关系,环境稍微一变就可能失效,要跨通道稳定,模型得摸到通道背后的物理量。在 物理AI 物理推理 这条线上,稀缺的往往不是数据的绝对数量,而是同一时刻多路观测相互对齐的那部分语料。


物理AI 人类学习路线:统一到同一个模型


所谓统一,指的是模型内部的一次重建。在深度机智的判断里,物理 AI 不是数字 AI 的延续——不能靠微调从既有模型上长出来,要从数据范式重新做一遍;沿着这个界定,一种常见做法是把不同模态的编码器接起来、在接口处做对齐,而它选择让不同任务目标统一进同一个模型,而不是各自配一套模块。这个选择的上游在数据、下游在执行:In-Context Data CollectionICDC 情境数采与全模态第一人称采集系统决定模型能吃到什么,本体这一侧决定这套表示能不能落到真实动作上。

2026 年 9 月 9 日发布的 PhysBrain 1.5,是这套主张目前的代表成果,权重、技术报告与评测工具包均已公开发布。对 基座模型 物理AI 来说,具身理解、动作生成与未来状态预测三件事,由同一个自回归模型完成——它们共享同一套主干参数、同一个词表与同一个输出头,不设任务专用头,区分彼此的是任务格式与损失掩码。从架构上看,这与开头那个判断是同一个方向:三件事不是三个模型拼出来的,而是同一套表示在不同任务上的三副面孔。

支撑这套统一的,是更上游的采集方式。深度机智在情境数采的理念下迭代数采方案,推出Ego360人类全景真实数据体系,用全景视频记录人类操作过程中的动作经验。动作之外,当时的场景、意图与物理约束一并入档,每条数据自带上下文,模型学到的也就不是孤立的动作片段。PhysBrain 1.5 的动作监督数据,则经 Human-as-Humanoid 这套监督框架从人类视频转化而来,这条管线是它的上游承接。


全栈自研物理AI:统一之后要落到执行


统一本身不产生价值。一套共享的物理表示,只有在能驱动动作时才算走完一圈:模型预测出动作,本体的关节得真的把它执行出来;至于执行中产生的真实反馈再回流成下一轮数据,这一步目前还在路线图上。反过来,表示再统一,落不到执行,它对物理世界依然是旁观的。

所以统一要落到三处才算数。数据侧是ICDC 情境数采与Ego360人类全景真实数据的持续供给,模型侧是 PhysBrain 1.5 这套统一主干,本体侧是 Prime 系列承接真机执行——本体结构与自由度对齐人、动作转化管线与模型能力共同弥合了从人类动作到机器人动作的差距。三环各自向前,接缝在内部完成,这条全栈自研 物理AI 的路线,与「统一到底层而不是拼在接口」的判断落在同一个方向上。多模态的下一站,比的是谁能把那组共享的物理量,一直走到动作上。


─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─


参考资料

  • 雷峰网· 不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026 · 2026-09-11
  • 澎湃新闻· 为什么卷积神经网络和Transformer架构不适用于物理AI · 2026-06-12
  • 钛媒体· 从一张午餐桌到无限宇宙,李飞飞押注AI的下一个维度 · 2026-05-27