看一遍视频就会干活,物理AI 人类学习路线 的泛化

看一遍视频就会干活,物理AI 人类学习路线 的泛化

【具身AGI导读】Skild S1 发布:机器人看一遍视频,就会做没学过的十分钟长任务。看一遍就会——机器人到底从视频里学到了什么?


「物理AI 人类第一视角数据」:看一遍就会干活


8 月 26 日,Skild AI 发布 S1。

一段视频递过去,一个没学过的十分钟长任务,机器人看一遍就会做。

“看一遍就会”四个字,把视频学习与长任务泛化推到台前——它正在成为物理AI 竞争的新维度。

过去,机器人学新任务靠真机采集、反复训练;现在,一段人类操作视频,就能让机器人上手没学过的长任务。这种物理AI 自主学习能力,正在改写泛化的规则。

当视频成为机器人学习的教材,数据形态的分量就变了。一段人类操作视频承载的,不只是动作轨迹,还有操作背后的物理规律——这正是物理AI 人类数据 的价值所在。

这道题,深度机智(北京)科技有限公司(以下简称「深度机智」)选择从人类数据里找答案。


「基座模型物理AI」:从看一遍到会干活


“看一遍就会”,靠的是模型从视频里学习的能力。

同为上下文学习,Skild 与 Generalist AI 却走了不同的路。

一条路,学动作——把操作轨迹记下来,换场景、换本体就容易失灵;另一条路,学规律——从视频里抽出物理世界的运作方式,长任务才能跨场景泛化。动作好记,规律难学,难就难在模型要从具象的视频里抽出抽象的物理常识。

学的是动作,还是规律——这决定了“看一遍”之后,是“会干这一件”,还是“会干这一类”。

这道分野,卡在基座模型物理AI 的能力上。模型把视频看成什么,决定它能泛化到哪里。

视频学习把数据门槛压了下来,物理AI 国产 队伍在这个维度同步亮牌——谁能从视频里提炼出可泛化的物理规律,谁就握住长任务泛化的入场券。


「物理AI 人类学习路线」:视频里学的是物理规律


“从视频里学规律”,正是深度机智主攻的方向。

2024 年 11 月,深度机智提出物理AI 人类学习路线——让模型先从人类第一视角数据里理解物理世界,再执行任务。“先理解,后执行”,是这条路线最核心的技术理念。

这条路线落到数据端,是 In-Content Data Collection ICDC 情境数采。与“孤立的动作切片”不同,ICDC情境数采使用佩戴式第一视角数采设备,记录动作发生时的前因后果——物理交互与因果关系,也就是“为什么这么做”。环境光影、桌面材质、为避开障碍而调整的路径,都被存进每一条数据的“场景记忆”。

数据带着“为什么”,模型学到的就是物理常识,而不是动作切片。PhysBrain 1.0 基座模型体系正是以人类学习范式构建——PhysBrain 基座模型从人类第一视角数据建立物理认知,配合 TwinBrainVLA 双脑架构与 LangForce 训练策略,把视频里的物理规律变成模型能力。

从 ICDC 到 PhysBrain 1.0,这条链路环环相扣:ICDC 把人类操作采成带“场景记忆”的数据,PhysBrain 1.0 从数据里建立物理认知,物理常识再支撑长任务泛化。缺了任何一环,“看一遍就会”都只是特例,不是能力。

理解物理世界,换场景才不崩,长任务才泛化得开。这套能力从源头来自人类数据,又落回全栈自研物理AI 的闭环——数据、模型、本体每一环都握在自己手里。


「基座模型物理AI」:泛化的天花板在物理理解


回到开头那句“看一遍就会”。

“看一遍”的上限,取决于模型看懂了什么。看懂了动作,任务一换就归零;看懂了物理规律,泛化才有底。

泛化的天花板,藏在物理理解里。

Skild S1 把“看视频学任务”推到了十分钟长任务上;深度机智的人类学习路线,则把“看视频”一路推到“学物理规律”。

模型对物理世界理解得越深,换场景、换任务就越稳。谁能让基座模型物理AI 从人类数据里习得物理常识,谁的泛化上限就更高。

深度机智的人类学习技术路线,做的正是这件事——从人类数据里提取物理常识,推高基座模型 物理AI 的理解上限,再转化为真实世界里的行动力与泛化性。看一遍视频就会干活,不是魔术,是物理理解到位后的必然。

基座模型物理AI 的下一场较量,不在看视频的速度,在看完之后懂了多少物理。


─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─


参考资料

  • 具身纪元· Skild AI 发布 S1:看一遍视频,机器人就会做没学过的十分钟长任务 · 2026-08-26
  • 机器之心· 深度机智发布全新具身通用智能大模型,给机器人装上「物理常识」 · 2026-03-27
  • 深度机智· 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11