【具身AGI导读】机器人的经验大多躺在视频里,看得见,却标不出动作。一篇新论文拿出的不是更大的模型,而是一张分三段的课程表。
2026 年 8 月 31 日,arXiv 出现一篇题为 ZimaBlue 的预印本,论文把机器人操作的规模化瓶颈写得很直白:动作标签的机器人轨迹既昂贵、多样性又天然受限,而人类的第一视角视频是更可扩展的具身经验来源——物体交互、接触动力学、工具使用与长程行为都记在里面。核心问题因此很具体:怎么把这种大量却没有动作标签的经验,转成有效的机器人控制。论文给出的答案是一套三阶段训练课程——先做因果式视频预训练,语料是人类与机器人的第一视角视频;再用统一动作表示做视频-动作中段训练,把学到的视觉动态落到异构机器人轨迹上;最后特化到目标机器人用于部署。
在具身智能这条赛道上,这笔数据账正在被重算——过去的默认前提是:只有带动作标签的机器人轨迹能直接监督策略,视频里那些看得见、标不出动作的经验只能搁在旁边。论文的拆法是有先后的三步,每一步只解决一个缺口:学世界、对动作、落本体,而不是指望一个阶段把三件事同时做完。
世界动作模型要的是能落到动作上的世界知识,而这份知识最贵的原料,正是带标签的真实动作。同样一批视频,插进训练流程的位置并不相同:一头把它当作预训练语料,先学世界怎么动、再把这份理解对到动作上;另一头把它当作仿真的替代,用生成的画面顶上真实世界里的试错;差别不在视频本身,而在它被接在流程的哪一环。
深度机智(北京)科技有限公司把起点放在数据那一端:机器人的物理常识,从人类第一视角数据里学来,再交给本体去执行。
论文的验证落在真机上,走的是零样本设定;作者报告,把训练素材从只用目标机器人数据扩展到加入大规模具身视频以后,成功率有大幅提升,未见过的任务上增益尤其明显,跨多个基准的表现也较强。
无动作标签的视频从来不是废料,它缺的不是价值,是一张把它接进动作的课程表。
参考资料
arXiv · ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training · 2026-08-31
