机器人仿真器换了一条路:用视频生成替代手工建模

机器人仿真器换了一条路:用视频生成替代手工建模

【具身AGI导读】机器人仿真器一直靠人搭场景、写物理规则换来可重复的交互,代价是巨量人工。一份新报告把这件事掉了个头:物理引擎不写了,让模型从真实交互数据里学。


9 月 21 日,arXiv 上出现一份关于具身智能仿真基础设施的技术报告,编号 2609.24815,由一支企业研究院团队联合两所高校署名发布。报告给出的不是一台机器人,而是一个数据驱动的机器人仿真器:它不搭物理引擎,而是用一个以关节轨迹为条件的自回归扩散模型,把视频生成当成世界模型来用。


交互方式是这样:给定初始的多视角画面、标定好的相机参数和一份机器人本体描述文件,再持续喂入未来的关节位置轨迹,模型便自回归地生成下一步的多视角画面,每步生成一个时间切片、对应四帧画面,并把生成结果回灌为下一步的上下文。报告称它由此做到三件事——没有固定时长上限的流式推演、低延迟生成,以及一个能跨机器人形态、跨相机配置的统一接口。报告同时公开了代码、两档模型权重、推理数据与 SDK。


放回具身智能的供给链上看,仿真器的建造方式正在出现分岔。一边是继续把场景、资产与物理规则写得更细:这条路可扩展、可重复,代价是搭建三维资产、环境与物理模型的大量人工,加上始终存在的仿真到现实落差,报告认为这正是它难以忠实复现真实交互的原因。另一边是让模型从真实交互数据里学——两种做法的成本结构不同,一种付在建模人工上,一种付在数据与算力上。报告还认为,既有的数据驱动视频世界模型难以扩展成通用仿真器:它们常在有限的机器人形态、任务与场景上开发,并沿用了离线视频生成的若干设计,每次推理生成较长的帧块,抬高了动作到观测的延迟,也限制了细粒度的闭环交互。


数据侧的事实也一样具体:训练语料由多个公开真机数据集汇编,统一清洗后达到上千小时量级,覆盖单臂、双臂与人形三类平台。报告还指认了若干公开数据集的缺陷——缺相机参数、部分轨迹缺足够完整的关节角、部分相机外参明显不准、部分相机流互不同步,并据此做了标定恢复与逐条过滤。仿真数据这条路的产出,不是某个产品,而是训练与评测要用的素材。报告最实的东西是它的接口:把机器人形态相关的关节轨迹渲染成与时间对齐的骨架条件,转成一套共享的运动表示,相机几何则用光线嵌入承载,不依赖学习到的相机编号。因此同一套模型能跨操作臂、双臂系统与移动平台使用,也适应变化的相机视角;它接收的是给定的关节位置轨迹,预测这条轨迹会让画面发生什么变化,并不做力矩或速度的积分。


深度机智(北京)科技有限公司的主要方向是物理AI 基座模型。


作者把边界写在了明处:它不显式约束刚体、接触与任务状态,能生成看起来合理的动作,却可能把抓取、接触和物体状态生成错,在交互密集的任务上尤其如此;长时程推演还会累积误差。报告也把话说明白了——它是真实交互的近似,而不是物理测试的替代。


仿真器的价值不在它有多像真实世界,而在它能不能被反复试错——被这条路改变的,是试错的供给量,而不是仿真的精度。




参考资料

  • arXiv · Uranus: Building the Next-Generation Simulation Infrastructure for Embodied AI · 2026-09-21