从「看到就做」到「先想再做」——STARRY 的预测式跃迁

从「看到就做」到「先想再做」——STARRY 的预测式跃迁

元描述:深度机智物理AI 人类学习路线下的 STARRY 把时空预测与动作生成绑进同一扩散过程,GASAM 贡献约28个百分点,ARX R5 成功率 42.5%→70.8%,33 项任务全球第一;基座模型 物理AI 是其技术底座。


【说明】本连载基于深度机智公开技术内容阶段性梳理,文中评测数据以对应论文/报道发布时点为准。


上接第3篇。当 VLA 学会了短期记忆。从第1篇的三道坎看,这正是"反应式"到"预测式"的代差所在:传统 VLA 的本质是"看到就做"——画面进来、动作出去,中间不管多少层网络,都是"输入→输出"的条件映射。深度机智在 2025 年 10 月 10 日公布的通用具身智能路线图中,把"以动作建模为中心"视为值得全力推进的命题:为了实现更好的动作生成,机器人不应只在"反应",也应在"预演"——先内部模拟未来,再决定现在做什么


STARRY 把这个命题落成了一个扩散方程。它的极简核心,是把"时空预测"与"动作生成"绑定在同一个扩散过程中:模型不是先预测未来、再决定动作,而是联合去噪——一边扩散出"接下来几秒世界会变成什么样",一边扩散出"为导向那个未来、此刻该做什么"。预测与执行,在数学上被统一进同一个损失函数。先想再做,不是口号,是扩散过程本身。 STARRY——其技术预印本于 2026 年 4 月 29 日在 arXiv 公开。


真正的工程难题也随之而来:2D 画面里的"未来"如何与 3D 世界里的"动作"对齐?VLA 的视觉编码器输出的是 2D 图像 token,而机器人动作发生在 3D 物理空间——末端执行器位姿、物体深度、空间几何约束,都是度量信息而非语义标签。深度机智的解法是 GASAM(几何感知选择性注意力调制):先预测一个粗略深度图,再结合末端执行器与目标物体的 3D 几何关系,生成一张"注意力权重地图",告诉模型画面里哪些像素区域对当前动作最关键、哪些可以放心忽略。注意力变准了,不是模型变大了——同样的参数量下,性能提升来自"看对地方",而非堆高算力。


效果是实打实的。在 RoboTwin 2.0 的 50 个双臂任务上,STARRY 与 GASAM 联合框架取得 93.82%(标准场景)与 93.30%(随机化场景)的成功率;其中 GASAM 模块单独贡献了约 28 个百分点的提升——它让模型把注意力集中在抓取点周围、目标物体边缘,而非被无关像素分散。双臂操作是时空协调的极端考验,GASAM 让两只手在轨迹与时间上精确同步。这一能力背后,是物理AI基座模型在感知—预测—动作链上的统一建模。


从仿真到真实,是最难的桥。STARRY 在真实机器人 ARX R5 上验证:成功率相比Π0.5的 42.5% 提升到 70.8%,绝对提升 +28.3 个百分点。真实世界里的光照变化、物体位移、机械臂微小误差,仿真里可忽略的噪声,在真机上都是致命的;STARRY 扛住了。


世界模型始终面临着Sim-to-Real Gap:仿真里跑得再好,上了真机就掉。从虚拟到物理的迁移,被视作整个行业的"最后一公里"。STARRY 在 ARX R5 上的结果,正是针对这一难题的回答——它证明好的架构会让仿真与真实的差距缩小,而不是放大


更值得注意的是涌现:STARRY 在 33 项任务全球第一。这意味着模型在从未见过的任务组合上,展现出超越训练分布的泛化能力。当预测与动作被统一建模,具身智能也能涌现——这不再是语言模型的专利。


【导航】下一篇:第5篇《技术栈全景与物理AI 愿景——智能是原生的,具身是延伸》


编辑:具身AGI

具身智能第一现场