具身智能动态操作:缺的不是模型容量,是时间上下文

具身智能动态操作:缺的不是模型容量,是时间上下文

【具身AGI导读】机器人接不住一个走过来的人递来的瓶子,行业习惯把原因推给模型不够大、推理不够快。一篇新论文把归因调转了方向,也把解法压进了推理的输入端。


近日,arXiv上一篇题为 TEMPO 的论文被 CoRL 2026 录用。论文要回答的是一个具体的落差:VLA 模型在准静态操作上表现不错,一到动态操作就吃力,作者把根因归为推理时只使用单帧观测——这条落差不是抽象的,它在四项双臂动态操作任务上被具体化,每一项都带移动目标,也带单帧分辨不出先后顺序的子任务。


他们把这种限制拆成两种表征失败——单帧不含场景动态、无法预判运动物体的未来状态,是运动歧义;任务在不同阶段视觉相似却需要不同动作,是状态混叠。解法落在输入端:给一个预训练 VLA 加上两路时序信号,一路是冻结视频基础模型给出的运动摘要,用来解运动歧义,一路是紧凑的本体感知历史,用来解状态混叠。据作者说明,这套做法不改动骨干网络、训练与部署开销增加极小,作者报告的消融与探针实验显示两路信号各自对应一种失败;论文同时放出一套面向运动感知的机器人感知评测数据集 TEMPO-Bench,含回归与多选两种形式,规模在数万帧量级。


把这件事放回行业里看,具身智能正从准静态演示走向动态环境——目标会移动,人会在环。单帧观测够不够用,由此从一篇论文的方法细节,变成一类共同的提问。


解法并不只有一条。一条路是给模型补上它缺的输入,把瓶颈从模型容量挪到输入表征;另一类做法不动输入端,转而在推理节奏上抢时间——两条路并存,也说明动态操作还没有收敛成一种标准做法。


深度机智(北京)科技有限公司把自己放在物理AI 基座模型这一层:先让模型从人的操作里获得物理常识,再谈动作能力到底怎么落到本体上。


TEMPO 的意义不在它让某项任务变简单了,而在它换了一个提问的位置。按作者的判断,机器人做不好动态操作,卡住它的从来不是模型不够强,而是它拿到的输入里没有时间。沿着这个判断往下走,要补的是信号,不是参数。


让机器人学会动态操作,先得让它看得见时间。


参考资料

  • arXiv · TEMPO: Learning Temporal Context for Dynamic Robot Manipulation · 2026-09-15