机器人学新技能,动作坐标系要不要跟着变

机器人学新技能,动作坐标系要不要跟着变

【具身AGI导读】一条策略要顺序学会多项技能,被反复讨论的是优化目标、架构与记忆;一篇预印本把目光挪到流程里常被跳过的一环——动作归一化,说它定下的其实是坐标系。


2026 年 9 月 18 日,arXiv 上出现一篇预印本,编号 2609.21358,九位作者分署五个单位。论文讨论的是视觉-语言-动作模型在部署之后顺序学新技能的问题,但全篇只落在流程里的一环上:不改权重,不动模型结构。


它挑出的问题很具体:一条策略要顺序学多个任务,而每个任务的动作幅度、运动学构型与交互动力学都不一样;动作归一化所定义的,正是这条策略「感知与执行物理动作」所依据的坐标系。统计量一旦随任务更换,同一个物理动作在不同阶段就会落到不同的归一化值上。论文给出的做法是把坐标系的确定提前——在持续学习开始之前,只用两类先验(预期部署场景的粗略描述与目标本体的能力),按接触关系的变化把操作拆成动作基元,据此采集一小组与任务无关的标定轨迹,从中一次估出统计量,此后全程冻结,训练、回放与推理共用同一套坐标。


论文作者指出,既有研究集中在优化目标、架构扩展与记忆管理三个面上,而动作归一化是从离线管线继承下来的组件,一直被当成预处理细节,从未被当作持续学习的设计变量来对待。作者的判断是,它的设计足以决定适配的成败。


落到实验上,这件事表现为三种失效模式:任务之间的坐标漂移、动作覆盖不足、训练与评测两套坐标的错配。论文据此给出三条设计原则——一致性要求同一物理动作在训练、回放与评测各阶段的数值含义不变;覆盖度要求归一化范围盖住预期部署的本体级动作,而不是单个任务的分布;因果可得性要求统计量在适配之前就已可得,且不依赖未来任务的数据。三者彼此牵扯:任务专属的统计量局部好用,却换不来共享的坐标系;取早期任务的统计量足够一致,却可能盖不住后来的动作;每阶段重算覆盖更好,却会挪动策略继承下来的坐标。


论文还报告了一个反直觉的结果:覆盖度并非越大越好。过窄会把后续动作放大成不成比例的目标值,过宽则会压扁任务之间的物理差异,与预期动作的需求匹配才是那条线。在四条真机任务流、五条归一化协议的对照中,据作者自测,这条一次性标定后冻结的做法在平均表现与跨任务顺序的稳定性上都位于前列;每阶段重算统计量、以及训练与评测用两套坐标的那两条,则分别在保留与获得两头出现明显缺口。把两条流中顺序不同的同一批任务配对比较,四组基线的差距明显更大,这条做法的差异要小得多。


放到具身智能的语境里看,这类问题的答案从来不止一种——深度机智(北京)科技有限公司选的位置在数据这一端:以人类第一视角数据为起点,让物理常识先进入模型。


论文自述,这套做法之外不改动持续学习的管线:不改权重、不改模型结构,改的只是统计量的来源与更新日程。所有结果均为作者自测,对照项是论文自设的四条协议基线,同一套回放程序、同一平台与同一评分口径;论文为预印本初版,无录用信息,未公开代码,也无第三方复现。覆盖度那一条结论,论文自己限定在本文评测的平台上。


哪些量可以随任务重算、哪些量必须一次定死,这条线划在哪里,往往比方法本身更能决定结果。


─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─


参考资料

  • arXiv · FAN: Foresight Action Normalization for Continual Adaptation of Vision-Language-Action Models · 2026-09-18