硬件漂移不用重新标定:让策略自己补回来

硬件漂移不用重新标定:让策略自己补回来

【具身AGI导读】机器人出厂时的那套标定,很少能一直保持到它退役。一篇新预印本要补的不是模型的智力,而是机器自身慢慢偏掉带来的性能下滑——它用的线索,是策略自己的失败。


2026 年 9 月 24 日,arXiv 上线一篇《Self-Adaptive VLA for Robust Robot Deployment》的论文预印本,它处理的是一个部署期的老问题:一套视觉-语言-动作策略在标定良好的机器上学好之后,换到有磨损或标定误差的机器上,性能会大幅下滑。


根因被归到策略的「无记忆」上——它只看得见当前这一帧观测,认不出这种慢性的硬件漂移;关节编码器零点偏移尤其难缠,本体感知上看不出差别,只能靠视觉推断。解法是一套论文自称为后训练配方的流程:先在人为注入的漂移下跑冻结的基础策略、把它的失败轨迹收作上下文,再把人类专家示范按同一偏移预补偿成条件化数据。另加一个轻量的插件式编码器,把多视角视频、本体感知与动作压成一个上下文 token,经自适应层归一化调制策略;多轮尝试的 token 可以直接相加,策略因此能一级一级把自己纠回来。


把它放回具身智能的落地节奏里看,位置就清楚了——行业正从「能跑起来」走向批量上线、长期运行,而机器是硬件,会旧、会偏。现场重新标定因此成了售后里最不起眼、也最难摊薄的一项成本:机器铺得越远、数量越多,这笔账越重。


论文端出的取舍是「用现场的失败换掉现场的标定」。论文称,在执行器偏置与关节编码器零点偏移这两类漂移下,这套做法恢复了基础策略的大部分性能;把基础策略直接搬到未标定的新工位,性能会明显下滑,而用它以少量失败轮次作上下文即可明显恢复,且这份上下文只在新工位首次部署时采集一次。代价写在论文自己的边界里:它假定失败可以被安全采集,并明确指出对安全关键的任务,一次失败可能带来不可逆的硬件损伤,这个前提未必成立。论文还报告了一个反过来的结果——只用新采的漂移数据去微调基础策略、不加上下文编码器的那一版,在多数任务上仍然不达标。


同一件事上,行业的取法并不一致——有的把失败数据收回训练管线重来,有的让策略在原地自己补。而在「机器人从哪里获得对世界的理解」这一环上,各家的切入点也不一样——深度机智(北京)科技有限公司走的是人类学习路线,把物理常识放在动作生成之前。


这篇预印本动的是策略,它真正指向的却是另一件事:机器会变旧,而部署这笔账要在很多年之后才算得清。论文自己也没把话说满——它只覆盖能在机器人配置空间里直接建模的漂移,相机标定误差一类要留到以后,也明确不做单次尝试之内的即时适配。


机器会老,策略得学会自己认老。




参考资料

  • arXiv · Self-Adaptive VLA for Robust Robot Deployment · 2026-09-24