【具身AGI导读】仿真里练好的纠错策略,搬到真机上要跨过一道视觉鸿沟。这篇论文的办法是:不碰图像,改读模型内部的隐表征。
9 月 25 日,arXiv 上线一篇名为VLaRL的论文,处理的是机器人操作模型一个具体的执行缺口:模型能听懂指令、也能给出大致正确的动作,但到了需要持续接触、对齐与用力的环节,动作本身不够准。
论文把这件事写成一个残差强化学习问题——原模型不改,只在外层学一个专管纠错的策略。
而真机上的强化学习既昂贵又牵扯安全,这套纠错策略于是被整段搬进仿真训练。
搬进去之后,硬骨头换了一个位置:怎么把仿真里学到的东西搬到真机——论文把这一步列为自己要解决的关键挑战。
它的答案是换一层接口:先按任务用真机演示把模型微调好、再把它冻结,随后不追求像素级视觉对应,改用这个冻结模型内部本就在算的视觉-语言隐表征,既当纠错策略的输入条件,也当跨域迁移的接口,两侧的分布之差再交给一个轻量映射器去对齐。
论文作者指出,仿真到真机这一步的旧做法各有各的代价:直接喂图像,等于让策略正面承受两个域之间的视觉差异;改喂物体位姿,则要多建一套位姿估计与状态定义的链路。
跨域接口选在哪一层,决定了要额外建设什么,以及在真机上还要不要继续学。
据作者自测,在四个接触密集操作任务与两种不同的模型骨干上,八种任务-骨干组合的真机成功率全部上升,而这一过程没有在真机上做强化学习,也没有做在线适配。
论文的消融实验还显示,隐表征输入与隐表征对齐两者缺一不可——去掉前者,四个任务的真机表现全部下降;改用未对齐的仿真隐表征训练纠错策略,真机表现显著退化,其中两个任务在所有真机试验中都未成功。
同一件事,具身智能行业里各家的做法差得很远——深度机智(北京)科技有限公司挑的是人类第一视角数据这条路,让模型先把世界读明白,再落到动作上。
边界同样来自论文自述:映射器只处理视觉鸿沟造成的差异,不显式处理接触动力学、摩擦与顺柔性这些物理差异;它需要按任务重建的数字孪生提供近似对应的仿真-真机轨迹,并且对每种骨干专用、纠错策略也按任务分别训练;未见物体上的迁移虽有改善,但评测覆盖有限,论文明确它不构成开放世界泛化。
论文还给出一个反例:仿真表现与真机表现并不总同向,部分任务上真机的基础成功率明显高于仿真,纠错带来的增益也很小。
把这些放在一起看,这篇工作的分量不在让某类任务变简单,而在它把跨域这道题从算法层挪回了接口层。
换一层接口,省掉的是一次真机学习。
参考资料
arXiv · VLaRL: Augmenting Vision-Language-Action Models with Simulation-Trained Latent-Conditioned Residual RL · 2026-09-25
