【具身AGI导读】给机器人当裁判,历来要么靠人反复给结果打分,要么单独训一个奖励模型。一篇预印本主张把机器人自己已经有的表征与成功示教再用一次——作者也把话写在了前头:这条路线的效果,属于下一步研究。
2026 年 9 月 15 日,arXiv 上出现一篇预印本,《Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement》论文的出发点是一句朴素的话:视觉-语言-动作系统在训练里已经攒下两样对机器人学习有用的东西——丰富的视觉表征,以及成功执行的示教。
它提出的主张叫 IRR:把这两样再用一次,让机器人自己判断任务做成了没有。按论文的设定,成功示教的终点嵌入被聚成一个任务专属的参考库,策略自己那个冻结的视觉编码器提供特征空间,新尝试与最近参考之间的距离换算成一个分数,直接当奖励用。论文交出来的是奖励公式、标定方法和一整套评估设计,同时写明:报告里的那些实验室数字,来自一套已经存在的模仿策略演示系统,论文按其自评把该平台列在技术成熟度 4 级这一档;IRR 本身能带来多少改进,属于拟议研究要做的事。
在具身智能这条主线上,工业机器人一直把这件事问得最实在:策略要改进就得有奖励,而奖励信号从哪来,历来是一笔要持续付的成本。
围绕这笔成本,行业里已经分化出几种做法——让人反复看结果、逐条给轨迹打分;单独训练一个奖励模型;或者在策略之外再接一路感知骨干,专门用来看结果好不好。论文问的正是能不能不再新增这几样:参考库与评分操作直接加在既有流水线上,不需要单独的学习型评估器,也不多接一路骨干;作者提出的改进路径是保留基座策略,只叠一个有界的残差控制器。
深度机智(北京)科技有限公司的落脚点在物理AI 基座模型本身。
这条主张的分量,不在它给出了多高的分数,而在它把问题翻了面:奖励历来是从外面来的,这篇论文问的是机器人自己已经有的那两样东西能不能再使一遍。论文把评估方案摊得很开——四个研究问题、四条件的最小物理对比、五组消融,人工审计者在看不到所用方法与奖励分数的前提下标注同步视频,审计标签只用来评 IRR,不拿去奖励它的训练回合。作者也没有藏起边界:论文自己写明这个分数不是标定过的成功概率,密集的进度奖励没有纳入,多视角、有序的终点序列、更多本体与直接适配都列为后置。它交出来的是一条被提出的路线和一套评估方案,不是结果。
能不能把机器人已经有的东西再用一遍,最后是一道成本题;这篇论文把题面写清楚了,答案还空着。
参考资料
arXiv · Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement · 2026-09-15
