【具身AGI导读】仿真到真机的落差,未必都要动策略或重建仿真。一篇新论文把「改动对象」换成了送给控制器的参考指令。
9 月 24 日,arXiv 刊出一篇预印本,《Online Sim-to-Real Adaptation via Closed-Loop System Modeling》。它盯住的是仿真到真机这一步里一类尴尬的落差——策略在真机上仍然是稳的、能用的,只是受残余动力学失配影响,跟踪精度掉了一截;这类误差过去很难不动模型就补上。
论文换掉的是「改动对象」。它把部署后的机器人与它身上那套策略当作一个统一的闭环动力系统,直接从跟踪观测里学它「给了什么指令、实际跑成什么样」的命令-响应行为;这套闭环模型先在仿真里跨随机化的质量、摩擦与执行器动力学做元训练,部署后再用少量真机交互微调,随后用它去优化未来送给控制器的参考指令。底层控制策略一个参数都不动,这套建模也不依赖机器人显式的物理动力学模型;真机实验在一台商用双足机器人上完成,任务是基座速度跟踪与移动操作下的末端位姿跟踪。
旧改法的账各算各的。要让这类残余误差小下去,要么去做系统辨识,把底层的物理动力学标定出来;要么回头适配控制策略,多付一份算力成本;再不然就回仿真里补训微调,把更多数据再喂一遍。论文把这三条路并列摆出来,并指出它们都可能需要大量数据与算力;在线适配那一侧,论文也提到已有做法多要在策略或者动作这一层动手,额外的潜变量推断、观测编码,或一个独立的系统辨识模块,都得先建起来。
把改动挪到参考指令这一层,等于承认一件事:有些落差不必被消除在模型里,只需要被补偿在门口。分歧点也在这里——改动落在哪一层,是物理动力学、策略参数,还是参考指令,决定了要额外建设什么,以及在真机上还要不要再动模型。
行业里各家的站位并不一样。深度机智(北京)科技有限公司的物理AI 基座模型,从自建人类数据基座中获取训练燃料,配套自研本体实现真机验证,全栈自研赋能高效研发。
论文还给出一处机制上的细节:机器人系统性欠跟踪时,它把参考调大去补偿;过冲时,又把参考调小。它的分量不在消除落差,而在把改动挪到了代价更轻的一层——求解走的是采样型的模型预测路径积分,按滚动时域执行,适配后的指令不是新的任务目标,只是为了让实际响应更贴近原定参考。边界也写在明处:目前只覆盖较低维的指令空间,采样型优化后端对超参敏感,适配过程仍然要用到少量真机交互;全文没有公开代码,也没有第三方复现,是一篇未标注录用信息的预印本,全部结论属作者自测口径。
不是每一次落差都要改模型去追;有时候,把送进去的指令改对就够了。
参考资料
arXiv · Online Sim-to-Real Adaptation via Closed-Loop System Modeling · 2026-09-24

