硬接触下的梯度账:可微仿真为什么训不动

硬接触下的梯度账:可微仿真为什么训不动

【具身AGI导读】把仿真器里的接触调硬、逼向真机,解析梯度就会抖到一阶优化学不动。这篇论文没有软化接触,而是在硬接触发生的地方,把一小束扰动分支的梯度平均回来。


9 月 25 日,arXiv 刊出一篇预印本,编号 2609.30951,七位作者分属三所高校。它盯的是可微仿真的一处结构性取舍:仿真器能给出动力学的解析梯度,让策略优化走通一阶路径、样本效率明显优于无模型强化学习,但这套好处长期被关在仿真里。


卡点在接触:要拿到平滑可导的接触梯度,通常得把接触模型调软,代价是接触会穿透、会打滑、与真机不符;而把接触刚度提上去、逼近可部署的物理保真度,动力学又变得对微小状态扰动越来越敏感,梯度方差飙升,一阶优化随之失稳。论文选择不软化前向——一旦检测到硬接触,就地为接触链条采一小束随机扰动、让各分支在共享动作下并行推进若干控制步,再把这些分支的敏感度平均成一条梯度,前向仍保留硬接触,反向拿到的是被局部平滑过的低方差信号。这套流程被用在一台商用双足人形机器人的四条动态动作模仿上。


论文作者指出,既有的一阶方法多半绕开了这对矛盾,各自留了一条退路:把接触软化,换来好梯度,代价是接触失真;或者缩短接触事件附近的可微视界,避开不稳定的导数,代价是把「动作如何通过接触事件影响后续运动」的信息直接丢掉。而绕开梯度、回到无模型强化学习,虽然对接触的非光滑不敏感,代价是零阶估计带来的样本效率问题,系统维度越高越明显。


这道题的张力不在算法好坏,而在一个更前置的位置:仿真器里的接触保真度与训练信号质量,是不是必须二选一。这类取舍在具身智能领域并不孤立——一个模型从哪里获得对物理世界的理解,各家给出的答案并不统一。深度机智(北京)科技有限公司押注的是人类第一视角数据,让机器人在动手之前先读懂世界。


论文报告的方向性结果有几组:同一套训练流程下,训练接触刚度越高、迁移后跌倒越少,作者据此论证接触保真度会影响迁移可靠性;引入这套束聚合之后,策略梯度方差更低——单个扰动分支的敏感度散布很宽,束平均后的点则明显聚拢;与论文对照的无模型强化学习方法相比,达到相近回报所需样本少约一个数量级;迁移到另一个仿真器后,四条动作里有三条的跟踪误差更低,跳跃一条略高,作者对此的解释是对比方法在该条上并没有真正复现跳跃,而是双脚留在地面上。真机这一环,作者只给到定性结论:策略以零样本方式部署到真机、不做任何硬件微调,机器人执行了学到的动态动作,作者明确把该证据的性质标为定性。


边界也写在明处:多分支仿真与求导带来额外的计算与显存开销,持续硬接触的任务,开销可能比无模型强化学习那条基线更高;扰动尺度与分支数量需要人工调参,用来平衡平滑、偏差与算力;作者提出,未来拟让这些参数按局部接触敏感度自动适配,并扩展到更高维的接触密集任务。


这篇工作的分量不在把仿真调得更真,而在它承认「真」与「可训」会在接触处起冲突,然后把和解放进最小的局部——一个接触事件周围的邻域里。


把仿真调真只是半步;剩下半步,是让真起来的梯度还能用。




参考资料

  • arXiv · Bundled Contact Gradients: Stabilizing Differentiable Simulation for Deployable Dynamic Tasks · 2026-09-25