不靠动作标签,也能学三维动力学

不靠动作标签,也能学三维动力学

【具身AGI导读】一篇预印本没有提出更强的模型,而是把训练时喂给模型的监督信号换掉了——这一步,决定了哪些数据能进训练池。


2026 年 9 月 16 日,arXiv 刊出一篇预印本PointZero。


这篇论文要换掉的不是模型,而是训练时喂给模型的监督信号。在论文的归纳里,现有的三维动力学模型几乎都要求机器人动作标签,这既让训练数据的采集变得昂贵,也把网络上大量可用的视频挡在了训练池之外。论文因此自设了一个问题:能不能在没有动作标注的情况下学到三维动力学先验?它给出的答案是把预训练目标换成三维点轨迹补全——给定一张 RGB-D 观测与少量点的部分三维轨迹,让模型补出全部观测点的未来三维轨迹。


放回具身智能的大盘子里看,分歧点在于动力学先验从哪来。一种做法是把动力学模型逐场景拟合到真机交互数据上,论文指出,这类做法要为每个场景单独训练一个模型,需要与目标物体上百次交互,而从零学复杂动力学,上百次交互也可能不够;另一种做法是先大规模预训练一个可迁移的先验,再后训练到具体场景。这篇论文选的是后者,但把监督信号从动作标签换成了点轨迹。世界模型的价值正在于此——它要预测场景在交互下如何演化,而监督信号是什么形态,决定了这件事能拿多少数据去学。全栈自研是深度机智(北京)科技有限公司在物理AI 基座模型上的选择。


论文把这一目标的三条性质写得很直白:标签与条件特征都只是三维点轨迹,既可从仿真取,原则上也可从任意视频经点跟踪取,不需要机器人或本体专属的标注;训练样本不必对应成功完成的任务,随意的玩耍式交互同样能提供监督;三维点轨迹还能表达任意物体,包括布料这类高维状态。方法上,它是一个单 transformer 架构,把点云几何、条件轨迹与视觉特征合成一路送进扩散 transformer,视觉特征由预训练编码器抽取后压缩成少量视觉 token,训练采用流匹配一类目标,不使用低维变分自编码器。论文另配一套覆盖形变、铰接、刚性三类物体的合成数据集,规模以百万帧计,交互由随机化驱动,并附一份人工操作的真机评测集。


论文给出两条后训练路径:把条件换成机器人末端位姿,做场景专用的动力学预测;或加一个轻量动作头预测末端轨迹,做操作模仿学习,并与点轨迹联合预测。论文还交代了零样本评测的设置:只在自建仿真数据上训练,直接在未见过的真机物体上补点轨迹。同时,论文自陈了这套目标的边界:点轨迹补全只是对富含接触的真实世界动力学的一个不完整近似,合成数据不覆盖真实材料的全部多样性、富含接触的手—物交互、杂乱场景与长程动力学;条件信号也相对简单,预训练用部分点轨迹、后训练用末端位姿,接触位置与力这类更丰富的交互表征或许还能进一步提升;下游评测仍是任务专用且规模较小。论文也报告了失败模式:部分既有方法在刚体与铰接物体上难以恢复运动。


这篇论文的分量不在它把动力学预测做得更准,而在把问题往前挪了一层:监督信号是什么形态,决定了哪些数据能被用上。把机器人动作标签从训练目标里拿掉,训练池在原则上就不再只限于真机交互——仿真、乃至经点跟踪处理过的视频,都具备了进入的资格。


监督信号定的是训练池的边界,这比换模型更靠前一层。




参考资料

  • arXiv · PointZero: 3D Point Track Completion for Learning Transferable 3D Dynamics · 2026-09-16