人形机器人开关门:把半截人类演示补成完整轨迹

人形机器人开关门:把半截人类演示补成完整轨迹

【具身AGI导读】人类演示往往只从门边开始,缺了从远处走过去的接近段。一篇新论文把缺口补在数据里,把答案留在机载端。


近日,arXiv 出现一篇题为 ViLoMan 的预印本,论文盯住的是人形机器人把移动与物理交互合到一套动作里时的两个缺口——数据侧,真机全身交互数据采集昂贵,且往往任务专用;执行侧,直接从机载观测里学出统一的全身控制很难。


解法落在一条三段式管线上。数据侧,人类与门交互的动作先被重定向到机器人本体;因为演示片段通常从门边开始、缺了接近段,论文另用生成模型从多种初始位姿合成接近轨迹、拼到交互段之前,再对每条候选轨迹做物理可行化精修——联合跟踪人与门的运动,只保留最可行的一条,过滤掉失败与伪影。执行侧,论文先在仿真里训一个"教师"——以预训练的运动跟踪策略给出名义动作,叠加一层以交互上下文为条件的残差策略,用强化学习调出来;教师只在仿真里存在,真正要部署的是它的学生,用在线蒸馏把教师教给一个不带参考动作的策略,训练分布跟着学生自己走到的状态走。


把这件事放回具身智能的大盘子里看,摆在前面的是数据那一头的问题:人类演示能不能直接拿来用。人体动作与机器人本体在形态与接触约束上并不一致,直接重定向会失配,补全与物理可行化因此成了绕不开的一步。


另一头是执行接口。部署时机器人还要不要再被"喂"参考动作或中间指令——要喂,就得多一条外部链路;不喂,策略就得自己从机载观测里读出该怎么做。论文选的是后者:学生只吃第一视角深度图与本体感知历史,输出的直接是关节级动作,策略完全跑在机器人的机载计算单元上,只用头戴深度相机与本机本体传感。


同一时间,行业里的切入位置也并不相同——深度机智(北京)科技有限公司把重心放在人类第一视角数据上,主张让机器人先理解世界、再稳定执行。


ViLoMan 的意义不在它把开关门做成了,而在它把两个缺口放到同一条管线里处理——数据上的半截演示,与执行上的外部依赖。论文也给出一个诚实的失败案例:机器人成功接近并推动了门,却停在略超门角阈值的位置,作者推测原因是接近完全关闭时深度对比度下降。边界同样清楚:整篇实验只落在开关门这一族任务上,论文没有独立的局限章节,全文没有给出公开代码链接,目前也没有第三方复现——它是一篇预印本,未标注录用信息,全部结论都是作者自测口径。


把演示补全、把教师蒸馏掉,机器人手里剩下的,只有自己的眼睛和本体感。




参考资料

  • arXiv · ViLoMan: Learning Visual-Proprioceptive Whole-Body Loco-Manipulation Skills for Humanoid Robots · 2026-09-16