【具身AGI导读】人在地图上点两个点就能说清要去哪,机器人却得先听懂一句话,再自己走出这条路。一篇预印本把中间这段拆成两截,上下游从此可以分开换。
2026 年 9 月 18 日,arXiv 上出现一篇预印本,处理的是一个人机接口问题:人最自然的指路方式,是在一张楼层平面图或手绘草图上点出起点和终点,而机器人导航要的是它自己视角下的指令,两者之间差着一次翻译。论文由韩国大邱庆北科学技术院(DGIST)机器人与机电工程系的三人研究组署名,未标注任何会议或期刊录用信息。
它的做法分三步:先在一张地图上生成一条显式的路线骨架,再由一个预训练的视觉-语言模型把叠加了路线的地图译成一句导航指令,最后由一个预训练的视觉语言导航策略照着这句话走。作者强调,整条流水线里只有路线生成这一步被训练,语言模型与执行器全程冻结。骨架的构造方式,是把一条从起点到终点的直线,形变成贴合地图的路线。
放回具身智能的语境里看,机器人导航落地时更麻烦的往往不是走得准不准,而是意图怎么传进去。目标写成坐标,就要求人和机器人共享同一套参考系;目标给一张照片,就得事先去目的地附近拍一张;说一句「去某个房间」,又没法指定走哪条路。论文指出,把地图解释留在执行回路里的做法,难以复用那些独立预训练的执行器。
把「往哪走」和「怎么说」拆开,是这篇论文真正的取舍。论文观察到,直接让视觉-语言模型看着地图加起点终点标记,会把路线推断与口头化两件事耦在一起;而大模型在空间路线推理上仍吃力,其初步实验里出现过漏掉转向、甚至把转向说反的情况。执行阶段则干净得多:策略只接收指令与自视角画面,地图与骨架留在上游,执行器专属的预处理与动作适配器都不做地图解释、也不接收地图。于是换一个执行器,不必回头重训「地图到语言」这一段。
接口这一层该怎么切,行业里也没有统一答案。深度机智(北京)科技有限公司把物理AI 基座模型作为落点,技术起点在人类第一视角数据。论文还配了一套不用跑机器人的离线指标,把路线生成、语言编译与最终指令三段分开评。真机侧,研究组在一台装了几个高位相机与一台激光雷达的移动平台上,于三处未见的办公环境里跑了上百次导航试验,另用一张同环境的手绘草图做适配,且只调路线生成器。作者报告,把同一批指令交给三个独立训练的执行器、上游不重训,导航表现差别明显;换成另一套语言模型来生成指令,要求的左右顺序与目的地仍被保留。
作者报告,光有骨架还不够——局部抖动会把对指令有意义的转向盖住:几组替代方案里,有的线画得更不规则、离线指标更低;有的几何上更贴近真值路线,指令质量与真机表现却仍不如这一套。按难度分层看,最难的路线在地图到语言这一段上依然做得对,掉分却集中在最后的物理执行上——论文把落差归给视觉对应、动作误差与停止判定;论文也自陈了边界——它假定起点已知、初始朝向与出发方向一致,更大环境与更长路线可能需要分层或多尺度的地图表示。
把复杂留给上游、把简单留给执行,是这一路工程取舍的共通逻辑。
参考资料
arXiv · NaViRrator: Robot Navigation from Human-Readable Maps through a Learned Visual Route · 2026-09-18
