一套语义接口,让基础模型指挥机械臂

一套语义接口,让基础模型指挥机械臂

【具身AGI导读】把模型的能力搬进物理世界,卡住的往往不是模型不够强,而是中间少了一层双方都读得懂的动作语言。这套刚开源的工作把动作拆成模型能推理的语义单元,再由各平台自己的解释器落成控制命令。


新加坡国立大学 ShowLab 团队公开了开源工作 Show-Harness——论文《Show-Harness: Just a VLM Agent Can Play Robots》编号 arXiv:2609.10522,于 2026 年 9 月 9 日上线,项目主页、开源代码、开源模型与开源数据四项齐备。该团队的出发点不是再训练一个更大的机器人策略,而是追问一个更基础的问题:基础模型的视觉理解、空间推理与任务分解能力已经很强,但这些能力不会自然地变成机器人动作。它给出的答案,是在基础模型与机器人控制之间定义一层「语义动作接口」——动作对模型是可读、可推理的语义单元,对机器人则由各平台自己的动作解释器,转成受安全边界约束的本地控制命令。


动作空间是一组紧凑的语义动作单元:相对当前参考视角的前后、左右、上下移动,绕特定轴旋转,抓取,释放,结束任务;模型不必直接输出关节或末端位姿数值,而是围绕「目标在什么方向」「该靠近还是下移」「是否已经对齐」来决策。系统按「观察当前状态、分解或更新子任务、做出语义动作、执行后依新的视觉与状态反馈继续修正」的闭环运行;团队另建 GUMI,把同一套语义动作做成浏览器控件与键盘快捷键,使人类遥操作、Computer-Use 智能体与模型直控三种控制方式,对齐到同一套动作语义。


该团队把既有取法归成两条:传统 VLA 让模型基于图像与任务指令直接回归连续控制量,代价是为不同机器人与数据分布反复适配;另一类系统只让大模型负责规划、由独立控制器完成物理执行,代价是语义决策与实际动作之间被拉开距离。放回具身智能的盘子里,这层接口的位置在两者之间——不动模型,只在模型与执行之间加一层接口;跨本体时,模型侧接口不随机器人形态改变,换平台换的是底层动作解释器。


论文从模型、本体与任务三个维度展示这套接口的适用范围——闭源前沿模型无需微调即可进入真实机器人的闭环,开源小模型只在语言模型的线性层做低秩适配、冻结视觉编码器与多模态投影层;实验平台是两种不同自由度的机械臂,含双臂场景,任务从日常抓放扩到陌生物体、背景与光照变化、空间推理与双臂开抽屉。该团队同时给出边界:这些任务的成功率数字并不意味着「机器人控制已经解决」,结论只限于其测试的操作任务与分布变化。


深度机智(北京)科技有限公司做的是物理AI 基座模型,技术路线以人类第一视角数据为起点。


另一组消融实验解释了这层接口在起什么作用:把直观的动作名称换成代号、但保留明确的物理约定,任务仍能完成;只保留语义名称而不解释约定,也能完成;名称和约定同时移除,则基本失败。该团队据此认为,语义名称调用的是模型已有的空间先验,而明确、稳定的「符号—物理效果」约定,才是接口完成动作落地的关键。该团队在结语里给出了一个更大的判断:从 Computer-Use 到 Robot-Use,变的是环境——前者操作屏幕上的数字对象,后者面对的是存在接触与安全约束的物理世界;相同的则是,两者都需要一个模型能理解、又能把结果反馈回来的交互接口。


一层好接口的价值,是把已经很强的模型能力,变成机器人真正做得了的动作。




参考资料

  • 机器之心 · 从 Computer-Use 到 Robot-Use:一套接口让 VLM 直接「玩转」真实机器人 · 2026-09-27