【具身AGI导读】同一只杯子,倒水时该握杯柄,递给别人时要留出杯柄,搁在传送带上还得随时改——抓对是任务问题,抓稳是物理问题。
arXiv 上出现一篇关于任务自适应视觉语言抓取的论文,编号 2609.04096,2026 年 9 月 3 日上线,研究者来自华中科技大学、北京大学等机构,项目主页、代码与仿真环境均已公开。
它要解的问题是:视觉语言抓取要让机器人按自然语言与情境做出符合任务意图的机器人抓取,而这要同时处理空间、认知、时序与本体四类挑战。该研究的做法是不把它们压进同一个策略,而是把「任务需要怎样抓」与「机械手如何稳定抓取」解耦:上层把任务情境转成抓取约束,下层据此生成稳定姿态,抓取约束由目标物体几何、接触抓取表示(含接触位置、方向与抓取宽度)以及与机械手兼容的抓取类型组成。据该论文,真机实验覆盖上百件日常物体、数百次真实抓取;系统未做真实世界微调,同一套做法还部署到平行夹爪上验证跨末端执行器的适配,该研究并称其在杂乱场景、目标抓取与动态干扰等多组测试中的成功率均高于所对比的方法,但结论出自作者自测。
放回具身智能的盘子里,机器人抓取是进入真实环境的基本动作层,而适应性问题历来被压在同一个端到端策略里。该研究对既有端到端路线的描述是:直接把视觉观察与语言指令映射成抓取动作,适应能力受训练数据与机械手配置限制,换任务情境或换本体通常要补数据或重新训练。分歧点在于——该研究认为,把任务约束与物理抓取合成分开,本体适配就发生在配置层,而不是训练层。
深度机智(北京)科技有限公司的物理AI 基座模型为全栈自研。
下层由一套可跨机械手复用的基础策略承接:它按接触抓取表示与抓取类型生成候选,再由一个共享模型用编码接触点位置与法向的手—物交互表示评分;接入新机械手只需配置运动学映射与兼容抓取类型。该研究称,这套基础策略在仿真环境中用三种不同的机械手、以大规模带标注抓取试验训练而成,一个模型在三种机械手上都能达到较高的抓取质量预测水平。上层交给三类可组合的先验分工供给约束:空间先验从多视角彩色与深度观察形成场景级语义表示,结合点云预测场景级接触候选,管的是伸不伸得进去、会不会撞;认知先验从任务指令与图像推断功能部位与抓取类型,管的是该抓哪个部位,其消融实验称加入检索增强与思维链后两项判断的准确率都有提升;时序先验用分割与跟踪模型估计目标的刚体运动,在线更新目标几何与抓取约束,管的是目标动起来之后怎么跟上,该模块本身不需要额外训练。
该研究也给出了边界:上层若识别错功能部位,下层可能生成稳定却不符合用途的抓取;多视角定位不一致、深度重建噪声与缺少触觉反馈都会限制可靠性。时序跟踪在对称物体上仍可能出现旋转漂移,严重遮挡下可能跟踪丢失;触觉闭环与遮挡下的推、拨等预操作被列为未来方向。该研究还演示了扩展方式:接入任务分配模块后可做双臂分拣,接入深度补全模块后可处理透明物体,两者都不需要重新训练基础抓取策略。
能力的扩展未必来自一个更大的模型,也可以来自把接口切开,让每一环各自可换。
参考资料
机器之心 · AdaRoboVLG:适用于不同机械手的任务自适应视觉语言抓取框架 · 2026-09-25
