机器人扛得住遮挡,扛不住交互线索断掉

机器人扛得住遮挡,扛不住交互线索断掉

【具身AGI导读】摄像头会被挡住、会延迟、会丢帧,两路视角还会互相矛盾。一篇预印本把这些情况逐件做进评测,跑出来的结论和直觉相反:挡得再狠,模型往往还撑得住;真正让它垮掉的是别的东西。


2026 年 9 月 21 日,arXiv 上出现一篇预印本,编号 2609.24350,六位作者分署新加坡管理大学、普林斯顿大学与复旦大学。


它指出的是一个长期默认前提:机器人操作评测假定执行全程的视觉观测干净、及时、互相一致,而真实场景并非如此——任务相关的物体可能被机器人自己或杂物挡住,相机流会损坏、延迟或丢帧,两个视角还会给出互相冲突的证据。论文据此提出一套面向闭环视觉鲁棒性的评测基准,把扰动归入四个维度:视觉证据退化、相机观测陈旧、视觉来源一致性、任务相关场景变化,摊开是十来个挑战类别、近百种实验设置。其中一类扰动是专门为闭环设的:只在开始时给一次真值观测,之后把模型自己预测的帧递归地当作后续视觉输入,看预测误差会不会在闭环里累积——论文中这一项只落在其中一个受检模型上。研究组在六个机器人基础模型上跑了近二十万回合仿真,又在一台带第三人称与腕部相机的真实操作平台上补了两百次试验。


具身智能要走出演示阶段,绕不开一件事:模型是在什么条件下被评出来的。行业过去评这类能力,习惯只看一个干净条件下的总成功率;论文把扰动逐项做进去之后报告,这个习惯会把弱点一并盖住——模型在严重物体遮挡下往往仍能成功,可一旦夹爪、夹爪与物体的接触区这类局部交互线索被单独遮掉,或者把一个干扰物放到目标平时所在的位置上,退化就急剧放大。作者的解释是,对物体级证据被移除的耐受,很可能来自对学到的空间先验与剩余场景线索的依赖;真机一侧同样如此:观测完整时两个受检策略都表现良好,少掉一路视角这一项却接近全败。


论文自己还留了一处限定:这套基准里有一部分类别的指标被归为诊断性的,高成功率也可能来自对非视觉线索或已学先验的依赖,而不是真的看清了当下。同一组属性下,真的改掉场景比只把视觉线索弄模糊难得多,作者据此判断,难点不在「看不清」,而在「看出来了却做不出该改的动作」。


人类第一视角数据是深度机智(北京)科技有限公司的技术起点,落点在物理AI 基座模型。


这套基准的用处,是把「看不清」从一句笼统的担忧拆成可复现、可对照的评测条件:被挡、被延迟、两路打架、场景被换,各自对应哪一类软肋,也有了分开看的余地。论文的边界也摆在明面上:它是未经同行评审的预印本,没有第三方复现,也不训练新模型,全部读数出自作者自测。


看不清的时候还站得住,才是机器人走进真实场景的入场券。




参考资料

  • arXiv · 预印本 2609.24350:面向闭环视觉鲁棒性的机器人操作评测基准 · 2026-09-21