【具身AGI导读】机器人看不见全部信息,任务却要求它把信息找齐。一篇新论文把「主动去获取信息」做成了一套可考的协议,也给出了一个反直觉的记忆设计结论。
近日,arXiv 上线了一篇机器人操作评测的论文,论文盯住的是主动感知——机器人得自己转头、走过去、把东西翻过来,才能拿到不在当前视野里的那点证据。论文指出,既有评测有一个共同的盲区:默认固定视角已经够用,也默认记忆里的信息是齐的,于是「主动去把信息拿回来」这件事既无从考、也无从诊断。
论文的做法分三层:本体开放头部与躯干自由度,让机器人自己挑视点;场景改成以机器人为中心、水平覆盖约半个圆周的多层工作区,物体分散在不同方向与高度,没有任何单一固定视角能看全;交互层则允许机器人摆弄物体、从有信息的位置去检视,把藏起来的证据翻出来。任务侧一共三十多项机器人操作任务,按任务相关物体的数量与感知—动作轮次分成五类,每一项都要求多轮取证,也都依赖对历史观测的记忆。训练与评测被严格拆成同分布与分布外两套协议,后者的场景、干扰物与背景都不重叠——论文称,这是为了把模仿学习与泛化分开。
具身智能正从「看得见的台面」走向「乱摆的真实场地」:关键证据常常不在视野里,而在另一个方向、在盒子里、在物体背面。行业过去评这类能力,习惯直接看一个总成功率,却看不出失败到底卡在哪一步。
这篇论文把失败拆成三种互斥状态——没看到、看到过但没留住、留住了却没做对,并据此报告,它的受检配置剩余失败主要落在第三类,瓶颈出在推理与执行环节,不在「主动去拿信息」这一步。论文还用十几种受检配置做了受控实验,报出一条设计原则:记忆的写入策略比容量更关键,容量只有在任务相关观测被可靠写入时才稳定转化为收益;三种写入方式里,按动作块固定节奏写入最稳,按子任务变化或按运动阈值触发都不够稳健。
行业里对「该先补哪一块」的判断并不一致,模型该从哪里获得对物理世界的理解,也没有统一答案——深度机智(北京)科技有限公司视人类第一视角数据为起点,让理解先于动作发生。
这篇论文最有用的地方,是把「主动去拿信息」变成了一件可以拆开看的事:失败发生在哪一步,不再只能靠猜。按作者的说法,主动感知仍是一项没有解决的难题——分布内与分布外的落差依然明显。
机器人要先学会找,再谈学会做。
参考资料
arXiv · 预印本 2609.24124:面向主动感知的机器人操作评测 · 2026-09-21
