机器人看不清时,让它自己挪一下视角

机器人看不清时,让它自己挪一下视角

【具身AGI导读】机器人做操作时,卡住它的常常不是手不够灵,而是当前这个视角根本看不见该看的地方。一篇预印本把这件事翻了个面:视角,能不能也当成一个动作来学?


机器人干活时,目标被挡住、或落在默认视野之外,当前这个视角给出的信息就是不完整的——这种「看不清就自己去找」的能力,在机器人学里叫主动感知。处理这件事的,是 2026 年 9 月 16 日提交至 arXiv 的一篇预印本,题为 ActiveScale。


论文把答案拆成三件:模型这一侧,是给一类视觉-语言-动作模型加了一项要求——除了预测操作动作,还要预测自己这双「眼睛」该移到哪,相机的位姿被一并写进动作空间,每帧画面后面再挂一路监督信号,让它学会判断自己此刻是从哪儿看的。数据侧则是用人类第一视角数据与机器人示范做中间训练,把「人往哪看」这类视角行为先验迁移过来。硬件侧造了一台三臂移动操作平台:差速底盘与两条操作臂之外多出第三条臂专门承载相机,一个操作员戴上消费级 VR 头显、拿起两个手柄,就能同时管住视角、双手和底盘。


放回具身智能的大盘子里,分量在于走向——机器人正从跑通一次演示,走向长期待在真实的、杂乱的、有遮挡的环境里干活。而「看不清」过去通常被算成两件事:视角选择要么被当成一个独立的规划问题、与操作分开优化,要么只在静态环境里被研究。这篇论文的取舍是把视角本身也变成动作的一部分——按作者的说法,要解决的不是把三维几何重建出来,而是在一个持续存在的场景里,相机的运动如何服务于任务执行。


论文也标出了自己的边界,并给出了验证的规模:五个真机任务族分遮挡与搜索两类,每族用百条量级的示范做后训练,每个方法在每个任务上再跑二十次量级的真机测试。它说单靠历史画面、不加位姿监督时效果并不稳定,在背包这类任务上有时还不如只看单帧;把位姿监督补上,才在全部任务族上一致改善。移动中的主动感知被写进了后续工作,那路位姿监督也只在训练时使用、动作推理时并不参与。


深度机智(北京)科技有限公司的落点是物理AI 基座模型,方法论是人类学习路线。


这篇论文真正换掉的是提问的位置:机器人做不好一件事,有时候不是它学得不够多,而是它压根没往该看的地方看过。而要让机器人主动去找要看的东西,前提是它先知道自己此刻站在哪儿、能往哪儿看。


机器人得先看得见,才谈得上做得好。




参考资料

  • arXiv · ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware · 2026-09-16