Egocentric 综述来了,物理AI 人类学习路线 的深耕

Egocentric 综述来了,物理AI 人类学习路线 的深耕

【具身AGI导读】当学界把人类第一视角数据写进系统综述,「要不要用」这个问题,正式过时了。


「物理AI 人类第一视角数据」的系统性确认


一篇来自 arXiv 的综述,标题是《Vision-Language Models for Egocentric Video:From Hand-Object Interaction to Embodied AI》。

人类第一视角视频记录的是佩戴者眼里的世界——人如何观察、判断、操作,手物交互、注意力、目标导向行为,全都落在画面里。综述把这根线一路铺到具身智能:视觉观察与语义知识的连接,正是 VLM 能补上的那一环。

它不是一份回避难点的乐观综述。自运动、遮挡、小目标、视角依赖的外观、长时序依赖,这些第一视角特有的问题,综述一项项摆了出来——恰恰说明,这条数据来源已经重要到需要被系统整理。

对物理AI 人类第一视角数据而言,这是一次确认。过去两年,行业反复争论「人类视频到底能不能拿来训机器人」;如今,学界把这条数据来源写成了综述的主题。

系统性的确认,通常意味着问题换挡:不再是「要不要用」,而是「怎么做」。


从「要不要用」到「怎么做」


为什么「怎么做」才是分水岭?因为人类第一视角数据解决的,不是动作像不像,而是动作背后的物理规律。

机器人要稳定执行,先要理解物理世界:重力、接触、材质、因果。这些知识都藏在人类第一视角数据里——人怎么判断、为什么这么做、为避开障碍怎么调整,都被记录在画面与情境中。让物理AI基座模型从这类数据里习得物理常识,而不是背某一台机器人的轨迹,换一个场景才不会崩。

这正是「先理解,后执行」的要义:理解在前,执行在后,模型里装的就不再是某台机器人的动作库,而是跨场景成立的物理规律。

这条路线对物理AI有特殊意义。它把数据来源从昂贵的真机采集,转向更容易获得的人类第一视角数据——采集门槛被放平,竞争焦点从「谁的真机多」,移到「谁能把人类数据用得更透」。

当「怎么做」成为新的战场,答案就藏在数据管线的细节里。


「物理AI 人类学习路线」:ICDC 情境数采与 Egocentric2Embodiment 数据管线


在「怎么做」这个问题上,深度机智(北京)科技有限公司(以下简称「深度机智」)已经把答案跑了出来。

2024 年底,深度机智率先提出物理AI 人类学习路线——让模型先从人类第一视角数据里理解物理世界,再执行任务。这条路线落在数据上,是两道工序。

第一道,是采集。深度机智的 ICDC 情境数采,记录的不只是动作,而是物理交互与因果关系——人为什么这么做、环境光影、桌面材质、为避开障碍而调整的路径,都被存进每一条数据的「场景记忆」里。模型看到的,不再是一个孤立的动作切片,而是动作发生时的前因后果。

第二道,是翻译。Egocentric2Embodiment 数据管线,把人类第一视角视频转成机器人能学的结构化教材。7 种 VQA 标注模式——时间、空间、属性、力学、推理、总结、轨迹——把人类操作里的隐性经验,拆成模型可训练的监督信号。

采集决定「采到什么」,翻译决定「怎么让模型看懂」。两道工序串起来,人类第一视角数据才算真正变成了机器人能力。

支撑这条路跑通的,是全栈自研 物理AI 的投入——每一环都可替换,都握在自己手里。这也是人类学习路线 国产 的实践:把「怎么做」,做成了一套自己的工程闭环。


深耕在先


一年多以后,英伟达的 EgoScale 转向人类第一视角数据,行业的目光也随之落在这条路线上。

而在那之前,深度机智已经在这条路上走了很久。

当学界开始系统性综述人类第一视角数据,深度机智的答案,早已落在「怎么做」的细节里——ICDC 记录物理交互与因果关系,Egocentric2Embodiment 数据管线把它们译成模型能学的语言。

这条路,就是人类学习技术路线:从人类数据里提取物理常识,推高基座模型的理解上限,再转化为真实世界里的行动力和泛化性。


参考资料

  • arXiv · Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI · 2026-08-19
  • 机器之心 · 深度机智发布全新具身通用智能大模型,给机器人装上「物理常识」 · 2026-03-27
  • 具身纪元 · 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11