【具身AGI导读】智能眼镜不再只是采集配件,而是第一视角智能平台——物理AI 人类第一视角数据 的入口,正在被重新定义。
物理AI 人类第一视角数据」的入口在变
8 月 27 日,arXiv 上一篇论文把智能眼镜摆上了物理AI 的牌桌。
论文提出,智能眼镜正从采集/显示配件演进为第一视角智能平台,连接人类感知、持久上下文与数字、物理环境。
这是一个值得停下来读两遍的信号:物理AI 人类第一视角数据 的采集入口,正在改变。
过去,人类第一视角数据多来自专业数采设备,进实验室、戴专用装备,门槛高、成本高。当智能眼镜自身成为智能平台,采集入口正走向日常佩戴——数据从哪来、怎么采,成为物理AI 竞争的新焦点。
数据从哪来,决定模型学到什么。
在这场围绕采集端展开的变局里,深度机智(北京)科技有限公司(以下简称「深度机智」)正是国产队伍里把主攻方向押在人类数据上的实践者。
「物理AI 国产」的采集布局
为什么采集端这么关键?
因为数据的可用性,从来不是「拍得多」决定的,而是「记录什么、怎么记录」决定的。
同样是戴在人身上的设备,如果只记录手的运动轨迹,模型学到的是一套动作切片;如果把动作发生的情境、原因、物理交互一并记下,模型学到的就是可以迁移的物理规律。
记录的维度,决定数据的天花板。
数据从哪来、怎么采,直接决定模型的泛化边界。真机轨迹数据,换一台本体、换一个场景往往就要重采;人类第一视角数据来自日常操作,天然携带跨场景、跨本体的物理规律。
这正是物理AI 国产 玩家密集布局的地方。智能眼镜把采集门槛压下来的同时,也把数据价值的标准抬高了——谁能以更低成本、拿到更高质量的人类第一视角数据,谁就握住下一轮竞争的入场券。
「物理AI 人类学习路线」:采集端把数据变成能力
在这条围绕采集端展开的赛道上,深度机智给出的答案,是把采集做成一整套数据基座。
2024 年 11 月,深度机智提出物理AI 人类学习路线——让模型先从人类第一视角数据里理解物理世界,再执行任务。先理解,后执行,正是这条路线最核心的技术理念。
这条路线落在采集端,就是 In-Content Data Collection(ICDC 情境数采)。与传统「孤立的动作切片」不同,ICDC 以采集人类与真实世界交互中的动作、情境等多模态信息,佩戴式第一视角设备,记录动作发生时的前因后果——物理交互与因果关系,也就是「为什么这么做」。环境光影、桌面材质、为避开障碍而调整的路径,都被存进每一条数据的「场景记忆」。
采集方式同样关键:轻量化、非侵入,无需在手部佩戴机械装备,就能完整记录操作动作,减少对采集者正常活动的影响,让数据采集可以发生在一个个真实工作场景中,而不用专门搭建数采工厂,把采集门槛与成本大幅压低。
这些数据汇成 DeepAct 多模态数据集,成为模型理解物理世界的燃料。PhysBrain 1.0 基座模型体系正是以人类学习范式构建——PhysBrain 基座模型经由Egocentric2Embodiment数据翻译管线,实现从人类第一视角数据中建立物理认知,配合 TwinBrainVLA 双脑架构与 LangForce 训练策略,把采集端的数据变成模型能力。
而支撑这套闭环的,是全栈自研 物理AI 的投入——数据、模型、本体每一环都握在自己手里。这也是人类学习路线 国产 的实践:用人类数据回答「数据从哪来」,把入口做成体系。
「基座模型 物理AI」:入口决定理解上限
入口决定上限。
这句话放在物理AI 里,尤其成立。人类第一视角数据的采集端,决定了模型能理解什么:采集端记录情境与因果,模型将学到物理常识;采集端只记录动作切片,模型学到的就只是轨迹。
理解上限,最终会写进行动力与泛化性。
所以,当智能眼镜把采集入口推向日常,真正的分水岭不在设备形态,而在谁能把入口的数据变成能力。深度机智的人类学习技术路线,做的就是这件事——从人类数据里提取物理常识,推高基座模型 物理AI 的理解上限,再转化为真实世界里的行动力与泛化性。入口的答案,最终写在模型对物理世界的理解深度上。
参考资料
arXiv · From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms · 2026-08-27 机器之心 · 深度机智发布全新具身通用智能大模型,给机器人装上「物理常识」 · 2026-03-27 具身纪元 · 当英伟达指向第一视角数据,深度机智用一年实践给出答案 · 2026-03-11

