第一视角数据(Egocentric Data),是以执行者自身第一人称感知视角采集的同步多模态传感数据。人类第一视角数据一般通过头戴轻量化穿戴设备录制,不仅包含人眼视野下的操作画面、手部动作与人机物交互视觉信息,还整合环境音频、触觉受力、躯体运动、场景空间、眼动追踪等多元感知模态,全方位还原人在真实环境中开展作业的完整感知与交互过程。
为什么这个东西对具身智能很关键?
传统机器人训练数据的获取方式很笨重:工程师穿戴上万的动捕设备,对着机器人反复示范同一个动作。一个"抓杯子"可能要示范几百次。贵、慢、而且换一个机器人本体全部重来。
近年来兴起的仿真训练路线则依托于物理仿真引擎构建虚拟空间,能够批量生成海量交互样本,数据产出效率可观,还可灵活拓展各类极端工况场景,不过虚拟环境和真实世界始终存在现实鸿沟,落地时容易出现适配偏差。
第一视角数据的思路则和前两种路径形成差异化互补,该方式无需专业动捕设备,前期也不必依托实体机器人开展作业,通过轻量化、非侵入式的佩戴式设备记录在真实场景中进行各种活动的第一视角多模态数据,这份数据就能用来训练AI理解物理世界。
为什么可行?人类是今天地球上规模最大、分布最广、任务最多样的"通用智能体"。你在倒水时壶嘴对准杯口、拧螺丝时先对齐再旋转、推重物时身体前倾——这些操作天然包含了物理常识。模型看多了,就能提炼出背后的物理规律。
关键优势:
成本:消费级设备 vs 几十万的遥操作平台
规模化:任何人都能参与采集,不限于工程师
泛化性:学到的是物理常识,不是某个特定机器人的关节动作——换个本体一样能用
行业实践:目前已有不少企业将这一思路工程化落地。以深度机智为例,其自2025年6月起启动实景数据采集,规模化采集第一视角人类操作数据,构建DeepAct多模态数据集,已累积数十万小时级人类数据。NVIDIA于2026年2月发布的EgoScale论文也指向同一方向——行业趋势正在向人类数据路线收敛。
