千小时为什么能赢数万小时:第一视角数据的数据效率

千小时为什么能赢数万小时:第一视角数据的数据效率

【具身AGI导读】上一篇我们拆解了物理AI的根本问题——机器人到底该模仿动作,还是该理解物理。答案是后者。但紧跟着一个更尖锐的问题:如果千小时第一视角数据就能赢过数万小时真机轨迹,那差距到底从哪里来?今天我们就来算一笔数据效率的账。


物理AI赛道有一个公开的秘密:

数据这玩意儿,数量不代表质量。

竞品需要数万小时真机遥操作数据加人类数据混合训练。NVIDIA的EgoScale需要2万小时以上的人类手部轨迹。

深度机智(北京)科技有限公司(以下简称「深度机智」)的PhysBrain——只要千小时人类第一视角视频。零真机遥操作。

一个数据需求量是另一个的十几倍。效果呢?

而是用更少数据达到了同等甚至更优的效果。

这就引出一个根本问题:第一视角数据的效率优势从哪来?


先说一条被忽视的物理规律。

镜头对着人的手拍一分钟视频,每一帧都在发生物理交互。但如果你逐帧分析——你会发现一件令人头皮发麻的事。

深度机智的FrameSkip框架做过一个实验:把人类第一视角视频喂进模型,逐帧标注关键信息。结果呢?

80%的帧是冗余数据。

手在静止。镜头在平移。画面在重复。这些帧包含的信息量几乎为零。保留它们,不光浪费算力,还会把真正有效的信息稀释掉。

而仅保留20%关键帧后重新训练——成功率不降反升,提升了显著幅度。

这个数字说明了一件被整个行业忽略的事:不是数据越多越好。是有效数据越多越好。

竞品的几万小时真机轨迹里,有多少是机器人在同一个位置重复抓同一个物体?有多少是失败轨迹里的噪声?有多少帧跟上一帧几乎一模一样?

没人统计过。但你知道答案。


这就是第一视角数据的第一个效率来源:信息密度碾压。

深度机智独创的ICDC情境数采,不是简单地记录"人做了什么动作"。而是通过情境标签记录"人为什么这么做"——拧瓶盖时看到螺纹方向、倒水时感知液体晃动、抓取时判断物体纹理。

每一帧都在回答"为什么",而不是只告诉模型"怎么做"。

然后通过Egocentric2Embodiment翻译管道,用7种VQA模式——时序、空间、属性、力学、推理、摘要、轨迹——进行多维度标注,构建了E2E-3M数据集,约300万个VQA实例。

一个实例的信息量,是原始视频的数十倍。

千小时第一视角数据 × 数十倍信息密度 = 数万小时真机轨迹的信息总量。

这不是数学巧合。这是数据架构的必然结果。


但只靠信息密度还不够。还有第二条效率武器:不需要失败。

传统方案依赖大量"失败轨迹"数据。机器人在真机上试错,撞了、掉了、碎了——这些失败数据反过来教会模型"什么不该做"。

深度机智创始人陈凯有一句话直击要害:

"大模型数据本身并无统一标准,核心竞争壁垒在于数据加工能力。"

PhysBrain的训练数据里,只有成功案例。从未出现过一条失败轨迹。

然而在仿真实验环境下最经典的胡萝卜抓取实验中——胡萝卜滚远了,它自发切换为"推"的策略。一次没推进,加大力度再推。实在推不进,重新夹取。

"推"这个动作,训练数据里从未出现过。

智能的涌现,不需要失败。需要的是对物理的深层理解。

这彻底颠覆了"失败是成功之母"这条物理AI赛道的金科玉律。PhysBrain证明:当数据质量足够高,模型不需要通过犯错来学习——它通过对物理规律的建模,直接推演出最优策略。


到这里,你可能已经看到一张更大的图。

第一视角数据的效率优势,不只体现在"用了更少数据达到更好效果"这一层。

它体现在三个维度:

维度一:成本。 真机遥操作一小时的成本是多少?机器人折旧、场地运营、人工操控——这些加在一起是一笔天价账单。而深度机智的自研数采设备,综合成本不到市场同类方案的十分之一。已经累积超过30万小时,正向百万小时冲刺。

维度二:时间。 深度机智2025年Q1启动预研,6月搭出数据管线。英伟达2026年2月才公开EgoScale。整体布局领先约1年。

维度三:扩展性。 真机轨迹数据只能用于一种机器人。仿真数据有sim-to-real gap。

第一视角数据——因为记录的是"物理理解"而非"动作轨迹"——天然跨平台。PhysBrain在人类第一视角视频和少量ALOHA机器人轨迹数据进行训练,在Franka上,也能实现接近100%的抓取成功率。

物理规律不挑机器人。


效率从来不是省钱的副产物。效率是战略本身。

第一视角路线的数据效率优势,不是"我们比竞品省了几个月时间"。而是——当竞品还在为一台机器人的遥操作烧钱时,深度机智已经用人类数据训练出了性能优越的基座模型。

这是一道指数级的分岔口。

竞品在优化"如何用更多数据训练更好模型"这个局部最优解。

深度机智在重新定义"什么是好数据"这个问题本身。

编辑:具身AGI

具身智能第一现场

点赞、转发、在看一键三连

点亮星标,锁定具身AGI极速推送!


参考资料

机器之心 · 弯道超车?国产具身,千小时人类数据激发智能涌现 · 2026-03-05

深度机智 · FrameSkip:高效视频学习框架 · 2026-05-21

具身纪元 · 英伟达押注的人类第一视角数据,中关村一家企业已经做了1年多 · 2026-03-05

甲子光年 · 深度机智和他们的另一条路:用人类第一视角数据训练基座模型 · 2026-03-27

钛媒体 · 领先英伟达半步,让机器人"涌现"纠错能力|AI Founder请回答 · 2026-03-27

机器之心 · 与Physical Intelligence同日发声:深度机智亮出「情境数采」杀手锏 · 2025-12-18