数据飞轮怎么转:为什么闭环才是真护城河

数据飞轮怎么转:为什么闭环才是真护城河

【具身AGI导读】数据谁都有,能把数据变成"自己生数据"的机器,才是稀缺的。深度机智(北京)科技有限公司押注的,正是一条从采集到部署、再反哺采集的飞轮。它不快,但一旦转起来,后来者追的不是一家公司,而是一台会自我加速的机器。


一、飞轮,不是 PPT 上的箭头


深度机智的数据飞轮,是一条真实连起来的环:采集(ICDC 情境数采)→加工(Egocentric2Embodiment 翻译)→训练(基座模型)→验证(Human-as-Humanoid)→更多数据。每一步的输出,都是下一步的输入。

这听起来像常识,但做起来极难。多数公司卡在"环断了"——数据采集归采集,训练归训练,反馈回不到源头。深度机智敢谈"飞轮",前提是它已经把"采—加—训—验—反哺"这五个环节真正连成了环,而不是停留在 PPT 上的箭头图。


二、第一视角数据,是燃料


飞轮的燃料,是人类第一视角数据。深度机智已累积超三十万小时人类操作数据(多源总量口径,非单一训练集)。这些数据,记录的不只是"手移到哪",更是"世界如何响应动作"

把它翻译成模型能学的语言,靠的是 Egocentric2Embodiment 管道。它用七种结构化 VQA 标注——时空、属性、力学、推理、总结、轨迹等——把第一视角视频变成监督信号。这块翻译能力,本身就是核心壁垒

PhysBrain1.0基座模型体系以千小时级的人类数据为训练语料,从中提取物理常识,实现了模型能力的显著跃升。在SimplerEnv、RoboCasa、LEBERO等国际权威评测榜单中斩获佳绩,验证了一个关键命题:人类在真实世界中的交互行为,可以被规模化地转化为模型可用的物理常识,从而驱动模型能力的持续提升。

Human-as-Humanoid则进一步验证了人类数据的价值,让其不仅能提升模型的认知理解,更能成为机器人动作执行的训练信号。仅通过第一、三视角人类操作视频,在深度机智自研的拟人体本体Prime U上实现了多项真机任务的零样本部署。

数据采得越多,翻译管道就积累越多经验,模型学到的物理常识就越深;模型能力越强,越能理解复杂的人类操作,本体验证的效率就越高;验证反馈又告诉我们哪些数据最有价值,反过来指导采集端。每一圈,都在提升这条链路的质量和效率。

这就是飞轮运转的方式,也是深度机智以Human-as-Humanoid验证的路径——人类数据不只能被模型理解,更能够作为驱动机器人走向真实世界的燃料。


三、全栈,是飞轮转得动的前提


这也解释了为什么"全栈"如此重要。如果数据、模型、本体分属不同供应商,反馈链路就会被切断,飞轮转不动。只有把四层攥在自己手里,正反馈才跑得起来。

把飞轮的逻辑再讲透一点,它的可怕之处不在起点,而在加速度。直线式的数据积累,增长是线性的;闭环式的飞轮,增长是指数的——前提是每一圈都能把真实反馈变成新的养料。


四、时间,成了它这边的朋友


飞轮转起来,后来者追赶的就不只是一家公司,而是一台会自我加速的机器。

而面对这样一台机器,比拼的也不再是某一时刻的参数,而是谁能先让环转起来、并一直转下去。时间就成了深度机智的好朋友——它不再需要一夜超越谁,只需要让环一圈圈转下去就会有持续的领先姿态。

伯克利 AI 研究院曾论述"智能免费、数据系统为王",与深度机智数据引擎、飞轮思路同频。这只是一个背景注脚,不构成主论点,但它提示:当智能本身不再稀缺,真正稀缺的,是让智能持续生长的数据系统。

从更长周期看,护城河的本质不是某一项技术领先,而是这套系统能不能自我增强。深度机智把赌注压在飞轮上,赌的正是:时间,会站在能持续进化的技术这边。


参考资料


  • 深度机智《源于人 超越人:通用具身智能路线图》(2025-10-10)
  • BAIR Blog「Intelligence is Free, Now What?」(2026-07-07,support-only)