阅读时间大约8分钟(2883字)
作者:Yina 出品:具身智能大讲堂
具身智能是今年WAIC人气最旺的赛道之一。走进世博中心H3馆,各家熟悉的本体与零部件企业纷纷将产线和场景搬进展台,吸引着大量观众排队体验、互动,热度高涨。
除此之外,今年还多了一批新的面孔。光轮智能、无问智科、穹彻智能、宸境科技、跨维智能……它们的展台上没有形态各异的机器人,而是展示着屏幕上的数据流、算法演示和评测系统。
这些看起来“不那么酷”的展台,围观的人却不少,且几乎都是具身智能业内人士。据现场了解,不少嘉宾正是带着破解数据困局的迫切需求前来,从数据采集成本、规模化路径到仿真与真实数据的融合方案,技术细节成为展台讨论的焦点。
行业正在形成共识,具身智能的竞争,正在从“造本体”转向“建地基”。而数据,就是这个地基里最重要的建材。
但高质量数据的匮乏,仍是行业最现实的瓶颈。它石智航创始人陈亦伦在展会期间指出,具身操作至少需要1000万小时合格数据,是自动驾驶所需的十倍。
截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,缺口悬殊。有预测称,头部机器人公司的有效数据量将从2025年的“万小时级”跃升到2027年的“百万小时级”,虽然增速可观,但与需求之间仍有很大的差距。
数据采集成本高、场景覆盖难、标注复杂度大。机器人的每一个动作都需要对应物理世界的真实反馈,抓取、放置、操作,不同物体、不同光线、不同角度都会产生完全不同的数据样本。这些无法像大语言模型那样从互联网文本中批量获取,必须一一在真实或仿真环境中“手把手”采集。
缺口越大,机会越大。一批专门解决“数据从哪里来”的企业,正是在这个背景下站上了时代的舞台。

01.
都有谁在“造数据”?
第一类:基础设施独角兽
光轮智能成立于2023年,是物理AI数据与评测基础设施企业。2026年5月,光轮智能估值突破150亿元,成为全球首个具身数据独角兽;6月再融10亿元,一季度新增订单5.5亿元,超过2025年全年。
创始人杨海波将2026年定义为“具身智能数据规模化元年”。他预计,今年行业数据需求较去年增长百倍至千倍,百万小时级订单成为常态。
本届WAIC上,光轮智能最突出的看点是同时参与具身仿真和人类数据两项国际标准共建,是参与这两大物理AI核心标准建设的唯一中国企业。仿真领域,光轮智能作为Newton仿真技术委员会唯一中国企业,与英伟达、谷歌DeepMind、迪士尼研究院、丰田研究院共同引领开源物理AI仿真标准建设;数据领域,作为EgoVerse人类数据委员会唯一中国企业,与Meta、Scale AI等国际团队共同推进全球最大规模人类数据训练体系建设。
展台上,光轮智能系统展示了“数据—评测—部署”持续学习闭环——SimFoundry、EgoSuite、RoboFinals和RoboStack分别面向物理仿真、人类经验数据、规模化评测和部署反馈。现场设置了多个互动体验:为观众制作咖啡并同步采集操作数据、通过仿真遥操完成拧螺丝和拉抽屉等精细动作,以及在RoboFinals并行评测大屏上展示多模型在同一任务上同时接受测试的画面。

第二类:数据采集设备与平台
宸境科技是物理AI通用型感知模组供应商与空间智能领域的核心技术企业。其核心路径是从“空间理解”出发构建具身智能体系,而非从机器人本体出发。
宸境科技在WAIC上推出了两款代表性产品。Looper具身智能数采系统是一套面向机器人基座模型和具身智能训练数据生产的可穿戴多视角采集系统。佩戴者无需改变自然操作习惯,即可同步记录头部第一视角和双手近场视角。同时展出的NavCore具身智能自主导航大脑,聚焦解决高质量三维空间数据的规模化采集瓶颈。

穹彻智能的技术路线强调“力位混合”——机器人不仅要知道“往哪动”,还要感知“用多大力”。其自主研发的RoboPocket无本体数据采集系统,通过可穿戴末端执行器与手机App结合,让普通用户即可参与操作数据采集。背后的DM3数据管理平台单日可处理9000至10000条数据,每月沉淀13500至15000小时真实数据资产。目前穹彻已在全国拥有2000多名数据采集员。
本届WAIC上,穹彻还展示了基于上述数据训练的新一代预训练模型“World Action Model”——该模型未使用任何遥操作数据,验证了无本体采集路线的可行性。

无问智科在WAIC上推出“无垠”物理AI数据基座平台,以“采集世界—生成世界—模拟世界”为三层架构,前端用大规模无感采集获取真实数据,后端以超大规模生成式仿真突破规模瓶颈。展台演示显示,额外增加200万帧UMI数据进行训练后,篮子收纳任务成功率提升约15%,物品分拣抓取成功率提升4%,分类成功率提升50%。

简智机器人聚焦头、手、身全模态感知数据的采集与治理。其Human Data解决方案由DAS采集硬件、DFM数据基础模型和ADP规模化数据流水线组成。简智认为,具身智能的下一阶段不再是堆砌海量视频素材,而是依托完整、真实、可学习的人类行为数据来提升模型能力。
此外,OriginFlow、零次方机器人等数据赛道企业在WAIC期间与百度智能云达成战略合作。
第三类:本体厂商自建数据闭环
本届WAIC上,智元机器人公布今年计划积累近1000万小时数据,是少数明确公布数据目标的本体厂商。
智元机器人合伙人、具身研究院执行院长姚卯青在WAIC智启具身论坛上提出“模型决定起点,数据定义终局”。在他看来,物理智能要实现规模化,必须突破三道墙:数据墙——高质量数据的规模和质量远远不够;表征墙——物理世界的信息如何有效表征给模型;闭环墙——模型在真实场景中如何持续学习、迭代优化。只有数据飞轮真正转动起来,智能涌现才会出现。

京东首次系统展示面向物理世界的具身智能数据布局。展出自研JoyEgoCam头戴式数据采集设备,观众佩戴后可记录零售货架整理、商品拿取等第一视角作业数据。京东目标两年内积累1000万小时高质量具身数据,并宣布开源行业最大人类视角数据集EgoLive。京东集团副总裁龚义成强调,必须完成数据采集、模型训练与场景验证的端到端闭环。

如祺数据是如祺出行旗下的AI数据业务板块,基于此前在自动驾驶数据服务领域积累的数据处理能力与经验,如祺数据于2026年6月推出具身智能数据平台,具备Ego-centric第一人称视频自动化处理流水线,打通数据导入、AI预处理、动作标注、多级质检、标准化导出全链条,目标是突破具身智能数据处理的“最后一公里”困境。

跨维智能是国内最早深耕物理AI全栈自研的企业之一。本届WAIC上,跨维智能正式开源Aligned DexWorld,这是全球首个贯通人类到仿真到真机的时空动作对齐大规模数据集,整合七大主流公开数据集,总计超200万条数据样本。该数据集从空间、动作、时间三个维度实现深度物理级对齐,针对性解决异构数据负迁移难题,该数据集免费向学术及产业界开放,确立了“数据对齐优先于数据增量”的行业新范式。
02.
数据竞赛之后
三类玩家,三个位置,三种逻辑。
光轮智能等基础设施型企业,卖的是标准和平台的定义权,一旦标准确立,就是行业的“水电煤”;宸境、穹彻等工具型平台卖的是效率和产能,谁的采集成本更低、数据质量更高,谁就能活下来,但天花板取决于市场总量;而本体厂商自建闭环,核心诉求不是卖数据,而是不让数据命脉被别人卡住。只是,他们最终会在同一个战场上相遇。
这种格局,和互联网早期有相似之处。当年搜索引擎、电商、社交平台打得不可开交,最后发现真正的稀缺资源是算力和数据,于是亚马逊靠AWS成了最大赢家,英伟达靠卖卡成了万亿巨头。
具身智能正在走一条类似的路。整机厂的参数之争只是上半场,数据基础设施的争夺才是重头戏。光轮智能一个季度5.5亿订单、半年估值翻到150亿,智元喊出“1000万小时”目标,京东开源EgoLive……行业已经意识到,谁掌握高质量数据的供给能力,谁就掌握了具身智能时代的“石油”。
但“必争之地”也意味着另一个问题。如果数据采集能力和高质量数据集被少数几家头部公司掌握,行业门槛将被急剧拉高。虽然部分企业通过开源数据集和参与标准共建等动作试图推动行业基础设施的公共化,但开源社区和商业级数据之间,仍然存在一条明显的“质量鸿沟”。真正健康的产业生态,或许需要一个介于“完全开源”和“完全封闭”之间的公共数据层,但谁来建、谁来维护、谁为成本买单,目前还没有答案。
2026年,具身智能的数据竞赛正式开局。这场竞赛的终局,不只是谁能造出最聪明的机器人,更是谁能定义“数据”这个生产资料的所有权、定价权和流通规则。
