阅读时间大约7分钟(2695字)
作者:毛不毛 出品:具身智能前沿
“缺口 20 倍”,可能是最容易误读的数字
2026 年的具身智能展会上,数据成了比机器人本体更热的话题之一。
一组被频繁引用的估算是:训练通用具身模型可能需要千万小时级数据,而全球可用的高质量真实物理交互数据只有数十万到百万小时。按最激进的口径算,两者相差约 20 倍。
听起来,这几乎是一张写好的商业计划书:缺口这么大,谁能把数据生产出来,谁就能赚钱。
问题也恰恰藏在这里。
“模型理论上需要多少数据”,回答的是技术供给问题;“客户今年愿意买多少数据”,回答的是现实预算问题。这两个数字之间,还隔着机器人出货、真实部署、任务定义、训练验证和采购流程。把前者直接当成后者,就像看到全国公路总里程很长,便认定每一家沥青厂都能拿到订单。
因此,20 倍缺口可以说明行业为什么重视数据,却不能直接证明数据服务商已经拥有一个同等规模的付费市场。它更像需求上限,而不是订单底稿。

机器人下线了,不代表需求已经闭环
2026 年 6 月 28 日,智元机器人宣布第 1.5 万台机器人下线。这个数字很重要:它说明供应链组织、标准化生产和工程交付已经跨过了新的门槛。
但“下线”首先证明的是可制造性,不是终端需求的持久性。
一台机器人可以被用于展演、教育、科研、数据采集或短期试点。只有当它进入真实工位,持续完成任务,并由客户的日常运营预算支付,才会产生稳定的数据回流:哪里失败、为什么失败、需要补什么样本、重新训练后有没有改善。
这也是为什么工信部和国资委在 2026 年实景实训专项行动中,把目标写成“应用验证和常态部署”,而不只是增加机器人数量。政策同时要求凝练高价值应用场景、积累真机数据,并形成“实景实训—数据沉淀—产品迭代—规模部署”的闭环。
这里的顺序不能倒过来。
如果终端任务尚未稳定,数据需求就很难被精确定义;如果客户还没有重复部署,第一次采购的数据也可能停留在项目验收,而不是持续训练。机器人卖出去多少台,与数据公司能获得多少长期收入,并不存在简单的线性关系。
按小时扩产,最容易生产出“库存”
具身数据看起来适合按小时计价,因为小时容易统计、容易验收,也方便比较采集效率。
可模型并不认识工时。
它只会对数据分布作出反应。同一个采集员,在同一张桌子上,用同一种路线重复拿杯子,确实能迅速增加时长,却未必增加新的物体、场景、策略和失败类型。对一个固定工业动作,这种标准化重复可能很有价值;对追求跨场景泛化的模型,它也可能只是大量相似样本。
Google DeepMind 牵头的 Open X-Embodiment 提供了一个更准确的参照。这个项目汇集 22 种机器人、500 多项技能和超过 100 万条轨迹,训练出的 RT-1-X 在多个实验室的测试中,相比各自原有方法取得了更好的平均表现。
这项结果支持的是“跨本体、多任务数据可以改善迁移”,而不是“只要小时数变多,模型就一定更强”。DeepMind自己也把数据混合比例如何影响泛化列为后续问题。换句话说,数据的本体、任务、环境和质量如何组合,至少和总量一样重要。
不过,跨本体迁移不等于不同机器人可以原样共用动作数据。场景视觉、物体特征、任务语义和高层策略更容易共享;关节角度、轨迹和力度则受本体结构、传感器与控制系统约束。Open X 论文也指出,同一个动作向量在不同机器人上可能产生完全不同的运动。
因此,仿真、公开视频和其他本体的数据可以扩大覆盖,却不能替代目标真机适配。标定偏差、延迟、打滑和回差,最终仍要在目标机器人、工位和任务中验证。
中国信通院 2026 年发布的具身智能训练场报告,也给出了相似警告:训练场数量快速增加,但场景任务同质化、实际数据产能有限、数据多样性与流通性不足,可持续商业模式尚未形成。
供给扩张解决的是“能不能采”,商业价值还要回答“采什么”和“采完是否有用”。如果这两步没有打通,数据不是资产,只是库存。
因此,更合理的路径通常不是在“买数据”和“自己采”之间二选一。公共或外部数据负责扩大覆盖,目标真机上的自采数据负责硬件适配,部署失败的回流数据则负责定义下一批最该补什么。自采并不天然更好;它真正的优势,是能够围绕自己的能力缺口定向获取,并在同一台机器和同一项任务上验证是否有效。如果没有训练与评测闭环,自采同样可能变成库存。
真正值钱的数据,通常从失败里长出来
训练前很难一次性列出机器人需要的全部数据。真实部署会不断暴露新问题:透明物体看不准,软包装抓取后滑落,衣服形态超出训练分布,连续任务中某一步失败后无法恢复。
这些失败不是普通意义上的脏数据。它们定义了下一轮最有价值的数据需求。
Physical Intelligence 在 π*0.6 的 RECAP训练流程中,把机器人自主执行产生的经验和专家纠正重新用于训练。论文报告,在多样衣物折叠和意式咖啡制作等任务上,引入真机运行数据后吞吐提高,失败率大约下降一半。
图片说明:黄色柱为加入真机经验后的最终 RECAP 模型;多样衣物与咖啡任务的成功率提升最明显。图片来源:Physical Intelligence 论文 Figure 8(π*0.6: a VLA That Learns From Experience)

这个结果不能被外推成所有任务都会得到同样收益,但它揭示了一条重要路径:数据的价值,不由采集动作结束时决定,而由重新训练和再次部署后的变化决定。

这也解释了为什么单纯的数据供应商很容易陷入项目制。客户提出任务,供应商按规格采集并交付,双方在文件数量和合格时长上完成验收。至于模型有没有变好,通常留给客户自己承担。
一旦行业供给增加、设备标准化,这种服务就容易比较人力、场地和单小时价格。规模可以带来收入,也可能同时带来更重的运营和更薄的利润。
数据生意有三层,只有最后一层接近壁垒
第一层卖采集能力:设备、人员、场地和项目管理,按小时或任务收费。需求真实,但竞争最终容易落到成本与交付速度。
第二层卖结构化数据:完成同步、清洗、姿态重建、语义标注、质量筛选和格式统一。这里已经包含数据工程能力,不过当规范逐渐统一,处理流程仍可能被标准化。
第三层卖能力增量:先定位模型在哪类场景失败,再设计采集任务和数据配比,参与训练与评测,最后用部署结果验证是否改善。客户买的不是一万小时视频,而是更稳定的抓取、更少的失败、更好的跨场景迁移。

难点在于,第三层已经不再是传统的数据外包。数据方必须理解模型、评测、本体和真实任务,还要获得客户训练流程与部署结果的反馈。它的服务边界更深,责任也更重。
所以,“不能只卖数据”并不是一句营销话术。它意味着商业模式从按投入计价,转向按研发结果建立信任。真正可能形成壁垒的,也不是某一批已经采完的数据,而是持续判断“下一批最该采什么”的能力。
接下来,少看总时长,多看四个信号
判断具身数据是不是一门成熟生意,我更愿意观察四件事。
第一,是否出现非关联客户的重复采购。首次订单可能来自试点、融资故事或生态合作,重复订单更接近真实使用价值。
第二,采购是否从创新试点预算进入日常运营预算。只有机器人持续工作,数据生产才可能成为持续支出,而不是一次性项目。
第三,数据供应商能否公开可比较的能力增量。不是展示采了多少小时,而是在明确任务、模型和评测口径下,说明成功率、失败率、吞吐或泛化发生了什么变化。
第四,部署失败能否回流。失败定义下一批自采或补采任务,能力改善再推动更多部署,这才可能形成数据飞轮。只有循环最终带来重复订单和持续付费,技术闭环才真正转成商业飞轮。
具身智能当然缺数据,而且可能长期缺。
但这个行业更稀缺的,不是又一批被计入总时长的视频,而是把一次真实失败变成一次可验证能力提升的系统。
当客户愿意为这种提升持续付费时,数据缺口才真正变成商业需求。此前,它仍然只是一个很大的数字。
