具身智能数据,为什么必须全链条自主可控?
统计 阅读时间大约9分钟(3360字)

3小时前 具身智能数据,为什么必须全链条自主可控?

来源:具身研习社
具身智能的数据问题,表面是技术问题,深处是产业分配问题。

作者:彭堃方     编辑:吕鑫燚     出品:具身研习社

进入 2026 年,全球具身智能产业的表层叙事都落在了数据采集。

但直到 WAIC,数据更深层的结构性问题才被明确治理。《2026 世界人工智能大会暨人工智能全球治理高级别会议主席声明》第四条指出:数据在人工智能发展中发挥重要作用。应当把握数据高流动性、高赋能性特征,深化数据资源开发利用,切实保障数据安全,共同加强个人信息保护,加快构建数据产权等基础制度,确保数据可管、可控、可追溯,促进数据安全有序流动和高效开发利用。

从声明中可见数据之于人工智能产业的重量,细化到具身智能来看数据身上的砝码只增不减。

这不是凭空推断的臆想,5 月份并发在一起的两件事,已经暴露出具身智能的数据隐忧:

一是破壳机器人创始人许华哲所说:“很多公司采到数据后会卖给英伟达、Google 这样的巨头。这些数据是智能化的‘弹药’,如果为了账面收入好看或融资,把弹药卖给竞争对手,我觉得这就像《六国论》里的 ’今日割五城,明日割十城’,是非常危险的短视行为。”

二是具身智能数据采集公司 Human Archive 宣布完成 820 万美元种子轮融资。这家公司相信“印度的零工经济能够训练世界上的机器人”。而投资人中赫然存在着英伟达、OpenAI、Google、Meta 等科技巨头的身影。

988ebdc3d7705e30380a06ca2928334c.jpg

一个话题呼之欲出,具身数据已经不能再被视为普通的能力。它更像一种从真实世界提取出来的新型工业原矿,一种为通用智能提供燃料或价值储备的稀缺资源。正因如此,它左右着具身智能的全球发展格局,进而能否全链条能够自主可控,成为不可忽视的系统性风险。

把它放到这个位置上去看,今天讨论具身数据的问题,如果只停留在“数据荒”“百万小时”“采集成本”这些技术词汇上,就远远不够了。更深层的问题在于:这些数据由谁开采、谁来冶炼、谁定标准、谁制成品、谁享收益。

如果这些问题没有清晰的答案,所谓“数据元年”很可能演变为一次不易察觉的资源转移:有人蒸馏自己,有人训练智能;有人提供原矿,有人制成成品再转售给你。

10adae90a1680d7267dc19d14e84b440.png

过去谈数据交易最常见的角度是隐私保护、合规审查这些当然重要。但放进具身智能的语境里,因为具身数据本身就是模型能力的来源,所以他涉及到核心价值归属问题。

文本数据训练语言模型,图像数据训练视觉模型,而具身数据训练的,是机器人在真实物理世界中的行动能力。一个产业工人如何完成精密装配,一名护工如何协助老人起身,一个仓储员工如何分拣货品,一个家庭成员如何整理空间——这些看似日常的行为,在经过规模化采集、对齐、标注、训练后,就会内化为机器人模型的泛化能力。

所以这也就有了那句“具身智能的数据交易,本质上接近于把弹药递到对手手里”。

但其实还可以再换一个维度去看——如果把高质量的具身数据比作这个时代的新型稀缺资源,那么数据交易就不只是资源流出,而是智能产业“价值储备”的外移。在持续向外输送价值的根基,而对方用这些根基去铸造未来。

再换一个角度。具身数据其实更像一种必须经过冶炼才能变成产品的原矿。把原矿卖出去,对方提炼成钢、做成机器、再转头卖回来,并掌握定价权。过去一百年里,无数原料型经济体都走过这条路:原料价格由别人定,成品价格也由别人定。

具身数据如果走上同样的路径,就会出现这样一种局面:A 产数据,B 造模型。普通商品贸易是一次性的,数据贸易是结构性的。数据一旦进入海外模型的训练管道,就会沉淀为系统能力,再随产品回到全球市场参与竞争,并反过来影响哪些只产数据不沉淀模型地区的未来。

这样说,还只是我们一厢情愿,站在数据生产链的优势上,把国内数据作为卖方市场的“杞人忧天”。但是一个更不易察觉、也少有人提起的话题是,模型和数据之间还有着训练所需的算力阻碍,而高端算力领域我们并无优势。

6 月星海图全球开发者大会上,高继扬指出模型训练中,“数据成本与算力成本比例大概是 1:10”。据了解,当前十万小时数据成本普遍达到千万级。更遑论百万、千万、乃至达到具身智能 ChatGPT 时刻业内普遍认可的所需的百亿小时。

在 4 月具身研习社主持的一场觅蜂科技圆桌中,极佳世界朱政更具体的给出成本剖析:“第一,现在采一小时数据成本约 200 元,几百亿小时根本负担不起;第二,数据利用效率太低,训几十万个小时就要几千万 GPU 成本。”这样看来,算力成本也将会在可预见的未来成为具身智能新的“硬骨头”,甚至形成对数据的反向钳制。

1663f700007ba940f3ee330639cbe33f.jpg

eec6efff2d005c5cc6f8a1c9c4d8d49e.png

当我们谈及“数据外流”时,如果放在一个更广阔的全球图景中去描绘,则是一种更具结构矛盾的数据流动:具身智能的数据采集,正在向部分地区扩散。

模型训练需要规模化、低成本、多样化的真实世界数据,这是产业的客观规律。不同地区的劳动力结构、生活场景、产业形态,对全球头部模型公司有天然的吸引力。从纯商业逻辑看,这种扩散是自然的。

但其中藏着一个值得警觉的结构性问题——如果这些地区只承担数据采集这一环,模型训练、产品定义、平台建设、商业利润都流向少数科技中心,它们最终得到的,可能只是短期的劳务收入,而不是真正意义上的产业升级。

这正是过去一百年里发生在许多原料型经济体身上的故事,表面上是公平贸易,结构上是单向萃取。AI 之前的全球化里,一些地区参与世界经济的方式,是输出矿产、土地、廉价劳动力;到了具身智能时代,它们可能还要再多输出一项比短期劳动更具长远价值的产物——“真实世界的行为数据”。

人们戴上采集设备,完成家务、搬运、照护、种植、清洁,自己的动作和经验被记录下来,上传到远端,变成训练机器人模型的原料。表面上是一份灵活就业,深层看,是把当地的生活、劳动和环境,转化成了外部智能系统的训练矿场。

更何况这种训练矿场正呈现一种负面循环,不因需求持续增加而提高定价权,却因门槛够低迎内卷竞争,丧失议价权。据具身研习社了解,部分区域的数据采集价钱已经在数月内跌十倍。

一阵热浪后,随波走的是盆满钵满的中间商,留下的生产方。

需要强调的是,全球化数据合作本身并不天然带有剥削性,关键在于当地是否留下了核心能力。如果一个地区参与具身智能产业,只留下采集员、标注员和外包团队,没有数据治理平台、没有模型训练能力、没有本地化的机器人应用、没有围绕本土场景形成的产业生态,那么这场技术浪潮对当地的真正意义就十分有限。

事实上,现在其他承担数据采集的区域,自身也有丰富的应用场景——农业、矿业、城市服务、物流、护理、家庭劳动,这些恰恰都是未来机器人最有可能落地的方向。如果它们只能把数据卖出去,却没有能力把模型产品和应用红利留在本地,最终会出现一种新的不平等:他贡献了真实世界,却没有分享真实红利。

新一轮产业分工中,数据链路上我们已经看到了尼日利亚、菲律宾、印度比比皆是的案例。

也正因为如此,“数据全链条自主可控”在更大尺度上不仅是产业议题,也是在 AI 时代如何避免再次被资源化的共同议题。

8ab9c47db4d4d0ef2635c2e4be9cdbfa.png

具身智能不能依赖外部的数据采集,否则将会错过非常关键的产业红利。因为数据采集本身,正在演变为一种新型的基础设施和新型的就业形态。

很多人一听“数据采集”,第一反应是低端环节、苦活累活。但具身智能里的数据采集,已经不只是机械标注。它连接着任务设计、动作捕捉、场景组织、传感设备、质量评估、模型反馈与应用验证一整套流程——真正做起来,它会带动一批围绕真实世界的岗位和能力建设。

京东在宿迁的尝试是一个值得关注的样本。据公开报道,京东计划建设大规模具身智能数据采集中心,发动内部超过 10 万名员工和外部约 50 万名各行业从业者参与采集;其中宿迁本地将有超过 10 万市民参与,覆盖家庭、办公、工厂、物流、商店、餐厅、医疗、环卫等上百个真实场景。采集员经过培训后,可以在擦桌子、叠衣服、整理收纳、地面清洁等日常劳动中完成数据生成。

df1d2209e4f262c9634742e8bbf3f454.png

这件事的真正价值,不止于“大厂下场”、“京东将手握海量数据”,诸如此类的评价。

更重要的是,它把数据生产环节嵌入了本地产业。采集员在家务、照护、生产、配送等场景中产生数据,数据经过上传、质检、标注,再进入模型训练和应用闭环。这是一种比较健康的产业组织方式:原矿没有被抽走,而是就地完成了第一道加工,转化为本地能力的基础设施。

当然,这种模式仍然有需要持续打磨的环节。但它至少指出了一种可能性——具身智能的数据红利,不应该只留在模型公司和资本市场,也应该让真实参与数据生产的劳动者、地区和产业获得一份收益。

国内数据生产体系的意义就在这里。它不只是“把活留下”,而是把采集、设备、治理、训练、验证、部署这些环节尽可能串联起来,让产业红利在本土形成闭环,让具身智能不只是替代劳动的工具,也成为升级劳动、培育新岗位、组织新型产业的机会。

把他变成数据,也要让他享有智能

具身智能的数据问题,表面是技术问题,深处是产业分配问题。

数据全链条自主可控,要回答的就是几个最根本的问题:数据从哪里来?由谁开采?流向哪里?由谁冶炼?服务谁的模型?沉淀在哪片区域、哪类企业?最后,智能带来的红利又返还给谁?

如果这些问题没有答案,“数据元年”可能演变成新的失衡。

数据全链条自主可控的意义就在这里。它不是把门关上,而是把根扎下;不是拒绝全球协作,而是在协作之前,先守住自己的真实世界、产业能力和价值分配权。

未来的具身智能竞争,拼的当然是模型、硬件和场景。但更底层地看,它拼的是一个国家能不能把自己的真实世界,转化为自己的智能能力;能不能让技术进步,最终回流到自己的产业、劳动者和社会之中。

这才是“数据自主可控”最现实、也最深远的含义。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×