阅读时间大约9分钟(3282字)
作者:北野五 出品:机器人大讲堂
一年前,Hugging Face拒绝了英伟达5亿美元的投资。理由很体面,不想让某个占据主导地位的投资者影响平台决策。
一年后,同一个买家开出129.3亿美元,它同意了。
当地时间9月3日,英伟达官宣收购Hugging Face。119亿美元归股东,最高10亿美元留才。1800万开发者、300万模型、50万数据集,AI世界最大的开源广场换了主人。
外人看这是一笔天价并购。对机器人行业来说,这笔交易真正的分量不只在成交价上。HF已经长出一条具身智能的数据货架,LeRobot框架、181个标准化机器人数据集、从仿真到真实的迁移代码。大量机器人公司的训练流程都搭在HF上。
当卖GPU的人买下这张地图,挖矿的人接下来每一笔开销都要重新算。
01.
HF的独立神话,撑不下去了
要理解为什么现在卖,得先看HF过去一年发生了什么。
2025年底,英伟达递来5亿美元投资方案,估值约70亿。HF的CEO Clément Delangue拒绝了。理由是不想让单一投资者拥有过大的话语权,左右公司的技术方向和战略决策。这个拒绝在当时完全合理,毕竟HF的核心价值就是它不属于任何一家芯片公司。
独立平台的日子并不好过。
HF的商业模式是免费托管模型,靠企业订阅、推理服务和计算服务赚钱。听起来像GitHub,但AI模型的托管成本远比代码仓库高。一个大模型权重文件的流量和存储成本,是普通代码仓库的几十倍甚至上百倍。
现实很残酷。据第三方估算,HF年收入约1.5亿美元,付费客户占比大约只有3%。平台上托管着超过300万个公开模型、100万个数据集、1500万注册用户,但流量巨大不等于赚钱。真正有钱的金主,也就是银行、证券、保险、大型制造业和科技公司,越来越关心数据安全和私有化部署,HF的线上SaaS模式很难满足这部分需求。GitLab当年就是靠私有化部署从GitHub手里抢走了一批企业客户,HF不是没想过做企业版,但它的平台从一开始就是按承载千万线上用户设计的,不是按线下to B交付团队设计的。
更大的压力来自两头挤压。上游的模型厂商,Meta有Llama自己的分发渠道,谷歌有Vertex AI,微软有Azure AI Foundry,OpenAI有自己的API生态,DeepSeek和Qwen也在自建下载站和社区。它们不需要把最好的东西全部交给HF。下游的云厂商,AWS、GCP、Azure自己就有模型市场和托管服务,HF的推理服务本质上是在它们的池子里做生意。
HF的位置很微妙。它卡住的是模型从论文到生产之间的路由层,但这个位置本身并不赚钱。它更像一个流量巨大的收费站,但过路费收不上来。
所以一年后态度反转,不是英伟达变得更有诚意,而是HF发现自己独立撑下去越来越难。被巨头收养,比被巨头边缘化强。

图1|Hugging Face官方logo;来源,Hugging Face品牌资产
02.
86倍市盈率,买的是英伟达的焦虑
想必从各种文章中,诸君已经清楚下面的一组数据,按照5亿美元年收入算,129.3亿的对价是86倍ARR。微软2018年75亿美元买GitHub,GitHub年收入约2.5亿,才30倍ARR。
英伟达花的不是溢价,是保险费。它买的不是HF的营收,是自己未来不被绕开的确定性。
英伟达现在看起来仍然是王者,但王位下面已经有裂缝。
2026财年,英伟达总营收2159亿美元,数据中心业务1935亿美元,占比接近90%。游戏业务收入225亿美元,占比萎缩到10%左右。这甚至不是双轮驱动,是单腿走路。数据中心业务一旦放缓,整个公司的叙事正在等待新的转折点。

图2|英伟达2026财年营收结构;来源,英伟达财报,作者整理
更要命的是,它最大的客户正在变成对手。OpenAI推出了自研推理芯片Jalapeño,由博通设计、台积电代工,计划2026年底部署,未来可能向其他公司开放。Anthropic被曝出在和三星接洽自研芯片,采用2纳米制程。连Anthropic都和AMD、Nscale签下了450亿美元的算力协议。谷歌、亚马逊、微软更是早就有了自己的TPU、Trainium、Inferentia、Maia。
这些AI lab过去是英伟达最大的买家,现在它们一边继续买英伟达芯片,一边拼命找Plan B。这不是商业关系的小波动,这是整个行业在试图降低对CUDA单一生态的依赖。
英伟达不可能坐视不理。它的应对思路很清晰,既然硬件上大家都在找替代,那就在软件层和分发层加深绑定。芯片、推理服务、模型、分发平台,黄仁勋要的是一根链条全攥在手里。收购Run:ai,拿下Poolside团队,发布Nemotron开源模型,现在买下Hugging Face,每一步都在把开源生态的关键节点变成自家产业链的一环。
买HF不是终点,是拼图的最后一块。它要的是你下载的每一个开源模型,下一步都优先跑在CUDA上。
03.
LeRobot不是小项目
很多人对LeRobot不熟悉。它不是HF的一个边缘项目,而是它在物理AI领域最重要的抓手。
LeRobot是HF主导发起、Meta FAIR和学术界深度参与的物理AI开源框架。它的目标是解决机器人数据格式碎片化的问题。过去每个实验室用自己的格式,HDF5、TFRecord、ROS bag、自定义CSV,训练一个跨数据集的模型要先写一堆数据加载器。LeRobot把所有东西统一成Parquet表格加MP4视频,开发者可以用两行代码加载任何LeRobot格式的数据集,直接接入ACT、Diffusion Policy、VQ-BeT等训练流程。
目前,GitHub 星标已超 2.3 万。HF Hub 上汇聚了 51 个以上预训练模型、181 个标准化数据集、7 个 Spaces工具,2025年机器人数据集从1145个增至 26991个,是HF增长最快的类别。
截至2026年中,LeRobot已经汇集了181个以上的机器人数据集,具不完全统计,覆盖 The Robot Studio 的 SO-100/SO-101、Koch Robotics 的 Koch、斯坦福 ALOHA 团队的 Mobile ALOHA、宇树科技的 Unitree G1、Pollen Robotics 的 Reachy 2、Hello Robot 的 Stretch、Hugging Face 自研的 HopeJR 等主流机器人。
我们必须承认,它正在成为机器人数据采集、训练、仿真到真实迁移的事实标准之一。

图4|基于LeRobot数据格式的Unitree G1机器人操作任务仿真;来源,Hugging Face数据集 jnsungp/unitree-g1-robocasa-pick-apple-bowl-contact-1k(CC BY 4.0)
更关键的是英伟达和HF在机器人领域的绑定已经提前开始了。
2026年7月,也就是收购传闻出来前两个月,双方官宣将NVIDIA Isaac GR00T 1.7开源模型和Isaac Teleop框架引入LeRobot,还计划后续接入NVIDIA Cosmos 3世界模型。英伟达的Isaac Sim、Isaac Lab、Jetson、GR00T、Cosmos,本质上是在构建一个从仿真生成数据、到训练模型、再到部署到实体机器人的完整物理AI闭环。
HF上的LeRobot和这个闭环一结合,机器人行业的训练数据、模型权重、部署工具就全部串在了一根绳上。这根绳的另一端,越来越指向CUDA生态。
对机器人公司来说,模型可以换,数据格式一旦统一就很难迁移。如果LeRobot和数据集越来越向英伟达的硬件和软件栈倾斜,走非英伟达路线的团队会被迫承担额外的迁移成本。这不是阴谋论,是平台收购后必然会被重新讨论的商业逻辑。
04.
不强制,但能卡你脖子
黄仁勋的承诺说得很清楚,Hugging Face会保持开放,不会强制使用英伟达硬件。英伟达企业计算副总裁Justin Boitano也说,HF"本质上是一个去中心化平台"。
黄仁勋和Boitano的表态都已被报道,但另一件事同样要写清楚,承诺和机制是两件事。
英伟达不需要关掉HF,也不需要让AMD或谷歌TPU的模型"恰好"用不了。它只需要让几件事"恰好"发生。
搜索排序上,新模型的冷启动权重向谁倾斜。推荐位上,首页banner和官方账号转发谁的作品更多。Spaces一键部署的默认后端指向谁的芯片。示例代码和文档维护上,哪种硬件的教程更新更勤快。数据集预处理脚本对哪种计算后端优化更充分。模型卡页面上的"一键部署"按钮默认跳转到哪个云服务。
这些细节单看都很小,但累积几年,就能重塑一个生态。关停是反垄断的雷区,倾斜是产品运营的日常。
真正的问题不是HF会不会封杀竞品,而是未来开发者在HF上找模型时,最优路径会不会"自然而然"地指向英伟达的推理服务和CUDA后端。这不需要强制,只需要默认值。
05.
中国公司面临什么
英伟达在监管文件里点名,"许多流行开放模型来自中国"。朋友们,请暂时放下手机仔细体味一下这句话。
这不是一句客套话。Hugging Face 2026年春季报告显示,中国自研开源模型的下载量占平台全部开源模型下载总量的41%,累计下载量突破100亿次,首次超过美国。在HF下载量最高的25个开源模型中,中国模型占了19个。以阿里Qwen家族为例,衍生模型数量已经突破15万个,关联代码仓库超过20万,全网累计下载量超过30亿次。

图5|Hugging Face平台开源模型下载量来源占比;来源,Hugging Face 2026春季报告,作者整理
这两组数据把一件事说得很清楚,HF已经和中国开源模型深度绑定,而这种绑定以后要算在英伟达的账本上。
中国机器人公司面对两道关卡。第一道是芯片获取。出口管制下,中国团队本来就拿不到最先进的英伟达训练卡,很多人已经在用昇腾、寒武纪、沐曦、天数智芯,或者用AMD和云厂商的替代方案。第二道是平台规则。如果未来HF上的模型分发、数据集下载、训练框架接入,越来越和CUDA生态强绑定,用国产芯片的团队就会被卡在工具链适配和数据格式迁移上。
用HF,你的训练流程和数据集格式会被慢慢锁进英伟达的生态。不用HF,迁移成本极高,国产替代平台在物理AI开源上的积累还不够深。魔搭社区、百度飞桨、华为昇思都在做,但LeRobot级别的标准化机器人数据框架,国内目前还没有完全对标的替代品。
中国具身智能的数据主权,不是喊口号能解决的。这笔交易把"自建数据栈"从可选项挤成了必答题。
06.
写在最后
Hugging Face的价值,曾经建立在"它不属于任何一家芯片公司"这个前提上。这个前提现在有了标价,129.3亿美元。
对普通开发者来说,未来的问题是搜索排序和默认部署按钮会不会变。对机器人公司来说,问题是训练数据和开源框架的入口会不会被生态绑定。对中国具身智能来说,问题是当全球最大的物理AI开源平台归了卖芯片的那家,数据主权和国产替代窗口还剩多少时间。
英伟达不需要关掉Hugging Face。它只需要让别家的路,恰好难走一点,而已。
