阅读时间大约8分钟(2851字)
出品:机器人产业应用
前言
2026年6月下旬,全球具身智能赛道迎来一笔极具范式意义的重磅融资。
成立不足一年的纽约AI实验室General Intuition官宣完成3.2亿美元A轮融资,投后估值突破23亿美元,由顶级风投Khosla Ventures领投,贝索斯Bezos Expeditions、前谷歌CEO施密特等明星资本集体跟投。叠加2025年10月落地的1.337亿美元种子轮,公司成立未满一年累计融资已超4.5亿美元。
相较于亮眼的资本成绩单,General Intuition的底层商业模式,更颠覆了行业固有认知。公司创始人Pim de Witte同时是全球头部游戏剪辑平台Medal.tv的缔造者,两家主体同属一个母公司体系。
Medal.tv沉淀1700万月活用户,年均产出超20亿条游戏高光片段,其核心价值并非普通视频画面,而是每帧画面同步绑定的玩家按键、鼠标位移、实时决策、操作意图的结构化动作标签数据。

依托这套独一无二的“像素视觉+人类主动动作”游戏数据集,General Intuition走出了一条行业前所未有的训练路径:摆脱昂贵的真机采数、规避仿真虚实鸿沟、补齐普通视频无动作缺陷,试图证明具身世界模型的迭代,未必需要依靠百万小时真机作业堆料。
在行业陷入真机、仿真、互联网视频三大赛道内卷的当下,游戏动作数据能否成为具身智能训练的第四条核心路径,重构全球物理AI的数据竞争格局?
01
行业痛点拆解:具身AI缺的从来不是画面,是带意图的动作数据
当前全球具身智能模型训练,已形成三条成熟但各有硬伤的数据路径,长期桎梏行业迭代速度与落地能力,也是通用物理AI难以快速突破的核心瓶颈。
其一,真机实操数据。真机数据真实度最高、物理适配性最强,是工业级落地的核心底座,但存在致命短板:采集成本极高、落地周期漫长、规模化扩容难度极大。
每一条机器人真实运动轨迹,都需要设备、场地、人工遥操作、场景运维多重成本叠加,百万小时级高质量真机数据,对绝大多数初创企业而言都是难以承担的天文成本,无法支撑模型快速迭代。
其二,虚拟仿真数据。依托Unity、Unreal引擎生成的仿真数据,具备低成本、可批量、可无限复刻的优势,能够快速扩充数据体量,但需弥补Sim-to-Real虚实鸿沟。
物理引擎对现实世界的摩擦、光照、材质、柔性交互、细微力学反馈做了大量简化,导致仿真训练模型落地真实场景后极易“水土不服”,环境适配、动态决策能力大幅下滑,难以支撑高精度商用作业。
其三,互联网公开视频数据。YouTube等公共平台拥有海量人类动态活动视频,数据体量堪称无限,但仅有旁观视角的画面信息,缺失核心的人类决策动作信号。
模型只能被动观察人类行为结果,无法学习“环境感知—决策判断—动作输出”的因果逻辑,无法建立三维空间推理与实时交互的直觉能力,训练价值极其有限。

General Intuition架构
General Intuition这家公司认为:游戏动作数据,是当前唯一能够兼顾低成本、大体量、高信噪比、带动作意图的全新数据范式。玩家在《堡垒之夜》《Apex英雄》等3D游戏中的走位、瞄准、闪避、战术决策,全部对应精准的按键输入与运动轨迹,天然匹配三维空间感知、动态轨迹预判、实时环境交互的训练需求。
正如创始人Pim de Witte所言,文字与普通视频都是对物理世界的滞后记录,游戏动作数据是最贴近人类感知层、带有明确行为意图的原始训练素材,能够快速为机器人搭建空间推理直觉底座。
02
8分钟微调出圈:范式突破与行业边界的辩证审视
General Intuition最出圈的技术成果,是业内震惊的“8分钟微调”实验,彻底颠覆了行业对具身数据训练的固有认知。
在纽约发布会现场,团队基于海量游戏数据预训练的空间推理基础模型,仅用8分钟户外街道真机采集数据做小幅微调,即可驱动单目摄像头配置、无激光雷达、无深度相机的四足机器人,在全新未知办公室场景完成全程自主导航,精准规避行人、动态障碍物,实现零样本泛化运行。
这一实验直接冲击行业“百万小时真机数据刚需”的固有共识,构建出全新训练范式:海量游戏数据搭建通用空间推理、因果交互底座,少量真机数据完成现实场景适配微调,将传统动辄数百小时的真机采数成本,压缩至分钟级,极大降低具身模型的迭代门槛与落地成本。

但客观来看,该技术突破存在明确的能力边界,不能过度神话,行业需理性辩证看待。目前公开信息明确三大核心限制:
第一,8分钟微调效果仅在结构化、光照稳定、地形平整的办公室场景完成验证,在工地、野外、家庭厨房等复杂光照、不规则地形、柔性交互场景的泛化能力,暂无权威基准测试佐证;
第二,该成果是“预训练+微调”组合模式,底层模型依托数百万小时游戏数据完成前置训练,算力成本与数据积淀并未消失,并非零成本突破;
第三,所有演示与数据均为企业单方披露,暂无第三方机构独立核验,在“演示易、量产难”的物理AI赛道,审慎验证必不可少。
从产业落地维度判断,游戏数据路线具备明确的落地优先级:在自主导航、环境巡游、动态避障等物理精度要求相对宽松的场景,可快速实现规模化落地;但在精密装配、柔性抓取、力控交互等对材质反馈、接触力学、细微误差极度敏感的任务中,游戏物理引擎与真实物理世界的偏差,仍是短期内无法逾越的天花板。
03
赛道新格局:四条数据路径分工明确,融合取代替代成行业主流
随着游戏动作数据路径走向成熟,全球具身智能训练正式形成四大数据体系并行格局,四条路径不再相互内卷替代,而是形成清晰分工、深度融合的产业生态。
真机数据锚定 ,保障机器人高精度作业、复杂力学交互、工业级落地的核心能力;仿真数据提供低成本、可批量、可复刻的预演场,快速扩充极端场景、特殊工况样本;互联网视频补充长尾人类行为样本,丰富模型对多元生活场景的认知;而游戏动作数据补齐了行业长期空白的带意图、带因果、带动作标签的结构化数据,解决模型空间推理与动态决策的泛化难题。

未来行业顶级具身基础模型,必然是四路数据的融合产物:用游戏数据拓宽泛化边界、用真机数据夯实物理精度、用仿真数据扩充场景样本、用互联网视频补齐行为长尾。而General Intuition的核心护城河,正是多年沉淀的数十亿级结构化游戏动作数据。
这也是2024年OpenAI曾出价5亿美元收购Medal.tv,却被创始人果断拒绝的核心原因——不可复刻的高信噪比具身数据,是物理AI时代的重要产业壁垒。
04
资本重仓逻辑:押注物理AI终局,高风险与高收益并存
贝索斯、施密特、Khosla等全球顶级资本密集重仓,本质是押注AI产业的终极迭代方向:数字大模型竞争见顶,物理具身AI迎来黄金拐点。
在资本视角下,LLM的推理涌现已趋近阶段性天花板,而机器人的空间直觉、物理交互、动态决策能力涌现,是下一阶段AI产业最大的确定性增量。游戏场景沉淀的人类“感知—决策—动作”闭环数据,正是催生物理AI直觉涌现的核心底座。
这笔超4.5亿美元的累计融资,是典型的“高风险、高上限”赛道赌注。目前General Intuition仍存在诸多不确定性:成立未满一年、暂无商业化落地客户、核心8分钟微调成果未经过多场景验证、无开源模型与开放生态。
同时,英伟达Halos for Robotics生态、Figure AI、1X等海外头部玩家持续迭代通用具身模型,行业竞争快速加剧,赛道窗口期正在快速收缩。
行业终极分水岭,在2026年夏末正式到来。随着General Intuition开放API,全球开发者将批量接入其模型能力,届时技术上限、场景边界、泛化短板将被彻底公开验证,真正定义游戏数据路径的产业价值。

05
结语:具身AI的竞争,从数据体量之争转向意图密度之争
数十年游戏产业,通过海量场景训练人类的三维空间感知与动态决策能力,如今这套人类行为沉淀的数据资产,反向赋能机器人“大脑”迭代,形成极具产业浪漫的技术轮回。General Intuition的出圈,核心价值不在于彻底颠覆真机、仿真数据路径,而是为行业开辟了一条全新的解题思路。

它让整个行业重新认知:具身智能的迭代瓶颈,早已不是数据数量不足,而是高意图密度、高因果关联、高信噪比的优质数据稀缺。未来具身世界模型的竞争,不再是简单的堆数据、堆算力、堆时长,而是数据范式、数据质量、数据闭环效率的系统性比拼。
游戏动作数据的崛起,不代表行业旧路径的落幕,而是标志着具身智能正式进入多数据融合、多路径互补、高质量迭代的全新阶段。这条全新的路径,或将成为物理AI产业的关键变量。
