世界模型热了这么久,光象科技想让它变为生产力
统计 阅读时间大约9分钟(3527字)

1天前 世界模型热了这么久,光象科技想让它变为生产力

来源:具身研习社
把物理规律写进模型,把产业规律刻进基因。

作者:彭堃方     编辑:吕鑫燚     出品:具身研习社

世界模型还有“虚火”。

从 2026 世界机器人大会看下来,论坛、展台和企业技术路线都在谈世界模型。但把视线从概念、论文和 Demo 移向产线,问题也随之具体起来,世界模型热了这么久,究竟帮助机器人缩短了多少部署时间、提高了多少任务成功率?

技术热度与产业贡献之间,仍然存在错位。模型被寄予“理解世界”“预测未来”的厚望,机器人进入工厂后,却要面对节拍、良率、停线风险和推理成本。生成看似合理的未来,与可靠地完成物理操作之间,还缺少关键一环。机器人需要理解,自己的哪个动作改变了世界,又为什么产生这样的结果。

近日,光象科技联合清华大学李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect,简称 ActEffect,将世界模型从“推理时规划器”转变为“训练时反馈器”,通过动作后果在训练阶段校正策略,让机器人执行时直接做出优化后的动作。

光象科技创始人兼 CEO 张涛在媒体开放日上,将公司的核心工作概括为两个层面:“一个是打造物理原生基座模型,使其具备理解和认知物理世界、与物理世界交互并持续自我进化的能力;另一个是让技术走出实验室,进入产业场景,真正转化为生产力。”

这两项任务并非彼此割裂。物理原生基座模型决定机器人的能力上限,真实场景则提供反馈、验证和商业闭环。光象科技想建立的,是一套能够理解动作后果、在物理交互中持续进化,并以可承受成本进入产业的学习系统。

这样看,光象科技是一家把物理规律写进模型,把产业规律刻进基因的企业——摆正世界模型的位置,也摆正企业愿景。

7767f98370d3705fd831bf86072bdbc8.png

人工智能擅长从语言、图像和视频中学习统计规律,但进入工厂、道路和家庭后,回答错一句话,与机械臂撞到工件、抓落零件,代价完全不同。光象实验室首席科学家吕尧在此次媒体开放日上表示:“物理世界要求的不只是‘像’,而是准确、稳定、安全,并且能够闭环完成任务。”

在机器人策略学习中,VLA 通过模仿学习,将视觉和语言映射为动作;世界—动作模型 WAM 则结合未来状态预测与动作生成,试图以“预见未来”改善决策。但前者未必理解动作为什么有效,后者通常将动作造成的变化与场景自身演化隐式耦合。预测未来,并不等于理解自己如何改变未来。

光象科技提出的“物理原生智能”由此切入。

ffffdd6aaff858f195fcdf4cd27ba78b.png

以物理交互为首要原则,让模型学习世界运行规律、动作后果及安全约束。其世界模型、数据结构和训练算法,贯穿状态解耦表征、时序因果驱动、物理定律约束三项特征,对应“看得更准、想得更清、运行得更稳”。

ActEffect 是该体系的首个模型化成果,重点体现“时序因果驱动”。它通过最小迭代策略 MIP,生成前馈提案、粗提案和精提案三个完整动作方案,再由受控世界模型结合当前视觉状态,预测各方案的物理后果,通过反事实排序,要求精提案优于粗提案、粗提案优于前馈提案。训练的重点由此落到,同一状态下,哪个动作能带来更好的结果?

后果模型不接收语言指令,因为零件受力后如何移动,应由物理规律决定,不随任务描述改变。ActEffect 将“动作改变了什么”与“动作是否符合任务语义”分开建模,让后果评价回到物理状态本身。

训练结束后,受控世界模型被移出推理链路。机器人无需反复预测未来、采样候选方案,只需策略网络一次前向计算。后果反馈已沉淀进策略权重,训练可以投入更多计算,部署时则不必承担世界模型反复推演的额外开销。

据开放日披露,ActEffect 在 LIBERO 上,平均成功率达到 98.8%;在 29 自由度的类人双臂操作基准 RoboCasa-GR1 中取得 67.5%的平均成功率;在包含相机、机器人初始状态、光照、背景和布局等扰动的 LIBERO-PLUS 中,ActEffect 取得 80.3%的平均成功率。在三个互补的仿真基准上,均取得领先表现。但光象科技也强调,基准只是阶段性验证,模型仍需接受真实工位的检验。

这套技术也带来对数据的重新审视。

“当前具身智能所谓的‘99%数据缺口’,并不只是数据量不足,更集中体现在三个方面:一是数据闭环不完整,二是反馈信息不充分,三是数据职能不清晰”。吕尧认为,“并非数据规模越大,模型就能达到最优水平”,还要明确各类数据的能力分工、训练阶段和配比。互联网视频及无动作标注的 Ego 数据用于建立世界先验;带动作标注的 Ego、UMI 和真机遥操作数据用于学习状态转移;仿真数据则用于生成干预、失败和反事实样本。

9e70ca8b0be3ed62c83708d0a78dc6cb.png

光象科技的训练范式是:前期用真实数据监督预训练,中期在仿真环境中通过强化学习探索不同动作,最后以真机微调补偿仿真误差、适配任务。如吕尧所强调:“影响能力上限的数据,我们认为是在仿真环境中大量试错、进行反事实推理的数据”,成功示范之外,模型还要理解哪些动作导致失败,以及成功与失败的边界。

这种技术判断与 Physical Intelligence 联合创始人兼 CEO Karol Hausman 在一场晚宴中所说一致:“从 0%到 20%再到 60%的零样本,是一个关于数据的故事。从 60%走到可部署,是一个关于强化学习的故事。”从光象科技此次披露的模型和训练方式看,具身数据的下一轮竞争,可能不再只是收集更多“人是怎么做的”,还要获得更多“动作为什么有效、失败边界在哪里”的信息。

000c9114e6e0df0e3a6968b7e5a0b6c2.png

机器人进厂,尤其是汽车工厂的话题不新鲜,一年前就出现在大规模宣传中。但直到今天,它还是“夹生”的。一头是传统自动化已经成熟,一头是大量具身玩家涌入,但内里却仍具备十足的挑战性。

光象科技将汽车制造作为首个重点产业场景,恰恰看中了成熟自动化体系留下的难题。标准设备容易解决的环节大多已完成升级,剩余人工工位往往更加零散、柔性和复杂。张涛在开放日上表示,具身机器人应在传统方案难以胜任的地方体现价值,重点是多品类生产、快速换产、动态环境和柔性操作。

光象科技 COO 郑可在 2026 WRC 一场圆桌对话中提到,团队此前走访了约 20 家主机厂。焊装车间的焊接自动化率已超过 90%,小型和异形工件上料却仍大量依赖人工;总装涉及插接、卡接、拧紧和粘贴等复杂操作,涂装与总装尾线等还存在非接触式质检需求。

这些工位的物料形态、初始姿态和操作方式并不固定。传统方案依赖定制夹具和固定程序,遇到品类变化,集成与重新部署成本就会上升。具身智能的机会,正在于补足这部分柔性缺口。

2e1b57e6cbe9642bfc92e201cfb8a5d1.jpg

即便做上下料,也有两种路径:围绕单一零件和固定动作打造“比人更快”的样板,或主动容纳异形工件、正反摆放、无序堆叠等变量。光象科技选择后者。张涛给出的场景标准是:具备相较现有方案的技术价值,获得客户对经济、质量或社会价值的认可,同时具有规模复制潜力。“我们并不是刻意追求与别人不同,我们更希望做正确的事,而不是做不一样的事”,他说。

产品构型同样服从场景。在郑可看来,单臂能按节拍完成车身扫描,就不必为双臂额外增加成本;无需上下楼梯,轮式底盘也可能更合适。光象科技据此提出“一套本体、一套模型适配异构工位”,工业级自进化具身智能机器人 Phi-Bot X1 强调工业级体魄、一身多能、快速上岗和自我学习,并通过法兰接口快速更换末端执行器,在有限构型中保留适配能力。

8c6899ebe55d6b5f50160a648310d9b2.jpg

在移动质检中,Phi-Bot X1 可自主识别对象、规划移动及末端轨迹,检测汽车复杂曲面。据开放日披露,其检测速度比现有工业生产节拍快 20%以上,且不需预先铺设大量物理设施、固定摄像头或边缘计算单元。在上下料中,它则面对大型料框内姿态不一、相互压叠的机械件,在动态台架和高精度要求下,以接近人类的节拍完成识别、抓取和放置。

据公司披露,光象科技已在不止一家豪华品牌车厂的真实产线正式工位上完成产品、功能与性能验证,进入真机部署阶段;Phi-Bot X1 相较传统工业 AI 或自动化方案,当前部署效率提升超过 10 倍。

这里需要强调,当前工位模型并不等同于 ActEffect。张涛在开放日上澄清,ActEffect 面向未来通用能力,真实工位采用的是相同技术路径下、训练目标更聚焦的原生端到端模型。未来,通用基础模型将向不同构型和场景蒸馏相应能力。

从首台部署走向规模复制,还要持续压缩部署周期、数据需求和工程人力。第一次交付积累的能力能否降低后续成本,决定着具身智能的效率优势能否延续。汽车工厂因此也是光象科技的“第二训练场”。产线检验可靠性与经济性,现场的状态变化、失败案例和安全信号再回流训练体系,推动下一轮进化。

b7221bbe7d86b1e45b7d8df3fed45523.png

从开放日和 WRC 发言中,可以看到光象科技共同的方法论与价值观。张涛关注真实价值和投入产出,吕尧强调因果、反馈与安全约束,郑可重视节拍、可靠性与构型取舍。讨论对象虽然不同,都在物理规律和产业条件的约束下寻找更优解。

这种气质与团队构成有关。光象科技成立于 2025 年 4 月,孵化于清华大学三个院系,积累了车辆、强化学习、空间感知和端到端自动驾驶等技术,也组建了来自阿里、腾讯、华为、库卡和极智嘉等企业的产业化团队。成立首月便开发出工程样机,经历三至四个版本迭代后,才于 2026 年 6 月正式发布 Phi-Bot X1。

其全栈布局覆盖物理原生数据、世界模型、训练算法、智能平台和机器人本体。意义在于打通观测、动作、状态转移、任务反馈、安全约束与本体特性。模型、本体、数据和部署彼此割裂,真实世界的反馈便难以完整回流。

d611db8c87dd670a2d87dfd93127a0fd.jpg

因此,从汽车制造中的高价值工位起步,并不必然与通用模型的长期目标冲突。关键在于,场景是否提供具有共性的难题,阶段性交付是否沉淀出可复用的模型、数据和工程能力。若每个项目都依赖重新堆人、重新调参,订单增长未必能带来能力增长;只有后续部署不断受益于此前积累,商业化才在推动技术走向通用。

张涛谈到商业模式时也给出了明确顺序:先解决具体问题,让客户认可并用起来,再通过能力升级获得持续付费。这为具身智能的长期投入提供了一条更现实的路径。企业不必等待完全通用的机器人出现,才开始证明价值,但每一步现实收入,也应当服务于下一步能力建设。

回到世界模型的“虚火”,行业需要增加的,是模型成绩与产业结果之间可验证的联系。光象科技的探索提供了一种思路:在训练端用动作后果改善策略,在部署端控制计算负担,再通过真实工位检验能力与经济性。

理解物理规律,是机器人获得智能的开始;将这种理解稳定、低成本地复制到更多工位,技术才真正转化为生产力。

推荐阅读
{{item.author_display_name}}
{{item.author_display_name}}
{{item.author_user_occu}}
{{item.author_user_sign}}
×
右键可直接复制图片
×