阅读时间大约6分钟(2309字)
出品:机器人产业应用
7月30日,Google DeepMind正式发布Gemini Robotics 2模型套件,这可能是人形机器人控制架构领域近期最值得关注的一次技术迭代。
与行业内普遍采用的“分段拼接式”方案不同——行走控制、躯干运动、双臂操作由各自独立的控制器负责,依靠上层调度串联——Gemini Robotics 2首次实现了从脚到指尖的全身统一端到端策略。
单一 VLA模型统筹双腿移动、重心平衡、躯干姿态、双臂与手指精细动作,让机器人第一次有机会像人一样连续、流畅地完成“行走—下蹲—抓取—放置”这类长流程任务。
官方演示中,Apollo 2接收到“把浇水壶放到底层货架绿色箱子里”的指令后,自主完成了从走向桌子、拾取水壶、走向货架到弯腰放置的全过程,全程无需人类进一步拆解步骤。移动与操作相互割裂的范式,正在被打破。
除这份技术突破之外,DeepMind同步发布的一份18页安全技术报告,同样值得行业关注。
在这份报告中,一组数据揭示了当前人形机器人安全部署的核心瓶颈:在主动式人类安全监控测试中,所有前沿模型都面临一个两难选择——将误报率压到5%以下时,漏报真实安全风险的概率会超过40%;而将漏报率压到10%-15%时,机器人又会在15%-25%的时间里不必要地停机。没有任何模型能同时做到低漏报和低误报。
翻译成产品语言:一个配备了最先进AI大脑的人形机器人,要么频繁无故停机影响可用性,要么偶尔检测不到靠近的人类——在家庭等场景中,这二者都是无法接受的。
99%的检测准确率在实验室环境下是优秀指标,但剩余1%的误差在真实商业部署中可能就是致命短板。
这引出了一个比“VLA是否颠覆分段拼接”更前置的问题:“边走边做”在真实商业场景中,到底有多大的需求量?而安全能力,是否才是决定部署节奏的真正瓶颈?
01
传统分段拼接架构的短板
Gemini Robotics 2官方指出了分段拼接架构的三个短板:动作割裂无法边走边做、系统调度冲突、跨硬件迁移困难。
逐条来看。
动作割裂:当前主流机器人普遍采用 "走到A点→停稳→操作→再走到B点" 的回合制模式,移动与操作无法连续协同。对于需要在移动中完成操作的任务(如野外巡检中边走边检测、家庭环境中边走边归位散落物品),这种模式效率低下且不自然。
系统调度冲突:行走控制器要求重心前移,操作控制器要求手臂前伸,两者指令同时发出时可能产生冲突,导致机器人失衡甚至摔倒。分段架构需要上层调度器不断仲裁各控制器的优先级,增加了系统复杂度和延迟。
跨硬件迁移困难:传统策略针对特定机器人的硬件参数训练,换一个手臂或腿部构型就需要重新采集数据、调参,算法复用成本高。
02
Gemini Robotics 2的突破:全身统一端到端VLA
Gemini Robotics 2的核心突破在于:用一个单一的VLA模型,直接输出人形机器人全部自由度的控制信号——从脚踝到指尖,从重心到姿态,端到端一体生成。
这意味着机器人的双腿不再是“运输工具”、双臂不再是“作业工具”,整副身体被模型视为一个相互耦合的整体动作空间。在官方演示中,Apollo 2接收高层指令后,自主完成了“走向桌子→弯腰拾取→转身走向货架→下蹲放置”的连贯操作。全程无需人类拆解步骤,无需上层调度在多个控制器之间协调切换。
其中,在模型组件中ER 2承担了“系统2”的角色——慢思考、做规划、判断安全;VLA承担“系统1”的角色——快响应、生成动作。两者构成的双系统架构,使机器人既能执行长流程任务,又能实时响应物理环境的变化。
03
两条技术路线,分别适配什么场景?
目前,行业正在形成两条清晰的技术路线分歧:
分层控制器架构(特斯拉、Figure等整机厂商):上层VLA负责任务规划,下层独立运动控制器以1kHz级别频率负责底层执行。各层可独立优化,调试手段成熟。
全身端到端VLA统一策略(DeepMind):单一VLA模型统筹双腿移动、重心平衡、躯干姿态、双臂与手指精细动作。
两条路线分别适配什么场景?
在工业标准化场景中,分层架构完胜。 环境可控、动作可预设、精度要求极高。底层控制器的1kHz输出频率与VLA的10Hz推理速度之间,存在两个数量级的差距。在这个赛道,“停下来操作”是效率最优解,分段拼接不是短板。
在家庭等非结构化场景中,全身统一VLA才有真正的差异化价值。 操作目标在空间上离散分布,路径规划和精细操作必须连续协同,无法被拆分为“先走再停再做”。这恰恰是DeepMind这条技术路线要解决的场景。
04
安全是决定部署节奏的瓶颈,而非控制精度
技术突破令人振奋,但DeepMind同步发布的安全报告揭示了一个更复杂的事实。
安全报告中的一个细节值得关注:VLA可行性感知测试中,当ER 2被提供了关于VLA训练分布的详细摘要信息后,其判断任务是否可行的准确率从62.0%提升至95.8%。
62%到95.8%——差距如此之大,说明当前模型对“自己会做什么、不会做什么”的认知边界仍然模糊。而“准确认知自身能力边界”,恰恰是安全部署的前置条件。
安全报告中反复出现一个词——“trade-off”(权衡)。安全与效率之间、谨慎与可用性之间、拒绝对比误行动之间。Gemini Robotics 2的贡献不在于解决了这些权衡,而在于将它们系统性地量化并摆到行业面前,使安全从“拍脑袋设计”走向“可衡量、可优化”的工程问题。
安全报告在结论部分明确指出:“目前最好还是将这些模型与确定性的、底层的安全防护措施搭配使用。”换言之,Gemini Robotics 2的“智能安全”仍在发展中,底层物理安全机制仍然是部署的必要兜底。
这或许是行业各方评估人形机器人落地节奏时,需要纳入考量的关键变量。
05
结语
Gemini Robotics 2的技术突破是真实的。它首次证明了“全身统一端到端VLA”这条路线在技术上的可行性——一个模型统筹双腿移动、重心平衡、躯干姿态与双臂精细操作,让机器人第一次有机会像人一样流畅地“边走边做”,而非在模块拼接的缝隙中寸步难行。这对于人形机器人控制架构而言,是一个标志性的跨越。
但同样真实的是,这份技术突破尚未完全跨越商用的门槛。安全报告中的数据清楚显示:当前模型的“智能安全”在真实部署中仍面临误报与漏报的零和博弈。这并非Gemini Robotics 2独有的问题,而是整个行业从“实验室验证”走向“规模化部署”过程中必须共同面对的共性挑战。
从这个意义上说,DeepMind这份安全报告的价值或许不亚于模型本身——它向全行业传递了一个清晰信号:人形机器人的竞争,正在从“能不能动”转向“能不能安全地动”。
全身统一VLA证明了“大脑”可以更聪明。但一个更聪明的机器人,也需要一套与之匹配的“安全神经系统”——既能理解任务语境,又能实时响应物理世界的变化,还能在不确定时主动向人类确认。这套系统今天尚未成熟,但Gemini Robotics 2指明了一个明确的方向。
拐点确实到了。但拐点之后,是从技术验证走向工程完备的漫长爬坡。安全,将是这条路上最值得关注的里程碑。
