Google DeepMind 发布 Gemini Robotics 2:机器人终于能「全身心」干活
不卖本体只卖大脑
当所有人都在卷机器人「本体」的时候,谷歌选择了卖「大脑」。当地时间 7 月 30 日,Google DeepMind 正式发布新一代机器人智能层 Gemini Robotics 2,一次端出三款模型,把机器人的能力从桌面抓取直接拉到了人形全身控制。
三款模型分工明确。Gemini Robotics 2 是视觉-语言-动作模型(VLA),负责把摄像头画面和自然语言指令直接转成电机控制信号,能从脚到指尖完整操控一台人形机器人;Gemini Robotics ER 2 是「高级大脑」,负责理解指令、观察环境、拆解多步骤任务,还能同时协调多台机器人分工协作,官方称可自动化处理包含数百个步骤的长程任务;Gemini Robotics On-Device 2 则是端侧轻量版,用不到 200 个示例、几小时训练,就能适配一台全新的人形机器人。
演示里,Apptronik 的 Apollo 机器人完成了走路、弯腰、把洒水壶放到低层货架的全流程,中途还自己绕开障碍物;「拧下灯泡」的成功率达到 92%。更关键的是 ER 2 引入了断点续跑能力:执行出错时,模型能通过摄像头画面识别最后正确的步骤,从断点继续,不用从头再来。
这套设计的核心思路,是给机器人行业提供一层通用智能底座,而不是自己下场造本体。 谷歌机器人业务副总裁卡罗琳娜·帕拉达说得直接:目标是「把 AI 带入物理世界,构建一层能被所有机器人使用的智能层」。发布会上还同步推出了 ASIMOV-Agentic 安全基准,专门评估人形机器人在避免碰撞、拒绝危险指令方面的能力,并宣布 ER 2 向开发者开放预览,更专业的两个模型则向 Apptronik、Agile Robots、Boston Dynamics 等 100 多家受信测试机构开放。
不过,谷歌自己也没回避差距。DeepMind 机器人部门总监拉奥坦言,真正意义上的灵巧仍是远期目标——机器人动作目前仍显缓慢刻意,因为机器必须停下来「思考」人类凭直觉就能做的判断。测试也显示,多指灵巧手的表现目前反而打不过两指夹爪。
把视线拉远一点,这场机器人竞赛的赛点其实已经变了:特斯拉在弗里蒙特练 Optimus,Figure 的 BotQ 工厂一小时下线一台,而谷歌站在旁边递上「操作系统」——赌的是谁能让所有机器人跑同一套智能层。对行业来说,本体竞争的尽头大概率是标准竞争,谁的大脑能适配最多的身体,谁就拿到平台位。 至于「通用人形」还要多久,官方那句话最实在:距离灵巧,还有很长的路。

