Google DeepMind 釋出 Gemini Robotics 2:機器人終於能「全身心」幹活
不賣本體只賣大腦
當所有人都在卷機器人「本體」的時候,谷歌選擇了賣「大腦」。當地時間 7 月 30 日,Google DeepMind 正式釋出新一代機器人智慧層 Gemini Robotics 2,一次端出三款模型,把機器人的能力從桌面抓取直接拉到了人形全身控制。
三款模型分工明確。Gemini Robotics 2 是視覺-語言-動作模型(VLA),負責把攝像頭畫面和自然語言指令直接轉成電機控制訊號,能從腳到指尖完整操控一臺人形機器人;Gemini Robotics ER 2 是「高階大腦」,負責理解指令、觀察環境、拆解多步驟任務,還能同時協調多臺機器人分工協作,官方稱可自動化處理包含數百個步驟的長程任務;Gemini Robotics On-Device 2 則是端側輕量版,用不到 200 個示例、幾小時訓練,就能適配一臺全新的人形機器人。
演示裡,Apptronik 的 Apollo 機器人完成了走路、彎腰、把灑水壺放到低層貨架的全流程,中途還自己繞開障礙物;「擰下燈泡」的成功率達到 92%。更關鍵的是 ER 2 引入了斷點續跑能力:執行出錯時,模型能透過攝像頭畫面識別最後正確的步驟,從斷點繼續,不用從頭再來。
這套設計的核心思路,是給機器人行業提供一層通用智慧底座,而不是自己下場造本體。 谷歌機器人業務副總裁卡羅琳娜·帕拉達說得直接:目標是「把 AI 帶入物理世界,構建一層能被所有機器人使用的智慧層」。釋出會上還同步推出了 ASIMOV-Agentic 安全基準,專門評估人形機器人在避免碰撞、拒絕危險指令方面的能力,並宣佈 ER 2 向開發者開放預覽,更專業的兩個模型則向 Apptronik、Agile Robots、Boston Dynamics 等 100 多家受信測試機構開放。
不過,谷歌自己也沒回避差距。DeepMind 機器人部門總監拉奧坦言,真正意義上的靈巧仍是遠期目標——機器人動作目前仍顯緩慢刻意,因為機器必須停下來「思考」人類憑直覺就能做的判斷。測試也顯示,多指靈巧手的表現目前反而打不過兩指夾爪。
把視線拉遠一點,這場機器人競賽的賽點其實已經變了:特斯拉在弗裡蒙特練 Optimus,Figure 的 BotQ 工廠一小時下線一臺,而谷歌站在旁邊遞上「作業系統」——賭的是誰能讓所有機器人跑同一套智慧層。對行業來說,本體競爭的盡頭大機率是標準競爭,誰的大腦能適配最多的身體,誰就拿到平臺位。 至於「通用人形」還要多久,官方那句話最實在:距離靈巧,還有很長的路。

