谷歌Gemma 4全系開源:31B逼近閉源前沿,端側離線跑通原生多模態
雲端溢價要被敲鐘了
7月初,Google DeepMind 悄悄放出了一顆「炸彈」——Gemma 4 技術報告解封,全系模型以 Apache 2.0 協議徹底開源。這不是一次普通的版本更新。31B 的旗艦版本在複雜數學、前沿科學和真實 Agent 工具呼叫上,已經能正面挑落比自己大數倍的閉源模型;更小的 12B、2.3B、4.5B 版本,則把「深度思考」和「原生多模態」直接塞進了筆記本和手機。
先說最反直覺的一點。過去做多模態大模型,行業通行的做法是「膠水架構」:先掛一個幾億引數的視覺編碼器(比如 CLIP)把圖片翻成向量,再掛一個音訊編碼器(比如 Whisper)把聲音翻成向量,最後才塞進大語言模型。Gemma 4 乾的事,是把這兩個「翻譯官」直接砍了,只留一個 35M 引數的極簡投影層,把原始影象的畫素塊、原始音訊 40 毫秒的波形塊,直接投影進同一個 Transformer 的統一空間。模型不再需要中間人轉述,它用同一顆「大腦」同時「看」「聽」「想」。
這意味著什麼?一臺 16GB 視訊記憶體的 MacBook,甚至一塊 Jetson Nano、樹莓派 5,就能本地實時跑通「音畫文」三位一體的互動。你不必再把音影片流打包,跨越幾千公里送到雲端;也不用擔心網路抖動、頻寬限制,或者隱私合規的鐵拳。資料 100% 不出本地,延遲趨近於零,硬體買一次之後邊際成本幾乎為零。對很多做實時應用的團隊來說,這套賬很好算。
更狠的是「思考」這件事也被下放了。過去從 OpenAI o1 到 DeepSeek R1,慢思考一直是雲端巨頭的護城河——模型要在回答前做上百次自我審視,燒的是真金白銀的 Token。Gemma 4 用一個簡單的 <|think|> 控制符,把這套機制原生帶到了 2.3B、4.5B 這樣的端側尺寸上。DeepMind 還配套了多 Token 預測草稿模型與量化感知訓練,讓本地深度思考不僅質量高,等待時間也大幅縮短。換句話說,一個幾B引數的小模型,也能在離線狀態下「想明白」再開口。
把視線拉遠一點,這背後是谷歌在「開放權重」這場焦土戰爭裡的又一步。Hugging Face 的 CEO Clem Delangue 最近就在公開場合提到,越來越多財富 500 強公司不想再「租用」AI,隨著推理成本推高,它們正轉向開放權重。Gemma 4 選在最寬容的 Apache 2.0 下全量開源,等於直接打穿了「好模型鎖在 API 後面、按 Token 收費」的雲端暴利模式。和 Meta 的 Llama 社群許可相比,Apache 2.0 在商用上更自由,這對開發者的吸引力是實打實的。
我的看法是,端側 AI 的拐點可能比很多人預期來得更快,但它不會立刻殺死雲端。 真正會被重構的,是「什麼必須上雲、什麼留在本地」的分工——敏感資料、實時互動、長尾場景會迅速端側化,而超大規模協同訓練仍離不開雲端。對普通使用者來說,最實在的判斷是:接下來選裝置、選工具,可以開始把「能不能本地跑一個夠用的模型」當成硬指標。智慧要是能離線、能私有、能塞進口袋,我們向雲端繳的「智商稅」,確實該重新算一筆賬了。