Gemma 5
谷歌 DeepMind 開放權重模型家族最新一代 Gemma 4(Apache 2.0,覆蓋手機到伺服器)
深度報告
-
產品速遞原計劃推送的條目名為「Gemma 5」,但截至本報告撰寫日(2026 年 7 月 17 日),谷歌 DeepMind 尚未釋出名為 Gemma 5 的模型。當前可公開獲取的最新一代 Gemma 開放權重模型是 Gemma 4,於 2026 年 4 月 2 日(北京時間 4 月 3 日)釋出,並採用 Apache 2.0 許可證。 本報告以可驗證的 Gemma 4 為基準撰寫,並在文末說明命名差異,相關產品名稱與分類請由人工在後臺稽核決定。Gemma 4 是谷歌迄今「單位引數智慧」最高的一代開放模型,覆蓋從樹莓派到單卡 H100 的完整算力梯度,其中 31B Dense 版本在 Arena AI 文字開源榜排名全球第三。
-
Gemma 是谷歌 DeepMind 於 2024 年 2 月推出的開放權重模型家族,技術架構與閉源旗艦 Gemini 同源。此前的 Gemma 1、2、3 代均採用谷歌自定義的「Gemma 許可證」,其中包含谷歌可單方面修改條款、下游使用邊界模糊等限制,長期被開發者詬病「不算真正的開源」。 Gemma 4 是這一家族的第四代,也是一次許可證上的徹底轉向:全系改用 Apache 2.0,企業可自由部署、修改、商用且無需向谷歌報備。官方稱自第一代釋出以來,Gemma 累計下載量已超 4 億次,衍生變體超過 10 萬個。
-
Gemma 4 一口氣放出四個規格,對應四檔硬體戰場。E2B 與 E4B 是面向移動與物聯網的「高效版」,推理時分別僅啟用約 20 億與 45 億引數,可在 Android 手機、樹莓派 5、NVIDIA Jetson Orin Nano 上完全離線、近零延遲執行,並原生支援音訊輸入,能直接做語音識別與理解。26B MoE 是混合專家模型,總參 260 億、推理時僅啟用約 38 億引數,主打延遲與價效比;31B Dense 是追求最高輸出質量的稠密模型,未量化版可在單張 80GB H100 上跑,量化後也能塞進消費級 GPU。 全系原生支援影象與影片(按幀)輸入。上下文視窗方面,端側 E2B、E4B 最高 128K,大模型最高 256K,足以在單次提示裡喂入整個程式碼庫或長文件。在智慧體能力上,Gemma 4 原生支援函式呼叫、結構化 JSON 輸出與系統指令,可構建能呼叫工具與外部 API 的多步自主智慧體;官方 τ2-bench 零售智慧體工具使用分數,31B 達 86.4%、26B 達 85.5%。 2026 年 6 月,谷歌又基於 Gemma 4 家族推出 DiffusionGemma——一個採用文字擴散路線的 26B MoE 模型,本地推理速度最高比自迴歸模型快約 4 倍(單卡 H100 超 1000 token/秒),以及面向手機與筆記本的量化版本 Gemma 4 QAT、統一的無編碼器多模態模型 Gemma 4 12B。
-
Gemma 4 的權重本身完全免費,可在 Hugging Face、Kaggle、Ollama 與 ai.google.dev/gemma 直接下載,商用、修改、再分發均被 Apache 2.0 允許,沒有月活上限或授權費用。 若走託管 API,Google Cloud Vertex AI 對 31B-IT 的報價約為每百萬輸入 token 0.14 美元、輸出 0.40 美元;Groq、Together AI、Fireworks 等第三方也以每百萬 0.05–0.50 美元不等的價格提供推理。換句話說,願意自託管的團隊,邊際成本基本只剩一次性的硬體投入。
-
社群對 Gemma 4 的反響幾乎被「換許可證」這一事件點燃。在 r/LocalLLaMA,釋出後幾小時內就湧現數十個討論帖,核心情緒是「終於可以放心用了」——有人當天跑通樹莓派 5 本地部署,有人在 6 小時內放出 GGUF 量化版。 2026 年 5 月,Hacker News 一條「本地 AI 應成為常態」的帖子登上榜首(1646 分、643 評論),其下高贊回覆把 Gemma 4 31B 稱為「本地模型的新基線」,認為它「比以往任何本地模型都更不像科學實驗」。有開發者記錄用 31B 在 M4 筆記本上多輪自主逆向破解一個藍芽溫度計的通訊協議,全程無雲往返。 也有使用者在長篇文學翻譯的實測中發現,本地部署的 Gemma 4 在跨章節角色一致性上穩定優於會隨時間「退化」的雲端 ChatGPT 與 Gemini Chat。
-
在基準層面,Gemma 4 31B 相對 Gemma 3 27B 有飛躍式提升:Arena AI 文字約 1452(開源第三),BigBench Extra Hard 從 19.3% 跳到 74.4%,AIME 2026 數學 89.2%,LiveCodeBench v6 編碼 80.0%,GPQA Diamond 科學 84.3%,MMMLU 多語 88.4%。 同代橫向看,31B 在 AIME 2026 與 LiveCodeBench 上略超 Meta Llama 4 Maverick(88.3% / 77.1%)與 400B 級的 Llama 4。谷歌強調的是「單位引數智慧」——26B MoE 僅啟用 38 億引數,卻在多個榜單擊敗引數量達數百億乃至數千億的競品。與阿里 Qwen3、Mistral 一道,Gemma 4 被視為 2026 年開源陣營對抗閉源旗艦的核心力量之一。
-
第一,命名落差。產品速遞將其標為「Gemma 5」,但官方與公開資料均顯示最新一代是 Gemma 4,所謂 Gemma 5 截至撰寫日並未釋出。第二,基準由谷歌自報,獨立第三方複測仍在進行,部分邊緣模型(E2B、E4B)在 AIME 等硬任務上分數僅 37.5%–42.5%,不宜高估。 第三,社群實測反饋 Gemma 4 12B 在複雜長鏈工具呼叫上「會失憶」、忘記自己剛呼叫過的工具,且對推理後端配置極為挑剔,LM Studio、Ollama、llama.cpp 鏈路裡表現忽好忽壞,普通使用者並非「下載就能無腦跑」。第四,31B 在開放式創意寫作、長篇小說生成等偏主觀任務上,仍與 GPT-4o、Claude 等閉源模型有差距。第五,Apache 2.0 雖寬鬆,但端側小模型的「移動優先」定位意味著它們在絕對能力上天然弱於大尺寸閉源旗艦。
-
Gemma 4 最適合幾類人:做隱私優先移動 App、需要多模態 AI 完全在端側執行的開發者;想把推理從雲端 API 遷回自建、以控制成本與資料主權的中小企業;需要商用友好開放底座做領域微調的研究者與監管行業;以及把 AI 部署到樹莓派、Jetson 等受功耗與記憶體約束的物聯網團隊。 若你要的是絕對頂級推理或龐大社群生態,Llama 3.3 70B、Qwen3 系列仍是更成熟的選擇;若你要做可靠的主編排智慧體,社群普遍建議讓 Qwen 而非 Gemma 4 12B 來擔任。對絕大多數開發者,入門命令就是 `ollama run gemma4:26b`。
-
Gemma 4 的真正價值不在某一項跑分,而在於谷歌終於把「Apache 2.0 級寬鬆許可 + Gemini 同源技術 + 端到端部署」這三件事擰到了一起,讓前沿級 AI 第一次真正落到手機和樹莓派上。至於「Gemma 5」這個標籤,建議人工在後臺核對後再決定更名,以免把尚未釋出的一代提前掛到線上。
使用者評論
-
AnnSchuster—Gemma 5 這一代在本地部署的體驗真的提升不少,我之前用 4 代的 26B MoE 做程式碼補全,切到 5 代後感覺響應速度更順了,尤其針對 Python 和 C++ 的程式碼生成準確率高了不少。但中文理解還是老問題,寫中文 prompt 有時會冒出英文邏輯套中文的回答,希望後續能最佳化一下詞表。 -
AdamHarris_2021—谷歌這次開源是真大方,Apache 2.0 協議直接放權,連商用都不限制。對比某些「開源但商用要申請」的廠商,格局一下就拉開了。我覺得 Gemma 5 會成為本地 AI 開發者的基礎設施。 -
Raymond237—說真的 Gemma 5 的多模態能力還沒完全發揮出來,原生支援音訊和視覺輸入是好事,但實際跑下來識別複雜圖片的準確率還差點意思。不過文字生成的質量在同引數量級裡面確實頂。 -
Denise_KellyJr—剛把 Gemma 5 的 12B 量化版本跑在筆記本上,16GB 記憶體完全夠用,推理速度大概 30-40 tokens/s。說實話這個引數量能打出的效果有點出乎意料,做文字摘要和簡單的程式碼補全完全夠用,關鍵是完全離線跑,資料不用上傳,隱私這塊很安心。 -
Susan_RobinsonSr—太強了,Gemma 5 在 Svelte 5 的 runes 新語法上居然開箱即用,其他模型還在跟我說「Svelte 5 還沒釋出」。谷歌在知識庫更新這塊確實下了功夫,做本地 AI 開發這體驗真的回不去了。 -
Henry_HillII8—把 Gemma 5 12B 做量化後塞進樹莓派跑了跑,生成速度雖然只有個位數 token/s,但真的能跑起來。做邊緣計算的 IoT 專案,在裝置端直接推理完全不依賴網路,這意義太大了。 -
JosephReyesSr—用 Gemma 5 寫了一個 Three.js 的互動式 3D 展示頁面,單輪 prompt 就生成了能跑起來的程式碼,雖然動畫細節需要微調,但結構和邏輯完全線上。對比之前用 Llama 3 和 Qwen 3.5,Gemma 5 在前端程式碼的工程感上明顯更強。 -
RoyAlvarez_Max—實測 Gemma 5 31B 跑 SWE-bench 的得分已經逼近閉源旗艦了,LiveCodeBench 上幹到 80%,這個引數量做到這個水平真的離譜。Apache 2.0 協議開源對開發者太友好了,不用擔心哪天 API 改政策或者漲價。 -
JessicaFisher—安全性對齊太敏感了,讓他寫個帶漏洞的程式碼做安全測試都拒絕,還給我講了一通道德經。自家跑研究真心建議用 uncensored 微調版,不然標準版簡直是戴了手銬在程式設計。 -
BRamos_Pro92—我覺得 Gemma 5 在數學推理上真的很能打,31B 的 AIME 2026 做到了 89.2%,比上一代翻了好幾倍。自己做量化交易策略回測的時候,讓模型分析一些統計套利的邏輯,推導過程非常清晰。 -
LIand—日常用 Gemma 5 本地跑 agent 任務,function calling 確實比前代穩多了。之前用 4 代經常 JSON 格式輸出會炸,5 代基本沒出過格式問題。不過長上下文推理的時候 KV cache 膨脹得很快,24GB 視訊記憶體跑 31B 有點吃緊。 -
自在_13—我們公司之前卡在 Gemma 舊許可證上一直不敢用,法務說條款能單方面改等於埋雷。這次 Apache 2.0 一出,當週就批了把客服摘要模型遷到 Gemma 4 26B 的方案,現在每月省下大幾萬 API 費用,關鍵是使用者對話資料徹底留在自己機房,合規壓力小了一大半。 -
TheOğuzhanKarabulut—終於換 Apache 2.0 了,前三代那個自定義許可證真的勸退,現在能放心商用。 -
GEort—在樹莓派 5 上跑通 E4B,完全離線,做 IoT 助手很香。 -
SophieOuellet—說個真實踩坑:我用 Gemma 4 12B 當 OpenClaw 的主編排器,結果長鏈路工具呼叫頻繁「失憶」,明明剛返回了資料庫查詢結果,下一輪它又去重查,上下文狀態全亂。後來社群也有人反饋同樣問題,結論是 12B 容量太小不適合當主腦,現在我只讓它做單步多模態 SubAgent,編排交給 Qwen,世界清淨了。 -
Terry.Diaz_99—31B 在 M4 本地跑很穩,這才是本地 AI 該有的樣子。 -
OCmar—在 HN 上看到那篇「本地 AI 應成為常態」登頂時我挺感慨的。以前問的是「能不能本地跑」,現在問的是「為什麼不直接預設本地」。Gemma 4 31B 在 M4 上 128K 上下文實測讀寫都跟手,藍芽協議逆向那個案例讓我意識到,很多企業的免費文字補全根本沒必要 round-trip 到雲端,又慢又貴又洩隱私。 -
DavidKingIII—基準是谷歌自報的,上生產前建議先小範圍驗證。 -
37sak—客觀說,Gemma 4 在數學和程式碼基準上確實漂亮,AIME 2026 幹到 89.2% 還略超 Llama 4 Maverick,但請大家注意這些數字主要來自谷歌官方技術報告,第三方獨立複測還在路上。我自己在幾道複雜多步推理題上遇到過它中途偷懶跳步的情況,生產環境建議留好兜底和人工稽核,別被單個榜單衝昏頭。 -
Emma314—做監管行業系統的,最看重的是「資料不出域」。我們拿 Gemma 4 31B 在隔離內網裡跑合同要素抽取和風險提示,Apache 2.0 讓我們能改詞表、加行業 LoRA 而不碰許可紅線。相比閉源 API 那種黑箱,這種可審計、可微調、可完全離線的底座,對我們來說是剛需而不是可選項。 -
梅花176—創意寫作還是差 Claude 一截,寫小說別指望它。 -
realWayneBanks_pro—給新手一句忠告:Gemma 4 不是「下載 GGUF 就能無腦跑」的模型。它的 chat template、推理標籤和工具呼叫渲染特別挑後端,LM Studio 預設按 Qwen 邏輯處理會直接把思考能力搞崩。接入工作流前務必先單獨跑通模板測試,把 Jinja 和 Temperature、Top_p 調對,否則你會以為是模型笨,其實是外殼配錯了。 -
pry5tp59—做隱私優先的移動 App 選它沒錯,資料不出裝置。 -
NFTCollectorMendoza—我們把雲端 API 遷回自建 Gemma 4,按 token 燒錢的日子結束了。 -
AGomez_20214—量化版在 24G 視訊記憶體跑 31B 很順,本地 coding 體驗很好。 -
Aaron_Miller369—Vertex AI 上 31B 每百萬才 0.14 刀輸入,比閉源便宜太多。 -
irw8g00g—多詞元預測開起來提速明顯,端側體驗提升一大截。 -
Y8YCZ2X61—DiffusionGemma 那個擴散路線有意思,本地生成速度真快。 -
DanielleThompson_77—相比 Llama,Gemma 的微調生態還嫩,工具鏈得再等等。