深度報告
-
Gemma 4 是 Google DeepMind 於 2026 年 4 月 2 日釋出的最新一代開源大模型家族,基於 Gemini 3 研究和技術構建,定位為「同等引數規模下最強的開源模型」。該系列包含 E2B、E4B、26B MoE、31B Dense 四款尺寸,首次採用 Apache 2.0 許可證實現全面開源商用,31B 版本以 1452 Elo 位列 LMSYS Chatbot Arena 開源模型全球第三,僅次於 GLM-5 和 Kimi 2.5 等超大閉源模型,用不到三十分之一的引數量實現了與 600B+ 級別模型相當的智慧水平。Gemma 系列自 2024 年釋出以來累計下載已超過 4 億次,衍生超過 10 萬個變體模型。
-
Google DeepMind 在 2024 年 2 月首次釋出 Gemma 系列開放模型,此後保持每年一迭代的節奏。Gemma 4 是該系列的第三代產品,官方釋出時間為 2026 年 4 月 2 日,釋出方為 Google DeepMind,程式碼基於 Jax、Keras 等 Google 自有框架訓練。值得注意的是,Gemma 4 首次拋棄了 Google 此前慣用的專有自定義許可證,轉而採用 OSI(開放原始碼倡議)認證的 Apache 2.0 許可證,這一轉變被社群視為 Google 在開源生態中爭取開發者信任的重要訊號。Gemma 4 與 Google 閉源旗艦 Gemini 3 共享底層研究技術,是目前可以在本地硬體上執行的效能最強的 Google 開放模型。
-
Gemma 4 系列在模型架構上引入了多項創新設計,形成了與其他開源模型明顯的差異化能力。 關於模型規格與架構創新。Gemma 4 提供四款尺寸:E2B(總引數 5.1B,啟用約 2.3B)、E4B(總引數約 8B,啟用約 4.5B)、26B MoE(總引數 25.2B,啟用僅 3.8B,採用 128 專家混合專家路由)以及 31B Dense(總引數 30.7B)。其中 26B MoE 透過稀疏啟用機制實現推理速度比同等能力稠密模型提升 2.5 倍的效果。在上下文支援方面,26B 和 31B 支援最長 256K token 上下文,配合交替區域性滑動視窗注意力(區域性層 512-1024 Token)與全域性全上下文注意力,以及雙 RoPE 位置編碼(滑動視窗用標準 RoPE,全域性層用比例 RoPE),在 256K 滿載「大海撈針」測試中準確率保持在 99% 以上。逐層嵌入(Per-Layer Embedding)技術讓 E2B 量化後可壓至 1.5GB 以下,使其在移動端實現完全離線執行,Android 裝置上透過 AICore 可獲得超過 40 token/s 的推理速度。 關於核心功能。Gemma 4 支援三大核心能力:一是 Agentic Workflows,原生支援函式呼叫(Function Calling)、JSON 輸出和 System 指令,模型天生知道如何使用工具,而非透過指令跟隨事後模擬,τ2-bench 代理工具使用基準從 Gemma 3 的 6.6% 躍升至 86.4%;二是 Multimodal Reasoning,內建約 550M 引數的視覺編碼器,支援文字、影象、音訊三模態輸入,31B 版本還支援最長 60 秒影片序列輸入(目前同引數量級中唯一支援影片輸入的模型),三是多語言支援,宣稱覆蓋 140+ 語言,在多語言理解基準上大幅超越上一代。 關於部署與生態。模型權重可透過 Hugging Face、Ollama、Kaggle、LM Studio、Docker 等主流渠道獲取,訓練與部署框架支援 Jax、Vertex AI、Keras、Google AI Edge、Google Kubernetes Engine 等。安全方面,Gemma 4 模型採用與 Google 閉源模型相同的嚴格基礎設施安全協議,企業和主權組織可獲得透明的安全白皮書。
-
Gemma 4 所有尺寸版本均完全免費使用,包括商業目的。Apache 2.0 許可證允許使用者自由下載、修改和商業使用,只需保留適當的版權宣告,無需向 Google 支付任何費用,不設定使用量上限或強制 API 呼叫路徑。這一模式與 Google 傳統的雲服務變現路徑形成有趣對照——Google 透過開放免費模型擴大 Jax、Vertex AI、Google Kubernetes Engine 等自有訓練和部署框架的使用量,從而在雲服務側獲得回報。對企業而言,Apache 2.0 許可證消除了法律審查摩擦和合規風險,特別適合對模型訓練資料安全稽核有嚴格要求的金融、醫療和政府部門。
-
Gemma 4 在開發者社群引發的討論熱度極高,主要集中在三個維度的反饋。 在積極評價方面,Apache 2.0 許可證獲得了幾乎一邊倒的認可,被認為是「終於可以放心商用」的關鍵突破。Hugging Face 團隊在評測中表示,Gemma 4 開箱即用的質量「高到難以找到足夠有代表性的微調示例」,暗示該模型在預訓練階段已經吸收了足夠廣泛的能力覆蓋。多語言能力是另一大亮點,140+ 語言的支援使得 Gemma 4 在非英語任務場景中的泛化性顯著優於競品。31B 版本 Codeforces ELO 達 2150,在程式設計競賽類任務上大幅領先同類開源模型,AIME 2026 數學推理達到 89.2%,相比 Gemma 3 的 20.8% 提升了 68 個百分點。 在批評聲音方面,推理速度是最主要的槽點:26B MoE 版本實測吞吐量僅約 11 token/s,遠低於 Qwen 3.5 在同等硬體下約 60 token/s 的表現,部分原因是 Gemma 4 尚未公開確認支援 MTP(多步預測)和推測解碼等加速技術。長上下文場景下的 KV Cache 視訊記憶體壓力也是痛點:256K 滿載狀態下僅 KV Cache 就需要約 20.8 GiB 視訊記憶體,加上權重量化後仍對硬體要求較高。此外,Gemma 4 釋出初期存在一定的工程摩擦,例如特定量化版本可能出現亂碼、部分功能依賴較新的框架版本等問題。社群也對評測基準選擇的客觀性存在一定爭議,呼籲 Google 公開更多訓練資料和評測方法論。
-
Gemma 4 的釋出在開源大模型格局中激起了顯著波瀾。從競品格局看,Gemma 4 31B 與 Qwen 3.5 27B 是當前最受關注的同檔位直接競爭者,兩者均採用 Apache 2.0 協議、支援思考模式、可免費商用。在傳統閉卷基準(GPQA Diamond、LiveCodeBench)上 Qwen 3.5 小幅領先,在人類對話偏好(Arena AI Elo)上 Gemma 4 明顯勝出;在多模態特別是影片輸入支援上 Gemma 4 獨樹一幟,在超長上下文(100 萬 token)支援上 Qwen 3.5 優勢更大;在中文生態深度和工具鏈成熟度上,Qwen 3.5 仍具護城河。Gemma 4 的釋出被部分觀察者解讀為 Google 試圖透過「更開放」的姿態重新爭奪開源模型領域的話語權——此前 Google 在開源領域的動作相對保守,而 Meta 的 Llama 系列憑藉更激進的開放策略積累了更強勢的開發者生態。
-
需要理性看待 Gemma 4 的幾個潛在問題。一是評測基準的傾向性爭議,有社群聲音質疑 Google 選擇性披露對自己有利的基準資料,部分資料未完整公開,影響外界全面評估;二是訓練流程的不透明,Google 尚未完全公開 Gemma 4 的訓練資料來源、RLHF 方法論和後訓練流程,與 Llama 4 面臨類似的資訊披露壓力;三是硬體門檻的實質挑戰,31B Dense 版本在 4-bit 量化下仍需約 24GB 視訊記憶體,長上下文場景的 KV Cache 壓力使其難以在消費級 24GB 顯示卡上實現高併發;四是推理效率短板,在 MTP 加速和推測解碼等工程最佳化方面落後於 Qwen 3.5,可能影響企業選型決策。
-
強烈推薦使用 Gemma 4 的場景包括:需要多語言任務支援的開發者(特別是非英語業務,Gemma 4 在多語言理解上優勢明顯)、有強合規需求的團隊(金融、醫療、政府等需要完整安全白皮書的行業)、需要影片理解能力的多模態應用開發者(31B 是目前同引數量級唯一支援 60 秒影片輸入的模型)、演算法競賽學習者(Codeforces ELO 2150 顯著優於同類)、以及需要微調基座的企業(31B Dense 定位為微調基座,預訓練質量高)。 可能需要考慮其他選擇的情況包括:預算敏感或硬體一般的開發者(Qwen 3.5 的推理速度和量化成熟度更具成本優勢)、中文主導業務團隊(Qwen 在中文對齊上有更深的積累和完整的評測資料)、極端長上下文使用者(Qwen 3.5 的 100 萬 token 上下文視窗是 Gemma 256K 的 4 倍)、以及對推理延遲敏感的生產環境(Qwen 3.5 在 vLLM 上實測吞吐量優勢明顯)。
-
Gemma 4 是 Google 在開源大模型領域投下的一枚戰略棋子,以 Apache 2.0 全面開源、31B 引數比肩 600B+ 閉源模型效能、以及多語言和多模態的差異化能力,重塑了開源模型的價值基準。它不是所有人的「無腦遷移」首選,但在多語言理解、影片理解、合規商用等特定維度上構建了真實競爭力。對於已在 Qwen 3.5 上跑通穩定工作流的團隊,Gemma 4 目前更像一個「值得高度關注並小規模評估的備用引擎」,而非必須立刻傾囊遷移的終極答案。
使用者評論
-
SolanaSoul564_n—把本地 agent 棧從 Qwen 3.5 換到 Gemma 4 26B MoE 之後,真有點回不去了。我那臺雙 3090 跑語義路由和通用對話,原來用的 Qwen 3.5 4B 和 30B A3B,換成 Gemma 26B A4B 加 E4B 之後,多輪 agent 工作流穩得離譜,寫 Doom 光線追蹤那種 demo 也能出活。r/LocalLLaMA 那個 353 讚的遷移帖說的沒錯,本地層拼的不是榜單分數,是誰能塞進視訊記憶體、誰在量化下響應快,Gemma 的 MoE 架構天生就是為這個來的。 -
Judith_Bennett_X0—踩了個坑提醒一下:老版本 Ollama 跑 Gemma 4 直接 404,模型根本沒載入,VRAM 只佔 3MB。Gemma 4 是 2026 年 4 月才進 Ollama 的,特殊 tokenizer 舊 runner 不認,必須升到 0.20.0 以上才行。一行 curl 重灌就好,別像我一樣對著空響應排查一小時。 -
SPowellJr—說實話 Gemma 4 最炸的從來不是跑分,是 Apache 2.0。前幾代 Gemma 用的是谷歌自家許可,企業法務看了直搖頭,商用邊界模糊得很。這次直接換 Apache 2.0,商用、改、再分發全放開,零授權費,法務那套 boilerplate 現成的。對一個想私有化部署的公司來說,這比什麼 Arena 第三都實在。 -
4557pp—E2B 在手機上斷網跑翻譯,地鐵裡拍個日文藥瓶五秒出結果,太香了。 -
CHcha2024—M4 MacBook Air 上用 Ollama 跑 Gemma 4,整個過程「無聊」到讓我意外——下載、敲命令、出結果,沒有報錯沒有風扇狂轉。以前本地模型像技術災難片,這次普通朋友照步驟都能自己裝好。這種「無聊」才是真進步,說明本地 AI 終於對普通人說了句你好。 -
AlexanderMendoza_X—速度這塊得潑盆冷水。同一張 5060 Ti 16G,Gemma 4 26B MoE 才 11 tok/s,Qwen 3.5 35B A3B 輕鬆 60+,差了五六倍。而且 Gemma 向來上下文視訊記憶體吃緊,同樣量化下佔用更高。生產環境如果延遲敏感,現在還是 Qwen 更穩,等 vLLM 和 llama.cpp 的最佳化跟上再說。 -
JAdams_2023—中文還是幹不過 Qwen,寫古詩俚語照樣翻車,CJK 詞表小是硬傷。 -
PamelaMurphy_X—4090 上跑 Gemma 4 26B,持續輸出能到 160 tok/s,視訊記憶體佔 24G 出頭,溫度 50 多度,做私有程式碼解釋、寫小指令碼、初步 code review 完全夠用。複雜重構和跨倉庫規劃還是丟給雲端強模型,本地負責高頻低風險隱私任務這條分工很舒服。 -
AmandaRivera007—端側三模態是真香。E2B/E4B 原生支援文字影象音訊,手機裝個 Google AI Edge Gallery,飛航模式下照樣翻譯、看圖、寫報告,資料全留本機。不過要注意,大號的 31B/26B 反而不帶音訊能力,想離線語音得用小模型,這點產品邏輯有點反直覺。 -
CHall_20210—31B 排全球開源第三,AIME 2026 幹到 89.2%,數學直接封神。 -
i0z1zarz—內建 thinking 模式挺好用,開 <think> 之後數學邏輯明顯穩,但本地小模型開深度思考會拖到一兩分鐘,日常問答還是關掉快。另外它的多語言是真強,德語法語越南語比我試的 Qwen 3.5 還順,做全球化產品這是個實打實的加分項。 -
tfziukdfa42025—Gemma 4 31B 跑 Claude Code 真的太香了,70%日常開發任務都能Cover,月費直接省掉 -
CarterGomez_dev—手機離線跑AI終於不是噱頭了,E4B才3.2GB記憶體,實測可用 -
HaroldCooper—E4B 手機端實測!斷網真能跑,生成速度比上代快了一截,就是邏輯推理題還是拉胯 -
飛鳥639—從Gemma 3換過來,31B提升是真的猛,AIME從20%跳到89%,這幅度有點誇張 -
海角791—Apache 2.0!終於等到這一天,Google這次真的良心了,企業商用再也不用擔心法務 -
JWhite_Plus—實測26B MoE版本每秒才11個token,比Qwen 3.5慢太多了,推理速度是硬傷 -
mONIQUE927—部署了一下午終於跑起來了,分享下視訊記憶體需求:31B用4bit量化需要約24GB視訊記憶體,26B MoE約18GB,16GB顯示卡基本沒戲 -
ArthurSullivanIII510—Hugging Face直接開源下載,權重隨便用,Google這波格局開啟了 -
星辰618—已經在用Gemma 4做程式碼補全,配合Claude Code,平日寫程式碼基本不用開雲端了 -
Keith.Davis007—E4B端側實測:生成速度有明顯提升,回覆成功率也比之前高了。深度思考功能就別想了,端側模型帶不動 -
Angela_Martin_66—多語言支援140+語言是真的強,之前用Qwen做翻譯總覺得差點意思,換Gemma 4效果好很多 -
Teresa_Garcia_Pro436—打榜1452,開源第三,31B幹翻600B+模型,Google這波真猛 -
LMorales_2020—剛部署完26B MoE,配合vLLM跑,視訊記憶體佔用比我預期的低 -
Walter197—問了個草莓有幾個r,答成2個……端側小引數模型邏輯推理還是不太行 -
Rita816—26B MoE工具呼叫鏈太長容易失控,CLAUDE.md里加了限制,一次只准呼叫一個工具 -
CarterWhite—本地跑起來之後成本幾乎為零,Claude Pro月費100塊瞬間不香了 -
Pamela.Myers520—256K上下文在RAG場景太爽了,之前128K經常不夠用,現在整本書直接喂進去 -
流光682—Codeforces ELO 2150,程式設計競賽類任務直接超越Qwen 3.5,這個必須點贊 -
Lawrence.GarciaZ77—對比了下Qwen 3.5:中文任務還是Qwen強,但多語言場景Gemma 4明顯更穩