Gemma 5
谷歌 DeepMind 开放权重模型家族最新一代 Gemma 4(Apache 2.0,覆盖手机到服务器)
深度报告
-
产品速递原计划推送的条目名为「Gemma 5」,但截至本报告撰写日(2026 年 7 月 17 日),谷歌 DeepMind 尚未发布名为 Gemma 5 的模型。当前可公开获取的最新一代 Gemma 开放权重模型是 Gemma 4,于 2026 年 4 月 2 日(北京时间 4 月 3 日)发布,并采用 Apache 2.0 许可证。 本报告以可验证的 Gemma 4 为基准撰写,并在文末说明命名差异,相关产品名称与分类请由人工在后台审核决定。Gemma 4 是谷歌迄今「单位参数智能」最高的一代开放模型,覆盖从树莓派到单卡 H100 的完整算力梯度,其中 31B Dense 版本在 Arena AI 文本开源榜排名全球第三。
-
Gemma 是谷歌 DeepMind 于 2024 年 2 月推出的开放权重模型家族,技术架构与闭源旗舰 Gemini 同源。此前的 Gemma 1、2、3 代均采用谷歌自定义的「Gemma 许可证」,其中包含谷歌可单方面修改条款、下游使用边界模糊等限制,长期被开发者诟病「不算真正的开源」。 Gemma 4 是这一家族的第四代,也是一次许可证上的彻底转向:全系改用 Apache 2.0,企业可自由部署、修改、商用且无需向谷歌报备。官方称自第一代发布以来,Gemma 累计下载量已超 4 亿次,衍生变体超过 10 万个。
-
Gemma 4 一口气放出四个规格,对应四档硬件战场。E2B 与 E4B 是面向移动与物联网的「高效版」,推理时分别仅激活约 20 亿与 45 亿参数,可在 Android 手机、树莓派 5、NVIDIA Jetson Orin Nano 上完全离线、近零延迟运行,并原生支持音频输入,能直接做语音识别与理解。26B MoE 是混合专家模型,总参 260 亿、推理时仅激活约 38 亿参数,主打延迟与性价比;31B Dense 是追求最高输出质量的稠密模型,未量化版可在单张 80GB H100 上跑,量化后也能塞进消费级 GPU。 全系原生支持图像与视频(按帧)输入。上下文窗口方面,端侧 E2B、E4B 最高 128K,大模型最高 256K,足以在单次提示里喂入整个代码库或长文档。在智能体能力上,Gemma 4 原生支持函数调用、结构化 JSON 输出与系统指令,可构建能调用工具与外部 API 的多步自主智能体;官方 τ2-bench 零售智能体工具使用分数,31B 达 86.4%、26B 达 85.5%。 2026 年 6 月,谷歌又基于 Gemma 4 家族推出 DiffusionGemma——一个采用文本扩散路线的 26B MoE 模型,本地推理速度最高比自回归模型快约 4 倍(单卡 H100 超 1000 token/秒),以及面向手机与笔记本的量化版本 Gemma 4 QAT、统一的无编码器多模态模型 Gemma 4 12B。
-
Gemma 4 的权重本身完全免费,可在 Hugging Face、Kaggle、Ollama 与 ai.google.dev/gemma 直接下载,商用、修改、再分发均被 Apache 2.0 允许,没有月活上限或授权费用。 若走托管 API,Google Cloud Vertex AI 对 31B-IT 的报价约为每百万输入 token 0.14 美元、输出 0.40 美元;Groq、Together AI、Fireworks 等第三方也以每百万 0.05–0.50 美元不等的价格提供推理。换句话说,愿意自托管的团队,边际成本基本只剩一次性的硬件投入。
-
社区对 Gemma 4 的反响几乎被「换许可证」这一事件点燃。在 r/LocalLLaMA,发布后几小时内就涌现数十个讨论帖,核心情绪是「终于可以放心用了」——有人当天跑通树莓派 5 本地部署,有人在 6 小时内放出 GGUF 量化版。 2026 年 5 月,Hacker News 一条「本地 AI 应成为常态」的帖子登上榜首(1646 分、643 评论),其下高赞回复把 Gemma 4 31B 称为「本地模型的新基线」,认为它「比以往任何本地模型都更不像科学实验」。有开发者记录用 31B 在 M4 笔记本上多轮自主逆向破解一个蓝牙温度计的通信协议,全程无云往返。 也有用户在长篇文学翻译的实测中发现,本地部署的 Gemma 4 在跨章节角色一致性上稳定优于会随时间「退化」的云端 ChatGPT 与 Gemini Chat。
-
在基准层面,Gemma 4 31B 相对 Gemma 3 27B 有飞跃式提升:Arena AI 文本约 1452(开源第三),BigBench Extra Hard 从 19.3% 跳到 74.4%,AIME 2026 数学 89.2%,LiveCodeBench v6 编码 80.0%,GPQA Diamond 科学 84.3%,MMMLU 多语 88.4%。 同代横向看,31B 在 AIME 2026 与 LiveCodeBench 上略超 Meta Llama 4 Maverick(88.3% / 77.1%)与 400B 级的 Llama 4。谷歌强调的是「单位参数智能」——26B MoE 仅激活 38 亿参数,却在多个榜单击败参数量达数百亿乃至数千亿的竞品。与阿里 Qwen3、Mistral 一道,Gemma 4 被视为 2026 年开源阵营对抗闭源旗舰的核心力量之一。
-
第一,命名落差。产品速递将其标为「Gemma 5」,但官方与公开资料均显示最新一代是 Gemma 4,所谓 Gemma 5 截至撰写日并未发布。第二,基准由谷歌自报,独立第三方复测仍在进行,部分边缘模型(E2B、E4B)在 AIME 等硬任务上分数仅 37.5%–42.5%,不宜高估。 第三,社区实测反馈 Gemma 4 12B 在复杂长链工具调用上「会失忆」、忘记自己刚调用过的工具,且对推理后端配置极为挑剔,LM Studio、Ollama、llama.cpp 链路里表现忽好忽坏,普通用户并非「下载就能无脑跑」。第四,31B 在开放式创意写作、长篇小说生成等偏主观任务上,仍与 GPT-4o、Claude 等闭源模型有差距。第五,Apache 2.0 虽宽松,但端侧小模型的「移动优先」定位意味着它们在绝对能力上天然弱于大尺寸闭源旗舰。
-
Gemma 4 最适合几类人:做隐私优先移动 App、需要多模态 AI 完全在端侧运行的开发者;想把推理从云端 API 迁回自建、以控制成本与数据主权的中小企业;需要商用友好开放底座做领域微调的研究者与监管行业;以及把 AI 部署到树莓派、Jetson 等受功耗与内存约束的物联网团队。 若你要的是绝对顶级推理或庞大社区生态,Llama 3.3 70B、Qwen3 系列仍是更成熟的选择;若你要做可靠的主编排智能体,社区普遍建议让 Qwen 而非 Gemma 4 12B 来担任。对绝大多数开发者,入门命令就是 `ollama run gemma4:26b`。
-
Gemma 4 的真正价值不在某一项跑分,而在于谷歌终于把「Apache 2.0 级宽松许可 + Gemini 同源技术 + 端到端部署」这三件事拧到了一起,让前沿级 AI 第一次真正落到手机和树莓派上。至于「Gemma 5」这个标签,建议人工在后台核对后再决定更名,以免把尚未发布的一代提前挂到线上。
用户评论
-
自在_13—我们公司之前卡在 Gemma 旧许可证上一直不敢用,法务说条款能单方面改等于埋雷。这次 Apache 2.0 一出,当周就批了把客服摘要模型迁到 Gemma 4 26B 的方案,现在每月省下大几万 API 费用,关键是用户对话数据彻底留在自己机房,合规压力小了一大半。 -
TheOğuzhanKarabulut—终于换 Apache 2.0 了,前三代那个自定义许可证真的劝退,现在能放心商用。 -
GEort—在树莓派 5 上跑通 E4B,完全离线,做 IoT 助手很香。 -
SophieOuellet—说个真实踩坑:我用 Gemma 4 12B 当 OpenClaw 的主编排器,结果长链路工具调用频繁「失忆」,明明刚返回了数据库查询结果,下一轮它又去重查,上下文状态全乱。后来社区也有人反馈同样问题,结论是 12B 容量太小不适合当主脑,现在我只让它做单步多模态 SubAgent,编排交给 Qwen,世界清净了。 -
Terry.Diaz_99—31B 在 M4 本地跑很稳,这才是本地 AI 该有的样子。 -
OCmar—在 HN 上看到那篇「本地 AI 应成为常态」登顶时我挺感慨的。以前问的是「能不能本地跑」,现在问的是「为什么不直接默认本地」。Gemma 4 31B 在 M4 上 128K 上下文实测读写都跟手,蓝牙协议逆向那个案例让我意识到,很多企业的免费文本补全根本没必要 round-trip 到云端,又慢又贵又泄隐私。 -
DavidKingIII—基准是谷歌自报的,上生产前建议先小范围验证。 -
37sak—客观说,Gemma 4 在数学和代码基准上确实漂亮,AIME 2026 干到 89.2% 还略超 Llama 4 Maverick,但请大家注意这些数字主要来自谷歌官方技术报告,第三方独立复测还在路上。我自己在几道复杂多步推理题上遇到过它中途偷懒跳步的情况,生产环境建议留好兜底和人工审核,别被单个榜单冲昏头。 -
Emma314—做监管行业系统的,最看重的是「数据不出域」。我们拿 Gemma 4 31B 在隔离内网里跑合同要素抽取和风险提示,Apache 2.0 让我们能改词表、加行业 LoRA 而不碰许可红线。相比闭源 API 那种黑箱,这种可审计、可微调、可完全离线的底座,对我们来说是刚需而不是可选项。 -
梅花176—创意写作还是差 Claude 一截,写小说别指望它。 -
realWayneBanks_pro—给新手一句忠告:Gemma 4 不是「下载 GGUF 就能无脑跑」的模型。它的 chat template、推理标签和工具调用渲染特别挑后端,LM Studio 默认按 Qwen 逻辑处理会直接把思考能力搞崩。接入工作流前务必先单独跑通模板测试,把 Jinja 和 Temperature、Top_p 调对,否则你会以为是模型笨,其实是外壳配错了。 -
pry5tp59—做隐私优先的移动 App 选它没错,数据不出设备。 -
NFTCollectorMendoza—我们把云端 API 迁回自建 Gemma 4,按 token 烧钱的日子结束了。 -
AGomez_20214—量化版在 24G 显存跑 31B 很顺,本地 coding 体验很好。 -
Aaron_Miller369—Vertex AI 上 31B 每百万才 0.14 刀输入,比闭源便宜太多。 -
irw8g00g—多词元预测开起来提速明显,端侧体验提升一大截。 -
Y8YCZ2X61—DiffusionGemma 那个扩散路线有意思,本地生成速度真快。 -
DanielleThompson_77—相比 Llama,Gemma 的微调生态还嫩,工具链得再等等。