谷歌Gemma 4全系开源:31B逼近闭源前沿,端侧离线跑通原生多模态
云端溢价要被敲钟了
7月初,Google DeepMind 悄悄放出了一颗「炸弹」——Gemma 4 技术报告解封,全系模型以 Apache 2.0 协议彻底开源。这不是一次普通的版本更新。31B 的旗舰版本在复杂数学、前沿科学和真实 Agent 工具调用上,已经能正面挑落比自己大数倍的闭源模型;更小的 12B、2.3B、4.5B 版本,则把「深度思考」和「原生多模态」直接塞进了笔记本和手机。
先说最反直觉的一点。过去做多模态大模型,行业通行的做法是「胶水架构」:先挂一个几亿参数的视觉编码器(比如 CLIP)把图片翻成向量,再挂一个音频编码器(比如 Whisper)把声音翻成向量,最后才塞进大语言模型。Gemma 4 干的事,是把这两个「翻译官」直接砍了,只留一个 35M 参数的极简投影层,把原始图像的像素块、原始音频 40 毫秒的波形块,直接投影进同一个 Transformer 的统一空间。模型不再需要中间人转述,它用同一颗「大脑」同时「看」「听」「想」。
这意味着什么?一台 16GB 显存的 MacBook,甚至一块 Jetson Nano、树莓派 5,就能本地实时跑通「音画文」三位一体的交互。你不必再把音视频流打包,跨越几千公里送到云端;也不用担心网络抖动、带宽限制,或者隐私合规的铁拳。数据 100% 不出本地,延迟趋近于零,硬件买一次之后边际成本几乎为零。对很多做实时应用的团队来说,这套账很好算。
更狠的是「思考」这件事也被下放了。过去从 OpenAI o1 到 DeepSeek R1,慢思考一直是云端巨头的护城河——模型要在回答前做上百次自我审视,烧的是真金白银的 Token。Gemma 4 用一个简单的 <|think|> 控制符,把这套机制原生带到了 2.3B、4.5B 这样的端侧尺寸上。DeepMind 还配套了多 Token 预测草稿模型与量化感知训练,让本地深度思考不仅质量高,等待时间也大幅缩短。换句话说,一个几B参数的小模型,也能在离线状态下「想明白」再开口。
把视线拉远一点,这背后是谷歌在「开放权重」这场焦土战争里的又一步。Hugging Face 的 CEO Clem Delangue 最近就在公开场合提到,越来越多财富 500 强公司不想再「租用」AI,随着推理成本推高,它们正转向开放权重。Gemma 4 选在最宽容的 Apache 2.0 下全量开源,等于直接打穿了「好模型锁在 API 后面、按 Token 收费」的云端暴利模式。和 Meta 的 Llama 社区许可相比,Apache 2.0 在商用上更自由,这对开发者的吸引力是实打实的。
我的看法是,端侧 AI 的拐点可能比很多人预期来得更快,但它不会立刻杀死云端。 真正会被重构的,是「什么必须上云、什么留在本地」的分工——敏感数据、实时交互、长尾场景会迅速端侧化,而超大规模协同训练仍离不开云端。对普通用户来说,最实在的判断是:接下来选设备、选工具,可以开始把「能不能本地跑一个够用的模型」当成硬指标。智能要是能离线、能私有、能塞进口袋,我们向云端缴的「智商税」,确实该重新算一笔账了。