Gemma 5

最新世代の Google DeepMind オープンウェイト モデル ファミリー Gemma 4 (Apache 2.0、携帯電話からサーバーまでをカバー)

詳細レポート

  • Product Express が当初プッシュする予定だったアイテムは「Gemma 5」と呼ばれていましたが、このレポートの執筆日 (2026 年 7 月 17 日) の時点で、Google DeepMind はまだ Gemma 5 という名前のモデルをリリースしていません。 現在公開されている最新世代の Gemma オープンウェイト モデルは Gemma 4 で、2026 年 4 月 2 日 (北京時間 4 月 3 日) にリリースされ、Apache 2.0 ライセンスに基づいてライセンスされています。 このレポートは検証可能な Gemma 4 に基づいて書かれており、命名の違いについては記事の最後で説明されています。関連する製品名と分類は、バックグラウンドで手動で確認して決定する必要があります。 Gemma 4 は、これまでで最高の「ユニット パラメーター インテリジェンス」を備えた Google 世代のオープン モデルで、Raspberry Pi からシングル カード H100 までの完全なコンピューティング能力勾配をカバーします。 31B Dense バージョンは、Arena AI テキスト オープンソース リストで世界 3 位にランクされています。

  • Gemma は、Google DeepMind が 2024 年 2 月に発売したオープンウェイト モデルのファミリーです。その技術アーキテクチャは、クローズドソースのフラッグシップである Gemini と同じです。以前の Gemma 1、2、および 3 世代はすべて、Google がカスタマイズした「Gemma ライセンス」を使用していました。これには、Google が一方的に条件を変更できることや、下流の使用境界があいまいになることなどの制限が含まれていました。これは長い間開発者から「真のオープンソースではない」と批判されてきました。 Gemma 4 はこのファミリーの第 4 世代であり、ライセンスの完全な移行でもあります。システム全体が Apache 2.0 に切り替わり、企業は Google に報告することなく自由に導入、変更、商用利用できるようになります。関係者によると、Gemma は第 1 世代のリリース以来、4 億回以上ダウンロードされ、10 万以上の派生版が存在します。

  • Gemma 4 は、4 つのレベルのハードウェア戦場に対応する 4 つの仕様を一度にリリースします。 E2B と E4B は、モバイルおよびモノのインターネット向けの「高効率バージョン」です。推論中にそれぞれ約 20 億と 45 億のパラメーターのみがアクティブになります。これらは、Android スマートフォン、Raspberry Pi 5、および NVIDIA Jetson Orin Nano 上で、ほぼゼロの遅延で完全にオフラインで実行できます。音声入力をネイティブにサポートし、音声認識と理解を直接実行できます。 26B MoE は、合計 260 億のパラメータを備えたハイブリッド エキスパート モデルで、推論中にアクティブになるパラメータはわずか約 38 億です。レイテンシと費用対効果に重点を置いています。 31B Dense は、最高の出力品質を追求した高密度モデルです。量子化されていないバージョンは、単一の 80GB H100 で実行できます。量子化後は、民生用 GPU に接続することもできます。 システム全体が画像およびビデオ (フレーム単位) 入力をネイティブにサポートします。コンテキスト ウィンドウに関しては、エンドサイド E2B および E4B の最大サイズは 128K、大規模モデルの最大サイズは 256K です。これは、コード ベース全体または長いドキュメントを 1 つのプロンプトにフィードするのに十分なサイズです。 In terms of agent capabilities, Gemma 4 natively supports function calls, structured JSON output and system instructions, and can build multi-step autonomous agents that can call tools and external APIs;公式の τ2 ベンチ小売エージェント ツール使用スコアは、31B で 86.4%、26B で 85.5% に達しています。 2026 年 6 月、Google は Gemma 4 ファミリーに基づく DifffusionGemma を立ち上げました。これは、テキスト拡散ルートを使用した 26B MoE モデルです。ローカル推論速度は、自己回帰モデル (1 枚のカード H100 で 1000 トークン/秒を超える) よりも最大約 4 倍高速です。また、携帯電話およびノー​​トブック向けの定量化バージョンである Gemma 4 QAT、および統合エンコーダーレス マルチモーダル モデル Gemma 4 12B よりも高速です。

  • Gemma 4 のウェイトは完全に無料で、Hugging Face、Kaggle、Ollama、ai.google.dev/gemma から直接ダウンロードできます。 Apache 2.0では商用利用、改変、再配布がすべて許可されており、月額上限やライセンス料はありません。 マネージド API を使用する場合、Google Cloud Vertex AI の 31B-IT の見積もりは、100 万入力トークンあたり約 0.14 米ドル、100 万出力あたり約 0.40 米ドルです。 Groq、Togetter AI、Fireworks などのサードパーティも、100 万あたり 0.05 ~ 0.50 米ドルの範囲の価格で推論を提供します。言い換えれば、自己ホストするチームにとって、限界コストは基本的に 1 回限りのハードウェア投資だけです。

  • Gemma 4 に対するコミュニティの反応は、「ライセンス変更」事件によってほぼ火がつきました。 r/LocalLLaMA では、リリースから数時間以内に数十のディスカッション スレッドが立ち上がりました。中心的な感情は「ついに安心して使用できるようになった」というものでした。同日、誰かが Raspberry Pi 5 のローカル デプロイメントを実行し、誰かが 6 時間以内に GGUF の定量版をリリースしました。 2026 年 5 月、Hacker News の投稿「ローカル AI が標準になるべき」がリストのトップになりました (1646 ポイント、643 コメント)。高く評価された回答は、Gemma 4 31B を「ローカル モデルの新しいベースライン」と呼び、「これまでのローカル モデルほど科学的実験ではない」と考えていました。開発者は、31B を使用して、M4 ノートブック上の Bluetooth 温度計の通信プロトコルを複数回にわたって独立してリバース エンジニアリングしたことを記録し、プロセス全体は雲ひとつありませんでした。 また、一部のユーザーは、長編文学翻訳の実際のテストで、時間の経過とともに「劣化」するクラウドベースの ChatGPT や Gemini Chat よりも、ローカルに展開された Gemma 4 の方が章間の文字の一貫性がより安定していることを発見しました。

  • ベンチマーク レベルでは、Gemma 4 31B は Gemma 3 27B に比べて大幅に改善されています。Arena AI テキストは約 1452 (オープンソースで 3 番目)、BigBench Extra Hard は 19.3% から 74.4% にジャンプ、AIME 2026 数学 89.2%、LiveCodeBench v6 エンコーディング 80.0%、GPQA ダイヤモンド サイエンス 84.3%、MMMLU 多言語88.4%。 同世代を水平方向に見ると、AIME 2026 および LiveCodeBench では、31B が Meta Llama 4 Maverick (88.3% / 77.1%) および 400B レベルの Llama 4 をわずかに上回りました。 Google は「ユニット パラメータ インテリジェンス」を強調しています。26B MoE は 38 億のパラメータのみを有効にしていますが、多くのリストにある数百億、さらには数千億のパラメータを備えた競合製品を打ち負かしています。 Ali Qwen3 や Mistral とともに、Gemma 4 は、2026 年のクローズドソースの旗艦に対抗するオープンソース陣営の中核勢力の 1 つとみなされています。

  • まず、ネーミングのギャップ。 Product Express では「Gemma 5」と表示されていますが、公式および公開情報によると、最新世代は Gemma 4 です。いわゆる Gemma 5 は、この記事の執筆時点ではリリースされていません。第二に、ベンチマークは Google によって自己報告されており、独立したサードパーティによる再テストが現在も継続中です。一部のエッジ モデル (E2B、E4B) では、AIME などの難しいタスクのスコアが 37.5% ~ 42.5% しかありませんが、過大評価すべきではありません。 第三に、コミュニティの実際のテスト フィードバックによると、Gemma 4 12B は複雑なロングチェーン ツールを呼び出すときに「メモリを失い」、呼び出したばかりのツールを忘れてしまい、推論バックエンドの構成に非常にうるさいことが示されています。 LM Studio、Ollama、および llama.cpp リンクのパフォーマンスに一貫性がありません。一般のユーザーは「何も考えずにダウンロードして実行する」ことはできません。第 4 に、31B は、オープンエンドの創造的な執筆や小説の生成などの主観的なタスクにおいて、GPT-4o や Claude などのクローズドソース モデルに依然として遅れをとっています。第 5 に、Apache 2.0 は緩いですが、小規模なエンドサイド モデルの「モバイル ファースト」の位置付けは、その絶対的な機能が大型のクローズドソース フラッグシップよりも当然弱いことを意味します。

  • Gemma 4 は、いくつかのタイプの人々に最適です。プライバシーを最優先したモバイル アプリを作成し、マルチモーダル AI をデバイス側で完全に実行する必要がある開発者。コストとデータ主権を管理するために、推論をクラウド API から自社構築に戻したいと考えている中小企業。ドメインの微調整のための商用に適したオープンベースを必要とする研究者や規制業界。 Raspberry Pi、Jetson、および電力消費とメモリの制約を受けるその他の IoT チームに AI を導入する IoT チーム。 完全にトップレベルの推論や巨大なコミュニティ エコシステムが必要な場合は、Llama 3.3 70B および Qwen3 シリーズがさらに成熟した選択肢です。信頼できるメイン オーケストレーション エージェントになりたい場合、コミュニティでは通常、Gemma 4 12B の代わりに Qwen を使用することを推奨します。ほとんどの開発者にとって、開始コマンドは「ollama run gemma4:26b」です。

  • Gemma 4 の真の価値は、特定の実行スコアにあるのではなく、Google が「Apache 2.0 の緩いライセンス + Gemini の類似テクノロジー + エンドツーエンドの展開」の 3 つを最終的に組み合わせて、最先端の AI を初めて携帯電話や Raspberry Pi で実際に利用できるようにしたという事実にあります。 「Gemma 5」というラベルについては、未リリースの世代を事前にオンラインに公開しないように、名前の変更を決定する前にバックグラウンドで手動でチェックすることをお勧めします。

ユーザーレビュー

  • 头像
    AnnSchuster
    Gemma 5 世代のローカル展開エクスペリエンスは非常に改善されました。私はコード補完に第 4 世代 26B MoE を使用していました。第5世代に切り替えてからは応答速度がスムーズになり、特にPythonとC++のコード生成精度が格段に上がったように感じます。しかし、中国語理解は依然として古い問題です。中国語のプロンプトを作成すると、英語のロジックと中国語での回答が表示されることがあります。将来的には語彙リストが最適化されることを願っています。

  • 头像
    AdamHarris_2021
    今回Googleはオープンソースに対して実に寛大だ。 Apache 2.0 プロトコルは権限を直接委任し、商用利用さえ制限しません。 「オープンソースだが商用利用には申請が必要」という一部のメーカーに比べ、そのパターンはすぐに開けた。 Gemma 5 は現地の AI 開発者にとってのインフラになると思います。

  • 头像
    Raymond237
    正直に言うと、Gemma 5 のマルチモーダル機能が十分に活用されていません。オーディオおよびビジュアル入力をネイティブにサポートするのは良いことですが、複雑な画像を実際に認識する精度は依然として残念です。ただし、テキスト生成の品質は、同じパラメータの中で確かに最高です。

  • 头像
    Denise_KellyJr
    ラップトップで Gemma 5 の 12B 量子化バージョンを実行しました。 16 GB のメモリは完全に十分であり、推論速度は約 30 ~ 40 トークン/秒です。正直に言うと、このパラメーターの量が生み出す効果は少し予想外です。テキストの要約と単純なコード補完には完全に十分です。重要なのは、完全にオフラインで実行され、データをアップロードする必要がないため、プライバシーが非常に安全であることです。

  • 头像
    Susan_RobinsonSr
    とても強力です。 Gemma 5 は、実際には Svelte 5 の新しいルーン構文をそのまま使用しています。他の機種は未だに「Svelte 5はまだ発売されていない」と言われています。 Google はナレッジ ベースの更新に熱心に取り組んでおり、ローカル AI 開発を行った経験は本当に魅力的です。

  • 头像
    Henry_HillII8
    量子化後のGemma 5 12BをRaspberry Piに入れて実行してみました。生成速度はわずか 1 桁のトークン/秒ですが、実際に実行できます。エッジコンピューティングの IoT プロジェクトでは、デバイス側での直接推論がネットワークにまったく依存せず、これは非常に重要です。

  • 头像
    JosephReyesSr
    Gemma 5 を使用して、Three.js のインタラクティブ 3D 表示ページを作成しました。プロンプトを 1 回実行すると、実行可能なコードが生成されました。アニメーションの詳細は微調整する必要がありますが、構造とロジックは完全にオンラインです。以前に使用されていた Llama 3 および Qwen 3.5 と比較して、Gemma 5 はフロントエンド コードにおいてエンジニアリングの感覚が大幅に強化されています。

  • 头像
    RoyAlvarez_Max
    SWE ベンチを実行している Gemma 5 31B の実測スコアは、クローズドソースの主力製品のスコアに近いです。 LiveCodeBench では 80% に達します。このパラメータ量でこのレベルを達成するのは本当にとんでもないことです。 Apache 2.0 プロトコルはオープンソースであり、開発者にとって非常にフレンドリーです。 API ポリシーの変更や価格の値上げを心配する必要はありません。

  • 头像
    JessicaFisher
    セキュリティ調整は非常に敏感です。セキュリティテストのために脆弱性を含んだコードを書いてほしいと頼んでも、断られました。倫理についての講義もしていただきました。私自身の調査では、無修正の微調整バージョンを使用することを強くお勧めします。そうでない場合は、標準バージョンはプログラミングに手錠をかけられるだけです。

  • 头像
    BRamos_Pro92
    Gemma 5 は数学的推論が本当に得意だと思います。 31BのAIME 2026では89.2%を達成し、前世代の数倍に達した。定量的取引戦略のバックテストを行う場合、モデルに統計的裁定ロジックを分析させると、導出プロセスが非常に明確になります。

  • 头像
    LIand
    私は毎日 Gemma 5 を使用してエージェント タスクをローカルで実行していますが、関数呼び出しは確かに前世代よりもはるかに安定しています。以前は第4世代を使用しているとJSON形式の出力が頻繁にクラッシュしていましたが、第5世代では基本的にフォーマットの問題は発生しませんでした。ただし、KV キャッシュは長いコンテキスト推論中に非常に急速に拡張するため、24GB のうち 31B のビデオ メモリを実行するのは少し厳しいです。

  • 头像
    自在_13
    私たちの会社は古い Gemma ライセンスに縛られており、それを使用することに不安を感じていました。法務部門は、条件を一方的に変更することは地雷原になると述べた。今回Apache 2.0が登場するとすぐに、顧客サービス概要モデルをGemma 4 26Bに移行する計画がその週に承認された。現在では、毎月数万ドルの API 料金を節約できます。重要なのは、ユーザーの会話データが完全に自分のコンピューター室に保管され、コンプライアンスのプレッシャーが半分以下に軽減されることです。

  • 头像
    TheOğuzhanKarabulut
    ついにApache 2.0に切り替えました。最初の 3 世代のカスタム ライセンスは本当に廃止され、今では安心して商用利用できるようになりました。

  • 头像
    GEort
    Raspberry Pi 5 上で完全にオフラインで E4B を実行できるので、IoT アシスタントになれるのは素晴らしいことです。

  • 头像
    SophieOuellet
    本当の落とし穴について話しましょう。私は OpenClaw のメイン オーケストレーターとして Gemma 4 12B を使用しました。その結果、長いリンクのツール呼び出しにより、記憶喪失が頻繁に発生しました。データベース クエリの結果が返されたばかりであることは明らかで、次のラウンドで再チェックされたところ、コンテキスト ステータスが完全に台無しになっていました。その後、コミュニティの誰かが同じ問題を報告し、12B の容量はメインの頭脳としては小さすぎると結論付けました。今では、シングルステップのマルチモーダル サブエージェントを実行するためにのみ使用し、オーケストレーションは Qwen に任せており、世界はクリーンです。

  • 头像
    Terry.Diaz_99
    31B はローカルの M4 上で非常に安定して動作します。これがローカル AI のあるべき姿です。

  • 头像
    OCmar
    HNの「ローカルAIは当たり前になるべき」という記事がトップになったのを見て、かなり感動しました。以前は「ローカルで実行できるか?」という疑問があったが、今では「なぜデフォルトでローカルにしないのか?」という疑問が生じている。 Gemma 4 31B は、M4 上で 128K コンテキストを読み書きできます。 Bluetooth プロトコルのリバース エンジニアリングの事例を見て、多くの企業では、時間がかかり、高価で、プライバシーが漏洩するクラウドへの往復の自由テキスト補完が必要ないことに気づきました。

  • 头像
    DavidKingIII
    ベンチマークは Google によって自己報告されており、本番環境に入る前に小規模で検証することをお勧めします。

  • 头像
    37sak
    客観的に言えば、Gemma 4 は数学とコードのベンチマークの点で確かに美しいです。 AIME 2026 は 89.2% を達成し、Llama 4 Maverick をわずかに上回りました。ただし、これらの数値は主に Google の公式技術レポートから得られたものであり、サードパーティによる独立した再テストがまだ途中であることに注意してください。私自身、複雑な複数ステップの推論問題で、途中のステップがスキップされてしまう問題にいくつか遭遇しました。運用環境では、単一のリストに惑わされないよう、注意深く監視し、手動でレビューを実施することをお勧めします。

  • 头像
    Emma314
    規制業界のシステムに携わる人々は、「データがドメインの外に出ない」ことを最も重視しています。 Gemma 4 31B を使用して、隔離されたイントラネットで契約要素の抽出とリスク警告を実行します。 Apache 2.0 では、許可の赤い線に触れずに語彙を変更し、業界 LoRA を追加できます。クローズド ソース API のブラック ボックスと比較すると、この種の監査可能、微調整可能、完全にオフラインのベースは、オプションではなく、私たちにとって必須です。

  • 头像
    梅花176
    創造的な文章はまだクロードほど上手ではないので、小説を書くときはそれに当てにしないでください。

  • 头像
    realWayneBanks_pro
    初心者へのアドバイス: Gemma 4 は、「何も考えずに GGUF をダウンロードして実行するだけ」のモデルではありません。そのチャット テンプレート、推論タグ、およびツール呼び出しレンダリングは、特にバックエンド指向です。 LM Studio のデフォルトは Qwen ロジック処理ですが、これは思考能力を直接破壊します。ワークフローに接続する前に、必ずテンプレート テストを個別に実行し、Jinja、Temperature、および Top_p を調整してください。そうしないと、モデルが愚かであると思われるでしょうが、実際にはシェルが一致していません。

  • 头像
    pry5tp59
    データがデバイスの外に流出しないため、プライバシーを最優先するモバイル アプリには正しい選択です。

  • 头像
    NFTCollectorMendoza
    私たちはクラウド API を自社構築の Gemma 4 に戻し、トークンに基づいてお金を燃やす時代は終わりました。

  • 头像
    AGomez_20214
    量子化バージョンは 31B の 24G ビデオ メモリでスムーズに動作し、ローカル コーディング エクスペリエンスは非常に優れています。

  • 头像
    Aaron_Miller369
    Vertex AI への 310 億の入力のコストは 100 万あたりわずか 0.14 ドルで、クローズド ソースよりもはるかに安価です。

  • 头像
    irw8g00g
    複数単語の予測を有効にすると大幅に高速になり、クライアント側のエクスペリエンスが大幅に向上します。

  • 头像
    Y8YCZ2X61
    DiffusionGemmaの拡散ルートは面白く、ローカル生成のスピードも本当に速いです。

  • 头像
    DanielleThompson_77
    Llama と比較すると、Gemma の微調整エコシステムはまだ若いため、ツールチェーンは待たなければなりません。