AI21 Jamba2
以色列 AI21 Labs 推出的开源混合 SSM-Transformer 模型家族,主打企业级可靠性与 256K 长上下文的内存效率
詳細レポート
-
Jamba2 は、イスラエルの AI 企業 AI21 Labs が 2026 年 1 月 8 日に発表した第 2 世代のオープンソース モデル ファミリです。チャートのトップに立つような極端なインテリジェンスではなく、エンタープライズ レベルの「信頼性」と「制御性」に重点を置いています。 AI21 の特徴的なハイブリッド アーキテクチャを継承しており、Mamba 状態空間モデル (SSM) と Transformer アテンション レイヤーを織り交ぜて、よりメモリを節約した方法で 256K の長いコンテキストを消費します。このファミリーには 2 つのサイズがあります。1 つは携帯電話に収まる 3B 高密度モデル、もう 1 つは 12B アクティベーションと 52B 総ボリュームの Mini (MoE) です。どちらも Apache 2.0 プロトコルを使用して重量をオープンします。そのセールスポイントは非常に明確です。企業が最も重視する注文コンプライアンスと「グラウンディング」の 2 つの点でクラスのリーダーとなり、同時に長時間にわたる文書処理のコストを削減することです。 Jamba2 のリリースが、AI21 自体が資金調達の失敗、60% の人員削減、戦略変更などを経験した激動の時期と一致したことは注目に値します。これは、技術的に優れたこのモデルに現実の影を落としました。
-
AI21 Labs は 2017 年 11 月に設立され、イスラエルのテルアビブに本社を置いています。同社の創設者 3 人は定評のある人物です。スタンフォード CS 名誉教授で元 Google の主任研究員であるヨアヴ・ショーハム、連続起業家のオリ・ゴーシェン、そしてモービルアイの共同創設者アムノン・シャシュアです (モービルアイはインテルに 153 億ドルで買収されました)。同社は初期に Wordtune ライティング アシスタントと Jurassic シリーズのモデルからスタートしました。 2024 年 3 月、業界初の実稼働レベルのハイブリッド Mamba-Transformer オープンソース モデルである Jamba でその名を轟かせました。 資金調達に関しては、AI21は総額約3億3,600万米ドルの資金調達を確認した。 2023年8月の1億5500万米ドルのシリーズCラウンドでは戦略的投資家としてGoogleとNvidiaが導入され、評価額は一時14億米ドルに達した。しかし、同社は2025年から2026年にかけて苦境に陥った。噂されていたGoogleとNvidiaとの3億米ドルのシリーズDは正式に決着することはなく、Nvidiaによる20億〜30億米ドルの買収交渉も失敗に終わった。その後の Nebius との買収交渉は 2026 年 5 月に終了しました。同社は商業的バックボーンとして Maestro オーケストレーション プラットフォームに注目し(年間収益約 5,000 万ドル)、従業員の 60% 以上を削減(約 180 人から約 70 人に)する一方、独立したモデル販売事業を中止しました。イスラエルのテクノロジーメディアCalcalistは、これを「ユニコーンからサバイバルモードへの転落」と表現した。
-
Jamba2 の主要な技術的違いは、SSM-Transformer ハイブリッド アーキテクチャです。純粋な Transformer が長いテキストを処理する場合、コンピューティング能力はコンテキストの長さの 2 乗に応じて増加しますが、Mamba レイヤーは線形の複雑さを持ちます。 AI21 は、シーケンス処理の大部分を Mamba に任せ、全体的な注意が本当に必要な Transformer レイヤーのみを保持します。その結果、256K コンテキスト ウィンドウのメモリ使用量は、従来の 128K Transformer のメモリ使用量よりもさらに低くなります。サードパーティのレビューでは一般に、同スケールの純粋な Transformer よりもビデオ メモリを約 40% 節約し、生成が約 30% 高速であると述べています。 機能的な位置付けの点では、AI21 は Jamba2 を意図的に「思考トークンを消費しない信頼できるツール」にし、複雑な複数ステップの推論ではなく、正確な質疑応答、文書処理、情報抽出、要約草案などのエンタープライズ ナレッジ ワークフローに特化しています。 IFBench、IFEval、Collie、FACTS 事実ベンチマークなどの指示準拠ベンチマークで優れたパフォーマンスを発揮しました。同関係者はまた、Jamba2 Mini と Ministral3 14B について人間によるブラインド評価を実施し、エンタープライズ タスクの全体的な品質と勝率において統計的に有意な利点があると主張しました。今回は3Bの濃密バージョンが目玉です。 iPhone、Android、Mac、PC 上で実際に実行でき、品質を損なうことなくエンドサイド RAG に使用できます。 Mini バージョンは、24 GB のビデオ メモリを備えたコンシューマー グレードの GPU に展開できます。このモデルは、英語、スペイン語、フランス語、ポルトガル語、イタリア語、オランダ語、ドイツ語、アラビア語、ヘブライ語の合計 9 言語をサポートしています。このナレッジは 2024 年 8 月まで利用可能で、AI21 Studio および Hugging Face でダウンロードできます。
-
Jamba2 は、「オープンソースの重み + マネージド API」の 2 つのトラックをたどります。セルフホスティングは完全に無料です。 Apache 2.0 プロトコルでは無制限の商用利用が許可されており、重みは Hugging Face に掛けられています。インフラストラクチャを自分で構築したくない場合は、AI21 のホスティング API を使用してトークンごとに請求できます。企業顧客は、SLA 保証と微調整サービスを購入することもできます。参考までに、主力の Jamba Large 1.7 の API 価格は、入力トークン 100 万個あたり約 2 ドル、出力トークン 8 ドルで、GPT や Claude の長いコンテキスト処理よりも安価ですが、Jamba2 シリーズの 2 つの小型モデルは、自己展開ルートを選択して API コストを完全に節約するのにより適しています。対象となるユーザーは、コストやデータプライバシーを重視し、自社の VPC またはローカルでモデルを実行したい企業、特に金融、防衛、医療などの規制業界の企業です。ただし、親会社は独立したモデルの販売を停止し、Maestro オーケストレーション プラットフォームに全面的に賭けていることを思い出してください。ジャンバはむしろ技術的な資産と排水として存在します。
-
開発者コミュニティによる Jamba2 の総合評価は「実用的な評価」です。肯定的な声は次の 3 つの点に集中しています。ハイブリッド アーキテクチャは、2026 年にオープンソース ハイブリッド モデルを本格的に実装する数少ないファミリーの 1 つです (よく比較されるもう 1 つは IBM Granite 4 です)。また、ロング コンテキストのメモリ効率は実質的な経済的利点です。 3B バージョンは、携帯電話やラップトップ上で使用可能な品質で実行でき、エンドサイドの導入当事者は非常に満足しています。 Mini バージョンはコンシューマー グレードの GPU で使用でき、H100 クラスターを持たない小規模チームに適しています。一部のレビューでは 8.0/10 のスコアが付けられており、価値ポイントは 9/10 に達します。 否定的なフィードバックも非常に直接的です。最も集中的な不満は、絶対的な機能が最初の階層にないということです。52B Mini は、主流の推論ベンチマークで、DeepSeek、GLM、および Qwen の同レベルのモデルに勝つことができません。中レベルのトレーニングには 5,000 億トークンのみが使用されます (主要なオープンソース モデルは簡単に数兆に達する可能性があります)。したがって、一般知識の範囲と多言語の範囲は限られています。英語は得意ですが、他の言語では平均的です。エコロジーには欠点もあります。Qwen、Llama、DeepSeek と比較して、サードパーティによる微調整されたバージョンが少ないことです。 Ollama と llama.cpp のサポートは追いつきつつありますが、まだ遅れています。ツール チェーンが純粋な Transformer パイプラインに関連付けられている場合、Jamba を実行している SSM レイヤーは追加の適応作業を行う必要があります。
-
Jamba2 に対する業界メディアの論調は一貫しています。これは「最も賢い人」を対象としたモデルではなく、「効率と信頼性」に特化したモデルです。多くのレビューでは、「頭脳を引き換えにスピードを得る」長い文脈の専門家として説明されています。これは、高スループットのドキュメント パイプラインには適していますが、創造的な文章、複雑な推論チェーン、および複雑なプログラミングには適していません。ある評論家はこれを 7.3/10 と評価し、「今年最も興味深いアーキテクチャ上の革新」と呼びましたが、生のインテリジェンスという点では最先端のモデルと真っ向から競合するものではないとも強調しました。アナリストは一般に、AI21 の差別化はスケールの積み重ねではなくアーキテクチャの革新にあると考えています。業界が成熟し、純粋な拡大の余地が減少していた時代には、これは貴重なルートだったはずです。残念なことに、同社の商業化と資本問題が妨げとなっています。
-
最大のリスクはモデル自体にあるのではなく、会社にあります。 2025 年から 2026 年にかけて、AI21 は資金調達の失敗、2 回の買収交渉、60% の人員削減、およびモデル販売からオーケストレーション プラットフォーム販売への戦略の転換により、激しい混乱を経験しました。当局は明らかに独立モデルの販売を停止した。これは、長期的な研究開発投資とその後の Jamba シリーズの反復に不確実性があることを意味します。企業が主要なワークフローでそれに依存している場合、「上流側がアップデートの提供を停止するかどうか」という問題を評価する必要があります。 Apache 2.0 の重みはオープンソース化され、セルフホスティングは廃止されませんが、メーカーによる継続的な最適化とサポートがなければ、その価値は低下します。 技術的な論争は「能力の上限」です。確かに、ハイブリッド アーキテクチャはメモリを節約し、高速に実行されますが、SSM 層の情報の逐次処理の特性により、グローバル パターン キャプチャを必要とする複雑な推論が困難になりやすくなります。複数の独立した評価では、GPQA、プログラミング、エージェント タスクの点で、同じ価格帯では弱いことが指摘されています。また、エコシステムが薄く、サードパーティ製のツールも少ないため、実際の導入においては摩擦が避けられません。
-
Jamba2 は 3 つのタイプの人々に適しています。1 つは、長いコンテキストの RAG システムに取り組んでいるチームで、256K のコンテキストと制御可能なメモリがスイート スポットに留まっているチームです。 2 つ目は、モバイル デバイスとエッジ デバイスを展開したい開発者です。3B バージョンのハイブリッド効率は実際に携帯電話で実現できます。 3 つ目は、非 Transformer アーキテクチャを試し、Apache 2.0 商用セキュリティ ゾーンに留まりたいと考えているチーム、特にデータ プライバシーを重視し、GDPR だけでなく民間展開を必要とする金融、医療、防衛企業です。ヨーロッパおよびイスラエルの顧客のコンプライアンスと地理的位置。 不適切なシナリオも明らかです。コードを記述し、複雑な複数ステップの推論を実行し、クリエイティブな執筆に従事できる一般的なメイン モデルが必要な場合は、Claude、GPT、および Qwen や DeepSeek などの主要なオープン ソース モデルがより安定した選択肢となります。同様のハイブリッド アーキテクチャを追求している場合は、代わりに IBM Granite 4 を検討することもできます。オープンソースの包括的な機能を追求している場合は、Qwen、Llama、DeepSeek を検討してください。
-
Jamba2 は、「優れたアーキテクチャ、平凡な機能、そして憂慮すべき企業の見通し」を備えたモデルです。ロングコンテキストの効率性とエンドサイドの展開という点で真の価値を提供しますが、インテリジェンスの第一段階にあるわけではありません。さらに、親会社は変革の渦中にあり、独立したモデルの販売を停止しました。このため、優れた技術を備えたこの製品は、長期にわたって期待できる生産の主力というよりは、AI21 ハイブリッド アーキテクチャ ルートの美しい脚注のようなものになります。ビデオ メモリを節約し、長いドキュメントを実行し、クライアント側 RAG を実行したいチームは、試してみる価値があります。長期にわたる安定した反復と最先端の機能が必要な場合は、他の場所を探す必要があります。
ユーザーレビュー
-
Terryr11—Jamba2 Mini を使用して社内契約 Q&A 用の RAG を作成しました。 256K コンテキストは本当に優れています。数十ページにわたる売買契約書を、切らずにそのまま挿入できます。返される回答は基本的に原文に従うことができます。確かにアースが強みで、以前使用していた小型モデルよりもはるかに信頼性が高くなります。 -
z4ebma3np—3B バージョンは実際に私の M2 Mac 上で直接実行でき、クライアント側のナレッジ ベース検索の品質は低下しません。これはまったく予想外のことです。通常、小型の高密度モデルの品質は圧縮されると崩壊しますが、実際には基本的なコマンドの追従と接地を維持できます。ローカル RAG が装備されている場合は、オフラインでドキュメントをクエリすることもできます。プライバシーが重視されるシナリオに非常に適しています。 -
ROmor—コードを書くためにこれを使用しないでください。実際には機能しません。 -
JAlvarez007—確かに、ハイブリッド アーキテクチャによりビデオ メモリが節約されます。同じ 256K のコンテキストでは、ビデオ メモリの使用量は純粋なトランスの使用量よりもほぼ 40% 少なくなります。 2 台の A100 で実行できます。これは、H100 クラスターを持たない私たちのような小規模チームにとって非常に使いやすく、コストはすぐに削減されます。 -
DeltaDefi386—エコロジーはまだ希薄すぎて、サードパーティの微調整されたバージョンを見つけるのはほとんど不可能です。 llama.cpp は GGUF をサポートしていますが、まだつまずいて時間がかかりました。 -
KCookX—はっきり言って効率重視のプレイヤーです。 DeepSeek や Qwen の同レベルのモデルに勝てるほどスマートではありませんが、メモリの節約、高速な実行、または Apache 2.0 の使用において優れています。それはあなたが何を望むかによります。 -
Donna_Bell—デプロイメントには、mamba-ssm および causal-conv1d パッケージをインストールする必要があります。初めて環境問題に取り組むときは、環境問題に本当に落胆するでしょうし、それを乗り越えるまでに多くの落とし穴を通過しなければなりません。 -
Lydia_Gray_2023—vLLM のサービスは非常にスムーズで、OpenAI 互換インターフェイスが直接接続されており、移行コストも高くありません。 -
董宇—私たちは財務文書の処理に従事しており、私たちが大切にしているのは、データをプライベートに展開し、イントラネット内に保管することです。 Jamba のポジショニングはまさに私たちが望んでいたものであり、コンプライアンスへの対応も容易です。 -
8upfprd—指示は非常に安定して実行され、形式に従って JSON が出力されることは基本的に正しいです。 -
GaryAlvarez_77—多言語領域では英語だけが最強です。中国語やその他の言語のトレーニング コーパスが明らかに不十分です。中国のシーンを演じるときは、心理的な期待を持たなければなりません。国内モデルのような滑らかさを期待しないでください。 -
happyzebra338—フリー ウェイトは自分で実行することもできますが、API を代替手段として使用できます。このレベルのオープンソースは、予算に敏感なチームにとって非常に実用的です。 -
MsMustafaDağdaş_88—私が最も心配しているのは、実際にはモデルではなく会社です。 AI21の資金調達は失敗し、買収交渉は決裂し、60人が解雇された。独立したモデルは販売せず、Maestroにオールインするという。 Apache 2.0 の重みを取り戻すことはできませんが、今後も最適化と反復を続ける人がいるかどうかは、まったく疑問符です。主要事業に賭けるのは不安だ。 -
lazybird915—長い文書を要約するのは本当に速いです。数万枚のトークンを投入および排出する速度は、同じサイズの変圧器の速度よりも大幅に高速です。これは、Mamba レイヤーの線形的な複雑さの利点です。コンテキストが長ければ長いほど、利点がより明らかになります。私たちは技術マニュアルと調査レポートの概要をバッチで実行しており、1 日で節約できるコンピューティング電力コストはかなりのものです。 -
Judy_WilsonQ—推理スコアに関してキミやGLMと比較するのは無意味です。根本的にトラックが違うのでランキング対象外です。 -
PhillipCook_66—公式ブログによると、MiniはエンタープライズタスクのブラインドテストでMinistral3 14Bを獲得したという。抽出タスクと要約タスクを自分で試してみましたが、確かに問題ありませんでした。ただし、この種の人間による勝率の評価には、やはり自分自身のビジネスデータが語らなければなりません。 -
HAand_r—API のミニ バージョンのコストは 100 万入力トークンあたり 0.2 ドルのみで、大規模な抽出および分類パイプラインの構築に使用できます。この価格は本当にお手頃です。 -
JacquelineWilliamsK47—今年最も興味深いのは建築です。ポストトランスフォーマーロードには、ついに実装可能なオープンソースファミリーが登場しました。もう 1 つは IBM Granite 4 です。 -
TokenMaster613—オラマはすでに引き上げて走らせることができるので、地元で気軽に遊ぶのに非常に便利です。 -
GraceJohnsonJr8—複雑な複数ステップの推論やエージェント タスクには当てにしないでください。 SSM レイヤーの情報の逐次処理の特性により、グローバル パターンの把握に問題が生じることが決まります。この種の作業では、やはり Claude または GPT に頼るべきです。 -
David_GutierrezII—デバイス側の RAG と 3B は素晴らしい組み合わせです。インターネットに接続していなくても、携帯電話でローカル ドキュメントの Q&A を実行できます。プライバシー関係者は大喜びです。以前は、使える小型モデルを携帯端末に入れようと思ったら、画質が悪くて読み取れませんでした。これは、少なくとも抽出と Q&A には耐えられます。複雑な推論は期待できませんが、位置付けが正しければ十分です。 -
Sandra.Hicks—公式ページでは高速、低コスト、正確性について多くのことを誇っていますが、ベンチマーク テーブルや遅延データの比較は提供されていないため、知るには自分でテストする必要があります。 -
Lisa_Gomez—長いコンテキストの代替を選択する場合、基本的に Jamba システムは避けられません。ハイブリッド アーキテクチャとエンタープライズ セキュリティ指向を備えており、その位置付けは非常に明確です。 -
Thomas.Murphy_9978—リリース日に、私は HuggingFace にアクセスして、3B と Mini の両方をダウンロードしました。 Apache 2.0 は無制限に商用利用できます。あまりにも良心的すぎるので、敬意を表して先に買いだめしました。