AI21 Jamba2
以色列 AI21 Labs 推出的開源混合 SSM-Transformer 模型家族,主打企業級可靠性與 256K 長上下文的記憶體效率
深度報告
-
Jamba2 是以色列 AI 公司 AI21 Labs 在 2026 年 1 月 8 日推出的第二代開源模型家族,主打企業級的「可靠」與「可控」,而不是刷榜的極限智慧。它延續了 AI21 招牌的混合架構——把 Mamba 狀態空間模型(SSM)和 Transformer 注意力層交織在一起,用更省記憶體的方式吃下 256K 長上下文。家族裡有兩個尺寸:能塞進手機的 3B 稠密模型,以及 12B 啟用、52B 總量的 Mini(MoE),兩者都用 Apache 2.0 協議開放權重。它的賣點很清楚:在指令遵循和「有據可依」(grounding)這兩件企業最在意的事上做到同級領先,同時把長文件處理的成本壓下來。值得注意的是,Jamba2 釋出時正趕上 AI21 自身經歷融資失敗、裁員六成、戰略轉向的動盪期,這給這款技術不錯的模型蒙上了一層現實陰影。
-
AI21 Labs 成立於 2017 年 11 月,總部在以色列特拉維夫,三位創始人來頭都不小:斯坦福 CS 榮休教授、前谷歌首席科學家 Yoav Shoham,連續創業者 Ori Goshen,以及 Mobileye 聯合創始人 Amnon Shashua(Mobileye 被英特爾以 153 億美元收購)。公司早期靠 Wordtune 寫作助手和 Jurassic 系列模型起家,2024 年 3 月憑 Jamba 打響名號——那是業界第一個生產級的混合 Mamba-Transformer 開源模型。 融資方面,AI21 累計確認融資約 3.36 億美元,2023 年 8 月的 1.55 億美元 C 輪引入了谷歌和英偉達作為戰略投資方,估值一度達到 14 億美元。但 2025 至 2026 年公司陷入困境:傳聞中與谷歌、英偉達談的 3 億美元 D 輪始終沒有正式落地,英偉達以 20 至 30 億美元收購的談判也告吹,隨後與 Nebius 的收購談判在 2026 年 5 月終止。公司轉而把 Maestro 編排平臺當作商業化支柱(年化收入約 5000 萬美元),並裁員超過 60%,員工從約 180 人砍到約 70 人,同時停止了獨立的模型銷售業務。以色列科技媒體 Calcalist 形容這是「從獨角獸跌入生存模式」。
-
Jamba2 最核心的技術差異是那套 SSM-Transformer 混合架構。純 Transformer 處理長文字時算力隨上下文長度平方級增長,而 Mamba 層是線性複雜度,AI21 把大部分序列處理交給 Mamba、只在真正需要全域性注意力的地方保留 Transformer 層。結果就是 256K 上下文視窗的記憶體佔用甚至比傳統 128K Transformer 還低,第三方評測普遍提到它比同規模純 Transformer 省約 40% 視訊記憶體、生成速度快約 30%。 功能定位上,AI21 刻意把 Jamba2 做成「不燒思考 token 的可靠工具」,專攻精準問答、文件處理、資訊抽取、總結起草這類企業知識工作流,而不是複雜的多步推理。它在 IFBench、IFEval、Collie 等指令遵循基準以及 FACTS 事實基準上表現突出,官方還拿 Jamba2 Mini 和 Ministral3 14B 做了盲測人評,聲稱在企業任務的整體質量和勝率上有統計顯著優勢。3B 稠密版是這次的一大亮點,能真正跑在 iPhone、安卓、Mac 和 PC 上,做端側 RAG 不至於質量崩塌;Mini 版則在 24GB 視訊記憶體的消費級 GPU 上就能部署。模型支援英語、西班牙語、法語、葡萄牙語、義大利語、荷蘭語、德語、阿拉伯語、希伯來語共 9 種語言,知識截止到 2024 年 8 月,可在 AI21 Studio 和 Hugging Face 下載。
-
Jamba2 走的是「開源權重 + 託管 API」雙軌。自託管完全免費,Apache 2.0 協議允許無限制商用,權重掛在 Hugging Face 上;如果不想自己搭基礎設施,可以用 AI21 的託管 API 按 token 計費,企業客戶還能買到 SLA 保障和微調服務。作為參考,同門旗艦 Jamba Large 1.7 的 API 定價約為輸入每百萬 token 2 美元、輸出 8 美元,比 GPT 和 Claude 的長上下文處理便宜,而 Jamba2 系列的兩個小模型更適合走自部署路線徹底省掉 API 成本。目標使用者是那些看重成本、資料隱私、要在自有 VPC 或本地跑模型的企業,尤其是金融、國防、醫療這類受監管行業。不過要提醒的是,母公司層面已經停止獨立模型銷售、全力押注 Maestro 編排平臺,Jamba 更多是作為技術資產和引流存在。
-
開發者社群對 Jamba2 的評價整體是「務實的欣賞」。正面聲音集中在三點:混合架構在 2026 年是少數幾個認真做開源混合模型的家族之一(另一個常被拿來對比的是 IBM Granite 4),長上下文的記憶體效率是真金白銀的優勢;3B 版能在手機和筆記本上跑出可用質量,端側部署黨很買賬;Mini 版用消費級 GPU 就能上,對沒有 H100 叢集的小團隊友好。有評測給出 8.0/10 的分數,價值分高達 9/10。 負面反饋也很直接。最集中的抱怨是絕對能力不算第一梯隊——52B 總量的 Mini 在主流推理基準上打不過 DeepSeek、GLM、Qwen 的同級模型,中訓練只用了 5000 億 token(頭部開源模型動輒數萬億),通用知識廣度和多語言覆蓋因此受限,英語強、其他語言一般。生態也是短板:相比 Qwen、Llama、DeepSeek,第三方微調版本少,Ollama、llama.cpp 支援在追趕但仍滯後,如果工具鏈死綁純 Transformer 管線,跑 Jamba 的 SSM 層還得額外做適配工作。
-
行業媒體給 Jamba2 的定調相當一致:這不是衝著「最聰明」去的模型,而是「效率與可靠性」的專精選手。多家評測把它形容為「用大腦換速度」的長上下文專家,適合高吞吐的文件流水線,不適合創意寫作、複雜推理鏈和高難度程式設計。有評測打出 7.3/10,稱它是「今年最有意思的架構創新」,但同時強調它在原始智慧上不與前沿模型正面競爭。分析普遍認為,AI21 的差異化在於架構創新而非規模堆料,這在行業成熟、純擴容邊際遞減的階段本該是有價值的路線,可惜公司的商業化和資本困境拖了後腿。
-
最大的風險不在模型本身,而在公司。AI21 在 2025 至 2026 年經歷了融資失敗、兩輪收購談判告吹、裁員六成、戰略從賣模型轉向賣編排平臺的劇烈動盪,官方已明確停止獨立模型銷售。這意味著 Jamba 系列的長期研發投入和後續迭代存在不確定性,企業若把關鍵工作流押在它身上,需要評估「上游會不會斷供更新」的問題——雖然 Apache 2.0 權重已經開源、自託管不會被收回,但少了廠商持續最佳化和支援,價值會打折扣。 技術層面的爭議則是「能力天花板」。混合架構省記憶體、跑得快是真的,但 SSM 層順序處理資訊的特性也讓它在需要全域性模式捕捉的複雜推理上容易吃虧,多個獨立評測都指出它在 GPQA、程式設計、agentic 任務上屬於同價位偏弱的一檔。此外生態薄、第三方工具少,也是實際落地時繞不開的摩擦。
-
Jamba2 適合三類人:一是做長上下文 RAG 系統的團隊,256K 上下文加可控記憶體正好卡在甜點區;二是要做移動端、邊緣端部署的開發者,3B 版的混合效率在手機上真正能打;三是想嘗試非 Transformer 架構、又要留在 Apache 2.0 商用安全區的團隊,尤其是重視資料隱私、需要私有部署的金融、醫療、國防類企業,以及看重 GDPR 合規和地理位置的歐洲、以色列客戶。 不適合的場景也很清楚:如果你要的是能寫程式碼、做複雜多步推理、搞創意寫作的通用主力模型,Claude、GPT、以及 Qwen、DeepSeek 等頭部開源模型都是更穩的選擇。替代方案上,追求同類混合架構可以看 IBM Granite 4;追求開源綜合能力可以看 Qwen、Llama、DeepSeek。
-
Jamba2 是一款「架構有亮點、能力中規中矩、公司前景堪憂」的模型——它在長上下文效率和端側部署上給出了實打實的價值,但絕對智慧不入第一梯隊,加上母公司深陷轉型陣痛、已停售獨立模型,讓這款技術不錯的產品更像是 AI21 混合架構路線的一個漂亮註腳,而非可以長期押注的生產主力。想省視訊記憶體、跑長文件、玩端側 RAG 的團隊值得一試;想要長期穩定迭代和前沿能力的,還得另尋他家。
使用者評論
-
Terryr11—拿 Jamba2 Mini 做了個內部合同問答的 RAG,256K 上下文是真香,幾十頁的採購合同直接塞進去不用切塊,返回的答案基本都能貼著原文走,grounding 這塊確實是它的強項,比我們之前用的那個小模型靠譜多了。 -
z4ebma3np—3B 版本居然能在我 M2 的 Mac 上直接跑起來,做端側的知識庫檢索質量沒崩,這點挺意外的,小尺寸稠密模型通常一壓縮質量就垮,它居然還能保住基本的指令遵循和 grounding,配本地 RAG 用離線也能問文件,隱私敏感的場景很合適。 -
ROmor—別拿它去寫程式碼,真不行。 -
JAlvarez007—混合架構省視訊記憶體這事是真的,同樣 256K 上下文我們這邊視訊記憶體佔用比純 transformer 少了差不多四成,兩張 A100 就能跑起來,對我們這種沒有 H100 叢集的小團隊太友好了,成本一下就下來了。 -
DeltaDefi386—生態還是太薄了,第三方微調版本幾乎找不到,llama.cpp 的支援雖然有 GGUF 了但還是磕磕絆絆,折騰半天。 -
KCookX—說白了這就是個效率型選手,絕對智慧打不過 DeepSeek 和 Qwen 的同級模型,但人家勝在省記憶體、跑得快、還是 Apache 2.0,看你要的是什麼。 -
Donna_Bell—部署要裝 mamba-ssm 和 causal-conv1d 那幾個包,第一次搞真的會被環境問題勸退,踩了不少坑才跑通。 -
Lydia_Gray_2023—vLLM 起服務挺順的,OpenAI 相容介面直接對接,遷移成本不高。 -
董宇—我們是做金融文件處理的,看重的就是私有部署加資料不出內網這一套,Jamba 這個定位算是正中下懷,合規那邊也好交代。 -
8upfprd—指令遵循確實穩,讓它按格式輸出 JSON 基本不跑偏。 -
GaryAlvarez_77—多語言這塊只能說英語最強,中文和其他語種明顯能感覺到訓練語料不夠,做中文場景要有心理預期,別指望它像國產模型那麼順。 -
happyzebra338—免費權重能自己跑,API 也就是備選,對預算敏感的團隊來說這個開源程度很實在。 -
MsMustafaDağdaş_88—最擔心的其實不是模型,是公司。AI21 又是融資黃了又是收購談崩還裁了六成人,據說都不賣獨立模型了全押 Maestro,雖然 Apache 2.0 的權重收不回去,但後續還有沒有人持續最佳化迭代真的要打個問號,把關鍵業務押上去心裡不踏實。 -
lazybird915—長文件總結是真的快,幾萬 token 丟進去出結果的速度比同尺寸 transformer 明顯快一截,這就是 Mamba 層線性複雜度的好處,上下文越長優勢越明顯,我們批次跑技術手冊和研報摘要,一天的量下來省下的算力成本很可觀。 -
Judy_WilsonQ—拿它和 Kimi、GLM 比推理分數沒意義,賽道根本不一樣,它就不是衝榜去的。 -
PhillipCook_66—官方部落格說 Mini 在企業任務盲測裡贏了 Ministral3 14B,我自己拿抽取和總結的活兒試了下,確實還行,但這種人評勝率的東西還是得自己的業務資料說話。 -
HAand_r—Mini 版 API 才 0.2 美元每百萬輸入 token,做大批次抽取分類的流水線,這個價格是真的頂得住。 -
JacquelineWilliamsK47—架構是今年最有意思的一個了,post-transformer 這條路終於有個能落地的開源家族,另一個也就 IBM Granite 4 了。 -
TokenMaster613—Ollama 上已經能拉起來跑了,本地隨便玩玩挺方便的。 -
GraceJohnsonJr8—複雜的多步推理和 agentic 任務真別指望它,SSM 層順序處理資訊的特性決定了它抓全域性模式會吃虧,這類活兒還是老老實實上 Claude 或者 GPT。 -
David_GutierrezII—端側 RAG 配 3B 是個很妙的組合,手機上跑不聯網也能做本地文件問答,隱私黨狂喜,之前想在移動端塞個能用的小模型總是質量崩到沒法看,這個至少在抽取和問答上還撐得住,雖然複雜推理別指望,但定位對了就夠用了。 -
Sandra.Hicks—官方頁面吹得挺猛,什麼速度快成本低準確率高,但就是不給 benchmark 表格,也沒有對比延遲資料,還是得自己上手測才知道。 -
Lisa_Gomez—現在選長上下文替代方案,Jamba 系基本是繞不開的一個,混合架構加企業安全取向,定位很清晰。 -
Thomas.Murphy_9978—釋出當天就去 HuggingFace 把 3B 和 Mini 都下下來了,Apache 2.0 無限制商用這點太良心,先囤為敬。