AI21 Jamba2
以色列 AI21 Labs 推出的开源混合 SSM-Transformer 模型家族,主打企业级可靠性与 256K 长上下文的内存效率
深度报告
-
Jamba2 是以色列 AI 公司 AI21 Labs 在 2026 年 1 月 8 日推出的第二代开源模型家族,主打企业级的「可靠」与「可控」,而不是刷榜的极限智能。它延续了 AI21 招牌的混合架构——把 Mamba 状态空间模型(SSM)和 Transformer 注意力层交织在一起,用更省内存的方式吃下 256K 长上下文。家族里有两个尺寸:能塞进手机的 3B 稠密模型,以及 12B 激活、52B 总量的 Mini(MoE),两者都用 Apache 2.0 协议开放权重。它的卖点很清楚:在指令遵循和「有据可依」(grounding)这两件企业最在意的事上做到同级领先,同时把长文档处理的成本压下来。值得注意的是,Jamba2 发布时正赶上 AI21 自身经历融资失败、裁员六成、战略转向的动荡期,这给这款技术不错的模型蒙上了一层现实阴影。
-
AI21 Labs 成立于 2017 年 11 月,总部在以色列特拉维夫,三位创始人来头都不小:斯坦福 CS 荣休教授、前谷歌首席科学家 Yoav Shoham,连续创业者 Ori Goshen,以及 Mobileye 联合创始人 Amnon Shashua(Mobileye 被英特尔以 153 亿美元收购)。公司早期靠 Wordtune 写作助手和 Jurassic 系列模型起家,2024 年 3 月凭 Jamba 打响名号——那是业界第一个生产级的混合 Mamba-Transformer 开源模型。 融资方面,AI21 累计确认融资约 3.36 亿美元,2023 年 8 月的 1.55 亿美元 C 轮引入了谷歌和英伟达作为战略投资方,估值一度达到 14 亿美元。但 2025 至 2026 年公司陷入困境:传闻中与谷歌、英伟达谈的 3 亿美元 D 轮始终没有正式落地,英伟达以 20 至 30 亿美元收购的谈判也告吹,随后与 Nebius 的收购谈判在 2026 年 5 月终止。公司转而把 Maestro 编排平台当作商业化支柱(年化收入约 5000 万美元),并裁员超过 60%,员工从约 180 人砍到约 70 人,同时停止了独立的模型销售业务。以色列科技媒体 Calcalist 形容这是「从独角兽跌入生存模式」。
-
Jamba2 最核心的技术差异是那套 SSM-Transformer 混合架构。纯 Transformer 处理长文本时算力随上下文长度平方级增长,而 Mamba 层是线性复杂度,AI21 把大部分序列处理交给 Mamba、只在真正需要全局注意力的地方保留 Transformer 层。结果就是 256K 上下文窗口的内存占用甚至比传统 128K Transformer 还低,第三方评测普遍提到它比同规模纯 Transformer 省约 40% 显存、生成速度快约 30%。 功能定位上,AI21 刻意把 Jamba2 做成「不烧思考 token 的可靠工具」,专攻精准问答、文档处理、信息抽取、总结起草这类企业知识工作流,而不是复杂的多步推理。它在 IFBench、IFEval、Collie 等指令遵循基准以及 FACTS 事实基准上表现突出,官方还拿 Jamba2 Mini 和 Ministral3 14B 做了盲测人评,声称在企业任务的整体质量和胜率上有统计显著优势。3B 稠密版是这次的一大亮点,能真正跑在 iPhone、安卓、Mac 和 PC 上,做端侧 RAG 不至于质量崩塌;Mini 版则在 24GB 显存的消费级 GPU 上就能部署。模型支持英语、西班牙语、法语、葡萄牙语、意大利语、荷兰语、德语、阿拉伯语、希伯来语共 9 种语言,知识截止到 2024 年 8 月,可在 AI21 Studio 和 Hugging Face 下载。
-
Jamba2 走的是「开源权重 + 托管 API」双轨。自托管完全免费,Apache 2.0 协议允许无限制商用,权重挂在 Hugging Face 上;如果不想自己搭基础设施,可以用 AI21 的托管 API 按 token 计费,企业客户还能买到 SLA 保障和微调服务。作为参考,同门旗舰 Jamba Large 1.7 的 API 定价约为输入每百万 token 2 美元、输出 8 美元,比 GPT 和 Claude 的长上下文处理便宜,而 Jamba2 系列的两个小模型更适合走自部署路线彻底省掉 API 成本。目标用户是那些看重成本、数据隐私、要在自有 VPC 或本地跑模型的企业,尤其是金融、国防、医疗这类受监管行业。不过要提醒的是,母公司层面已经停止独立模型销售、全力押注 Maestro 编排平台,Jamba 更多是作为技术资产和引流存在。
-
开发者社区对 Jamba2 的评价整体是「务实的欣赏」。正面声音集中在三点:混合架构在 2026 年是少数几个认真做开源混合模型的家族之一(另一个常被拿来对比的是 IBM Granite 4),长上下文的内存效率是真金白银的优势;3B 版能在手机和笔记本上跑出可用质量,端侧部署党很买账;Mini 版用消费级 GPU 就能上,对没有 H100 集群的小团队友好。有评测给出 8.0/10 的分数,价值分高达 9/10。 负面反馈也很直接。最集中的抱怨是绝对能力不算第一梯队——52B 总量的 Mini 在主流推理基准上打不过 DeepSeek、GLM、Qwen 的同级模型,中训练只用了 5000 亿 token(头部开源模型动辄数万亿),通用知识广度和多语言覆盖因此受限,英语强、其他语言一般。生态也是短板:相比 Qwen、Llama、DeepSeek,第三方微调版本少,Ollama、llama.cpp 支持在追赶但仍滞后,如果工具链死绑纯 Transformer 管线,跑 Jamba 的 SSM 层还得额外做适配工作。
-
行业媒体给 Jamba2 的定调相当一致:这不是冲着「最聪明」去的模型,而是「效率与可靠性」的专精选手。多家评测把它形容为「用大脑换速度」的长上下文专家,适合高吞吐的文档流水线,不适合创意写作、复杂推理链和高难度编程。有评测打出 7.3/10,称它是「今年最有意思的架构创新」,但同时强调它在原始智能上不与前沿模型正面竞争。分析普遍认为,AI21 的差异化在于架构创新而非规模堆料,这在行业成熟、纯扩容边际递减的阶段本该是有价值的路线,可惜公司的商业化和资本困境拖了后腿。
-
最大的风险不在模型本身,而在公司。AI21 在 2025 至 2026 年经历了融资失败、两轮收购谈判告吹、裁员六成、战略从卖模型转向卖编排平台的剧烈动荡,官方已明确停止独立模型销售。这意味着 Jamba 系列的长期研发投入和后续迭代存在不确定性,企业若把关键工作流押在它身上,需要评估「上游会不会断供更新」的问题——虽然 Apache 2.0 权重已经开源、自托管不会被收回,但少了厂商持续优化和支持,价值会打折扣。 技术层面的争议则是「能力天花板」。混合架构省内存、跑得快是真的,但 SSM 层顺序处理信息的特性也让它在需要全局模式捕捉的复杂推理上容易吃亏,多个独立评测都指出它在 GPQA、编程、agentic 任务上属于同价位偏弱的一档。此外生态薄、第三方工具少,也是实际落地时绕不开的摩擦。
-
Jamba2 适合三类人:一是做长上下文 RAG 系统的团队,256K 上下文加可控内存正好卡在甜点区;二是要做移动端、边缘端部署的开发者,3B 版的混合效率在手机上真正能打;三是想尝试非 Transformer 架构、又要留在 Apache 2.0 商用安全区的团队,尤其是重视数据隐私、需要私有部署的金融、医疗、国防类企业,以及看重 GDPR 合规和地理位置的欧洲、以色列客户。 不适合的场景也很清楚:如果你要的是能写代码、做复杂多步推理、搞创意写作的通用主力模型,Claude、GPT、以及 Qwen、DeepSeek 等头部开源模型都是更稳的选择。替代方案上,追求同类混合架构可以看 IBM Granite 4;追求开源综合能力可以看 Qwen、Llama、DeepSeek。
-
Jamba2 是一款「架构有亮点、能力中规中矩、公司前景堪忧」的模型——它在长上下文效率和端侧部署上给出了实打实的价值,但绝对智能不入第一梯队,加上母公司深陷转型阵痛、已停售独立模型,让这款技术不错的产品更像是 AI21 混合架构路线的一个漂亮注脚,而非可以长期押注的生产主力。想省显存、跑长文档、玩端侧 RAG 的团队值得一试;想要长期稳定迭代和前沿能力的,还得另寻他家。
用户评论
-
Terryr11—拿 Jamba2 Mini 做了个内部合同问答的 RAG,256K 上下文是真香,几十页的采购合同直接塞进去不用切块,返回的答案基本都能贴着原文走,grounding 这块确实是它的强项,比我们之前用的那个小模型靠谱多了。 -
z4ebma3np—3B 版本居然能在我 M2 的 Mac 上直接跑起来,做端侧的知识库检索质量没崩,这点挺意外的,小尺寸稠密模型通常一压缩质量就垮,它居然还能保住基本的指令遵循和 grounding,配本地 RAG 用离线也能问文档,隐私敏感的场景很合适。 -
ROmor—别拿它去写代码,真不行。 -
JAlvarez007—混合架构省显存这事是真的,同样 256K 上下文我们这边显存占用比纯 transformer 少了差不多四成,两张 A100 就能跑起来,对我们这种没有 H100 集群的小团队太友好了,成本一下就下来了。 -
DeltaDefi386—生态还是太薄了,第三方微调版本几乎找不到,llama.cpp 的支持虽然有 GGUF 了但还是磕磕绊绊,折腾半天。 -
KCookX—说白了这就是个效率型选手,绝对智能打不过 DeepSeek 和 Qwen 的同级模型,但人家胜在省内存、跑得快、还是 Apache 2.0,看你要的是什么。 -
Donna_Bell—部署要装 mamba-ssm 和 causal-conv1d 那几个包,第一次搞真的会被环境问题劝退,踩了不少坑才跑通。 -
Lydia_Gray_2023—vLLM 起服务挺顺的,OpenAI 兼容接口直接对接,迁移成本不高。 -
董宇—我们是做金融文档处理的,看重的就是私有部署加数据不出内网这一套,Jamba 这个定位算是正中下怀,合规那边也好交代。 -
8upfprd—指令遵循确实稳,让它按格式输出 JSON 基本不跑偏。 -
GaryAlvarez_77—多语言这块只能说英语最强,中文和其他语种明显能感觉到训练语料不够,做中文场景要有心理预期,别指望它像国产模型那么顺。 -
happyzebra338—免费权重能自己跑,API 也就是备选,对预算敏感的团队来说这个开源程度很实在。 -
MsMustafaDağdaş_88—最担心的其实不是模型,是公司。AI21 又是融资黄了又是收购谈崩还裁了六成人,据说都不卖独立模型了全押 Maestro,虽然 Apache 2.0 的权重收不回去,但后续还有没有人持续优化迭代真的要打个问号,把关键业务押上去心里不踏实。 -
lazybird915—长文档总结是真的快,几万 token 丢进去出结果的速度比同尺寸 transformer 明显快一截,这就是 Mamba 层线性复杂度的好处,上下文越长优势越明显,我们批量跑技术手册和研报摘要,一天的量下来省下的算力成本很可观。 -
Judy_WilsonQ—拿它和 Kimi、GLM 比推理分数没意义,赛道根本不一样,它就不是冲榜去的。 -
PhillipCook_66—官方博客说 Mini 在企业任务盲测里赢了 Ministral3 14B,我自己拿抽取和总结的活儿试了下,确实还行,但这种人评胜率的东西还是得自己的业务数据说话。 -
HAand_r—Mini 版 API 才 0.2 美元每百万输入 token,做大批量抽取分类的流水线,这个价格是真的顶得住。 -
JacquelineWilliamsK47—架构是今年最有意思的一个了,post-transformer 这条路终于有个能落地的开源家族,另一个也就 IBM Granite 4 了。 -
TokenMaster613—Ollama 上已经能拉起来跑了,本地随便玩玩挺方便的。 -
GraceJohnsonJr8—复杂的多步推理和 agentic 任务真别指望它,SSM 层顺序处理信息的特性决定了它抓全局模式会吃亏,这类活儿还是老老实实上 Claude 或者 GPT。 -
David_GutierrezII—端侧 RAG 配 3B 是个很妙的组合,手机上跑不联网也能做本地文档问答,隐私党狂喜,之前想在移动端塞个能用的小模型总是质量崩到没法看,这个至少在抽取和问答上还撑得住,虽然复杂推理别指望,但定位对了就够用了。 -
Sandra.Hicks—官方页面吹得挺猛,什么速度快成本低准确率高,但就是不给 benchmark 表格,也没有对比延迟数据,还是得自己上手测才知道。 -
Lisa_Gomez—现在选长上下文替代方案,Jamba 系基本是绕不开的一个,混合架构加企业安全取向,定位很清晰。 -
Thomas.Murphy_9978—发布当天就去 HuggingFace 把 3B 和 Mini 都下下来了,Apache 2.0 无限制商用这点太良心,先囤为敬。