Mistral Codestral 2

Mistral 第二代代码专用模型,Apache 2.0 重新授权后可合法自托管与商用,擅长 IDE 内联补全

深度报告

  • Codestral 2 是 Mistral AI 的第二代代码专用模型,最关键的变动发生在 2026 年 4 月 8 日:Mistral 将其从初代的「非生产许可」重新授权为 Apache 2.0,意味着它终于可以合法地嵌入商用产品和付费服务。它是一枚 22B 的密集(dense)Transformer,原生支持中间填充(FIM)补全,拥有 256K 上下文窗口,覆盖 80 多种编程语言。它的定位很清晰:一枚又快又便宜、擅长 IDE 内联补全的代码模型,而不是用来跑复杂多步智能体编码的旗舰。对想要「在自己 GPU 上合法自托管代码补全」的团队和个人来说,它是目前最干净的选择之一。

  • Mistral AI 是一家总部位于巴黎的欧洲大模型公司,长期以开放权重和「数字主权」叙事著称。Codestral 系列是其代码模型的专门线。初代 Codestral 于 2024 年 5 月发布,22B 参数,能力不俗,但采用了 Mistral Non-Production License(MNPL),禁止商业使用,只能用于研究和测试。这一许可条款在开发者社区引发了持续的怀疑——「能不能把它装进付费 SaaS」「非生产怎么界定」「半年后会不会变」之类的问题反复出现。 版本沿革大致是:Codestral(2024.05,22B,MNPL)→ Codestral 25.01(2025.01,即 V2,改进了 tokenizer、速度翻倍、256K 上下文)→ Codestral 2(2026.04,在 Apache 2.0 下重新授权)。2026 年的这次重新授权,被多家评测称为「自 Llama 2 商用化以来最大的开源代码许可解锁」,因为它把「可在闭源工具里商用、可微调并售卖结果、无需申请许可」一次性放开。需要注意,不同第三方资料对参数和上下文的口径并不一致:谷歌云 Vertex AI 上的合作模型页把 codestral-2 标注为 GA、128K 上下文、2025 年 10 月发布;部分评测站点写作 32B、128K;而社区最一致的说法是 22B dense、256K 上下文、2026 年 4 月重新授权。本文以社区最一致、且与重新授权节点吻合的「22B dense / 256K / Apache 2.0」口径为准,并在风险章点明口径差异。

  • Codestral 2 的核心能力围绕代码生成,尤其是 FIM。FIM 指模型能从一段代码的中间位置向前向后补全,这正是 IDE 内联灰色补全的底层机制。Mistral 内部基准称其在 HumanEval 上 86.6%、MBPP 上 91.2%,在 BigCodeBench 上排名靠前。它针对 2026 年的主流语言做了优化:Python、TypeScript、Go、Rust、SQL,同时对 80 多种语言有基本覆盖。 在真实工作流里,它的强项很集中。Continue.dev、VS Code、JetBrains、Cline 都能接入;Cursor 可以把 Chat 和 Cmd-K 路由到 Codestral 2,但 Tab 内联补全仍跑在 Cursor 自有的闭源模型上、无法重定向——这是每个外部后端在 Cursor 里都有的同质限制。社区实测(dev.to,2026 年 6 月,RTX 4090,Q4_K_M 量化)显示短补全约 45–55 token/秒,做聊天和改动能用,但跑长链路智能体明显慢于云端。多位开发者(enterprisedna 汇总的 Reddit/HN 反馈)把它的评价浓缩成一句话:「我见过最好的自动补全器,也是最令人沮丧的结对程序员」——单轮生成质量高,多文件重构和含糊提示下会露怯。

  • Codestral 2 的变现路径分两层。其一是开放权重本身:Apache 2.0 授权下,从 HuggingFace 拉取权重、用 Ollama 或 vLLM 自托管,模型费用为零,只需硬件。其二是 Mistral 托管 API,按 token 计费:输入 0.30 美元、输出 0.90 美元每百万 token,与 Mistral Small/Medium 档位一致;它还有独立的 FIM 端点(codestral.mistral.ai/v1/fim/completions)专供 IDE 补全,以及常规聊天/补全端点(api.mistral.ai)。此外它通过 Google Cloud Vertex AI 提供(在欧洲 west4、美国 central1 等区域),并预告将上 Amazon Bedrock。 横向比价:DeepSeek V4-Flash 输入 0.14、输出 0.435 美元,更便宜且在 agent 任务上更强;Gemini 3.5 Flash 约 1.50 / 6 美元,更贵且不支持自托管和 FIM 端点。换句话说,Codestral 2 在「可合法自托管」这一栏是独一档,纯云端按量计费则并非最低价。自托管硬件门槛上,Q4_K_M 量化约 13.3GB,16GB 显卡(如 4060 Ti)能勉强跑短上下文,24GB 的 3090 是甜点(约 40–50 token/秒),4090 约 60–75 token/秒,生产级用单张 H100 80GB 跑满精度;48GB 显存可满精度带合理上下文。但务必注意:256K 上下文是服务器/API 层面的能力,消费级显卡在 16K–16K 上下文就会吃紧,远到不了 256K。

  • 真实开发者社区的声音偏务实。Reddit 和 Hacker News 上,初代 Codestral 发布当天的线程几小时内数百条评论,先是对基准兴奋,随后被许可条款浇了冷水;2026 年 Apache 2.0 重新授权后又被一批团队严肃二次评估。普遍认可的点:FIM 补全接近 Copilot 级别、延迟低(单张 A100 上短补全 80–200 毫秒 token-out,像本地补全而非云端往返)、Python/TypeScript 流畅(干净的 pandas 变换、像样的 pytest 脚手架、合理的类型提示)。被诟病的点:复杂多文件重构和模糊需求下表现不稳,多轮推理弱于更大的模型;许可证历史造成的「我能不能在它上面建生意」的疑虑至今仍在 2026 年的讨论里出现。一位开发者在 HN 上的总结流传很广:「最好的自动补全器,最令人沮丧的结对程序员」——这种「单轮强、多轮弱」的张力是社区共识。

  • 在开放权重代码模型的 2026 年格局里,Codestral 2 与 Qwen2.5-Coder-32B、DeepSeek-Coder V3、StarCoder 3、IBM Granite Code 34B 同台。多项横向研究指出,在原始代码生成基准上,开放权重与闭源旗舰的差距已经很小;真正的落差在真实 PR 接受率上,因为这取决于 agent loop 的质量而非模型本身。综合评分站点 AIToolTier 给 Codestral 2 打 7.5/10,赞其重新授权的意义、FIM 领先、22B dense 显存可预测、EU 托管满足 GDPR;减分项则是复杂推理落后闭源旗舰、无多模态/原生 tool-use、基准透明度偏弱(Mistral 主要发 MBPP/HumanEval,第三方 SWE-bench / LiveCodeBench 验证较薄),以及 SWE-bench Verified 落后 Qwen Coder 3.5、DeepSeek V3 Coder 几个点。一个常被忽视的事实是:2026 年中,密集模型在本地编码上已被 MoE(Qwen3-Coder、DeepSeek V4 等)反超,22B dense 的优势是显存可预测,而非速度或上限。

  • 第一,版本与口径混乱。同一个「Codestral 2」在官方 V2(25.01,2025 年 1 月)、Vertex AI 合作模型(标注 2025 年 10 月 GA、128K)、以及 2026 年 4 月 Apache 2.0 重新授权之间,参数(22B 对 32B)、上下文(256K 对 128K)、发布时间都存在冲突。企业接入前应核实自己拿到的是哪个具体版本,别把初代 MNPL 权重当成可商用版本。 第二,能力边界。它是专注补全的 code-specialist,不是通用智能体。复杂多步 agentic 编码、截图转代码、终端工具执行,要用 Claude Code、Cursor Composer 2 或 Devin;它自身没有原生多模态和 tool-use。 第三,基准可信度。Mistral 自己发布的 HumanEval/MBPP 数字是内部评测,HumanEval 在 2026 年已接近饱和,不应据此排座次;第三方 SWE-bench/LiveCodeBench 验证偏少。 第四,本地部署幻象。256K 上下文是营销亮点,但消费级显卡根本喂不饱 KV 缓存,真实可用上下文只有几千到一万多 token;想用满需要服务器级显存。 第五,保质期风险。开放权重代码模型迭代极快,一枚 22B 密集模型的「货架期按季度计」,12 个月内就可能被更新的 MoE 同尺寸模型在能力和价格上双重碾压。

  • 适合:想要合法自托管代码补全的个人和团队、代码隐私敏感(代码不出本地、客户代码在 NDA 下)、把模型作为 IDE 补全后端(尤其 Continue.dev 的 FIM 槽位)、在闭源商用产品里内嵌代码模型(Apache 2.0 放开)、跑 CI 代码审查 bot 或夜间重构批处理(按量计费比闭源便宜数倍)。 不适合:需要复杂多步智能体编码的(选 Claude Code / Devin / DeepSeek V4-Flash)、需要截图转代码或终端工具执行的、需要整库超大上下文问答的(Llama 4 Scout 的 10M 上下文更像这类「派对把戏」)。 具体到编辑器:如果你要的是最好的内联补全且能合法跑在自己 GPU 上,把它接进 Continue.dev 的 FIM 槽位;如果用 Cursor,它只能接管 Chat/Cmd-K,Tab 还是 Cursor 自己的。如果要做 Cline 的 agent 后端,它适合「应用这个聚焦改动」类任务,不适合「搞清楚集成测试为什么飘并修好它」。 替代方案:纯云端 agent 后端选 DeepSeek V4-Flash(更便宜更强);想要开源权重里的 agentic 冠军看 DeepSeek-Coder V3(236B MoE);整库长上下文问答看 Llama 4 Scout;企业最宽松许可看 IBM Granite Code 34B(Apache 2.0)。

  • Codestral 2 真正值钱的地方不是参数或基准,而是那张 Apache 2.0 许可证——它把一枚质量过硬、22B 可预测、FIM 领先、能自托管的代码补全模型,从「研究玩具」变成了「可以装进产品卖钱」的合规组件。把它用在它擅长的地方(内联补全、隐私本地化、商用内嵌),它物超所值;指望它替代前沿智能体编码器,则会失望。

用户评论

  • 头像
    BrittanyMendoza_2020
    Codestral 2 的 FIM 是真的顶,回不去了。

  • 头像
    Madk637
    接进 Continue.dev 当补全模型,灰字补全比 Cursor 自带的差点意思,但代码不出本地很安心。

  • 头像
    Frances.Perry3697
    在公司内网部署了一版,Apache 2.0 直接省了采购扯皮。之前初代那个非生产许可根本不敢碰商用,现在终于能名正言顺塞进我们自己的 IDE 插件里了。

  • 头像
    wcmqo0d703
    我在一张 3090 上跑 Q4_K_M,短补全大概 45 token/秒,写 TS 的 hook 和类型客户端很顺。但说实话多文件重构它就开始露怯,上次让它改一个跨三文件的重构,第三轮就跑偏了。日常 tab 补全神器,别指望它当结对程序员。

  • 头像
    Martha_Anderson_2024
    256K 上下文就是个噱头,我 24G 卡实际只能撑到 16K,再多就 OOM。

  • 头像
    xEstebanDueñas_x
    「最好的自动补全器,最令人沮丧的结对程序员」这句 HN 老哥总结得精准。单轮生成质量没话说,多轮推理是真不行。

  • 头像
    李星妍
    作为欧洲团队我们比较在意数据驻留,Codestral 2 走 Mistral 的欧盟托管 API,GDPR 这关好过。不过北美的同事抱怨延迟比 DeepSeek 和 Copilot 高,北美节点确实有点亏,反而是自托管那台 3090 最快。

  • 头像
    GClark_7
    0.3 刀百万 token,真香。

  • 头像
    宋娜
    Cursor 的 Tab 补全没法重定向到外部模型,这点挺坑。想用它的 FIM 最好老老实实上 Continue.dev,Continue 能直接吃专用 FIM 端点,体验才对。

  • 头像
    CryptoNinjaChavez
    跟 Qwen3-Coder 比,密集 22B 在本地编码速度上已经不占优了,MoE 同尺寸又快又强。但 Codestral 2 胜在许可证干净和可预测——没有专家路由的意外,显存占用一眼能算清。要补全选它,要 agent 选别的。

  • 头像
    KellyKelly_66
    版本号真乱,25.01、2、2.1 到底哪个能商用?踩过初代非生产许可的坑后现在看到版本就先查许可证。

  • 头像
    nzdw4jan52
    做 CI 代码审查 bot 用它的 API,批处理比 OpenAI 便宜好几倍。HumanEval 86.6% 看着还行,但这榜 2026 年早饱和了,别拿来排座次。

  • 头像
    CAcox
    Mac M4 24G 跑 Q4 也挺香,离线写代码毫无卡顿感。

  • 头像
    SatoshiSnakeJones
    想用满 256K 上下文基本得服务器级显存,消费卡就别想了。我日常 8K 上下文已经够用,补全质量没觉得比云端差,隐私还更好。