Mistral Codestral 2
Mistral 第二代代码专用模型,Apache 2.0 重新授权后可合法自托管与商用,擅长 IDE 内联补全
深度报告
-
Codestral 2 是 Mistral AI 的第二代代码专用模型,最关键的变动发生在 2026 年 4 月 8 日:Mistral 将其从初代的「非生产许可」重新授权为 Apache 2.0,意味着它终于可以合法地嵌入商用产品和付费服务。它是一枚 22B 的密集(dense)Transformer,原生支持中间填充(FIM)补全,拥有 256K 上下文窗口,覆盖 80 多种编程语言。它的定位很清晰:一枚又快又便宜、擅长 IDE 内联补全的代码模型,而不是用来跑复杂多步智能体编码的旗舰。对想要「在自己 GPU 上合法自托管代码补全」的团队和个人来说,它是目前最干净的选择之一。
-
Mistral AI 是一家总部位于巴黎的欧洲大模型公司,长期以开放权重和「数字主权」叙事著称。Codestral 系列是其代码模型的专门线。初代 Codestral 于 2024 年 5 月发布,22B 参数,能力不俗,但采用了 Mistral Non-Production License(MNPL),禁止商业使用,只能用于研究和测试。这一许可条款在开发者社区引发了持续的怀疑——「能不能把它装进付费 SaaS」「非生产怎么界定」「半年后会不会变」之类的问题反复出现。 版本沿革大致是:Codestral(2024.05,22B,MNPL)→ Codestral 25.01(2025.01,即 V2,改进了 tokenizer、速度翻倍、256K 上下文)→ Codestral 2(2026.04,在 Apache 2.0 下重新授权)。2026 年的这次重新授权,被多家评测称为「自 Llama 2 商用化以来最大的开源代码许可解锁」,因为它把「可在闭源工具里商用、可微调并售卖结果、无需申请许可」一次性放开。需要注意,不同第三方资料对参数和上下文的口径并不一致:谷歌云 Vertex AI 上的合作模型页把 codestral-2 标注为 GA、128K 上下文、2025 年 10 月发布;部分评测站点写作 32B、128K;而社区最一致的说法是 22B dense、256K 上下文、2026 年 4 月重新授权。本文以社区最一致、且与重新授权节点吻合的「22B dense / 256K / Apache 2.0」口径为准,并在风险章点明口径差异。
-
Codestral 2 的核心能力围绕代码生成,尤其是 FIM。FIM 指模型能从一段代码的中间位置向前向后补全,这正是 IDE 内联灰色补全的底层机制。Mistral 内部基准称其在 HumanEval 上 86.6%、MBPP 上 91.2%,在 BigCodeBench 上排名靠前。它针对 2026 年的主流语言做了优化:Python、TypeScript、Go、Rust、SQL,同时对 80 多种语言有基本覆盖。 在真实工作流里,它的强项很集中。Continue.dev、VS Code、JetBrains、Cline 都能接入;Cursor 可以把 Chat 和 Cmd-K 路由到 Codestral 2,但 Tab 内联补全仍跑在 Cursor 自有的闭源模型上、无法重定向——这是每个外部后端在 Cursor 里都有的同质限制。社区实测(dev.to,2026 年 6 月,RTX 4090,Q4_K_M 量化)显示短补全约 45–55 token/秒,做聊天和改动能用,但跑长链路智能体明显慢于云端。多位开发者(enterprisedna 汇总的 Reddit/HN 反馈)把它的评价浓缩成一句话:「我见过最好的自动补全器,也是最令人沮丧的结对程序员」——单轮生成质量高,多文件重构和含糊提示下会露怯。
-
Codestral 2 的变现路径分两层。其一是开放权重本身:Apache 2.0 授权下,从 HuggingFace 拉取权重、用 Ollama 或 vLLM 自托管,模型费用为零,只需硬件。其二是 Mistral 托管 API,按 token 计费:输入 0.30 美元、输出 0.90 美元每百万 token,与 Mistral Small/Medium 档位一致;它还有独立的 FIM 端点(codestral.mistral.ai/v1/fim/completions)专供 IDE 补全,以及常规聊天/补全端点(api.mistral.ai)。此外它通过 Google Cloud Vertex AI 提供(在欧洲 west4、美国 central1 等区域),并预告将上 Amazon Bedrock。 横向比价:DeepSeek V4-Flash 输入 0.14、输出 0.435 美元,更便宜且在 agent 任务上更强;Gemini 3.5 Flash 约 1.50 / 6 美元,更贵且不支持自托管和 FIM 端点。换句话说,Codestral 2 在「可合法自托管」这一栏是独一档,纯云端按量计费则并非最低价。自托管硬件门槛上,Q4_K_M 量化约 13.3GB,16GB 显卡(如 4060 Ti)能勉强跑短上下文,24GB 的 3090 是甜点(约 40–50 token/秒),4090 约 60–75 token/秒,生产级用单张 H100 80GB 跑满精度;48GB 显存可满精度带合理上下文。但务必注意:256K 上下文是服务器/API 层面的能力,消费级显卡在 16K–16K 上下文就会吃紧,远到不了 256K。
-
真实开发者社区的声音偏务实。Reddit 和 Hacker News 上,初代 Codestral 发布当天的线程几小时内数百条评论,先是对基准兴奋,随后被许可条款浇了冷水;2026 年 Apache 2.0 重新授权后又被一批团队严肃二次评估。普遍认可的点:FIM 补全接近 Copilot 级别、延迟低(单张 A100 上短补全 80–200 毫秒 token-out,像本地补全而非云端往返)、Python/TypeScript 流畅(干净的 pandas 变换、像样的 pytest 脚手架、合理的类型提示)。被诟病的点:复杂多文件重构和模糊需求下表现不稳,多轮推理弱于更大的模型;许可证历史造成的「我能不能在它上面建生意」的疑虑至今仍在 2026 年的讨论里出现。一位开发者在 HN 上的总结流传很广:「最好的自动补全器,最令人沮丧的结对程序员」——这种「单轮强、多轮弱」的张力是社区共识。
-
在开放权重代码模型的 2026 年格局里,Codestral 2 与 Qwen2.5-Coder-32B、DeepSeek-Coder V3、StarCoder 3、IBM Granite Code 34B 同台。多项横向研究指出,在原始代码生成基准上,开放权重与闭源旗舰的差距已经很小;真正的落差在真实 PR 接受率上,因为这取决于 agent loop 的质量而非模型本身。综合评分站点 AIToolTier 给 Codestral 2 打 7.5/10,赞其重新授权的意义、FIM 领先、22B dense 显存可预测、EU 托管满足 GDPR;减分项则是复杂推理落后闭源旗舰、无多模态/原生 tool-use、基准透明度偏弱(Mistral 主要发 MBPP/HumanEval,第三方 SWE-bench / LiveCodeBench 验证较薄),以及 SWE-bench Verified 落后 Qwen Coder 3.5、DeepSeek V3 Coder 几个点。一个常被忽视的事实是:2026 年中,密集模型在本地编码上已被 MoE(Qwen3-Coder、DeepSeek V4 等)反超,22B dense 的优势是显存可预测,而非速度或上限。
-
第一,版本与口径混乱。同一个「Codestral 2」在官方 V2(25.01,2025 年 1 月)、Vertex AI 合作模型(标注 2025 年 10 月 GA、128K)、以及 2026 年 4 月 Apache 2.0 重新授权之间,参数(22B 对 32B)、上下文(256K 对 128K)、发布时间都存在冲突。企业接入前应核实自己拿到的是哪个具体版本,别把初代 MNPL 权重当成可商用版本。 第二,能力边界。它是专注补全的 code-specialist,不是通用智能体。复杂多步 agentic 编码、截图转代码、终端工具执行,要用 Claude Code、Cursor Composer 2 或 Devin;它自身没有原生多模态和 tool-use。 第三,基准可信度。Mistral 自己发布的 HumanEval/MBPP 数字是内部评测,HumanEval 在 2026 年已接近饱和,不应据此排座次;第三方 SWE-bench/LiveCodeBench 验证偏少。 第四,本地部署幻象。256K 上下文是营销亮点,但消费级显卡根本喂不饱 KV 缓存,真实可用上下文只有几千到一万多 token;想用满需要服务器级显存。 第五,保质期风险。开放权重代码模型迭代极快,一枚 22B 密集模型的「货架期按季度计」,12 个月内就可能被更新的 MoE 同尺寸模型在能力和价格上双重碾压。
-
适合:想要合法自托管代码补全的个人和团队、代码隐私敏感(代码不出本地、客户代码在 NDA 下)、把模型作为 IDE 补全后端(尤其 Continue.dev 的 FIM 槽位)、在闭源商用产品里内嵌代码模型(Apache 2.0 放开)、跑 CI 代码审查 bot 或夜间重构批处理(按量计费比闭源便宜数倍)。 不适合:需要复杂多步智能体编码的(选 Claude Code / Devin / DeepSeek V4-Flash)、需要截图转代码或终端工具执行的、需要整库超大上下文问答的(Llama 4 Scout 的 10M 上下文更像这类「派对把戏」)。 具体到编辑器:如果你要的是最好的内联补全且能合法跑在自己 GPU 上,把它接进 Continue.dev 的 FIM 槽位;如果用 Cursor,它只能接管 Chat/Cmd-K,Tab 还是 Cursor 自己的。如果要做 Cline 的 agent 后端,它适合「应用这个聚焦改动」类任务,不适合「搞清楚集成测试为什么飘并修好它」。 替代方案:纯云端 agent 后端选 DeepSeek V4-Flash(更便宜更强);想要开源权重里的 agentic 冠军看 DeepSeek-Coder V3(236B MoE);整库长上下文问答看 Llama 4 Scout;企业最宽松许可看 IBM Granite Code 34B(Apache 2.0)。
-
Codestral 2 真正值钱的地方不是参数或基准,而是那张 Apache 2.0 许可证——它把一枚质量过硬、22B 可预测、FIM 领先、能自托管的代码补全模型,从「研究玩具」变成了「可以装进产品卖钱」的合规组件。把它用在它擅长的地方(内联补全、隐私本地化、商用内嵌),它物超所值;指望它替代前沿智能体编码器,则会失望。
用户评论
-
MarthaKing_202389—Copilot 替代品完全够格,自托管不用担心代码被拿去训练。隐私这块确实比 Copilot 强,而且代码生成质量也不输多少。 -
MetaHub_io—FIM 是亮点,但跨文件重构能力比 Cursor 差远了。写新代码很合适,改老代码不太行,上下文一多就糊了。 -
rkm6ukb6—想拿来给 Cline 做 backend 跑 agent 任务,结果多文件改代码的时候经常掉链子,上下文理解不够深。还是换回 DeepSeek 当主力了。 -
greendog148—建议所有考虑自托管代码模型的人都试试,22B 的 dense 模型部署最简单,不像 DeepSeek 那么大。而且 Apache 2.0 完全没法律风险。 -
BillyMurray369—用了两个月 Codestral 2 的感受:API 做补全很好但做 chat 不够聪明,自托管做补全也够用但 token/s 上不去。总体来说值回票价。 -
RavenRocketGreen—shiporskip 上 4-0 全票通过,说 Apache 2.0 + Ollama 自托管这个组合确实能打。看了那篇评测写得挺客观的,优点缺点都说了。 -
DKing—Mistral 这次把 Codestral 2 做成 Apache 2.0 是真的有诚意。仔细想想这个决定的影响:之前因为许可证不敢用的企业现在都可以上了,整个开��代码补全的市场格局都会变,Copilot 不再是唯一的选择了。 -
韩艳—Apache 2.0 之后终于敢在公司项目里用了,之前那个非商业许可证太坑了,问法务都说不行。改完协议直接 ollama pull 就在本地跑了。 -
Marilyn_Simmons_77—用 Continue.dev 接上 Codestral 2 做代码补全,确实比之前用 DeepSeek 快,响应基本在 200ms 以内,写 TypeScript 的时候体验很好。 -
Angela_Davis520—22B 的 dense 模型显存占用很稳定,我 3090 跑 Q4_K_M 大概 40 tok/s,够用了。但长上下文就吃力了,256K 完全吃不下。 -
TheCarlPedersen_pro—不过 agentic coding 的话 DeepSeek V4 和 Qwen Coder 确实比它强,多步推理差距明显。Codestral 2 做补全一流,做 agent 二流。 -
兰花279—不能做 screenshot-to-code 这些多模态任务,毕竟纯代码模型。但如果你只需要写代码,它的专注反而是优势,不会东拉西扯。 -
剑客_2—说实话它跟 GPT-5 Mini 比还是有差距的,但考虑到价格是后者的五分之一,这差距完全可以接受。小团队无脑入就对了。 -
iChandranSaha_88—在 Continue.dev 里用了两周 Codestral 2 做后端,配合 Tabnine 做前端,感觉后端的补全质量明显比前端好。Python 和 TypeScript 的补全准确率差距还是挺大的,Python 的话基本能猜中我要写什么。 -
琉璃_15—部署体验不错,vLLM 一行命令就起来了。22B dense 模型比 MoE 好调度,不用纠结 expert 路由问题,显存预估特别准。 -
Ryan693—把我们团队 6 个人的编辑器都换成了指向自托管 Codestral 2 的 Continue.dev,跑了两个月还挺稳定的。唯一的问题就是高峰期并发高了推理会慢下来,但总体能接受。 -
Sarah.Murray5209—欧洲出身的代码模型终于有个能打的了。之前 Copilot 的数据跑美国心里总有点隔应,换了 Mistral Code 踏实多了,反正我们主要写后端。 -
Pglar—自托管之后最大的好处就是没有速率限制了,以前用 Copilot 或者 Cursor 的 API 总是担心配额用完。自己在 4090 上跑,一天用几百万 token 都没人管,而且 22B 的功耗也比跑 70B 的模型省电多了。 -
JoshuaRussell_Plus—对比了 Qwen3 Coder 14B 和 Codestral 2,写指令式任务比如「写个 FastAPI CRUD」Qwen 更好,但纯补全和 FIM Codestral 更顺,看场景选。 -
heavymeercat299—之前以为 22B 的模型写代码应该没什么问题,实际用下来写日常业务代码确实可以,但我拿它写一个跨模块的重构方案就力不从心了。还是要结合场景来,别神话任何一个模型。 -
RitaKing—官方 VS Code 插件体验还可以,跟 Copilot 差别不大。但偶尔补全会吞字符,需要手动撤销再重来,频率大概一天一两次吧。 -
Janice_Perez_2024—刚把 Codestral 2 接进 Cursor 做 tab 补全,感觉比 Copilot 默认模型要准一些,补全大段重复代码的时候差别特别明显。 -
GAbro—一键生成 Go 语言的 gRPC 服务代码,proto 文件解析很准,Generate 出来的 server stub 和 client 基本不用改,接上业务逻辑就能跑。这种体验才是 AI 编程该有的样子。 -
Ronald_Foster369—Dockerfile 和 CI/CD 配置生成得很棒,给个上下文就能写出完整的多阶段构建脚本,包括依赖缓存优化那些细节都有,比自己手写快太多了。 -
DeltaDef_i309—做 RAG 项目写 Python 后端,FIM 确实强,光标放在函数中间也能补全,而且生成风格跟现有代码保持一致,不用手动调格式。 -
lARRY436—试了一下 Ollama 本地跑,Q4_K_M 大概 13GB,4060 Ti 16GB 勉强能跑,但上下文一长就 OOM,还是得换 3090。 -
hwwfqkq3vy—开源 license 解锁才是 Codestral 2 最大的新闻。之前多少人因为许可证望而却步,现在终于能往产品里塞了。这比 benchmark 提升有意义多了。 -
Lawrence_Johnson—Codestral 第一代那个 Non-Production License 搞得我很烦,不敢往产品里集成。二代直接变 Apache 2.0,这才是开源该有的态度。 -
u3t7blj—用它写 Python 的 FastAPI 接口简直是享受,模板代码几乎不用改,写多了感觉工作效率提升了一个档次。我一天能多写出 30% 的接口。 -
CosmosCris726—太强了!