Mistral Codestral 2
Mistral 第二代代码专用模型,Apache 2.0 重新授权后可合法自托管与商用,擅长 IDE 内联补全
詳細レポート
-
Codestral 2 は、Mistral AI の第 2 世代コード固有モデルです。最も重要な変更は 2026 年 4 月 8 日に発生しました。Mistral は元の「非実稼働ライセンス」から Apache 2.0 に再ライセンスしました。これは、最終的に商用製品や有料サービスに合法的に組み込むことができることを意味します。これは 22B の高密度 Transformer で、中間補完 (FIM) 補完をネイティブにサポートし、256K のコンテキスト ウィンドウを備え、80 以上のプログラミング言語をカバーします。その位置付けは非常に明確です。複雑なマルチステップのエージェント コーディングを実行するためのフラッグシップではなく、IDE インライン補完に優れた高速かつ安価なコード モデルです。これは、「独自の GPU で合法的なセルフホスト型コード補完」を望むチームや個人にとって、最もクリーンなオプションの 1 つです。
-
Mistral AI は、パリに本社を置くヨーロッパの大手モデル企業で、オープン ウェイトと「デジタル主権」の主張で長年知られています。 Codestral シリーズは、そのコード モデルを特化したラインです。 Codestral の第 1 世代は 2024 年 5 月にリリースされ、22B のパラメータと優れた機能を備えていましたが、商用利用が禁止され、研究とテストにのみ使用できる Mistral Non-Production License (MNPL) が採用されていました。このライセンス条項は、「有料 SaaS にインストールできるか?」など、開発者コミュニティに継続的な疑問を引き起こしています。 「非本番をどう定義するか」「半年で変わるのか?」繰り返し現れる。 バージョン履歴は大まかに次のとおりです: Codestral (2024.05、22B、MNPL) → Codestral 25.01 (2025.01、V2、改良されたトークナイザー、倍速、256K コンテキスト) → Codestral 2 (2026.04、Apache 2.0 で再認証)。 2026年のこの再認可は、「ライセンスを申請することなく、クローズドソースツールでの商用利用、結果の微調整、販売」を一度に許可するため、多くのレビューで「Llama 2の商業化以来最大のオープンソースコードライセンスのロック解除」と呼ばれている。さまざまなサードパーティのマテリアルは、パラメータとコンテキストに関して一貫性がないことに注意してください。Google Cloud Vertex AI の共同モデル ページでは、codestral-2 を GA、128K コンテキスト、2025 年 10 月にリリースされているとラベル付けしています。一部の評価サイトでは 32B、128K と書かれています。そして、コミュニティからの最も一貫した声明は、2026 年 4 月に再認可された 22B 密度、256K コンテキストです。この記事では、コミュニティで最も一貫性があり、再認可されたノードと一致する「22B 密度 / 256K / Apache 2.0」口径を使用し、リスクの章で口径の違いを指摘しています。
-
Codestral 2 のコア機能は、コード生成、特に FIM を中心に展開されています。 FIM は、モデルがコードの途中から前方および後方に完了できることを意味します。これは、IDE インライン グレー補完の基礎となるメカニズムです。 Mistral の内部ベンチマークによると、HumanEval で 86.6%、MBPP で 91.2% を達成し、BigCodeBench で高いランクにランクされています。 2026 年の主流言語である Python、TypeScript、Go、Rust、SQL 向けに最適化されており、80 以上の言語を基本的にカバーしています。 実際のワークフローでは、その長所が集中しています。 Continue.dev、VS Code、JetBrains、および Cline はすべてアクセス可能です。 Cursor は Chat と Cmd-K を Codestral 2 にルーティングできますが、Tab インライン補完は依然として Cursor 独自のクローズドソース モデルで実行され、リダイレクトできません。これは、Cursor のすべての外部バックエンドに課せられる同種の制限です。コミュニティの実測 (dev.to、2026 年 6 月、RTX 4090、Q4_K_M の定量化) によると、ショート完了は約 45 ~ 55 トークン/秒であり、チャットや変更には使用できますが、ロングリンク エージェントの実行は明らかにクラウドよりも遅いことがわかります。複数の開発者 (Enterprisedna によって集約された Reddit/HN フィードバック) は、その評価を一文にまとめました: 「これまで見た中で最高のオートコンプリーターであり、最もイライラするペア プログラマー」 - 1 回のラウンドでは高品質ですが、複数ファイルの再構築と曖昧なプロンプトの下では気弱です。
-
Codestral 2 の収益化パスは 2 つの層に分かれています。 1 つは重み自体をオープンにする方法です。Ollama または vLLM で自己ホストされている HuggingFace から重みをプルします。Apache 2.0 ライセンスに基づいて、モデルのコストはゼロで、ハードウェアのみが必要です。 2 つ目は、Mistral マネージド API で、トークンによって課金されます。100 万トークンあたり入力 0.30 ドル、出力 0.90 ドルで、Mistral Small/Medium 層と一致します。また、IDE 補完専用の独立した FIM エンドポイント (codestral.mistral.ai/v1/fim/completions) と、通常のチャット/補完エンドポイント (api.mistral.ai) もあります。また、Google Cloud Vertex AI(欧州西部4、米国中部1などのリージョン)を通じて提供され、Amazon Bedrockでも利用可能になることが発表されています。 水平価格比較: DeepSeek V4-Flash の入力は 0.14 米ドル、出力は 0.435 米ドルで、エージェント タスクにおいてはより安価で強力です。 Gemini 3.5 フラッシュの価格は約 1.50/6 ドルで、より高価であり、セルフホスティングおよび FIM エンドポイントをサポートしていません。言い換えれば、「合法的なセルフホスティング」列にあるのは Codestral 2 だけであり、純粋なクラウドの従量課金制の価格は最低価格ではありません。セルフホスト型ハードウェアのしきい値では、Q4_K_M は約 13.3GB と定量化されており、16GB グラフィックス カード (4060 Ti など) ではショート コンテキストをかろうじて実行できます。 24GB 3090 がスイート スポット (約 40 ~ 50 トークン/秒)、4090 は約 60 ~ 75 トークン/秒です。実稼働レベルでは、1 つの H100 80GB が完全な精度で実行できます。 48 GB のビデオ メモリは、完全な精度と適切なコンテキストで実行できます。ただし、256K コンテキストはサーバー/API レベルの機能であることに注意してください。コンシューマーグレードのグラフィックス カードは、16K ~ 16K の範囲では限界があり、256K に達することはできません。
-
実際の開発者コミュニティの声は現実的です。 Reddit と Hacker News では、オリジナルの Codestral がリリースされた日にスレッドに数百のコメントがありました。彼らは最初はベンチマークに興奮していましたが、次にライセンス条項に冷や水を浴びせました。 Apache 2.0 が 2026 年に再承認された後、チームのグループによって真剣に再評価されました。一般的に認識されている点: FIM の完了は Copilot レベルに近く、遅延が低い (単一の A100 での短い完了は 80 ~ 200 ミリ秒のトークンアウトで、クラウドの往復ではなくローカルの完了に似ています)、Python/TypeScript はスムーズです (クリーンなパンダ変換、適切な pytest スキャフォールディング、適切な型ヒント)。批判された点: 複雑なマルチファイルの再構築とファジーな要件の下ではパフォーマンスが不安定で、マルチラウンド推論は大規模なモデルよりも弱い。ライセンス履歴に起因する「ビジネスを構築できるか」という疑問は、2026 年になっても議論に現れています。HN に関する開発者の要約は広く広まっています。「最高のオートコンプリーター、最もイライラするペア プログラマー」 - この「1 ラウンドでは強いが、複数ラウンドでは弱い」という緊張感がコミュニティのコンセンサスです。
-
オープンウェイト コード モデルの 2026 年の展望において、Codestral 2 は Qwen2.5-Coder-32B、DeepSeek-Coder V3、StarCoder 3、IBM Granite Code 34B と同じステージに立っています。複数の横断的調査により、元のコード生成ベンチマークでは、オープン ウェイトとクローズド ソースのフラッグシップとの差はすでに非常に小さいことが指摘されています。実際のギャップは、実際の PR 受け入れ率にあります。これは、モデル自体ではなくエージェント ループの品質に依存するためです。総合評価サイト AIToolTier は、Codestral 2 に 7.5/10 の評価を与え、再ライセンスの重要性、最先端の FIM、予測可能な 22B 高密度メモリ、GDPR を満たす EU ホスティングを賞賛しました。減点項目は、クローズドソースのフラッグシップに遅れをとった複雑な推論、マルチモーダル/ネイティブ ツールの使用なし、ベンチマークの透明性の弱さ (Mistral は主に MBPP/HumanEval を公開し、サードパーティの SWE-bench/LiveCodeBench 検証は薄い)、SWE-bench Verified は Qwen Coder 3.5 や DeepSeek V3 Coder よりも数ポイント遅れています。見落とされがちな事実は、2026 年半ばに、ローカル エンコーディングにおいて高密度モデルが MoE (Qwen3-Coder、DeepSeek V4 など) に取って代わられたということです。 22B 高密度の利点は、速度や上限ではなく、予測可能なメモリです。
-
まず、バージョンと口径が混同されています。同じ「Codestral 2」でも、パラメータ (22B 対 32B)、コンテキスト (256K 対 128K)、公式 V2 (2025 年 1 月 25.01)、Vertex AI 連携モデル (2025 年 10 月 GA、128K とマーク)、および 2026 年 4 月の Apache 2.0 再認証の間でリリース時期に矛盾があります。企業は、特定のバージョンを確認する必要があります。はアクセス前に取得しており、第一世代 MNPL の重みを商用バージョンとして考慮しません。 第二に、能力の限界です。汎用エージェントではなく、補完に重点を置いたコード専門家です。複雑なマルチステップのエージェントコーディング、スクリーンショット変換、およびターミナルツールの実行には、Claude Code、Cursor Composer 2、または Devin を使用する必要があります。ネイティブのマルチモダリティやツールの使用はありません。 第三に、基本的な信頼性です。 Mistral が発表する HumanEval/MBPP の数値は内部評価です。 HumanEval は 2026 年には飽和状態に近づいており、これに基づいてランク付けすべきではありません。サードパーティの SWE ベンチ/LiveCodeBench 検証では不十分です。 第四に、地方展開の幻想。 256K コンテキストはマーケティングのハイライトですが、コンシューマー グレードのグラフィック カードは KV キャッシュにまったくフィードできません。実際に利用可能なコンテキストには、数千から 10,000 以上のトークンしかありません。最大限に使用したい場合は、サーバーグレードのグラフィックス メモリが必要です。 第五に、保存期間のリスク。オープンウェイトコードモデルは非常に迅速に反復されます。 「22B 高密度モデルの保存期間は 4 分の 1 単位で測定され」、機能と価格の両方が同じサイズの更新された MoE モデルによって 12 か月以内に押しつぶされる可能性があります。
-
適した対象: 合法的なセルフホスト コード補完を希望する個人およびチーム、コードのプライバシーが重要 (コードはローカル外に流出せず、顧客コードは NDA の下にある)、IDE 補完バックエンドとしてモデルを使用する (特に Continue.dev の FIM スロット)、クローズド ソースの商用製品にコード モデルを埋め込む (Apache 2.0 がリリースされている)、CI コード レビュー ボットまたは夜間のリファクタリング バッチ処理を実行する (従量課金制の請求はクローズドの数倍安い)出典)。 適さないもの: 複雑な複数ステップのエージェントコーディングを必要とするもの (Claude Code / Devin / DeepSeek V4-Flash を選択)、スクリーンショット変換またはターミナルツールの実行を必要とするもの、非常に大規模なコンテキストの質問と回答のライブラリ全体を必要とするもの (Llama 4 Scout の 10M コンテキストは、この種の「パーティー トリック」に似ています)。 エディター固有: 独自の GPU で合法的に実行できる最高のインライン補完が必要な場合は、それを Continue.dev の FIM スロットに接続します。 Cursor を使用する場合、Cursor は Chat/Cmd-K を引き継ぐことしかできず、Tab は依然として Cursor のものです。 Cline のエージェント バックエンドを作成する場合、「このフォーカス変更を適用する」タイプのタスクには適していますが、「統合テストがフローティングになっている理由を見つけて修正する」タイプのタスクには適していません。 代替案: 純粋なクラウド エージェント バックエンドの場合は、DeepSeek V4-Flash (より安価で強力) を選択します。オープンソースの重みでエージェントのチャンピオンが欲しい場合は、DeepSeek-Coder V3 (236B MoE) を見てください。ライブラリ全体に関する長期にわたる状況に応じた Q&A については、Llama 4 Scout を参照してください。最も自由なエンタープライズ ライセンスについては、IBM Granite Code 34B (Apache 2.0) を参照してください。
-
Codestral 2 の本当の価値はパラメータやベンチマークではなく、Apache 2.0 ライセンスです。これは、高品質で 22B の予測可能な、FIM をリードするセルフホスト コード補完モデルを、「研究玩具」から「製品に組み込んでお金で販売できる」準拠コンポーネントに変えます。それが得意とすること (インライン補完、プライベートローカリゼーション、商用埋め込み) に使用すれば、お金を払う価値があります。最先端のエージェント エンコーダに代わるものだと期待するとがっかりするでしょう。
ユーザーレビュー
-
MarthaKing_202389—Copilot 替代品完全够格,自托管不用担心代码被拿去训练。隐私这块确实比 Copilot 强,而且代码生成质量也不输多少。 -
MetaHub_io—FIM 是亮点,但跨文件重构能力比 Cursor 差远了。写新代码很合适,改老代码不太行,上下文一多就糊了。 -
rkm6ukb6—想拿来给 Cline 做 backend 跑 agent 任务,结果多文件改代码的时候经常掉链子,上下文理解不够深。还是换回 DeepSeek 当主力了。 -
greendog148—建议所有考虑自托管代码模型的人都试试,22B 的 dense 模型部署最简单,不像 DeepSeek 那么大。而且 Apache 2.0 完全没法律风险。 -
BillyMurray369—用了两个月 Codestral 2 的感受:API 做补全很好但做 chat 不够聪明,自托管做补全也够用但 token/s 上不去。总体来说值回票价。 -
RavenRocketGreen—shiporskip 上 4-0 全票通过,说 Apache 2.0 + Ollama 自托管这个组合确实能打。看了那篇评测写得挺客观的,优点缺点都说了。 -
DKing—Mistral 这次把 Codestral 2 做成 Apache 2.0 是真的有诚意。仔细想想这个决定的影响:之前因为许可证不敢用的企业现在都可以上了,整个开��代码补全的市场格局都会变,Copilot 不再是唯一的选择了。 -
韩艳—Apache 2.0 之后终于敢在公司项目里用了,之前那个非商业许可证太坑了,问法务都说不行。改完协议直接 ollama pull 就在本地跑了。 -
Marilyn_Simmons_77—用 Continue.dev 接上 Codestral 2 做代码补全,确实比之前用 DeepSeek 快,响应基本在 200ms 以内,写 TypeScript 的时候体验很好。 -
Angela_Davis520—22B 的 dense 模型显存占用很稳定,我 3090 跑 Q4_K_M 大概 40 tok/s,够用了。但长上下文就吃力了,256K 完全吃不下。 -
TheCarlPedersen_pro—不过 agentic coding 的话 DeepSeek V4 和 Qwen Coder 确实比它强,多步推理差距明显。Codestral 2 做补全一流,做 agent 二流。 -
兰花279—不能做 screenshot-to-code 这些多模态任务,毕竟纯代码模型。但如果你只需要写代码,它的专注反而是优势,不会东拉西扯。 -
剑客_2—说实话它跟 GPT-5 Mini 比还是有差距的,但考虑到价格是后者的五分之一,这差距完全可以接受。小团队无脑入就对了。 -
iChandranSaha_88—在 Continue.dev 里用了两周 Codestral 2 做后端,配合 Tabnine 做前端,感觉后端的补全质量明显比前端好。Python 和 TypeScript 的补全准确率差距还是挺大的,Python 的话基本能猜中我要写什么。 -
琉璃_15—部署体验不错,vLLM 一行命令就起来了。22B dense 模型比 MoE 好调度,不用纠结 expert 路由问题,显存预估特别准。 -
Ryan693—把我们团队 6 个人的编辑器都换成了指向自托管 Codestral 2 的 Continue.dev,跑了两个月还挺稳定的。唯一的问题就是高峰期并发高了推理会慢下来,但总体能接受。 -
Sarah.Murray5209—欧洲出身的代码模型终于有个能打的了。之前 Copilot 的数据跑美国心里总有点隔应,换了 Mistral Code 踏实多了,反正我们主要写后端。 -
Pglar—自托管之后最大的好处就是没有速率限制了,以前用 Copilot 或者 Cursor 的 API 总是担心配额用完。自己在 4090 上跑,一天用几百万 token 都没人管,而且 22B 的功耗也比跑 70B 的模型省电多了。 -
JoshuaRussell_Plus—对比了 Qwen3 Coder 14B 和 Codestral 2,写指令式任务比如「写个 FastAPI CRUD」Qwen 更好,但纯补全和 FIM Codestral 更顺,看场景选。 -
heavymeercat299—之前以为 22B 的模型写代码应该没什么问题,实际用下来写日常业务代码确实可以,但我拿它写一个跨模块的重构方案就力不从心了。还是要结合场景来,别神话任何一个模型。 -
RitaKing—官方 VS Code 插件体验还可以,跟 Copilot 差别不大。但偶尔补全会吞字符,需要手动撤销再重来,频率大概一天一两次吧。 -
Janice_Perez_2024—刚把 Codestral 2 接进 Cursor 做 tab 补全,感觉比 Copilot 默认模型要准一些,补全大段重复代码的时候差别特别明显。 -
GAbro—一键生成 Go 语言的 gRPC 服务代码,proto 文件解析很准,Generate 出来的 server stub 和 client 基本不用改,接上业务逻辑就能跑。这种体验才是 AI 编程该有的样子。 -
Ronald_Foster369—Dockerfile 和 CI/CD 配置生成得很棒,给个上下文就能写出完整的多阶段构建脚本,包括依赖缓存优化那些细节都有,比自己手写快太多了。 -
DeltaDef_i309—做 RAG 项目写 Python 后端,FIM 确实强,光标放在函数中间也能补全,而且生成风格跟现有代码保持一致,不用手动调格式。 -
lARRY436—试了一下 Ollama 本地跑,Q4_K_M 大概 13GB,4060 Ti 16GB 勉强能跑,但上下文一长就 OOM,还是得换 3090。 -
hwwfqkq3vy—开源 license 解锁才是 Codestral 2 最大的新闻。之前多少人因为许可证望而却步,现在终于能往产品里塞了。这比 benchmark 提升有意义多了。 -
Lawrence_Johnson—Codestral 第一代那个 Non-Production License 搞得我很烦,不敢往产品里集成。二代直接变 Apache 2.0,这才是开源该有的态度。 -
u3t7blj—用它写 Python 的 FastAPI 接口简直是享受,模板代码几乎不用改,写多了感觉工作效率提升了一个档次。我一天能多写出 30% 的接口。 -
CosmosCris726—太强了!