Mistral Codestral 2

Mistral 第二代程式碼專用模型,Apache 2.0 重新授權後可合法自託管與商用,擅長 IDE 內聯補全

深度報告

  • Codestral 2 是 Mistral AI 的第二代程式碼專用模型,最關鍵的變動發生在 2026 年 4 月 8 日:Mistral 將其從初代的「非生產許可」重新授權為 Apache 2.0,意味著它終於可以合法地嵌入商用產品和付費服務。它是一枚 22B 的密集(dense)Transformer,原生支援中間填充(FIM)補全,擁有 256K 上下文視窗,覆蓋 80 多種程式語言。它的定位很清晰:一枚又快又便宜、擅長 IDE 內聯補全的程式碼模型,而不是用來跑複雜多步智慧體編碼的旗艦。對想要「在自己 GPU 上合法自託管程式碼補全」的團隊和個人來說,它是目前最乾淨的選擇之一。

  • Mistral AI 是一家總部位於巴黎的歐洲大模型公司,長期以開放權重和「數字主權」敘事著稱。Codestral 系列是其程式碼模型的專門線。初代 Codestral 於 2024 年 5 月釋出,22B 引數,能力不俗,但採用了 Mistral Non-Production License(MNPL),禁止商業使用,只能用於研究和測試。這一許可條款在開發者社群引發了持續的懷疑——「能不能把它裝進付費 SaaS」「非生產怎麼界定」「半年後會不會變」之類的問題反覆出現。 版本沿革大致是:Codestral(2024.05,22B,MNPL)→ Codestral 25.01(2025.01,即 V2,改進了 tokenizer、速度翻倍、256K 上下文)→ Codestral 2(2026.04,在 Apache 2.0 下重新授權)。2026 年的這次重新授權,被多家評測稱為「自 Llama 2 商用化以來最大的開原始碼許可解鎖」,因為它把「可在閉源工具裡商用、可微調並售賣結果、無需申請許可」一次性放開。需要注意,不同第三方資料對引數和上下文的口徑並不一致:谷歌雲 Vertex AI 上的合作模型頁把 codestral-2 標註為 GA、128K 上下文、2025 年 10 月釋出;部分評測站點寫作 32B、128K;而社群最一致的說法是 22B dense、256K 上下文、2026 年 4 月重新授權。本文以社群最一致、且與重新授權節點吻合的「22B dense / 256K / Apache 2.0」口徑為準,並在風險章點明口徑差異。

  • Codestral 2 的核心能力圍繞程式碼生成,尤其是 FIM。FIM 指模型能從一段程式碼的中間位置向前向後補全,這正是 IDE 內聯灰色補全的底層機制。Mistral 內部基準稱其在 HumanEval 上 86.6%、MBPP 上 91.2%,在 BigCodeBench 上排名靠前。它針對 2026 年的主流語言做了最佳化:Python、TypeScript、Go、Rust、SQL,同時對 80 多種語言有基本覆蓋。 在真實工作流裡,它的強項很集中。Continue.dev、VS Code、JetBrains、Cline 都能接入;Cursor 可以把 Chat 和 Cmd-K 路由到 Codestral 2,但 Tab 內聯補全仍跑在 Cursor 自有的閉源模型上、無法重定向——這是每個外部後端在 Cursor 裡都有的同質限制。社群實測(dev.to,2026 年 6 月,RTX 4090,Q4_K_M 量化)顯示短補全約 45–55 token/秒,做聊天和改動能用,但跑長鏈路智慧體明顯慢於雲端。多位開發者(enterprisedna 彙總的 Reddit/HN 反饋)把它的評價濃縮成一句話:「我見過最好的自動補全器,也是最令人沮喪的結對程式設計師」——單輪生成質量高,多檔案重構和含糊提示下會露怯。

  • Codestral 2 的變現路徑分兩層。其一是開放權重本身:Apache 2.0 授權下,從 HuggingFace 拉取權重、用 Ollama 或 vLLM 自託管,模型費用為零,只需硬體。其二是 Mistral 託管 API,按 token 計費:輸入 0.30 美元、輸出 0.90 美元每百萬 token,與 Mistral Small/Medium 檔位一致;它還有獨立的 FIM 端點(codestral.mistral.ai/v1/fim/completions)專供 IDE 補全,以及常規聊天/補全端點(api.mistral.ai)。此外它透過 Google Cloud Vertex AI 提供(在歐洲 west4、美國 central1 等區域),並預告將上 Amazon Bedrock。 橫向比價:DeepSeek V4-Flash 輸入 0.14、輸出 0.435 美元,更便宜且在 agent 任務上更強;Gemini 3.5 Flash 約 1.50 / 6 美元,更貴且不支援自託管和 FIM 端點。換句話說,Codestral 2 在「可合法自託管」這一欄是獨一檔,純雲端按量計費則並非最低價。自託管硬體門檻上,Q4_K_M 量化約 13.3GB,16GB 顯示卡(如 4060 Ti)能勉強跑短上下文,24GB 的 3090 是甜點(約 40–50 token/秒),4090 約 60–75 token/秒,生產級用單張 H100 80GB 跑滿精度;48GB 視訊記憶體可滿精度帶合理上下文。但務必注意:256K 上下文是伺服器/API 層面的能力,消費級顯示卡在 16K–16K 上下文就會吃緊,遠到不了 256K。

  • 真實開發者社群的聲音偏務實。Reddit 和 Hacker News 上,初代 Codestral 釋出當天的執行緒幾小時內數百條評論,先是對基準興奮,隨後被許可條款澆了冷水;2026 年 Apache 2.0 重新授權後又被一批團隊嚴肅二次評估。普遍認可的點:FIM 補全接近 Copilot 級別、延遲低(單張 A100 上短補全 80–200 毫秒 token-out,像本地補全而非雲端往返)、Python/TypeScript 流暢(乾淨的 pandas 變換、像樣的 pytest 腳手架、合理的型別提示)。被詬病的點:複雜多檔案重構和模糊需求下表現不穩,多輪推理弱於更大的模型;許可證歷史造成的「我能不能在它上面建生意」的疑慮至今仍在 2026 年的討論裡出現。一位開發者在 HN 上的總結流傳很廣:「最好的自動補全器,最令人沮喪的結對程式設計師」——這種「單輪強、多輪弱」的張力是社群共識。

  • 在開放權重程式碼模型的 2026 年格局裡,Codestral 2 與 Qwen2.5-Coder-32B、DeepSeek-Coder V3、StarCoder 3、IBM Granite Code 34B 同臺。多項橫向研究指出,在原始程式碼生成基準上,開放權重與閉源旗艦的差距已經很小;真正的落差在真實 PR 接受率上,因為這取決於 agent loop 的質量而非模型本身。綜合評分站點 AIToolTier 給 Codestral 2 打 7.5/10,贊其重新授權的意義、FIM 領先、22B dense 視訊記憶體可預測、EU 託管滿足 GDPR;減分項則是複雜推理落後閉源旗艦、無多模態/原生 tool-use、基準透明度偏弱(Mistral 主要發 MBPP/HumanEval,第三方 SWE-bench / LiveCodeBench 驗證較薄),以及 SWE-bench Verified 落後 Qwen Coder 3.5、DeepSeek V3 Coder 幾個點。一個常被忽視的事實是:2026 年中,密集模型在本地編碼上已被 MoE(Qwen3-Coder、DeepSeek V4 等)反超,22B dense 的優勢是視訊記憶體可預測,而非速度或上限。

  • 第一,版本與口徑混亂。同一個「Codestral 2」在官方 V2(25.01,2025 年 1 月)、Vertex AI 合作模型(標註 2025 年 10 月 GA、128K)、以及 2026 年 4 月 Apache 2.0 重新授權之間,引數(22B 對 32B)、上下文(256K 對 128K)、釋出時間都存在衝突。企業接入前應核實自己拿到的是哪個具體版本,別把初代 MNPL 權重當成可商用版本。 第二,能力邊界。它是專注補全的 code-specialist,不是通用智慧體。複雜多步 agentic 編碼、截圖轉程式碼、終端工具執行,要用 Claude Code、Cursor Composer 2 或 Devin;它自身沒有原生多模態和 tool-use。 第三,基準可信度。Mistral 自己釋出的 HumanEval/MBPP 數字是內部評測,HumanEval 在 2026 年已接近飽和,不應據此排座次;第三方 SWE-bench/LiveCodeBench 驗證偏少。 第四,本地部署幻象。256K 上下文是營銷亮點,但消費級顯示卡根本喂不飽 KV 快取,真實可用上下文只有幾千到一萬多 token;想用滿需要伺服器級視訊記憶體。 第五,保質期風險。開放權重程式碼模型迭代極快,一枚 22B 密集模型的「貨架期按季度計」,12 個月內就可能被更新的 MoE 同尺寸模型在能力和價格上雙重碾壓。

  • 適合:想要合法自託管程式碼補全的個人和團隊、程式碼隱私敏感(程式碼不出本地、客戶程式碼在 NDA 下)、把模型作為 IDE 補全後端(尤其 Continue.dev 的 FIM 槽位)、在閉源商用產品裡內嵌程式碼模型(Apache 2.0 放開)、跑 CI 程式碼審查 bot 或夜間重構批處理(按量計費比閉源便宜數倍)。 不適合:需要複雜多步智慧體編碼的(選 Claude Code / Devin / DeepSeek V4-Flash)、需要截圖轉程式碼或終端工具執行的、需要整庫超大上下文問答的(Llama 4 Scout 的 10M 上下文更像這類「派對把戲」)。 具體到編輯器:如果你要的是最好的內聯補全且能合法跑在自己 GPU 上,把它接進 Continue.dev 的 FIM 槽位;如果用 Cursor,它只能接管 Chat/Cmd-K,Tab 還是 Cursor 自己的。如果要做 Cline 的 agent 後端,它適合「應用這個聚焦改動」類任務,不適合「搞清楚整合測試為什麼飄並修好它」。 替代方案:純雲端 agent 後端選 DeepSeek V4-Flash(更便宜更強);想要開源權重裡的 agentic 冠軍看 DeepSeek-Coder V3(236B MoE);整庫長上下文問答看 Llama 4 Scout;企業最寬鬆許可看 IBM Granite Code 34B(Apache 2.0)。

  • Codestral 2 真正值錢的地方不是引數或基準,而是那張 Apache 2.0 許可證——它把一枚質量過硬、22B 可預測、FIM 領先、能自託管的程式碼補全模型,從「研究玩具」變成了「可以裝進產品賣錢」的合規元件。把它用在它擅長的地方(內聯補全、隱私本地化、商用內嵌),它物超所值;指望它替代前沿智慧體編碼器,則會失望。

使用者評論

  • 頭像
    MarthaKing_202389
    Copilot 替代品完全夠格,自託管不用擔心程式碼被拿去訓練。隱私這塊確實比 Copilot 強,而且程式碼生成質量也不輸多少。

  • 頭像
    MetaHub_io
    FIM 是亮點,但跨檔案重構能力比 Cursor 差遠了。寫新程式碼很合適,改老程式碼不太行,上下文一多就糊了。

  • 頭像
    rkm6ukb6
    想拿來給 Cline 做 backend 跑 agent 任務,結果多檔案改程式碼的時候經常掉鏈子,上下文理解不夠深。還是換回 DeepSeek 當主力了。

  • 頭像
    greendog148
    建議所有考慮自託管程式碼模型的人都試試,22B 的 dense 模型部署最簡單,不像 DeepSeek 那麼大。而且 Apache 2.0 完全沒法律風險。

  • 頭像
    BillyMurray369
    用了兩個月 Codestral 2 的感受:API 做補全很好但做 chat 不夠聰明,自託管做補全也夠用但 token/s 上不去。總體來說值回票價。

  • 頭像
    RavenRocketGreen
    shiporskip 上 4-0 全票透過,說 Apache 2.0 + Ollama 自託管這個組合確實能打。看了那篇評測寫得挺客觀的,優點缺點都說了。

  • 頭像
    DKing
    Mistral 這次把 Codestral 2 做成 Apache 2.0 是真的有誠意。仔細想想這個決定的影響:之前因為許可證不敢用的企業現在都可以上了,整個開��程式碼補全的市場格局都會變,Copilot 不再是唯一的選擇了。

  • 頭像
    韓豔
    Apache 2.0 之後終於敢在公司專案裡用了,之前那個非商業許可證太坑了,問法務都說不行。改完協議直接 ollama pull 就在本地跑了。

  • 頭像
    Marilyn_Simmons_77
    用 Continue.dev 接上 Codestral 2 做程式碼補全,確實比之前用 DeepSeek 快,響應基本在 200ms 以內,寫 TypeScript 的時候體驗很好。

  • 頭像
    Angela_Davis520
    22B 的 dense 模型視訊記憶體佔用很穩定,我 3090 跑 Q4_K_M 大概 40 tok/s,夠用了。但長上下文就吃力了,256K 完全吃不下。

  • 頭像
    TheCarlPedersen_pro
    不過 agentic coding 的話 DeepSeek V4 和 Qwen Coder 確實比它強,多步推理差距明顯。Codestral 2 做補全一流,做 agent 二流。

  • 頭像
    蘭花279
    不能做 screenshot-to-code 這些多模態任務,畢竟純程式碼模型。但如果你只需要寫程式碼,它的專注反而是優勢,不會東拉西扯。

  • 頭像
    劍客_2
    說實話它跟 GPT-5 Mini 比還是有差距的,但考慮到價格是後者的五分之一,這差距完全可以接受。小團隊無腦入就對了。

  • 頭像
    iChandranSaha_88
    在 Continue.dev 裡用了兩週 Codestral 2 做後端,配合 Tabnine 做前端,感覺後端的補全質量明顯比前端好。Python 和 TypeScript 的補全準確率差距還是挺大的,Python 的話基本能猜中我要寫什麼。

  • 頭像
    琉璃_15
    部署體驗不錯,vLLM 一行命令就起來了。22B dense 模型比 MoE 好排程,不用糾結 expert 路由問題,視訊記憶體預估特別準。

  • 頭像
    Ryan693
    把我們團隊 6 個人的編輯器都換成了指向自託管 Codestral 2 的 Continue.dev,跑了兩個月還挺穩定的。唯一的問題就是高峰期併發高了推理會慢下來,但總體能接受。

  • 頭像
    Sarah.Murray5209
    歐洲出身的程式碼模型終於有個能打的了。之前 Copilot 的資料跑美國心裡總有點隔應,換了 Mistral Code 踏實多了,反正我們主要寫後端。

  • 頭像
    Pglar
    自託管之後最大的好處就是沒有速率限制了,以前用 Copilot 或者 Cursor 的 API 總是擔心配額用完。自己在 4090 上跑,一天用幾百萬 token 都沒人管,而且 22B 的功耗也比跑 70B 的模型省電多了。

  • 頭像
    JoshuaRussell_Plus
    對比了 Qwen3 Coder 14B 和 Codestral 2,寫指令式任務比如「寫個 FastAPI CRUD」Qwen 更好,但純補全和 FIM Codestral 更順,看場景選。

  • 頭像
    heavymeercat299
    之前以為 22B 的模型寫程式碼應該沒什麼問題,實際用下來寫日常業務程式碼確實可以,但我拿它寫一個跨模組的重構方案就力不從心了。還是要結合場景來,別神話任何一個模型。

  • 頭像
    RitaKing
    官方 VS Code 外掛體驗還可以,跟 Copilot 差別不大。但偶爾補全會吞字元,需要手動撤銷再重來,頻率大概一天一兩次吧。

  • 頭像
    Janice_Perez_2024
    剛把 Codestral 2 接進 Cursor 做 tab 補全,感覺比 Copilot 預設模型要準一些,補全大段重複程式碼的時候差別特別明顯。

  • 頭像
    GAbro
    一鍵生成 Go 語言的 gRPC 服務程式碼,proto 檔案解析很準,Generate 出來的 server stub 和 client 基本不用改,接上業務邏輯就能跑。這種體驗才是 AI 程式設計該有的樣子。

  • 頭像
    Ronald_Foster369
    Dockerfile 和 CI/CD 配置生成得很棒,給個上下文就能寫出完整的多階段構建指令碼,包括依賴快取最佳化那些細節都有,比自己手寫快太多了。

  • 頭像
    DeltaDef_i309
    做 RAG 專案寫 Python 後端,FIM 確實強,游標放在函式中間也能補全,而且生成風格跟現有程式碼保持一致,不用手動調格式。

  • 頭像
    lARRY436
    試了一下 Ollama 本地跑,Q4_K_M 大概 13GB,4060 Ti 16GB 勉強能跑,但上下文一長就 OOM,還是得換 3090。

  • 頭像
    hwwfqkq3vy
    開源 license 解鎖才是 Codestral 2 最大的新聞。之前多少人因為許可證望而卻步,現在終於能往產品裡塞了。這比 benchmark 提升有意義多了。

  • 頭像
    Lawrence_Johnson
    Codestral 第一代那個 Non-Production License 搞得我很煩,不敢往產品裡整合。二代直接變 Apache 2.0,這才是開源該有的態度。

  • 頭像
    u3t7blj
    用它寫 Python 的 FastAPI 介面簡直是享受,模板程式碼幾乎不用改,寫多了感覺工作效率提升了一個檔次。我一天能多寫出 30% 的介面。

  • 頭像
    CosmosCris726
    太強了!