Mistral Small 3.1
法國AI初創公司Mistral AI釋出的240億引數開源多模態模型,在文字和多模態任務上表現出色
深度報告
-
Mistral Small 3.1 是法國AI初創公司Mistral AI於2025年3月17日釋出的新一代開源多模態模型,擁有240億引數,在文字處理和多模態理解方面表現出色,支援長達128K的上下文長度。官方聲稱該模型是同級別中的最佳模型,在多項基準測試中超越OpenAI和Google的同類產品。
-
Mistral AI是一家法國人工智慧初創公司,由前Google DeepMind和Meta研究人員創立。該公司致力於開發開源高效的AI模型,在大語言模型領域與OpenAI、Google等巨頭競爭。Mistral Small 3.1是其針對輕量級場景推出的重要產品,旨在讓開發者能夠在消費級硬體上執行強大的AI能力。
-
Mistral Small 3.1的核心功能包括:文字理解和生成、多模態理解(支援影象輸入)、長上下文處理(128K tokens)、程式碼編寫和數學推理。模型能夠在單張RTX 4090顯示卡或32GB記憶體的Mac裝置上執行,每秒可處理約150個tokens。模型基於Apache 2.0許可證開源釋出。
-
根據官方基準測試,Mistral Small 3.1在多項測試中超越GPT-4o Mini和Google Gemma 3等競品,尤其在程式碼生成和數學推理方面表現突出。輕量級設計使其成為本地部署和邊緣裝置的理想選擇。
-
該模型適合需要本地部署AI能力的企業和個人開發者,以及對資料隱私有要求的應用場景。適用於程式設計輔助、文件理解、對話系統等多種應用。
-
Mistral Small 3.1為開源社群提供了一個高效能的輕量級選擇,240億引數的設計在效率和效能之間取得良好平衡,是追求本地化AI部署的使用者值得關注的選項。
使用者評論
-
EthanRoss_Pro—在 4090 上跑了幾天 Mistral Small 3.1,分類和文件抽取的準確率確實穩,結構化輸出基本不翻車。但做複雜推理是真不行,稍微繞一點的邏輯鏈就斷,還是老老實實用大模型吧。 -
MTurnerX—Apache 2.0 授權真香,公司合規審查直接過了,不用跟法務扯皮。之前用某個國產模型的許可證卡了好久,律師費都花了不少,換成這個之後合規部門一句話沒說就批了,省心。 -
iShreyaShayana_dev—128k 上下文看起來挺大,實際用起來給足 128k 時注意力衰減很明顯,中間段資訊召回率感人。建議不要貪長,實際控制在 32k 以內效果最好。 -
KathleenRiveraX—試了試 Mistral Small 3.1 的 OCR 能力,中文單據識別效果還行,但表格結構提取偶爾會亂,需要後處理校正。 -
清風_6—這個模型寫出來的東西感覺太正經了,像公務員寫報告一樣,少點靈氣。同樣的 task 換成 Llama 3.3 生成的結果有意思得多。 -
Noah.Powell_99—搞了個批次文字分類 pipeline,每小時處理幾十萬條,成本不到一毛錢,就是這個場景的神器。之前用 GPT-4o Mini 跑同樣的量,一天就要好幾十美金,直接換 Small 3.1 成本降了兩個數量級,準確率就掉了兩個點,完全能接受。 -
svxjdv6vj—函式呼叫確實比同體量的模型強不少,tools 定義好後基本不會亂填引數。但多步 agent 流程裡狀態保持還是差點意思,複雜任務容易丟上下文。 -
廖梅—說實話這個模型的定價在漲,五月份到現在翻了兩倍多,雖然絕對值還是便宜但漲幅真的誇張。 -
PRalv99—本地部署在 M4 Max 上還挺順暢的,32G 記憶體 4bit 量化能跑 30 token/s 左右,日常寫寫郵件摘要夠用了。 -
LCooper369—做過完整的對比評測,Phi-4 在數學和程式碼上確實強一截,但 Mistral Small 3.1 的歐洲語言支援真是獨一檔。我們產品要同時上法語德語義大利語,用別的模型小語種表現拉胯,換 Small 3.1 之後多語言效果肉眼可見地好了。 -
邵桂—用來做文件問答還行,前提是文件結構清晰。如果是一堆掃描件混排,效果就會打折扣。 -
DFisher_Plus—SimpleQA 只有 10%,這個事實召回能力確實離譜了,RAG 不是 options 是必需品懂吧。任何不配檢索增強生成的場景,用這個模型就是給自己埋坑,使用者隨便問個事實性問題就給你胡編一個答案出來。 -
AnnReed_72—終於把部署架構改成了雙 A100 跑 bf16,吞吐上來了但價效比還是不如 vLLM 量化版。 -
LoganFlores00716—做競品分析發現 DeepSeek V4-Flash 的價格是它的一半,上下文還是 1M。如果不是有歐盟資料主權需求,實在想不出選 Small 3.1 的理由。但反過來說,如果客戶是歐洲公司要求 GDPR 合規+資料不出境,那 Small 3.1 基本上就是唯一的答案了。 -
xayyp5—公司專案用了 Small 3.1 做客服意圖識別,上線兩個月準確率 93%,比之前用的 GPT-4o Mini 差一兩個點但成本只有十分之一,老闆很滿意。關鍵是部署在本地,使用者聊天資料不用出伺服器,隱私合規這一塊也讓法務很放心。 -
JustinGreen_99—才釋出三個月就被 3.2 超過了,買 3.1 有點虧啊,早知道等 3.2 了。 -
MarkKelly_Pro884—文件理解方面真是同級別的天花板,94% 的 DocVQA 得分不是吹的,處理發票和合同比預期好很多。我們做財務自動化專案,用它做票據識別和資訊提取,準確率直接替代了之前專門的 OCR 方案。 -
Nicholas.CookK—在 RTX 4090 上部署了就再沒碰過雲端 API,資料不出本地的安全感對甲方來說太重要了。 -
8p7qha5or_q—7B 模型搞不定的分類任務它搞定了,70B 模型能做的它勉強能做,定位其實挺尷尬的。真正適合它的場景反而是那些不需要複雜推理但需要高吞吐和低延遲的批次處理任務,比如文字分類、資訊抽取這些,在這些場景下價效比確實無敵。 -
AngelaBrooksIII7—用了幾個月了,最適合的場景就是批次文件處理——分類、提取、摘要一條龍,穩定性和一致性吊打同尺寸其他模型。我們內部每天跑幾萬份 PDF 合同,用 vLLM 搭的 batch 推理,連續跑了三個月就出過一次小問題,比之前用雲端 API 省了至少 70% 的成本。 -
VildanHakyemez—那個 150 token/s 的速度確實不是吹的,體感比 Phi-4 快一倍都不止。 -
Terry.Torres5206—英語之外的語種表現很棒,我們做德語法語客服系統,之前用 GPT 翻車的地方 Small 3.1 反而做得更好。德語那種長複合詞和複雜句式,很多模型處理不好,但這個模型因為本身就是法國團隊做的,對歐洲語言理解比美國模型深不少。 -
Jade641—多模態能力確實有,但跟 GPT-4o 比還是有差距,複雜圖表分析經常讀錯資料。簡單任務的話沒問題。 -
JMartin_88726—對比了一圈,如果要結構化輸出+本地部署+多語言,Small 3.1 目前是沒有對手的。其他方面各有取捨吧。 -
蔣軒晨—入手了。24B 跑在 4090 上出乎意料地流暢,不過滿上下文時視訊記憶體快滿了,得注意控制。建議實際部署把 max_context 調到 64k 左右,既能滿足大部分場景需求,也能給併發請求留出餘量。3.2 版本的指令遵循能力提升不少,如果還沒部署的建議直接上 3.2。 -
Charles.JohnsonZ37—程式碼補全還行,但寫複雜一點的業務邏輯就不太行了,不如 Codestral 或者專門的程式碼模型。 -
Harold.Ramirez_881—法語和德語的支援是絕活,歐洲團隊做本地化專案首選,沒有之一。 -
David_Ward_8806—我們拿來做郵件自動分類和回覆草稿,配合 vLLM 部署,穩定跑了兩個月沒出過么蛾子。 -
brownbutterfly456—單卡就能跑的 vision model 裡這個算是最好的選擇之一了,尤其是做文件 OCR 場景。 -
Melissa.Roberts_2023—升級到 3.2 了,指令遵循確實好了一些,但 3.1 也不差,不值得專門從 3.1 升級。