Mistral Small 3.1
フランスの AI スタートアップ Mistral AI がリリースした 240 億パラメータのオープンソース マルチモーダル モデルは、テキストおよびマルチモーダル タスクで優れたパフォーマンスを発揮します
詳細レポート
-
Mistral Small 3.1 は、フランスの AI スタートアップ企業 Mistral AI によって 2025 年 3 月 17 日にリリースされた新世代のオープンソース マルチモーダル モデルです。これには 240 億のパラメータがあり、テキスト処理とマルチモーダル理解で優れたパフォーマンスを発揮し、最大 128K のコンテキスト長をサポートします。当局者らは、このモデルは複数のベンチマークテストでOpenAIやGoogleの同様の製品を上回り、同クラス最高のモデルであると主張している。
-
Mistral AI は、元 Google DeepMind および Meta 研究者によって設立されたフランスの人工知能スタートアップです。同社は、大規模言語モデルの分野で OpenAI や Google などの巨人と競争するために、オープンソースで効率的な AI モデルの開発に取り組んでいます。 Mistral Small 3.1 は、開発者が消費者グレードのハードウェアで強力な AI 機能を実行できるようにすることを目的として、軽量シナリオ向けに発売された重要な製品です。
-
Mistral Small 3.1 の中核機能には、テキストの理解と生成、マルチモーダルの理解 (画像入力のサポート)、長いコンテキストの処理 (128K トークン)、コードの作成、および数学的推論が含まれます。このモデルは、1 つの RTX 4090 グラフィックス カードまたは 32 GB のメモリを搭載した Mac デバイス上で実行でき、1 秒あたり約 150 トークンを処理できます。このモデルは、Apache 2.0 ライセンスに基づいてオープン ソースでリリースされています。
-
公式ベンチマーク テストによると、Mistral Small 3.1 は複数のテスト、特にコード生成と数学的推論において、GPT-4o Mini や Google Gemma 3 などの競合製品を上回りました。軽量設計により、オンプレミスの導入やエッジ デバイスに最適です。
-
このモデルは、AI 機能をローカルに展開する必要がある企業や個人の開発者だけでなく、データ プライバシーが必要なアプリケーション シナリオにも適しています。プログラミング支援、文書理解、対話システムなど、さまざまな用途に適しています。
-
Mistral Small 3.1 は、オープンソース コミュニティに高性能の軽量オプションを提供します。 240 億のパラメータ設計により、効率とパフォーマンスのバランスが取れています。ローカライズされた AI の導入を追求するユーザーにとって、注目に値するオプションです。
ユーザーレビュー
-
EthanRoss_Pro—在 4090 上跑了几天 Mistral Small 3.1,分类和文档抽取的准确率确实稳,结构化输出基本不翻车。但做复杂推理是真不行,稍微绕一点的逻辑链就断,还是老老实实用大模型吧。 -
MTurnerX—Apache 2.0 授权真香,公司合规审查直接过了,不用跟法务扯皮。之前用某个国产模型的许可证卡了好久,律师费都花了不少,换成这个之后合规部门一句话没说就批了,省心。 -
iShreyaShayana_dev—128k 上下文看起来挺大,实际用起来给足 128k 时注意力衰减很明显,中间段信息召回率感人。建议不要贪长,实际控制在 32k 以内效果最好。 -
KathleenRiveraX—试了试 Mistral Small 3.1 的 OCR 能力,中文单据识别效果还行,但表格结构提取偶尔会乱,需要后处理校正。 -
清风_6—这个模型写出来的东西感觉太正经了,像公务员写报告一样,少点灵气。同样的 task 换成 Llama 3.3 生成的结果有意思得多。 -
Noah.Powell_99—搞了个批量文本分类 pipeline,每小时处理几十万条,成本不到一毛钱,就是这个场景的神器。之前用 GPT-4o Mini 跑同样的量,一天就要好几十美金,直接换 Small 3.1 成本降了两个数量级,准确率就掉了两个点,完全能接受。 -
svxjdv6vj—函数调用确实比同体量的模型强不少,tools 定义好后基本不会乱填参数。但多步 agent 流程里状态保持还是差点意思,复杂任务容易丢上下文。 -
廖梅—说实话这个模型的定价在涨,五月份到现在翻了两倍多,虽然绝对值还是便宜但涨幅真的夸张。 -
PRalv99—本地部署在 M4 Max 上还挺顺畅的,32G 内存 4bit 量化能跑 30 token/s 左右,日常写写邮件摘要够用了。 -
LCooper369—做过完整的对比评测,Phi-4 在数学和代码上确实强一截,但 Mistral Small 3.1 的欧洲语言支持真是独一档。我们产品要同时上法语德语意大利语,用别的模型小语种表现拉胯,换 Small 3.1 之后多语言效果肉眼可见地好了。 -
邵桂—用来做文档问答还行,前提是文档结构清晰。如果是一堆扫描件混排,效果就会打折扣。 -
DFisher_Plus—SimpleQA 只有 10%,这个事实召回能力确实离谱了,RAG 不是 options 是必需品懂吧。任何不配检索增强生成的场景,用这个模型就是给自己埋坑,用户随便问个事实性问题就给你胡编一个答案出来。 -
AnnReed_72—终于把部署架构改成了双 A100 跑 bf16,吞吐上来了但性价比还是不如 vLLM 量化版。 -
LoganFlores00716—做竞品分析发现 DeepSeek V4-Flash 的价格是它的一半,上下文还是 1M。如果不是有欧盟数据主权需求,实在想不出选 Small 3.1 的理由。但反过来说,如果客户是欧洲公司要求 GDPR 合规+数据不出境,那 Small 3.1 基本上就是唯一的答案了。 -
xayyp5—公司项目用了 Small 3.1 做客服意图识别,上线两个月准确率 93%,比之前用的 GPT-4o Mini 差一两个点但成本只有十分之一,老板很满意。关键是部署在本地,用户聊天数据不用出服务器,隐私合规这一块也让法务很放心。 -
JustinGreen_99—才发布三个月就被 3.2 超过了,买 3.1 有点亏啊,早知道等 3.2 了。 -
MarkKelly_Pro884—文档理解方面真是同级别的天花板,94% 的 DocVQA 得分不是吹的,处理发票和合同比预期好很多。我们做财务自动化项目,用它做票据识别和信息提取,准确率直接替代了之前专门的 OCR 方案。 -
Nicholas.CookK—在 RTX 4090 上部署了就再没碰过云端 API,数据不出本地的安全感对甲方来说太重要了。 -
8p7qha5or_q—7B 模型搞不定的分类任务它搞定了,70B 模型能做的它勉强能做,定位其实挺尴尬的。真正适合它的场景反而是那些不需要复杂推理但需要高吞吐和低延迟的批量处理任务,比如文本分类、信息抽取这些,在这些场景下性价比确实无敌。 -
AngelaBrooksIII7—用了几个月了,最适合的场景就是批量文档处理——分类、提取、摘要一条龙,稳定性和一致性吊打同尺寸其他模型。我们内部每天跑几万份 PDF 合同,用 vLLM 搭的 batch 推理,连续跑了三个月就出过一次小问题,比之前用云端 API 省了至少 70% 的成本。 -
VildanHakyemez—那个 150 token/s 的速度确实不是吹的,体感比 Phi-4 快一倍都不止。 -
Terry.Torres5206—英语之外的语种表现很棒,我们做德语法语客服系统,之前用 GPT 翻车的地方 Small 3.1 反而做得更好。德语那种长复合词和复杂句式,很多模型处理不好,但这个模型因为本身就是法国团队做的,对欧洲语言理解比美国模型深不少。 -
Jade641—多模态能力确实有,但跟 GPT-4o 比还是有差距,复杂图表分析经常读错数据。简单任务的话没问题。 -
JMartin_88726—对比了一圈,如果要结构化输出+本地部署+多语言,Small 3.1 目前是没有对手的。其他方面各有取舍吧。 -
蒋轩晨—入手了。24B 跑在 4090 上出乎意料地流畅,不过满上下文时显存快满了,得注意控制。建议实际部署把 max_context 调到 64k 左右,既能满足大部分场景需求,也能给并发请求留出余量。3.2 版本的指令遵循能力提升不少,如果还没部署的建议直接上 3.2。 -
Charles.JohnsonZ37—代码补全还行,但写复杂一点的业务逻辑就不太行了,不如 Codestral 或者专门的代码模型。 -
Harold.Ramirez_881—法语和德语的支持是绝活,欧洲团队做本地化项目首选,没有之一。 -
David_Ward_8806—我们拿来做邮件自动分类和回复草稿,配合 vLLM 部署,稳定跑了两个月没出过幺蛾子。 -
brownbutterfly456—单卡就能跑的 vision model 里这个算是最好的选择之一了,尤其是做文档 OCR 场景。 -
Melissa.Roberts_2023—升级到 3.2 了,指令遵循确实好了一些,但 3.1 也不差,不值得专门从 3.1 升级。