Mistral Small 3.1
法国AI初创公司Mistral AI发布的240亿参数开源多模态模型,在文本和多模态任务上表现出色
深度报告
-
Mistral Small 3.1 是法国AI初创公司Mistral AI于2025年3月17日发布的新一代开源多模态模型,拥有240亿参数,在文本处理和多模态理解方面表现出色,支持长达128K的上下文长度。官方声称该模型是同级别中的最佳模型,在多项基准测试中超越OpenAI和Google的同类产品。
-
Mistral AI是一家法国人工智能初创公司,由前Google DeepMind和Meta研究人员创立。该公司致力于开发开源高效的AI模型,在大语言模型领域与OpenAI、Google等巨头竞争。Mistral Small 3.1是其针对轻量级场景推出的重要产品,旨在让开发者能够在消费级硬件上运行强大的AI能力。
-
Mistral Small 3.1的核心功能包括:文本理解和生成、多模态理解(支持图像输入)、长上下文处理(128K tokens)、代码编写和数学推理。模型能够在单张RTX 4090显卡或32GB内存的Mac设备上运行,每秒可处理约150个tokens。模型基于Apache 2.0许可证开源发布。
-
根据官方基准测试,Mistral Small 3.1在多项测试中超越GPT-4o Mini和Google Gemma 3等竞品,尤其在代码生成和数学推理方面表现突出。轻量级设计使其成为本地部署和边缘设备的理想选择。
-
该模型适合需要本地部署AI能力的企业和个人开发者,以及对数据隐私有要求的应用场景。适用于编程辅助、文档理解、对话系统等多种应用。
-
Mistral Small 3.1为开源社区提供了一个高性能的轻量级选择,240亿参数的设计在效率和性能之间取得良好平衡,是追求本地化AI部署的用户值得关注的选项。
用户评论
-
EthanRoss_Pro—在 4090 上跑了几天 Mistral Small 3.1,分类和文档抽取的准确率确实稳,结构化输出基本不翻车。但做复杂推理是真不行,稍微绕一点的逻辑链就断,还是老老实实用大模型吧。 -
MTurnerX—Apache 2.0 授权真香,公司合规审查直接过了,不用跟法务扯皮。之前用某个国产模型的许可证卡了好久,律师费都花了不少,换成这个之后合规部门一句话没说就批了,省心。 -
iShreyaShayana_dev—128k 上下文看起来挺大,实际用起来给足 128k 时注意力衰减很明显,中间段信息召回率感人。建议不要贪长,实际控制在 32k 以内效果最好。 -
KathleenRiveraX—试了试 Mistral Small 3.1 的 OCR 能力,中文单据识别效果还行,但表格结构提取偶尔会乱,需要后处理校正。 -
清风_6—这个模型写出来的东西感觉太正经了,像公务员写报告一样,少点灵气。同样的 task 换成 Llama 3.3 生成的结果有意思得多。 -
Noah.Powell_99—搞了个批量文本分类 pipeline,每小时处理几十万条,成本不到一毛钱,就是这个场景的神器。之前用 GPT-4o Mini 跑同样的量,一天就要好几十美金,直接换 Small 3.1 成本降了两个数量级,准确率就掉了两个点,完全能接受。 -
svxjdv6vj—函数调用确实比同体量的模型强不少,tools 定义好后基本不会乱填参数。但多步 agent 流程里状态保持还是差点意思,复杂任务容易丢上下文。 -
廖梅—说实话这个模型的定价在涨,五月份到现在翻了两倍多,虽然绝对值还是便宜但涨幅真的夸张。 -
PRalv99—本地部署在 M4 Max 上还挺顺畅的,32G 内存 4bit 量化能跑 30 token/s 左右,日常写写邮件摘要够用了。 -
LCooper369—做过完整的对比评测,Phi-4 在数学和代码上确实强一截,但 Mistral Small 3.1 的欧洲语言支持真是独一档。我们产品要同时上法语德语意大利语,用别的模型小语种表现拉胯,换 Small 3.1 之后多语言效果肉眼可见地好了。 -
邵桂—用来做文档问答还行,前提是文档结构清晰。如果是一堆扫描件混排,效果就会打折扣。 -
DFisher_Plus—SimpleQA 只有 10%,这个事实召回能力确实离谱了,RAG 不是 options 是必需品懂吧。任何不配检索增强生成的场景,用这个模型就是给自己埋坑,用户随便问个事实性问题就给你胡编一个答案出来。 -
AnnReed_72—终于把部署架构改成了双 A100 跑 bf16,吞吐上来了但性价比还是不如 vLLM 量化版。 -
LoganFlores00716—做竞品分析发现 DeepSeek V4-Flash 的价格是它的一半,上下文还是 1M。如果不是有欧盟数据主权需求,实在想不出选 Small 3.1 的理由。但反过来说,如果客户是欧洲公司要求 GDPR 合规+数据不出境,那 Small 3.1 基本上就是唯一的答案了。 -
xayyp5—公司项目用了 Small 3.1 做客服意图识别,上线两个月准确率 93%,比之前用的 GPT-4o Mini 差一两个点但成本只有十分之一,老板很满意。关键是部署在本地,用户聊天数据不用出服务器,隐私合规这一块也让法务很放心。 -
JustinGreen_99—才发布三个月就被 3.2 超过了,买 3.1 有点亏啊,早知道等 3.2 了。 -
MarkKelly_Pro884—文档理解方面真是同级别的天花板,94% 的 DocVQA 得分不是吹的,处理发票和合同比预期好很多。我们做财务自动化项目,用它做票据识别和信息提取,准确率直接替代了之前专门的 OCR 方案。 -
Nicholas.CookK—在 RTX 4090 上部署了就再没碰过云端 API,数据不出本地的安全感对甲方来说太重要了。 -
8p7qha5or_q—7B 模型搞不定的分类任务它搞定了,70B 模型能做的它勉强能做,定位其实挺尴尬的。真正适合它的场景反而是那些不需要复杂推理但需要高吞吐和低延迟的批量处理任务,比如文本分类、信息抽取这些,在这些场景下性价比确实无敌。 -
AngelaBrooksIII7—用了几个月了,最适合的场景就是批量文档处理——分类、提取、摘要一条龙,稳定性和一致性吊打同尺寸其他模型。我们内部每天跑几万份 PDF 合同,用 vLLM 搭的 batch 推理,连续跑了三个月就出过一次小问题,比之前用云端 API 省了至少 70% 的成本。 -
VildanHakyemez—那个 150 token/s 的速度确实不是吹的,体感比 Phi-4 快一倍都不止。 -
Terry.Torres5206—英语之外的语种表现很棒,我们做德语法语客服系统,之前用 GPT 翻车的地方 Small 3.1 反而做得更好。德语那种长复合词和复杂句式,很多模型处理不好,但这个模型因为本身就是法国团队做的,对欧洲语言理解比美国模型深不少。 -
Jade641—多模态能力确实有,但跟 GPT-4o 比还是有差距,复杂图表分析经常读错数据。简单任务的话没问题。 -
JMartin_88726—对比了一圈,如果要结构化输出+本地部署+多语言,Small 3.1 目前是没有对手的。其他方面各有取舍吧。 -
蒋轩晨—入手了。24B 跑在 4090 上出乎意料地流畅,不过满上下文时显存快满了,得注意控制。建议实际部署把 max_context 调到 64k 左右,既能满足大部分场景需求,也能给并发请求留出余量。3.2 版本的指令遵循能力提升不少,如果还没部署的建议直接上 3.2。 -
Charles.JohnsonZ37—代码补全还行,但写复杂一点的业务逻辑就不太行了,不如 Codestral 或者专门的代码模型。 -
Harold.Ramirez_881—法语和德语的支持是绝活,欧洲团队做本地化项目首选,没有之一。 -
David_Ward_8806—我们拿来做邮件自动分类和回复草稿,配合 vLLM 部署,稳定跑了两个月没出过幺蛾子。 -
brownbutterfly456—单卡就能跑的 vision model 里这个算是最好的选择之一了,尤其是做文档 OCR 场景。 -
Melissa.Roberts_2023—升级到 3.2 了,指令遵循确实好了一些,但 3.1 也不差,不值得专门从 3.1 升级。