Mistral Small 3.1

法国AI初创公司Mistral AI发布的240亿参数开源多模态模型,在文本和多模态任务上表现出色

In-depth Report

  • Mistral Small 3.1 is a new generation open source multi-modal model released by French AI startup Mistral AI on March 17, 2025. It has 24 billion parameters, performs well in text processing and multi-modal understanding, and supports context lengths of up to 128K. Officials claim that this model is the best model in its class, surpassing similar products from OpenAI and Google in multiple benchmark tests.

  • Mistral AI is a French artificial intelligence startup founded by former Google DeepMind and Meta researchers. The company is committed to developing open source and efficient AI models to compete with giants such as OpenAI and Google in the field of large language models. Mistral Small 3.1 is an important product launched for lightweight scenarios, aiming to enable developers to run powerful AI capabilities on consumer-grade hardware.

  • The core features of Mistral Small 3.1 include: text understanding and generation, multi-modal understanding (supporting image input), long context processing (128K tokens), code writing and mathematical reasoning. The model can run on a single RTX 4090 graphics card or a Mac device with 32GB of memory and can process approximately 150 tokens per second. The model is released open source under the Apache 2.0 license.

  • According to the official benchmark test, Mistral Small 3.1 surpassed competing products such as GPT-4o Mini and Google Gemma 3 in multiple tests, especially in code generation and mathematical reasoning. The lightweight design makes it ideal for on-premises deployments and edge devices.

  • This model is suitable for enterprises and individual developers who need to deploy AI capabilities locally, as well as application scenarios that require data privacy. It is suitable for various applications such as programming assistance, document understanding, and dialogue systems.

  • Mistral Small 3.1 provides the open source community with a high-performance lightweight option. The 24 billion parameter design strikes a good balance between efficiency and performance. It is an option worthy of attention for users pursuing localized AI deployment.

User Reviews

  • 头像
    EthanRoss_Pro
    在 4090 上跑了几天 Mistral Small 3.1,分类和文档抽取的准确率确实稳,结构化输出基本不翻车。但做复杂推理是真不行,稍微绕一点的逻辑链就断,还是老老实实用大模型吧。

  • 头像
    MTurnerX
    Apache 2.0 授权真香,公司合规审查直接过了,不用跟法务扯皮。之前用某个国产模型的许可证卡了好久,律师费都花了不少,换成这个之后合规部门一句话没说就批了,省心。

  • 头像
    iShreyaShayana_dev
    128k 上下文看起来挺大,实际用起来给足 128k 时注意力衰减很明显,中间段信息召回率感人。建议不要贪长,实际控制在 32k 以内效果最好。

  • 头像
    KathleenRiveraX
    试了试 Mistral Small 3.1 的 OCR 能力,中文单据识别效果还行,但表格结构提取偶尔会乱,需要后处理校正。

  • 头像
    清风_6
    这个模型写出来的东西感觉太正经了,像公务员写报告一样,少点灵气。同样的 task 换成 Llama 3.3 生成的结果有意思得多。

  • 头像
    Noah.Powell_99
    搞了个批量文本分类 pipeline,每小时处理几十万条,成本不到一毛钱,就是这个场景的神器。之前用 GPT-4o Mini 跑同样的量,一天就要好几十美金,直接换 Small 3.1 成本降了两个数量级,准确率就掉了两个点,完全能接受。

  • 头像
    svxjdv6vj
    函数调用确实比同体量的模型强不少,tools 定义好后基本不会乱填参数。但多步 agent 流程里状态保持还是差点意思,复杂任务容易丢上下文。

  • 头像
    廖梅
    说实话这个模型的定价在涨,五月份到现在翻了两倍多,虽然绝对值还是便宜但涨幅真的夸张。

  • 头像
    PRalv99
    本地部署在 M4 Max 上还挺顺畅的,32G 内存 4bit 量化能跑 30 token/s 左右,日常写写邮件摘要够用了。

  • 头像
    LCooper369
    做过完整的对比评测,Phi-4 在数学和代码上确实强一截,但 Mistral Small 3.1 的欧洲语言支持真是独一档。我们产品要同时上法语德语意大利语,用别的模型小语种表现拉胯,换 Small 3.1 之后多语言效果肉眼可见地好了。

  • 头像
    邵桂
    用来做文档问答还行,前提是文档结构清晰。如果是一堆扫描件混排,效果就会打折扣。

  • 头像
    DFisher_Plus
    SimpleQA 只有 10%,这个事实召回能力确实离谱了,RAG 不是 options 是必需品懂吧。任何不配检索增强生成的场景,用这个模型就是给自己埋坑,用户随便问个事实性问题就给你胡编一个答案出来。

  • 头像
    AnnReed_72
    终于把部署架构改成了双 A100 跑 bf16,吞吐上来了但性价比还是不如 vLLM 量化版。

  • 头像
    LoganFlores00716
    做竞品分析发现 DeepSeek V4-Flash 的价格是它的一半,上下文还是 1M。如果不是有欧盟数据主权需求,实在想不出选 Small 3.1 的理由。但反过来说,如果客户是欧洲公司要求 GDPR 合规+数据不出境,那 Small 3.1 基本上就是唯一的答案了。

  • 头像
    xayyp5
    公司项目用了 Small 3.1 做客服意图识别,上线两个月准确率 93%,比之前用的 GPT-4o Mini 差一两个点但成本只有十分之一,老板很满意。关键是部署在本地,用户聊天数据不用出服务器,隐私合规这一块也让法务很放心。

  • 头像
    JustinGreen_99
    才发布三个月就被 3.2 超过了,买 3.1 有点亏啊,早知道等 3.2 了。

  • 头像
    MarkKelly_Pro884
    文档理解方面真是同级别的天花板,94% 的 DocVQA 得分不是吹的,处理发票和合同比预期好很多。我们做财务自动化项目,用它做票据识别和信息提取,准确率直接替代了之前专门的 OCR 方案。

  • 头像
    Nicholas.CookK
    在 RTX 4090 上部署了就再没碰过云端 API,数据不出本地的安全感对甲方来说太重要了。

  • 头像
    8p7qha5or_q
    7B 模型搞不定的分类任务它搞定了,70B 模型能做的它勉强能做,定位其实挺尴尬的。真正适合它的场景反而是那些不需要复杂推理但需要高吞吐和低延迟的批量处理任务,比如文本分类、信息抽取这些,在这些场景下性价比确实无敌。

  • 头像
    AngelaBrooksIII7
    用了几个月了,最适合的场景就是批量文档处理——分类、提取、摘要一条龙,稳定性和一致性吊打同尺寸其他模型。我们内部每天跑几万份 PDF 合同,用 vLLM 搭的 batch 推理,连续跑了三个月就出过一次小问题,比之前用云端 API 省了至少 70% 的成本。

  • 头像
    VildanHakyemez
    那个 150 token/s 的速度确实不是吹的,体感比 Phi-4 快一倍都不止。

  • 头像
    Terry.Torres5206
    英语之外的语种表现很棒,我们做德语法语客服系统,之前用 GPT 翻车的地方 Small 3.1 反而做得更好。德语那种长复合词和复杂句式,很多模型处理不好,但这个模型因为本身就是法国团队做的,对欧洲语言理解比美国模型深不少。

  • 头像
    Jade641
    多模态能力确实有,但跟 GPT-4o 比还是有差距,复杂图表分析经常读错数据。简单任务的话没问题。

  • 头像
    JMartin_88726
    对比了一圈,如果要结构化输出+本地部署+多语言,Small 3.1 目前是没有对手的。其他方面各有取舍吧。

  • 头像
    蒋轩晨
    入手了。24B 跑在 4090 上出乎意料地流畅,不过满上下文时显存快满了,得注意控制。建议实际部署把 max_context 调到 64k 左右,既能满足大部分场景需求,也能给并发请求留出余量。3.2 版本的指令遵循能力提升不少,如果还没部署的建议直接上 3.2。

  • 头像
    Charles.JohnsonZ37
    代码补全还行,但写复杂一点的业务逻辑就不太行了,不如 Codestral 或者专门的代码模型。

  • 头像
    Harold.Ramirez_881
    法语和德语的支持是绝活,欧洲团队做本地化项目首选,没有之一。

  • 头像
    David_Ward_8806
    我们拿来做邮件自动分类和回复草稿,配合 vLLM 部署,稳定跑了两个月没出过幺蛾子。

  • 头像
    brownbutterfly456
    单卡就能跑的 vision model 里这个算是最好的选择之一了,尤其是做文档 OCR 场景。

  • 头像
    Melissa.Roberts_2023
    升级到 3.2 了,指令遵循确实好了一些,但 3.1 也不差,不值得专门从 3.1 升级。