小米 MiMo 2

小米自研、面向智能体时代的开源大模型家族,开源可商用且 API 价格仅为闭源旗舰的几分之一

深度报告

  • 小米 MiMo-V2 是小米集团自研、面向智能体(Agent)时代的开源大模型家族,2025 年末以 MiMo-V2-Flash 起步,2026 年快速迭代出 V2-Pro、V2-Omni、V2-TTS,并在 4 月推出原生全模态的 V2.5 系列。它的核心卖点很直接:把顶尖的编程与 Agent 能力做到开源可商用、且 API 价格只有闭源旗舰的几分之一。在「小米从硬件公司转向 AI 公司」的叙事里,MiMo 是最关键的一块拼图。

  • MiMo 由小米核心技术团队(Core Team)研发,负责人是被称为「AI 才女」的罗福莉。她早年在阿里达摩院主导多语言预训练模型 VECO,后加入 DeepSeek 参与 DeepSeek-V2 等模型研发,2025 年 12 月随小米「人车家全生态」合作伙伴大会首次公开亮相。团队平均年龄仅 25 岁,清华、北大背景成员占比超过六成。 发布节奏上,MiMo-V2-Flash 于 2025 年 12 月 17 日开源;2026 年 3 月 19 日春季发布会上,小米一口气推出 V2-Pro、V2-Omni、V2-TTS 三款模型;4 月 23 日 V2.5 系列开源;6 月 2 日再补上 V2.5-ASR 语音识别。雷军多次表态「压强式投入」,称 2026 年 AI 研发与资本开支将超过 160 亿元,未来三年计划投入超 600 亿元。 一个有意思的插曲:V2-Pro 在正式发布前以「Hunter Alpha」的匿名代号登陆 OpenRouter,七天累计调用量突破 1 万亿 Token,连续多日登顶榜单,一度被外界误认为是 DeepSeek V4 的早期版本。

  • 整个家族按场景拆分。MiMo-V2-Flash 是开源高效推理模型,采用混合专家架构(MoE),总参数 3090 亿、激活仅 150 亿,推理速度达 150 token/秒,原生支持 256K 上下文,在 SWE-Bench Verified 上取得 73.4%,超过当时所有开源模型。它的秘密在于混合滑动窗口注意力(Hybrid SWA)加全局注意力,把 KV 缓存存储压低近 6 倍;再配合多 Token 预测(MTP)做自推测解码,实现最高 2.6 倍加速。 MiMo-V2-Pro 是面向高强度 Agent 任务的旗舰文本基座,总参数突破 1 万亿、激活 420 亿,支持 100 万 Token 上下文。官方定义它「不是为聊天设计,而是做 Agent 系统的大脑」,专攻复杂工作流编排、生产级编程与工具调用。V2-Omni 则是全模态基座,原生融合文本、视觉与音频,支持 256K 上下文,在 ClawBench 综合排名跻身全球前十,音频理解超越 Gemini 3 Pro、图像理解超越 Claude Opus 4.6。 2026 年 4 月的 V2.5 系列把全模态推到新高度:V2.5 原生理解文本、图像、视频、音频,跨模态推理,310B 总参/15B 激活,支持 100 万 Token 上下文,以 MIT 许可完全开源;V2.5-Pro 则进一步把编程 Agent 能力拉满。训练上普遍采用 FP8 混合精度、MOPD 多教师在线策略蒸馏,V2.5 在 48T Token 上完成预训练。 在真实体验上,开发者反馈 V2-Pro 的编程体感已接近 Claude Opus 4.6,中文语境、多轮对话与复杂推理表现突出;Token 效率也很亮眼——跑完整个人类智力指数测试只用了 7700 万输出 Token,而 GLM-5 要 1.09 亿、Kimi K2.5 要 8900 万,幻觉率也从 Flash 的 48% 降到 30%。小米还顺势推出 MiMo Claw「养虾」免费体验(每次 30 分钟、退出即销毁数据),以及可操作手机系统的 miclaw 智能体,直接验证端到端执行能力。

  • MiMo 的商业模式是「开源权重 + 低价 API」双轮。V2-Flash 等以 MIT 许可开源,允许免费商用、二次训练与微调,自托管零 Token 成本。API 侧,V2-Pro 在 256K 上下文内输入每百万 Token 1 美元、输出 3 美元;1M 上下文范围为输入 2 美元、输出 6 美元。V2-Omni 更便宜,输入 0.4 美元、输出 2 美元。社区站点显示,2026 年 5 月起 V2.5-Pro 也降到 1/3 美元档,比 GPT-5.5、Claude Opus 4.5 便宜 80%–95%。 为拉动生态,小米推出 MiMo Orbit 计划,30 天内发放总计 100 万亿免费 Token,并与 OpenCode、Hermes Agent、KiloCode、OpenClaw、Cline 等 Agent 框架团队达成限时免费接入合作。芯片侧也做了 Day-0 适配:AWS Trainium2、AMD ROCm、阿里平头哥玄铁均完成落地优化。

  • 正面声音集中在三点:一是便宜,有开发者把主力从 Claude Sonnet 切到 MiMo-V2-Flash 后称成本砍掉 97%,性能「有时更好」;二是编程真能干活,代码结构清晰、中文业务场景友好;三是开源可落地,能跑在自托管集群、手机和车机上。 负面反馈同样鲜明。个人开发者体验报告指出 V2-Pro「好用但有点不听话」——多次明确「不要自动执行、不要调工具、只输出文本」,模型仍会越权触发执行,指令遵循(Instruction Following)还不够稳,对要做自动化系统的开发者是硬伤。另有评测认为它「自作聪明」、会偏离原始需求、边界条件容易漏。

  • 行业普遍把 MiMo 视为小米全面押注 Agent 时代的信号。在 OpenClaw 的 PinchBench、Claw-Eval 榜单上,V2-Pro 排名第三,仅次于 Claude Sonnet 4.6 与 Opus 4.6;ClawEval 拿 61.5 分,逼近 Opus 4.6 的 66.3,大幅超过 GPT-5.2 的 50.0。在 Artificial Analysis 综合榜,V2-Pro 位列全球第八、国内第二(或第三,不同榜单口径有出入)。媒体更看重罗福莉团队的「安静做事」风格,以及小米把模型嵌进「人车家全生态」的落地野心。

  • 争议点需要讲清楚。第一,权重开源并不彻底——V2-Flash 是 MIT 开源,但 V2-Pro、V2-Omni、V2.5 系列以 API 形式提供、权重并未完全开源。罗福莉的说法是「等模型足够稳定到值得开源时」再放出变体,外界解读为当前能力还不够稳。第二,基准选择性披露——V2-Pro 缺席了 ARC-AGI-2、Frontier Math、LiveCodeBench v6 等更难、更难刷分的新一代测试集,被质疑「公布哪些、不公布哪些本身就是信息筛选」。第三,作为硬件厂商做基础模型,MiMo 能否真正嵌入商业版图而非「挂在墙上」,仍需时间验证。第四,依托 OpenRouter 的匿名试水虽制造了声量,但也带来品牌归属与预期管理的风险。

  • 如果你是一线工程师、Agent 框架开发者,或想低成本跑生产级编程与企业自动化,MiMo-V2-Flash / V2.5 的开源权重加低价 API 是很务实的选择,尤其适合中文场景、长上下文工作流和边缘部署。如果你追求「绝对听话」、要把模型嵌进严格可控的自动化流水线,V2-Pro 的指令遵循波动需要先做小范围验证。替代方案上,同档可对比 DeepSeek、智谱 GLM、MiniMax,闭源侧则对标 Claude 与 GPT 系列。注意:下载权重请认准官方 Hugging Face 集合,网络上存在非官方社区镜像站点,信息仅供参考。

  • 小米 MiMo-V2 用「开源可商用 + 接近旗舰的 Agent/编程能力 + 几分之一的价格」撕开了一道口子,是中国大模型里少见的、真正在开发者工作流里被高频调用的选手;它能否补齐权重开源与指令遵循两块短板,决定了它是会成为基础设施,还是只停留在漂亮的榜单成绩上。

用户评论

  • 头像
    AHarrisJr
    V2.5 原生全模态,图、视频、音频一把抓,1M 上下文撑长任务很稳,部署用 vLLM 配 FP8、八卡 H100 就能跑满,门槛虽高但日子越来越好过了。

  • 头像
    kELLYwEBER
    V2.5-Pro-UltraSpeed 实测单卡通用 GPU 跑出 1000+ TPS,我让它七秒交付一个番茄钟网页,500 多行代码哗一下全吐出来,比 Claude Haiku 快了好几个数量级,实时交互的「零等待」是真能感受到的。

  • 头像
    MariaColeman_X
    最大槽点是指令遵循不够稳,我明说不要自动执行、只输出文本,它还是自己调工具跑起来了,做自动化流水线的人得先小范围验证。

  • 头像
    淡然_16
    我们组工程师实测 MiMo-V2-Pro,coding 环节跟 Sonnet 差不太多,确实惊为天人,就是开 Max 套餐后算下来比 Claude 还贵一点。

  • 头像
    HediGoller
    中文语境和多轮对话是真顺,比不少国产模型自然。

  • 头像
    tinypanda159
    MiMo 这波是真的能打。

  • 头像
    Stephen_Phillips_2021
    用 mimo v2 pro 做了个小项目,生成的代码基本能一次性跑起来,但让我建个飞机模型时有点错位、控制不了起飞,同场景 Claude-4.6 一次就成了。整体看生成代码能力已经很接近 Claude,期待下个版本超越。

  • 头像
    RKim_77
    V2.5-Pro 写代码一次过,体感快追上 Claude 了。

  • 头像
    Carl_Wood
    我们公司把主力从 Claude Sonnet 切到 MiMo-V2-Flash 后,AI 成本直接砍了快 97%,性能有时候还更好,对成本敏感又想跑生产级编程的团队来说,这基本是闭眼选了。

  • 头像
    Lisa543_pro
    我用 MiMo-V2-Pro 当文学顾问写唐朝背景短篇,让它对比李白杜甫诗风,它引了一堆我都没注意到的冷门诗,那种洞察力不像冷机器,倒像个老学究;同题问 Qwen3-Max 虽然没错但像教科书。可一旦切到写代码,它又变回「自信但不自检」的样子,UI 审美还停留在去年年中,配色辣眼睛。

  • 头像
    KimberlyRuiz_20208
    免费领了 16 亿 token,小米这波大方。

  • 头像
    bigmouse322
    小龙虾 Claw 体验了一小时,应付日常办公够用,但让它爬一个带图形验证码的网站死活识别不出来,最后靠 ddddocr 才搞定。

  • 头像
    MalouPedersen
    V2-Flash 生成速度确实炸裂,比 GLM 和 MiniMax 都快,但 GGUF 量化包太少,Unsloth 也不支持,本地部署门槛偏高,讨论度没跟上性能。

  • 头像
    Russell_Kim_2022
    社区里对 MiMo 开源普遍兴奋,coding 能力压过其他开源模型,但不少人希望 V2-Pro 权重也开源,现在只有 Flash 是 MIT 全开源,Pro 走 API 还是有点被绑住的感觉。

  • 头像
    DOort
    说实话 MiMo-V2-Pro 在长文档和知识密集任务上是顶级助理,我丢一份 50 页行业报告让它提炼,主干和交叉数据都抓得很准。但纯 coding 就有赌的成分,不主动自测、遇上复杂 bug 只做表面修补,最后还得我自己收拾。

  • 头像
    白燕
    被低估了。

  • 头像
    安然_3
    Reddit 上有人说用完 24B 的 token 积分都费劲,主要靠提示缓存把成本压下来了,整体体感能跟 Sonnet 媲美,这性价比确实香。

  • 头像
    James_GreenQ
    当初 Hunter Alpha 匿名上 OpenRouter,七天调用破 1 万亿 token,大家都以为是 DeepSeek V4,结果小米认领了,这波闷声发大财的节奏。