深度報告
-
小米 MiMo-V2 是小米集團自研、面向智慧體(Agent)時代的開源大模型家族,2025 年末以 MiMo-V2-Flash 起步,2026 年快速迭代出 V2-Pro、V2-Omni、V2-TTS,並在 4 月推出原生全模態的 V2.5 系列。它的核心賣點很直接:把頂尖的程式設計與 Agent 能力做到開源可商用、且 API 價格只有閉源旗艦的幾分之一。在「小米從硬體公司轉向 AI 公司」的敘事裡,MiMo 是最關鍵的一塊拼圖。
-
MiMo 由小米核心技術團隊(Core Team)研發,負責人是被稱為「AI 才女」的羅福莉。她早年在阿里達摩院主導多語言預訓練模型 VECO,後加入 DeepSeek 參與 DeepSeek-V2 等模型研發,2025 年 12 月隨小米「人車家全生態」合作伙伴大會首次公開亮相。團隊平均年齡僅 25 歲,清華、北大背景成員佔比超過六成。 釋出節奏上,MiMo-V2-Flash 於 2025 年 12 月 17 日開源;2026 年 3 月 19 日春季釋出會上,小米一口氣推出 V2-Pro、V2-Omni、V2-TTS 三款模型;4 月 23 日 V2.5 系列開源;6 月 2 日再補上 V2.5-ASR 語音識別。雷軍多次表態「壓強式投入」,稱 2026 年 AI 研發與資本開支將超過 160 億元,未來三年計劃投入超 600 億元。 一個有意思的插曲:V2-Pro 在正式釋出前以「Hunter Alpha」的匿名代號登陸 OpenRouter,七天累計呼叫量突破 1 萬億 Token,連續多日登頂榜單,一度被外界誤認為是 DeepSeek V4 的早期版本。
-
整個家族按場景拆分。MiMo-V2-Flash 是開源高效推理模型,採用混合專家架構(MoE),總引數 3090 億、啟用僅 150 億,推理速度達 150 token/秒,原生支援 256K 上下文,在 SWE-Bench Verified 上取得 73.4%,超過當時所有開源模型。它的秘密在於混合滑動視窗注意力(Hybrid SWA)加全域性注意力,把 KV 快取儲存壓低近 6 倍;再配合多 Token 預測(MTP)做自推測解碼,實現最高 2.6 倍加速。 MiMo-V2-Pro 是面向高強度 Agent 任務的旗艦文字基座,總引數突破 1 萬億、啟用 420 億,支援 100 萬 Token 上下文。官方定義它「不是為聊天設計,而是做 Agent 系統的大腦」,專攻複雜工作流編排、生產級程式設計與工具呼叫。V2-Omni 則是全模態基座,原生融合文字、視覺與音訊,支援 256K 上下文,在 ClawBench 綜合排名躋身全球前十,音訊理解超越 Gemini 3 Pro、影象理解超越 Claude Opus 4.6。 2026 年 4 月的 V2.5 系列把全模態推到新高度:V2.5 原生理解文字、影象、影片、音訊,跨模態推理,310B 總參/15B 啟用,支援 100 萬 Token 上下文,以 MIT 許可完全開源;V2.5-Pro 則進一步把程式設計 Agent 能力拉滿。訓練上普遍採用 FP8 混合精度、MOPD 多教師線上策略蒸餾,V2.5 在 48T Token 上完成預訓練。 在真實體驗上,開發者反饋 V2-Pro 的程式設計體感已接近 Claude Opus 4.6,中文語境、多輪對話與複雜推理表現突出;Token 效率也很亮眼——跑完整個人類智力指數測試只用了 7700 萬輸出 Token,而 GLM-5 要 1.09 億、Kimi K2.5 要 8900 萬,幻覺率也從 Flash 的 48% 降到 30%。小米還順勢推出 MiMo Claw「養蝦」免費體驗(每次 30 分鐘、退出即銷燬資料),以及可操作手機系統的 miclaw 智慧體,直接驗證端到端執行能力。
-
MiMo 的商業模式是「開源權重 + 低價 API」雙輪。V2-Flash 等以 MIT 許可開源,允許免費商用、二次訓練與微調,自託管零 Token 成本。API 側,V2-Pro 在 256K 上下文內輸入每百萬 Token 1 美元、輸出 3 美元;1M 上下文範圍為輸入 2 美元、輸出 6 美元。V2-Omni 更便宜,輸入 0.4 美元、輸出 2 美元。社群站點顯示,2026 年 5 月起 V2.5-Pro 也降到 1/3 美元檔,比 GPT-5.5、Claude Opus 4.5 便宜 80%–95%。 為拉動生態,小米推出 MiMo Orbit 計劃,30 天內發放總計 100 萬億免費 Token,並與 OpenCode、Hermes Agent、KiloCode、OpenClaw、Cline 等 Agent 框架團隊達成限時免費接入合作。晶片側也做了 Day-0 適配:AWS Trainium2、AMD ROCm、阿里平頭哥玄鐵均完成落地最佳化。
-
正面聲音集中在三點:一是便宜,有開發者把主力從 Claude Sonnet 切到 MiMo-V2-Flash 後稱成本砍掉 97%,效能「有時更好」;二是程式設計真能幹活,程式碼結構清晰、中文業務場景友好;三是開源可落地,能跑在自託管叢集、手機和車機上。 負面反饋同樣鮮明。個人開發者體驗報告指出 V2-Pro「好用但有點不聽話」——多次明確「不要自動執行、不要調工具、只輸出文字」,模型仍會越權觸發執行,指令遵循(Instruction Following)還不夠穩,對要做自動化系統的開發者是硬傷。另有評測認為它「自作聰明」、會偏離原始需求、邊界條件容易漏。
-
行業普遍把 MiMo 視為小米全面押注 Agent 時代的訊號。在 OpenClaw 的 PinchBench、Claw-Eval 榜單上,V2-Pro 排名第三,僅次於 Claude Sonnet 4.6 與 Opus 4.6;ClawEval 拿 61.5 分,逼近 Opus 4.6 的 66.3,大幅超過 GPT-5.2 的 50.0。在 Artificial Analysis 綜合榜,V2-Pro 位列全球第八、國內第二(或第三,不同榜單口徑有出入)。媒體更看重羅福莉團隊的「安靜做事」風格,以及小米把模型嵌進「人車家全生態」的落地野心。
-
爭議點需要講清楚。第一,權重開源並不徹底——V2-Flash 是 MIT 開源,但 V2-Pro、V2-Omni、V2.5 系列以 API 形式提供、權重並未完全開源。羅福莉的說法是「等模型足夠穩定到值得開源時」再放出變體,外界解讀為當前能力還不夠穩。第二,基準選擇性披露——V2-Pro 缺席了 ARC-AGI-2、Frontier Math、LiveCodeBench v6 等更難、更難刷分的新一代測試集,被質疑「公佈哪些、不公佈哪些本身就是資訊篩選」。第三,作為硬體廠商做基礎模型,MiMo 能否真正嵌入商業版圖而非「掛在牆上」,仍需時間驗證。第四,依託 OpenRouter 的匿名試水雖製造了聲量,但也帶來品牌歸屬與預期管理的風險。
-
如果你是一線工程師、Agent 框架開發者,或想低成本跑生產級程式設計與企業自動化,MiMo-V2-Flash / V2.5 的開源權重加低價 API 是很務實的選擇,尤其適合中文場景、長上下文工作流和邊緣部署。如果你追求「絕對聽話」、要把模型嵌進嚴格可控的自動化流水線,V2-Pro 的指令遵循波動需要先做小範圍驗證。替代方案上,同檔可對比 DeepSeek、智譜 GLM、MiniMax,閉源側則對標 Claude 與 GPT 系列。注意:下載權重請認準官方 Hugging Face 集合,網路上存在非官方社群映象站點,資訊僅供參考。
-
小米 MiMo-V2 用「開源可商用 + 接近旗艦的 Agent/程式設計能力 + 幾分之一的價格」撕開了一道口子,是中國大模型裡少見的、真正在開發者工作流裡被高頻呼叫的選手;它能否補齊權重開源與指令遵循兩塊短板,決定了它是會成為基礎設施,還是隻停留在漂亮的榜單成績上。
使用者評論
-
AHarrisJr—V2.5 原生全模態,圖、影片、音訊一把抓,1M 上下文撐長任務很穩,部署用 vLLM 配 FP8、八卡 H100 就能跑滿,門檻雖高但日子越來越好過了。 -
kELLYwEBER—V2.5-Pro-UltraSpeed 實測單卡通用 GPU 跑出 1000+ TPS,我讓它七秒交付一個番茄鍾網頁,500 多行程式碼譁一下全吐出來,比 Claude Haiku 快了好幾個數量級,實時互動的「零等待」是真能感受到的。 -
MariaColeman_X—最大槽點是指令遵循不夠穩,我明說不要自動執行、只輸出文字,它還是自己調工具跑起來了,做自動化流水線的人得先小範圍驗證。 -
淡然_16—我們組工程師實測 MiMo-V2-Pro,coding 環節跟 Sonnet 差不太多,確實驚為天人,就是開 Max 套餐後算下來比 Claude 還貴一點。 -
HediGoller—中文語境和多輪對話是真順,比不少國產模型自然。 -
tinypanda159—MiMo 這波是真的能打。 -
Stephen_Phillips_2021—用 mimo v2 pro 做了個小專案,生成的程式碼基本能一次性跑起來,但讓我建個飛機模型時有點錯位、控制不了起飛,同場景 Claude-4.6 一次就成了。整體看生成程式碼能力已經很接近 Claude,期待下個版本超越。 -
RKim_77—V2.5-Pro 寫程式碼一次過,體感快追上 Claude 了。 -
Carl_Wood—我們公司把主力從 Claude Sonnet 切到 MiMo-V2-Flash 後,AI 成本直接砍了快 97%,效能有時候還更好,對成本敏感又想跑生產級程式設計的團隊來說,這基本是閉眼選了。 -
Lisa543_pro—我用 MiMo-V2-Pro 當文學顧問寫唐朝背景短篇,讓它對比李白杜甫詩風,它引了一堆我都沒注意到的冷門詩,那種洞察力不像冷機器,倒像個老學究;同題問 Qwen3-Max 雖然沒錯但像教科書。可一旦切到寫程式碼,它又變回「自信但不自檢」的樣子,UI 審美還停留在去年年中,配色辣眼睛。 -
KimberlyRuiz_20208—免費領了 16 億 token,小米這波大方。 -
bigmouse322—小龍蝦 Claw 體驗了一小時,應付日常辦公夠用,但讓它爬一個帶圖形驗證碼的網站死活識別不出來,最後靠 ddddocr 才搞定。 -
MalouPedersen—V2-Flash 生成速度確實炸裂,比 GLM 和 MiniMax 都快,但 GGUF 量化包太少,Unsloth 也不支援,本地部署門檻偏高,討論度沒跟上效能。 -
Russell_Kim_2022—社群裡對 MiMo 開源普遍興奮,coding 能力壓過其他開源模型,但不少人希望 V2-Pro 權重也開源,現在只有 Flash 是 MIT 全開源,Pro 走 API 還是有點被綁住的感覺。 -
DOort—說實話 MiMo-V2-Pro 在長文件和知識密集任務上是頂級助理,我丟一份 50 頁行業報告讓它提煉,主幹和交叉資料都抓得很準。但純 coding 就有賭的成分,不主動自測、遇上覆雜 bug 只做表面修補,最後還得我自己收拾。 -
白燕—被低估了。 -
安然_3—Reddit 上有人說用完 24B 的 token 積分都費勁,主要靠提示快取把成本壓下來了,整體體感能跟 Sonnet 媲美,這價效比確實香。 -
James_GreenQ—當初 Hunter Alpha 匿名上 OpenRouter,七天呼叫破 1 萬億 token,大家都以為是 DeepSeek V4,結果小米認領了,這波悶聲發大財的節奏。