MiniMax M2.7
MiniMax釋出的2290億引數MoE架構程式碼與協作專用大模型,以Claude Opus約7%的成本完成90%以上程式碼任務質量
深度報告
-
MiniMax M2.7 是 MiniMax(稀宇科技)於 2026 年 3 月 18 日釋出的旗艦級大語言模型,採用 MoE 混合專家架構,總引數量 2290 億,啟用引數約 100 億。作為國內首個深度參與自身訓練迭代的模型,M2.7 最大的技術突破在於將強化學習 Harness 自動化迴圈引入訓練流程,使模型能承擔研發工作量中約 30%~50% 的任務。在軟體工程基準 SWE-Pro 測試中取得 56.22% 的成績,程式碼與 bug 檢測能力已接近 Claude Opus 4.6 水平。定價方面,M2.7 輸入價格僅為 Claude Opus 4.6 的約 1/15,被視為 2026 年上半年價效比最高的準第一梯隊程式碼模型。值得注意的是,該模型的權重雖已對外開源,但採用的是 MiniMax-Modified 非商業許可協議,禁止未經授權的商用部署。
-
MiniMax 成立於 2021 年,是一家專注於人工智慧技術的科技公司,總部位於中國。MiniMax 的創始團隊在 AI 領域有深厚積累,公司先後獲得多家知名機構的投資。M2.7 是 MiniMax M 系列模型的最新迭代版本,從 M2 到 M2.7 的迭代週期約 6 個月,每一代都在關鍵基準指標上有明顯提升。 M2.7 的定位並非通用對話模型,而是主打「Cowork Agent」協作場景的程式碼與專業任務模型。從技術路線來看,M2.7 採用稀疏混合專家(MoE)架構,每個 token 僅啟用約 100 億引數(佔總引數量的 4.3%),這種設計使得模型在保持強大能力的同時大幅降低了推理成本。 2026 年 4 月 12 日,MiniMax 正式宣佈 M2.7 開源開放權重,但使用了名為「MiniMax-Modified Non-Commercial License」的特殊協議,允許個人和研究使用,但明確禁止商業用途,商業使用需提前向 MiniMax 提交書面授權申請。這一許可證安排引發了一定爭議,被部分開發者認為存在「偽開源」的嫌疑。
-
M2.7 最大的技術亮點在於其「自我進化」能力。傳統模型的訓練迭代依賴大量人工參與,包括資料篩選、實驗設計、評測分析等環節。M2.7 則構建了一套自動化的強化學習 Harness,能夠自行驅動實驗監控、日誌排查、程式碼修復與評測迴圈。模型在訓練過程中可以承擔約 30%~50% 的研發工作量,MiniMax 內部評測資料顯示這種機制帶來了約 30% 的綜合效能提升。這一機制的實現依託於 M2.7 原生支援的 Agent Teams 能力,多個 AI 智慧體可以分工協作完成複雜的多階段任務,且這種能力已內化到模型底層而非依賴外部提示詞工程。
-
M2.7 在多項軟體工程基準測試中表現優異。在 SWE-Pro 測試中得分 56.22%,接近 GPT-5.3-Codex 的水平。Kilo Code 獨立實驗室的實測顯示,在 3 個 TypeScript 程式碼庫的測試中,M2.7 與 Claude Opus 4.6 均能找出全部 6 個 bug 和全部 10 個安全漏洞,表現完全持平。不過在修復徹底性上存在差距:Claude Opus 4.6 生成了 41 個整合測試(含測試資料庫和清理邏輯),而 M2.7 生成了 20 個單元測試(直接驗證 schema 和處理函式)。線上上運維場景中,M2.7 能夠自主完成分析監控告警、連線資料庫驗證原因、非阻塞止血處理(如建索引)以及提交 PR 的全流程,官方資料顯示基於 M2.7 已多次將故障恢復時間壓縮至 3 分鐘以內。
-
M2.7 在專業辦公領域的能力也得到了充分體現。在 GDPval-AA ELO 評測中得分 1495~1500,位列全球第四,專業場景涵蓋金融文件分析、營收預測建模等。在 Office 三件套(Excel/PPT/Word)複雜編輯場景中,M2.5 到 M2.7 的提升顯著,支援多輪修改和高保真編輯。工具呼叫(Function Calling)方面,Toolathon 基準正確率達 46.3%,OpenClaw 評測中接近最新 Claude Sonnet 4.6 水平。
-
M2.7 採用 MoE 稀疏混合專家架構,總引數量 2290 億,啟用引數約 100 億。多頭因果自注意力結合旋轉位置編碼(RoPE)和 QK RMSNorm 最佳化。上下文視窗為 204800 tokens(約 20 萬),最大輸出長度官方標稱可達 204800 tokens。知識截止時間為 2026 年 3 月。模型為純文字輸入,不支援影象、音訊或影片等多模態輸入。API 協議全面相容 OpenAI 格式,支援 Function Calling、Streaming、JSON Mode 等常用功能。
-
M2.7 提供兩個 API 版本,標準版 M2.7 輸入價格為 0.30 美元/百萬 tokens,輸出價格為 1.20 美元/百萬 tokens;高速版 M2.7-highspeed 輸入價格 0.60 美元/百萬 tokens,輸出價格 2.40 美元/百萬 tokens。自動上下文快取功能無需配置即可生效,快取後的複用價格降至約 0.06 美元/百萬 tokens,顯著降低了長對話和程式碼庫引用場景的成本。 與其他主流模型相比,M2.7 的價格優勢極為明顯。以輸入價格為例,Claude Opus 4.6 為 5.00 美元/百萬 tokens(為 M2.7 的約 17 倍),GPT-5.4 為 2.50 美元,Claude Sonnet 4.6 為 3.00 美元,而 DeepSeek V3 僅為 0.27 美元。按照 Kilo Code 的實測案例,相同測試任務 M2.7 花費 0.27 美元而 Claude Opus 花費 3.67 美元,成本約為競品的 7%。對於日均處理 1000 萬 tokens 的團隊,M2.7 的年化成本約 3 萬美元,而 Claude Opus 4.6 則接近 90 萬美元。 除按量付費外,MiniMax 還提供 Token Plan 訂閱制,年費從 100 美元(入門)到 1500 美元(超高速)不等。使用者也可以透過 OpenRouter(排名第4的使用量)、HuggingFace(開放權重下載)、agent.minimax.io(免費試用額度)等多種渠道接入。OpenRouter 上 M2.7 價格與官方一致,不額外加價。
-
M2.7 在多項主流基準測試中的表現如下:MMLU-Pro 78.2 分(對比 Claude Opus 4.6 的 80.1),數學推理 MATH-500 得分 91.6(Claude Opus 4.6 為 93.2,差距僅 1.6 分),HumanEval+ 程式碼測試 87.5 分。但 SWE-Bench Verified(第三方獨立驗證版本)得分 48.3%,與 Claude Opus 4.6 的 55.7% 仍有約 7 個百分點的差距。長上下文大海撈針測試(NIAH 100K)得分 99.1%,1M 超長上下文得分 96.8%,是 M2.7 的核心優勢專案。Artificial Analysis 的 AA Intelligence Index v4.0 獨立測量給出 50 分(Claude Opus 4.6 為 53 分),LMSYS Chatbot Arena 獨立驗證得分為 1447ELO。 需要注意的是,部分高分基準(SWE-Pro 56.22%、Terminal Bench 2 57.0%、VIBE-Pro 55.6%)為 MiniMax 自測或內部基準,且存在兩項已確認的效能回退:在 τ²-Bench 電信任務上較 M2.5 下降 11 個百分點,在 BridgeBench vibe-coding 任務上表現也不如 M2.5。此外,Artificial Analysis 指出 M2.7 生成的輸出 tokens 總量比 M2.5 多出約 55%,這在一定程度上拉高了獎勵完整性的基準分數,但在實際生產環境中也意味著更高的成本和更慢的響應速度。
-
由於 M2.7 釋出時間相對較新,公開的大規模使用者評價資料有限。從現有資訊來看,開發者和 AI 應用社群對 M2.7 的價效比給予了高度認可。前代產品 M2.5 已在 Kilo Code 平臺佔據 Code 模式使用量第一的位置,市場佔有率達 37%,超越了 Claude Opus 4.6 和 GPT-5.4,這一市場基礎為 M2.7 的推廣提供了有力背書。 從實測反饋來看,M2.7 在程式碼生成、bug 檢測、安全漏洞識別等日常開發任務上獲得了較多正面評價,開發者普遍認可其在保持高質量輸出的同時顯著降低使用成本的特性。部分使用者反映 M2.7 生成的響應較長,在處理一些需要簡潔回覆的場景時不如 Claude 系列模型。純文字限制也受到部分需要多模態能力使用者的批評。
-
M2.7 的釋出在程式碼模型市場掀起了新一輪價格戰,將頂級程式碼模型的使用門檻大幅拉低。從競爭格局來看,M2.7 的直接競品包括 Claude Opus 4.6、GPT-5.4-Codex、Claude Sonnet 4.6、Kimi K2.5 和 DeepSeek V3。在程式碼能力維度,M2.7 與 Claude Sonnet 4.6 水平接近,落後於 Claude Opus 4.6 和 GPT-5.4;在價格維度,M2.7 僅次於 DeepSeek V3 的極低定價,遠低於其他競品。 M2.7 的「自我進化」機制引發了不少行業討論。支持者認為這代表了大模型訓練的新正規化,模型能夠自主參與最佳化過程將顯著加速 AI 能力的迭代;批評者則認為這種機制目前仍是在嚴格程式化框架內執行的自動化評估迴圈,並非真正的自主進化,營銷宣傳存在過度擬人化的問題。還有觀點指出,如果 MiniMax 保持當前的快速迭代節奏,將對 Anthropic 和 OpenAI 的定價策略形成壓力,推動整個行業向更低價方向發展。
-
關於開源屬性的爭議是 M2.7 面臨的主要質疑之一。雖然 MiniMax 宣佈 M2.7 開放權重,但許可證明確禁止商業使用,HuggingFace 上的 LICENSE 檔案第一行即標註「NON-COMMERCIAL LICENSE」。這與通常意義上的開源(以 MIT、Apache 等協議為代表,允許無條件商用)有本質區別。MiniMax 將其宣傳為「開源」被部分開發者認為存在誤導,M 系列許可證從 M2 的 MIT 協議逐步收緊也引發了關於公司開放策略誠信度的討論。 資料安全風險是企業使用者需要重點考量的因素。MiniMax 母公司總部位於中國,受《中華人民共和國國家情報法》第7條約束。雖然全球 API(api.minimax.io)由新加坡實體運營,資料與國內端點隔離,但對於金融、醫療、政府等敏感行業使用者而言,合規審查和審計風險仍然顯著。企業若對資料主權有嚴格要求,建議優先考慮自建部署方案,但需評估硬體門檻——FP16 無量化版本需要約 461 GB 視訊記憶體(約 7 張 H100 80GB),4-bit 量化版本也需 115~130 GB 視訊記憶體。 基準測試信任問題也值得關注。最高分的基準資料(SWE-Pro、VIBE-Pro、Terminal Bench 等)均為 MiniMax 自測或內部基準,第三方獨立驗證的資料相對保守,企業使用者在選型時應綜合考慮這一因素。此外,模型處於非美國實體清單狀態,但存在未來被納入的供應鏈風險。
-
M2.7 的最佳使用場景包括:日常程式設計輔助與程式碼生成(佔常規任務 80% 的比例,M2.7 價效比最高)、超長程式碼庫分析與理解(20 萬上下文配合低輸入價格優勢明顯)、多 Agent 協作管線搭建(原生 Agent Teams 支援)、需要控制 API 成本的高併發 SaaS 後端服務,以及 RAG 系統的生成端(長上下文能容納更多檢索結果)。 不推薦使用 M2.7 的場景包括:複雜企業級程式碼重構和長期架構設計(建議使用 Claude Opus 4.6 或 GPT-5.4)、需要多模態處理的能力(模型為純文字限制)、非技術性內容創作和散文寫作(Claude 系列更擅長)、以及對許可證合規性有嚴格要求的商業產品整合。 一個務實的組合使用策略是:以 M2.7 處理日常程式設計問答、文件分析和常規任務(約佔總工作量 80%),以 Claude Opus 4.6 或 GPT-5.4 處理複雜工程難題(約 20%),以 DeepSeek V3 處理大規模批次資料處理和內容生成。這種組合可以在保持輸出質量的同時顯著控制 API 成本。
-
MiniMax M2.7 是一款能力處於準第一梯隊、價效比極高的程式碼與協作專用大模型,其核心競爭力在於以 Claude Opus 4.6 約 7% 的成本完成了 90% 以上的程式碼任務質量,加上原生多 Agent 協作和自我進化訓練機制的加持,在 2026 年上半年的程式碼模型市場中具有極強的競爭力。但其非商業許可限制、資料安全地緣政治風險、以及基準資料獨立性不足等爭議也不容忽視。適合對成本敏感且程式碼任務為主的技術團隊選用,但企業在生產整合前應充分評估合規要求和許可證約束。
使用者評論
-
EugenHauk—整體體驗下來 M2.7 在辦公、程式碼、跟 MaxClaw 適配度上都超出預期,幫我省了 BI 工具和 Coding 訂閱的錢。硬傷還是複雜 Bug 快速定位和大規模改寫程式碼出錯率,多輪裡自相矛盾的 Prompt 處理得不夠好。作為國產 Agent 模型第一梯隊,閉源和純文字是我最遺憾的兩點。 -
丁梅—跑複雜 Agent 時 40 個 Skill 還能保持 97% 的指令遵循率,我電腦上 32 個 skills 龍蝦基本沒亂過,這點比大多數模型強,裝多了也不串臺。 -
Gary_Peterson_X—PinchBench 排第四,離 Sonnet 4.6 就差 0.7 個百分點,龍蝦圈裡已經算國產天花板了。 -
秦心—真拿它處理過一次線上慢查詢故障,從告警到根因定位不到一小時,它還知道用非阻塞方式先建索引止血再補 MR,這種 SRE 級別的判斷比單純寫程式碼值錢多了。日常開發它能扛 70% 到 80% 的方案設計和編碼,剩下那截還得人把關,量大管飽但真不兜底。 -
FoxFinanceCooper—長流程多輪對話上下文會衰減,自相矛盾的需求它不會主動跟你確認,直接把你已歸檔的選題給過濾了,複雜系統還是先把產品設計好再扔給它。 -
DRussell_20210—貴是真不貴,API 比 Opus 便宜快 20 倍,快取讀幾乎白送。 -
Russell.Cook—自我進化這個點確實嚇人,MiniMax 讓 M2.7 自己最佳化內部腳手架,零人工干預跑了 100 多輪迭代迴圈,自己分析失敗軌跡、改程式碼、跑評測、對比決定保留還是回退,內部評測集直接漲了 30%。Kaggle MLE Lite 24 小時拿 9 金 5 銀 1 銅,和 Gemini-3.1 打平。 -
天涯_1—讓它做 iPhone 歷代外觀盤點網頁,結構和時間線都對,就是圖片抓取被牆載入失敗,最後接 MaxClaw 搓圖才插進去,影象獲取這塊還是卡手。 -
煙雨93—開源黨破防了,M2.5 還是 Apache2.0,到 M2.7 直接閉源了,商用自部署還要書面授權。 -
PaulRoss_66755—Token Plan 升級後額度暴漲四五倍還改人民幣定價,Plus 檔 49 塊月付 1500 次請求 / 5 小時,對國內開發者太友好了。就是 5 小時滾動視窗不滾存,高峰 15 點到 17 點半還會動態限流,得卡著點用。 -
GraviqyDrop238—吐槽一下,數學和複雜巢狀指令真不能賭,L-Math Hard 才 15 分,迴圈輸出崩得厲害,涉及推理還是換別的模型吧。 -
bluetiger391—程式碼比想象能打,SWE-Pro 56 追平 Opus,工程活兒是真行。 -
Bryan.Gonzalez_2020—月燒三千刀 Skills 重度使用者說句實話:M2.7 響應比 Claude 快太多了,highspeed 版本即時滿足,Agent Team 多角色協作也扛得住,寫 3D 主題樂園網頁一句話口噴就跑起來。但在 Office 三件套尤其 PPT 的閱讀樣式和長文原創人設上還得自己改。結論:Agent 協作、辦公自動化、價效比這三個維度,國產天花板沒跑了。 -
KathleenWilliams_2020—實測生產故障排查,M2.7 真能關聯監控指標和部署時間線做因果推理,定位到缺失的索引遷移檔案,還知道先用非阻塞建索引止血再提 MR,三分鐘恢復,這不像只會寫程式碼的模型。 -
ETlop—純文字模型這點挺遺憾,今年都卷多模態了它還不支援圖。 -
Abigail.PowellJr311—MaxClaw 是真香,裝 Skill 直接甩連結就行,網路問題它自己重試,不用去折騰配置頁面了,終於有「寄存大腦」的感覺了。 -
Ethan.Cook_2022—把 MiniMax M2.7 接進 Claude Code 跑了份 4.4 個 G 的股票資料視覺化,它自己裝 Pandas、清洗、建模型、最後用 Streamlit 轉成可互動網頁,全程我沒怎麼插手。長任務上下文是真穩,近萬字研報愣是沒幻覺,這點比很多旗艦都強。 -
PeterButler_2021—M2.7 幫我做了一份閃迪財報 Excel,五張 Sheet 直接吐出來,投行深藍配色太頂了。 -
PamelaPrice_2021—太香了這個價格,輸入才0.3刀一百萬token,Claude要15刀! -
happyrabbit128—接入了Cursor跑了幾天,M2.7真的是價效比之王。日常CRUD任務完全不輸Claude,偶爾遇到難的再切Opus,省了太多錢了 -
DianaWalker_2022—開源是開源,但許可證寫著禁止商用啊各位,這不是真正意義上的開源,別被宣傳帶跑了 -
JenniferEvans36956—部署試了一下,FF16無量化需要7張H100,4090根本跑不動…還是乖乖用API吧 -
Declan593—Kaggle MLE Lite拿了66.6%的得牌率,這個成績僅次於Opus 4.6和GPT-5.4了,已經是國產最高了吧說實話 -
梅花643—終於開源了!但用了一下發現不能商用…還好API便宜,不然真得罵人 -
EJohnsonSr—OpenRouter上能用,切換成本幾乎為零,Claude SDK直接改個環境變數就切過去了,這個體驗要給好評 -
Steven_Anderson369904—測試了一下bug檢測,我找了6個bug它全部找出來了,跟Opus打了個平手,有點東西 -
Ethan_Hicks007305—自我進化這個概念很唬人,但說實話就是在嚴格的RL框架裡跑自動化迴圈,沒有那麼神 -
George_Alvarez_X—穩定性真的比智譜好太多,智譜動不動就售罄,MiniMax目前還沒遇到過這種情況 -
NathanMyers_738—對比了一圈國內四家大模型套餐,MiniMax綜合最優解:穩定、量大、價格合理。Kimi被按在地上摩擦,token消耗異常偏高的問題太大了,實際可用量直接打五折 -
goldenleopard197—高速版實測速度大概7-10 tokens/sec,不是官方宣稱的100TPS,但也夠用了