MiniMax M2.7

MiniMax公開的2290亿参数MoE架构代码とコラボ专用大規模モデル,以Claude Opus约7%的成本完成90%以上代码任务质量

詳細レポート

  • MiniMax M2.7 は、MiniMax (Xiyu Technology) が 2026 年 3 月 18 日にリリースした主力大型言語モデルです。MoE ハイブリッド エキスパート アーキテクチャを採用しており、総パラメータ量は 2,290 億、アクティベーション パラメータは約 100 億です。独自のトレーニング反復に深く関与する中国初のモデルである M2.7 の最大の技術的進歩は、強化学習ハーネス自動化サイクルをトレーニング プロセスに導入したことであり、これによりモデルが研究開発ワークロードの約 30% ~ 50% を引き受けることが可能になります。ソフトウェア エンジニアリング ベンチマーク SWE-Pro テストで 56.22% のスコアを達成し、コードとバグ検出機能は Claude Opus 4.6 のレベルに近いものになっています。価格の点では、M2.7 の投入価格は Claude Opus 4.6 のわずか約 15 分の 1 であり、2026 年上半期において最も費用対効果の高い準第 1 層コード モデルとみなされています。このモデルの重みはオープンソース化されていますが、無許可の商用展開を禁止する MiniMax-Modified 非商用ライセンス契約を採用していることは注目に値します。

  • MiniMax は 2021 年に設立され、中国に本社を置く人工知能テクノロジーに焦点を当てたテクノロジー企業です。 MiniMax の創設チームは AI 分野で豊富な経験を持ち、同社は多くの著名な機関から投資を受けています。 M2.7 は、MiniMax M シリーズ モデルの最新の反復バージョンです。 M2 から M2.7 までの反復サイクルは約 6 か月で、各世代で主要なベンチマーク指標が大幅に改善されました。 M2.7の位置付けは、一般的な対話モデルではなく、「Cowork Agent」のコラボレーションシナリオに焦点を当てたコードおよび専門タスクモデルです。技術的な観点から見ると、M2.7 はスパース混合エキスパート (MoE) アーキテクチャを採用しており、各トークンは約 100 億個のパラメーターのみをアクティブにします (全パラメーターの 4.3% を占めます)。この設計により、モデルは強力な機能を維持しながら推論コストを大幅に削減できます。 2026年4月12日、MiniMaxはM2.7のオープンソース重量を正式に発表しましたが、「MiniMax-Modified Non-Commercial License」という特別な契約を使用しており、個人利用や研究利用は許可されていますが、商用利用は明確に禁止されています。商用利用には事前にMiniMaxへの書面による認可申請が必要です。このライセンス契約は物議を醸しており、一部の開発者は「疑似オープンソース」の疑いがあると考えています。

  • M2.7の最大の技術的ハイライトは、その「自己進化」能力です。従来のモデルのトレーニング反復は、データ スクリーニング、実験計画、評価と分析などを含む、大量の手動参加に依存しています。M2.7 は、実験モニタリング、ログ検査、コード修復および評価サイクルを単独で推進できる一連の自動強化学習ハーネスを構築しました。モデルは、トレーニング プロセス中に研究開発ワークロードの約 30% ~ 50% を引き受けることができます。 MiniMax の内部評価データによると、このメカニズムにより全体的なパフォーマンスが 30% 向上します。このメカニズムの実装は、M2.7 によってネイティブにサポートされるエージェント チーム機能に依存します。複数の AI エージェントが連携して、複雑な多段階のタスクを完了できます。この機能は、外部のプロンプト ワード エンジニアリングに依存するのではなく、モデルの最下層に組み込まれています。

  • M2.7 は、いくつかのソフトウェア エンジニアリング ベンチマークで優れたパフォーマンスを発揮します。 SWE-Pro テストでは 56.22% のスコアを獲得し、GPT-5.3-Codex のレベルに近づきました。 Kilo Code の独立した研究所による実際の測定では、3 つの TypeScript コード ベースのテストで、M2.7 と Claude Opus 4.6 が完全に同等のパフォーマンスで 6 つのバグすべてと 10 のセキュリティ脆弱性すべてを検出できたことが示されています。ただし、修正の完全性にはギャップがあります。Claude Opus 4.6 では 41 の統合テスト (データベースのテストとクリーニング ロジックを含む) が生成されましたが、M2.7 では 20 の単体テスト (スキーマと処理関数の直接検証) が生成されました。オンライン運用およびメンテナンスのシナリオでは、M2.7 はモニタリング アラームの分析、データベースへの接続による原因の検証、ノンブロッキング止血処理 (インデックス作成など)、PR の送信というプロセス全体を独立して完了できます。公式データによると、M2.7 に基づいて、障害回復時間が 3 分未満に何度も短縮されました。

  • プロフェッショナルオフィス分野でもM2.7の実力が遺憾なく発揮されています。 GDPval-AA ELO評価では1495~1500点を獲得し、世界第4位となった。プロフェッショナルなシナリオには、財務文書分析、収益予測モデリングなどが含まれます。3 つの要素からなる Office スイート (Excel/PPT/Word) の複雑な編集シナリオでは、M2.5 から M2.7 まで大幅に改善され、複数回の修正と忠実度の高い編集がサポートされています。ツール呼び出し (関数呼び出し) に関しては、Toolathon ベンチマーク精度率は 46.3% に達し、OpenClaw の評価における最新の Claude Sonnet 4.6 レベルに近い値となっています。

  • M2.7はMoEスパースハイブリッドエキスパートアーキテクチャを採用しており、パラメータ総数は2,290億、活性化パラメータは約100億。マルチヘッド因果的セルフアテンションは、回転位置エンコーディング (RoPE) と QK RMSNorm 最適化を組み合わせます。コンテキスト ウィンドウは 204,800 トークン (約 200,000) で、最大出力長は公称最大 204,800 トークンです。ナレッジの期限は 2026 年 3 月です。このモデルはプレーン テキスト入力を使用し、画像、音声、ビデオなどのマルチモーダル入力をサポートしていません。 API プロトコルは OpenAI 形式と完全に互換性があり、関数呼び出し、ストリーミング、JSON モードなどの一般的な機能をサポートします。

  • M2.7 は 2 つの API バージョンを提供します。標準バージョン M2.7 の入力価格は 0.30 ドル/100 万トークン、出力価格は 1.20 ドル/100 万トークンです。高速バージョン M2.7-highspeed の入力価格は 0.60 ドル/100 万トークン、出力価格は 2.40 ドル/100 万トークンです。自動コンテキスト キャッシュ機能は設定なしで有効になり、キャッシュ後の再利用料金は 100 万トークンあたり約 0.06 米ドルに削減され、長時間の会話やコード ベースの参照シナリオのコストが大幅に削減されます。 他の主流モデルと比較すると、M2.7 の価格上の優位性は非常に明白です。入力価格を例に挙げると、Claude Opus 4.6 は 100 万トークンあたり 5.00 ドル (M2.7 の約 17 倍)、GPT-5.4 は 2.50 ドル、Claude Sonnet 4.6 は 3.00 ドル、DeepSeek V3 はわずか 0.27 ドルです。 Kilo Code の実際のテスト ケースによると、同じテスト タスクの M2.7 のコストは 0.27 米ドル、Claude Opus のコストは 3.67 米ドルで、これは競合製品のコストの約 7% です。 1 日あたり 1,000 万個のトークンを処理するチームの場合、M2.7 の年間コストは約 30,000 ドルですが、Claude Opus 4.6 のコストは 900,000 ドル近くになります。 MiniMax は、従量課金制に加えて、トークン プランのサブスクリプションも提供しており、年会費は 100 米ドル (エントリー) から 1,500 米ドル (超高速) の範囲です。ユーザーは、OpenRouter (使用量ランキング 4 位)、HuggingFace (オープンウェイトダウンロード)、agent.minimax.io (無料トライアル割り当て) などのさまざまなチャネルを通じてアクセスすることもできます。OpenRouter の M2.7 の価格は公式価格と一致しており、追加の値上げはありません。

  • 複数の主流ベンチマーク テストにおける M2.7 のパフォーマンスは次のとおりです。MMLU-Pro 78.2 ポイント (Claude Opus 4.6 の 80.1 ポイントと比較)、数的推論 MATH-500 スコア 91.6 (Claude Opus 4.6 は 93.2 で、その差はわずか 1.6 ポイント)、HumanEval+ コード テスト 87.5 ポイントです。しかし、SWE-Bench Verified (サードパーティの独立した検証バージョン) スコア 48.3% は、Claude Opus 4.6 の 55.7% とはまだ約 7 ポイントの差です。干し草の山テスト (NIAH 100K) でのロングコンテキストニードルのスコアは 99.1%、1M の超ロングコンテキストのスコアは 96.8% であり、これが M2.7 の主な利点です。 Artificial Analysis の AA Intelligence Index v4.0 の独立した測定によるスコアは 50 (Claude Opus 4.6 の 53 と比較)、LMSYS Chatbot Arena の独立した検証スコアは 1447ELO です。 高スコアのベンチマークの一部 (SWE-Pro 56.22%、ターミナル ベンチ 2 57.0%、VIBE-Pro 55.6%) は MiniMax セルフテストまたは内部ベンチマークであり、2 つの確認されたパフォーマンス回帰があることに注意してください。τ²-Bench テレコム タスクでは M2.5 より 11 パーセント ポイント低く、BridgeBench バイブコーディング タスクではパフォーマンスがそれほど良くありません。 M2.5。さらに、Artificial Analysis は、M2.7 は M2.5 よりも約 55% 多くの総出力トークンを生成し、報酬の完全性に関するベンチマーク スコアをある程度向上させますが、実際の運用環境ではコストが高くなり、応答時間が遅くなることも意味すると指摘しています。

  • M2.7は比較的最近リリースされたため、公開されている大規模なユーザー評価データは限られています。入手可能な情報から判断すると、開発者と AI アプリケーション コミュニティは M2.7 の費用対効果を高く評価しています。前世代の製品 M2.5 は、Kilo Code プラットフォームのコード モード使用量で第 1 位を占め、市場シェア 37% を獲得し、Claude Opus 4.6 と GPT-5.4 を上回りました。この市場基盤は、M2.7 の推進を強力に支持します。 実際のテストのフィードバックから判断すると、M2.7 は、コード生成、バグ検出、セキュリティ脆弱性の特定などの日常の開発タスクに対して多くの肯定的なレビューを受けています。開発者は一般に、高品質の出力を維持しながら使用コストを大幅に削減するその機能を認識しています。一部のユーザーは、M2.7 は長い応答を生成し、簡潔な応答を必要とする一部のシナリオの処理において Claude シリーズ モデルほど優れていないことを報告しています。テキストのみの制限は、マルチモーダル機能を必要とする一部のユーザーからも批判されています。

  • M2.7 のリリースにより、コード モデル市場で新たな価格戦争が始まり、トップ コード モデルを使用する敷居が大幅に下がりました。競争環境から見ると、M2.7 の直接の競合相手には、Claude Opus 4.6、GPT-5.4-Codex、Claude Sonnet 4.6、Kimi K2.5、DeepSeek V3 が含まれます。コード機能の点では、M2.7 は Claude Sonnet 4.6 に近く、Claude Opus 4.6 および GPT-5.4 に劣ります。価格の点では、M2.7 は DeepSeek V3 の非常に低い価格設定に次いで 2 番目であり、他の競合製品よりもはるかに安いです。 M2.7 の「自己進化」メカニズムは、業界で多くの議論を引き起こしました。支持者は、これが大規模モデルのトレーニングの新しいパラダイムを表し、最適化プロセスに自律的に参加するモデルの機能により AI 機能の反復が大幅に加速されると信じています。批評家は、このメカニズムは依然として厳密なプログラムの枠組み内で実行される自動化された評価サイクルであり、真の自律的な進化ではなく、マーケティングのプロモーションが過度に擬人化されていると信じています。また、MiniMax が現在の急速な反復ペースを維持すると、Anthropic と OpenAI の価格戦略に圧力がかかり、業界全体が低価格化に向かう​​だろうと指摘する人もいます。

  • オープンソースの性質をめぐる論争は、M2.7 が直面する主な疑問の 1 つです。 MiniMaxはM2.7のオープンウェイトを発表しましたが、ライセンスでは商業利用が明確に禁止されています。 HuggingFace の LICENSE ファイルの最初の行には、「NON-COMMERCIAL LICENSE」とマークされています。これは、通常の意味でのオープンソース (MIT、Apache、および無条件の商用利用を許可するその他のプロトコルに代表される) とは本質的に異なります。 MiniMax がそれを「オープンソース」として宣伝することは、一部の開発者には誤解を招くと考えられています。 M2 の MIT 契約による M シリーズ ライセンスの段階的な厳格化も、同社のオープン戦略の完全性に関する議論を引き起こしました。 データ セキュリティのリスクは、企業ユーザーが考慮する必要がある要素です。 MiniMax の親会社は中国に本社があり、中華人民共和国国家情報法第 7 条に拘束されています。グローバル API (api.minimax.io) はシンガポールの事業体によって運営されており、データは国内のエンドポイントから分離されていますが、金融、医療、政府などの機密性の高い業界のユーザーにとって、コンプライアンスのレビューと監査のリスクは依然として重大です。企業にデータ主権に対する厳しい要件がある場合は、自社構築の導入ソリューションを優先することをお勧めしますが、ハードウェアのしきい値を評価する必要があります。FP16 の非量子化バージョンには約 461 GB のビデオ メモリ (約 7 H100 80GB) が必要で、4 ビット量子化バージョンにも 115 ~ 130 GB のビデオ メモリが必要です。 ベンチマークの信頼の問題も注目に値する。最高スコアのベンチマーク データ (SWE-Pro、VIBE-Pro、ターミナル ベンチなど) はすべて MiniMax セルフテストまたは内部ベンチマークです。第三者によって独自に検証されたデータは比較的保守的です。企業ユーザーはモデルを選択する際にこの要素を考慮する必要があります。さらに、このモデルは米国以外のエンティティリストのステータスにありますが、将来的にはサプライチェーンに含まれるリスクがあります。

  • M2.7 の最適な使用シナリオには、毎日のプログラミング支援とコード生成 (通常のタスクの 80% を占め、M2.7 が最も費用対効果が高い)、超長いコード ベースの分析と理解 (200,000 のコンテキストと低入力価格には明らかな利点があります)、マルチエージェント コラボレーション パイプラインの構築 (ネイティブ エージェント チームによってサポート)、API コストを制御する必要がある同時実行性の高い SaaS バックエンド サービス、およびRAG システム (長いコンテキストにより、より多くの検索結果を収容できます)。 M2.7 が推奨されないシナリオには、複雑なエンタープライズ レベルのコード リファクタリングと長期的なアーキテクチャ設計 (Claude Opus 4.6 または GPT-5.4 を推奨)、マルチモーダル処理を必要とする機能 (モデルはプレーン テキストに限定される)、非技術的なコンテンツの作成と散文の作成 (Claude シリーズが得意)、およびライセンス コンプライアンスの厳格な要件がある商用製品の統合が含まれます。 実用的な組み合わせ使用戦略は、日常的なプログラミング Q&A、ドキュメント分析、および一般的なタスク (総ワークロードの約 80%) には M2.7 を、複雑なエンジニアリングの問題 (約 20%) には Claude Opus 4.6 または GPT-5.4 を、そして大規模なバッチ データ処理とコンテンツ生成には DeepSeek V3 を使用することです。この組み合わせにより、出力品質を維持しながら API コストを大幅に制御できます。

  • MiniMax M2.7 は、コードとコラボレーションに特化した、準第一層のコスト効率の高い大型モデルです。その核となる競争力は、Claude Opus 4.6 の約 7% のコストでコード タスクの品質の 90% 以上を完了できることにあります。ネイティブのマルチエージェント コラボレーションと自己進化トレーニング メカニズムのサポートと相まって、2026 年上半期のコード モデル市場での競争力は非常に高くなるでしょう。ただし、非商用ライセンスの制限、データ セキュリティに対する地政学的リスク、ベンチマーク データの不十分な独立性などの論争は無視できません。これは、コストを重視しコーディング タスクに重点を置く技術チームに適していますが、企業は運用統合の前にコンプライアンス要件とライセンスの制約を十分に評価する必要があります。

ユーザーレビュー

  • 头像
    EugenHauk
    整体体验下来 M2.7 在办公、代码、跟 MaxClaw 适配度上都超出预期,帮我省了 BI 工具和 Coding 订阅的钱。硬伤还是复杂 Bug 快速定位和大规模改写代码出错率,多轮里自相矛盾的 Prompt 处理得不够好。作为国产 Agent 模型第一梯队,闭源和纯文本是我最遗憾的两点。

  • 头像
    丁梅
    跑复杂 Agent 时 40 个 Skill 还能保持 97% 的指令遵循率,我电脑上 32 个 skills 龙虾基本没乱过,这点比大多数模型强,装多了也不串台。

  • 头像
    Gary_Peterson_X
    PinchBench 排第四,离 Sonnet 4.6 就差 0.7 个百分点,龙虾圈里已经算国产天花板了。

  • 头像
    秦心
    真拿它处理过一次线上慢查询故障,从告警到根因定位不到一小时,它还知道用非阻塞方式先建索引止血再补 MR,这种 SRE 级别的判断比单纯写代码值钱多了。日常开发它能扛 70% 到 80% 的方案设计和编码,剩下那截还得人把关,量大管饱但真不兜底。

  • 头像
    FoxFinanceCooper
    长流程多轮对话上下文会衰减,自相矛盾的需求它不会主动跟你确认,直接把你已归档的选题给过滤了,复杂系统还是先把产品设计好再扔给它。

  • 头像
    DRussell_20210
    贵是真不贵,API 比 Opus 便宜快 20 倍,缓存读几乎白送。

  • 头像
    Russell.Cook
    自我进化这个点确实吓人,MiniMax 让 M2.7 自己优化内部脚手架,零人工干预跑了 100 多轮迭代循环,自己分析失败轨迹、改代码、跑评测、对比决定保留还是回退,内部评测集直接涨了 30%。Kaggle MLE Lite 24 小时拿 9 金 5 银 1 铜,和 Gemini-3.1 打平。

  • 头像
    天涯_1
    让它做 iPhone 历代外观盘点网页,结构和时间线都对,就是图片抓取被墙加载失败,最后接 MaxClaw 搓图才插进去,图像获取这块还是卡手。

  • 头像
    烟雨93
    开源党破防了,M2.5 还是 Apache2.0,到 M2.7 直接闭源了,商用自部署还要书面授权。

  • 头像
    PaulRoss_66755
    Token Plan 升级后额度暴涨四五倍还改人民币定价,Plus 档 49 块月付 1500 次请求 / 5 小时,对国内开发者太友好了。就是 5 小时滚动窗口不滚存,高峰 15 点到 17 点半还会动态限流,得卡着点用。

  • 头像
    GraviqyDrop238
    吐槽一下,数学和复杂嵌套指令真不能赌,L-Math Hard 才 15 分,循环输出崩得厉害,涉及推理还是换别的模型吧。

  • 头像
    bluetiger391
    代码比想象能打,SWE-Pro 56 追平 Opus,工程活儿是真行。

  • 头像
    Bryan.Gonzalez_2020
    月烧三千刀 Skills 重度用户说句实话:M2.7 响应比 Claude 快太多了,highspeed 版本即时满足,Agent Team 多角色协作也扛得住,写 3D 主题乐园网页一句话口喷就跑起来。但在 Office 三件套尤其 PPT 的阅读样式和长文原创人设上还得自己改。结论:Agent 协作、办公自动化、性价比这三个维度,国产天花板没跑了。

  • 头像
    KathleenWilliams_2020
    实测生产故障排查,M2.7 真能关联监控指标和部署时间线做因果推理,定位到缺失的索引迁移文件,还知道先用非阻塞建索引止血再提 MR,三分钟恢复,这不像只会写代码的模型。

  • 头像
    ETlop
    纯文本模型这点挺遗憾,今年都卷多模态了它还不支持图。

  • 头像
    Abigail.PowellJr311
    MaxClaw 是真香,装 Skill 直接甩链接就行,网络问题它自己重试,不用去折腾配置页面了,终于有「寄存大脑」的感觉了。

  • 头像
    Ethan.Cook_2022
    把 MiniMax M2.7 接进 Claude Code 跑了份 4.4 个 G 的股票数据可视化,它自己装 Pandas、清洗、建模型、最后用 Streamlit 转成可交互网页,全程我没怎么插手。长任务上下文是真稳,近万字研报愣是没幻觉,这点比很多旗舰都强。

  • 头像
    PeterButler_2021
    M2.7 帮我做了一份闪迪财报 Excel,五张 Sheet 直接吐出来,投行深蓝配色太顶了。

  • 头像
    PamelaPrice_2021
    太香了这个价格,输入才0.3刀一百万token,Claude要15刀!

  • 头像
    happyrabbit128
    接入了Cursor跑了几天,M2.7真的是性价比之王。日常CRUD任务完全不输Claude,偶尔遇到难的再切Opus,省了太多钱了

  • 头像
    DianaWalker_2022
    开源是开源,但许可证写着禁止商用啊各位,这不是真正意义上的开源,别被宣传带跑了

  • 头像
    JenniferEvans36956
    部署试了一下,FF16无量化需要7张H100,4090根本跑不动…还是乖乖用API吧

  • 头像
    Declan593
    Kaggle MLE Lite拿了66.6%的得牌率,这个成绩仅次于Opus 4.6和GPT-5.4了,已经是国产最高了吧说实话

  • 头像
    梅花643
    终于开源了!但用了一下发现不能商用…还好API便宜,不然真得骂人

  • 头像
    EJohnsonSr
    OpenRouter上能用,切换成本几乎为零,Claude SDK直接改个环境变量就切过去了,这个体验要给好评

  • 头像
    Steven_Anderson369904
    测试了一下bug检测,我找了6个bug它全部找出来了,跟Opus打了个平手,有点东西

  • 头像
    Ethan_Hicks007305
    自我进化这个概念很唬人,但说实话就是在严格的RL框架里跑自动化循环,没有那么神

  • 头像
    George_Alvarez_X
    稳定性真的比智谱好太多,智谱动不动就售罄,MiniMax目前还没遇到过这种情况

  • 头像
    NathanMyers_738
    对比了一圈国内四家大模型套餐,MiniMax综合最优解:稳定、量大、价格合理。Kimi被按在地上摩擦,token消耗异常偏高的问题太大了,实际可用量直接打五折

  • 头像
    goldenleopard197
    高速版实测速度大概7-10 tokens/sec,不是官方宣称的100TPS,但也够用了