MiniMax M2.7

MiniMax发布的2290亿参数MoE架构代码与协作专用大模型,以Claude Opus约7%的成本完成90%以上代码任务质量

深度报告

  • MiniMax M2.7 是 MiniMax(稀宇科技)于 2026 年 3 月 18 日发布的旗舰级大语言模型,采用 MoE 混合专家架构,总参数量 2290 亿,激活参数约 100 亿。作为国内首个深度参与自身训练迭代的模型,M2.7 最大的技术突破在于将强化学习 Harness 自动化循环引入训练流程,使模型能承担研发工作量中约 30%~50% 的任务。在软件工程基准 SWE-Pro 测试中取得 56.22% 的成绩,代码与 bug 检测能力已接近 Claude Opus 4.6 水平。定价方面,M2.7 输入价格仅为 Claude Opus 4.6 的约 1/15,被视为 2026 年上半年性价比最高的准第一梯队代码模型。值得注意的是,该模型的权重虽已对外开源,但采用的是 MiniMax-Modified 非商业许可协议,禁止未经授权的商用部署。

  • MiniMax 成立于 2021 年,是一家专注于人工智能技术的科技公司,总部位于中国。MiniMax 的创始团队在 AI 领域有深厚积累,公司先后获得多家知名机构的投资。M2.7 是 MiniMax M 系列模型的最新迭代版本,从 M2 到 M2.7 的迭代周期约 6 个月,每一代都在关键基准指标上有明显提升。 M2.7 的定位并非通用对话模型,而是主打「Cowork Agent」协作场景的代码与专业任务模型。从技术路线来看,M2.7 采用稀疏混合专家(MoE)架构,每个 token 仅激活约 100 亿参数(占总参数量的 4.3%),这种设计使得模型在保持强大能力的同时大幅降低了推理成本。 2026 年 4 月 12 日,MiniMax 正式宣布 M2.7 开源开放权重,但使用了名为「MiniMax-Modified Non-Commercial License」的特殊协议,允许个人和研究使用,但明确禁止商业用途,商业使用需提前向 MiniMax 提交书面授权申请。这一许可证安排引发了一定争议,被部分开发者认为存在「伪开源」的嫌疑。

  • M2.7 最大的技术亮点在于其「自我进化」能力。传统模型的训练迭代依赖大量人工参与,包括数据筛选、实验设计、评测分析等环节。M2.7 则构建了一套自动化的强化学习 Harness,能够自行驱动实验监控、日志排查、代码修复与评测循环。模型在训练过程中可以承担约 30%~50% 的研发工作量,MiniMax 内部评测数据显示这种机制带来了约 30% 的综合性能提升。这一机制的实现依托于 M2.7 原生支持的 Agent Teams 能力,多个 AI 智能体可以分工协作完成复杂的多阶段任务,且这种能力已内化到模型底层而非依赖外部提示词工程。

  • M2.7 在多项软件工程基准测试中表现优异。在 SWE-Pro 测试中得分 56.22%,接近 GPT-5.3-Codex 的水平。Kilo Code 独立实验室的实测显示,在 3 个 TypeScript 代码库的测试中,M2.7 与 Claude Opus 4.6 均能找出全部 6 个 bug 和全部 10 个安全漏洞,表现完全持平。不过在修复彻底性上存在差距:Claude Opus 4.6 生成了 41 个集成测试(含测试数据库和清理逻辑),而 M2.7 生成了 20 个单元测试(直接验证 schema 和处理函数)。在线上运维场景中,M2.7 能够自主完成分析监控告警、连接数据库验证原因、非阻塞止血处理(如建索引)以及提交 PR 的全流程,官方数据显示基于 M2.7 已多次将故障恢复时间压缩至 3 分钟以内。

  • M2.7 在专业办公领域的能力也得到了充分体现。在 GDPval-AA ELO 评测中得分 1495~1500,位列全球第四,专业场景涵盖金融文档分析、营收预测建模等。在 Office 三件套(Excel/PPT/Word)复杂编辑场景中,M2.5 到 M2.7 的提升显著,支持多轮修改和高保真编辑。工具调用(Function Calling)方面,Toolathon 基准正确率达 46.3%,OpenClaw 评测中接近最新 Claude Sonnet 4.6 水平。

  • M2.7 采用 MoE 稀疏混合专家架构,总参数量 2290 亿,激活参数约 100 亿。多头因果自注意力结合旋转位置编码(RoPE)和 QK RMSNorm 优化。上下文窗口为 204800 tokens(约 20 万),最大输出长度官方标称可达 204800 tokens。知识截止时间为 2026 年 3 月。模型为纯文本输入,不支持图像、音频或视频等多模态输入。API 协议全面兼容 OpenAI 格式,支持 Function Calling、Streaming、JSON Mode 等常用功能。

  • M2.7 提供两个 API 版本,标准版 M2.7 输入价格为 0.30 美元/百万 tokens,输出价格为 1.20 美元/百万 tokens;高速版 M2.7-highspeed 输入价格 0.60 美元/百万 tokens,输出价格 2.40 美元/百万 tokens。自动上下文缓存功能无需配置即可生效,缓存后的复用价格降至约 0.06 美元/百万 tokens,显著降低了长对话和代码库引用场景的成本。 与其他主流模型相比,M2.7 的价格优势极为明显。以输入价格为例,Claude Opus 4.6 为 5.00 美元/百万 tokens(为 M2.7 的约 17 倍),GPT-5.4 为 2.50 美元,Claude Sonnet 4.6 为 3.00 美元,而 DeepSeek V3 仅为 0.27 美元。按照 Kilo Code 的实测案例,相同测试任务 M2.7 花费 0.27 美元而 Claude Opus 花费 3.67 美元,成本约为竞品的 7%。对于日均处理 1000 万 tokens 的团队,M2.7 的年化成本约 3 万美元,而 Claude Opus 4.6 则接近 90 万美元。 除按量付费外,MiniMax 还提供 Token Plan 订阅制,年费从 100 美元(入门)到 1500 美元(超高速)不等。用户也可以通过 OpenRouter(排名第4的使用量)、HuggingFace(开放权重下载)、agent.minimax.io(免费试用额度)等多种渠道接入。OpenRouter 上 M2.7 价格与官方一致,不额外加价。

  • M2.7 在多项主流基准测试中的表现如下:MMLU-Pro 78.2 分(对比 Claude Opus 4.6 的 80.1),数学推理 MATH-500 得分 91.6(Claude Opus 4.6 为 93.2,差距仅 1.6 分),HumanEval+ 代码测试 87.5 分。但 SWE-Bench Verified(第三方独立验证版本)得分 48.3%,与 Claude Opus 4.6 的 55.7% 仍有约 7 个百分点的差距。长上下文大海捞针测试(NIAH 100K)得分 99.1%,1M 超长上下文得分 96.8%,是 M2.7 的核心优势项目。Artificial Analysis 的 AA Intelligence Index v4.0 独立测量给出 50 分(Claude Opus 4.6 为 53 分),LMSYS Chatbot Arena 独立验证得分为 1447ELO。 需要注意的是,部分高分基准(SWE-Pro 56.22%、Terminal Bench 2 57.0%、VIBE-Pro 55.6%)为 MiniMax 自测或内部基准,且存在两项已确认的性能回退:在 τ²-Bench 电信任务上较 M2.5 下降 11 个百分点,在 BridgeBench vibe-coding 任务上表现也不如 M2.5。此外,Artificial Analysis 指出 M2.7 生成的输出 tokens 总量比 M2.5 多出约 55%,这在一定程度上拉高了奖励完整性的基准分数,但在实际生产环境中也意味着更高的成本和更慢的响应速度。

  • 由于 M2.7 发布时间相对较新,公开的大规模用户评价数据有限。从现有信息来看,开发者和 AI 应用社区对 M2.7 的性价比给予了高度认可。前代产品 M2.5 已在 Kilo Code 平台占据 Code 模式使用量第一的位置,市场占有率达 37%,超越了 Claude Opus 4.6 和 GPT-5.4,这一市场基础为 M2.7 的推广提供了有力背书。 从实测反馈来看,M2.7 在代码生成、bug 检测、安全漏洞识别等日常开发任务上获得了较多正面评价,开发者普遍认可其在保持高质量输出的同时显著降低使用成本的特性。部分用户反映 M2.7 生成的响应较长,在处理一些需要简洁回复的场景时不如 Claude 系列模型。纯文本限制也受到部分需要多模态能力用户的批评。

  • M2.7 的发布在代码模型市场掀起了新一轮价格战,将顶级代码模型的使用门槛大幅拉低。从竞争格局来看,M2.7 的直接竞品包括 Claude Opus 4.6、GPT-5.4-Codex、Claude Sonnet 4.6、Kimi K2.5 和 DeepSeek V3。在代码能力维度,M2.7 与 Claude Sonnet 4.6 水平接近,落后于 Claude Opus 4.6 和 GPT-5.4;在价格维度,M2.7 仅次于 DeepSeek V3 的极低定价,远低于其他竞品。 M2.7 的「自我进化」机制引发了不少行业讨论。支持者认为这代表了大模型训练的新范式,模型能够自主参与优化过程将显著加速 AI 能力的迭代;批评者则认为这种机制目前仍是在严格程序化框架内运行的自动化评估循环,并非真正的自主进化,营销宣传存在过度拟人化的问题。还有观点指出,如果 MiniMax 保持当前的快速迭代节奏,将对 Anthropic 和 OpenAI 的定价策略形成压力,推动整个行业向更低价方向发展。

  • 关于开源属性的争议是 M2.7 面临的主要质疑之一。虽然 MiniMax 宣布 M2.7 开放权重,但许可证明确禁止商业使用,HuggingFace 上的 LICENSE 文件第一行即标注「NON-COMMERCIAL LICENSE」。这与通常意义上的开源(以 MIT、Apache 等协议为代表,允许无条件商用)有本质区别。MiniMax 将其宣传为「开源」被部分开发者认为存在误导,M 系列许可证从 M2 的 MIT 协议逐步收紧也引发了关于公司开放策略诚信度的讨论。 数据安全风险是企业用户需要重点考量的因素。MiniMax 母公司总部位于中国,受《中华人民共和国国家情报法》第7条约束。虽然全球 API(api.minimax.io)由新加坡实体运营,数据与国内端点隔离,但对于金融、医疗、政府等敏感行业用户而言,合规审查和审计风险仍然显著。企业若对数据主权有严格要求,建议优先考虑自建部署方案,但需评估硬件门槛——FP16 无量化版本需要约 461 GB 显存(约 7 张 H100 80GB),4-bit 量化版本也需 115~130 GB 显存。 基准测试信任问题也值得关注。最高分的基准数据(SWE-Pro、VIBE-Pro、Terminal Bench 等)均为 MiniMax 自测或内部基准,第三方独立验证的数据相对保守,企业用户在选型时应综合考虑这一因素。此外,模型处于非美国实体清单状态,但存在未来被纳入的供应链风险。

  • M2.7 的最佳使用场景包括:日常编程辅助与代码生成(占常规任务 80% 的比例,M2.7 性价比最高)、超长代码库分析与理解(20 万上下文配合低输入价格优势明显)、多 Agent 协作管线搭建(原生 Agent Teams 支持)、需要控制 API 成本的高并发 SaaS 后端服务,以及 RAG 系统的生成端(长上下文能容纳更多检索结果)。 不推荐使用 M2.7 的场景包括:复杂企业级代码重构和长期架构设计(建议使用 Claude Opus 4.6 或 GPT-5.4)、需要多模态处理的能力(模型为纯文本限制)、非技术性内容创作和散文写作(Claude 系列更擅长)、以及对许可证合规性有严格要求的商业产品集成。 一个务实的组合使用策略是:以 M2.7 处理日常编程问答、文档分析和常规任务(约占总工作量 80%),以 Claude Opus 4.6 或 GPT-5.4 处理复杂工程难题(约 20%),以 DeepSeek V3 处理大规模批量数据处理和内容生成。这种组合可以在保持输出质量的同时显著控制 API 成本。

  • MiniMax M2.7 是一款能力处于准第一梯队、性价比极高的代码与协作专用大模型,其核心竞争力在于以 Claude Opus 4.6 约 7% 的成本完成了 90% 以上的代码任务质量,加上原生多 Agent 协作和自我进化训练机制的加持,在 2026 年上半年的代码模型市场中具有极强的竞争力。但其非商业许可限制、数据安全地缘政治风险、以及基准数据独立性不足等争议也不容忽视。适合对成本敏感且代码任务为主的技术团队选用,但企业在生产集成前应充分评估合规要求和许可证约束。

用户评论

  • 头像
    PamelaPrice_2021
    太香了这个价格,输入才0.3刀一百万token,Claude要15刀!

  • 头像
    happyrabbit128
    接入了Cursor跑了几天,M2.7真的是性价比之王。日常CRUD任务完全不输Claude,偶尔遇到难的再切Opus,省了太多钱了

  • 头像
    DianaWalker_2022
    开源是开源,但许可证写着禁止商用啊各位,这不是真正意义上的开源,别被宣传带跑了

  • 头像
    JenniferEvans36956
    部署试了一下,FF16无量化需要7张H100,4090根本跑不动…还是乖乖用API吧

  • 头像
    Declan593
    Kaggle MLE Lite拿了66.6%的得牌率,这个成绩仅次于Opus 4.6和GPT-5.4了,已经是国产最高了吧说实话

  • 头像
    梅花643
    终于开源了!但用了一下发现不能商用…还好API便宜,不然真得骂人

  • 头像
    EJohnsonSr
    OpenRouter上能用,切换成本几乎为零,Claude SDK直接改个环境变量就切过去了,这个体验要给好评

  • 头像
    Steven_Anderson369904
    测试了一下bug检测,我找了6个bug它全部找出来了,跟Opus打了个平手,有点东西

  • 头像
    Ethan_Hicks007305
    自我进化这个概念很唬人,但说实话就是在严格的RL框架里跑自动化循环,没有那么神

  • 头像
    George_Alvarez_X
    稳定性真的比智谱好太多,智谱动不动就售罄,MiniMax目前还没遇到过这种情况

  • 头像
    NathanMyers_738
    对比了一圈国内四家大模型套餐,MiniMax综合最优解:稳定、量大、价格合理。Kimi被按在地上摩擦,token消耗异常偏高的问题太大了,实际可用量直接打五折

  • 头像
    goldenleopard197
    高速版实测速度大概7-10 tokens/sec,不是官方宣称的100TPS,但也够用了

  • 头像
    JasonGarcia
    生成长文的能力确实强,输出tokens比M2.5多了55%,有时候回复太啰嗦,一个简单问题能给你写篇小作文

  • 头像
    Sandra_Powell_2022
    M2.7是纯文本模型,这点要注意,多模态能力没有,期待后续版本能加上

  • 头像
    KGutierrezX
    接入OpenClaw用了一次,感觉比M2.5好很多,skills遵循率到了97%,复杂任务表现非常稳

  • 头像
    0h8wq_9x
    用它做了个RetroWave OS的demo,包含记事本、计算器、贪吃蛇和记忆翻牌,生成过程很顺畅,完全没有卡顿或死循环,给力!

  • 头像
    Dylan.Baker
    20万上下文处理长代码库真的爽,之前用的模型上下文不够得分段,现在直接一股脑塞进去就行

  • 头像
    71j248pjy4
    总结一下我这两个月的使用策略:M2.7负责80%的日常任务,Opus负责20%的复杂工程难题,DeepSeek V3处理批量内容。这样搭配质量和成本都能兼顾

  • 头像
    David.Fisher520
    数据安全是个问题,公司用的是金融业务场景,法务说暂时不能用MiniMax API,除非能自建部署。但自建要7张H100,成本太高了,最后还是选了其他方案

  • 头像
    SamuelCruzX
    对比测评看了不少,M2.7在代码生成这块确实是强项,但散文写作、创意内容这些还是Claude更强。如果主要是写代码,选M2.7没毛病

  • 头像
    CAwoo_io
    刚发布那天就申请了测试资格,接入Claude Code之后体验了一下Office三件套的任务,手机上就能搞定Word写研究计划、Excel整理论文数据、PPT制作组会汇报,这个场景有点超出预期

  • 头像
    ThomasGarcia_88
    价格屠夫来了,Claude Opus每月要几百刀的用量,用M2.7可能只要几十块,差距太大了

  • 头像
    CDavisII539
    GDPval-AA ELO1495,开源最高分,这个确实牛

  • 头像
    Ant_honyHarris
    正式发布了!终于等到M2.7,之前M2.5在Kilo Code上用着就很好,Code模式使用量第一不是吹的