MiniMax M2.7

MiniMax发布的2290亿参数MoE架构代码与协作专用大模型,以Claude Opus约7%的成本完成90%以上代码任务质量

深度报告

  • MiniMax M2.7 是 MiniMax(稀宇科技)于 2026 年 3 月 18 日发布的旗舰级大语言模型,采用 MoE 混合专家架构,总参数量 2290 亿,激活参数约 100 亿。作为国内首个深度参与自身训练迭代的模型,M2.7 最大的技术突破在于将强化学习 Harness 自动化循环引入训练流程,使模型能承担研发工作量中约 30%~50% 的任务。在软件工程基准 SWE-Pro 测试中取得 56.22% 的成绩,代码与 bug 检测能力已接近 Claude Opus 4.6 水平。定价方面,M2.7 输入价格仅为 Claude Opus 4.6 的约 1/15,被视为 2026 年上半年性价比最高的准第一梯队代码模型。值得注意的是,该模型的权重虽已对外开源,但采用的是 MiniMax-Modified 非商业许可协议,禁止未经授权的商用部署。

  • MiniMax 成立于 2021 年,是一家专注于人工智能技术的科技公司,总部位于中国。MiniMax 的创始团队在 AI 领域有深厚积累,公司先后获得多家知名机构的投资。M2.7 是 MiniMax M 系列模型的最新迭代版本,从 M2 到 M2.7 的迭代周期约 6 个月,每一代都在关键基准指标上有明显提升。 M2.7 的定位并非通用对话模型,而是主打「Cowork Agent」协作场景的代码与专业任务模型。从技术路线来看,M2.7 采用稀疏混合专家(MoE)架构,每个 token 仅激活约 100 亿参数(占总参数量的 4.3%),这种设计使得模型在保持强大能力的同时大幅降低了推理成本。 2026 年 4 月 12 日,MiniMax 正式宣布 M2.7 开源开放权重,但使用了名为「MiniMax-Modified Non-Commercial License」的特殊协议,允许个人和研究使用,但明确禁止商业用途,商业使用需提前向 MiniMax 提交书面授权申请。这一许可证安排引发了一定争议,被部分开发者认为存在「伪开源」的嫌疑。

  • M2.7 最大的技术亮点在于其「自我进化」能力。传统模型的训练迭代依赖大量人工参与,包括数据筛选、实验设计、评测分析等环节。M2.7 则构建了一套自动化的强化学习 Harness,能够自行驱动实验监控、日志排查、代码修复与评测循环。模型在训练过程中可以承担约 30%~50% 的研发工作量,MiniMax 内部评测数据显示这种机制带来了约 30% 的综合性能提升。这一机制的实现依托于 M2.7 原生支持的 Agent Teams 能力,多个 AI 智能体可以分工协作完成复杂的多阶段任务,且这种能力已内化到模型底层而非依赖外部提示词工程。

  • M2.7 在多项软件工程基准测试中表现优异。在 SWE-Pro 测试中得分 56.22%,接近 GPT-5.3-Codex 的水平。Kilo Code 独立实验室的实测显示,在 3 个 TypeScript 代码库的测试中,M2.7 与 Claude Opus 4.6 均能找出全部 6 个 bug 和全部 10 个安全漏洞,表现完全持平。不过在修复彻底性上存在差距:Claude Opus 4.6 生成了 41 个集成测试(含测试数据库和清理逻辑),而 M2.7 生成了 20 个单元测试(直接验证 schema 和处理函数)。在线上运维场景中,M2.7 能够自主完成分析监控告警、连接数据库验证原因、非阻塞止血处理(如建索引)以及提交 PR 的全流程,官方数据显示基于 M2.7 已多次将故障恢复时间压缩至 3 分钟以内。

  • M2.7 在专业办公领域的能力也得到了充分体现。在 GDPval-AA ELO 评测中得分 1495~1500,位列全球第四,专业场景涵盖金融文档分析、营收预测建模等。在 Office 三件套(Excel/PPT/Word)复杂编辑场景中,M2.5 到 M2.7 的提升显著,支持多轮修改和高保真编辑。工具调用(Function Calling)方面,Toolathon 基准正确率达 46.3%,OpenClaw 评测中接近最新 Claude Sonnet 4.6 水平。

  • M2.7 采用 MoE 稀疏混合专家架构,总参数量 2290 亿,激活参数约 100 亿。多头因果自注意力结合旋转位置编码(RoPE)和 QK RMSNorm 优化。上下文窗口为 204800 tokens(约 20 万),最大输出长度官方标称可达 204800 tokens。知识截止时间为 2026 年 3 月。模型为纯文本输入,不支持图像、音频或视频等多模态输入。API 协议全面兼容 OpenAI 格式,支持 Function Calling、Streaming、JSON Mode 等常用功能。

  • M2.7 提供两个 API 版本,标准版 M2.7 输入价格为 0.30 美元/百万 tokens,输出价格为 1.20 美元/百万 tokens;高速版 M2.7-highspeed 输入价格 0.60 美元/百万 tokens,输出价格 2.40 美元/百万 tokens。自动上下文缓存功能无需配置即可生效,缓存后的复用价格降至约 0.06 美元/百万 tokens,显著降低了长对话和代码库引用场景的成本。 与其他主流模型相比,M2.7 的价格优势极为明显。以输入价格为例,Claude Opus 4.6 为 5.00 美元/百万 tokens(为 M2.7 的约 17 倍),GPT-5.4 为 2.50 美元,Claude Sonnet 4.6 为 3.00 美元,而 DeepSeek V3 仅为 0.27 美元。按照 Kilo Code 的实测案例,相同测试任务 M2.7 花费 0.27 美元而 Claude Opus 花费 3.67 美元,成本约为竞品的 7%。对于日均处理 1000 万 tokens 的团队,M2.7 的年化成本约 3 万美元,而 Claude Opus 4.6 则接近 90 万美元。 除按量付费外,MiniMax 还提供 Token Plan 订阅制,年费从 100 美元(入门)到 1500 美元(超高速)不等。用户也可以通过 OpenRouter(排名第4的使用量)、HuggingFace(开放权重下载)、agent.minimax.io(免费试用额度)等多种渠道接入。OpenRouter 上 M2.7 价格与官方一致,不额外加价。

  • M2.7 在多项主流基准测试中的表现如下:MMLU-Pro 78.2 分(对比 Claude Opus 4.6 的 80.1),数学推理 MATH-500 得分 91.6(Claude Opus 4.6 为 93.2,差距仅 1.6 分),HumanEval+ 代码测试 87.5 分。但 SWE-Bench Verified(第三方独立验证版本)得分 48.3%,与 Claude Opus 4.6 的 55.7% 仍有约 7 个百分点的差距。长上下文大海捞针测试(NIAH 100K)得分 99.1%,1M 超长上下文得分 96.8%,是 M2.7 的核心优势项目。Artificial Analysis 的 AA Intelligence Index v4.0 独立测量给出 50 分(Claude Opus 4.6 为 53 分),LMSYS Chatbot Arena 独立验证得分为 1447ELO。 需要注意的是,部分高分基准(SWE-Pro 56.22%、Terminal Bench 2 57.0%、VIBE-Pro 55.6%)为 MiniMax 自测或内部基准,且存在两项已确认的性能回退:在 τ²-Bench 电信任务上较 M2.5 下降 11 个百分点,在 BridgeBench vibe-coding 任务上表现也不如 M2.5。此外,Artificial Analysis 指出 M2.7 生成的输出 tokens 总量比 M2.5 多出约 55%,这在一定程度上拉高了奖励完整性的基准分数,但在实际生产环境中也意味着更高的成本和更慢的响应速度。

  • 由于 M2.7 发布时间相对较新,公开的大规模用户评价数据有限。从现有信息来看,开发者和 AI 应用社区对 M2.7 的性价比给予了高度认可。前代产品 M2.5 已在 Kilo Code 平台占据 Code 模式使用量第一的位置,市场占有率达 37%,超越了 Claude Opus 4.6 和 GPT-5.4,这一市场基础为 M2.7 的推广提供了有力背书。 从实测反馈来看,M2.7 在代码生成、bug 检测、安全漏洞识别等日常开发任务上获得了较多正面评价,开发者普遍认可其在保持高质量输出的同时显著降低使用成本的特性。部分用户反映 M2.7 生成的响应较长,在处理一些需要简洁回复的场景时不如 Claude 系列模型。纯文本限制也受到部分需要多模态能力用户的批评。

  • M2.7 的发布在代码模型市场掀起了新一轮价格战,将顶级代码模型的使用门槛大幅拉低。从竞争格局来看,M2.7 的直接竞品包括 Claude Opus 4.6、GPT-5.4-Codex、Claude Sonnet 4.6、Kimi K2.5 和 DeepSeek V3。在代码能力维度,M2.7 与 Claude Sonnet 4.6 水平接近,落后于 Claude Opus 4.6 和 GPT-5.4;在价格维度,M2.7 仅次于 DeepSeek V3 的极低定价,远低于其他竞品。 M2.7 的「自我进化」机制引发了不少行业讨论。支持者认为这代表了大模型训练的新范式,模型能够自主参与优化过程将显著加速 AI 能力的迭代;批评者则认为这种机制目前仍是在严格程序化框架内运行的自动化评估循环,并非真正的自主进化,营销宣传存在过度拟人化的问题。还有观点指出,如果 MiniMax 保持当前的快速迭代节奏,将对 Anthropic 和 OpenAI 的定价策略形成压力,推动整个行业向更低价方向发展。

  • 关于开源属性的争议是 M2.7 面临的主要质疑之一。虽然 MiniMax 宣布 M2.7 开放权重,但许可证明确禁止商业使用,HuggingFace 上的 LICENSE 文件第一行即标注「NON-COMMERCIAL LICENSE」。这与通常意义上的开源(以 MIT、Apache 等协议为代表,允许无条件商用)有本质区别。MiniMax 将其宣传为「开源」被部分开发者认为存在误导,M 系列许可证从 M2 的 MIT 协议逐步收紧也引发了关于公司开放策略诚信度的讨论。 数据安全风险是企业用户需要重点考量的因素。MiniMax 母公司总部位于中国,受《中华人民共和国国家情报法》第7条约束。虽然全球 API(api.minimax.io)由新加坡实体运营,数据与国内端点隔离,但对于金融、医疗、政府等敏感行业用户而言,合规审查和审计风险仍然显著。企业若对数据主权有严格要求,建议优先考虑自建部署方案,但需评估硬件门槛——FP16 无量化版本需要约 461 GB 显存(约 7 张 H100 80GB),4-bit 量化版本也需 115~130 GB 显存。 基准测试信任问题也值得关注。最高分的基准数据(SWE-Pro、VIBE-Pro、Terminal Bench 等)均为 MiniMax 自测或内部基准,第三方独立验证的数据相对保守,企业用户在选型时应综合考虑这一因素。此外,模型处于非美国实体清单状态,但存在未来被纳入的供应链风险。

  • M2.7 的最佳使用场景包括:日常编程辅助与代码生成(占常规任务 80% 的比例,M2.7 性价比最高)、超长代码库分析与理解(20 万上下文配合低输入价格优势明显)、多 Agent 协作管线搭建(原生 Agent Teams 支持)、需要控制 API 成本的高并发 SaaS 后端服务,以及 RAG 系统的生成端(长上下文能容纳更多检索结果)。 不推荐使用 M2.7 的场景包括:复杂企业级代码重构和长期架构设计(建议使用 Claude Opus 4.6 或 GPT-5.4)、需要多模态处理的能力(模型为纯文本限制)、非技术性内容创作和散文写作(Claude 系列更擅长)、以及对许可证合规性有严格要求的商业产品集成。 一个务实的组合使用策略是:以 M2.7 处理日常编程问答、文档分析和常规任务(约占总工作量 80%),以 Claude Opus 4.6 或 GPT-5.4 处理复杂工程难题(约 20%),以 DeepSeek V3 处理大规模批量数据处理和内容生成。这种组合可以在保持输出质量的同时显著控制 API 成本。

  • MiniMax M2.7 是一款能力处于准第一梯队、性价比极高的代码与协作专用大模型,其核心竞争力在于以 Claude Opus 4.6 约 7% 的成本完成了 90% 以上的代码任务质量,加上原生多 Agent 协作和自我进化训练机制的加持,在 2026 年上半年的代码模型市场中具有极强的竞争力。但其非商业许可限制、数据安全地缘政治风险、以及基准数据独立性不足等争议也不容忽视。适合对成本敏感且代码任务为主的技术团队选用,但企业在生产集成前应充分评估合规要求和许可证约束。

用户评论

  • 头像
    EugenHauk
    整体体验下来 M2.7 在办公、代码、跟 MaxClaw 适配度上都超出预期,帮我省了 BI 工具和 Coding 订阅的钱。硬伤还是复杂 Bug 快速定位和大规模改写代码出错率,多轮里自相矛盾的 Prompt 处理得不够好。作为国产 Agent 模型第一梯队,闭源和纯文本是我最遗憾的两点。

  • 头像
    丁梅
    跑复杂 Agent 时 40 个 Skill 还能保持 97% 的指令遵循率,我电脑上 32 个 skills 龙虾基本没乱过,这点比大多数模型强,装多了也不串台。

  • 头像
    Gary_Peterson_X
    PinchBench 排第四,离 Sonnet 4.6 就差 0.7 个百分点,龙虾圈里已经算国产天花板了。

  • 头像
    秦心
    真拿它处理过一次线上慢查询故障,从告警到根因定位不到一小时,它还知道用非阻塞方式先建索引止血再补 MR,这种 SRE 级别的判断比单纯写代码值钱多了。日常开发它能扛 70% 到 80% 的方案设计和编码,剩下那截还得人把关,量大管饱但真不兜底。

  • 头像
    FoxFinanceCooper
    长流程多轮对话上下文会衰减,自相矛盾的需求它不会主动跟你确认,直接把你已归档的选题给过滤了,复杂系统还是先把产品设计好再扔给它。

  • 头像
    DRussell_20210
    贵是真不贵,API 比 Opus 便宜快 20 倍,缓存读几乎白送。

  • 头像
    Russell.Cook
    自我进化这个点确实吓人,MiniMax 让 M2.7 自己优化内部脚手架,零人工干预跑了 100 多轮迭代循环,自己分析失败轨迹、改代码、跑评测、对比决定保留还是回退,内部评测集直接涨了 30%。Kaggle MLE Lite 24 小时拿 9 金 5 银 1 铜,和 Gemini-3.1 打平。

  • 头像
    天涯_1
    让它做 iPhone 历代外观盘点网页,结构和时间线都对,就是图片抓取被墙加载失败,最后接 MaxClaw 搓图才插进去,图像获取这块还是卡手。

  • 头像
    烟雨93
    开源党破防了,M2.5 还是 Apache2.0,到 M2.7 直接闭源了,商用自部署还要书面授权。

  • 头像
    PaulRoss_66755
    Token Plan 升级后额度暴涨四五倍还改人民币定价,Plus 档 49 块月付 1500 次请求 / 5 小时,对国内开发者太友好了。就是 5 小时滚动窗口不滚存,高峰 15 点到 17 点半还会动态限流,得卡着点用。

  • 头像
    GraviqyDrop238
    吐槽一下,数学和复杂嵌套指令真不能赌,L-Math Hard 才 15 分,循环输出崩得厉害,涉及推理还是换别的模型吧。

  • 头像
    bluetiger391
    代码比想象能打,SWE-Pro 56 追平 Opus,工程活儿是真行。

  • 头像
    Bryan.Gonzalez_2020
    月烧三千刀 Skills 重度用户说句实话:M2.7 响应比 Claude 快太多了,highspeed 版本即时满足,Agent Team 多角色协作也扛得住,写 3D 主题乐园网页一句话口喷就跑起来。但在 Office 三件套尤其 PPT 的阅读样式和长文原创人设上还得自己改。结论:Agent 协作、办公自动化、性价比这三个维度,国产天花板没跑了。

  • 头像
    KathleenWilliams_2020
    实测生产故障排查,M2.7 真能关联监控指标和部署时间线做因果推理,定位到缺失的索引迁移文件,还知道先用非阻塞建索引止血再提 MR,三分钟恢复,这不像只会写代码的模型。

  • 头像
    ETlop
    纯文本模型这点挺遗憾,今年都卷多模态了它还不支持图。

  • 头像
    Abigail.PowellJr311
    MaxClaw 是真香,装 Skill 直接甩链接就行,网络问题它自己重试,不用去折腾配置页面了,终于有「寄存大脑」的感觉了。

  • 头像
    Ethan.Cook_2022
    把 MiniMax M2.7 接进 Claude Code 跑了份 4.4 个 G 的股票数据可视化,它自己装 Pandas、清洗、建模型、最后用 Streamlit 转成可交互网页,全程我没怎么插手。长任务上下文是真稳,近万字研报愣是没幻觉,这点比很多旗舰都强。

  • 头像
    PeterButler_2021
    M2.7 帮我做了一份闪迪财报 Excel,五张 Sheet 直接吐出来,投行深蓝配色太顶了。

  • 头像
    PamelaPrice_2021
    太香了这个价格,输入才0.3刀一百万token,Claude要15刀!

  • 头像
    happyrabbit128
    接入了Cursor跑了几天,M2.7真的是性价比之王。日常CRUD任务完全不输Claude,偶尔遇到难的再切Opus,省了太多钱了

  • 头像
    DianaWalker_2022
    开源是开源,但许可证写着禁止商用啊各位,这不是真正意义上的开源,别被宣传带跑了

  • 头像
    JenniferEvans36956
    部署试了一下,FF16无量化需要7张H100,4090根本跑不动…还是乖乖用API吧

  • 头像
    Declan593
    Kaggle MLE Lite拿了66.6%的得牌率,这个成绩仅次于Opus 4.6和GPT-5.4了,已经是国产最高了吧说实话

  • 头像
    梅花643
    终于开源了!但用了一下发现不能商用…还好API便宜,不然真得骂人

  • 头像
    EJohnsonSr
    OpenRouter上能用,切换成本几乎为零,Claude SDK直接改个环境变量就切过去了,这个体验要给好评

  • 头像
    Steven_Anderson369904
    测试了一下bug检测,我找了6个bug它全部找出来了,跟Opus打了个平手,有点东西

  • 头像
    Ethan_Hicks007305
    自我进化这个概念很唬人,但说实话就是在严格的RL框架里跑自动化循环,没有那么神

  • 头像
    George_Alvarez_X
    稳定性真的比智谱好太多,智谱动不动就售罄,MiniMax目前还没遇到过这种情况

  • 头像
    NathanMyers_738
    对比了一圈国内四家大模型套餐,MiniMax综合最优解:稳定、量大、价格合理。Kimi被按在地上摩擦,token消耗异常偏高的问题太大了,实际可用量直接打五折

  • 头像
    goldenleopard197
    高速版实测速度大概7-10 tokens/sec,不是官方宣称的100TPS,但也够用了