智谱 GLM-5.2

智谱上线并开源的新一代旗舰大模型,在编码与长程任务上与国际顶尖闭源模型同台竞技,以 MIT 协议开源并适配国产算力

深度报告

  • 2026年6月17日,智谱正式上线并开源新一代旗舰大模型 GLM-5.2,定位从即时问答转向「长程任务」——让 AI 能像人一样连续工作数小时,自主跑完一个完整的大型工程。在 Artificial Analysis 综合榜单上,GLM-5.2 取得 51 分,与 Anthropic、OpenAI 一起位居前三,形成所谓的「新御三家」格局。这是开源模型首次在代码与长程任务这类最硬核的工程场景,与闭源旗舰同台竞技。模型采用 744B 参数的 MoE 架构(每 token 约 40B 活跃参数),以 MIT 协议完全开源,可免费商用,且训练与推理均未依赖海外算力,上线首日即完成与华为昇腾、平头哥、摩尔线程等九大国产算力平台的适配。

  • 智谱(北京智谱华章科技股份有限公司)是国内头部大模型创业公司,2026 年 3 月在港交所披露首份业绩报告(股票代码 02513.HK),已从纯研发阶段迈入商业化落地期。GLM-5.2 是智谱在 GLM 系列上的又一次重大迭代。从 2025 年初开始,智谱几乎投入全部力量攻关编码能力,经历了 GLM-4.5、GLM-4.7、GLM-5.0、GLM-5.1 的连续迭代,到 GLM-5.2 终于实现了「开源模型编码 SOTA」的目标。 模型的核心突破在于将百万级上下文窗口做到了工程可用。GLM-5.2 提出 IndexShare 架构创新——在每四层稀疏注意力层之间复用同一个索引器(indexer),在 1M 上下文长度下将单位 token 的 FLOPs 降低至 2.9 倍。同时改进了投机解码的 MTP 层,将接受长度最多提升 20%。训练侧依赖自研 Slime 框架支撑大规模 Agentic RL 和 OPD 训练。 在行业定位上,GLM-5.2 的发布恰逢海外最强模型转向封闭、开源替代需求上升的关键时间窗口。Claude Fable 5 被美国出口管制,海外开发者急需靠谱的高端替代方案,GLM-5.2 的出现填补了市场空白,被部分分析称为「DeepSeek moment 2.0」。

  • GLM-5.2 的核心能力围绕三大方向展开:长程任务(Long Horizon Task)、编码能力(Coding)、极致 Infra 优化。 在长程任务方面,GLM-5.2 实现了 Solid 1M 无损上下文。这不仅是参数上标注 1M,而是在实际应用中能做到工程可用。智谱花了几个月时间大幅扩展了 1M Coding Agent 的训练环境,覆盖大规模实现、自动化研究、性能优化等多个典型领域。在 FrontierSWE 测试集(考察 AI 能否在数小时到数十小时尺度上完成复杂技术项目的基准)上,GLM-5.2 得分 74.4%,仅比 Claude Opus 4.8 低 1%,超过 GPT-5.5 的 72.6%。据智谱演示,GLM-5.2 可在一轮连续任务中处理 88 万以上 token,自主完成从开发、联调、测试到打包上线的完整软件交付流程,数小时内产出一个覆盖网页端、移动端与小程序的完整应用。 在编码能力方面,GLM-5.2 在多个权威基准上保持开源 SOTA。在 Design Arena 人类偏好评测中,GLM-5.2 以 1360 Elo 排名全球第一,略超 Claude Opus 4.8 的 1350 Elo。在 SWE-bench Pro 上得分 62.1%,超过 GPT-5.5 的 58.6%。在 Terminal-Bench 2.1(评测 AI Agent 通过命令行操作计算机的基准)上得分 81.0,相比 GLM-5.1 提升了 17.5 个百分点。在 MCP-Atlas(工具使用评测)上,GLM-5.2 与 Opus 4.8 的差距仅 0.8%。模型还引入了 effort level(思考档位)控制,用户可以在能力、速度、成本之间做平衡。 在 Infra 优化方面,GLM-5.2 的线上推理依托多个国产算力平台,已在 Day 0 完成与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞、天数智芯等国产算力平台的推理适配,在国产芯片集群上实现高吞吐、低延迟、大并发的稳定运行。 不过在实际使用中,用户反馈也揭示了几个明显短板。有开发者实测后指出,GLM-5.2 存在「涣散」问题——在多步骤任务中容易忘记上下文、中途跑偏。也有用户反馈模型有「幻觉式扩展需求」的倾向,用户要求做 A,模型自动补上 B 和 C,增加审查负担。此外,GLM-5.2 是纯文本模型,不具备原生多模态能力——2026 年的旗舰模型不带视觉,在竞品普遍具备多模态能力的背景下显得尴尬。

  • GLM-5.2 的 API 定价极具竞争力。按每百万 token 计算,输入成本约 1.40 美元,输出成本约 4.40 美元。对比来看,Claude Opus 4.8 的输入 / 输出成本分别为 5 美元 / 25 美元,GPT-5.5 为 5 美元 / 30 美元。按 5000 万 token / 月的模拟场景计算,GLM-5.2 月成本约 145 美元,Opus 4.8 约 750 美元,GPT-5.5 约 875 ���元——选择 GLM-5.2 每月可节省高达 730 美元。 同时,GLM-5.2 以 MIT 协议完全开源,企业可以自建部署,彻底消除 API 按 token 计费的成本。这对于数据合规严苛的企业尤其有吸引力——MIT 协议可自由修改商用,国产部署数据不出境,不怕外部服务断供。 不过 GLM-5.2 在智谱自身的套餐体系下存在「高消耗」问题。由于模型定位高阶,调用时按倍率消耗额度(高峰期 3 倍、非高峰期 1 倍),加上单次推理 token 消耗量大(1M 上下文全量拉入),普通 Lite 套餐用户反馈「一个半小时就用完 5 小时额度」,实际使用体验受限于套餐限制。

  • 在 807 名真实使用者的样本统计中,69% 给出了正面评价。正面反馈集中在三个方向:前端开发能力突出、性价比碾压同级闭源模型、MIT 开源协议灵活性高。有开发者将整套 Opus 工作流迁移至 GLM-5.2,算力成本从 186 美元降至 17 美元。有企业盲测前端落地页生成效果,成品质量与 Opus 4.8 几乎无差异,但成本仅为 1/6。甚至有世界 500 强企业已将半数编码工作迁移至该模型。 从用户画像来看,82% 的使用者为程序员群体,聚焦编码、Agent 开发、本地部署等技术场景,71% 为英语用户——这证明 GLM-5.2 的热度是纯粹的全球开发者圈层热度,而非泛 C 端流量。 负面反馈同样明确。约 31% 的真实用户给出了不同程度的差评,主要吐槽点包括:推理速度偏慢、token 效率较低(同样任务比竞品消耗更多 token)、运行稳定性不足(偶发错误如「The prompt parameter was not received normally」)、视觉能力缺失。有一位掘金博主用了一天后的结论是「写代码可以,让它规划复杂的大事就别指望」,并分享了他「Claude 当大脑、GLM-5.2 当手」的搭配方案。

  • 行业媒体的评价整体积极。科技日报、央广网、中国日报等主流媒体均对 GLM-5.2 做了大篇幅报道,强调其「开源国模 + 国产算力」的组合意义。中国日报的报道指出,「在海外最强模型转向封闭、开源替代需求上升的背景下,这一组合受到全行业关注」。 智谱创始人唐杰在 7 月 11 日的内部信《巨浪已来》中确认,GLM-5.2 多个核心指标已追平甚至超过 GPT-5.5 等闭源旗舰。这一声明确认了一个正在发生的行业转折——开源模型首次在代码与长程任务这类最硬核的工程场景,与闭源旗舰同台竞技。 在竞品格局方面,GLM-5.2 的直接竞争对手包括 Claude Opus 4.8(Anthropic)、GPT-5.5(OpenAI)、Kimi K2.7 Code(月之暗面)、MiniMax M3 等。在编码赛道上,Claude Opus 4.8 整体仍保持领先,但 GLM-5.2 作为开源模型,已将与闭源旗舰的差距压缩到 5% 以内。在综合性价比上,GLM-5.2 具有压倒性优势。 不过也有分析指出,GLM-5.2 的「火」有一定的虚高成分。9163 条相关推文的全量分析显示,真正上手使用过并给出具体评价的用户仅占 9%,近八成为传播声量和资本效应驱动。话题热度远高于实际用户规模。

  • GLM-5.2 面临的主要争议和风险集中在几个方面。首先是长上下文的实际稳定性问题。虽然官方宣称「Solid 1M 无损上下文」,但多名开发者实测发现模型在多步骤长程任务中存在注意力涣散的情况——「窗口拉到 100 万管个屁,脑子还是只看头尾」。长上下文模型集体的脆点,GLM-5.2 也没能幸免。 其次是产品稳定性和用户体验的问题。有用户反馈在使用智谱官方的 Coding Plan 时,连读取 txt 文件都会报错,错误信息为 `reason=unknown`,缺乏可排查的错误提示。模型本身的能力和产品层面的完成度之间存在 gap。 第三是计费策略的争议。高峰期 3 倍消耗的倍率机制导致不少用户抱怨额度「烧得太快」,普通套餐几乎无法支撑真实开发场景。这一问题在社区引发了「模型强但用得爽是两码事」的广泛讨论。 最后是视觉能力缺失。2026 年的旗舰模型不带原生多模态能力,在竞品普遍具备多模态的背景下,这一短板可能限制 GLM-5.2 的应用场景。

  • GLM-5.2 最适合的人群是程序员和开发团队,尤其是以下场景:高频率的编码自动化需求;需要百万级上下文处理大型代码仓库;对成本敏感、希望降低 API 费用的团队;有数据合规要求、需要本地部署的企业;希望将编码工作从闭源模型迁移到开源模型的开发者。 最不适合的场景包括:需要多模态理解的任务(看图、视频分析等);需要模型自主规划复杂、模糊的高层架构设计;对实时推理速度要求极高的交互场景。 对于普通开发者,建议的用法是「扬长避短」:把需要全局视野、目标明确的重构和编码任务交给 GLM-5.2,把需要意图理解、需求澄清和复杂规划的环节交给 Claude 或 GPT 等擅长「想清楚」的模型。

  • GLM-5.2 是国产大模型在高端编码领域的一次标志性突破。它首次让开源模型在代码和长程任务上与闭源旗舰站在了同一赛道上,并以极致性价比和 MIT 开源协议为开发者提供了真正可落地的替代方案。在海外最强模型转向封闭、国产算力生态日趋成熟的行业转折点上,GLM-5.2 踩准了节奏。但它并非无懈可击——长上下文的注意力稳定性、多模态能力的缺失、产品层面的完成度、以及计费策略带来的用户体验问题,都是它需要持续攻克的「下一座高山」。

用户评论

  • 头像
    SLeeK
    用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。

  • 头像
    Adrianc41
    从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。

  • 头像
    Stephanie_Morgan_Pro
    当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。

  • 头像
    DAOthinker464
    对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。

  • 头像
    CAphi
    把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。

  • 头像
    reddog874
    开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。

  • 头像
    BenjaminFlores_Pro
    纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。

  • 头像
    r6xxu1c
    试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。

  • 头像
    Sam_anthaWood
    写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。

  • 头像
    z5l3kae7k
    价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。

  • 头像
    段娜
    1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。

  • 头像
    SPeterson_2020
    让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。

  • 头像
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。

  • 头像
    co25ko0ac3
    公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。

  • 头像
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。

  • 头像
    JOols
    推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。

  • 头像
    MHoward_2021
    在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。

  • 头像
    GameFiGamer273
    Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。

  • 头像
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。

  • 头像
    CatherineHolm
    用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。

  • 头像
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。

  • 头像
    Emily_Henderson_66
    高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。

  • 头像
    James.Sanchez_2022
    国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。

  • 头像
    CrnptoLink
    前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。

  • 头像
    Michellew70
    token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。

  • 头像
    TheStephanieAnderson_dev
    知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。

  • 头像
    Kenneth_MendozaJr10
    试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。

  • 头像
    sadmeercat181
    自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。

  • 头像
    SUpet
    个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。

  • 头像
    Bruce_Kelly
    24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。