智譜 GLM-5.2

智譜上線並開源的新一代旗艦大模型,在編碼與長程任務上與國際頂尖閉源模型同臺競技,以 MIT 協議開源並適配國產算力

深度報告

  • 2026年6月17日,智譜正式上線並開源新一代旗艦大模型 GLM-5.2,定位從即時問答轉向「長程任務」——讓 AI 能像人一樣連續工作數小時,自主跑完一個完整的大型工程。在 Artificial Analysis 綜合榜單上,GLM-5.2 取得 51 分,與 Anthropic、OpenAI 一起位居前三,形成所謂的「新御三家」格局。這是開源模型首次在程式碼與長程任務這類最硬核的工程場景,與閉源旗艦同臺競技。模型採用 744B 引數的 MoE 架構(每 token 約 40B 活躍引數),以 MIT 協議完全開源,可免費商用,且訓練與推理均未依賴海外算力,上線首日即完成與華為昇騰、平頭哥、摩爾執行緒等九大國產算力平臺的適配。

  • 智譜(北京智譜華章科技股份有限公司)是國內頭部大模型創業公司,2026 年 3 月在港交所披露首份業績報告(股票程式碼 02513.HK),已從純研發階段邁入商業化落地期。GLM-5.2 是智譜在 GLM 系列上的又一次重大迭代。從 2025 年初開始,智譜幾乎投入全部力量攻關編碼能力,經歷了 GLM-4.5、GLM-4.7、GLM-5.0、GLM-5.1 的連續迭代,到 GLM-5.2 終於實現了「開源模型編碼 SOTA」的目標。 模型的核心突破在於將百萬級上下文視窗做到了工程可用。GLM-5.2 提出 IndexShare 架構創新——在每四層稀疏注意力層之間複用同一個索引器(indexer),在 1M 上下文長度下將單位 token 的 FLOPs 降低至 2.9 倍。同時改進了投機解碼的 MTP 層,將接受長度最多提升 20%。訓練側依賴自研 Slime 框架支撐大規模 Agentic RL 和 OPD 訓練。 在行業定位上,GLM-5.2 的釋出恰逢海外最強模型轉向封閉、開源替代需求上升的關鍵時間視窗。Claude Fable 5 被美國出口管制,海外開發者急需靠譜的高階替代方案,GLM-5.2 的出現填補了市場空白,被部分分析稱為「DeepSeek moment 2.0」。

  • GLM-5.2 的核心能力圍繞三大方向展開:長程任務(Long Horizon Task)、編碼能力(Coding)、極致 Infra 最佳化。 在長程任務方面,GLM-5.2 實現了 Solid 1M 無損上下文。這不僅是引數上標註 1M,而是在實際應用中能做到工程可用。智譜花了幾個月時間大幅擴充套件了 1M Coding Agent 的訓練環境,覆蓋大規模實現、自動化研究、效能最佳化等多個典型領域。在 FrontierSWE 測試集(考察 AI 能否在數小時到數十小時尺度上完成複雜技術專案的基準)上,GLM-5.2 得分 74.4%,僅比 Claude Opus 4.8 低 1%,超過 GPT-5.5 的 72.6%。據智譜演示,GLM-5.2 可在一輪連續任務中處理 88 萬以上 token,自主完成從開發、聯調、測試到打包上線的完整軟體交付流程,數小時內產出一個覆蓋網頁端、移動端與小程式的完整應用。 在編碼能力方面,GLM-5.2 在多個權威基準上保持開源 SOTA。在 Design Arena 人類偏好評測中,GLM-5.2 以 1360 Elo 排名全球第一,略超 Claude Opus 4.8 的 1350 Elo。在 SWE-bench Pro 上得分 62.1%,超過 GPT-5.5 的 58.6%。在 Terminal-Bench 2.1(評測 AI Agent 透過命令列操作計算機的基準)上得分 81.0,相比 GLM-5.1 提升了 17.5 個百分點。在 MCP-Atlas(工具使用評測)上,GLM-5.2 與 Opus 4.8 的差距僅 0.8%。模型還引入了 effort level(思考檔位)控制,使用者可以在能力、速度、成本之間做平衡。 在 Infra 最佳化方面,GLM-5.2 的線上推理依託多個國產算力平臺,已在 Day 0 完成與華為昇騰、平頭哥、摩爾執行緒、寒武紀、崑崙芯、沐曦、海光、壁仞、天數智芯等國產算力平臺的推理適配,在國產晶片叢集上實現高吞吐、低延遲、大併發的穩定執行。 不過在實際使用中,使用者反饋也揭示了幾個明顯短板。有開發者實測後指出,GLM-5.2 存在「渙散」問題——在多步驟任務中容易忘記上下文、中途跑偏。也有使用者反饋模型有「幻覺式擴充套件需求」的傾向,使用者要求做 A,模型自動補上 B 和 C,增加審查負擔。此外,GLM-5.2 是純文字模型,不具備原生多模態能力——2026 年的旗艦模型不帶視覺,在競品普遍具備多模態能力的背景下顯得尷尬。

  • GLM-5.2 的 API 定價極具競爭力。按每百萬 token 計算,輸入成本約 1.40 美元,輸出成本約 4.40 美元。對比來看,Claude Opus 4.8 的輸入 / 輸出成本分別為 5 美元 / 25 美元,GPT-5.5 為 5 美元 / 30 美元。按 5000 萬 token / 月的模擬場景計算,GLM-5.2 月成本約 145 美元,Opus 4.8 約 750 美元,GPT-5.5 約 875 ���元——選擇 GLM-5.2 每月可節省高達 730 美元。 同時,GLM-5.2 以 MIT 協議完全開源,企業可以自建部署,徹底消除 API 按 token 計費的成本。這對於資料合規嚴苛的企業尤其有吸引力——MIT 協議可自由修改商用,國產部署資料不出境,不怕外部服務斷供。 不過 GLM-5.2 在智譜自身的套餐體系下存在「高消耗」問題。由於模型定位高階,呼叫時按倍率消耗額度(高峰期 3 倍、非高峰期 1 倍),加上單次推理 token 消耗量大(1M 上下文全量拉入),普通 Lite 套餐使用者反饋「一個半小時就用完 5 小時額度」,實際使用體驗受限於套餐限制。

  • 在 807 名真實使用者的樣本統計中,69% 給出了正面評價。正面反饋集中在三個方向:前端開發能力突出、價效比碾壓同級閉源模型、MIT 開源協議靈活性高。有開發者將整套 Opus 工作流遷移至 GLM-5.2,算力成本從 186 美元降至 17 美元。有企業盲測前端落地頁生成效果,成品質量與 Opus 4.8 幾乎無差異,但成本僅為 1/6。甚至有世界 500 強企業已將半數編碼工作遷移至該模型。 從使用者畫像來看,82% 的使用者為程式設計師群體,聚焦編碼、Agent 開發、本地部署等技術場景,71% 為英語使用者——這證明 GLM-5.2 的熱度是純粹的全球開發者圈層熱度,而非泛 C 端流量。 負面反饋同樣明確。約 31% 的真實使用者給出了不同程度的差評,主要吐槽點包括:推理速度偏慢、token 效率較低(同樣任務比競品消耗更多 token)、執行穩定性不足(偶發錯誤如「The prompt parameter was not received normally」)、視覺能力缺失。有一位掘金博主用了一天後的結論是「寫程式碼可以,讓它規劃複雜的大事就別指望」,並分享了他「Claude 當大腦、GLM-5.2 當手」的搭配方案。

  • 行業媒體的評價整體積極。科技日報、央廣網、中國日報等主流媒體均對 GLM-5.2 做了大篇幅報道,強調其「開源國模 + 國產算力」的組合意義。中國日報的報道指出,「在海外最強模型轉向封閉、開源替代需求上升的背景下,這一組合受到全行業關注」。 智譜創始人唐傑在 7 月 11 日的內部信《巨浪已來》中確認,GLM-5.2 多個核心指標已追平甚至超過 GPT-5.5 等閉源旗艦。這一宣告確認了一個正在發生的行業轉折——開源模型首次在程式碼與長程任務這類最硬核的工程場景,與閉源旗艦同臺競技。 在競品格局方面,GLM-5.2 的直接競爭對手包括 Claude Opus 4.8(Anthropic)、GPT-5.5(OpenAI)、Kimi K2.7 Code(月之暗面)、MiniMax M3 等。在編碼賽道上,Claude Opus 4.8 整體仍保持領先,但 GLM-5.2 作為開源模型,已將與閉源旗艦的差距壓縮到 5% 以內。在綜合價效比上,GLM-5.2 具有壓倒性優勢。 不過也有分析指出,GLM-5.2 的「火」有一定的虛高成分。9163 條相關推文的全量分析顯示,真正上手使用過並給出具體評價的使用者僅佔 9%,近八成為傳播聲量和資本效應驅動。話題熱度遠高於實際使用者規模。

  • GLM-5.2 面臨的主要爭議和風險集中在幾個方面。首先是長上下文的實際穩定性問題。雖然官方宣稱「Solid 1M 無損上下文」,但多名開發者實測發現模型在多步驟長程任務中存在注意力渙散的情況——「視窗拉到 100 萬管個屁,腦子還是隻看頭尾」。長上下文模型集體的脆點,GLM-5.2 也沒能倖免。 其次是產品穩定性和使用者體驗的問題。有使用者反饋在使用智譜官方的 Coding Plan 時,連讀取 txt 檔案都會報錯,錯誤資訊為 `reason=unknown`,缺乏可排查的錯誤提示。模型本身的能力和產品層面的完成度之間存在 gap。 第三是計費策略的爭議。高峰期 3 倍消耗的倍率機制導致不少使用者抱怨額度「燒得太快」,普通套餐幾乎無法支撐真實開發場景。這一問題在社群引發了「模型強但用得爽是兩碼事」的廣泛討論。 最後是視覺能力缺失。2026 年的旗艦模型不帶原生多模態能力,在競品普遍具備多模態的背景下,這一短板可能限制 GLM-5.2 的應用場景。

  • GLM-5.2 最適合的人群是程式設計師和開發團隊,尤其是以下場景:高頻率的編碼自動化需求;需要百萬級上下文處理大型程式碼倉庫;對成本敏感、希望降低 API 費用的團隊;有資料合規要求、需要本地部署的企業;希望將編碼工作從閉源模型遷移到開源模型的開發者。 最不適合的場景包括:需要多模態理解的任務(看圖、影片分析等);需要模型自主規劃複雜、模糊的高層架構設計;對實時推理速度要求極高的互動場景。 對於普通開發者,建議的用法是「揚長避短」:把需要全域性視野、目標明確的重構和編碼任務交給 GLM-5.2,把需要意圖理解、需求澄清和複雜規劃的環節交給 Claude 或 GPT 等擅長「想清楚」的模型。

  • GLM-5.2 是國產大模型在高階編碼領域的一次標誌性突破。它首次讓開源模型在程式碼和長程任務上與閉源旗艦站在了同一賽道上,並以極致價效比和 MIT 開源協議為開發者提供了真正可落地的替代方案。在海外最強模型轉向封閉、國產算力生態日趨成熟的行業轉折點上,GLM-5.2 踩準了節奏。但它並非無懈可擊——長上下文的注意力穩定性、多模態能力的缺失、產品層面的完成度、以及計費策略帶來的使用者體驗問題,都是它需要持續攻克的「下一座高山」。

使用者評論

  • 頭像
    SLeeK
    用了一週 GLM-5.2,最大的感受就是程式設計能力確實強,前端生成頁面基本跟 Opus 一個水平,但確實有渙散的問題,長任務跑到後面就忘了前面說過什麼。

  • 頭像
    Adrianc41
    從 5.1 換到 5.2,最明顯的感覺就是上下文真的大了,以前 20 萬 token 撐滿就幻覺,現在整個專案塞進去還能改得動。

  • 頭像
    Stephanie_Morgan_Pro
    當天額度一個小時就燒完了,我還以為是 bug,結果發現是 5.2 在高峰期按 3 倍扣額度,太難了。

  • 頭像
    DAOthinker464
    對比 Opus 4.8 和 GPT-5.5 實測了一週,前端能力 GLM-5.2 確實不虛,但複雜系統的架構設計還是 Claude 更強,5.2 容易在中間步驟跑偏。

  • 頭像
    CAphi
    把整套 Opus 的工作流遷過去了,算力成本從 186 降到 17 美元,真的很香。

  • 頭像
    reddog874
    開源協議是 MIT,可以隨便商用部署,這點對合規要求高的公司真是太友好了。

  • 頭像
    BenjaminFlores_Pro
    純文字模型,2026 年了旗艦機不帶視覺,說實話有點尷尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模態。

  • 頭像
    r6xxu1c
    試了一下讓它讀 txt 檔案,直接報錯「The prompt parameter was not received normally」,太離譜了。

  • 頭像
    Sam_anthaWood
    寫程式碼確實不錯,但讓它做規劃就別指望了,我的用法是 Claude 當大腦、GLM-5.2 當手,配合起來體驗最佳。

  • 頭像
    z5l3kae7k
    價格確實是降維打擊,按 5000 萬 token 算一個月才 145 美元,Opus 要 750,這差價足夠讓我忍它的缺點了。

  • 頭像
    段娜
    1M 上下文是真的能用的,不像某些模型標了百萬其實幾十萬就開始掉鏈子,5.2 我塞了八十幾萬 token 跑完一整個工程沒斷。

  • 頭像
    SPeterson_2020
    讓我最煩的是它老愛自作主張,讓它做 A 它非要順手把 B 和 C 也做了,審起來比自己做還累。

  • 頭像
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,這成績確實硬,不是吹的。

  • 頭像
    co25ko0ac3
    公司裡盲測了前端落地頁生成,成品跟 Opus 4.8 幾乎沒有肉眼可見的差距,但成本只有六分之一,果斷切了。

  • 頭像
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一個半小時見底,升了 Pro 才好點。

  • 頭像
    JOols
    推理速度偏慢,等得有點心焦,但考慮到這個價格也認了。

  • 頭像
    MHoward_2021
    在 Claude Code 裡接上它,改了一個幾萬行程式碼的專案,十輪互動下來不跑偏,體驗比 5.1 好太多了。

  • 頭像
    GameFiGamer273
    Vercel 的 CEO 都說「almost shocked」,這波國產模型是真的支稜起來了。

  • 頭像
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 剛好開源,時間點卡得太妙了,MIT 協議意味著誰也 ban 不了它。

  • 頭像
    CatherineHolm
    用 Rust 從零復刻阿波羅登月計算機那個 demo 真的震撼到我了,雖然日常用不上,但足以證明它的實力。

  • 頭像
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,這個資料挺說明問題,但跟 Opus 4.8 的 69.2 還有差距,營銷話術說「接近 Opus」多少有點誇張了。

  • 頭像
    Emily_Henderson_66
    高峰期 14 點到 18 點千萬別用,3 倍扣額度真扛不住,我現在都趕上午幹活。

  • 頭像
    James.Sanchez_2022
    國產算力適配是亮點,華為昇騰、摩爾執行緒都能跑,不用擔心被卡脖子。

  • 頭像
    CrnptoLink
    前端開發能力確實強,Design Arena 排第一不是吹的,生成頁面審美線上,但後端那種需要理解複雜業務邏輯的活它就不太行了。

  • 頭像
    Michellew70
    token 消耗太大,同個任務比 Claude 多用 50% 的 token,雖然單價便宜但總價優勢沒那麼大。

  • 頭像
    TheStephanieAnderson_dev
    知乎大 V 說「以後用 Opus 可能其實是 GLM-5.2 冒充的你都分不出來」,笑死。

  • 頭像
    Kenneth_MendozaJr10
    試了讓它寫一個 Minecraft 克隆,直接跑出來了能飛的版本,體驗比 GPT-5.5 的版本還好。

  • 頭像
    sadmeercat181
    自己部署的話門檻不低,744B 的大模型需要挺多視訊記憶體,不是人人都能本地跑的。

  • 頭像
    SUpet
    個人開發者小團隊用價效比無敵,閉源模型那種按 token 付費的模式對高頻呼叫太傷了。

  • 頭像
    Bruce_Kelly
    24 小時跑完一個 SaaS 專案從開發到上線,88 萬 token,實現了我對 AI 程式設計的終極想象。