GLM-5.1

智譜AI釋出的旗艦級開源大模型,全球首個實現8小時持續工作能力,程式設計能力超越Claude Opus 4.6

深度報告

  • GLM-5.1是智譜AI於2026年4月8日釋出的旗艦級開源大模型,在軟體工程領域實現了國產模型的重大突破。該模型是全球首個透過真實工程任務驗證8小時持續工作能力的開源模型,在最接近真實軟體開發的SWE-Bench Pro基準測試中取得58.4分,超越GPT-5.4和Claude Opus 4.6,首次登頂全球開源模型榜首。GLM-5.1支援200K超長上下文,具備卓越的自我糾錯與長時最佳化能力,能夠在數百至上千輪迭代中持續自主工作,完成從規劃、執行到迭代最佳化的完整閉環。定價方面,0-32K上下文範圍的輸入價格為0.86美元/百萬Tokens,輸出價格為3.5美元/百萬Tokens,約為競品的五分之一至七分之一。

  • GLM-5.1由智譜AI(Zhipu AI)自主研發,採用MIT協議開源釋出。該模型基於GLM-5的744B MoE架構最佳化而來,是智譜在2026年釋出的第三款模型此前已分別於2025年2月12日釋出GLM-5、2025年3月16日釋出GLM-5-Turbo。不到三個月內,智譜連續釋出三款模型,形成完整的產品的矩陣,中國前十大網際網路公司中有九家已接入智譜AI的模型。 從技術發展脈絡來看,GLM-5.1的核心突破在於長程任務處理能力。與傳統模型以分鐘為單位的互動式呼叫不同,GLM-5.1可以單次任務中持續長時工作,涵蓋數百至上千輪迭代。它能夠自主完成"實驗→分析→調整→再驗證"的完整閉環,在關鍵決策節點反覆進行自我校驗與路徑修正,最終交付工程級成果。 2026年4月8日釋出GLM-5.1時,智譜同步宣佈Token價格再度上調10%。釋出後智譜股價連漲三日,市值突破4000億港元,反映出市場對其技術能力的認可。業界評價認為"GLM-5.1不只是一個更強的模型,而是一種新的技術正規化的開啟",標誌著AI從"回答問題"向"完成專案"的轉變。

  • GLM-5.1作為旗艦級基座模型,具備以下核心功能特性。在思考模式方面,該模型提供多種思考模式,覆蓋不同任務需求,使用者可根據具體場景選擇合適的思考方式。在輸出方式上,GLM-5.1支援實時流式響應,能夠顯著提升使用者互動體驗,讓使用者在生成過程中即時看到部分結果。 在工具呼叫方面,GLM-5.1具備強大的Function Call能力,支援外部工具整合與函式呼叫,可靈活呼叫外部MCP工具與資料來源,擴充套件系統能力。在上下文處理方面,該模型支援智慧快取機制,能夠最佳化長對話場景下的效能表現,同時還支援JSON等結構化格式輸出,便於後續處理。 從技術引數來看,GLM-5.1的輸入模態和輸出模態均為文字,上下文視窗達到200K tokens,最大輸出Tokens為128K。這些引數使得GLM-5.1能夠處理超長文件和複雜的多輪對話場景。 在推薦應用場景方面,GLM-5.1特別擅長Agentic Coding場景,針對Claude Code、OpenClaw等典型場景進行了最佳化,適合多階段、強依賴關係的真實工程任務。此外,該模型也適用於通用對話、創意寫作、Artifacts/前端開發以及Office生產力等場景,能夠完成PPT、Word、PDF、Excel等複雜文件的生產任務。 從基準測試表現來看,GLM-5.1在SWE-Bench Pro基準測試中取得58.4分,重新整理全球最佳表現,超越GPT-5.4、Claude Opus 4.6和Gemini 3.1 Pro。在Terminal-Bench 2.0和NL2Repo基準測試中,GLM-5.1也進入了全球前三名,並位列開源模型第一。綜合能力與Coding能力對齊Claude Opus 4.6,程式設計能力達到Claude Opus 4.6的94.6%。

  • GLM-5.1的API定價根據上下文長度有所不同。根據302.AI平臺的資料,0-32K tokens上下文範圍的輸入價格為0.86美元/百萬Tokens,輸出價格為3.5美元/百萬Tokens;32K-200K tokens上下文範圍的輸入價格為1.2美元/百萬Tokens,輸出價格為4美元/百萬Tokens。對於大額採購,使用者可以聯絡客戶經理享受專屬優惠。 與前代版本GLM-5相比,GLM-5.1的價格有所上漲。GLM-5在0-32K tokens範圍的輸入價格為0.6美元/百萬Tokens,輸出價格為2.6美元/百萬Tokens。GLM-5.1的漲價幅度約為43%(輸入)和35%(輸出)。 與競品對比來看,GLM-5.1的程式設計場景定價已經直逼Anthropic的Claude Sonnet水平,但綜合價效比仍具有顯著優勢。根據使用者評價,GLM-5.1的程式設計能力達到Claude Opus 4.6的94.6%,而價格僅為競品的約1/5至1/7,被使用者評價為"用30%的錢,達到94%的能力"。 2026年4月8日釋出GLM-5.1時,智譜同步宣佈Token價格再度上調10%。釋出後智譜股價連漲三日,市值突破4000億港元。這一市場反應顯示出投資者對GLM-5.1技術能力的認可和對智譜未來發展的信心。

  • 從正面評價來看,使用者普遍認為GLM-5.1的程式設計能力已達到Claude Opus 4.6的第一梯隊水平,能夠獨立完成複雜工程任務。實測案例顯示,GLM-5.1在邏輯推理任務中能夠完整推匯出多種解法,並在關鍵節點進行自我校驗與路徑修正。 作為全球首個透過真實工程任務驗證8小時持續工作能力的開源模型,GLM-5.1在長時間任務中的表現獲得使用者肯定。其自我糾錯與長時最佳化能力使其能夠持續在數百輪次、上千次工具呼叫中保持任務目標一致性。 使用者反饋顯示,GLM-5.1傾向於把東西做完整,主動補齊細節,相較於競品更擅長專案級任務的整體結構組織與細節補全。在價效比方面,使用者評價"用30%的錢,達到94%的能力",GLM-5.1的價格優勢明顯,對於處理90%的標準任務具有很高的實用價值。 在前端開發測試中,GLM-5.1生成的網頁作品集具有完整的互動系統、滾動視差效果、滑鼠跟隨柔光特效等,整體視覺"剋制且自然",獲得了較高的評價。 從負面反饋和改進建議來看,部分使用者反饋官方渠道存在訂閱難搶、使用卡頓與延遲等問題,算力供應未能完全滿足使用者需求。這導致部分使用者轉向第三方部署渠道尋求解決方案。 有使用者指出GLM-5.1不擅長"做減法",在極限設計感表達方面稍弱,更像執行力強的工程模型而非追求單維度極限。在複雜動畫等任務中,GLM-5.1生成的程式碼量較大,可能帶來一定的效能開銷。個別使用者反映任務複雜時響應速度較慢,但整體能力獲得肯定。

  • GLM-5.1的釋出在行業內引起了廣泛關注,被視為國產大模型發展的重要里程碑。 在開源領域,GLM-5.1是全球開源大模型中程式設計能力的第一梯隊,在權威評測中超越GPT-5.4和Claude Opus 4.6,登頂全球開源榜首,被業界稱為開源界的"Claude Opus"。這是國產大模型在軟體工程領域的里程碑式突破,首次在核心工程指標上達到國際頂尖閉源模型水平。 業界評價認為,GLM-5.1不只是一個更強的模型,而是一種新的技術正規化的開啟,標誌著AI從"回答問題"向"完成專案"的轉變。 從市場反響來看,不到三個月內,中國前十大網際網路公司中有九家爭相接入智譜AI的模型,形成了行業內的廣泛認可。大量企業在社交媒體、官網官宣"已接入",涵蓋網際網路公司、雲服務商、軟體廠商、晶片企業,大中小皆有。 釋出GLM-5.1並宣佈提價後,智譜股價連漲三日,市值突破4000億港元,反映出投資者對技術能力的認可。GLM-5.1的成功釋出推動中國大模型從"追趕"階段進入"攻堅"階段,行業競爭格局發生變化。 在競爭格局方面,GLM-5.1的主要競爭對手包括Anthropic的Claude系列、OpenAI的GPT系列以及月之暗面的Kimi系列。2026年4月,Kimi K2.6和GLM-5.1相繼釋出,都強調長週期編碼和Agent能力,但技術路線截然不同。GLM-5.1更注重工程交付能力,而Kimi K2.6在多模態理解方面各有側重。

  • 從使用者反饋來看,GLM-5.1目前主要的爭議集中在算力供應方面。部分使用者反饋官方渠道存在訂閱難搶、使用卡頓與延遲等問題,算力供應緊張是目前存在的主要問題。這反映出智譜在算力基礎設施方面還需要進一步加大投入,以滿足快速增長的使用者需求。 從技術層面來看,有使用者指出GLM-5.1更偏向工程型模型,不擅長"做減法",在極限設計感表達方面稍弱。這意味著GLM-5.1更適合需要完整交付的專案級任務,而非追求單點極致表現的場景。 此外,GLM-5.1在釋出後不久即宣佈提價,雖然市場反應積極,但也引發了一些使用者對成本控制的擔憂。對於需要大規模使用GLM-5.1的企業使用者來說,API成本的上漲需要納入整體預算考慮。

  • GLM-5.1特別適合以下使用者群體:複雜程式設計任務的使用者,特別是需要多階段、強依賴關係的真實工程任務;需要長時間軟體工程交付的使用者,可持續工作8小時完成完整專案交付;需要持續迭代最佳化的專案,具備自我校驗與路徑修正能力;成本敏感型專案,使用者評價顯示其價格僅為競品的1/5至1/7。 對於以下場景,GLM-5.1可能不是最佳選擇:單維度極致表現追求的場景,更偏向工程型模型;極限設計感場景,不擅長"做減法",表達稍弱。 從替代方案來看,如果使用者需要處理最難的10%任務,可能仍需要使用Claude Opus 4.6或GPT-5.4等前沿模型;但對於其餘90%的標準任務,GLM-5.1具有很高的實用價值。

  • GLM-5.1是智譜AI推出的旗艦級開源大模型,在軟體工程領域實現了重大技術突破。其核心優勢包括:8小時級長程任務處理能力、SWE-Bench Pro全球開源第一的程式設計能力、200K超長上下文支援,以及相較於國際頂尖閉源模型顯著的價格優勢。 作為全球首個透過真實工程任務驗證8小時持續工作能力的開源模型,GLM-5.1重新定義了AI從"回答問題"到"完成專案"的轉變。其自我糾錯與長時最佳化能力使其能夠持續在數百輪次、上千次工具呼叫中保持任務目標一致性,交付工程級成果。 從市場表現來看,不到三個月內中國前十大網際網路公司中有九家接入,以及4000億港元的市值突破,都證明了GLM-5.1的技術實力獲得了行業認可。展望未來,GLM-5.1的成功釋出標誌著中國大模型從"追趕"階段進入"攻堅"階段,國產大模型在全球AI競爭中的地位將進一步提升。

使用者評論

  • 頭像
    NAdams_Pro
    睡前把需求丟給它,早上起來活兒真幹完了,中間自己規劃自己debug,跨幾十步還記得最初的約束,這個長程任務能力國產裡確實是斷檔第一。

  • 頭像
    Logan.Cox
    能力沒得說,就是慢到離譜,一個複雜任務跑了一個多小時,急起來真想砸鍵盤。

  • 頭像
    SeanGray_7
    分享個真實案例。我之前一直用 Typeless 那個 mac 語音輸入,年費一千塊,主要拿來做 vibe coding。前幾天看到 GitHub 上有人發了一段特別詳細的提示詞,完整描述了一個選單欄語音輸入 app 的需求,我直接原封不動扔給 GLM-5.1 跑。它自己拆模組、寫 Swift、遇到編譯衝突自己定位改掉,全程沒問我一句,大概二十分鐘就吐了個帶 Makefile 的完整專案,build 出來簽名好的 app 直接能跑,按住 Fn 說話底部彈膠囊懸浮窗,波形跟著聲音跳,鬆手文字準確填進游標位置。整個過程只用了五小時額度裡不到百分之十。這成品覆蓋了 Typeless 九成以上功能,程式碼還全在我手裡,那一千塊我大機率不續了。

  • 頭像
    Vincent_GonzalezX
    看到有人測睡一覺讓它從零搭 Linux 桌面,八小時一千兩百多步,早上起來視窗管理器、狀態列、應用、VPN 管理器全齊了,說是相當於四人團隊一週的量,這畫面還挺科幻的。

  • 頭像
    何莉霞
    國產之光實至名歸了這次。

  • 頭像
    Alan.Thompson_Max
    冷靜點說,官方宣傳 Pro 套餐額度是 Claude Pro 的十五倍,我實測完全是虛標。跑完一個複雜任務 weekly usage 直接來到百分之八,半天用下來就百分之十了,高強度用根本不夠。編碼質量確實沒啥大毛病,但速度慢加用量虛標這兩個硬傷擺在那,所謂價效比優勢其實沒想象中那麼香。

  • 頭像
    AltSeasonHughes
    200K 上下文也好意思當亮點吹?人家 Kimi 256K、DeepSeek 都 1M 了,整個程式碼庫塞進去還是有點吃力。

  • 頭像
    Megan.Wright_6638
    最戳我的一點是遇到坑不喊人。讓它做本地記賬應用,裝 better-sqlite3 那個包要編譯,我環境裡沒 C++ 工具鏈,換別的模型這裡肯定停下來讓我先裝,結果它自己發現編譯失敗,直接改用 sql.js 純 JS 方案接著往下跑,最後瀏覽器直接能用。

  • 頭像
    JCarter_202105
    作為重度 coding 使用者認真評一下。SWE-bench Pro 上它重新整理了全球最佳,真實 GitHub 倉庫定位修 bug 這種最硬的指標能壓過 GPT-5.4 和 Opus 4.6,程式碼三項綜合全球第三國產第一。我印象最深的是那個向量資料庫最佳化的例子,655 輪迭代自己從全庫掃描切到 IVF 分桶、加半精度壓縮、量化粗排、兩級路由,硬是把吞吐從 3108 QPS 推到 21472,六點九倍。這已經不是程式碼生成器了,是會自己找瓶頸換策略的最佳化器。

  • 頭像
    HhshNet
    架構設計和 UI 審美還是差點意思,得配腳手架。

  • 頭像
    Abigail_Turner_99
    真香!用它做了個後臺管理系統,從資料庫設計到介面實現全程自動,跑通了!之前用其他模型經常卡殼,這個8小時連續工作不是吹的,確實穩。

  • 頭像
    鄒玉
    用了兩週GLM-5.1寫後端程式碼,價效比真的沒話說!日常CRUD和小功能開發完全夠用,比Claude便宜太多了,終於可以放開膀子寫程式碼了!

  • 頭像
    N_athanBaker
    國內搶購這操作是真的服了,定鬧鐘十點開售照樣秒沒,錢都得搶著交。最後走國際版年付才買到,也是無語。

  • 頭像
    Judith.Myers_2023
    強烈推薦給預算有限的團隊!用它替代Claude處理日常需求,一個月上千的訂閱費直接砍掉大半,省下來的錢可以買點別的工具。

  • 頭像
    PWard_Max
    說實話有點超出預期。本來以為國產模型就那樣,結果GLM-5.1的長程任務能力真不錯,測試用例自己就能寫完整,還知道回頭校驗錯誤。

  • 頭像
    VYW9X1F
    吐槽一下高峰期漲價的問題!下午三四點那會兒消耗額度直接翻三倍,用起來心疼。建議錯峰使用,早上九點前或者晚上十點後價效比最高。

  • 頭像
    C_Lree
    剛用GLM-5.1重構了一個半廢棄的Vue專案,整體體驗還行。不過複雜動畫場景還是要手調,生成的程式碼量有點大,效能開銷需要最佳化。

  • 頭像
    Theresa_CookK
    國產之光名不虛傳!用它做了個資料視覺化大屏,從圖表選型到互動邏輯全程AI輔助,最後交付的東西客戶還挺滿意的。

  • 頭像
    ARussell520
    響應速度確實比Claude慢,但勝在便宜啊!用它處理90%的標準任務完全沒問題,那10%的複雜場景再用Claude兜底,這樣搭配最划算。

  • 頭像
    r2ke2u1wtp
    前端除錯起來稍微有點頭疼,CSS樣式糾纏不清的情況還是有的。不過後端程式碼質量挺高,介面設計和異常處理都比較到位。

  • 頭像
    PamelaScott
    用GLM-5.1開發了一個小工具箱,涵蓋七八個實用功能,累計跑了四十多個小時。中間偶發卡頓,但整體穩定效能接受。

  • 頭像
    ADtur
    客觀說,複雜多檔案重構和架構設計還是Claude強一些。但日常開發用它足夠了,省錢才是硬道理啊!

  • 頭像
    潘悅勇
    長上下文處理確實強,10萬行程式碼庫丟進去分析,它還記得前面說過的約束,不會突然失憶。這個能力對大型專案幫助很大。

  • 頭像
    TGomez_9915
    訂閱確實難搶,每次放號都要蹲點。希望智譜能擴大算力供應,需求太大了根本不夠用。

  • 頭像
    Natalie.Hicks168
    用它寫了幾個Python指令碼,處理Excel和資料清洗太方便了!批次操作和格式轉換都能自動完成,省了不少重複勞動。

  • 頭像
    蘇月洋
    說實話,介面可以再簡潔一些。不過功能是真的全,用起來還挺順手的。

  • 頭像
    orangecat977
    配合Claude Code使用效果更佳!用它規劃任務和生成程式碼框架,Claude負責最終最佳化和除錯,分工明確效率翻倍。

  • 頭像
    NicholasGutierrez_X
    生成程式碼的速度挺快的,就是等待的時候有點煎熬。建議智譜最佳化一下流式輸出的體驗。

  • 頭像
    iJoséLozano
    用了大概一個月,感覺進步很明顯。之前GLM-5的一些問題都修復了,死迴圈的情況基本沒再遇到過。

  • 頭像
    Shirley.Moore007
    用它做了個專案管理系統,包含使用者、訂單、許可權等模組。從資料庫設計到前端頁面全程AI輔助,兩天就交付了MVP版本。