Zhipu GLM-5.2

Zhipus neues Flaggschiff-Sprachmodell, unter MIT-Lizenz quelloffen veröffentlicht: konkurriert bei Coding und Langzeitaufgaben mit den besten geschlossenen Modellen und ist an chinesische Hardware angepasst

Ausführlicher Bericht

  • Am 17. Juni 2026 hat Zhipu das Flaggschiff-Großmodell GLM-5.2 der neuen Generation offiziell auf den Markt gebracht und als Open Source bereitgestellt. Seine Positionierung hat sich von sofortigen Fragen und Antworten zu „Langstreckenaufgaben“ verlagert – so kann die KI mehrere Stunden lang ununterbrochen wie ein Mensch arbeiten und autonom ein komplettes Großprojekt abschließen. Auf der umfassenden Liste der künstlichen Analyse erzielte GLM-5.2 51 Punkte und rangierte zusammen mit Anthropic und OpenAI unter den ersten drei und bildete das sogenannte „New Royal Three“-Muster. Dies ist das erste Mal, dass ein Open-Source-Modell mit Closed-Source-Flaggschiffen in den schwierigsten Entwicklungsszenarien wie Code und weitreichenden Aufgaben konkurriert. Das Modell verwendet eine MoE-Architektur mit 744B Parametern (ca. 40B aktive Parameter pro Token). Es ist vollständig Open Source unter dem MIT-Protokoll und kann kostenlos für kommerzielle Zwecke verwendet werden. Weder Training noch Inferenz sind auf Rechenleistung im Ausland angewiesen. Es wurde am ersten Tag der Veröffentlichung an neun große inländische Computerplattformen angepasst, darunter Huawei Ascend, Pingtou Ge und Moore Threads.

  • Zhipu (Beijing Zhipu Huazhang Technology Co., Ltd.) ist das führende große Modell-Startup-Unternehmen in China. Das Unternehmen veröffentlichte seinen ersten Leistungsbericht im März 2026 an der Hong Kong Stock Exchange (Aktiencode 02513.HK) und ist von der reinen Forschungs- und Entwicklungsphase in die Kommerzialisierungsphase eingetreten. GLM-5.2 ist eine weitere wichtige Version der GLM-Serie auf GLM. Seit Anfang 2025 investiert Zhipu fast alle seine Anstrengungen in die Erforschung von Codierungsfunktionen. Es hat kontinuierliche Iterationen von GLM-4.5, GLM-4.7, GLM-5.0 und GLM-5.1 durchlaufen und schließlich mit GLM-5.2 das Ziel der „Open-Source-Modellcodierung SOTA“ erreicht. Der zentrale Durchbruch des Modells besteht darin, Millionen von Kontextfenstern für technische Zwecke verfügbar zu machen. GLM-5.2 schlägt die IndexShare-Architekturinnovation vor – die Wiederverwendung desselben Indexers zwischen jeweils vier Schichten mit geringer Aufmerksamkeit, wodurch die FLOPs pro Token bei einer Kontextlänge von 1 M auf das 2,9-fache reduziert werden. Auch die MTP-Schicht für die spekulative Dekodierung wurde verbessert, wodurch die akzeptierte Länge um bis zu 20 % erhöht wurde. Die Schulungsseite stützt sich auf das selbst entwickelte Slime-Framework, um groß angelegte Agentic RL- und OPD-Schulungen zu unterstützen. Im Hinblick auf die Branchenpositionierung fällt die Veröffentlichung von GLM-5.2 mit dem kritischen Zeitfenster zusammen, in dem die stärksten ausländischen Modelle auf geschlossene Modelle umsteigen und die Nachfrage nach Open-Source-Alternativen steigt. Claude Fable 5 unterliegt den Exportkontrollen der USA und ausländische Entwickler benötigen dringend zuverlässige High-End-Alternativen. Das Aufkommen von GLM-5.2 hat die Marktlücke geschlossen und wird von einigen Analysten als „DeepSeek Moment 2.0“ bezeichnet.

  • Die Kernfunktionen von GLM-5.2 drehen sich um drei Hauptrichtungen: Long Horizon Task, Coding und Ultimate Infra Optimization. Für Langstreckenmissionen implementiert GLM-5.2 den verlustfreien Kontext Solid 1M. Dies ist nicht nur auf den Parametern mit 1M gekennzeichnet, sondern kann auch im Engineering in tatsächlichen Anwendungen verwendet werden. Zhipu verbrachte mehrere Monate damit, die Schulungsumgebung von 1M Coding Agent erheblich zu erweitern und viele typische Bereiche wie groß angelegte Implementierung, Automatisierungsforschung und Leistungsoptimierung abzudecken. Beim FrontierSWE-Testsatz (ein Benchmark, der untersucht, ob KI komplexe technische Projekte im Stundenbereich bis zu mehreren zehn Stunden abschließen kann) erreichte GLM-5.2 74,4 %, nur 1 % weniger als Claude Opus 4.8 und übertraf die 72,6 % von GPT-5.5. Laut einer Zhipu-Demonstration kann GLM-5.2 mehr als 880.000 Token in einer Reihe kontinuierlicher Aufgaben verarbeiten, den gesamten Softwarebereitstellungsprozess von der Entwicklung über das gemeinsame Debugging, das Testen bis hin zur Verpackung und online selbstständig abschließen und innerhalb weniger Stunden eine vollständige Anwendung erstellen, die Webseiten, mobile Endgeräte und Miniprogramme umfasst. In Bezug auf die Codierungsfunktionen bleibt GLM-5.2 bei mehreren maßgeblichen Benchmarks Open-Source-SOTA. In der menschlichen Präferenzbewertung von Design Arena belegte GLM-5.2 mit 1360 Elo den ersten Platz weltweit und übertraf damit leicht die 1350 Elo von Claude Opus 4.8. Auf dem SWE-Bench Pro erreicht es 62,1 % und übertrifft damit die 58,6 % von GPT-5.5. Beim Terminal-Bench 2.1 (einem Benchmark, der KI-Agenten bewertet, die Computer über die Befehlszeile bedienen) erreichte es 81,0 Punkte, was einer Verbesserung von 17,5 Prozentpunkten im Vergleich zu GLM-5.1 entspricht. Im MCP-Atlas (einer Überprüfung der Tool-Nutzung) unterscheidet sich GLM-5.2 nur um 0,8 % von Opus 4.8. Das Modell führt außerdem eine Steuerung des Aufwandsniveaus (Denkausrüstung) ein, sodass Benutzer Fähigkeiten, Geschwindigkeit und Kosten in Einklang bringen können. Im Hinblick auf die Infra-Optimierung stützt sich die Online-Inferenz von GLM-5.2 auf mehrere inländische Computerplattformen. Am Tag 0 wurde die Inferenzadaption mit inländischen Computerplattformen wie Huawei Ascend, Pingtou Ge, Moore Thread, Cambrian, Kunlun Core, Muxi, Haiguang, Biren, Tianshu Zhixin usw. abgeschlossen und ein stabiler Betrieb mit hohem Durchsatz, geringer Latenz und großer Parallelität auf inländischen Chip-Clustern erreicht. Im tatsächlichen Einsatz zeigten die Rückmeldungen der Benutzer jedoch auch einige offensichtliche Mängel auf. Einige Entwickler haben es getestet und darauf hingewiesenEs stellt sich heraus, dass GLM-5.2 ein „Streuungsproblem“ hat – bei mehrstufigen Aufgaben vergisst man leicht den Kontext und kommt vom Weg ab. Es gibt auch Benutzer, die berichten, dass das Modell eine Tendenz zu „illusorischen Erweiterungsanforderungen“ aufweist. Der Benutzer fragt nach A und das Modell fügt automatisch B und C hinzu, was den Überprüfungsaufwand erhöht. In addition, GLM-5.2 is a text-only model and does not have native multi-modal capabilities - the 2026 flagship model does not have vision, which looks awkward in the context of competing products generally having multi-modal capabilities.

  • Die API-Preise für GLM-5.2 sind äußerst wettbewerbsfähig. Auf einer Million Token-Basis betragen die Eingabekosten etwa 1,40 US-Dollar und die Ausgabekosten etwa 4,40 US-Dollar. Zum Vergleich: Die Eingabe-/Ausgabekosten von Claude Opus 4.8 betragen jeweils 5 $/25 $ und GPT-5.5 5 $/30 $. Basierend auf einem Simulationsszenario von 50 Millionen Token/Monat betragen die monatlichen Kosten für GLM-5.2 etwa 145 US-Dollar, für Opus 4.8 etwa 750 US-Dollar und für GPT-5.5 etwa 875 US-Dollar. Wenn Sie sich für GLM-5.2 entscheiden, können Sie bis zu 730 US-Dollar pro Monat sparen. Gleichzeitig ist GLM-5.2 vollständig Open Source unter dem MIT-Protokoll, und Unternehmen können es selbst erstellen und bereitstellen, wodurch die Kosten für die API-Abrechnung per Token vollständig entfallen. Dies ist besonders attraktiv für Unternehmen mit strikter Datenkonformität – das MIT-Protokoll kann für die kommerzielle Nutzung frei geändert werden, inländische Bereitstellungsdaten verlassen das Land nicht und es besteht keine Angst vor einer Unterbrechung der externen Servicebereitstellung. Allerdings weist GLM-5.2 unter Zhipus eigenem Paketsystem ein Problem mit „hohem Verbrauch“ auf. Aufgrund der High-End-Positionierung des Modells wird das Kontingent bei Anrufen mehrfach verbraucht (3-mal in Spitzenzeiten, 1-mal in Nebenzeiten). Darüber hinaus ist der Verbrauch einzelner Inferenztokens hoch (alle 1 Mio. Kontexte werden einbezogen). Gewöhnliche Lite-Paketbenutzer berichteten, dass „das 5-Stunden-Kontingent in eineinhalb Stunden aufgebraucht ist“ und die tatsächliche Nutzungserfahrung durch die Paketbeschränkungen eingeschränkt ist.

  • In einer Stichprobe von 807 echten Nutzern gaben 69 % positive Bewertungen ab. Das positive Feedback konzentriert sich auf drei Richtungen: herausragende Front-End-Entwicklungsfähigkeiten, überlegene Kostenleistung im Vergleich zu ähnlichen Closed-Source-Modellen und hohe Flexibilität des MIT-Open-Source-Protokolls. Ein Entwickler migrierte den gesamten Opus-Workflow auf GLM-5.2 und die Kosten für die Rechenleistung sanken von 186 US-Dollar auf 17 US-Dollar. Ein Unternehmen testete blind die Wirkung der Front-End-Landingpage-Generierung und stellte fest, dass die Qualität des fertigen Produkts fast mit der von Opus 4.8 übereinstimmte, die Kosten jedoch nur 1/6 betrugen. Es gibt sogar Fortune-500-Unternehmen, die die Hälfte ihrer Codierungsbemühungen auf dieses Modell verlagert haben. Den Benutzerporträts zufolge sind 82 % der Benutzer Programmierer, die sich auf technische Szenarien wie Codierung, Agentenentwicklung und lokale Bereitstellung konzentrieren, und 71 % sind englische Benutzer. Dies beweist, dass die Beliebtheit von GLM-5.2 rein auf einen globalen Entwicklerkreis und nicht auf Pan-C-End-Verkehr zurückzuführen ist. Das negative Feedback war ebenso deutlich. Ungefähr 31 % der echten Nutzer gaben unterschiedlich negative Bewertungen ab. Zu den Hauptbeschwerden gehören: langsame Inferenzgeschwindigkeit, geringe Token-Effizienz (die gleiche Aufgabe verbraucht mehr Token als Konkurrenzprodukte), unzureichende Laufstabilität (gelegentliche Fehler wie „Der Eingabeaufforderungsparameter wurde nicht normal empfangen“) und mangelnde visuelle Fähigkeit. Ein Nuggets-Blogger kam nach einem Tag der Nutzung zu dem Schluss, dass „es in Ordnung ist, Code zu schreiben, aber man darf nicht erwarten, dass man damit komplexe Ereignisse plant.“ Er teilte auch seinen Kombinationsplan „Claude als Gehirn und GLM-5.2 als Hand“ mit.

  • Die Kritiken der Branchenmedien waren im Allgemeinen positiv. Mainstream-Medien wie Science and Technology Daily, CCTV und China Daily haben ausführlich über GLM-5.2 berichtet und dabei die Bedeutung seiner Kombination aus „nationalem Open-Source-Modell + inländischer Rechenleistung“ betont. In einem Bericht der China Daily heißt es: „Angesichts der Tatsache, dass die stärksten ausländischen Modelle auf geschlossene Modelle umsteigen und die Nachfrage nach Open-Source-Alternativen steigt, hat diese Kombination die Aufmerksamkeit der gesamten Branche auf sich gezogen.“ Tang Jie, der Gründer von GLM, bestätigte am 11. Juli in einem internen Brief „The Big Wave Is Coming“, dass mehrere Kernindikatoren von GLM-5.2 denen von Closed-Source-Flaggschiffen wie GPT-5.5 gleichgekommen sind oder diese sogar übertroffen haben. Diese Ankündigung bestätigt einen Branchenwandel, der stattfindet – zum ersten Mal konkurrieren Open-Source-Modelle mit Closed-Source-Flaggschiffen in den schwierigsten Entwicklungsszenarien wie Code und Langzeitaufgaben. In Bezug auf die wettbewerbsfähige Produktlandschaft gehören zu den direkten Konkurrenten von GLM-5.2 Claude Opus 4.8 (Anthropic), GPT-5.5 (OpenAI), Kimi K2.7 Code (Dark Side of the Moon), MiniMax M3 usw. Auf der Codierungsstrecke behält Claude Opus 4.8 insgesamt immer noch die Führung, aber GLM-5.2 hat als Open-Source-Modell den Abstand zum Closed-Source-Flaggschiff auf bis zu 5 % reduziert. Im Hinblick auf das umfassende Preis-Leistungs-Verhältnis hat GLM-5.2 einen überwältigenden Vorteil. Einige Analysten wiesen jedoch darauf hin, dass das „Feuer“ von GLM-5.2 eine gewisse falsch hohe Komponente aufweist. Eine vollständige Analyse von 9.163 verwandten Tweets zeigt, dass nur 9 % der Nutzer es tatsächlich genutzt und spezifische Bewertungen abgegeben haben, und fast 80 % sind auf das Kommunikationsvolumen und die Kapitaleffekte zurückzuführen. Die Beliebtheit des Themas ist viel höher als die tatsächliche Benutzergröße.

  • Die Hauptstreitigkeiten und Risiken, mit denen GLM-5.2 konfrontiert ist, konzentrieren sich auf mehrere Aspekte. Das erste ist das praktische Stabilitätsproblem langer Kontexte. Obwohl die offizielle Behauptung lautet: „Solid 1M ist ein verlustfreier Kontext“, haben viele Entwickler in tatsächlichen Tests festgestellt, dass das Modell bei mehrstufigen Langstreckenaufgaben unter Ablenkung leidet – „Es spielt keine Rolle, ob das Fenster auf 1 Million gedehnt wird, das Gehirn schaut immer noch nur auf den Anfang und das Ende.“ GLM-5.2 ist nicht immun gegen die kollektiven Mängel von Modellen mit langem Kontext. Zweitens gibt es Probleme mit der Produktstabilität und dem Benutzererlebnis. Einige Benutzer berichteten, dass bei Verwendung des offiziellen Coding Plans von Zhipu selbst das Lesen einer TXT-Datei zu einem Fehler führen würde. Die Fehlermeldung lautete „Grund=unbekannt“ und es mangelte an behebbaren Fehlermeldungen. Es besteht eine Lücke zwischen den Fähigkeiten des Modells selbst und dem Fertigstellungsgrad auf Produktebene. Der dritte Punkt ist die Kontroverse über die Abrechnungspolitik. Der Verdopplungsmechanismus des dreifachen Verbrauchs in Spitzenzeiten hat bei vielen Benutzern zu der Beschwerde geführt, dass das Kontingent „zu schnell verbrennt“ und normale Pakete kaum reale Entwicklungsszenarien unterstützen können. Dieses Problem löste in der Community umfangreiche Diskussionen darüber aus, dass „das Modell stark ist, aber es Spaß macht, es zu verwenden, was zwei verschiedene Dinge sind.“ Schließlich kommt es zum Verlust der Sehfähigkeit. Das Flaggschiffmodell 2026 verfügt nicht über native multimodale Funktionen. Im Kontext konkurrierender Produkte, die im Allgemeinen über multimodale Fähigkeiten verfügen, kann dieser Mangel die Anwendungsszenarien von GLM-5.2 einschränken.

  • GLM-5.2 eignet sich am besten für Programmierer und Entwicklungsteams, insbesondere in den folgenden Szenarien: Automatisierungsanforderungen für die Hochfrequenzcodierung; große Code-Warehouses, die Millionen von Kontexten erfordern; Teams, die kostensensibel sind und die API-Gebühren senken möchten; Unternehmen, die Daten-Compliance-Anforderungen haben und eine lokale Bereitstellung erfordern; Entwickler, die ihre Programmierarbeit von einem Closed-Source-Modell auf ein Open-Source-Modell migrieren möchten. Zu den am wenigsten geeigneten Szenarien gehören: Aufgaben, die ein multimodales Verständnis erfordern (Bildbetrachtung, Videoanalyse usw.); komplexe und unscharfe High-Level-Architekturentwürfe, die eine unabhängige Planung des Modells erfordern; und interaktive Szenarien, die eine extrem hohe Echtzeit-Denkgeschwindigkeit erfordern. Für normale Entwickler besteht die empfohlene Verwendung darin, „Stärken zu nutzen und Schwächen zu vermeiden“: Übergeben Sie Refactoring- und Codierungsaufgaben, die eine globale Vision und klare Ziele erfordern, an GLM-5.2 und übergeben Sie Links, die Absichtsverständnis, Anforderungsklärung und komplexe Planung erfordern, an Modelle, die gut „klar denken“ können, wie Claude oder GPT.

  • GLM-5.2 ist ein bahnbrechender Durchbruch für inländische Großmodelle im Bereich der High-End-Codierung. Damit stellt es das Open-Source-Modell in puncto Code und Langstreckenaufgaben erstmals auf die gleiche Spur wie das Closed-Source-Flaggschiff und bietet Entwicklern eine wirklich umsetzbare Alternative mit extremer Kostenleistung und dem MIT-Open-Source-Abkommen. An einem Wendepunkt in der Branche, an dem die stärksten ausländischen Modelle aufgeben und das heimische Rechenleistungs-Ökosystem reift, ist GLM-5.2 auf dem richtigen Weg. Aber es ist nicht tadellos – die Aufmerksamkeitsstabilität eines langen Kontexts, das Fehlen multimodaler Fähigkeiten, die Vervollständigung der Produktebene und die durch die Abrechnungsstrategie verursachten Benutzererfahrungsprobleme sind alles die „nächsten Berge“, die es weiterhin zu erobern gilt.

Nutzerbewertungen

  • Avatar
    SLeeK
    用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。

  • Avatar
    Adrianc41
    从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。

  • Avatar
    Stephanie_Morgan_Pro
    当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。

  • Avatar
    DAOthinker464
    对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。

  • Avatar
    CAphi
    把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。

  • Avatar
    reddog874
    开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。

  • Avatar
    BenjaminFlores_Pro
    纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。

  • Avatar
    r6xxu1c
    试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。

  • Avatar
    Sam_anthaWood
    写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。

  • Avatar
    z5l3kae7k
    价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。

  • Avatar
    段娜
    1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。

  • Avatar
    SPeterson_2020
    让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。

  • Avatar
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。

  • Avatar
    co25ko0ac3
    公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。

  • Avatar
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。

  • Avatar
    JOols
    推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。

  • Avatar
    MHoward_2021
    在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。

  • Avatar
    GameFiGamer273
    Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。

  • Avatar
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。

  • Avatar
    CatherineHolm
    用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。

  • Avatar
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。

  • Avatar
    Emily_Henderson_66
    高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。

  • Avatar
    James.Sanchez_2022
    国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。

  • Avatar
    CrnptoLink
    前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。

  • Avatar
    Michellew70
    token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。

  • Avatar
    TheStephanieAnderson_dev
    知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。

  • Avatar
    Kenneth_MendozaJr10
    试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。

  • Avatar
    sadmeercat181
    自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。

  • Avatar
    SUpet
    个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。

  • Avatar
    Bruce_Kelly
    24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。