Zhipu GLM-5.2

Nouveau modèle phare de Zhipu, publié en open source sous licence MIT : rivalise avec les meilleurs modèles fermés en codage et tâches de long terme, adapté aux puces chinoises

Rapport détaillé

  • Le 17 juin 2026, Zhipu a officiellement lancé et open source le grand modèle phare de nouvelle génération GLM-5.2. Son positionnement est passé de questions et réponses instantanées à des « tâches à long terme » - permettant à l'IA de travailler en continu pendant plusieurs heures comme un humain et de mener à bien de manière autonome un projet complet à grande échelle. Sur la liste complète de l'analyse artificielle, GLM-5.2 a obtenu 51 points, se classant parmi les trois premiers avec Anthropic et OpenAI, formant le modèle dit « New Royal Three ». C'est la première fois qu'un modèle open source rivalise avec des produits phares fermés dans les scénarios d'ingénierie les plus complexes tels que le code et les tâches à longue portée. Le modèle adopte une architecture MoE de paramètres 744B (environ 40B de paramètres actifs par jeton). Il est entièrement open source sous le protocole MIT et peut être utilisé gratuitement à des fins commerciales. Ni la formation ni l'inférence ne dépendent de la puissance de calcul étrangère. Il a été adapté à neuf grandes plates-formes informatiques nationales, dont Huawei Ascend, Pingtou Ge et Moore Threads, dès le premier jour de son lancement.

  • Zhipu (Beijing Zhipu Huazhang Technology Co., Ltd.) est la première start-up modèle à grande échelle en Chine. Elle a publié son premier rapport de performance à la Bourse de Hong Kong en mars 2026 (code boursier 02513.HK) et est entrée dans la phase de commercialisation à partir de la phase pure de recherche et développement. GLM-5.2 est une autre itération majeure de la série GLM sur GLM. Depuis le début de 2025, Zhipu a investi presque tous ses efforts dans la recherche de capacités de codage. Il a traversé des itérations continues de GLM-4.5, GLM-4.7, GLM-5.0 et GLM-5.1, et a finalement atteint l'objectif de « codage de modèle open source SOTA » avec GLM-5.2. La principale avancée du modèle est de rendre des millions de fenêtres contextuelles disponibles à des fins d'ingénierie. GLM-5.2 propose l'innovation architecturale IndexShare : réutiliser le même indexeur entre quatre couches d'attention clairsemées, réduisant les FLOP par jeton à 2,9 fois sous une longueur de contexte de 1 M. La couche MTP pour le décodage spéculatif a également été améliorée, augmentant la longueur acceptée jusqu'à 20 %. Le côté formation s'appuie sur le framework Slime auto-développé pour prendre en charge la formation Agentic RL et OPD à grande échelle. En termes de positionnement de l'industrie, la sortie de GLM-5.2 coïncide avec la fenêtre de temps critique où les modèles étrangers les plus puissants se tournent vers le fermé et où la demande d'alternatives open source augmente. Claude Fable 5 est soumis à des contrôles à l'exportation par les États-Unis et les développeurs étrangers ont un besoin urgent d'alternatives fiables et haut de gamme. L'émergence du GLM-5.2 a comblé le vide du marché et est appelée « Moment DeepSeek 2.0 » par certains analystes.

  • Les fonctionnalités de base de GLM-5.2 s'articulent autour de trois directions principales : les tâches à long horizon, le codage et l'optimisation ultime de l'infrastructure. Pour les missions à longue portée, GLM-5.2 implémente le contexte sans perte Solid 1M. Celui-ci n'est pas seulement marqué 1M sur les paramètres, mais peut également être utilisé en ingénierie dans des applications réelles. Zhipu a passé plusieurs mois à étendre considérablement l'environnement de formation de 1M Coding Agent, couvrant de nombreux domaines typiques tels que la mise en œuvre à grande échelle, la recherche sur l'automatisation et l'optimisation des performances. Sur l'ensemble de tests FrontierSWE (un benchmark qui examine si l'IA peut réaliser des projets techniques complexes sur une échelle de quelques heures à quelques dizaines d'heures), GLM-5.2 a obtenu un score de 74,4 %, soit seulement 1 % de moins que Claude Opus 4.8 et dépassant les 72,6 % de GPT-5.5. Selon une démonstration de Zhipu, GLM-5.2 peut traiter plus de 880 000 jetons dans une série de tâches continues, compléter de manière indépendante le processus complet de livraison de logiciels depuis le développement, le débogage conjoint, les tests jusqu'à l'empaquetage et en ligne, et produire une application complète couvrant des pages Web, des terminaux mobiles et des mini-programmes en quelques heures. En termes de capacités de codage, GLM-5.2 reste SOTA open source sur plusieurs benchmarks faisant autorité. Dans l'évaluation des préférences humaines de Design Arena, GLM-5.2 s'est classé premier au monde avec 1360 Elo, dépassant légèrement les 1350 Elo de Claude Opus 4.8. Il obtient un score de 62,1 % sur SWE-bench Pro, dépassant les 58,6 % de GPT-5.5. Il a obtenu un score de 81,0 sur Terminal-Bench 2.1 (un benchmark qui évalue les agents IA exploitant des ordinateurs via la ligne de commande), soit une amélioration de 17,5 points de pourcentage par rapport au GLM-5.1. Sur MCP-Atlas (une revue de l'utilisation de l'outil), GLM-5.2 n'est différent que de 0,8% de l'Opus 4.8. Le modèle introduit également un contrôle du niveau d'effort (équipement de réflexion), afin que les utilisateurs puissent équilibrer les capacités, la vitesse et le coût. En termes d'optimisation Infra, l'inférence en ligne de GLM-5.2 s'appuie sur plusieurs plates-formes informatiques nationales. Au jour 0, il a terminé l'adaptation de l'inférence avec des plates-formes informatiques nationales telles que Huawei Ascend, Pingtou Ge, Moore Thread, Cambrian, Kunlun Core, Muxi, Haiguang, Biren, Tianshu Zhixin, etc., obtenant ainsi un fonctionnement stable avec un débit élevé, une faible latence et une grande concurrence sur les clusters de puces nationaux. Cependant, en pratique, les retours des utilisateurs ont également révélé plusieurs défauts évidents. Certains développeurs l'ont testé et ont souligné queIl s'avère que GLM-5.2 a un problème de « dispersion » : il est facile d'oublier le contexte et de dérailler dans des tâches en plusieurs étapes. Certains utilisateurs signalent également que le modèle a une tendance aux « exigences d'expansion illusoires ». L'utilisateur demande A et le modèle ajoute automatiquement B et C, augmentant ainsi la charge de révision. De plus, GLM-5.2 est un modèle uniquement textuel et ne possède pas de capacités multimodales natives - le modèle phare de 2026 n'a pas de vision, ce qui semble gênant dans le contexte de produits concurrents ayant généralement des capacités multimodales.

  • Les prix de l'API pour GLM-5.2 sont extrêmement compétitifs. Sur la base d'un million de jetons, le coût des intrants est d'environ 1,40 $ et le coût de la sortie est d'environ 4,40 $. À titre de comparaison, les coûts d'entrée/sortie de Claude Opus 4.8 sont respectivement de 5 $/25 $, et GPT-5.5 est de 5 $/30 $. Calculé sur la base d'un scénario de simulation de 50 millions de jetons/mois, le coût mensuel du GLM-5.2 est d'environ 145 $, celui de l'Opus 4.8 est d'environ 750 $ et celui du GPT-5.5 est d'environ 875 $. Choisir GLM-5.2 peut économiser jusqu'à 730 $ par mois. Dans le même temps, GLM-5.2 est entièrement open source sous le protocole MIT, et les entreprises peuvent le créer et le déployer elles-mêmes, éliminant ainsi complètement le coût de facturation des API par jeton. Ceci est particulièrement intéressant pour les entreprises qui respectent strictement leurs données : le protocole MIT peut être librement modifié pour un usage commercial, les données de déploiement national ne quittent pas le pays et il n'y a aucune crainte d'interruption de la fourniture de services externes. Cependant, GLM-5.2 a un problème de « consommation élevée » dans le système de package de Zhipu. Du fait du positionnement haut de gamme du modèle, le quota est consommé à un rythme multiple lors des appels (3 fois en période de pointe, 1 fois en période creuse). De plus, la consommation de jetons d'inférence unique est importante (tous les 1 million de contextes sont extraits). Les utilisateurs du package Lite ordinaire ont signalé que « le quota de 5 heures est utilisé en une heure et demie » et que l'expérience d'utilisation réelle est limitée par les restrictions du package.

  • Sur un échantillon de 807 utilisateurs réels, 69 % ont donné des avis positifs. Les retours positifs se concentrent dans trois directions : des capacités de développement front-end exceptionnelles, des performances de coût supérieures à celles de modèles fermés similaires et une grande flexibilité du protocole open source du MIT. Un développeur a migré l'intégralité du flux de travail Opus vers GLM-5.2, et le coût de la puissance de calcul est passé de 186 USD à 17 USD. Une entreprise a testé aveuglément l'effet de la génération de pages de destination frontales et a constaté que la qualité du produit fini était presque la même que celle de l'Opus 4.8, mais que le coût n'était que de 1/6. Il existe même des entreprises Fortune 500 qui ont déplacé la moitié de leurs efforts de codage vers ce modèle. À en juger par les portraits des utilisateurs, 82 % des utilisateurs sont des programmeurs, se concentrant sur des scénarios techniques tels que le codage, le développement d'agents et le déploiement local, et 71 % sont des utilisateurs anglophones. Cela prouve que la popularité de GLM-5.2 est purement due au cercle mondial des développeurs, plutôt qu'au trafic pan-C-end. Les retours négatifs étaient tout aussi clairs. Environ 31 % des utilisateurs réels ont donné des avis négatifs à des degrés divers. Les principales plaintes incluent : une vitesse d'inférence lente, une faible efficacité des jetons (la même tâche consomme plus de jetons que les produits concurrents), une stabilité de fonctionnement insuffisante (des erreurs occasionnelles telles que "Le paramètre d'invite n'a pas été reçu normalement") et un manque de capacité visuelle. Un blogueur des Nuggets a conclu après l'avoir utilisé pendant une journée : « il est acceptable d'écrire du code, mais ne vous attendez pas à ce qu'il planifie des événements complexes ». Il a également partagé son plan de combinaison de "Claude comme cerveau et GLM-5.2 comme main".

  • Les critiques des médias du secteur ont été généralement positives. Les médias grand public tels que Science and Technology Daily, CCTV et China Daily ont réalisé des reportages détaillés sur GLM-5.2, soulignant l'importance de sa combinaison de « modèle national open source + puissance de calcul nationale ». Un article du China Daily souligne que « dans le contexte où les modèles étrangers les plus puissants se tournent vers le fermé et où la demande d'alternatives open source augmente, cette combinaison a attiré l'attention de l'ensemble du secteur ». Tang Jie, le fondateur de GLM, a confirmé dans une lettre interne « La grande vague arrive » du 11 juillet que plusieurs indicateurs de base du GLM-5.2 ont égalé, voire dépassé, les produits phares de sources fermées tels que GPT-5.5. Cette annonce confirme une transition industrielle en cours : pour la première fois, les modèles open source rivalisent avec les produits phares du code source fermé dans les scénarios d'ingénierie les plus complexes tels que le code et les tâches à long terme. En termes de paysage de produits concurrentiels, les concurrents directs du GLM-5.2 incluent Claude Opus 4.8 (Anthropic), GPT-5.5 (OpenAI), Kimi K2.7 Code (Dark Side of the Moon), MiniMax M3, etc. Sur la piste de codage, Claude Opus 4.8 conserve toujours la tête globale, mais GLM-5.2, en tant que modèle open source, a réduit l'écart avec le produit phare fermé à moins de 5 %. En termes de rapport coût/performance global, le GLM-5.2 présente un avantage considérable. Cependant, certains analystes ont souligné que le « feu » du GLM-5.2 comporte une certaine composante faussement élevée. Une analyse complète de 9 163 tweets associés montre que seuls 9 % des utilisateurs l'ont effectivement utilisé et ont donné des avis spécifiques, et près de 80 % sont motivés par le volume de communication et les effets de capital. La popularité du sujet est bien supérieure à la taille réelle des utilisateurs.

  • Les principaux litiges et risques auxquels est confronté GLM-5.2 se concentrent sur plusieurs aspects. Le premier est le problème pratique de la stabilité des contextes longs. Bien que l'affirmation officielle soit que "Solid 1M est un contexte sans perte", de nombreux développeurs ont découvert lors de tests réels que le modèle souffre de distraction lors de tâches longue distance en plusieurs étapes - "Peu importe si la fenêtre est étendue à 1 million, le cerveau ne regarde toujours que le début et la fin." GLM-5.2 n'est pas à l'abri des défauts collectifs des modèles à contexte long. Deuxièmement, il y a des problèmes de stabilité du produit et d’expérience utilisateur. Certains utilisateurs ont signalé que lors de l'utilisation du plan de codage officiel de Zhipu, même la lecture d'un fichier txt entraînerait une erreur. Le message d'erreur était « raison=inconnu » et il y avait un manque d'invites d'erreur permettant de résoudre les problèmes. Il existe un écart entre les capacités du modèle lui-même et le degré d’achèvement au niveau du produit. Le troisième est la controverse sur la politique de facturation. Le mécanisme de doublement de la consommation par 3 pendant les périodes de pointe a amené de nombreux utilisateurs à se plaindre du fait que le quota « brûle trop vite » et que les packages ordinaires peuvent difficilement supporter des scénarios de développement réels. Ce problème a déclenché de longues discussions au sein de la communauté selon lesquelles "le modèle est solide mais il est amusant de l'utiliser, ce qui est deux choses différentes". Enfin, il y a la perte de la capacité visuelle. Le modèle phare de 2026 ne dispose pas de capacités multimodales natives. Dans le contexte de produits concurrents ayant généralement des capacités multimodales, cette lacune peut limiter les scénarios d'application du GLM-5.2.

  • GLM-5.2 convient particulièrement aux programmeurs et aux équipes de développement, en particulier dans les scénarios suivants : exigences d'automatisation du codage haute fréquence ; de grands entrepôts de code qui nécessitent des millions de contextes ; les équipes sensibles aux coûts et souhaitant réduire les frais d’API ; les entreprises qui ont des exigences de conformité des données et nécessitent un déploiement local ; les développeurs qui souhaitent migrer leur travail de codage d'un modèle fermé vers un modèle open source. Les scénarios les moins adaptés comprennent : les tâches qui nécessitent une compréhension multimodale (visualisation d'images, analyse vidéo, etc.) ; des conceptions d'architecture de haut niveau complexes et floues qui nécessitent que le modèle soit planifié de manière indépendante ; et des scénarios interactifs qui nécessitent une vitesse de raisonnement en temps réel extrêmement élevée. Pour les développeurs ordinaires, l'usage recommandé est de « tirer parti des points forts et d'éviter les faiblesses » : confier les tâches de refactoring et de codage qui nécessitent une vision globale et des objectifs clairs à GLM-5.2, et confier les liens qui nécessitent une compréhension de l'intention, une clarification des exigences et une planification complexe à des modèles capables de « penser clairement » comme Claude ou GPT.

  • GLM-5.2 constitue une avancée majeure pour les grands modèles nationaux dans le domaine du codage haut de gamme. Pour la première fois, il place le modèle open source sur la même voie que le produit phare du code source fermé en termes de code et de tâches à long terme, et offre aux développeurs une alternative véritablement implémentable avec des performances de coût extrêmes et l'accord open source du MIT. À un tournant dans l’industrie, où les modèles étrangers les plus puissants se ferment et où l’écosystème national de puissance de calcul mûrit, GLM-5.2 est sur la bonne voie. Mais ce n'est pas impeccable : la stabilité de l'attention sur un contexte long, le manque de capacités multimodales, l'achèvement du niveau de produit et les problèmes d'expérience utilisateur causés par la stratégie de facturation sont autant de « prochaines montagnes » qu'il lui faut continuer à conquérir.

Avis des utilisateurs

  • avatar
    SLeeK
    用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。

  • avatar
    Adrianc41
    从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。

  • avatar
    Stephanie_Morgan_Pro
    当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。

  • avatar
    DAOthinker464
    对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。

  • avatar
    CAphi
    把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。

  • avatar
    reddog874
    开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。

  • avatar
    BenjaminFlores_Pro
    纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。

  • avatar
    r6xxu1c
    试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。

  • avatar
    Sam_anthaWood
    写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。

  • avatar
    z5l3kae7k
    价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。

  • avatar
    段娜
    1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。

  • avatar
    SPeterson_2020
    让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。

  • avatar
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。

  • avatar
    co25ko0ac3
    公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。

  • avatar
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。

  • avatar
    JOols
    推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。

  • avatar
    MHoward_2021
    在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。

  • avatar
    GameFiGamer273
    Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。

  • avatar
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。

  • avatar
    CatherineHolm
    用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。

  • avatar
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。

  • avatar
    Emily_Henderson_66
    高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。

  • avatar
    James.Sanchez_2022
    国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。

  • avatar
    CrnptoLink
    前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。

  • avatar
    Michellew70
    token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。

  • avatar
    TheStephanieAnderson_dev
    知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。

  • avatar
    Kenneth_MendozaJr10
    试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。

  • avatar
    sadmeercat181
    自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。

  • avatar
    SUpet
    个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。

  • avatar
    Bruce_Kelly
    24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。