Zhipu GLM-5.2

Novo modelo carro-chefe da Zhipu, lançado em código aberto sob licença MIT: compete com os melhores modelos fechados em programação e tarefas de longo prazo, adaptado ao hardware chinês

Relatório detalhado

  • Em 17 de junho de 2026, a Zhipu lançou oficialmente e abriu o código-fonte do modelo grande carro-chefe da nova geração GLM-5.2. Seu posicionamento mudou de perguntas e respostas instantâneas para “tarefas de longo alcance” – permitindo que a IA trabalhe continuamente por várias horas como um ser humano e conclua autonomamente um projeto completo em grande escala. Na lista abrangente de Análise Artificial, o GLM-5.2 obteve 51 pontos, ficando entre os três primeiros junto com Antrópico e OpenAI, formando o chamado padrão "Novos Três Reais". Esta é a primeira vez que um modelo de código aberto compete com carros-chefe de código fechado nos cenários de engenharia mais difíceis, como código e tarefas de longo alcance. O modelo adota uma arquitetura MoE de parâmetros de 744B (aproximadamente 40B de parâmetros ativos por token). É totalmente de código aberto sob o protocolo MIT e pode ser usado gratuitamente para uso comercial. Nem o treinamento nem a inferência dependem do poder da computação no exterior. Ele foi adaptado para nove principais plataformas de computação domésticas, incluindo Huawei Ascend, Pingtou Ge e Moore Threads no primeiro dia de lançamento.

  • Zhipu (Beijing Zhipu Huazhang Technology Co., Ltd.) é a empresa líder de startups de modelos em grande escala na China. Divulgou seu primeiro relatório de desempenho na Bolsa de Valores de Hong Kong em março de 2026 (código de ações 02513.HK) e entrou na fase de comercialização a partir da fase pura de pesquisa e desenvolvimento. GLM-5.2 é outra iteração importante da série GLM no GLM. A partir do início de 2025, a Zhipu investiu quase todos os seus esforços na pesquisa de capacidades de codificação. Ele passou por iterações contínuas de GLM-4.5, GLM-4.7, GLM-5.0 e GLM-5.1 e finalmente alcançou o objetivo de "codificação de modelo de código aberto SOTA" com GLM-5.2. A principal inovação do modelo é disponibilizar milhões de janelas de contexto para uso de engenharia. O GLM-5.2 propõe a inovação arquitetônica IndexShare – reutilizando o mesmo indexador entre cada quatro camadas de atenção esparsas, reduzindo os FLOPs por token para 2,9 vezes no comprimento de contexto de 1M. A camada MTP para decodificação especulativa também foi melhorada, aumentando o comprimento aceito em até 20%. O lado do treinamento depende da estrutura Slime autodesenvolvida para apoiar o treinamento Agentic RL e OPD em larga escala. Em termos de posicionamento da indústria, o lançamento do GLM-5.2 coincide com o período crítico em que os modelos internacionais mais fortes estão a tornar-se fechados e a procura por alternativas de código aberto está a aumentar. Claude Fable 5 está sujeito a controles de exportação por parte dos Estados Unidos, e os desenvolvedores estrangeiros precisam urgentemente de alternativas confiáveis ​​e de alta qualidade. O surgimento do GLM-5.2 preencheu a lacuna do mercado e é chamado de “momento DeepSeek 2.0” por alguns analistas.

  • Os principais recursos do GLM-5.2 giram em torno de três direções principais: Long Horizon Task, Coding e Ultimate Infra Optimization. Para missões de longo alcance, o GLM-5.2 implementa o contexto Solid 1M sem perdas. Isto não é apenas marcado com 1M nos parâmetros, mas também pode ser usado em engenharia em aplicações reais. Zhipu passou vários meses para expandir significativamente o ambiente de treinamento do 1M Coding Agent, cobrindo muitos campos típicos, como implementação em larga escala, pesquisa de automação e otimização de desempenho. No conjunto de testes FrontierSWE (um benchmark que examina se a IA pode concluir projetos técnicos complexos em uma escala de horas a dezenas de horas), o GLM-5.2 obteve 74,4%, apenas 1% abaixo do Claude Opus 4.8 e excedendo os 72,6% do GPT-5.5. De acordo com uma demonstração da Zhipu, o GLM-5.2 pode processar mais de 880.000 tokens em uma rodada de tarefas contínuas, concluir de forma independente o processo completo de entrega de software, desde o desenvolvimento, depuração conjunta, teste até empacotamento e on-line, e produzir um aplicativo completo cobrindo páginas da web, terminais móveis e miniprogramas em poucas horas. Em termos de capacidades de codificação, o GLM-5.2 permanece SOTA de código aberto em vários benchmarks oficiais. Na avaliação de preferência humana da Design Arena, o GLM-5.2 ficou em primeiro lugar no mundo com 1360 Elo, superando ligeiramente o 1350 Elo de Claude Opus 4.8. Ele pontua 62,1% no SWE-bench Pro, excedendo os 58,6% do GPT-5.5. Ele obteve 81,0 pontos no Terminal-Bench 2.1 (um benchmark que avalia Agentes de IA operando computadores por meio da linha de comando), uma melhoria de 17,5 pontos percentuais em comparação ao GLM-5.1. No MCP-Atlas (uma revisão do uso da ferramenta), o GLM-5.2 é apenas 0,8% diferente do Opus 4.8. O modelo também introduz controle de nível de esforço (equipamento de pensamento), para que os usuários possam equilibrar capacidades, velocidade e custo. Em termos de otimização de infra-estrutura, a inferência online do GLM-5.2 depende de múltiplas plataformas de computação domésticas. No Dia 0, concluiu a adaptação de inferência com plataformas de computação domésticas, como Huawei Ascend, Pingtou Ge, Moore Thread, Cambrian, Kunlun Core, Muxi, Haiguang, Biren, Tianshu Zhixin, etc., alcançando operação estável com alto rendimento, baixa latência e grande simultaneidade em clusters de chips domésticos. No entanto, na utilização real, o feedback dos utilizadores também revelou várias deficiências óbvias. Alguns desenvolvedores testaram e apontaram queAcontece que o GLM-5.2 tem um problema de “dispersão” – é fácil esquecer o contexto e sair do caminho em tarefas de várias etapas. Há também usuários que relatam que o modelo tem tendência a “requisitos de expansão ilusórios”. O usuário solicita A e o modelo adiciona automaticamente B e C, aumentando a carga de revisão. Além disso, o GLM-5.2 é um modelo somente de texto e não possui capacidades multimodais nativas – o modelo principal de 2026 não tem visão, o que parece estranho no contexto de produtos concorrentes que geralmente possuem capacidades multimodais.

  • O preço da API para GLM-5.2 é extremamente competitivo. Por milhão de tokens, o custo de entrada é de aproximadamente US$ 1,40 e o custo de saída é de aproximadamente US$ 4,40. Para efeito de comparação, os custos de entrada/saída do Claude Opus 4.8 são de US$ 5/US$ 25, respectivamente, e do GPT-5.5 é de US$ 5/US$ 30. Calculado com base em um cenário de simulação de 50 milhões de tokens/mês, o custo mensal do GLM-5.2 é de cerca de US$ 145, do Opus 4.8 é de cerca de US$ 750 e do GPT-5.5 é de cerca de US$ 875. Escolher o GLM-5.2 pode economizar até US$ 730 por mês. Ao mesmo tempo, o GLM-5.2 é totalmente de código aberto sob o protocolo MIT, e as empresas podem construí-lo e implantá-lo por conta própria, eliminando completamente o custo de cobrança de API por token. Isto é particularmente atraente para empresas com estrita conformidade de dados - o protocolo MIT pode ser modificado livremente para uso comercial, os dados de implantação doméstica não saem do país e não há medo de interrupção do fornecimento de serviços externos. No entanto, o GLM-5.2 tem um problema de “alto consumo” no próprio sistema de pacotes da Zhipu. Devido ao posicionamento high-end do modelo, a cota é consumida a uma taxa múltipla nas chamadas (3 vezes durante os períodos de pico, 1 vez durante os períodos sem pico). Além disso, o consumo de token de inferência única é grande (todos os contextos de 1 milhão são incluídos). Usuários comuns do pacote Lite relataram que "a cota de 5 horas se esgota em uma hora e meia", e a experiência de uso real é limitada pelas restrições do pacote.

  • Em uma amostra de 807 usuários reais, 69% deram avaliações positivas. O feedback positivo está concentrado em três direções: excelentes capacidades de desenvolvimento front-end, desempenho de custo superior a modelos de código fechado semelhantes e alta flexibilidade do protocolo de código aberto do MIT. Um desenvolvedor migrou todo o fluxo de trabalho do Opus para o GLM-5.2, e o custo do poder de computação caiu de US$ 186 para US$ 17. Uma empresa testou cegamente o efeito da geração da página de destino front-end e descobriu que a qualidade do produto final era quase a mesma do Opus 4.8, mas o custo era de apenas 1/6. Existem até empresas Fortune 500 que transferiram metade de seus esforços de codificação para este modelo. A julgar pelos retratos dos usuários, 82% dos usuários são programadores, com foco em cenários técnicos como codificação, desenvolvimento de agentes e implantação local, e 71% são usuários ingleses. Isso prova que a popularidade do GLM-5.2 é puramente um círculo global de desenvolvedores, em vez de tráfego pan-C-end. O feedback negativo foi igualmente claro. Cerca de 31% dos usuários reais deram vários graus de avaliações negativas. As principais reclamações incluem: velocidade de inferência lenta, baixa eficiência de token (a mesma tarefa consome mais tokens do que produtos concorrentes), estabilidade de execução insuficiente (erros ocasionais como "O parâmetro prompt não foi recebido normalmente") e falta de capacidade visual. Um blogueiro do Nuggets concluiu depois de usá-lo por um dia que “não há problema em escrever código, mas não espere que ele planeje eventos complexos”. Ele também compartilhou seu plano combinado de “Claude como o cérebro e GLM-5.2 como a mão”.

  • As críticas da mídia do setor foram geralmente positivas. A grande mídia, como Science and Technology Daily, CCTV e China Daily, fez extensas reportagens sobre o GLM-5.2, enfatizando a importância de sua combinação de "modelo nacional de código aberto + poder de computação doméstico". Um relatório do China Daily apontou que "No contexto dos modelos estrangeiros mais fortes se voltando para os fechados e da crescente demanda por alternativas de código aberto, esta combinação atraiu a atenção de toda a indústria". Tang Jie, o fundador do GLM, confirmou em uma carta interna "The Big Wave Is Coming" em 11 de julho que vários indicadores principais do GLM-5.2 igualaram ou até superaram os carros-chefe de código fechado, como o GPT-5.5. Este anúncio confirma uma transição da indústria que está ocorrendo – pela primeira vez, modelos de código aberto estão competindo com carros-chefe de código fechado nos cenários de engenharia mais difíceis, como código e tarefas de longo prazo. Em termos de cenário competitivo de produtos, os concorrentes diretos do GLM-5.2 incluem Claude Opus 4.8 (Anthropic), GPT-5.5 (OpenAI), Kimi K2.7 Code (Dark Side of the Moon), MiniMax M3, etc. Na trilha de codificação, Claude Opus 4.8 ainda mantém a liderança geral, mas o GLM-5.2, como um modelo de código aberto, reduziu a lacuna com o carro-chefe de código fechado para dentro de 5%. Em termos de desempenho de custos abrangente, o GLM-5.2 tem uma vantagem esmagadora. No entanto, alguns analistas apontaram que o “incêndio” do GLM-5.2 tem um certo componente falso alto. Uma análise completa de 9.163 tweets relacionados mostra que apenas 9% dos usuários realmente o utilizaram e deram avaliações específicas, e quase 80% são motivados pelo volume de comunicação e efeitos de capital. A popularidade do tópico é muito maior do que o tamanho real do usuário.

  • As principais disputas e riscos enfrentados pelo GLM-5.2 concentram-se em vários aspectos. A primeira é a questão da estabilidade prática de contextos longos. Embora a afirmação oficial seja que "Solid 1M é um contexto sem perdas", muitos desenvolvedores descobriram em testes reais que o modelo sofre distração durante tarefas de longa distância com várias etapas - "Não importa se a janela é esticada para 1 milhão, o cérebro ainda olha apenas para o início e o fim." O GLM-5.2 não está imune às deficiências coletivas dos modelos de contexto longo. Em segundo lugar, existem questões de estabilidade do produto e experiência do utilizador. Alguns usuários relataram que ao usar o Plano de Codificação oficial do Zhipu, até mesmo a leitura de um arquivo txt resultaria em erro. A mensagem de erro era `reason=unknown` e faltavam avisos de erro solucionáveis. Existe uma lacuna entre as capacidades do modelo em si e o grau de conclusão no nível do produto. A terceira é a controvérsia sobre a política de cobrança. O mecanismo de duplicação do consumo em 3 vezes durante os períodos de pico fez com que muitos usuários reclamassem que a cota "queima muito rápido" e que os pacotes comuns dificilmente suportam cenários reais de desenvolvimento. Esta questão desencadeou extensas discussões na comunidade de que “o modelo é forte, mas é divertido usá-lo, o que são duas coisas diferentes”. Finalmente, há a perda da capacidade visual. O modelo principal de 2026 não possui recursos multimodais nativos. No contexto de produtos concorrentes que geralmente possuem capacidades multimodais, esta deficiência pode limitar os cenários de aplicação do GLM-5.2.

  • O GLM-5.2 é mais adequado para programadores e equipes de desenvolvimento, especialmente nos seguintes cenários: requisitos de automação de codificação de alta frequência; grandes armazéns de código que exigem milhões de contextos; equipes que são sensíveis aos custos e desejam reduzir as taxas de API; empresas que possuem requisitos de conformidade de dados e exigem implantação local; desenvolvedores que desejam migrar seu trabalho de codificação de um modelo de código fechado para um modelo de código aberto. Os cenários menos adequados incluem: tarefas que requerem compreensão multimodal (visualização de imagens, análise de vídeos, etc.); projetos de arquitetura de alto nível complexos e confusos que exigem que o modelo seja planejado de forma independente; e cenários interativos que exigem velocidade de raciocínio em tempo real extremamente alta. Para desenvolvedores comuns, o uso recomendado é "aproveitar os pontos fortes e evitar os pontos fracos": entregar tarefas de refatoração e codificação que exigem uma visão global e objetivos claros para o GLM-5.2, e entregar links que exigem compreensão da intenção, esclarecimento de requisitos e planejamento complexo para modelos que são bons em "pensar com clareza", como Claude ou GPT.

  • GLM-5.2 é um avanço histórico para grandes modelos domésticos na área de codificação de ponta. Pela primeira vez, ele coloca o modelo de código aberto no mesmo caminho que o carro-chefe do código fechado em termos de código e tarefas de longo alcance, e fornece aos desenvolvedores uma alternativa verdadeiramente implementável com desempenho de custo extremo e o acordo de código aberto do MIT. Num ponto de viragem na indústria, onde os modelos estrangeiros mais fortes estão a fechar-se e o ecossistema de poder de computação doméstico está a amadurecer, o GLM-5.2 está no caminho certo. Mas não é impecável - a estabilidade da atenção do contexto longo, a falta de capacidades multimodais, a conclusão do nível do produto e os problemas de experiência do utilizador causados ​​pela estratégia de facturação são todas as "próximas montanhas" que precisa de continuar a conquistar.

Avaliações de usuários

  • avatar
    SLeeK
    用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。

  • avatar
    Adrianc41
    从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。

  • avatar
    Stephanie_Morgan_Pro
    当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。

  • avatar
    DAOthinker464
    对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。

  • avatar
    CAphi
    把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。

  • avatar
    reddog874
    开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。

  • avatar
    BenjaminFlores_Pro
    纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。

  • avatar
    r6xxu1c
    试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。

  • avatar
    Sam_anthaWood
    写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。

  • avatar
    z5l3kae7k
    价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。

  • avatar
    段娜
    1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。

  • avatar
    SPeterson_2020
    让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。

  • avatar
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。

  • avatar
    co25ko0ac3
    公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。

  • avatar
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。

  • avatar
    JOols
    推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。

  • avatar
    MHoward_2021
    在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。

  • avatar
    GameFiGamer273
    Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。

  • avatar
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。

  • avatar
    CatherineHolm
    用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。

  • avatar
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。

  • avatar
    Emily_Henderson_66
    高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。

  • avatar
    James.Sanchez_2022
    国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。

  • avatar
    CrnptoLink
    前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。

  • avatar
    Michellew70
    token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。

  • avatar
    TheStephanieAnderson_dev
    知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。

  • avatar
    Kenneth_MendozaJr10
    试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。

  • avatar
    sadmeercat181
    自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。

  • avatar
    SUpet
    个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。

  • avatar
    Bruce_Kelly
    24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。