즈푸 GLM-5.2

즈푸(Zhipu)가 출시·오픈소스화한 차세대 플래그십 대형 모델. 코딩과 장기 과제에서 세계 최고 폐쇄형 모델과 경쟁하며 MIT 라이선스로 공개, 중국산 컴퓨팅 칩에도 최적화

심층 리포트

  • 2026년 6월 17일, Zhipu는 차세대 플래그십 대형 모델 GLM-5.2를 공식 출시하고 오픈 소스화했습니다. 즉각적인 질의응답에서 '장거리 작업'으로 포지셔닝이 바뀌어 AI가 인간처럼 몇 시간 동안 지속적으로 작업하고 완전한 대규모 프로젝트를 자율적으로 완료할 수 있게 되었습니다. 인공 분석 종합 목록에서 GLM-5.2는 51점을 획득해 Anthropic, OpenAI와 함께 상위 3위에 오르며 소위 "New Royal Three" 패턴을 형성했습니다. 코드 및 장거리 작업과 같은 가장 하드코어 엔지니어링 시나리오에서 오픈 소스 모델이 폐쇄 소스 플래그십과 경쟁하는 것은 이번이 처음입니다. 이 모델은 744B 매개변수 MoE 아키텍처(토큰당 약 40B 활성 매개변수)를 채택합니다. MIT 프로토콜에 따른 완전한 오픈 소스이며 상업적 용도로 무료로 사용할 수 있습니다. 훈련이나 추론 모두 해외 컴퓨팅 능력에 의존하지 않습니다. 출시 첫날 Huawei Ascend, Pingtou Ge, Moore Threads 등 국내 주요 컴퓨팅 플랫폼 9개에 적용되었습니다.

  • Zhipu(Beijing Zhipu Huazhang Technology Co., Ltd.)는 중국 최고의 대규모 모델 스타트업 회사입니다. 2026년 3월 홍콩증권거래소에 첫 실적보고서(주식코드 02513.HK)를 공개했으며, 순수 연구개발 단계부터 상용화 단계에 돌입했다. GLM-5.2는 GLM에 대한 GLM 시리즈의 또 다른 주요 반복입니다. Zhipu는 2025년 초부터 코딩 역량 연구에 거의 모든 노력을 투자했습니다. GLM-4.5, GLM-4.7, GLM-5.0, GLM-5.1의 지속적인 반복을 거쳐 마침내 GLM-5.2를 통해 "오픈 소스 모델 코딩 SOTA"라는 목표를 달성했습니다. 이 모델의 핵심 혁신은 수백만 개의 컨텍스트 창을 엔지니어링 용도로 사용할 수 있게 만드는 것입니다. GLM-5.2는 IndexShare 아키텍처 혁신을 제안합니다. 즉, 4개의 희소 주의 계층마다 동일한 인덱서를 재사용하여 컨텍스트 길이 1M에서 토큰당 FLOP를 2.9배로 줄입니다. 추론적 디코딩을 위한 MTP 계층도 개선되어 허용 길이가 최대 20% 증가했습니다. 훈련 측면에서는 자체 개발한 Slime 프레임워크를 사용하여 대규모 Agentic RL 및 OPD 훈련을 지원합니다. 업계 포지셔닝 측면에서 GLM-5.2의 출시는 가장 강력한 해외 모델이 폐쇄되고 오픈 소스 대안에 대한 수요가 증가하는 중요한 시기와 일치합니다. 클로드 페이블 5(Claude Fable 5)는 미국의 수출 통제 대상이며, 해외 개발자들은 신뢰할 수 있는 고급 대안이 절실히 필요합니다. GLM-5.2의 등장으로 시장 격차가 메워졌으며 일부 분석가들은 "DeepSeek moment 2.0"이라고 부릅니다.

  • GLM-5.2의 핵심 기능은 Long Horizon Task, Coding 및 Ultimate Infra Optimization이라는 세 가지 주요 방향을 중심으로 이루어집니다. 장거리 임무의 경우 GLM-5.2는 Solid 1M 무손실 컨텍스트를 구현합니다. 이는 매개변수에 1M으로 표시될 뿐만 아니라 실제 응용 분야의 엔지니어링에도 사용할 수 있습니다. Zhipu는 대규모 구현, 자동화 연구 및 성능 최적화와 같은 많은 일반적인 분야를 다루면서 1M Coding Agent의 교육 환경을 크게 확장하기 위해 몇 달을 보냈습니다. FrontierSWE 테스트 세트(AI가 몇 시간에서 수십 시간 규모로 복잡한 기술 프로젝트를 완료할 수 있는지 조사하는 벤치마크)에서 GLM-5.2는 74.4%를 기록했는데, 이는 Claude Opus 4.8보다 단 1% 낮고 GPT-5.5의 72.6%를 초과했습니다. Zhipu 시연에 따르면 GLM-5.2는 일련의 연속 작업에서 880,000개 이상의 토큰을 처리할 수 있으며 개발, 공동 디버깅, 테스트에서 패키징 및 온라인에 이르기까지 전체 소프트웨어 제공 프로세스를 독립적으로 완료하고 몇 시간 내에 웹 페이지, 모바일 터미널 및 미니 프로그램을 포함하는 완전한 애플리케이션을 생성할 수 있습니다. 코딩 기능 측면에서 GLM-5.2는 여러 권위 있는 벤치마크에서 오픈 소스 SOTA로 남아 있습니다. 디자인 아레나 인간 선호도 평가에서 GLM-5.2는 1360 Elo로 세계 1위에 올랐으며 Claude Opus 4.8의 1350 Elo를 약간 앞섰습니다. SWE-bench Pro에서는 62.1%를 기록해 GPT-5.5의 58.6%를 넘어섰습니다. Terminal-Bench 2.1(명령줄을 통해 컴퓨터를 운영하는 AI 에이전트를 평가하는 벤치마크)에서 81.0점을 기록해 GLM-5.1에 비해 17.5%포인트 향상됐다. MCP-Atlas(도구 사용 검토)에서 GLM-5.2는 Opus 4.8과 0.8%만 다릅니다. 또한 이 모델에는 노력 수준(사고 장비) 제어 기능이 도입되어 사용자가 기능, 속도 및 비용의 균형을 맞출 수 있습니다. 인프라 최적화 측면에서 GLM-5.2의 온라인 추론은 여러 국내 컴퓨팅 플랫폼에 의존합니다. Day 0에는 Huawei Ascend, Pingtou Ge, Moore Thread, Cambrian, Kunlun Core, Muxi, Haiguang, Biren, Tianshu Zhixin 등과 같은 국내 컴퓨팅 플랫폼으로 추론 적응을 완료하여 국내 칩 클러스터에서 높은 처리량, 낮은 대기 시간 및 대규모 동시성으로 안정적인 운영을 달성했습니다. 그러나 실제 사용에서는 사용자 피드백을 통해 몇 가지 명백한 단점도 드러났습니다. 일부 개발자는 이를 테스트하고 다음과 같이 지적했습니다.GLM-5.2에는 "분산" 문제가 있는 것으로 밝혀졌습니다. 즉, 다단계 작업에서 맥락을 잊어버리고 궤도를 벗어나기 쉽습니다. 모델에 "환상의 확장 요구 사항" 경향이 있다고 보고하는 사용자도 있습니다. 사용자가 A를 요청하면 모델이 B, C를 자동으로 추가해 리뷰 부담이 가중됩니다. 또한 GLM-5.2는 텍스트 전용 모델이며 기본 다중 모드 기능이 없습니다. 2026년 주력 모델에는 비전이 없어 일반적으로 다중 모드 기능을 갖춘 경쟁 제품의 맥락에서 어색해 보입니다.

  • GLM-5.2의 API 가격은 매우 경쟁력이 있습니다. 백만 토큰당 입력 비용은 약 $1.40이고 출력 비용은 약 $4.40입니다. 비교를 위해 Claude Opus 4.8의 입출력 비용은 각각 $5/$25이고 GPT-5.5는 $5/$30입니다. 월 5천만 개의 토큰에 대한 시뮬레이션 시나리오를 기반으로 계산하면 GLM-5.2의 월 비용은 약 $145, Opus 4.8은 약 $750, GPT-5.5는 약 $875입니다. GLM-5.2를 선택하면 월 최대 $730를 절약할 수 있습니다. 동시에 GLM-5.2는 MIT 프로토콜에 따른 완전한 오픈 소스이며 기업은 이를 직접 구축하고 배포할 수 있으므로 토큰에 의한 API 청구 비용이 완전히 제거됩니다. 이는 특히 데이터 규정을 엄격하게 준수하는 기업에 매력적입니다. MIT 프로토콜은 상업적 용도로 자유롭게 수정할 수 있고, 국내 배포 데이터가 국외로 유출되지 않으며, 외부 서비스 공급 중단에 대한 우려가 없습니다. 그러나 GLM-5.2는 Zhipu 자체 패키지 시스템에서 '높은 소비' 문제를 안고 있습니다. 모델의 고급 포지셔닝으로 인해 통화 시 할당량이 여러 비율로 소모됩니다(피크 기간에는 3회, 비피크 기간에는 1회). 또한 단일 추론 토큰 소비가 큽니다(100만 개의 컨텍스트를 모두 가져옵니다). 일반 Lite 패키지 사용자들은 "5시간 할당량이 1시간 30분 만에 다 소모된다"고 보고했으며, 실제 사용 경험은 패키지 제한으로 인해 제한됩니다.

  • 807명의 실제 사용자 샘플에서 69%가 긍정적인 평가를 받았습니다. 긍정적인 피드백은 뛰어난 프런트 엔드 개발 능력, 유사한 폐쇄 소스 모델에 비해 우수한 비용 성능, MIT 오픈 소스 프로토콜의 높은 유연성이라는 세 가지 방향으로 집중됩니다. 개발자는 전체 Opus 워크플로를 GLM-5.2로 마이그레이션했고 컴퓨팅 성능 비용은 US$186에서 US$17로 떨어졌습니다. 한 기업이 프런트 엔드 랜딩 페이지 생성 효과를 맹목적으로 테스트한 결과 완성된 제품의 품질은 Opus 4.8과 거의 동일하지만 비용은 1/6에 불과한 것으로 나타났습니다. 코딩 노력의 절반을 이 모델로 옮긴 Fortune 500대 기업도 있습니다. 사용자 초상화를 보면 사용자의 82%가 프로그래머로 코딩, 에이전트 개발, 로컬 배포 등의 기술 시나리오에 중점을 두고 있으며 71%는 영어 사용자입니다. 이는 GLM-5.2의 인기가 범C엔드 트래픽이 아닌 순전히 글로벌 개발자 집단에 의한 것임을 입증합니다. 부정적인 피드백도 마찬가지로 명확했습니다. 실제 사용자의 약 31%가 다양한 수준의 부정적인 리뷰를 남겼습니다. 주요 불만 사항으로는 느린 추론 속도, 낮은 토큰 효율성(동일한 작업이 경쟁 제품보다 더 많은 토큰을 소비함), 실행 안정성 부족("프롬프트 매개변수가 정상적으로 수신되지 않았습니다."와 같은 간헐적인 오류), 시각적 능력 부족 등이 있습니다. Nuggets 블로거는 하루 동안 사용해본 후 "코드를 작성하는 것은 괜찮지만 복잡한 이벤트를 계획할 것이라고 기대하지는 마세요"라고 결론지었습니다. 그는 "뇌는 클로드, 손은 GLM-5.2"라는 조합 계획도 공유했다.

  • 업계 언론의 리뷰는 일반적으로 긍정적이었습니다. Science and Technology Daily, CCTV, China Daily 등 주류 언론은 GLM-5.2에 대해 광범위한 보도를 하면서 "오픈 소스 국가 모델 + 국내 컴퓨팅 파워" 결합의 중요성을 강조했습니다. 차이나데일리의 보도에 따르면 "해외 최강 모델이 폐쇄적으로 변하고 오픈소스 대안에 대한 수요가 높아지는 상황에서 이번 조합은 업계 전체의 주목을 받고 있다"고 지적했다. GLM의 창립자인 Tang Jie는 7월 11일 내부 서한 "The Big Wave Is Coming"에서 GLM-5.2의 여러 핵심 지표가 GPT-5.5와 같은 비공개 소스 플래그십과 동등하거나 심지어 이를 초과했음을 확인했습니다. 이번 발표는 현재 진행 중인 업계 전환을 확인시켜 줍니다. 처음으로 오픈 소스 모델이 코드 및 장기 작업과 같은 가장 하드코어 엔지니어링 시나리오에서 폐쇄 소스 모델과 경쟁하게 되었습니다. 경쟁적인 제품 환경 측면에서 GLM-5.2의 직접적인 경쟁자로는 Claude Opus 4.8(Anthropic), GPT-5.5(OpenAI), Kimi K2.7 Code(Dark Side of the Moon), MiniMax M3 등이 있습니다. 코딩 트랙에서는 Claude Opus 4.8이 여전히 선두를 유지하고 있지만 오픈 소스 모델인 GLM-5.2는 폐쇄 소스 플래그십과의 격차를 5% 이내로 줄였습니다. 종합적인 비용 성능 측면에서 GLM-5.2는 압도적인 이점을 가지고 있습니다. 그러나 일부 분석가들은 GLM-5.2의 "불"에는 특정한 잘못된 높은 구성 요소가 있음을 지적했습니다. 9,163개의 관련 트윗을 전체적으로 분석한 결과, 실제로 사용하고 구체적인 리뷰를 제공한 사용자는 9%에 불과했으며, 거의 80%가 커뮤니케이션 규모와 자본 효과에 의해 좌우되는 것으로 나타났습니다. 해당 주제의 인기도는 실제 사용자 규모보다 훨씬 높습니다.

  • GLM-5.2가 직면한 주요 분쟁과 위험은 여러 측면에 중점을 두고 있습니다. 첫 번째는 긴 컨텍스트의 실질적인 안정성 문제입니다. 공식적인 주장은 "Solid 1M은 무손실 컨텍스트"이지만, 많은 개발자는 실제 테스트에서 모델이 다단계 장거리 작업 중에 주의가 산만해지는 것을 발견했습니다. "창이 100만 개로 늘어나도 상관없습니다. 뇌는 여전히 시작과 끝만 봅니다." GLM-5.2는 긴 컨텍스트 모델의 총체적인 단점으로부터 면역되지 않습니다. 둘째, 제품의 안정성과 사용자 경험의 문제가 있습니다. 일부 사용자는 Zhipu의 공식 코딩 계획을 사용할 때 txt 파일을 읽어도 오류가 발생한다고 보고했습니다. 오류 메시지는 `reason=unknown`이었고 문제 해결 가능한 오류 프롬프트가 부족했습니다. 모델 자체의 성능과 제품 수준의 완성도 사이에는 격차가 있습니다. 세 번째는 과금정책에 대한 논란이다. 피크 기간 동안 3배 소비하는 두 배의 메커니즘으로 인해 많은 사용자는 할당량이 "너무 빨리 소모된다"고 불평하게 되었으며 일반 패키지는 실제 개발 시나리오를 거의 지원할 수 없습니다. 이 문제는 커뮤니티에서 "모델은 강력하지만 사용하는 것이 재미있다는 두 가지 다른 점"이라는 광범위한 토론을 불러일으켰습니다. 마지막으로 시각 능력의 상실이 있습니다. 2026년형 플래그십 모델에는 기본 다중 모드 기능이 없습니다. 일반적으로 다중 모드 기능을 갖춘 경쟁 제품의 맥락에서 이러한 단점은 GLM-5.2의 적용 시나리오를 제한할 수 있습니다.

  • GLM-5.2는 특히 다음과 같은 시나리오에서 프로그래머와 개발 팀에 가장 적합합니다. 고주파 코딩 자동화 요구 사항; 수백만 개의 컨텍스트가 필요한 대규모 코드 웨어하우스 비용에 민감하고 API 수수료를 줄이려는 팀 데이터 규정 준수 요구 사항이 있고 로컬 배포가 필요한 회사 코딩 작업을 비공개 소스 모델에서 오픈 소스 모델로 마이그레이션하려는 개발자. 가장 적합하지 않은 시나리오는 다음과 같습니다: 다중 모드 이해가 필요한 작업(사진 보기, 비디오 분석 등) 모델이 독립적으로 계획해야 하는 복잡하고 모호한 고급 아키텍처 설계 매우 높은 실시간 추론 속도가 필요한 대화형 시나리오. 일반 개발자의 경우 권장되는 사용법은 "강점을 활용하고 약점을 방지"하는 것입니다. 글로벌 비전과 명확한 목표가 필요한 리팩토링 및 코딩 작업을 GLM-5.2에 넘겨주고, 의도 이해, 요구 사항 명확화 및 복잡한 계획이 필요한 링크는 Claude 또는 GPT와 같이 "명확하게 생각"하는 데 능숙한 모델에 넘겨줍니다.

  • GLM-5.2는 고급 코딩 분야에서 국내 대형 모델의 획기적인 혁신입니다. 처음으로 오픈 소스 모델을 코드 및 장거리 작업 측면에서 폐쇄 소스 플래그십과 동일한 궤도에 올려 놓고 개발자에게 최고의 비용 성능과 MIT 오픈 소스 계약을 통해 실제로 구현 가능한 대안을 제공합니다. 해외 최강 모델이 문을 닫고 국내 컴퓨팅 파워 생태계가 성숙해지는 업계의 전환점에서 GLM-5.2가 올바른 길을 가고 있습니다. 그러나 완벽한 것은 아닙니다. 긴 맥락의 주의 안정성, 다중 모드 기능의 부족, 제품 수준의 완성도, 과금 전략으로 인한 사용자 경험 문제는 모두 계속해서 정복해야 할 "다음 산"입니다.

사용자 리뷰

  • 아바타
    SLeeK
    用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。

  • 아바타
    Adrianc41
    从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。

  • 아바타
    Stephanie_Morgan_Pro
    当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。

  • 아바타
    DAOthinker464
    对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。

  • 아바타
    CAphi
    把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。

  • 아바타
    reddog874
    开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。

  • 아바타
    BenjaminFlores_Pro
    纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。

  • 아바타
    r6xxu1c
    试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。

  • 아바타
    Sam_anthaWood
    写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。

  • 아바타
    z5l3kae7k
    价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。

  • 아바타
    段娜
    1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。

  • 아바타
    SPeterson_2020
    让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。

  • 아바타
    CarolJ_ohnson
    全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。

  • 아바타
    co25ko0ac3
    公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。

  • 아바타
    Aaron.Cook_77
    Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。

  • 아바타
    JOols
    推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。

  • 아바타
    MHoward_2021
    在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。

  • 아바타
    GameFiGamer273
    Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。

  • 아바타
    WPowell_2024269
    Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。

  • 아바타
    CatherineHolm
    用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。

  • 아바타
    Nicholas_Murphy_77
    SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。

  • 아바타
    Emily_Henderson_66
    高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。

  • 아바타
    James.Sanchez_2022
    国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。

  • 아바타
    CrnptoLink
    前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。

  • 아바타
    Michellew70
    token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。

  • 아바타
    TheStephanieAnderson_dev
    知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。

  • 아바타
    Kenneth_MendozaJr10
    试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。

  • 아바타
    sadmeercat181
    自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。

  • 아바타
    SUpet
    个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。

  • 아바타
    Bruce_Kelly
    24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。