智譜 GLM-5.2
智譜(Zhipu)が公開しオープンソース化した新世代フラッグシップ大規模モデル。コーディングと長期タスクで世界トップの閉源モデルと肩を並べ、MITライセンスで公開、中国国産チップにも対応
詳細レポート
-
2026 年 6 月 17 日、Zhipu は新世代フラッグシップ大型モデル GLM-5.2 を正式に発売し、オープンソース化しました。その位置付けは、瞬時の質疑応答から「長期タスク」に移行し、AI が人間と同じように数時間継続的に作業し、完全な大規模プロジェクトを自律的に完了できるようになりました。人工分析の総合リストでは、GLM-5.2 が 51 ポイントを獲得し、Anthropic、OpenAI とともにトップ 3 にランクされ、いわゆる「ニュー ロイヤル 3」パターンを形成しました。コードや長距離タスクなどの最もハードコアなエンジニアリング シナリオにおいて、オープンソース モデルがクローズド ソースの主力モデルと競合するのはこれが初めてです。このモデルは、744B パラメータ MoE アーキテクチャ (トークンあたり約 40B のアクティブ パラメータ) を採用しています。 MIT プロトコルに基づく完全なオープンソースであり、商用目的で無料で使用できます。トレーニングも推論も海外のコンピューティング能力に依存しません。発売初日から、Huawei Ascend、Pingtou Ge、Moore Threads を含む 9 つの主要な国内コンピューティング プラットフォームに適応されました。
-
Zhipu (Beijing Zhipu Huazhang Technology Co., Ltd.) は、中国を代表する大規模模型スタートアップ企業です。 2026年3月に香港証券取引所で初めて業績報告書を公開し(証券コード02513.HK)、純粋な研究開発段階から商業化段階に入った。 GLM-5.2 は、GLM 上の GLM シリーズのもう 1 つの主要な反復です。 Zhipu は 2025 年の初めから、コーディング機能の研究にほぼすべての労力を投資してきました。 GLM-4.5、GLM-4.7、GLM-5.0、GLM-5.1の継続的な反復を経て、最終的にGLM-5.2で「オープンソースモデルコーディングSOTA」という目標を達成しました。 このモデルの主な進歩は、何百万ものコンテキスト ウィンドウをエンジニアリング用途に利用できるようにすることです。 GLM-5.2 は、IndexShare アーキテクチャの革新を提案しています。つまり、4 つのスパース アテンション レイヤーごとに同じインデクサーを再利用し、1M のコンテキスト長でトークンあたりの FLOP を 2.9 倍に削減します。投機的デコード用の MTP 層も改善され、受け入れられる長さが最大 20% 増加しました。トレーニング側は、大規模な Agentic RL および OPD トレーニングをサポートするために、自社開発の Slime フレームワークに依存しています。 業界の位置付けという点では、GLM-5.2 のリリースは、最も強力な海外モデルがクローズドモデルに変わり、オープンソースの代替モデルに対する需要が高まる重要な時期と一致しています。 Claude Fable 5 は米国による輸出規制の対象となっており、海外の開発者は信頼できるハイエンドの代替品を緊急に必要としています。 GLM-5.2 の登場は市場のギャップを埋め、一部のアナリストからは「DeepSeek moment 2.0」と呼ばれています。
-
GLM-5.2 の中核機能は、Long Horizon タスク、コーディング、究極のインフラ最適化という 3 つの主要な方向を中心に展開します。 長距離ミッションの場合、GLM-5.2 は Solid 1M ロスレス コンテキストを実装します。これはパラメータに 1M とマークされているだけでなく、実際のアプリケーションのエンジニアリングにも使用できます。 Zhipu は数か月を費やして 1M コーディング エージェントのトレーニング環境を大幅に拡張し、大規模な実装、自動化研究、パフォーマンスの最適化などの多くの典型的な分野をカバーしました。 FrontierSWE テスト セット (AI が数時間から数十時間の規模で複雑な技術プロジェクトを完了できるかどうかを調べるベンチマーク) では、GLM-5.2 のスコアは 74.4% で、Claude Opus 4.8 よりわずか 1% 低いだけで、GPT-5.5 の 72.6% を上回りました。 Zhipu のデモによると、GLM-5.2 は一連の連続タスクで 880,000 個を超えるトークンを処理し、開発、共同デバッグ、テストからパッケージング、オンラインに至る完全なソフトウェア配信プロセスを独立して完了し、Web ページ、モバイル端末、ミニ プログラムをカバーする完全なアプリケーションを数時間以内に作成できます。 コーディング機能の点では、GLM-5.2 は複数の信頼できるベンチマークにおいてオープンソース SOTA のままです。 Design Arena の人間の好みの評価では、GLM-5.2 が 1360 Elo で世界第 1 位となり、Claude Opus 4.8 の 1350 Elo をわずかに上回りました。 SWE-bench Pro では 62.1% のスコアを記録し、GPT-5.5 の 58.6% を上回りました。 Terminal-Bench 2.1 (コマンド ラインを介してコンピューターを操作する AI エージェントを評価するベンチマーク) では 81.0 というスコアを獲得し、GLM-5.1 と比較して 17.5 パーセント ポイント向上しました。 MCP-Atlas (ツール使用法のレビュー) では、GLM-5.2 は Opus 4.8 とわずか 0.8% の差しかありません。このモデルには、努力レベル (思考装置) 制御も導入されているため、ユーザーは機能、速度、コストのバランスを取ることができます。 インフラの最適化という点では、GLM-5.2 のオンライン推論は複数の国内コンピューティング プラットフォームに依存しています。 0日目には、Huawei Ascend、Pingtou Ge、Moore Thread、Cambrian、Kunlun Core、Muxi、Haiguang、Biren、Tianshu Zhixinなどの国内コンピューティングプラットフォームとの推論適応を完了し、国内チップクラスター上で高スループット、低遅延、大規模同時実行による安定した動作を実現しました。 ただし、実際に使用すると、ユーザーからのフィードバックにより、いくつかの明らかな欠点も明らかになりました。一部の開発者はそれをテストし、次のことを指摘しましたGLM-5.2 には「分散」問題があることが判明しました。つまり、複数ステップのタスクでコンテキストを忘れて軌道から外れやすくなります。このモデルには「錯覚的な拡張要件」の傾向があると報告するユーザーもいます。ユーザーが A を要求すると、モデルが自動的に B と C を追加するため、レビューの負担が増加します。さらに、GLM-5.2 はテキストのみのモデルであり、ネイティブのマルチモーダル機能を備えていません。2026 年の主力モデルにはビジョンがありません。一般的にマルチモーダル機能を備えている競合製品との関係では、これは不自然に見えます。
-
GLM-5.2 の API 価格は非常に競争力があります。 100 万トークンあたりの入力コストは約 1.40 ドル、出力コストは約 4.40 ドルです。比較のために、Claude Opus 4.8 の入力/出力コストはそれぞれ $5/$25、GPT-5.5 は $5/$30 です。 5,000 万トークン/月のシミュレーション シナリオに基づいて計算すると、GLM-5.2 の月額コストは約 145 ドル、Opus 4.8 は約 750 ドル、GPT-5.5 は約 875 ドルです。 GLM-5.2 を選択すると、月額最大 730 ドル節約できます。 同時に、GLM-5.2 は MIT プロトコルの下で完全にオープンソースであるため、企業はそれを自社で構築および展開できるため、トークンによる API 請求のコストが完全に排除されます。これは、厳格なデータ コンプライアンスを遵守する企業にとって特に魅力的です。MIT プロトコルは商用目的で自由に変更でき、国内展開データは国外に流出せず、外部サービスの供給が中断される心配はありません。 しかし、GLM-5.2はZhipu独自のパッケージシステムのもとで「消費量が多い」という問題を抱えている。モデルはハイエンドに位置付けられているため、通話時にクォータが複数の割合で消費されます (ピーク期間に 3 回、非ピーク期間に 1 回)。さらに、単一の推論トークンの消費量が多くなります (1M コンテキストがすべて引き込まれます)。通常の Lite パッケージ ユーザーは、「5 時間の割り当てが 1 時間半で使い果たされる」と報告しており、実際の使用体験はパッケージの制限によって制限されています。
-
実際のユーザー 807 人のサンプルでは、69% が肯定的なレビューを与えました。肯定的なフィードバックは、卓越したフロントエンド開発能力、類似のクローズドソース モデルに比べて優れたコスト パフォーマンス、MIT オープン ソース プロトコルの高い柔軟性の 3 つの方向に集中しています。開発者は Opus ワークフロー全体を GLM-5.2 に移行し、コンピューティング電力コストは 186 米ドルから 17 米ドルに下がりました。ある企業がフロントエンドのランディング ページ生成の効果を盲目的にテストしたところ、完成品の品質は Opus 4.8 とほぼ同じでありながら、コストはわずか 1/6 であることがわかりました。コーディング作業の半分をこのモデルに移行したフォーチュン 500 企業さえあります。 ユーザーの状況から判断すると、ユーザーの 82% がプログラマーで、コーディング、エージェント開発、ローカル展開などの技術的なシナリオに重点を置いており、71% が英語ユーザーです。これは、GLM-5.2 の人気が汎 C エンドのトラフィックではなく、純粋に世界的な開発者サークルによるものであることを証明しています。 否定的なフィードバックも同様に明確でした。実際のユーザーの約 31% が、さまざまな程度の否定的なレビューを与えました。主な不満としては、推論速度の遅さ、トークン効率の低さ(同じタスクで競合製品よりも多くのトークンを消費する)、実行安定性の不足(「プロンプトパラメータが正常に受信されませんでした」などのエラーが時折発生する)、視覚能力の欠如などが挙げられます。ナゲッツのブロガーは、1日使用した後、「コードを書くのは問題ないが、複雑なイベントを計画することは期待しないでください」と結論付けた。また、「クロードが頭脳、GLM-5.2が手」という組み合わせプランも明かした。
-
業界メディアからのレビューは概して好意的でした。 Science and Technology Daily、CCTV、China Dailyなどの主要メディアはGLM-5.2について広範囲に報道し、「オープンソース国家モデル+国内コンピューティング能力」の組み合わせの重要性を強調しました。チャイナ・デイリーの報道では、「最強の海外モデルがクローズドに変わり、オープンソースの代替品への需要が高まる中、この組み合わせは業界全体の注目を集めている」と指摘した。 GLMの創設者であるTang Jie氏は、7月11日の社内書簡「ビッグウェーブが来ている」の中で、GLM-5.2の複数のコア指標がGPT-5.5などのクローズドソースの主力指標と同等、あるいはそれを超えていることを認めた。この発表は、業界で起こっている移行を裏付けるものです。コードや長期タスクなどの最もハードコアなエンジニアリング シナリオにおいて、初めてオープンソース モデルがクローズド ソースの主力製品と競合することになります。 競争力のある製品環境の観点から見ると、GLM-5.2 の直接の競合相手には、Claude Opus 4.8 (Anthropic)、GPT-5.5 (OpenAI)、Kimi K2.7 Code (Dark Side of the Moon)、MiniMax M3 などが含まれます。コーディングトラックでは、Claude Opus 4.8 が依然として全体のリードを維持していますが、オープンソース モデルである GLM-5.2 は、クローズド ソースのフラッグシップ モデルとの差を 5% 以内に縮小しています。総合的なコストパフォーマンスではGLM-5.2が圧倒的に有利です。 しかし、一部のアナリストは、GLM-5.2の「火災」にはある種の誤った高成分があると指摘しました。 9,163件の関連ツイートを完全に分析したところ、実際に利用して具体的なレビューをしたユーザーはわずか9%で、80%近くはコミュニケーション量と資本効果によるものであることがわかった。トピックの人気は実際のユーザー数よりもはるかに高くなります。
-
GLM-5.2 が直面する主な紛争とリスクは、いくつかの側面に焦点を当てています。 1 つ目は、長いコンテキストの実際的な安定性の問題です。公式主張では「ソリッド 1M はロスレス コンテキストである」とされていますが、多くの開発者は実際のテストで、このモデルが複数ステップの長距離タスク中に注意散漫になることを発見しました。「ウィンドウが 100 万まで拡張されても問題ではありません。脳は依然として最初と最後しか見ていません。」 GLM-5.2 は、ロング コンテキスト モデルの集合的な欠点の影響を受けないわけではありません。 第二に、製品の安定性とユーザーエクスペリエンスの問題があります。一部のユーザーは、Zhipu の公式コーディング プランを使用すると、txt ファイルを読み込むだけでもエラーが発生すると報告しました。エラー メッセージは「reason=unknown」であり、トラブルシューティング可能なエラー プロンプトがありませんでした。モデル自体の性能と製品レベルの完成度にはギャップがあります。 3つ目は、請求ポリシーをめぐる論争です。ピーク時の消費量が 3 倍になる倍増メカニズムにより、多くのユーザーからクォータの消費が速すぎるとの不満が生じ、通常のパッケージでは実際の開発シナリオをサポートすることはほとんどできません。この問題は、コミュニティで「モデルは強力だが、使用するのは楽しい。これは別のことである」という広範な議論を引き起こしました。 最後に、視覚能力の喪失があります。 2026 年のフラッグシップ モデルには、ネイティブのマルチモーダル機能がありません。競合製品が一般にマルチモーダル機能を備えているという状況では、この欠点により GLM-5.2 のアプリケーション シナリオが制限される可能性があります。
-
GLM-5.2 は、プログラマーや開発チーム、特に次のシナリオに最適です。高頻度コーディングの自動化要件。数百万のコンテキストを必要とする大規模なコード ウェアハウス。コストを重視し、API 料金を削減したいチーム。データ コンプライアンス要件があり、ローカル展開が必要な企業。コーディング作業をクローズドソース モデルからオープンソース モデルに移行したい開発者。 最も不適切なシナリオには次のものが含まれます。 マルチモーダルな理解を必要とするタスク (写真の閲覧、ビデオ分析など)。モデルが独立して計画する必要がある、複雑であいまいな高レベルのアーキテクチャ設計。非常に高いリアルタイム推論速度を必要とするインタラクティブなシナリオ。 一般の開発者にとって推奨される使用方法は、「強みを活かして弱みを避ける」ことです。グローバルなビジョンと明確な目標が必要なリファクタリングやコーディングのタスクは GLM-5.2 に引き継ぎ、意図の理解、要件の明確化、複雑な計画が必要なリンクは Claude や GPT などの「明確に考える」のが得意なモデルに引き継ぎます。
-
GLM-5.2 は、ハイエンドコーディングの分野における国内大型モデルにとって画期的な画期的な製品です。初めて、コードと長期タスクの点でオープンソース モデルをクローズド ソースのフラッグシップと同じ軌道に乗せ、開発者に極めて高いコスト パフォーマンスと MIT オープンソース契約を備えた真に実装可能な代替手段を提供します。海外の最強モデルが廃業し、国内のコンピューティングパワーエコシステムが成熟しつつある業界の転換点において、GLM-5.2 は正しい軌道に乗っています。しかし、それは完璧ではありません。長いコンテキストの注意の安定性、マルチモーダル機能の欠如、製品レベルの完成度、および課金戦略によって引き起こされるユーザーエクスペリエンスの問題はすべて、克服し続ける必要がある「次の山」です。
ユーザーレビュー
-
SLeeK—用了一周 GLM-5.2,最大的感受就是编程能力确实强,前端生成页面基本跟 Opus 一个水平,但确实有涣散的问题,长任务跑到后面就忘了前面说过什么。 -
Adrianc41—从 5.1 换到 5.2,最明显的感觉就是上下文真的大了,以前 20 万 token 撑满就幻觉,现在整个项目塞进去还能改得动。 -
Stephanie_Morgan_Pro—当天额度一个小时就烧完了,我还以为是 bug,结果发现是 5.2 在高峰期按 3 倍扣额度,太难了。 -
DAOthinker464—对比 Opus 4.8 和 GPT-5.5 实测了一周,前端能力 GLM-5.2 确实不虚,但复杂系统的架构设计还是 Claude 更强,5.2 容易在中间步骤跑偏。 -
CAphi—把整套 Opus 的工作流迁过去了,算力成本从 186 降到 17 美元,真的很香。 -
reddog874—开源协议是 MIT,可以随便商用部署,这点对合规要求高的公司真是太友好了。 -
BenjaminFlores_Pro—纯文本模型,2026 年了旗舰机不带视觉,说实话有点尴尬,同期的 Kimi K2.7 Code 和 MiniMax M3 都是多模态。 -
r6xxu1c—试了一下让它读 txt 文件,直接报错「The prompt parameter was not received normally」,太离谱了。 -
Sam_anthaWood—写代码确实不错,但让它做规划就别指望了,我的用法是 Claude 当大脑、GLM-5.2 当手,配合起来体验最佳。 -
z5l3kae7k—价格确实是降维打击,按 5000 万 token 算一个月才 145 美元,Opus 要 750,这差价足够让我忍它的缺点了。 -
段娜—1M 上下文是真的能用的,不像某些模型标了百万其实几十万就开始掉链子,5.2 我塞了八十几万 token 跑完一整个工程没断。 -
SPeterson_2020—让我最烦的是它老爱自作主张,让它做 A 它非要顺手把 B 和 C 也做了,审起来比自己做还累。 -
CarolJ_ohnson—全球可用模型 Code Arena 第一,这成绩确实硬,不是吹的。 -
co25ko0ac3—公司里盲测了前端落地页生成,成品跟 Opus 4.8 几乎没有肉眼可见的差距,但成本只有六分之一,果断切了。 -
Aaron.Cook_77—Lite 套餐根本扛不住 5.2,一个半小时见底,升了 Pro 才好点。 -
JOols—推理速度偏慢,等得有点心焦,但考虑到这个价格也认了。 -
MHoward_2021—在 Claude Code 里接上它,改了一个几万行代码的项目,十轮交互下来不跑偏,体验比 5.1 好太多了。 -
GameFiGamer273—Vercel 的 CEO 都说「almost shocked」,这波国产模型是真的支棱起来了。 -
WPowell_2024269—Fable 5 被 ban 那天 GLM-5.2 刚好开源,时间点卡得太妙了,MIT 协议意味着谁也 ban 不了它。 -
CatherineHolm—用 Rust 从零复刻阿波罗登月计算机那个 demo 真的震撼到我了,虽然日常用不上,但足以证明它的实力。 -
Nicholas_Murphy_77—SWE-bench Pro 62.1 超了 GPT-5.5 的 58.6,这个数据挺说明问题,但跟 Opus 4.8 的 69.2 还有差距,营销话术说「接近 Opus」多少有点夸张了。 -
Emily_Henderson_66—高峰期 14 点到 18 点千万别用,3 倍扣额度真扛不住,我现在都赶上午干活。 -
James.Sanchez_2022—国产算力适配是亮点,华为昇腾、摩尔线程都能跑,不用担心被卡脖子。 -
CrnptoLink—前端开发能力确实强,Design Arena 排第一不是吹的,生成页面审美在线,但后端那种需要理解复杂业务逻辑的活它就不太行了。 -
Michellew70—token 消耗太大,同个任务比 Claude 多用 50% 的 token,虽然单价便宜但总价优势没那么大。 -
TheStephanieAnderson_dev—知乎大 V 说「以后用 Opus 可能其实是 GLM-5.2 冒充的你都分不出来」,笑死。 -
Kenneth_MendozaJr10—试了让它写一个 Minecraft 克隆,直接跑出来了能飞的版本,体验比 GPT-5.5 的版本还好。 -
sadmeercat181—自己部署的话门槛不低,744B 的大模型需要挺多显存,不是人人都能本地跑的。 -
SUpet—个人开发者小团队用性价比无敌,闭源模型那种按 token 付费的模式对高频调用太伤了。 -
Bruce_Kelly—24 小时跑完一个 SaaS 项目从开发到上线,88 万 token,实现了我对 AI 编程的终极想象。