要約 Z.ai は 2026年8月14日に GLM-5.3 をリリースしました。GLM-5.2 とまったく同じ ~743–753B パラメータの Mixture-of-Experts ベースモデル上に構築されています。すべての向上は、長期地平の環境におけるスケールしたポストトレーニングによるものです。その結果、Z.ai の社内 Code Bench で ~50% の相対改善、Terminal-Bench 3.0(4.6 → 28.3)および Agents’ Last Exam でオープンソースの SOTA、エージェント系スコアの劇的な向上、そしてサイバーセキュリティでの新たな最先端性能(CyberGym 84.5%)を達成しました。トークン効率も改善しました。
重ねて、ウェイトは安全強化後、おおよそローンチから 2 週間後に公開予定です。開発者は、CometAPI のような統合プラットフォームを通じて、関連する GLM モデルやワークフローをすでに効率的にテストできます。
重要ポイント
- ベースモデルは GLM-5.2 と同一。すべての進歩はポストトレーニング(IndexShare、SAO、slime フレームワーク + より多くの環境と計算資源)によるもの。
- コーディング: Terminal-Bench 3.0 4.6 → 28.3、DeepSWE v1.1 46.2 → 66.9、社内 Z.ai Code Bench で ~50% 向上(出力トークンは減少)。
- エージェント: AutomationBench 26.2 → 48.2、Agents’ Last Exam 23.8 → 28.5、GDPval-AA v2 1508 → 1769。
- サイバー: CyberGym 77.2 → 84.5(SOTA、Mythos 5 と GPT-5.6 Sol を上回る);ExploitBench は 24.4 → 54.4 と 2 倍以上。実環境での発見: 269 プロジェクトで 2,436 件の脆弱性。
- コアアーキテクチャの仕様は不変: 1M コンテキスト、最大 128K 出力トークン、思考は常時オン(low/high/max)。
- アクセス: GLM Coding Plan と ZCode でライブ提供中。一般 API とオープンウェイト(MIT 風予定)は安全審査後に提供。CometAPI は GLM ファミリーへの OpenAI 互換アクセスを提供し、サイドバイサイド検証や本番ルーティングを容易に。
GLM-5.3 vs GLM-5.2 一目比較
| 次元 | GLM-5.3 | GLM-5.2 | 勝者 / 注記 |
|---|---|---|---|
| ベースモデル | 同一 ~743–753B MoE | 同一 | 同一 |
| ポストトレーニング | 環境を大規模スケーリング | 以前のスタック | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3(大幅) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K tokens | 23.4% @ ~96K tokens | 5.3(性能 + 効率) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5(SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| コンテキスト / 最大出力 | 1M / 128K | 1M / 同等 | 同一 |
| 思考 | 常時オン(low/high/max) | 以前はより柔軟 | 5.3(常時オン) |
| オープンウェイト | ローンチ後 ~2 週間(予定) | 利用可能(MIT) | 現状は 5.2 |
| 現時点の主アクセス手段 | Coding Plan / ZCode | API + ウェイト + Coding Plan | 5.2 の方が成熟 |
はじめに: ポストトレーニングがもたらす世代的飛躍
2026 年 8 月中旬、オープンウェイト競争でまた迅速な反復が見られました。Z.ai(旧 Zhipu AI / ChatGLM チームの国際ブランド)は GLM-5.3 を GLM-5.2 からわずか 59 日で発表しました。発表は異例に明確で、基盤のベースモデルは同一のままだとされています。「GLM-5.3 ではポストトレーニングのスケーリングだけを行った」と同社は述べています。
この主張は重要です。長年「大きいモデルが勝つ」という物語が支配的でした。GLM-5.3 は、強化学習環境の拡大、長期地平タスクの多様化、システムインフラの強化によって、新たな事前学習を行わずとも、難易度の高いコーディング、エージェント、さらにはサイバーセキュリティのワークロードで大きな成果が得られることを示しました。いくつかの難関ベンチマークでは数値が十分に大きく、独立の観測者が「増分」ではなく「質的な変化」と評するほどです。GLM-5.3 の機能、ベンチマーク、アクセスの概要。
GLM-5.3 vs GLM-5.2: 実際に何が変わったのか?
GLM-5.3 を「GLM-5.2 を大きくしただけ」と考えるのは最大の誤解です。
そうではありません。
Z.ai によれば、ベースモデルは本質的に同一のままです。主な革新は「ポストトレーニングのスケーリング」にあります。Z.ai は 3 つの柱を強調しています。
- slime 内のシステム改善 — より良いトレーニング
- 環境スケーリング — 実務のワークフローから、実行可能で検証可能、かつ長期地平の環境を合成するパイプライン。リサーチエージェントがタスクのパターンを抽出し、ジャッジエージェントが解けることを検証。報酬ハッキングを減らすため、検証器は参照解を見ずに構築。
- SAO + 圧縮の継続利用 — 長いトラジェクトリで得た改善が短いものへ崩れ落ちるのを防ぐ。– ロールアウトの一貫性(log-prob の差を ~1e-7 に制御)、階層型キャッシング、マルチティーチャー対応、ワークロード対応スケジューリング、長期地平のコーディング RL タスクでエンドツーエンドスループットが 2.3× 超と報告。
これらの変更は、コーディング、エージェント、サイバーセキュリティの各スイートで実測の改善を生みました。重要なのは、相対的な伸びが最も大きいのは、ベースラインが低く最も難しいテストである点です—これは、モデルが以前は信頼して対処できなかった領域に押し込まれたときに期待されるパターンです。
結果として、このアップグレードは単なるアーキテクチャではなく、主として「振る舞いと能力」に関するものになっています。
GLM-5.3 vs GLM-5.2: 機能比較
1. 新しいベースモデルではなく、スケールしたポストトレーニング
Z.ai は GLM-5.3 のレシピ全体がポストトレーニングのスケーリングだと説明しています。リサーチエージェントが実務からパターンを抽出して、隠れ状態や多段依存を持つ実行可能なタスクに落とし込みます。ジャッジエージェントが各タスクの可解性を検証。検証器は参照解を見ずに作られ、オラクル・ノーオペ・未解決状態に対してテストされ、報酬ショートカットを抑制します。
このシステムには依然として人間のレビューが必要であり、Z.ai は自動化された環境生成と検証の高度化は今後の課題だと明言しています。この但し書きは、これは大規模なトレーニングパイプラインであって、合成環境が完全に自律したと主張しているわけではないことを裏付け、信頼性を高めています。
2. 長期地平のコーディングがより強力に
GLM-5.3 は、リポジトリ作業、ターミナルタスク、ML インフラ、性能最適化、多段のソフトウェアデリバリで向上しました。現実のユーザーシナリオを反映することを意図した社内評価 Z.ai Code Bench では、GLM-5.2 よりおよそ 50% のコーディング性能向上が報告されています。
効率性の結果はスコアと同じくらい重要です。Max 努力では、GLM-5.3 はタスク当たり約 75K 出力トークンで 34.5% を達成し、GLM-5.2 の約 96K で 23.4% と比べて、11.1 ポイントの品質向上とともに出力トークンを約 22% 削減しました。High 努力では、GLM-5.3 は約 50K トークンで 31.4% に到達し、同じファーストパーティの表で Claude Opus 4.8(120K で 29.5%)を上回りました。Max 努力下では Claude Fable 5 が 39.5% で依然として上位でした。
3. 新たに現れたサイバーセキュリティ能力
Z.ai はポストトレーニング中に脆弱性発見の環境を追加しました。発表によれば、能力は孤立した欠陥の検出を超え、攻撃チェーンの複数段階にまたがって推論するようになりました。
公開スコアは進歩と限界の双方を示します。GLM-5.3 は CyberGym で 84.5 と、GLM-5.2 の 77.2 を上回り、Z.ai の比較表で首位です。ExploitBench では GLM-5.2 の 24.4 に対して 54.4 と 2 倍超に達しましたが、Fable 5(78.0)や GPT-5.6 Sol(76.5)には依然届きません。ExploitGym では正規化された 2 時間予算で 105 タスク、6 時間で 130 タスクを完了(GLM-5.2 はそれぞれ 29、39)。GPT-5.6 Sol や Fable 5 は大幅に先行しています。
これらの能力はデュアルユースです。組織はモデルアクセスの制限、サンドボックス化されたツール、ログ取得、スキャンの認可要件、人間による検証と開示のプロセスを維持すべきです。
4. 3 段階の常時オン推論
GLM-5.3 は low、high、max の推論努力をサポートします。GLM-5.2 と異なり、思考の無効化はサポートされません。既存の統合で thinking.type: "disabled" を送っている場合、モデル ID を切り替える前に値を enabled に変更しないと、Z.ai によればリクエストは失敗します。
対話的な編集や低リスクの変換には low、大きなリポジトリ作業には high、難しいコーディングやセキュリティ解析には max を使用してください。努力レベルが高いほどレイテンシやコストが増す可能性があるため、より強力な回答が必ずしも最も経済的とは限らない点を評価してください。
5. slime による学習スループットの向上
GLM-5.3 は、トレーニング側で Megatron、ロールアウト側で SGLang を用いる Z.ai のオープンソースフレームワーク slime の継続利用です。Z.ai は、top-p マスキング、top-k と全語彙のオンポリシー蒸留、ティーチャー切り替え、キャッシング、トレーニングとロールアウトの数値整合性の強化などの追加を報告しています。発表では平均の対数確率差が 1e-7 レベルに制御され、従来設定より 99.99% 以上低減したとされています。
ワークロード対応のスケジューリングと負荷分散により、長期地平のコーディング RL タスクでエンドツーエンドのスループットが 2.3 倍超に向上したと報告されています。これはエンドユーザーの推論保証ではなくトレーニングインフラの改善ですが、Z.ai が 1 ヶ月でより長く多様なトラジェクトリをスケールできた理由を説明します。
6. 安全審査のためにオープンウェイトを遅延
Z.ai は GLM-5.3 をオープンウェイトモデルと呼んでいますが、ローンチ当日にウェイトはダウンロード可能ではありませんでした。同社は、安全評価とハードニング後にローンチから 2 週間で公開するとしています。これは、Hugging Face 上で MIT ライセンスのウェイトがすでに利用可能な GLM-5.2 との実質的な違いです。
多くのチームにとっては、ホスト型 API でのテストが依然として現実的な第一歩です。モデルは巨大で、オープンウェイトであっても推論ハードウェア、量子化、サービング、監視、セキュリティ制御のコストはなくなりません。
GLM-5.3 vs GLM-5.2: ベンチマークの改善
以下の表は Z.ai の公式ローンチデータ に基づきます。「Change」は報告値からの単純計算です。GLM-5.2 のベースラインが低い場合、相対比は劇的に見えうるため、絶対変化も併記しています。
| ベンチマーク | GLM-5.2 | GLM-5.3 | 絶対変化 | 相対変化 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym(2 時間) | 29 | 105 | +76 | +262.1% |
| ExploitGym(6 時間) | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
ベンチマークの改善: GLM-5.3 vs GLM-5.2 と競合他社
以下の数値は、公式の Z.ai ブログに基づくベンダー報告です(ハーネス、コンテキスト長、サンプリングの方法論注記付き)。ウェイトと幅広いアクセスが提供され次第、独立検証が行われます。
コーディングベンチマーク
| ベンチマーク | GLM-5.3 | GLM-5.2 | 注記 / 競合 |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | クローズド上位モデルと競合 |
| Terminal Bench 3.0 | 28.3 | 4.6 | オープンソース SOTA;対 Fable 5 ~33.7、GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 大幅な伸び |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench(社内、Max 努力) | ~34.5% 完了 @ ~75K tokens | ~23.4% @ ~96K tokens | コーディング体感で ~50% 改善;効率性も向上 |
High 努力では、GLM-5.3 は ~50K トークンで 31.4% の完了率に達し、同社内ベンチで Claude Opus 4.8(120K で 29.5%)を上回った一方、Claude Fable 5(Max で 39.5%)には未達でした。
サイバーセキュリティベンチマーク
| ベンチマーク | GLM-5.3 | GLM-5.2 | 競合(概算) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%、GPT-5.6 Sol: 83.6%(SOTA) |
| ExploitBench | 54.4% | 24.4% | 以前の 2 倍超;クローズドモデルはより高い(Mythos 5 ~78%、GPT-5.6 Sol ~76.5%) |
| ExploitGym(2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 は依然先行(181/247) |
伸びは攻撃チェーンの上流で最も大きくなっています。中国のセキュリティチームと行った実環境のテストでは、(GLM-5.2 の取り組みを土台に)269 プロジェクトで 2,436 件の脆弱性を特定し、そのうち 1,097 件が中〜高重要度でした。一部の欠陥は ~40 年前(最古 ~1981 年)に遡ります。発見は公開の Z.ai Security Disclosure Ledger でトラッキングされています。
エージェント & その他のベンチマーク
| ベンチマーク | GLM-5.3 | GLM-5.2 | 注記 |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 大幅な伸び |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | オープンソースで競合 |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | 44 職種をカバー |
これらの結果は、長期地平の多段プロフェッショナルタスクで明確な進歩を示しています。
トークン効率、思考モード、実運用でのふるまい
静かながら重要な改善がトークン効率です。社内の Code Bench では、より高い完了率を、より少ない出力トークンで実現しています。これは本番のエージェントループにおけるコストとレイテンシに影響します。
GLM-5.3 は思考が常に有効です。low、high、max の 3 段階をサポートします(デフォルトかつコーディングで推奨は max)。思考の無効化はサポートされなくなったため、以前に thinking.type: "disabled" を設定していたアプリケーションは移行が必要です。
コンテキストは引き続き 1M トークンで、最大出力は 128K まで。アーキテクチャは GLM-5.2 から不変のため、将来のセルフホスティングに向けたハードウェア規模の見積りは GLM-5.2 の実績から概算可能です(総パラメータ数を踏まえると、量子化後でもフットプリントは大きいまま)。
即座に試したい、あるいはモデル間の柔軟性を維持したい開発者には、統一ゲートウェイが有用です。CometAPI は GLM シリーズ(利用可能となると GLM-5.3 も、モデル ID glm-5.3 で掲載)を OpenAI 互換エンドポイント、競争力のある料金、従量課金で提供し、GLM-5.2、GLM-5.3、その他多数の先端・オープンモデル間をコード変更なしで切り替えられます。これは、コーディングエージェントの A/B テスト、成功タスク当たり実コストの測定、ワークロードに基づくルーティングに特に実用的です。
誰が GLM-5.3 へ移行すべきか、評価方法
コーディングエージェント、長期地平オートメーション、リポジトリ規模のエンジニアリングワークフロー、防御的セキュリティツールを構築するチームは評価を優先すべきです。完了率の向上、複雑タスクでのトークン効率の改善、多段エージェンシーの強化の組合せは重要です。
推奨評価パス:
- 同一の社内タスク(または固定ハーネス)を GLM-5.2 と GLM-5.3(または Coding Plan)で同じ努力レベルで実行。
- 合格率だけでなく、トークン数、壁時計時間、人手介入率も測定。
- CometAPI のような統一 API レイヤーを使い、比較摩擦を抑えつつ、フォールバックや選択的ルーティングの選択肢を確保。
- セキュリティ感度の高いワークロードでは、安全強化済みのオープンウェイトの公開を待ち、開示手順を確認。
ウェイトが公開されれば、特にすでに GLM-5.2 のインフラを運用している組織にとって、セルフホスティングは魅力的になるでしょう。
結論: 新たなスケーリングの最前線としてのポストトレーニング
GLM-5.3 は、ポストトレーニングのスケール—より現実的な環境、より良い RL インフラ、長いトラジェクトリへの継続的な計算投入—によって、従来は新しいベースモデルが必要だと思われていた能力の飛躍が得られることを、近年でも最も明確に示した例の一つです。コーディングとエージェントの伸びは大きく、サイバーの成果は多くが新たに現れたもので、発見系ベンチマークでは競合または先行しています。
実務者への実践的な示唆は端的です。モデルを実際のワークロードで試し、単なるリーダーボードの順位ではなく、成功アウトカム当たりのコストを測定し、統合は柔軟に保つこと。CometAPI のようなプラットフォームは、単一のキー、OpenAI 互換のインターフェース、GLM シリーズと競合モデル間の容易な切り替えを提供し、新機能をどの程度積極的に採用するかを決めるまでの過程を簡素化します。
