FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/CometAPIリサーチ

GLM-5.3 vs GLM-5.2: ベンチマークとテストが示す変更点

GLM-5.3 vs GLM-5.2: 同一ベースモデル、純粋なポストトレーニングによりコーディング性能が約50%向上(Terminal-Bench 3.0 4.6→28.3)& 創発的 CyberGym 84.5% SOTA。

CometAPI
AnnaAIモデルとAPIの調査チーム
更新日 Aug 17, 2026 6 分読み
GLM-5.3 vs GLM-5.2: ベンチマークとテストが示す変更点
このパターンを使う

最初のAPI呼び出しを行う。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

要約 Z.ai は 2026年8月14日に GLM-5.3 をリリースしました。GLM-5.2 とまったく同じ ~743–753B パラメータの Mixture-of-Experts ベースモデル上に構築されています。すべての向上は、長期地平の環境におけるスケールしたポストトレーニングによるものです。その結果、Z.ai の社内 Code Bench で ~50% の相対改善、Terminal-Bench 3.0(4.6 → 28.3)および Agents’ Last Exam でオープンソースの SOTA、エージェント系スコアの劇的な向上、そしてサイバーセキュリティでの新たな最先端性能(CyberGym 84.5%)を達成しました。トークン効率も改善しました。

重ねて、ウェイトは安全強化後、おおよそローンチから 2 週間後に公開予定です。開発者は、CometAPI のような統合プラットフォームを通じて、関連する GLM モデルやワークフローをすでに効率的にテストできます。

重要ポイント

  • ベースモデルは GLM-5.2 と同一。すべての進歩はポストトレーニング(IndexShare、SAO、slime フレームワーク + より多くの環境と計算資源)によるもの。
  • コーディング: Terminal-Bench 3.0 4.6 → 28.3、DeepSWE v1.1 46.2 → 66.9、社内 Z.ai Code Bench で ~50% 向上(出力トークンは減少)。
  • エージェント: AutomationBench 26.2 → 48.2、Agents’ Last Exam 23.8 → 28.5、GDPval-AA v2 1508 → 1769。
  • サイバー: CyberGym 77.2 → 84.5(SOTA、Mythos 5 と GPT-5.6 Sol を上回る);ExploitBench は 24.4 → 54.4 と 2 倍以上。実環境での発見: 269 プロジェクトで 2,436 件の脆弱性。
  • コアアーキテクチャの仕様は不変: 1M コンテキスト、最大 128K 出力トークン、思考は常時オン(low/high/max)。
  • アクセス: GLM Coding Plan と ZCode でライブ提供中。一般 API とオープンウェイト(MIT 風予定)は安全審査後に提供。CometAPI は GLM ファミリーへの OpenAI 互換アクセスを提供し、サイドバイサイド検証や本番ルーティングを容易に。

GLM-5.3 vs GLM-5.2 一目比較

次元GLM-5.3GLM-5.2勝者 / 注記
ベースモデル同一 ~743–753B MoE同一同一
ポストトレーニング環境を大規模スケーリング以前のスタック5.3
Terminal-Bench 3.028.34.65.3(大幅)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3(性能 + 効率)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5(SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
コンテキスト / 最大出力1M / 128K1M / 同等同一
思考常時オン(low/high/max)以前はより柔軟5.3(常時オン)
オープンウェイトローンチ後 ~2 週間(予定)利用可能(MIT)現状は 5.2
現時点の主アクセス手段Coding Plan / ZCodeAPI + ウェイト + Coding Plan5.2 の方が成熟

はじめに: ポストトレーニングがもたらす世代的飛躍

2026 年 8 月中旬、オープンウェイト競争でまた迅速な反復が見られました。Z.ai(旧 Zhipu AI / ChatGLM チームの国際ブランド)は GLM-5.3 を GLM-5.2 からわずか 59 日で発表しました。発表は異例に明確で、基盤のベースモデルは同一のままだとされています。「GLM-5.3 ではポストトレーニングのスケーリングだけを行った」と同社は述べています

この主張は重要です。長年「大きいモデルが勝つ」という物語が支配的でした。GLM-5.3 は、強化学習環境の拡大、長期地平タスクの多様化、システムインフラの強化によって、新たな事前学習を行わずとも、難易度の高いコーディング、エージェント、さらにはサイバーセキュリティのワークロードで大きな成果が得られることを示しました。いくつかの難関ベンチマークでは数値が十分に大きく、独立の観測者が「増分」ではなく「質的な変化」と評するほどです。GLM-5.3 の機能、ベンチマーク、アクセスの概要

GLM-5.3 vs GLM-5.2: 実際に何が変わったのか?

GLM-5.3 を「GLM-5.2 を大きくしただけ」と考えるのは最大の誤解です。

そうではありません。

Z.ai によれば、ベースモデルは本質的に同一のままです。主な革新は「ポストトレーニングのスケーリング」にあります。Z.ai は 3 つの柱を強調しています。

  1. slime 内のシステム改善 — より良いトレーニング
  2. 環境スケーリング — 実務のワークフローから、実行可能で検証可能、かつ長期地平の環境を合成するパイプライン。リサーチエージェントがタスクのパターンを抽出し、ジャッジエージェントが解けることを検証。報酬ハッキングを減らすため、検証器は参照解を見ずに構築。
  3. SAO + 圧縮の継続利用 — 長いトラジェクトリで得た改善が短いものへ崩れ落ちるのを防ぐ。– ロールアウトの一貫性(log-prob の差を ~1e-7 に制御)、階層型キャッシング、マルチティーチャー対応、ワークロード対応スケジューリング、長期地平のコーディング RL タスクでエンドツーエンドスループットが 2.3× 超と報告。

これらの変更は、コーディング、エージェント、サイバーセキュリティの各スイートで実測の改善を生みました。重要なのは、相対的な伸びが最も大きいのは、ベースラインが低く最も難しいテストである点です—これは、モデルが以前は信頼して対処できなかった領域に押し込まれたときに期待されるパターンです。

結果として、このアップグレードは単なるアーキテクチャではなく、主として「振る舞いと能力」に関するものになっています。

GLM-5.3 vs GLM-5.2: 機能比較

1. 新しいベースモデルではなく、スケールしたポストトレーニング

Z.ai は GLM-5.3 のレシピ全体がポストトレーニングのスケーリングだと説明しています。リサーチエージェントが実務からパターンを抽出して、隠れ状態や多段依存を持つ実行可能なタスクに落とし込みます。ジャッジエージェントが各タスクの可解性を検証。検証器は参照解を見ずに作られ、オラクル・ノーオペ・未解決状態に対してテストされ、報酬ショートカットを抑制します。

このシステムには依然として人間のレビューが必要であり、Z.ai は自動化された環境生成と検証の高度化は今後の課題だと明言しています。この但し書きは、これは大規模なトレーニングパイプラインであって、合成環境が完全に自律したと主張しているわけではないことを裏付け、信頼性を高めています。

2. 長期地平のコーディングがより強力に

GLM-5.3 は、リポジトリ作業、ターミナルタスク、ML インフラ、性能最適化、多段のソフトウェアデリバリで向上しました。現実のユーザーシナリオを反映することを意図した社内評価 Z.ai Code Bench では、GLM-5.2 よりおよそ 50% のコーディング性能向上が報告されています。

効率性の結果はスコアと同じくらい重要です。Max 努力では、GLM-5.3 はタスク当たり約 75K 出力トークンで 34.5% を達成し、GLM-5.2 の約 96K で 23.4% と比べて、11.1 ポイントの品質向上とともに出力トークンを約 22% 削減しました。High 努力では、GLM-5.3 は約 50K トークンで 31.4% に到達し、同じファーストパーティの表で Claude Opus 4.8(120K で 29.5%)を上回りました。Max 努力下では Claude Fable 5 が 39.5% で依然として上位でした。

3. 新たに現れたサイバーセキュリティ能力

Z.ai はポストトレーニング中に脆弱性発見の環境を追加しました。発表によれば、能力は孤立した欠陥の検出を超え、攻撃チェーンの複数段階にまたがって推論するようになりました。

公開スコアは進歩と限界の双方を示します。GLM-5.3 は CyberGym で 84.5 と、GLM-5.2 の 77.2 を上回り、Z.ai の比較表で首位です。ExploitBench では GLM-5.2 の 24.4 に対して 54.4 と 2 倍超に達しましたが、Fable 5(78.0)や GPT-5.6 Sol(76.5)には依然届きません。ExploitGym では正規化された 2 時間予算で 105 タスク、6 時間で 130 タスクを完了(GLM-5.2 はそれぞれ 29、39)。GPT-5.6 Sol や Fable 5 は大幅に先行しています。

これらの能力はデュアルユースです。組織はモデルアクセスの制限、サンドボックス化されたツール、ログ取得、スキャンの認可要件、人間による検証と開示のプロセスを維持すべきです。

4. 3 段階の常時オン推論

GLM-5.3 は lowhighmax の推論努力をサポートします。GLM-5.2 と異なり、思考の無効化はサポートされません。既存の統合で thinking.type: "disabled" を送っている場合、モデル ID を切り替える前に値を enabled に変更しないと、Z.ai によればリクエストは失敗します。

対話的な編集や低リスクの変換には low、大きなリポジトリ作業には high、難しいコーディングやセキュリティ解析には max を使用してください。努力レベルが高いほどレイテンシやコストが増す可能性があるため、より強力な回答が必ずしも最も経済的とは限らない点を評価してください。

5. slime による学習スループットの向上

GLM-5.3 は、トレーニング側で Megatron、ロールアウト側で SGLang を用いる Z.ai のオープンソースフレームワーク slime の継続利用です。Z.ai は、top-p マスキング、top-k と全語彙のオンポリシー蒸留、ティーチャー切り替え、キャッシング、トレーニングとロールアウトの数値整合性の強化などの追加を報告しています。発表では平均の対数確率差が 1e-7 レベルに制御され、従来設定より 99.99% 以上低減したとされています。

ワークロード対応のスケジューリングと負荷分散により、長期地平のコーディング RL タスクでエンドツーエンドのスループットが 2.3 倍超に向上したと報告されています。これはエンドユーザーの推論保証ではなくトレーニングインフラの改善ですが、Z.ai が 1 ヶ月でより長く多様なトラジェクトリをスケールできた理由を説明します。

6. 安全審査のためにオープンウェイトを遅延

Z.ai は GLM-5.3 をオープンウェイトモデルと呼んでいますが、ローンチ当日にウェイトはダウンロード可能ではありませんでした。同社は、安全評価とハードニング後にローンチから 2 週間で公開するとしています。これは、Hugging Face 上で MIT ライセンスのウェイトがすでに利用可能な GLM-5.2 との実質的な違いです。

多くのチームにとっては、ホスト型 API でのテストが依然として現実的な第一歩です。モデルは巨大で、オープンウェイトであっても推論ハードウェア、量子化、サービング、監視、セキュリティ制御のコストはなくなりません。

GLM-5.3 vs GLM-5.2: ベンチマークの改善

以下の表は Z.ai の公式ローンチデータ に基づきます。「Change」は報告値からの単純計算です。GLM-5.2 のベースラインが低い場合、相対比は劇的に見えうるため、絶対変化も併記しています。

ベンチマークGLM-5.2GLM-5.3絶対変化相対変化
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym(2 時間)29105+76+262.1%
ExploitGym(6 時間)39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE with tools54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

ベンチマークの改善: GLM-5.3 vs GLM-5.2 と競合他社

以下の数値は、公式の Z.ai ブログに基づくベンダー報告です(ハーネス、コンテキスト長、サンプリングの方法論注記付き)。ウェイトと幅広いアクセスが提供され次第、独立検証が行われます。

コーディングベンチマーク

ベンチマークGLM-5.3GLM-5.2注記 / 競合
Terminal Bench 2.188.281.0クローズド上位モデルと競合
Terminal Bench 3.028.34.6オープンソース SOTA;対 Fable 5 ~33.7、GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2大幅な伸び
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench(社内、Max 努力)~34.5% 完了 @ ~75K tokens~23.4% @ ~96K tokensコーディング体感で ~50% 改善;効率性も向上

High 努力では、GLM-5.3 は ~50K トークンで 31.4% の完了率に達し、同社内ベンチで Claude Opus 4.8(120K で 29.5%)を上回った一方、Claude Fable 5(Max で 39.5%)には未達でした。

サイバーセキュリティベンチマーク

ベンチマークGLM-5.3GLM-5.2競合(概算)
CyberGym84.5%77.2%Mythos 5: 83.8%、GPT-5.6 Sol: 83.6%(SOTA)
ExploitBench54.4%24.4%以前の 2 倍超;クローズドモデルはより高い(Mythos 5 ~78%、GPT-5.6 Sol ~76.5%)
ExploitGym(2h/6h)105 / 13029 / 39Mythos 5 は依然先行(181/247)

伸びは攻撃チェーンの上流で最も大きくなっています。中国のセキュリティチームと行った実環境のテストでは、(GLM-5.2 の取り組みを土台に)269 プロジェクトで 2,436 件の脆弱性を特定し、そのうち 1,097 件が中〜高重要度でした。一部の欠陥は ~40 年前(最古 ~1981 年)に遡ります。発見は公開の Z.ai Security Disclosure Ledger でトラッキングされています。

エージェント & その他のベンチマーク

ベンチマークGLM-5.3GLM-5.2注記
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2大幅な伸び
Agents’ Last Exam (ALE-CLI)28.523.8オープンソースで競合
HLE w/ Tools62.554.7
GDPval-AA v21769150844 職種をカバー

これらの結果は、長期地平の多段プロフェッショナルタスクで明確な進歩を示しています。

トークン効率、思考モード、実運用でのふるまい

静かながら重要な改善がトークン効率です。社内の Code Bench では、より高い完了率を、より少ない出力トークンで実現しています。これは本番のエージェントループにおけるコストとレイテンシに影響します。

GLM-5.3 は思考が常に有効です。lowhighmax の 3 段階をサポートします(デフォルトかつコーディングで推奨は max)。思考の無効化はサポートされなくなったため、以前に thinking.type: "disabled" を設定していたアプリケーションは移行が必要です。

コンテキストは引き続き 1M トークンで、最大出力は 128K まで。アーキテクチャは GLM-5.2 から不変のため、将来のセルフホスティングに向けたハードウェア規模の見積りは GLM-5.2 の実績から概算可能です(総パラメータ数を踏まえると、量子化後でもフットプリントは大きいまま)。

即座に試したい、あるいはモデル間の柔軟性を維持したい開発者には、統一ゲートウェイが有用です。CometAPI は GLM シリーズ(利用可能となると GLM-5.3 も、モデル ID glm-5.3 で掲載)を OpenAI 互換エンドポイント、競争力のある料金、従量課金で提供し、GLM-5.2、GLM-5.3、その他多数の先端・オープンモデル間をコード変更なしで切り替えられます。これは、コーディングエージェントの A/B テスト、成功タスク当たり実コストの測定、ワークロードに基づくルーティングに特に実用的です。

誰が GLM-5.3 へ移行すべきか、評価方法

コーディングエージェント、長期地平オートメーション、リポジトリ規模のエンジニアリングワークフロー、防御的セキュリティツールを構築するチームは評価を優先すべきです。完了率の向上、複雑タスクでのトークン効率の改善、多段エージェンシーの強化の組合せは重要です。

推奨評価パス:

  1. 同一の社内タスク(または固定ハーネス)を GLM-5.2 と GLM-5.3(または Coding Plan)で同じ努力レベルで実行。
  2. 合格率だけでなく、トークン数、壁時計時間、人手介入率も測定。
  3. CometAPI のような統一 API レイヤーを使い、比較摩擦を抑えつつ、フォールバックや選択的ルーティングの選択肢を確保。
  4. セキュリティ感度の高いワークロードでは、安全強化済みのオープンウェイトの公開を待ち、開示手順を確認。

ウェイトが公開されれば、特にすでに GLM-5.2 のインフラを運用している組織にとって、セルフホスティングは魅力的になるでしょう。

結論: 新たなスケーリングの最前線としてのポストトレーニング

GLM-5.3 は、ポストトレーニングのスケール—より現実的な環境、より良い RL インフラ、長いトラジェクトリへの継続的な計算投入—によって、従来は新しいベースモデルが必要だと思われていた能力の飛躍が得られることを、近年でも最も明確に示した例の一つです。コーディングとエージェントの伸びは大きく、サイバーの成果は多くが新たに現れたもので、発見系ベンチマークでは競合または先行しています。

実務者への実践的な示唆は端的です。モデルを実際のワークロードで試し、単なるリーダーボードの順位ではなく、成功アウトカム当たりのコストを測定し、統合は柔軟に保つこと。CometAPI のようなプラットフォームは、単一のキー、OpenAI 互換のインターフェース、GLM シリーズと競合モデル間の容易な切り替えを提供し、新機能をどの程度積極的に採用するかを決めるまでの過程を簡素化します。

学習を続ける

この記事を次の判断につなげる。

すべてのトピックを見る
公開日 Aug 15, 2026
最終更新 Aug 17, 2026
6 回視聴
明確性、出典の帰属、最新のAPI用語について確認済みです。

AI開発コストを20%削減する準備はできていますか?

数分で無料スタート。無料トライアルクレジット付き。クレジットカード不要。

もっと読む