GLM-5.3 の技術仕様
| 仕様 | GLM-5.3 |
|---|---|
| 開発元 | Z.ai / Zhipu AI |
| リリース | 2026年8月14日 |
| モデルタイプ | フラッグシップ基盤モデル |
| 入力 | テキスト |
| 出力 | テキスト |
| コンテキストウィンドウ | 1,000,000 トークン |
| 最大出力 | 128,000 トークン |
| 思考 | 複数モード |
| ストリーミング | はい |
| 関数呼び出し | はい |
| 構造化出力 | はい |
| コンテキストキャッシング | はい |
| MCP | はい |
| 主な用途 | コーディング、エージェント、エンジニアリング、サイバーセキュリティ |
Z.ai の公開モデルリポジトリには依然としてダウンロード可能な GLM-5.3 のアーティファクトではなく GLM-5.2 が目立って表示されているため、まだ公開されていない仕様については明確に未確認と記載したままとすべきである。
GLM-5.3 とは?
GLM-5.3 は Z.ai の GLM ファミリーの最新世代であり、複雑なセキュリティとエンジニアリング作業を自律的に実行できる AI システムへと舵を切ったことを示している。
この発表が特筆されるのは、サイバーセキュリティが単なるベンチマークの一カテゴリーとして示されているわけではない点にある。Z.ai は GLM-5.3 を用いて、ソフトウェアの脆弱性を発見し、攻撃開発ワークフローに参加できる AI システムを実演している。
Reuters は、Z.ai がセキュリティ評価を完了した後にモデルを一般公開する計画である一方、より高度な機能は当初は信頼済みアクセス機構を通じて制限されると報じている。
これは GLM-5.2 からの強調点の大きな変化である。
GLM-5.2 は主に長期ホライズンのソフトウェアエンジニアリングとエージェント型コーディングを中心に位置づけられていた。Z.ai の 6 月の研究ページでは、GLM-5.2 を「長期タスクのために構築」と説明している。
GLM-5.3 はそのエージェント的哲学を、はるかにセンシティブな領域へ拡張している。
ソフトウェアエンジニアリング → 脆弱性発見 → サイバー防御 → 制御された攻撃的セキュリティ
GLM-5.3 の主な特徴は?
サイバーセキュリティ中心の推論
見出しとなる能力はサイバーセキュリティである。
GLM-5.3 は達成した:
CyberGym で 84.5%
CyberGym は、AI システムがソフトウェアの脆弱性を特定する能力を評価する。結果は Mythos 5 の報告値 83.8% をわずかに上回る。
これは重要だ。なぜならサイバーセキュリティには、文法的に正しいコードを生成する以上のものが求められるからである。
有能なセキュリティエージェントに必要なのは次のとおりだ。
- 見慣れないコードを理解する。
- 攻撃面を特定する。
- 脆弱性に関する仮説を立てる。
- データと制御のフローを追跡する。
- 仮説を検証する。
- 適切な PoC を作成する。
- 脆弱性が実際に悪用可能かどうかを判断する。
GLM-5.3 の CyberGym スコアは、この連鎖の前半において意味のある進歩を示唆している。
脆弱性発見の強さ
84.5% の CyberGym スコアは、初期結果の中でも最も印象的なものと言えるだろう。
これは脆弱性の識別において、GLM-5.3 を Mythos 5 よりわずかに上に置く。
| Model | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
差はわずか0.7 パーセンテージポイントにすぎないため、GLM-5.3 を決定的に優れていると表現するのは誤解を招く。
より興味深いのは、Z.ai の公開ウェイトモデルが、厳しく制限されたサイバーセキュリティシステムと同じ性能領域に入りつつあるという点である。
エクスプロイト開発は依然として弱点
GLM-5.3 はサイバーセキュリティのあらゆるタスクで支配的というわけではない。
ExploitBench において:
| Model | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
これは23.6 ポイントの差だ。
ここには重要な違いがある。
脆弱性を見つけることと、それを安定的に悪用することは同じではない。
GLM-5.3 は弱点の特定において非常に有能に見えるが、初期結果は、その発見を信頼性の高いエクスプロイト開発へと変換することは依然としてかなり難しいことを示している。
エンタープライズのセキュリティチームにとって、これはモデルを単なる攻撃自動化エンジンというよりも、防御的な脆弱性分析アシスタントとして興味深いものにしている。
GLM-5.3 と GLM-5.2 の比較
GLM-5.2 は、最も有用で確認済みのベースラインを提供する。
| 機能 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| ステータス | 公開済み | 発表済み |
| 主なポジショニング | 長期ホライズンのエージェント | サイバーセキュリティ + エージェント |
| コーディング | 優秀 | 引き続き強力と予想 |
| サイバーセキュリティ | 強い可能性 | 明確なフラッグシップの焦点 |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| コンテキスト | 1M | 未確認 |
| パラメータ | ~753B | 未確認 |
| ライセンス | MIT | 公開ウェイトを発表 |
| API 料金 | 公開済み | 未公開 |
| 公開ウェイト | 利用可能 | 計画済み |
GLM-5.2 の確認済みアーキテクチャはおよそ753B パラメータであり、公開モデルカタログには 753B モデルと FP8 版が引き続き掲載されている。
また、第三者の報告(Z.ai のモデル評価資料に基づく)によれば、GLM-5.2 は Terminal-Bench 2.1 で 81.0、SWE-bench Pro で 62.1 を達成している。
ただし、これらの数値はGLM-5.2 のベンチマークとして扱うべきであり、GLM-5.3 に帰属させてはならない。
GLM-5.3 と Mythos 5 の比較
これは現時点で最も意味のあるベンチマーク比較である。
| ベンチマーク | GLM-5.3 | Mythos 5 | 差分 |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
この結果は、含みのある結論を導く。
GLM-5.3 は脆弱性の特定で勝る。
しかし:
Mythos 5 はエクスプロイト開発で依然として大きく優位にある。
したがって、**「GLM-5.3 が Mythos 5 に勝った」**と述べるのは、利用可能なデータの解釈として不正確である。
より適切な表現は次のとおりだ。
GLM-5.3 は脆弱性発見で Mythos 5 と同等レベルに到達しつつ、エクスプロイト開発では依然として後れを取っている。