Technische Spezifikationen von GLM-5.3
| Spezifikation | GLM-5.3 |
|---|---|
| Entwickler | Z.ai / Zhipu AI |
| Veröffentlichung | 14. August 2026 |
| Modelltyp | Flaggschiff-Grundlagenmodell |
| Eingabe | Text |
| Ausgabe | Text |
| Kontextfenster | 1,000,000 Tokens |
| Maximale Ausgabe | 128,000 Tokens |
| Denken | Mehrere Modi |
| Streaming | Ja |
| Funktionsaufrufe | Ja |
| Strukturierte Ausgabe | Ja |
| Kontext-Caching | Ja |
| MCP | Ja |
| Primäre Anwendungen | Programmierung, Agenten, Engineering, Cybersicherheit |
Die öffentlichen Modell-Repositorien von Z.ai zeigen weiterhin prominent GLM-5.2 statt eines herunterladbaren GLM-5.3-Artefakts, daher sollten Spezifikationen, die noch nicht veröffentlicht wurden, ausdrücklich als unbestätigt gekennzeichnet bleiben.
Was ist GLM-5.3?
GLM-5.3 ist die jüngste Generation der GLM-Familie von Z.ai und steht für eine Entwicklung hin zu KI-Systemen, die komplexe Sicherheits- und Engineering-Aufgaben autonom ausführen können.
Die Ankündigung ist besonders bemerkenswert, weil Cybersicherheit nicht nur als eine weitere Benchmark-Kategorie präsentiert wird. Z.ai nutzt GLM-5.3, um ein KI-System zu demonstrieren, das Software-Schwachstellen entdecken und an Workflows zur Angriffsentwicklung teilnehmen kann.
Reuters berichtet, dass Z.ai plant, das Modell nach Abschluss von Sicherheitsbewertungen öffentlich zu veröffentlichen, während fortgeschrittenere Fähigkeiten zunächst über einen vertrauensbasierten Zugangsmechanismus eingeschränkt werden.
Dies ist eine bedeutende Akzentverschiebung gegenüber GLM-5.2.
GLM-5.2 war primär auf Softwareentwicklung mit langem Zeithorizont und agentenorientiertes Coding ausgerichtet. Die Forschungsseite von Z.ai aus dem Juni beschreibt GLM-5.2 als „Built for Long-Horizon Tasks“.
GLM-5.3 überträgt diese agentenorientierte Philosophie in eine erheblich sensiblere Domäne:
Softwareentwicklung → Schwachstellenerkennung → Cyberabwehr → kontrollierte offensive Sicherheit
Was sind die Hauptfunktionen von GLM-5.3?
Cybersicherheitszentriertes Denken
Die herausragende Fähigkeit ist die Cybersicherheit.
GLM-5.3 erreichte:
84.5% auf CyberGym
CyberGym bewertet die Fähigkeit eines KI-Systems, Software-Schwachstellen zu identifizieren. Das Ergebnis liegt geringfügig über den gemeldeten 83.8% von Mythos 5.
Das ist wichtig, weil Cybersicherheit mehr erfordert als nur syntaktisch korrekten Code zu erzeugen.
Ein leistungsfähiger Sicherheitsagent muss:
- Fremden Code verstehen.
- Angriffsflächen identifizieren.
- Hypothesen über Schwachstellen bilden.
- Daten- und Kontrollfluss nachverfolgen.
- Die Hypothese validieren.
- Einen geeigneten Proof of Concept entwickeln.
- Bestimmen, ob die Schwachstelle tatsächlich ausnutzbar ist.
Die CyberGym-Wertung von GLM-5.3 deutet auf bedeutende Fortschritte im ersten Teil dieser Kette hin.
Starke Schwachstellenerkennung
Die 84.5% CyberGym-Wertung ist wohl das beeindruckendste frühe Ergebnis.
Sie positioniert GLM-5.3 bei der Schwachstellenidentifikation leicht vor Mythos 5:
| Modell | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
Der Abstand beträgt nur 0.7 Prozentpunkte, daher wäre es irreführend, GLM-5.3 als eindeutig überlegen zu bezeichnen.
Interessanter ist, dass ein Open-Weight-Modell von Z.ai in dieselbe Leistungsregion vordringt wie ein stark eingeschränktes Cybersicherheits-System.
Exploit-Entwicklung bleibt eine Schwäche
GLM-5.3 dominiert nicht jede Cybersicherheitsaufgabe.
Auf ExploitBench:
| Modell | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Das ist eine Lücke von 23.6 Punkten.
Das offenbart einen wichtigen Unterschied:
Eine Schwachstelle zu finden ist nicht dasselbe wie sie zuverlässig auszunutzen.
GLM-5.3 scheint bei der Identifikation von Schwächen sehr leistungsfähig zu sein, doch die frühen Ergebnisse deuten darauf hin, dass die zuverlässige Umwandlung dieser Erkenntnisse in Exploit-Entwicklung weiterhin deutlich anspruchsvoller ist.
Für Sicherheitsteams in Unternehmen macht das das Modell als defensiven Assistenten für Schwachstellenanalysen interessant, statt nur als Motor für offensive Automatisierung.
GLM-5.3 vs GLM-5.2
GLM-5.2 liefert die nützlichste bestätigte Referenz.
| Merkmal | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Status | Veröffentlicht | Angekündigt |
| Primäre Positionierung | Langzeithorizont-Agenten | Cybersicherheit + Agenten |
| Programmierung | Exzellent | Voraussichtlich weiterhin stark |
| Cybersicherheit | Starkes Potenzial | Expliziter Flaggschiff-Fokus |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Kontext | 1M | Nicht bestätigt |
| Parameter | ~753B | Nicht bestätigt |
| Lizenz | MIT | Open-Weight angekündigt |
| API-Preise | Veröffentlicht | Noch nicht veröffentlicht |
| Öffentliche Gewichte | Verfügbar | Geplant |
Die bestätigte Architektur von GLM-5.2 umfasst ungefähr 753B Parameter, und der öffentliche Modellkatalog listet weiterhin das 753B-Modell sowie die FP8-Version.
GLM-5.2 erreichte zudem 81.0 auf Terminal-Bench 2.1 und 62.1 auf SWE-bench Pro, laut Berichten Dritter, die auf den Evaluationsunterlagen von Z.ai basieren.
Diese Werte sollten jedoch als GLM-5.2-Benchmarks behandelt und nicht GLM-5.3 zugeschrieben werden.
GLM-5.3 vs Mythos 5
Dies ist derzeit der aussagekräftigste Benchmark-Vergleich.
| Benchmark | GLM-5.3 | Mythos 5 | Differenz |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 Prozentpunkte |
| ExploitBench | 54.4% | 78.0% | −23.6 Prozentpunkte |
Das Ergebnis führt zu einem nuancierten Fazit.
GLM-5.3 gewinnt bei der Schwachstellenidentifikation.
Aber:
Mythos 5 bleibt bei der Exploit-Entwicklung deutlich stärker.
Daher wäre die Aussage „GLM-5.3 schlägt Mythos 5“ eine ungenaue Interpretation der verfügbaren Daten.
Treffender ist:
GLM-5.3 erreicht Mythos-5-Niveau bei der Schwachstellenerkennung, liegt bei der Exploit-Entwicklung jedoch zurück.
Das ist deutlich belastbarer und für Entwickler hilfreicher.