Tekniske specifikationer for GLM-5.3
| Specifikation | GLM-5.3 |
|---|---|
| Udvikler | Z.ai / Zhipu AI |
| Udgivelse | August 14, 2026 |
| Modeltype | Flagship foundation model |
| Input | Tekst |
| Output | Tekst |
| Kontekstvindue | 1,000,000 tokens |
| Maksimalt output | 128,000 tokens |
| Tænkning | Flere tilstande |
| Streaming | Ja |
| Funktionskald | Ja |
| Struktureret output | Ja |
| Kontekst-caching | Ja |
| MCP | Ja |
| Primære anvendelser | Kodning, agenter, ingeniørarbejde, cybersikkerhed |
Z.ai's offentlige model-repositorier viser stadig tydeligt GLM-5.2 i stedet for et downloadbart GLM-5.3-artefakt, så specifikationer, der endnu ikke er offentliggjort, bør fortsat være eksplicit markeret som ubekræftet.
Hvad er GLM-5.3?
GLM-5.3 er den seneste generation i Z.ai's GLM-familie og markerer et skifte mod AI-systemer, der autonomt kan udføre komplekse sikkerheds- og ingeniøropgaver.
Annonceringen er særligt bemærkelsesværdig, fordi cybersikkerhed ikke blot præsenteres som endnu en benchmark-kategori. Z.ai bruger GLM-5.3 til at demonstrere et AI-system, der kan opdage software-sårbarheder og deltage i arbejdsgange for udvikling af angreb.
Reuters rapporterer, at Z.ai planlægger at frigive modellen offentligt efter afsluttede sikkerhedsvurderinger, mens mere avancerede kapabiliteter i første omgang vil blive begrænset gennem en mekanisme for betroet adgang.
Dette er en markant ændring i vægtning i forhold til GLM-5.2.
GLM-5.2 var primært positioneret omkring softwareudvikling med lang horisont og agentbaseret kodning. Z.ai's forskningsside fra juni beskriver GLM-5.2 som "Built for Long-Horizon Tasks."
GLM-5.3 tager den agentbaserede filosofi ind i et betydeligt mere følsomt domæne:
softwareudvikling → sårbarhedsopdagelse → cyberforsvar → kontrolleret offensiv sikkerhed
Hvad er de vigtigste funktioner i GLM-5.3?
Cybersikkerheds-centreret ræsonnering
Den vigtigste kapabilitet er cybersikkerhed.
GLM-5.3 opnåede:
84.5% på CyberGym
CyberGym evaluerer et AI-systems evne til at identificere software-sårbarheder. Resultatet ligger en anelse over Mythos 5's rapporterede 83.8%.
Det er vigtigt, fordi cybersikkerhed kræver mere end at generere syntaktisk korrekt kode.
En kapabel sikkerhedsagent skal kunne:
- Forstå ukendt kode.
- Identificere angrebsflader.
- Danne hypoteser om sårbarheder.
- Spore data- og kontrolflow.
- Validere hypotesen.
- Udvikle et passende proof of concept.
- Afgøre om sårbarheden faktisk kan udnyttes.
GLM-5.3's CyberGym-score antyder meningsfulde fremskridt gennem den første del af denne kæde.
Stærk sårbarhedsopdagelse
Den 84.5% CyberGym-score er måske det mest imponerende tidlige resultat.
Den placerer GLM-5.3 en smule foran Mythos 5 i sårbarhedsidentifikation:
| Model | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
Margen er kun 0.7 procentpoint, så det ville være misvisende at beskrive GLM-5.3 som afgørende overlegen.
Det mere interessante er, at en model med åbne vægte fra Z.ai bevæger sig ind i samme præstationsområde som et stærkt begrænset cybersikkerhedssystem.
Udvikling af exploits er stadig en svaghed
GLM-5.3 dominerer ikke alle cybersikkerhedsopgaver.
På ExploitBench:
| Model | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Det er et hul på 23.6 point.
Dette afslører en vigtig sondring:
At finde en sårbarhed er ikke det samme som at udnytte den pålideligt.
GLM-5.3 synes meget kapabel til at identificere svagheder, men de tidlige resultater indikerer, at at omsætte disse fund til pålidelig udvikling af exploits fortsat er betydeligt sværere.
For sikkerhedsteams i virksomheder gør dette faktisk modellen interessant som en defensiv assistent til sårbarhedsanalyse snarere end blot en offensiv automatiseringsmotor.
GLM-5.3 vs GLM-5.2
GLM-5.2 giver den mest nyttige bekræftede grundlinje.
| Funktion | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Status | Udgivet | Annonceret |
| Primær positionering | Agenter med lang horisont | Cybersikkerhed + agenter |
| Kodning | Fremragende | Forventes at forblive stærk |
| Cybersikkerhed | Stort potentiale | Udtrykkeligt flagskibsfokus |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Kontekst | 1M | Ikke bekræftet |
| Parametre | ~753B | Ikke bekræftet |
| Licens | MIT | Åbne vægte annonceret |
| API-priser | Offentliggjort | Endnu ikke offentliggjort |
| Offentlige vægte | Tilgængelige | Planlagt |
GLM-5.2's bekræftede arkitektur er cirka 753B parametre, og dets offentlige modelkatalog viser stadig 753B-modellen og FP8-versionen.
GLM-5.2 opnåede også 81.0 på Terminal-Bench 2.1 og 62.1 på SWE-bench Pro ifølge tredjepartsrapportering baseret på Z.ai's modèlevalueringsmaterialer.
Men disse tal bør forblive GLM-5.2-benchmarks, ikke tilskrives GLM-5.3.
GLM-5.3 vs Mythos 5
Dette er i øjeblikket den mest meningsfulde benchmark-sammenligning.
| Benchmark | GLM-5.3 | Mythos 5 | Forskel |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Resultatet giver en nuanceret konklusion.
GLM-5.3 vinder på sårbarhedsidentifikation.
Men:
Mythos 5 er fortsat væsentligt stærkere i udvikling af exploits.
Derfor ville det være en unøjagtig tolkning af de tilgængelige data at sige "GLM-5.3 slår Mythos 5".
En bedre beskrivelse er:
GLM-5.3 når Mythos-5-niveau i sårbarhedsopdagelse, men ligger stadig bagefter i udvikling af exploits.