TL;DR Z.ai lancerede GLM-5.3 den 14. august 2026 på præcis samme ~743–753B-parameter Mixture-of-Experts-basismodel som GLM-5.2. Alle gevinster kom fra skaleret eftertræning i langtidshorisont-miljøer. Resultatet er en ~50% relativ forbedring på Z.ai’s interne Code Bench, open-source SOTA på Terminal-Bench 3.0 (4,6 → 28,3) og Agents’ Last Exam, markant bedre agentiske resultater samt emergent førende cybersikkerhedsydelse (CyberGym 84,5%). Tokeneffektiviteten blev også forbedret.
Vægtene forventes cirka to uger efter lancering, efter sikkerhedshærdning. Udviklere kan allerede tilgå relaterede GLM-modeller og teste workflows effektivt via samlede platforme som CometAPI.
Nøglepointer
- Samme basismodel som GLM-5.2; alle fremskridt fra eftertræning (IndexShare, SAO, slime-framework + flere miljøer og compute).
- Kodning: Terminal-Bench 3.0 4,6 → 28,3; DeepSWE v1.1 46,2 → 66,9; intern Z.ai Code Bench ~50% bedre med færre outputtokens.
- Agentik: AutomationBench 26,2 → 48,2; Agents’ Last Exam 23,8 → 28,5; GDPval-AA v2 1508 → 1769.
- Cyber: CyberGym 77,2 → 84,5 (SOTA, foran Mythos 5 og GPT-5.6 Sol); ExploitBench mere end fordoblet (24,4 → 54,4). Fund i virkeligheden: 2.436 sårbarheder på tværs af 269 projekter.
- Specifikationer uændrede i kernearkitekturen: 1M kontekst, op til 128K outputtokens, altid aktiveret tænkning med low/high/max effort.
- Adgang: Live via GLM Coding Plan og ZCode; generel API og åbne vægte (forventet MIT-lignende) kommer efter sikkerhedsreview. CometAPI tilbyder bekvem, OpenAI-kompatibel adgang til GLM-familien for side-by-side-test og produktionsrouting.
GLM-5.3 vs GLM-5.2 i overblik
| Dimension | GLM-5.3 | GLM-5.2 | Vinder / Noter |
|---|---|---|---|
| Basismodel | Samme ~743–753B MoE | Samme | Identisk |
| Eftertræning | Kraftigt skalerede miljøer | Tidligere stack | 5.3 |
| Terminal-Bench 3.0 | 28,3 | 4,6 | 5.3 (stor) |
| DeepSWE v1.1 | 66,9 | 46,2 | 5.3 |
| Intern Code Bench (Max) | 34,5% @ ~75K tokens | 23,4% @ ~96K tokens | 5.3 (ydeevne + effektivitet) |
| Agents’ Last Exam | 28,5 | 23,8 | 5.3 |
| AutomationBench | 48,2 | 26,2 | 5.3 |
| CyberGym | 84,5 (SOTA) | 77,2 | 5.3 |
| ExploitBench | 54,4 | 24,4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| Kontekst / Max output | 1M / 128K | 1M / lignende | Samme |
| Tænkning | Altid aktiveret (low/high/max) | Tidligere mere fleksibel | 5.3 (altid aktiveret) |
| Åbne vægte | ~2 uger post-launch (planlagt) | Tilgængelige (MIT) | 5.2 aktuelt |
| Primær adgang nu | Coding Plan / ZCode | API + vægte + Coding Plan | 5.2 mere moden |
Introduktion: Eftertræning leverer et generationsspring
I midten af august 2026 så AI-fællesskabet endnu en hurtig iteration i open-weights-kapløbet. Z.ai (det internationale ansigt for det tidligere Zhipu AI / ChatGLM-team) lancerede GLM-5.3 blot 59 dage efter GLM-5.2. Annonceringen var usædvanligt tydelig: den underliggende basismodel forblev identisk. “Scaling post-training is all we did for GLM-5.3,” udtalte virksomheden.
Det udsagn er vigtigt. I årevis har den dominerende fortælling været “større modeller vinder.” GLM-5.3 viser, at aggressiv skalering af reinforcement learning-miljøer, diversitet i langtidshorisont-opgaver og systeminfrastruktur kan give uforholdsmæssigt store gevinster på svære kode-, agentiske og endda cybersikkerhedsopgaver uden et nyt pretraining-run. Tallene er så store på flere vanskelige benchmarks, at uafhængige observatører har beskrevet springet som kvalitativt anderledes snarere end inkrementelt. Overblik over GLM-5.3-funktioner, benchmarks og adgangsnoter.
GLM-5.3 vs GLM-5.2: Hvad ændrede sig egentlig?
Den største misforståelse ville være at tro, at GLM-5.3 blot er “GLM-5.2 men større.”
Det er den ikke.
Basismodellen er ifølge Z.ai i det væsentlige den samme. Den store innovation er skaleret eftertræning. Z.ai fremhæver tre søjler:
- Systemforbedringer i slime — Bedre træning
- Miljøskalering — Pipelines, der syntetiserer eksekverbare, verificerbare langtidshorisont-miljøer fra reelle professionelle workflows. Forskningsagenter udtrækker opgavemønstre; dommeragenter verificerer løsbarhed; verifikatorer bygges uden adgang til referencesolutioner for at reducere reward hacking.
- Fortsat brug af SAO + kompaktion — Hjælper med at fastholde gevinster på lange forløb fremfor at kollapse på korte. – rollout-konsistens (log-prob-forskelle kontrolleret til ~1e-7), hierarkisk caching, multi-teacher-understøttelse, workload-bevidst planlægning og rapporteret >2,3× end-to-end throughput-gevinster på langtidshorisont-kode-RL-opgaver.
Disse ændringer gav målbare forbedringer på tværs af kode-, agentik- og cybersikkerhedssuiter. Vigtigt er det, at de største relative gevinster ses på de hårdeste, lavt-baseline tests—præcis det mønster, man forventer, når en model skubbes ind i regimer, den tidligere ikke kunne håndtere pålideligt.
Resultatet er en modelopgradering, der primært handler om adfærd og kapabilitet snarere end blot arkitektur.
GLM-5.3 vs GLM-5.2: Funktionssammenligning
1. Skaleret eftertræning i stedet for en ny basismodel
Z.ai beskriver skaleret eftertræning som hele opskriften for GLM-5.3. Forskningsagenter omdanner mønstre fra rigtigt arbejde til kørbare opgaver med skjult tilstand og multi-trin-afhængigheder. En dommeragent verificerer, at hver opgave er løsbar. Verifikatorer skabes uden at se referencesolutionen og testes mod oracle-, no-op- og uløste tilstande for at reducere reward-genveje.
Systemet kræver stadig menneskelig review, og Z.ai siger eksplicit, at mere autonom miljøgenerering og -verifikation forbliver fremtidigt arbejde. Den indrømmelse øger troværdigheden af påstanden: dette er en stor træningspipeline, ikke en påstand om, at syntetiske miljøer er blevet fuldt selvstyrende.
2. Stærkere langtidshorisont-kodning
GLM-5.3 er bedre til repository-arbejde, terminalopgaver, maskinlæringsinfrastruktur, performanceoptimering og multi-trins softwarelevering. På Z.ai Code Bench, den private interne evaluering tiltænkt at afspejle realistiske brugerscenarier, rapporterer Z.ai cirka 50% bedre kodepræstation end GLM-5.2.
Effektiviteten er lige så vigtig som scoren. Ved Max effort opnåede GLM-5.3 34,5% ved cirka 75K outputtokens per opgave mod GLM-5.2’s 23,4% ved 96K. Det er en kvalitetsforbedring på 11,1 point, mens der produceres omtrent 22% færre outputtokens. Ved High effort nåede GLM-5.3 31,4% med cirka 50K tokens, foran Claude Opus 4.8 på 29,5% med 120K i samme førstepartsdiagram. Claude Fable 5 forblev højere med 39,5% under Max effort.
3. Emergent cybersikkerhedskapabilitet
Z.ai tilføjede sårbarhedsfindende miljøer under eftertræning. Ifølge lanceringsrapporten voksede kapabiliteten ud over at finde isolerede fejl: modellen begyndte at ræsonnere på tværs af flere stadier i en udnyttelseskæde.
De offentlige scorer viser både fremskridt og grænser. GLM-5.3 fører Z.ai’s sammenligningstabel på CyberGym med 84,5 mod 77,2 for GLM-5.2. På ExploitBench mere end fordobler den GLM-5.2 og når 54,4 mod 24,4, men ligger fortsat et stykke efter Fable 5 på 78,0 og GPT-5.6 Sol på 76,5. På ExploitGym fuldfører den 105 opgaver i et normaliseret to-timers budget og 130 på seks timer, sammenlignet med 29 og 39 for GLM-5.2; GPT-5.6 Sol og Fable 5 er fortsat markant foran.
Disse kapabiliteter er dobbeltanvendelige. Organisationer bør begrænse modeladgang, sandboxe værktøjer, logge handlinger, kræve autorisation for scanning og have et menneske i loopet til validering og offentliggørelse af sårbarheder.
4. Altid aktiveret ræsonnering med tre indsatsniveauer
GLM-5.3 understøtter low, high og max reasoning effort. I modsætning til GLM-5.2 understøtter den ikke deaktiveret tænkning. Eksisterende integrationer, der sender thinking.type: "disabled", skal ændre værdien til enabled før skift af model-ID, ellers siger Z.ai, at forespørgslen fejler.
Brug low til interaktive ændringer og lavrisiko-transformationer, high til substantielle repository-opgaver og max til svær kodning eller sikkerhedsanalyse. Højere indsats bør vurderes for latenstid og omkostninger, da et stærkere svar ikke automatisk er det mest økonomiske.
5. Bedre trænings-throughput via slime
GLM-5.3 fortsætter med at bruge slime, Z.ai’s open-source-framework med Megatron på træningssiden og SGLang på rollout-siden. Z.ai rapporterer tilføjelser til top-p-maskering, top-k og fuld-ordforråds on-policy-destillation, lærer-skift, caching og strammere numerisk alignment mellem træning og rollout. Lanceringsrapporten siger, at gennemsnitlige log-sandsynlighedsforskelle blev kontrolleret på 1e-7-niveau, mere end 99,99% lavere end tidligere opsætninger.
Arbejdsbelastningsbevidst planlægning og belastningsudligning forbedrede angiveligt end-to-end reinforcement-learning-throughput med mere end 2,3 gange på langtidshorisont-kodeopgaver. Dette er træningsinfrastrukturforbedringer snarere end slutbruger-inferencegarantier, men de forklarer, hvordan Z.ai skalerede længere og mere varierede forløb på en måned.
6. Forsinkede åbne vægte til sikkerhedsgennemgang
Z.ai kalder GLM-5.3 en open-weights-model, men vægtene var ikke downloadbare på lanceringsdagen. Virksomheden siger, at de frigives to uger efter lancering efter sikkerhedsevaluering og -hærdning. Dette er en materiel forskel fra GLM-5.2, hvis MIT-licenserede vægte allerede ligger på Hugging Face.
For de fleste teams er hostet API-test stadig det praktiske første skridt. Modellen er stor, og åbne vægte fjerner ikke omkostningen til inference-hardware, kvantisering, serving, monitorering eller sikkerhedskontrol.
GLM-5.3 vs GLM-5.2: Benchmarkforbedringer
Tabellen nedenfor bruger Z.ai’s officielle lanceringsdata. “Change” er en simpel beregning fra de rapporterede scorer. Relative procenter kan se dramatiske ud, når GLM-5.2-baselinen er lav, så den absolutte ændring vises også.
| Benchmark | GLM-5.2 | GLM-5.3 | Absolut ændring | Relativ ændring |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81,0 | 88,2 | +7,2 | +8,9% |
| Terminal-Bench 3.0 | 4,6 | 28,3 | +23,7 | +515,2% |
| DeepSWE v1.1 | 46,2 | 66,9 | +20,7 | +44,8% |
| NL2Repo | 48,9 | 58,0 | +9,1 | +18,6% |
| ProgramBench Almost Solved | 9,5 | 19,0 | +9,5 | +100,0% |
| FrontierSWE | 67,5 | 78,1 | +10,6 | +15,7% |
| SWE-Marathon v1.1 | 19,4 | 42,5 | +23,1 | +119,1% |
| PostTrainBench | 31,7 | 39,8 | +8,1 | +25,6% |
| CyberGym | 77,2 | 84,5 | +7,3 | +9,5% |
| ExploitBench | 24,4 | 54,4 | +30,0 | +123,0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262,1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233,3% |
| Toolathlon Verified | 59,9 | 73,0 | +13,1 | +21,9% |
| AutomationBench v1.0.6 | 26,2 | 48,2 | +22,0 | +84,0% |
| Agents' Last Exam CLI | 23,8 | 28,5 | +4,7 | +19,7% |
| HLE with tools | 54,7 | 62,5 | +7,8 | +14,3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17,3% |
Benchmarkforbedringer: GLM-5.3 vs GLM-5.2 og konkurrenter
Alle tal nedenfor er leverandørrapporterede fra den officielle Z.ai-blog (med metodologienoter om harnesses, kontekstlængder og sampling). Uafhængig verifikation følger, når vægte og bredere adgang er tilgængelig.
Kode-benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Noter / konkurrenter |
|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | 81,0 | Konkurrencedygtig med top lukkede modeller |
| Terminal Bench 3.0 | 28,3 | 4,6 | Open-source SOTA; vs Fable 5 ~33,7, GPT-5.6 Sol ~34,6 |
| DeepSWE v1.1 | 66,9 | 46,2 | Stort spring |
| NL2Repo | 58,0 | 48,9 | — |
| ProgramBench Almost Solved | 19,0 | 9,5 | — |
| FrontierSWE | 78,1 | 67,5 | — |
| SWE-Marathon v1.1 | 42,5 | 19,4 | — |
| Z.ai Code Bench (intern, Max effort) | ~34,5% completion @ ~75K tokens | ~23,4% @ ~96K tokens | ~50% samlet forbedring i coding feel; højere effektivitet |
Ved High effort nåede GLM-5.3 31,4% completion med ~50K tokens, og overgik Claude Opus 4.8 (29,5% med 120K tokens) på den interne bench, men lå stadig efter Claude Fable 5 (39,5% ved Max).
Cybersikkerheds-benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Konkurrenter (cirka) |
|---|---|---|---|
| CyberGym | 84,5% | 77,2% | Mythos 5: 83,8%, GPT-5.6 Sol: 83,6% (SOTA) |
| ExploitBench | 54,4% | 24,4% | Mere end fordobler tidligere; lukkede modeller højere (Mythos 5 ~78%, GPT-5.6 Sol ~76,5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 stadig foran (181/247) |
Gevinsterne er størst længere oppe i udnyttelseskæden. I test i virkeligheden med kinesiske sikkerhedsteams identificerede modellen (med afsæt i GLM-5.2-arbejde) 2.436 sårbarheder på tværs af 269 projekter, inklusive 1.097 middel-til-høj alvorlige issues. Nogle fejl går ~40 år tilbage (ældste ~1981). Fund spores i den offentlige Z.ai Security Disclosure Ledger.
Agentik og andre benchmarks
| Benchmark | GLM-5.3 | GLM-5.2 | Noter |
|---|---|---|---|
| Toolathlon Verified | 73,0 | 59,9 | — |
| AutomationBench v1.0.6 | 48,2 | 26,2 | Stor gevinst |
| Agents’ Last Exam (ALE-CLI) | 28,5 | 23,8 | Open-source konkurrencedygtig |
| HLE w/ Tools | 62,5 | 54,7 | — |
| GDPval-AA v2 | 1769 | 1508 | Dækker 44 professioner |
Disse resultater demonstrerer klare fremskridt på langtidshorisont, multi-trins professionelle opgaver.
Tokeneffektivitet, tænkemåder og praktisk adfærd
En stille, men vigtig forbedring er tokeneffektivitet. På den interne Code Bench kommer højere completion rates med færre outputtokens. Det er vigtigt for omkostning og latenstid i produktionsagent-loops.
GLM-5.3 aktiverer altid tænkning. Tre indsatsniveauer understøttes: low, high og max (standard og anbefalet til kodning er max). Deaktivering af tænkning understøttes ikke længere; applikationer, der tidligere satte thinking.type: "disabled", skal migrere.
Konteksten er stadig solide 1M tokens med maksimum output op til 128K. Arkitekturen er uændret fra GLM-5.2, så hardwaredimensionering for fremtidig self-hosting kan estimeres ud fra eksisterende GLM-5.2-erfaring (kvantiserede fodaftryk er stadig store givet det samlede parameterantal).
For udviklere, der vil eksperimentere straks eller bevare fleksibilitet på tværs af modeller, er samlede gateways nyttige. CometAPI lister GLM-seriens modeller (inklusive GLM-5.3 under model-ID’et glm-5.3, efterhånden som den bliver tilgængelig) med OpenAI-kompatible endpoints, konkurrencedygtige priser, forbrugsbaseret afregning og mulighed for at skifte mellem GLM-5.2, GLM-5.3 og adskillige andre frontier- og open-modeller uden at omskrive integrationskode. Dette er særligt praktisk til A/B-test af kodeagenter, måling af reel pris pr. succesfuld opgave og routing af trafik baseret på arbejdsbelastning.
Hvem bør skifte til GLM-5.3, og hvordan evaluerer man?
Teams, der bygger kodeagenter, langtidshorisont-automatisering, repository-skala engineering-workflows eller defensiv sikkerhedsværktøjskæde, bør prioritere evaluering. Kombinationen af højere completion rates, bedre tokeneffektivitet på komplekse opgaver og stærkere multi-trins agentik er væsentlig.
Anbefalet evalueringssti:
- Kør de samme interne opgaver (eller et fast harness) på GLM-5.2 og GLM-5.3 (eller via Coding Plan) på matchede indsatsniveauer.
- Mål ikke kun pass rate, men også tokens, wall-clock-tid og menneskelig interventionsrate.
- Brug et samlet API-lag som CometAPI for at holde sammenligningen friktionsfri og bevare muligheden for fallback eller selektiv routing.
- For sikkerhedsfølsomme workloads: vent på de fuldt sikkerhedshærdede åbne vægte og gennemgå disclosure-praksisser.
Self-hosting bliver attraktivt, når vægtene frigives, især for organisationer der allerede kører GLM-5.2-infrastruktur.
Konklusion: Eftertræning som den nye skaleringsfrontier
GLM-5.3 er en af de klareste nylige demonstrationer af, at skala i eftertræning—mere realistiske miljøer, bedre RL-infrastruktur og vedvarende compute på lange forløb—kan skabe kapabilitetsspring, som tidligere syntes at kræve nye basismodeller. Kode- og agentikgevinsterne er store; cyberresultaterne var i høj grad emergente og allerede konkurrencedygtige eller førende på opdagelsesorienterede benchmarks.
For praktikere er den praktiske lære ligetil: test modellen på jeres faktiske workloads, mål pris pr. succesfuldt udfald frem for rå leaderboard-position, og hold integrationen fleksibel. Platforme som CometAPI forenkler processen ved at tilbyde én nøgle, OpenAI-kompatibel grænseflade og let skift på tværs af GLM-serien og konkurrerende modeller, mens I beslutter, hvor aggressivt I vil adoptere de nye kapabiliteter.
