DeepSeek Vision and Grok Imagine models are now live on CometAPI →
ai-comparisons/CometAPI research

GLM-5.3 vs GLM-5.2: Benchmarks og tests fortæller os, hvad der har ændret sig

GLM-5.3 vs GLM-5.2: Samme basismodel, udelukkende eftertræning giver ~50% løft i kodning (Terminal-Bench 3.0 4.6→28.3) & emergent CyberGym 84.5% SOTA.

CometAPI
AnnaForskningshold for AI-modeller og API
Opdateret Aug 23, 2026 12 min. læsning
GLM-5.3 vs GLM-5.2: Benchmarks og tests fortæller os, hvad der har ændret sig
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Z.ai lancerede GLM-5.3 den 14. august 2026 på præcis samme ~743–753B-parameter Mixture-of-Experts-basismodel som GLM-5.2. Alle gevinster kom fra skaleret eftertræning i langtidshorisont-miljøer. Resultatet er en ~50% relativ forbedring på Z.ai’s interne Code Bench, open-source SOTA på Terminal-Bench 3.0 (4,6 → 28,3) og Agents’ Last Exam, markant bedre agentiske resultater samt emergent førende cybersikkerhedsydelse (CyberGym 84,5%). Tokeneffektiviteten blev også forbedret.

Vægtene forventes cirka to uger efter lancering, efter sikkerhedshærdning. Udviklere kan allerede tilgå relaterede GLM-modeller og teste workflows effektivt via samlede platforme som CometAPI.

Nøglepointer

  • Samme basismodel som GLM-5.2; alle fremskridt fra eftertræning (IndexShare, SAO, slime-framework + flere miljøer og compute).
  • Kodning: Terminal-Bench 3.0 4,6 → 28,3; DeepSWE v1.1 46,2 → 66,9; intern Z.ai Code Bench ~50% bedre med færre outputtokens.
  • Agentik: AutomationBench 26,2 → 48,2; Agents’ Last Exam 23,8 → 28,5; GDPval-AA v2 1508 → 1769.
  • Cyber: CyberGym 77,2 → 84,5 (SOTA, foran Mythos 5 og GPT-5.6 Sol); ExploitBench mere end fordoblet (24,4 → 54,4). Fund i virkeligheden: 2.436 sårbarheder på tværs af 269 projekter.
  • Specifikationer uændrede i kernearkitekturen: 1M kontekst, op til 128K outputtokens, altid aktiveret tænkning med low/high/max effort.
  • Adgang: Live via GLM Coding Plan og ZCode; generel API og åbne vægte (forventet MIT-lignende) kommer efter sikkerhedsreview. CometAPI tilbyder bekvem, OpenAI-kompatibel adgang til GLM-familien for side-by-side-test og produktionsrouting.

GLM-5.3 vs GLM-5.2 i overblik

DimensionGLM-5.3GLM-5.2Vinder / Noter
BasismodelSamme ~743–753B MoESammeIdentisk
EftertræningKraftigt skalerede miljøerTidligere stack5.3
Terminal-Bench 3.028,34,65.3 (stor)
DeepSWE v1.166,946,25.3
Intern Code Bench (Max)34,5% @ ~75K tokens23,4% @ ~96K tokens5.3 (ydeevne + effektivitet)
Agents’ Last Exam28,523,85.3
AutomationBench48,226,25.3
CyberGym84,5 (SOTA)77,25.3
ExploitBench54,424,45.3
GDPval-AA v2176915085.3
Kontekst / Max output1M / 128K1M / lignendeSamme
TænkningAltid aktiveret (low/high/max)Tidligere mere fleksibel5.3 (altid aktiveret)
Åbne vægte~2 uger post-launch (planlagt)Tilgængelige (MIT)5.2 aktuelt
Primær adgang nuCoding Plan / ZCodeAPI + vægte + Coding Plan5.2 mere moden

Introduktion: Eftertræning leverer et generationsspring

I midten af august 2026 så AI-fællesskabet endnu en hurtig iteration i open-weights-kapløbet. Z.ai (det internationale ansigt for det tidligere Zhipu AI / ChatGLM-team) lancerede GLM-5.3 blot 59 dage efter GLM-5.2. Annonceringen var usædvanligt tydelig: den underliggende basismodel forblev identisk. “Scaling post-training is all we did for GLM-5.3,” udtalte virksomheden.

Det udsagn er vigtigt. I årevis har den dominerende fortælling været “større modeller vinder.” GLM-5.3 viser, at aggressiv skalering af reinforcement learning-miljøer, diversitet i langtidshorisont-opgaver og systeminfrastruktur kan give uforholdsmæssigt store gevinster på svære kode-, agentiske og endda cybersikkerhedsopgaver uden et nyt pretraining-run. Tallene er så store på flere vanskelige benchmarks, at uafhængige observatører har beskrevet springet som kvalitativt anderledes snarere end inkrementelt. Overblik over GLM-5.3-funktioner, benchmarks og adgangsnoter.

GLM-5.3 vs GLM-5.2: Hvad ændrede sig egentlig?

Den største misforståelse ville være at tro, at GLM-5.3 blot er “GLM-5.2 men større.”

Det er den ikke.

Basismodellen er ifølge Z.ai i det væsentlige den samme. Den store innovation er skaleret eftertræning. Z.ai fremhæver tre søjler:

  1. Systemforbedringer i slime — Bedre træning
  2. Miljøskalering — Pipelines, der syntetiserer eksekverbare, verificerbare langtidshorisont-miljøer fra reelle professionelle workflows. Forskningsagenter udtrækker opgavemønstre; dommeragenter verificerer løsbarhed; verifikatorer bygges uden adgang til referencesolutioner for at reducere reward hacking.
  3. Fortsat brug af SAO + kompaktion — Hjælper med at fastholde gevinster på lange forløb fremfor at kollapse på korte. – rollout-konsistens (log-prob-forskelle kontrolleret til ~1e-7), hierarkisk caching, multi-teacher-understøttelse, workload-bevidst planlægning og rapporteret >2,3× end-to-end throughput-gevinster på langtidshorisont-kode-RL-opgaver.

Disse ændringer gav målbare forbedringer på tværs af kode-, agentik- og cybersikkerhedssuiter. Vigtigt er det, at de største relative gevinster ses på de hårdeste, lavt-baseline tests—præcis det mønster, man forventer, når en model skubbes ind i regimer, den tidligere ikke kunne håndtere pålideligt.

Resultatet er en modelopgradering, der primært handler om adfærd og kapabilitet snarere end blot arkitektur.

GLM-5.3 vs GLM-5.2: Funktionssammenligning

1. Skaleret eftertræning i stedet for en ny basismodel

Z.ai beskriver skaleret eftertræning som hele opskriften for GLM-5.3. Forskningsagenter omdanner mønstre fra rigtigt arbejde til kørbare opgaver med skjult tilstand og multi-trin-afhængigheder. En dommeragent verificerer, at hver opgave er løsbar. Verifikatorer skabes uden at se referencesolutionen og testes mod oracle-, no-op- og uløste tilstande for at reducere reward-genveje.

Systemet kræver stadig menneskelig review, og Z.ai siger eksplicit, at mere autonom miljøgenerering og -verifikation forbliver fremtidigt arbejde. Den indrømmelse øger troværdigheden af påstanden: dette er en stor træningspipeline, ikke en påstand om, at syntetiske miljøer er blevet fuldt selvstyrende.

2. Stærkere langtidshorisont-kodning

GLM-5.3 er bedre til repository-arbejde, terminalopgaver, maskinlæringsinfrastruktur, performanceoptimering og multi-trins softwarelevering. På Z.ai Code Bench, den private interne evaluering tiltænkt at afspejle realistiske brugerscenarier, rapporterer Z.ai cirka 50% bedre kodepræstation end GLM-5.2.

Effektiviteten er lige så vigtig som scoren. Ved Max effort opnåede GLM-5.3 34,5% ved cirka 75K outputtokens per opgave mod GLM-5.2’s 23,4% ved 96K. Det er en kvalitetsforbedring på 11,1 point, mens der produceres omtrent 22% færre outputtokens. Ved High effort nåede GLM-5.3 31,4% med cirka 50K tokens, foran Claude Opus 4.8 på 29,5% med 120K i samme førstepartsdiagram. Claude Fable 5 forblev højere med 39,5% under Max effort.

3. Emergent cybersikkerhedskapabilitet

Z.ai tilføjede sårbarhedsfindende miljøer under eftertræning. Ifølge lanceringsrapporten voksede kapabiliteten ud over at finde isolerede fejl: modellen begyndte at ræsonnere på tværs af flere stadier i en udnyttelseskæde.

De offentlige scorer viser både fremskridt og grænser. GLM-5.3 fører Z.ai’s sammenligningstabel på CyberGym med 84,5 mod 77,2 for GLM-5.2. På ExploitBench mere end fordobler den GLM-5.2 og når 54,4 mod 24,4, men ligger fortsat et stykke efter Fable 5 på 78,0 og GPT-5.6 Sol på 76,5. På ExploitGym fuldfører den 105 opgaver i et normaliseret to-timers budget og 130 på seks timer, sammenlignet med 29 og 39 for GLM-5.2; GPT-5.6 Sol og Fable 5 er fortsat markant foran.

Disse kapabiliteter er dobbeltanvendelige. Organisationer bør begrænse modeladgang, sandboxe værktøjer, logge handlinger, kræve autorisation for scanning og have et menneske i loopet til validering og offentliggørelse af sårbarheder.

4. Altid aktiveret ræsonnering med tre indsatsniveauer

GLM-5.3 understøtter low, high og max reasoning effort. I modsætning til GLM-5.2 understøtter den ikke deaktiveret tænkning. Eksisterende integrationer, der sender thinking.type: "disabled", skal ændre værdien til enabled før skift af model-ID, ellers siger Z.ai, at forespørgslen fejler.

Brug low til interaktive ændringer og lavrisiko-transformationer, high til substantielle repository-opgaver og max til svær kodning eller sikkerhedsanalyse. Højere indsats bør vurderes for latenstid og omkostninger, da et stærkere svar ikke automatisk er det mest økonomiske.

5. Bedre trænings-throughput via slime

GLM-5.3 fortsætter med at bruge slime, Z.ai’s open-source-framework med Megatron på træningssiden og SGLang på rollout-siden. Z.ai rapporterer tilføjelser til top-p-maskering, top-k og fuld-ordforråds on-policy-destillation, lærer-skift, caching og strammere numerisk alignment mellem træning og rollout. Lanceringsrapporten siger, at gennemsnitlige log-sandsynlighedsforskelle blev kontrolleret på 1e-7-niveau, mere end 99,99% lavere end tidligere opsætninger.

Arbejdsbelastningsbevidst planlægning og belastningsudligning forbedrede angiveligt end-to-end reinforcement-learning-throughput med mere end 2,3 gange på langtidshorisont-kodeopgaver. Dette er træningsinfrastrukturforbedringer snarere end slutbruger-inferencegarantier, men de forklarer, hvordan Z.ai skalerede længere og mere varierede forløb på en måned.

6. Forsinkede åbne vægte til sikkerhedsgennemgang

Z.ai kalder GLM-5.3 en open-weights-model, men vægtene var ikke downloadbare på lanceringsdagen. Virksomheden siger, at de frigives to uger efter lancering efter sikkerhedsevaluering og -hærdning. Dette er en materiel forskel fra GLM-5.2, hvis MIT-licenserede vægte allerede ligger på Hugging Face.

For de fleste teams er hostet API-test stadig det praktiske første skridt. Modellen er stor, og åbne vægte fjerner ikke omkostningen til inference-hardware, kvantisering, serving, monitorering eller sikkerhedskontrol.

GLM-5.3 vs GLM-5.2: Benchmarkforbedringer

Tabellen nedenfor bruger Z.ai’s officielle lanceringsdata. “Change” er en simpel beregning fra de rapporterede scorer. Relative procenter kan se dramatiske ud, når GLM-5.2-baselinen er lav, så den absolutte ændring vises også.

BenchmarkGLM-5.2GLM-5.3Absolut ændringRelativ ændring
Terminal-Bench 2.181,088,2+7,2+8,9%
Terminal-Bench 3.04,628,3+23,7+515,2%
DeepSWE v1.146,266,9+20,7+44,8%
NL2Repo48,958,0+9,1+18,6%
ProgramBench Almost Solved9,519,0+9,5+100,0%
FrontierSWE67,578,1+10,6+15,7%
SWE-Marathon v1.119,442,5+23,1+119,1%
PostTrainBench31,739,8+8,1+25,6%
CyberGym77,284,5+7,3+9,5%
ExploitBench24,454,4+30,0+123,0%
ExploitGym, 2-hour tasks29105+76+262,1%
ExploitGym, 6-hour tasks39130+91+233,3%
Toolathlon Verified59,973,0+13,1+21,9%
AutomationBench v1.0.626,248,2+22,0+84,0%
Agents' Last Exam CLI23,828,5+4,7+19,7%
HLE with tools54,762,5+7,8+14,3%
GDPval-AA v2, Elo15081769+261+17,3%

Benchmarkforbedringer: GLM-5.3 vs GLM-5.2 og konkurrenter

Alle tal nedenfor er leverandørrapporterede fra den officielle Z.ai-blog (med metodologienoter om harnesses, kontekstlængder og sampling). Uafhængig verifikation følger, når vægte og bredere adgang er tilgængelig.

Kode-benchmarks

BenchmarkGLM-5.3GLM-5.2Noter / konkurrenter
Terminal Bench 2.188,281,0Konkurrencedygtig med top lukkede modeller
Terminal Bench 3.028,34,6Open-source SOTA; vs Fable 5 ~33,7, GPT-5.6 Sol ~34,6
DeepSWE v1.166,946,2Stort spring
NL2Repo58,048,9
ProgramBench Almost Solved19,09,5
FrontierSWE78,167,5
SWE-Marathon v1.142,519,4
Z.ai Code Bench (intern, Max effort)~34,5% completion @ ~75K tokens~23,4% @ ~96K tokens~50% samlet forbedring i coding feel; højere effektivitet

Ved High effort nåede GLM-5.3 31,4% completion med ~50K tokens, og overgik Claude Opus 4.8 (29,5% med 120K tokens) på den interne bench, men lå stadig efter Claude Fable 5 (39,5% ved Max).

Cybersikkerheds-benchmarks

BenchmarkGLM-5.3GLM-5.2Konkurrenter (cirka)
CyberGym84,5%77,2%Mythos 5: 83,8%, GPT-5.6 Sol: 83,6% (SOTA)
ExploitBench54,4%24,4%Mere end fordobler tidligere; lukkede modeller højere (Mythos 5 ~78%, GPT-5.6 Sol ~76,5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 stadig foran (181/247)

Gevinsterne er størst længere oppe i udnyttelseskæden. I test i virkeligheden med kinesiske sikkerhedsteams identificerede modellen (med afsæt i GLM-5.2-arbejde) 2.436 sårbarheder på tværs af 269 projekter, inklusive 1.097 middel-til-høj alvorlige issues. Nogle fejl går ~40 år tilbage (ældste ~1981). Fund spores i den offentlige Z.ai Security Disclosure Ledger.

Agentik og andre benchmarks

BenchmarkGLM-5.3GLM-5.2Noter
Toolathlon Verified73,059,9
AutomationBench v1.0.648,226,2Stor gevinst
Agents’ Last Exam (ALE-CLI)28,523,8Open-source konkurrencedygtig
HLE w/ Tools62,554,7
GDPval-AA v217691508Dækker 44 professioner

Disse resultater demonstrerer klare fremskridt på langtidshorisont, multi-trins professionelle opgaver.

Tokeneffektivitet, tænkemåder og praktisk adfærd

En stille, men vigtig forbedring er tokeneffektivitet. På den interne Code Bench kommer højere completion rates med færre outputtokens. Det er vigtigt for omkostning og latenstid i produktionsagent-loops.

GLM-5.3 aktiverer altid tænkning. Tre indsatsniveauer understøttes: low, high og max (standard og anbefalet til kodning er max). Deaktivering af tænkning understøttes ikke længere; applikationer, der tidligere satte thinking.type: "disabled", skal migrere.

Konteksten er stadig solide 1M tokens med maksimum output op til 128K. Arkitekturen er uændret fra GLM-5.2, så hardwaredimensionering for fremtidig self-hosting kan estimeres ud fra eksisterende GLM-5.2-erfaring (kvantiserede fodaftryk er stadig store givet det samlede parameterantal).

For udviklere, der vil eksperimentere straks eller bevare fleksibilitet på tværs af modeller, er samlede gateways nyttige. CometAPI lister GLM-seriens modeller (inklusive GLM-5.3 under model-ID’et glm-5.3, efterhånden som den bliver tilgængelig) med OpenAI-kompatible endpoints, konkurrencedygtige priser, forbrugsbaseret afregning og mulighed for at skifte mellem GLM-5.2, GLM-5.3 og adskillige andre frontier- og open-modeller uden at omskrive integrationskode. Dette er særligt praktisk til A/B-test af kodeagenter, måling af reel pris pr. succesfuld opgave og routing af trafik baseret på arbejdsbelastning.

Hvem bør skifte til GLM-5.3, og hvordan evaluerer man?

Teams, der bygger kodeagenter, langtidshorisont-automatisering, repository-skala engineering-workflows eller defensiv sikkerhedsværktøjskæde, bør prioritere evaluering. Kombinationen af højere completion rates, bedre tokeneffektivitet på komplekse opgaver og stærkere multi-trins agentik er væsentlig.

Anbefalet evalueringssti:

  1. Kør de samme interne opgaver (eller et fast harness) på GLM-5.2 og GLM-5.3 (eller via Coding Plan) på matchede indsatsniveauer.
  2. Mål ikke kun pass rate, men også tokens, wall-clock-tid og menneskelig interventionsrate.
  3. Brug et samlet API-lag som CometAPI for at holde sammenligningen friktionsfri og bevare muligheden for fallback eller selektiv routing.
  4. For sikkerhedsfølsomme workloads: vent på de fuldt sikkerhedshærdede åbne vægte og gennemgå disclosure-praksisser.

Self-hosting bliver attraktivt, når vægtene frigives, især for organisationer der allerede kører GLM-5.2-infrastruktur.

Konklusion: Eftertræning som den nye skaleringsfrontier

GLM-5.3 er en af de klareste nylige demonstrationer af, at skala i eftertræning—mere realistiske miljøer, bedre RL-infrastruktur og vedvarende compute på lange forløb—kan skabe kapabilitetsspring, som tidligere syntes at kræve nye basismodeller. Kode- og agentikgevinsterne er store; cyberresultaterne var i høj grad emergente og allerede konkurrencedygtige eller førende på opdagelsesorienterede benchmarks.

For praktikere er den praktiske lære ligetil: test modellen på jeres faktiske workloads, mål pris pr. succesfuldt udfald frem for rå leaderboard-position, og hold integrationen fleksibel. Platforme som CometAPI forenkler processen ved at tilbyde én nøgle, OpenAI-kompatibel grænseflade og let skift på tværs af GLM-serien og konkurrerende modeller, mens I beslutter, hvor aggressivt I vil adoptere de nye kapabiliteter.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Aug 15, 2026
Sidst opdateret Aug 23, 2026
188 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Klar til at skære AI-udviklingsomkostninger med 20%?

Kom gratis i gang på få minutter. Gratis prøvekreditter inkluderet. Intet kreditkort påkrævet.

Læs mere