DeepSeek Vision and Grok Imagine models are now live on CometAPI →
ai-comparisons/CometAPI-forskning

GLM-5.3 vs GLM-5.2: Benchmarking og testing forteller oss hva som har endret seg

GLM-5.3 vs GLM-5.2: Samme grunnmodell, ren ettertrening gir ~50% løft i koding (Terminal-Bench 3.0 4.6→28.3) og emergent CyberGym 84.5% SOTA.

CometAPI
AnnaForskerteam for AI-modeller og API
Oppdatert Aug 24, 2026 12 min lesetid
GLM-5.3 vs GLM-5.2: Benchmarking og testing forteller oss hva som har endret seg
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Z.ai lanserte GLM-5.3 14. august 2026, på nøyaktig den samme ~743–753B-parameter Mixture-of-Experts-grunnmodellen som GLM-5.2. Alle forbedringer kom fra skalert ettertrening i lang-horisont-miljøer. Resultatet er ~50% relativ forbedring på Z.ais interne Code Bench, åpen-kilde SOTA på Terminal-Bench 3.0 (4.6 → 28.3) og Agents’ Last Exam, dramatisk bedre agentiske resultater, og fremvoksende topp moderne cybersikkerhetsytelse (CyberGym 84.5%). Token-effektivitet ble også forbedret.

Vektene forventes omtrent to uker etter lansering, etter sikkerhetsherding. Utviklere kan allerede få tilgang til relaterte GLM-modeller og teste arbeidsflyter effektivt via samlete plattformer som CometAPI.

Nøkkelpunkter

  • Samme grunnmodell som GLM-5.2; alle fremskritt fra ettertrening (IndexShare, SAO, slime-rammeverk + flere miljøer og mer compute).
  • Koding: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; intern Z.ai Code Bench ~50% bedre med færre utgående tokens.
  • Agentisk: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Cyber: CyberGym 77.2 → 84.5 (SOTA, foran Mythos 5 og GPT-5.6 Sol); ExploitBench mer enn doblet (24.4 → 54.4). Funn i virkeligheten: 2 436 sårbarheter på tvers av 269 prosjekter.
  • Spesifikasjoner uendret i kjernearkitektur: 1M kontekst, opptil 128K utgående tokens, alltid-på tenkning med low/high/max effort.
  • Tilgang: Live via GLM Coding Plan og ZCode; generell API og åpne vekter (forventet MIT-lignende) kommer etter sikkerhetsgjennomgang. CometAPI tilbyr praktisk OpenAI-kompatibel tilgang til GLM-familien for side-om-side-testing og produksjonsruting.

GLM-5.3 vs GLM-5.2 i korte trekk

DimensjonGLM-5.3GLM-5.2Vinner / Merknader
GrunnmodellSamme ~743–753B MoESammeIdentisk
EttertreningKraftig skalerte miljøerTidligere stack5.3
Terminal-Bench 3.028.34.65.3 (stor)
DeepSWE v1.166.946.25.3
Intern Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (ytelse + effektivitet)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Kontekst / Maks output1M / 128K1M / liknendeSamme
TenkningAlltid på (low/high/max)Tidligere mer fleksibel5.3 (alltid-på)
Åpne vekter~2 uker etter lansering (planlagt)Tilgjengelig (MIT)5.2 for øyeblikket
Primær tilgang nåCoding Plan / ZCodeAPI + vekter + Coding Plan5.2 mer modent

Introduksjon: Ettertrening gir et sprang i generasjon

I midten av august 2026 så AI-miljøet nok en rask iterasjon i kappløpet om åpne vekter. Z.ai (den internasjonale fronten til tidligere Zhipu AI / ChatGLM-teamet) lanserte GLM-5.3 bare 59 dager etter GLM-5.2. Kunngjøringen var uvanlig tydelig: den underliggende grunnmodellen forble identisk. «Å skalere ettertrening er alt vi gjorde for GLM-5.3,» uttalte selskapet.

Det utsagnet er viktig. I årevis har det dominerende narrativet vært «større modeller vinner». GLM-5.3 viser at aggressiv skalering av forsterkningslæringsmiljøer, oppgavediversitet med lang horisont og systeminfrastruktur kan gi store gevinster på krevende kode-, agentiske og til og med cybersikkerhets-arbeidslaster uten en ny pretreningsrunde. Tallene er store nok på flere vanskelige benchmarker til at uavhengige observatører har beskrevet spranget som kvalitativt forskjellig snarere enn inkrementelt. Oversikt over GLM-5.3-funksjoner, benchmarker og tilgangsnotater.

GLM-5.3 vs GLM-5.2: Hva endret seg faktisk?

Den største misoppfatningen ville være å tro at GLM-5.3 bare er «GLM-5.2, men større».

Det er det ikke.

Grunnmodellen forblir i all hovedsak den samme, ifølge Z.ai. Den store innovasjonen er skalert ettertrening. Z.ai fremhever tre pilarer:

  1. Systemforbedringer i slime — Bedre trening
  2. Miljøskalering — Pipeliner som syntetiserer kjørbare, verifiserbare, lang-horisont-miljøer fra ekte profesjonelle arbeidsflyter. Forskningsagenter ekstraherer oppgavemønstre; dommeragenter verifiserer løselighet; verifikatorer bygges uten tilgang til referanseløsninger for å redusere reward hacking.
  3. Fortsatt bruk av SAO + komprimering — Hjelper gevinster å bestå over lange trajektorier i stedet for å kollapse på korte. – konsistens i utrulling (log-sannsynlighetsforskjeller kontrollert til ~1e-7), hierarkisk caching, støtte for flere lærere, arbeidsbelastningsbevisst planlegging, og rapporterte >2,3× ende-til-ende throughput-gevinster på lang-horisont kode-RL-oppgaver.

Disse endringene ga målbare forbedringer på tvers av kode-, agentiske og cybersikkerhets-suiter. Viktig nok fremstår de største relative gevinstene på de hardeste, lavest-baseline-testene—akkurat mønsteret man forventer når en modell dyttes inn i regimer den tidligere ikke håndterte pålitelig.

Resultatet er en modelloppgradering som primært handler om atferd og kapasitet, snarere enn bare arkitektur.

GLM-5.3 vs GLM-5.2: Funksjonssammenligning

1. Skalert ettertrening i stedet for ny grunnmodell

Z.ai beskriver skalert ettertrening som hele oppskriften for GLM-5.3. Forskningsagenter omformer mønstre fra virkelig arbeid til kjørbare oppgaver med skjult tilstand og flertrinns avhengigheter. En dommeragent verifiserer at hver oppgave er løselig. Verifikatorer skapes uten å se referanseløsningen, og testes deretter mot orakel-, no-op- og uløste tilstander for å redusere reward-snarveier.

Systemet krever fortsatt menneskelig gjennomgang, og Z.ai sier eksplisitt at mer autonom miljøgenerering og -verifisering forblir fremtidig arbeid. Det forbeholdet øker troverdigheten i påstanden: dette er en stor treningspipeline, ikke et utsagn om at syntetiske miljøer har blitt fullt selvstyrende.

2. Sterkere lang-horisont-koding

GLM-5.3 blir bedre på repository-arbeid, terminaloppgaver, maskinlæringsinfrastruktur, ytelsesoptimalisering og flertrinns programvareleveranse. På Z.ai Code Bench, den private interne evalueringen ment å reflektere realistiske brukerscenarier, rapporterer Z.ai omtrent 50% bedre kodeytelse enn GLM-5.2.

Effektiviteten er like viktig som poengsummen. Ved Max effort oppnådde GLM-5.3 34,5% ved omtrent 75K utgående tokens per oppgave, sammenlignet med GLM-5.2s 23,4% ved 96K. Det er en kvalitetsøkning på 11,1 poeng samtidig som det produseres omtrent 22% færre utgående tokens. Ved High effort nådde GLM-5.3 31,4% med omtrent 50K tokens, foran Claude Opus 4.8 på 29,5% med 120K i den samme førstepartsfiguren. Claude Fable 5 forble høyere på 39,5% under Max effort.

3. Fremvoksende cybersikkerhetskapabilitet

Z.ai la til sårbarhetsoppdagelsesmiljøer under ettertrening. Ifølge lanseringsrapporten vokste kapasiteten utover å finne isolerte feil: modellen begynte å resonere på tvers av flere stadier i en utnyttelseskjede.

De offentlige poengsummene viser både fremgang og begrensninger. GLM-5.3 leder Z.ais sammenligningstabell på CyberGym med 84,5, mot 77,2 for GLM-5.2. På ExploitBench mer enn dobler den GLM-5.2, og når 54,4 mot 24,4, men ligger fortsatt et godt stykke bak Fable 5 på 78,0 og GPT-5.6 Sol på 76,5. På ExploitGym fullfører den 105 oppgaver i et normalisert to-timers budsjett og 130 på seks timer, sammenlignet med 29 og 39 for GLM-5.2; GPT-5.6 Sol og Fable 5 ligger fortsatt betydelig foran.

Disse kapasitetene er til dobbeltbruk. Organisasjoner bør begrense modelltilgang, sandkasse verktøy, logge handlinger, kreve autorisasjon for skanning, og ha et menneske i loopen for validering og offentliggjøring av sårbarheter.

4. Alltid-på-resonnering med tre innsatsnivåer

GLM-5.3 støtter low, high og max reasoning effort. I motsetning til GLM-5.2 støtter den ikke deaktivert tenkning. Eksisterende integrasjoner som sender thinking.type: "disabled" må endre verdien til enabled før de bytter modell-ID, ellers sier Z.ai at forespørselen vil feile.

Bruk low for interaktive endringer og lavrisiko-transformasjoner, high for betydelige repository-oppgaver, og max for vanskelig koding eller sikkerhetsanalyse. Høyere innsats bør vurderes opp mot latens og kostnad, fordi et sterkere svar ikke automatisk er det mest økonomiske.

5. Bedre treningsgjennomstrømning via slime

GLM-5.3 fortsetter å bruke slime, Z.ais open-source-rammeverk med Megatron på treningssiden og SGLang på utrullingssiden. Z.ai rapporterer tillegg for top-p-maskering, top-k og full-ordforråd on-policy-distillasjon, lærerbytte, caching og strammere numerisk justering mellom trening og utrulling. Lanseringsrapporten sier at gjennomsnittlige log-sannsynlighetsforskjeller ble kontrollert på 1e-7-nivå, mer enn 99,99% lavere enn tidligere oppsett.

Arbeidsbelastningsbevisst planlegging og lastbalansering forbedret angivelig ende-til-ende forsterkningslæringsgjennomstrømning med mer enn 2,3 ganger på lang-horisont kodeoppgaver. Dette er treningsinfrastrukturforbedringer heller enn garanti for sluttbrukerinferens, men de forklarer hvordan Z.ai skalerte lengre og mer varierte trajektorier på en måned.

6. Utsatte åpne vekter for sikkerhetsgjennomgang

Z.ai kaller GLM-5.3 en open-weights-modell, men vektene var ikke nedlastbare på lanseringsdagen. Selskapet sier de vil frigis to uker etter lansering etter sikkerhetsevaluering og herding. Dette er en materiell forskjell fra GLM-5.2, hvis MIT-lisensierte vekter allerede er på Hugging Face.

For de fleste team er hostet API-testing fortsatt det praktiske første steget. Modellen er stor, og åpne vekter fjerner ikke kostnaden for inferensmaskinvare, kvantisering, serving, overvåkning eller sikkerhetskontroller.

GLM-5.3 vs GLM-5.2: Benchmark-forbedringer

Følgende tabell bruker Z.ais offisielle lanseringsdata. «Endring» er en enkel beregning fra de rapporterte poengene. Relative prosenter kan se dramatiske ut når GLM-5.2-baselinen er lav, så den absolutte endringen vises også.

BenchmarkGLM-5.2GLM-5.3Absolutt endringRelativ endring
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, 2-hour tasks29105+76+262.1%
ExploitGym, 6-hour tasks39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE med verktøy54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Benchmark-forbedringer: GLM-5.3 vs GLM-5.2 og konkurrenter

Alle tall nedenfor er leverandørrapporterte fra den offisielle Z.ai-bloggen (med metodikk-notater om harness, kontekster og sampling). Uavhengig verifikasjon vil følge når vekter og bredere tilgang er tilgjengelig.

Kode-benchmarker

BenchmarkGLM-5.3GLM-5.2Notater / Konkurrenter
Terminal Bench 2.188.281.0Konkurransedyktig med topp lukkede modeller
Terminal Bench 3.028.34.6Open-source SOTA; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Sterkt hopp
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (intern, Max effort)~34.5% fullføring @ ~75K tokens~23.4% @ ~96K tokens~50% samlet forbedring i kodefølelse; høyere effektivitet

Ved High effort nådde GLM-5.3 31,4% fullføring med ~50K tokens, og passerte Claude Opus 4.8 (29,5% med 120K tokens) på den interne benken, mens den fortsatt lå bak Claude Fable 5 (39,5% ved Max).

Cybersikkerhets-benchmarker

BenchmarkGLM-5.3GLM-5.2Konkurrenter (ca.)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Mer enn dobler tidligere; lukkede modeller høyere (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2t/6t)105 / 13029 / 39Mythos 5 fortsatt foran (181/247)

Gevinstene er størst lenger opp i utnyttelseskjeden. I virkelige tester med kinesiske sikkerhetsteam identifiserte modellen (med videreføring av GLM-5.2-arbeid) 2 436 sårbarheter på tvers av 269 prosjekter, inkludert 1 097 middels til høy alvorlighetsgrad. Noen feil daterte seg ~40 år tilbake (eldste ~1981). Funn spores i den offentlige Z.ai Security Disclosure Ledger.

Agentiske og andre benchmarker

BenchmarkGLM-5.3GLM-5.2Notater
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Stor gevinst
Agents’ Last Exam (ALE-CLI)28.523.8Open-source konkurransedyktig
HLE m/ verktøy62.554.7
GDPval-AA v217691508Dekker 44 profesjoner

Disse resultatene viser klar fremgang på lang-horisont, flertrinns profesjonelle oppgaver.

Token-effektivitet, tenkemoduser og praktisk atferd

En stille, men viktig forbedring er token-effektivitet. På den interne Code Bench kommer høyere fullføringsrater med færre utgående tokens. Dette betyr noe for kostnad og latens i produksjonsagent-sløyfer.

GLM-5.3 aktiverer alltid tenkning. Tre innsatsnivåer støttes: low, high og max (standard og anbefalt for koding er max). Å deaktivere tenkning støttes ikke lenger; applikasjoner som tidligere satte thinking.type: "disabled" må migrere.

Kontekst forblir solide 1M tokens med maksimum output opptil 128K. Arkitekturen er uendret fra GLM-5.2, så maskinvarestørrelse for fremtidig selvhosting kan estimeres fra eksisterende GLM-5.2-erfaring (kvantiserte fotavtrykk er fortsatt store gitt totalt antall parametere).

For utviklere som vil eksperimentere umiddelbart eller opprettholde fleksibilitet på tvers av modeller, er samlete gatewayer nyttige. CometAPI lister GLM-seriens modeller (inkludert GLM-5.3 under modell-ID-en glm-5.3 etter hvert som den blir tilgjengelig) med OpenAI-kompatible endepunkter, konkurransedyktige priser, bruksbasert fakturering og muligheten til å bytte mellom GLM-5.2, GLM-5.3 og dusinvis av andre frontier- og åpne modeller uten å skrive om integrasjonskode. Dette er spesielt praktisk for A/B-testing av kodeagenter, måling av reell kostnad per vellykket oppgave, og ruting av trafikk basert på arbeidslast.

Hvem bør gå over til GLM-5.3 og hvordan evaluere

Team som bygger kodeagenter, lang-horisont-automatisering, repository-skala ingeniørarbeidsflyter eller defensivt sikkerhetsverktøy bør prioritere evaluering. Kombinasjonen av høyere fullføringsrater, bedre token-effektivitet på komplekse oppgaver og sterkere flertrinns agentikk er materiell.

Anbefalt evalueringsløp:

  1. Kjør de samme interne oppgavene (eller et fast harness) på GLM-5.2 og GLM-5.3 (eller via Coding Plan) på matchede innsatsnivåer.
  2. Mål ikke bare passrate, men tokens, veggklokketid og rate for menneskelig inngripen.
  3. Bruk et samlet API-lag som CometAPI for å holde sammenligningen friksjonsfri og for å beholde muligheten til å falle tilbake eller rute selektivt.
  4. For sikkerhetssensitive arbeidslaster, vent på fullt sikkerhetsherdede åpne vekter og gjennomgå praksis for offentliggjøring.

Selvhosting blir attraktivt når vektene leveres, spesielt for organisasjoner som allerede kjører GLM-5.2-infrastruktur.

Konklusjon: Ettertrening som den nye skaleringsfronten

GLM-5.3 er en av de tydeligste nylige demonstrasjonene av at ettertreningsskala—mer realistiske miljøer, bedre RL-infrastruktur og vedvarende compute på lange trajektorier—kan gi kapasitetssprang som tidligere syntes å kreve nye grunnmodeller. Kode- og agentiske gevinster er store; cyber-resultatene var i stor grad fremvoksende og allerede konkurransedyktige eller ledende på oppdagelsesorienterte benchmarker.

For praktikere er den praktiske takeawayen enkel: test modellen på dine faktiske arbeidslaster, mål kostnad per vellykket utfall i stedet for rå ledertavleposisjon, og hold integrasjonen fleksibel. Plattformene som CometAPI forenkler prosessen ved å tilby én nøkkel, OpenAI-kompatibelt grensesnitt, og enkel bytting på tvers av GLM-serien og konkurrerende modeller mens du avgjør hvor aggressivt du vil ta i bruk de nye kapasitetene.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Aug 15, 2026
Sist oppdatert Aug 24, 2026
192 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer