FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/Ricerca CometAPI

GLM-5.3 vs GLM-5.2: benchmark e test ci dicono cosa è cambiato

GLM-5.3 vs GLM-5.2: stesso modello di base, il solo post-training porta a un balzo del ~50% nella programmazione (Terminal-Bench 3.0 4.6→28.3) e capacità emergenti su CyberGym con SOTA all'84.5%.

CometAPI
AnnaTeam di ricerca su modelli AI e API
Aggiornato Aug 17, 2026 14 min di lettura
GLM-5.3 vs GLM-5.2: benchmark e test ci dicono cosa è cambiato
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Z.ai ha rilasciato GLM-5.3 il 14 agosto 2026, sullo stesso modello base Mixture-of-Experts da ~743–753B parametri di GLM-5.2. Ogni miglioramento deriva dal post-training scalato su ambienti a lungo orizzonte. Il risultato è un miglioramento relativo di ~50% sul Code Bench interno di Z.ai, SOTA open-source su Terminal-Bench 3.0 (4.6 → 28.3) e Agents’ Last Exam, punteggi agentici drasticamente migliori, e prestazioni emergenti di cybersecurity allo stato dell’arte (CyberGym 84.5%). È migliorata anche l’efficienza dei token.

I pesi sono previsti circa due settimane dopo il lancio, dopo il rafforzamento della sicurezza. Gli sviluppatori possono già accedere ai modelli GLM correlati e testare i workflow in modo efficiente tramite piattaforme unificate come CometAPI.

Punti chiave

  • Stesso modello base di GLM-5.2; tutti i progressi derivano dal post-training (IndexShare, SAO, framework slime + più ambienti e compute).
  • Coding: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Code Bench interno di Z.ai ~50% meglio con meno token di output.
  • Agentico: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769.
  • Cyber: CyberGym 77.2 → 84.5 (SOTA, davanti a Mythos 5 e GPT-5.6 Sol); ExploitBench più che raddoppiato (24.4 → 54.4). Riscontri reali: 2.436 vulnerabilità su 269 progetti.
  • Specifiche invariate nell’architettura core: contesto da 1M, fino a 128K token di output, ragionamento sempre attivo con impegno basso/alto/massimo.
  • Accesso: live via GLM Coding Plan e ZCode; API generica e pesi aperti (previsti stile MIT) in arrivo dopo la revisione di sicurezza. CometAPI offre accesso compatibile con OpenAI alla famiglia GLM per test side-by-side e instradamento in produzione.

GLM-5.3 vs GLM-5.2 in sintesi

DimensioneGLM-5.3GLM-5.2Vincitore / Note
Modello baseStesso MoE ~743–753BStessoIdentici
Post-trainingAmbienti fortemente scalatiStack precedente5.3
Terminal-Bench 3.028.34.65.3 (grande)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K token23.4% @ ~96K token5.3 (prestaz. + efficienza)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
Contesto / Output massimo1M / 128K1M / simileUguali
RagionamentoSempre attivo (basso/alto/max)Più flessibile in precedenza5.3 (always-on)
Pesi aperti~2 settimane post-lancio (previsti)Disponibili (MIT)5.2 attualmente
Accesso primario oraCoding Plan / ZCodeAPI + pesi + Coding Plan5.2 più maturo

Introduzione: il post-training offre un salto generazionale

A metà agosto 2026 la comunità AI ha assistito a un’altra iterazione rapida nella corsa ai pesi aperti. Z.ai (il volto internazionale dell’ex team Zhipu AI / ChatGLM) ha lanciato GLM-5.3 appena 59 giorni dopo GLM-5.2. L’annuncio è stato insolito per chiarezza: il modello base sottostante è rimasto identico. “Per GLM-5.3 abbiamo solo scalato il post-training,” ha affermato l’azienda.

Questa affermazione è importante. Per anni ha dominato la narrativa “i modelli più grandi vincono”. GLM-5.3 dimostra che lo scaling aggressivo degli ambienti di apprendimento per rinforzo, la diversità di compiti a lungo orizzonte e l’infrastruttura di sistema possono produrre guadagni sproporzionati su workload difficili di coding, agentici e persino di cybersecurity senza un nuovo ciclo di pre-training. I numeri sono abbastanza grandi su diversi benchmark impegnativi che osservatori indipendenti hanno descritto il salto come qualitativamente diverso piuttosto che incrementale. Panoramica di funzionalità, benchmark e note di accesso di GLM-5.3.

GLM-5.3 vs GLM-5.2: cosa è realmente cambiato?

Il più grande fraintendimento sarebbe pensare che GLM-5.3 sia semplicemente “GLM-5.2 ma più grande”.

Non lo è.

Il modello base rimane sostanzialmente lo stesso, secondo Z.ai. La principale innovazione è il post-training scalato. Z.ai evidenzia tre pilastri:

  1. Miglioramenti di sistema all’interno di slime — Addestramento migliore
  2. Scaling degli ambienti — Pipeline che sintetizzano ambienti eseguibili, verificabili e a lungo orizzonte a partire da workflow professionali reali. Agenti di ricerca estraggono pattern di compiti; agenti giudici verificano la risolvibilità; i verificatori sono costruiti senza accesso alle soluzioni di riferimento per ridurre il reward hacking.
  3. Uso continuo di SAO + compaction — Aiuta i guadagni a persistere su traiettorie lunghe anziché collassare su quelle corte. –consistenza dei rollout (differenze di log-prob controllate a ~1e-7), caching gerarchico, supporto multi-teacher, pianificazione consapevole del carico e riportati >2.3× di guadagno di throughput end-to-end su task RL di coding a lungo orizzonte.

Questi cambiamenti hanno prodotto miglioramenti misurabili su suite di coding, agentiche e di cybersecurity. Importante, i guadagni relativi più grandi emergono sui test più difficili e con baseline più basse—esattamente il pattern atteso quando un modello viene spinto in regimi che in precedenza non riusciva a gestire in modo affidabile.

Il risultato è un upgrade del modello che riguarda principalmente comportamento e capacità, piuttosto che semplicemente l’architettura.

GLM-5.3 vs GLM-5.2: confronto delle funzionalità

1. Post-training scalato invece di un nuovo modello base

Z.ai descrive lo scaling del post-training come l’intera ricetta di GLM-5.3. Gli agenti di ricerca trasformano pattern dal lavoro reale in compiti eseguibili con stato nascosto e dipendenze multi-step. Un agente giudice verifica che ogni compito sia risolvibile. I verificatori vengono creati senza vedere la soluzione di riferimento, poi testati contro stati oracle, no-op e unsolved per ridurre scorciatoie di ricompensa.

Il sistema richiede ancora revisione umana, e Z.ai afferma esplicitamente che generazione e verifica più autonome degli ambienti restano lavori futuri. Questa clausola aumenta la credibilità dell’affermazione: si tratta di una grande pipeline di training, non del claim che gli ambienti sintetici siano diventati completamente autogovernati.

2. Coding a lungo orizzonte più robusto

GLM-5.3 migliora nel lavoro su repository, attività da terminale, infrastruttura di machine learning, ottimizzazione delle prestazioni e delivery software multi-step. Sul Code Bench interno di Z.ai, la valutazione privata pensata per riflettere scenari utente realistici, Z.ai riporta ~50% di miglioramento nel coding rispetto a GLM-5.2.

Il risultato di efficienza è importante quanto il punteggio. A impegno Max, GLM-5.3 ha raggiunto 34.5% con circa 75K token di output per task, contro il 23.4% a 96K di GLM-5.2. È un guadagno di 11.1 punti di qualità producendo circa il 22% di token in meno. A impegno High, GLM-5.3 ha raggiunto 31.4% usando circa 50K token, davanti a Claude Opus 4.8 a 29.5% con 120K nello stesso grafico first-party. Claude Fable 5 rimane più alto a 39.5% sotto Max.

3. Capacità di cybersecurity emergente

Z.ai ha aggiunto ambienti di scoperta di vulnerabilità durante il post-training. Secondo il report di lancio, la capacità è cresciuta oltre il rilevamento di difetti isolati: il modello ha iniziato a ragionare su più fasi di una catena di exploitation.

I punteggi pubblici mostrano sia progressi che limiti. GLM-5.3 guida la tabella di confronto di Z.ai su CyberGym a 84.5, contro 77.2 di GLM-5.2. Su ExploitBench più che raddoppia GLM-5.2, raggiungendo 54.4 contro 24.4, ma rimane ben dietro Fable 5 a 78.0 e GPT-5.6 Sol a 76.5. Su ExploitGym completa 105 task in un budget normalizzato di due ore e 130 in sei ore, rispetto a 29 e 39 di GLM-5.2; GPT-5.6 Sol e Fable 5 rimangono sostanzialmente avanti.

Queste capacità sono dual-use. Le organizzazioni dovrebbero limitare l’accesso al modello, sandboxare gli strumenti, loggare le azioni, richiedere autorizzazione per la scansione e mantenere un umano nel loop per validazione e disclosure delle vulnerabilità.

4. Ragionamento sempre attivo con tre livelli di impegno

GLM-5.3 supporta low, high e max come livelli di impegno nel ragionamento. A differenza di GLM-5.2, non supporta il pensiero disabilitato. Le integrazioni esistenti che inviano thinking.type: "disabled" devono cambiare il valore in enabled prima di passare all’ID del modello, altrimenti Z.ai afferma che la richiesta fallirà.

Usa low per modifiche interattive e trasformazioni a basso rischio, high per compiti sostanziali su repository, e max per coding difficile o analisi di sicurezza. L’impegno più alto va valutato per latenza e costo perché una risposta più forte non è automaticamente la più economica.

5. Miglior throughput di training tramite slime

GLM-5.3 continua a usare slime, il framework open-source di Z.ai con Megatron lato training e SGLang lato rollout. Z.ai riporta aggiunte per top-p masking, top-k e distillazione on-policy a vocabolario completo, cambio di teacher, caching e allineamento numerico più stretto tra training e rollout. Il report di lancio afferma che le differenze medie di log-probabilità sono state controllate al livello 1e-7, oltre il 99.99% inferiori rispetto a setup precedenti.

Pianificazione e bilanciamento del carico consapevoli del workload avrebbero migliorato il throughput end-to-end di reinforcement learning di oltre 2.3 volte su task di coding a lungo orizzonte. Si tratta di miglioramenti di infrastruttura di training piuttosto che garanzie di inferenza lato utente, ma spiegano come Z.ai abbia scalato traiettorie più lunghe e varie in un mese.

6. Pesi aperti ritardati per revisione di sicurezza

Z.ai definisce GLM-5.3 un modello a pesi aperti, ma i pesi non erano scaricabili al giorno del lancio. L’azienda afferma che verranno rilasciati due settimane dopo il lancio, dopo valutazione e irrobustimento della sicurezza. È una differenza materiale rispetto a GLM-5.2, i cui pesi con licenza MIT sono già su Hugging Face.

Per la maggior parte dei team, i test via API hosted restano il primo passo pratico. Il modello è grande, e i pesi aperti non eliminano il costo di hardware d’inferenza, quantizzazione, serving, monitoraggio o controlli di sicurezza.

GLM-5.3 vs GLM-5.2: miglioramenti sui benchmark

La tabella seguente usa i dati ufficiali di lancio di Z.ai. “Variazione” è un calcolo semplice dai punteggi riportati. Le percentuali relative possono sembrare drammatiche quando la baseline di GLM-5.2 è bassa, quindi è mostrata anche la variazione assoluta.

BenchmarkGLM-5.2GLM-5.3Variazione assolutaVariazione relativa
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym, attività da 2 ore29105+76+262.1%
ExploitGym, attività da 6 ore39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE con strumenti54.762.5+7.8+14.3%
GDPval-AA v2, Elo15081769+261+17.3%

Miglioramenti sui benchmark: GLM-5.3 vs GLM-5.2 e concorrenti

Tutti i numeri sotto sono riportati dal vendor nel blog ufficiale di Z.ai (con note metodologiche su harness, lunghezze di contesto e sampling). La verifica indipendente seguirà una volta disponibili pesi e accesso più ampio.

Benchmark di coding

BenchmarkGLM-5.3GLM-5.2Note / Concorrenti
Terminal Bench 2.188.281.0Competitivo con top modelli closed
Terminal Bench 3.028.34.6SOTA open-source; vs Fable 5 ~33.7, GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2Salto forte
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (interno, Max effort)~34.5% completamento @ ~75K token~23.4% @ ~96K token~50% miglioramento complessivo nel coding; maggiore efficienza

A impegno High, GLM-5.3 ha raggiunto 31.4% di completamento con ~50K token, superando Claude Opus 4.8 (29.5% con 120K token) sul bench interno, pur rimanendo dietro Claude Fable 5 (39.5% a Max).

Benchmark di cybersecurity

BenchmarkGLM-5.3GLM-5.2Concorrenti (circa)
CyberGym84.5%77.2%Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%Più che raddoppia il precedente; modelli closed più alti (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 ancora avanti (181/247)

I guadagni sono maggiori più in alto nella catena di exploitation. Nei test reali con team di sicurezza cinesi, il modello (basandosi sul lavoro di GLM-5.2) ha identificato 2.436 vulnerabilità su 269 progetti, incluse 1.097 di gravità medio-alta. Alcuni difetti risalgono a ~40 anni fa (il più vecchio ~1981). Le evidenze sono tracciate nel registro pubblico Z.ai Security Disclosure Ledger.

Benchmark agentici e altri

BenchmarkGLM-5.3GLM-5.2Note
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2Grande guadagno
Agents’ Last Exam (ALE-CLI)28.523.8Competitivo open-source
HLE con strumenti62.554.7
GDPval-AA v217691508Copre 44 professioni

Questi risultati mostrano progressi chiari su compiti professionali a lungo orizzonte e multi-step.

Efficienza dei token, modalità di ragionamento e comportamento pratico

Un miglioramento silenzioso ma importante è l’efficienza dei token. Sul Code Bench interno, tassi di completamento più alti arrivano con meno token di output. Conta per costo e latenza nei loop agent in produzione.

GLM-5.3 abilita sempre il ragionamento. Sono supportati tre livelli di impegno: low, high e max (predefinito e consigliato per il coding è max). Disabilitare il ragionamento non è più supportato; le applicazioni che in precedenza impostavano thinking.type: "disabled" devono migrare.

Il contesto resta solido a 1M token con output massimo fino a 128K. L’architettura è invariata rispetto a GLM-5.2, quindi il dimensionamento hardware per futuro self-hosting può essere stimato dall’esperienza con GLM-5.2 (impronte quantizzate ancora grandi dato il conteggio totale di parametri).

Per gli sviluppatori che vogliono sperimentare subito o mantenere flessibilità tra modelli, i gateway unificati sono utili. CometAPI elenca i modelli della serie GLM (incluso GLM-5.3 sotto l’ID modello glm-5.3 man mano che diventa disponibile) con endpoint compatibili con OpenAI, tariffe competitive, billing a consumo e la possibilità di passare tra GLM-5.2, GLM-5.3 e decine di altri modelli frontier e open senza riscrivere il codice di integrazione. È particolarmente pratico per A/B test di agenti di coding, misurare il costo per task riuscito e instradare il traffico in base al workload.

Chi dovrebbe passare a GLM-5.3 e come valutare

I team che costruiscono agenti di coding, automazione a lungo orizzonte, workflow ingegneristici su scala repository o strumenti di sicurezza difensivi dovrebbero prioritizzare la valutazione. La combinazione di tassi di completamento più alti, migliore efficienza dei token su compiti complessi e agency multi-step più forte è sostanziale.

Percorso di valutazione consigliato:

  1. Esegui gli stessi compiti interni (o un harness fisso) su GLM-5.2 e GLM-5.3 (o via Coding Plan) con livelli di impegno allineati.
  2. Misura non solo il tasso di passaggio ma anche token, tempo wall-clock e tasso di intervento umano.
  3. Usa uno strato API unificato come CometAPI per mantenere il confronto senza attriti e conservare l’opzione di fallback o instradamento selettivo.
  4. Per workload sensibili alla sicurezza, attendi i pesi aperti completamente irrobustiti e rivedi le pratiche di disclosure.

Il self-hosting diventerà interessante una volta che i pesi saranno disponibili, specialmente per le organizzazioni che già gestiscono infrastruttura GLM-5.2.

Conclusione: il post-training come nuova frontiera dello scaling

GLM-5.3 è una delle dimostrazioni più chiare recenti che lo scale del post-training—ambienti più realistici, migliore infrastruttura RL e compute sostenuto su traiettorie lunghe—può produrre salti di capacità che in precedenza sembravano richiedere nuovi modelli base. I guadagni nel coding e nell’agency sono grandi; i risultati nel cyber sono stati in gran parte emergenti e già competitivi o leader su benchmark orientati alla discovery.

Per i pratici, il takeaway è semplice: testa il modello sui tuoi workload reali, misura il costo per risultato riuscito piuttosto che la posizione pura in classifica, e mantieni l’integrazione flessibile. Piattaforme come CometAPI semplificano il processo offrendo una singola chiave, interfaccia compatibile con OpenAI, e passaggio facile tra la serie GLM e modelli concorrenti mentre decidi quanto aggressivamente adottare le nuove capacità.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Aug 15, 2026
Ultimo aggiornamento Aug 17, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di più