TL;DR GLM-5.3 è il più recente modello AI di punta di Z.ai, rilasciato il 14 agosto 2026, con un’attenzione mirata a ingegneria del software, agenti autonomi, task a lungo orizzonte e cybersecurity.
A differenza di un aggiornamento convenzionale, GLM-5.3 mantiene lo stesso modello base di GLM-5.2. Z.ai afferma che i principali miglioramenti derivano dal post-training su larga scala, utilizzando workflow di esperti reali invece di aumentare semplicemente la dimensione del modello.
I risultati di spicco sono significativi. Z.ai riporta un miglioramento del 50% nelle prestazioni di coding rispetto a GLM-5.2 sul suo Code Bench interno, mentre i punteggi sui benchmark pubblici includono 66.9 su DeepSWE v1.1, in aumento da 46.2 per GLM-5.2, e 28.5 su Agents’ Last Exam (CLI), in aumento da 23.8. In cybersecurity, GLM-5.3 ha ottenuto 84.5% su CyberGym, di poco avanti a Mythos 5 di Anthropic con 83.8%, mentre ExploitBench è passato da 24.4% a 54.4%.
Punti chiave
- GLM-5.3 usa lo stesso identico modello base di GLM-5.2; ogni miglioramento deriva da post-training scalato su ambienti a lungo orizzonte.
- Il coding fa un salto netto: Terminal-Bench 3.0 da 4.6 → 28.3; DeepSWE v1.1 da 46.2 → 66.9; ~50% meglio sul Code Bench interno di Z.ai con maggiore efficienza di token.
- Capacità cyber emergenti: CyberGym 84.5% (SOTA), ExploitBench più che raddoppia (24.4% → 54.4%). Scoperta nel mondo reale di 2.436 vulnerabilità (1.097 di gravità media-alta) in 269 progetti.
- Specifiche: solo testo, contesto da 1M, output massimo 128K token, thinking sempre attivo con livelli di impegno low/high/max.
- Disponibilità: già attivo su GLM Coding Plan e ZCode; API e pesi open in stile MIT previsti ~2 settimane dopo il lancio, dopo la revisione di sicurezza.
- Forte posizionamento per agentic engineering, coding a lungo orizzonte e ricerca in sicurezza difensiva.
- CometAPI fornisce accesso semplice e scontato alla serie GLM (e a 500+ modelli) tramite un’unica API compatibile con OpenAI—ideale in attesa degli endpoint GLM-5.3 nativi.
Che cos’è GLM-5.3?
GLM-5.3 è l’ultimo modello di punta di Z.ai (precedentemente Zhipu AI), rilasciato il 14 agosto 2026. Appartiene alla famiglia GLM (General Language Model), che si è evoluta rapidamente dalle prime versioni ChatGLM in una serie di potenti modelli con pesi aperti ottimizzati per coding, reasoning e workflow agentici.
A differenza di un completo rifacimento del pre-training, GLM-5.3 è costruito sul medesimo modello base del suo predecessore GLM-5.2 (un’architettura Mixture-of-Experts di grandi dimensioni con circa 743–744 miliardi di parametri totali e ~40 miliardi attivati per token). Tutti i guadagni di performance derivano da un post-training estremo: decine di volte più ambienti di task a lungo orizzonte, maggiore diversità di ambienti e molto più calcolo dedicato a reinforcement learning (RL) e tecniche correlate.
Z.ai descrive l’obiettivo come il superamento del “vibe coding” verso una vera agentic engineering—modelli che possano prendersi carico di unità di lavoro professionali sostanziali, di più giorni, invece di generare semplici snippet di codice isolati. Gli ambienti di training ora includono scenari realistici di produzione (ad esempio, diagnosi di colli di bottiglia negli stack di training ML, implementazione di ottimizzazioni, esecuzione di esperimenti e consegna di miglioramenti misurabili end-to-end mantenendo la correttezza).
Elementi chiave dello stack tecnico ripresi e scalati da GLM-5.2 includono:
- IndexShare per un’elaborazione efficiente del long context
- SAO (con compattazione) per RL su task a lungo orizzonte
- slime (framework RL asincrono open source) per training su larga scala
Il modello è solo testo (modalità input/output: testo), supporta una solida finestra di contesto da 1 milione di token e consente fino a 128K token di output. Il thinking è sempre abilitato, con tre livelli di impegno: low, high e max (il predefinito e raccomandato per il coding è max). Disabilitare il thinking non è più supportato.
Caratteristiche principali di GLM-5.3
- Coding d’avanguardia e capacità agentiche: progettato per ingegneria del software complessa, operazioni da terminale, task agentici multi-step e workflow a lungo orizzonte che possono durare ore o giorni.
- Contesto lossless da 1M: forte ritenzione per codebase a livello di progetto, documentazione e ragionamento multi-file.
- Modalità di thinking multiple: reasoning sempre attivo con sforzo controllabile (low / high / max) per bilanciare profondità vs latenza/costo.
- Streaming, chiamata di funzioni, output strutturato e cache del contesto: supporto per strumenti agent pronti per la produzione.
- Punti di forza emergenti in cybersecurity: solida scoperta di vulnerabilità white-box e pianificazione di exploit multi-stage in crescita (pensata principalmente per uso difensivo).
- Guadagni di efficienza dei token: risultati migliori con meno token di output rispetto a GLM-5.2 a parità o prestazioni superiori.
- Roadmap dei pesi open: pesi previsti ~2 settimane dopo il lancio con licenza permissiva (seguendo il modello MIT dei precedenti GLM-5.x), dopo valutazione e hardening di sicurezza focalizzati sulle nuove capacità cyber.
Queste caratteristiche posizionano GLM-5.3 come un forte candidato per sviluppatori che costruiscono agenti di coding, sistemi di ingegneria autonomi e strumenti di ricerca in sicurezza.
Miglioramenti dei benchmark: GLM-5.3 vs GLM-5.2
Il modo più utile per valutare GLM-5.3 è osservare i benchmark in cui Z.ai fornisce un confronto diretto prima/dopo.
Da x
Cosa dicono realmente i dati dei benchmark
Primo, l’upgrade rispetto a GLM-5.2 è ampio. GLM-5.3 migliora in ogni riga della tabella di confronto di Z.ai. I maggiori cambiamenti relativi compaiono su task difficili con baseline basse come Terminal-Bench 3.0, ExploitGym ed ExploitBench. Questo schema è coerente con l’affermazione di Z.ai secondo cui ambienti a lungo orizzonte più sofisticati hanno spinto le capacità più in alto lungo la curva di difficoltà.
Secondo, GLM-5.3 è competitivo ma non un leader assoluto su tutti i fronti. Guida l’intero confronto su CyberGym (84.5), AutomationBench (48.2) e GDPval-AA v2 (1769 Elo). È quasi alla pari con GPT-5.6 Sol su Agents’ Last Exam CLI, 28.5 contro 28.6. Tuttavia, GPT-5.6 Sol ottiene 34.6 su Terminal-Bench 3.0 e 72.7 su DeepSWE, mentre Fable 5 raggiunge 33.7 e 69.7. Su ExploitBench, entrambi sono oltre 20 punti avanti a GLM-5.3.
Terzo, dettagli su harness e budget contano. Z.ai ha valutato benchmark diversi con contesti tra 300K e 1M token, output massimi tra 64K e 163.840 token e timeout fino a dieci ore. Diversi test hanno utilizzato Claude Code 2.1.207 come harness per agenti. I budget temporali di ExploitGym sono stati normalizzati usando la throughput per modello. Queste scelte sono documentate, ma implicano che il punteggio misuri un sistema modello+Harness piuttosto che la sola intelligenza astratta.
Come accedere a GLM-5.3
Al lancio, l’accesso è ancora in fase di roll-out.
La documentazione ufficiale di Z.ai afferma attualmente:
“L’API di GLM-5.3 è in arrivo.”
Allo stesso tempo, GLM-5.3 è disponibile per gli utenti del GLM Coding Plan.
La documentazione del Coding Plan di Z.ai indica che il servizio supporta GLM-5.3 insieme ad altri modelli GLM e può essere utilizzato con ambienti di coding come Claude Code, Cline, OpenCode e strumenti correlati.
La documentazione ufficiale di ZCode descrive inoltre l’integrazione di GLM-5.3 tramite account Z.ai e BigModel.
Prezzi di GLM-5.3
Il pricing è un’area in cui gli sviluppatori devono fare attenzione.
Al momento della pubblicazione, il pricing generale dell’API GLM-5.3 non è ancora stato pubblicato da Z.ai nella documentazione ufficiale dell’API GLM-5.3, poiché l’API è ancora descritta come “in arrivo”.
Attualmente, gli sviluppatori possono accedere al modello tramite il GLM Coding Plan.
La pagina attuale dei piani di Z.ai pubblicizza i seguenti prezzi di partenza:
| Piano | Prezzo pubblicizzato | Posizionamento |
|---|---|---|
| Lite | $12.60/mese promozionale / $18 standard | Sviluppo leggero |
| Pro | $56/mese promozionale / $80 standard | Carichi professionali |
| Max | Tier superiore | Carichi ad alto volume |
*I prezzi e le promozioni possono cambiare; verifica la pagina prezzi live di Z.ai prima dell’acquisto.
Il punto importante è che questi sono prezzi di abbonamento per il coding, non equivalenti al pricing per token dell’API.
Una volta che l’API generale di GLM-5.3 sarà disponibile, gli sviluppatori dovrebbero confrontare:
- Costo dei token in input
- Costo dei token in output
- Costo dei token di ragionamento
- Prezzi per input in cache
- Prezzi per la finestra di contesto
- Limiti di frequenza
- Costi delle chiamate agli strumenti
- Prezzi per batch
- Termini enterprise
piuttosto che confrontare solo i prezzi di abbonamento.
Tabella di confronto GLM-5.3: quale modello si adatta a quale workload?
| Modello | Segnali forti nella tabella di Z.ai | Debolezza relativa nella stessa tabella | Adattamento pratico |
|---|---|---|---|
| GLM-5.3 | Guida CyberGym, AutomationBench e GDPval-AA v2; grandi guadagni su 5.2 | Dietro a Fable 5 e GPT-5.6 Sol su diversi test di coding ed exploit | Agenti di coding attenti ai costi, automazione, valutazione di sicurezza difensiva, ingegneria a lungo orizzonte |
| GLM-5.2 | Pesi open maturi, licenza MIT, contesto da 1M | Molto indietro rispetto a 5.3 sui benchmark più recenti e difficili | Self-hosting oggi, deployment open riproducibili, percorso di migrazione a minor rischio |
| Kimi K3 | DeepSWE leggermente più alto; forte su Toolathlon | CyberGym, AutomationBench e GDPval-AA v2 più bassi di GLM-5.3 | Coding long-context e valutazione agentica dove Kimi è già integrato nello stack |
| Claude Fable 5 | Terminal-Bench 3.0, DeepSWE, ExploitBench ed ExploitGym più alti | AutomationBench, CyberGym e GDPval-AA v2 più bassi | Coding ad altissima difficoltà ed exploit research dove il prezzo è secondario |
| GPT-5.6 Sol | I più alti Terminal-Bench 3.0, DeepSWE, HLE con strumenti ed ExploitGym | AutomationBench, CyberGym e GDPval-AA v2 più bassi | Coding generale di frontiera e agenti a lungo orizzonte con percorso premium |
Questa non è una classifica universale. La metrica corretta in produzione è il costo per risultato accettato sui tuoi task, includendo retry, latenza, failure degli strumenti e correzione umana.
Dovresti usare GLM-5.3?
GLM-5.3 merita una valutazione seria se il tuo workload include coding a livello di repository, automazione, uso di strumenti di lunga durata o sicurezza difensiva. L’upgrade rispetto a GLM-5.2 è troppo ampio per liquidarlo come rumore da benchmark, e il risultato di efficienza dei token nel test di coding privato di Z.ai potrebbe contare quanto il punteggio grezzo.
Non è una sostituzione automatica per ogni modello. Fable 5 e GPT-5.6 Sol restano avanti su diversi benchmark di coding ed exploit nella stessa tabella di Z.ai. GLM-5.2 rimane più semplice da self-hostare oggi. Funzionalità interattive sensibili alla latenza possono preferire anche un modello più veloce con reasoning opzionale o disattivato.
Per la maggior parte delle aziende, il percorso pragmatico è testare GLM-5.3 tramite un’API hosted, confrontarlo su task reali e instradare selettivamente. CometAPI è particolarmente rilevante se vuoi fatturazione a consumo, uno sconto visualizzato del 20% e modelli alternativi disponibili tramite lo stesso layer operativo. Controlla prima il catalogo live, perché questo articolo fotografa lo stato del prodotto al giorno del lancio e potrebbe cambiare rapidamente.
In sintesi
GLM-5.3 è uno dei rilasci AI con pesi aperti più significativi di agosto 2026 perché rappresenta un cambiamento nel significato di “miglioramento del modello”. Z.ai non ha semplicemente annunciato un modello più grande. Ha invece mantenuto il base di GLM-5.2 e spinto molto di più su post-training con workflow di ingegneria reali.
I risultati sono notevoli:
- Miglioramento del 50% nel coding sul Code Bench di Z.ai
- 46.2 → 66.9 su DeepSWE v1.1
- 23.8 → 28.5 su Agents’ Last Exam
- 24.4 → 54.4 su ExploitBench
- 84.5% su CyberGym
- Contesto da 1M token
- Output massimo 128K
- Capacità agent e di uso strumenti più forti
Il modello è attualmente accessibile tramite il Coding Plan di Z.ai, mentre la sua API generale è ancora in arrivo. I pesi open sono attesi dopo ulteriore valutazione di sicurezza. Per gli sviluppatori, la più grande opportunità non è semplicemente chiedersi se GLM-5.3 batta un altro modello in una leaderboard.
La domanda migliore è:
GLM-5.3 può completare il tuo workflow di ingegneria reale con meno interventi umani, costo totale inferiore e latenza accettabile?
Questo è il benchmark che conta.
Per i team che stanno già sperimentando i modelli GLM, CometAPI offre un punto di partenza pratico tramite la sua integrazione API esistente con GLM-5.2. Man mano che GLM-5.3 diventa disponibile sulle piattaforme di terze parti, un approccio con API unificata può rendere più semplice confrontare GLM-5.3 con altri modelli di reasoning e coding senza ricostruire l’intero stack applicativo.
Esplora i modelli GLM su CometAPI
FAQ su GLM-5.3
Che cos’è GLM-5.3?
GLM-5.3 è il modello di reasoning di Z.ai di agosto 2026 per coding complesso, agenti a lungo orizzonte, automazione e cybersecurity. Usa lo stesso modello base di GLM-5.2, e i suoi guadagni sono attribuiti a post-training scalato su ambienti eseguibili più numerosi e più difficili.
GLM-5.3 è migliore di GLM-5.2?
Sì su ogni benchmark nella tabella di lancio di GLM-5.3 di Z.ai. Esempi includono Terminal-Bench 3.0 che sale da 4.6 a 28.3, DeepSWE da 46.2 a 66.9, AutomationBench da 26.2 a 48.2 ed ExploitBench da 24.4 a 54.4.
GLM-5.3 è open source?
Z.ai lo definisce un modello con pesi open ma non ha pubblicato i pesi il giorno del lancio. L’azienda afferma che i pesi verranno rilasciati due settimane dopo il lancio del 14 agosto, una volta completate valutazione e hardening di sicurezza.
Perché GLM-5.3 è rilevante per la cybersecurity?
Z.ai riporta 84.5 su CyberGym, 54.4 su ExploitBench e 105/130 task di ExploitGym completati con budget normalizzati di due/sei ore. Il modello migliora nettamente rispetto a GLM-5.2, ma gli output di sicurezza richiedono comunque autorizzazione, sandboxing, revisione di esperti e divulgazione coordinata.
Come posso accedere all’API di GLM-5.3?
Z.ai fornisce GLM-5.3 tramite il suo Coding Plan e ZCode. CometAPI elenca l’ID modello glm-5.3 con un endpoint di produzione compatibile con OpenAI.
GLM-5.3 supporta una finestra di contesto da 1M token?
Z.ai ha valutato alcuni benchmark di GLM-5.3 con un contesto da 1M token e GLM-5.3 condivide il modello base di GLM-5.2, la cui caratteristica di punta è proprio un contesto da 1M.
GLM-5.3 supporta visione o input di immagini?
Nessuna capacità di visione è stata confermata nel post di lancio ufficiale. CometAPI attualmente elenca input testuale e output testuale, quindi gli sviluppatori dovrebbero trattare GLM-5.3 come solo testo a meno che Z.ai o il provider API pubblichino una specifica multimodale.
GLM-5.3 è il miglior modello per il coding?
È uno dei modelli più forti nella tabella di lancio di Z.ai e un grande miglioramento rispetto a GLM-5.2, ma non è primo in ogni benchmark di coding. GPT-5.6 Sol e Fable 5 ottengono punteggi più alti su Terminal-Bench 3.0 e DeepSWE, quindi il modello migliore dipende da workload, latenza, prezzo e tasso di risultati accettati.
