Specifiche tecniche di GLM-5.3
| Parametro | GLM-5.3 |
|---|---|
| Sviluppatore | Z.ai |
| Famiglia di modelli | GLM-5 |
| Versione | 5.3 |
| Annuncio | 14 agosto 2026 |
| Tipo di modello | LLM agentico di frontiera |
| Focus principale | Sicurezza informatica, coding, agenti autonomi |
| Pesi aperti | Sì / annunciati |
| Parametri | Non ancora divulgati |
| Parametri attivi | Non ancora divulgati |
| Architettura | Non ancora divulgata |
| Finestra di contesto | Non ancora divulgata |
| Output massimo | Non ancora divulgato |
| Visione nativa | Non ancora confermata |
| CyberGym | 84.5% |
| ExploitBench | 54.4% |
| Pesi pubblici | Pianificati |
| Rilascio pubblico | Circa due settimane dopo l'annuncio |
| ID modello API | Non ancora confermato pubblicamente |
| Prezzi API | Non ancora annunciati |
| Accesso avanzato | Utenti fidati/verificati |
| Migliori casi d'uso | Sicurezza informatica, agenti di coding, ricerca sulle vulnerabilità |
I repository pubblici dei modelli di Z.ai mostrano ancora in evidenza GLM-5.2, invece di un artefatto GLM-5.3 scaricabile, quindi le specifiche non ancora pubblicate devono rimanere esplicitamente contrassegnate come non confermate.
Che cos'è GLM-5.3?
GLM-5.3 è l’ultima generazione della famiglia GLM di Z.ai e rappresenta un passaggio verso sistemi di IA in grado di eseguire autonomamente complessi compiti di sicurezza e ingegneria.
L’annuncio è particolarmente rilevante perché la sicurezza informatica non viene presentata come un’altra semplice categoria di benchmark. Z.ai sta usando GLM-5.3 per dimostrare un sistema di IA capace di scoprire vulnerabilità software e partecipare a workflow di sviluppo di attacchi.
Reuters riferisce che Z.ai prevede di rilasciare pubblicamente il modello dopo il completamento delle valutazioni di sicurezza, mentre le capacità più avanzate saranno inizialmente limitate tramite un meccanismo di accesso fidato.
Si tratta di un cambiamento significativo di enfasi rispetto a GLM-5.2.
GLM-5.2 era principalmente posizionato su ingegneria del software a lungo orizzonte e coding agentico. La pagina di ricerca di giugno di Z.ai descrive GLM-5.2 come “Built for Long-Horizon Tasks”.
GLM-5.3 porta quella filosofia agentica in un dominio notevolmente più sensibile:
ingegneria del software → scoperta di vulnerabilità → difesa informatica → sicurezza offensiva controllata
Quali sono le principali caratteristiche di GLM-5.3?
Ragionamento incentrato sulla sicurezza informatica
La capacità di punta è la sicurezza informatica.
GLM-5.3 ha ottenuto:
84.5% su CyberGym
CyberGym valuta la capacità di un sistema di IA di identificare vulnerabilità software. Il risultato supera leggermente l’83.8% riportato di Mythos 5.
Ciò è importante perché la sicurezza informatica richiede più del semplice generare codice sintatticamente corretto.
Un agente di sicurezza capace deve:
- Comprendere codice non familiare.
- Identificare le superfici di attacco.
- Formulare ipotesi sulle vulnerabilità.
- Tracciare i flussi di dati e di controllo.
- Validare l’ipotesi.
- Sviluppare una proof of concept adeguata.
- Determinare se la vulnerabilità è effettivamente sfruttabile.
Il punteggio di GLM-5.3 in CyberGym suggerisce progressi significativi attraverso la prima parte di questa catena.
Solida capacità di individuazione delle vulnerabilità
L’84.5% in CyberGym è probabilmente il risultato iniziale più impressionante.
Colloca GLM-5.3 leggermente davanti a Mythos 5 nell’identificazione delle vulnerabilità:
| Modello | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
Il margine è di soli 0.7 punti percentuali, quindi sarebbe fuorviante descrivere GLM-5.3 come decisamente superiore.
Più interessante è che un modello a pesi aperti di Z.ai sta entrando nello stesso intorno prestazionale di un sistema di sicurezza informatica altamente ristretto.
Lo sviluppo di exploit è ancora una debolezza
GLM-5.3 non domina ogni compito di sicurezza informatica.
Su ExploitBench:
| Modello | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
Si tratta di un divario di 23.6 punti.
Questo rivela una distinzione importante:
Trovare una vulnerabilità non è la stessa cosa che sfruttarla in modo affidabile.
GLM-5.3 sembra altamente capace nell’identificare debolezze, ma i primi risultati indicano che convertire tali riscontri in uno sviluppo di exploit affidabile rimane considerevolmente più difficile.
Per i team di sicurezza aziendali, questo rende il modello interessante come assistente difensivo per l’analisi delle vulnerabilità, più che come un semplice motore di automazione offensiva.
GLM-5.3 vs GLM-5.2
GLM-5.2 fornisce il riferimento confermato più utile.
| Caratteristica | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Stato | Rilasciato | Annunciato |
| Posizionamento principale | Agenti a lungo orizzonte | Sicurezza informatica + agenti |
| Programmazione | Eccellente | Si prevede rimanga forte |
| Sicurezza informatica | Forte potenziale | Focus dichiarato di punta |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| Contesto | 1M | Non confermato |
| Parametri | ~753B | Non confermato |
| Licenza | MIT | Pesi aperti annunciati |
| Prezzi API | Pubblicati | Non ancora pubblicati |
| Pesi pubblici | Disponibili | Pianificati |
L’architettura confermata di GLM-5.2 è di circa 753B parametri, e il suo catalogo pubblico dei modelli elenca ancora il modello 753B e la versione FP8.
GLM-5.2 ha anche ottenuto 81.0 su Terminal-Bench 2.1 e 62.1 su SWE-bench Pro secondo segnalazioni di terze parti basate sui materiali di valutazione dei modelli di Z.ai.
Ma tali numeri devono rimanere benchmark di GLM-5.2 e non essere attribuiti a GLM-5.3.
GLM-5.3 vs Mythos 5
Questo è attualmente il confronto di benchmark più significativo.
| Benchmark | GLM-5.3 | Mythos 5 | Differenza |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
Il risultato porta a una conclusione sfumata.
GLM-5.3 vince nell’identificazione delle vulnerabilità.
Ma:
Mythos 5 rimane sostanzialmente più forte nello sviluppo di exploit.
Pertanto, dire "GLM-5.3 batte Mythos 5" sarebbe un’interpretazione imprecisa dei dati disponibili.
Una descrizione migliore è:
GLM-5.3 raggiunge prestazioni al livello di Mythos 5 nella scoperta di vulnerabilità, pur rimanendo indietro nello sviluppo di exploit.