In sintesi: Sei rilasci importanti sono arrivati a distanza di circa tre settimane l’uno dall’altro a luglio 2026: la famiglia GPT-5.6 a tre livelli di OpenAI (Sol/Terra/Luna), Gemini 3.6 Flash di Google, Grok 4.5 di xAI, Kimi K3 di Moonshot AI, Claude Opus 5 di Anthropic e GLM-5.2 di Zhipu. Non esiste una scelta universalmente migliore. La decisione pratica dipende dalla profondità di ragionamento, dalle prestazioni in coding, dal costo per token, dai requisiti di contesto e dal fatto che la distribuzione con pesi aperti sia importante. Questo confronto utilizza le informazioni ufficiali correnti dei provider e le schede CometAPI, con le affermazioni sui benchmark etichettate per fonte anziché trattate come una singola classifica universale.
Punti chiave:
- GPT-5.6 non è un unico modello — sono tre (Sol, Terra, Luna) a tre fasce di prezzo diverse, e scegliere il livello sbagliato è un errore di costo più grande che scegliere la famiglia di modelli sbagliata in assoluto.
- Gemini 3.6 Flash e GLM-5.2 pubblicano entrambi una finestra di contesto da 1,000,000 token; anche Kimi K3 corrisponde a questo valore — la dimensione del contesto ha smesso di essere un elemento differenziante tra i modelli leader di questa generazione.
- GLM-5.2 e Kimi K3 supportano entrambi la distribuzione con pesi aperti, ma non usano la stessa licenza. GLM-5.2 è rilasciato sotto licenza MIT; Kimi K3 utilizza la separata Licenza Kimi K3, i cui termini commerciali vanno esaminati prima del self-hosting o dell’offerta di accesso come model-as-a-service.
- Claude Opus 5 è ufficialmente rilasciato. Anthropic lo ha annunciato il 24 luglio 2026 con una finestra di contesto da 1M token, fino a 128K di output sincrono, e un prezzo ufficiale di $5 per milione di token in input e $25 per milione di token in output; CometAPI attualmente lo elenca a $4/$20.
Cosa è effettivamente uscito questo mese
Luglio 2026 è stato un mese insolitamente denso per i modelli di frontiera e quasi di frontiera. In circa tre settimane, OpenAI ha rilasciato la famiglia GPT-5.6 (9 lug), xAI ha rilasciato Grok 4.5 (8 lug), Moonshot AI ha rilasciato Kimi K3 (16 lug), Google ha rilasciato Gemini 3.6 Flash (21 lug) e Anthropic ha lanciato ufficialmente Claude Opus 5 (24 lug). GLM-5.2 di Zhipu è arrivato leggermente prima, a giugno, ma il suo contesto da 1M token e il rilascio open con licenza MIT lo rendono pertinente alle stesse decisioni di acquisto e distribuzione.
La domanda pratica per chiunque costruisca su questi modelli non è quale sia il migliore in astratto, ma quale opzione confermata si adatti a un compito specifico. I sei differiscono in modo significativo per costo, contesto, comportamento nel coding, licenze e flessibilità di distribuzione.
Prezzi e specifiche, affiancati
Tutti i prezzi sotto sono per milione di token. Dove un modello ha più livelli, ognuno è elencato separatamente.
| Modello | Input | Output | Finestra di contesto | Licenza | Data di rilascio |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | Non specificata pubblicamente | Proprietaria | Jul 9, 2026 |
| GPT-5.6 Terra | $2.50 | $15.00 | Non specificata pubblicamente | Proprietaria | Jul 9, 2026 |
| GPT-5.6 Luna | $1.00 | $6.00 | Non specificata pubblicamente | Proprietaria | Jul 9, 2026 |
| Grok 4.5 | $2.00 | $4.00 | Non specificata pubblicamente | Proprietaria | Jul 8, 2026 |
| Kimi K3 | $3.00 | $15.00 | 1,048,576 tokens | Pesi aperti (Licenza Kimi K3) | Jul 16, 2026 |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 tokens (65,536 output) | Proprietaria | Jul 21, 2026 |
| GLM-5.2 | $1.40 | $4.41 | 1,000,000 tokens | Open (licenza MIT) | Jun 13, 2026 |
| Claude Opus 5 | $5.00 | $25.00 | 1,000,000 tokens (128K output) | Proprietaria | Jul 24, 2026 |
*I prezzi ufficiali dei provider mostrati sopra; un’API unificata che applica uno sconto standard ridurrebbe proporzionalmente ciascuno — il punto della tabella è il divario relativo tra i modelli, non il prezzo al checkout di un vendor specifico.
Alcuni elementi spiccano dalla tabella dei prezzi e delle specifiche. Sol, il livello più alto di GPT-5.6, è prezzato per ragionamento di frontiera e lavori basati su agenti a lungo orizzonte piuttosto che per l’uso quotidiano, mentre il prezzo dell’output di Grok 4.5 è relativamente basso per il suo posizionamento. GLM-5.2 ha il prezzo di output più basso elencato in questo gruppo e usa la licenza permissiva MIT. Kimi K3 offre anche pesi scaricabili e un contesto da 1M token, ma sotto la distinta Licenza Kimi K3 anziché MIT. Gemini 3.6 Flash, Kimi K3, GLM-5.2 e Claude Opus 5 pubblicano tutti finestre di contesto di circa 1M token, quindi la sola capacità di contesto non basta più per scegliere tra loro. Le tariffe elencate da CometAPI sono generalmente inferiori ai prezzi di listino dei provider, ma la valutazione a livello di carico di lavoro resta più utile che confrontare i prezzi per token isolatamente.
Per cosa è effettivamente ottimizzato ciascuno
GPT-5.6 Sol è posizionato per ragionamento di frontiera, coding basato su agenti e lavoro tecnico a lungo orizzonte — supporta una modalità "Max Reasoning Effort" e una "Ultra Mode" che attiva sub-agent in parallelo. Questo è il livello a cui affidarsi per problemi complessi e multi-step, non per attività routinarie, dato il divario di prezzo rispetto a Terra e Luna.
GPT-5.6 Terra è il livello intermedio bilanciato — produttività quotidiana, documentazione, supporto al coding e automazione aziendale. Per la maggior parte dei backend applicativi che non richiedono specificamente la profondità di ragionamento di Sol, Terra è la scelta predefinita più difendibile.
GPT-5.6 Luna è orientato a utilizzi leggeri e ad alto volume: classificazione, flussi di assistenza clienti, onboarding, generazione ripetuta di contenuti. A $1.00/$6.00 per milione di token (prima di eventuali sconti di gateway), è prezzato esattamente per questo tipo di carico ad alto numero di chiamate e bassa complessità — e supporta anche una tariffazione con input in cache con uno sconto del 90% rispetto alla tariffa standard di input, che qui conta più che per i livelli superiori dato quanto ripetitivi tendono ad essere i carichi ad alto volume.
Grok 4.5 non pubblica una specializzazione dichiarata come fanno i livelli GPT-5.6, ma il suo prezzo lo pone tra un’opzione economica e una di fascia media — vale la pena un confronto diretto a benchmark contro Terra o Kimi K3 per un carico specifico, piuttosto che dedurre il posizionamento dal prezzo.
Kimi K3 è un modello Mixture-of-Experts da 2,8 trilioni di parametri, costruito per coding a lungo orizzonte, lavoro multimodale di conoscenza e analisi estesa di documenti o repository entro un contesto da 1M token. Moonshot AI ha rilasciato i pesi completi, quindi è possibile il self-hosting, ma il rilascio usa la Licenza Kimi K3, che include condizioni commerciali diverse da un rilascio MIT standard.
Gemini 3.6 Flash è il rilascio focalizzato sull’efficienza di Google: è esplicitamente presentato come un seguito incrementale, ottimizzato per costo e latenza, di 3.5 Flash piuttosto che un nuovo modello di frontiera, con progressi reali su benchmark di coding e agenti insieme a un prezzo per-token in output inferiore al suo predecessore. È la scelta per carichi basati su agenti in cui l’efficienza di token e il costo per task completato contano quanto la capacità pura.
GLM-5.2 è l’opzione open più permissiva in questo confronto. Z.ai lo ha rilasciato sotto licenza MIT con un contesto da 1M token e un’enfasi esplicita su coding a lungo orizzonte, uso di tool e impegno di pensiero regolabile. I team possono accederci tramite API o eseguire localmente i pesi pubblicati, soggetti alla propria infrastruttura e ai requisiti di valutazione.
Confronto delle capacità di coding
I sei rilasci mirano a pattern ingegneristici diversi, quindi la capacità di coding va compresa al meglio come aderenza al carico di lavoro piuttosto che come classifica unica.
- Claude Opus 5 è qui l’opzione più adatta per debug difficili, analisi della causa radice, grandi refactoring e agenti software di lunga durata; Anthropic evidenzia comportamenti di verifica e iterazione più forti.
- GPT-5.6 Sol, Terra e Luna offrono un percorso a livelli dal coding e ragionamento complessi al lavoro di sviluppo bilanciato fino all’assistenza al codice ad alto volume.
- Gemini 3.6 Flash è ottimizzato per cicli di coding agentici rapidi in cui latenza e costo per iterazione contano.
- Kimi K3 è progettato per coding a lungo orizzonte su repository molto grandi, con un contesto da 1M token e pesi scaricabili.
- GLM-5.2 combina coding a lungo orizzonte, uso di tool, impegno di pensiero regolabile e distribuzione locale sotto licenza MIT.
- Grok 4.5 va trattato come candidato per una valutazione diretta rispetto agli altri perché il suo posizionamento ufficiale non fornisce la stessa scomposizione di specializzazioni nel coding della famiglia GPT a livelli.
Il compromesso di confrontare (e cambiare) i modelli così spesso
Nulla di tutto ciò è un invito a inseguire ogni nuovo rilascio. Spostare i carichi di produzione su un nuovo modello ogni volta che esce ha costi reali: ri-testare i prompt, ri-validare la qualità dell’output e ri-verificare il calcolo del costo per task rispetto al tuo traffico effettivo, non a un benchmark sintetico. Un’API unificata non elimina quel lavoro di valutazione, ma elimina gli oneri di account e fatturazione separati per eseguire effettivamente il confronto — poter chiamare GPT-5.6 Terra, Gemini 3.6 Flash, Kimi K3 e GLM-5.2 con lo stesso schema di richiesta e un’unica fattura rende realistico testare più di un candidato prima di impegnarsi, invece di ripiegare su qualunque provider per cui avevi già una chiave.
È un vantaggio reale, non una soluzione completa — non sostituisce la lettura della documentazione di ciascun modello, e non rende la scelta del modello esente dai costi di switching descritti sopra. Quello che fa è abbassare il costo di scoprire quale modello è effettivamente giusto per un dato carico di lavoro, che è un’affermazione diversa (e più onesta) di “questo modello è il migliore”.
FAQ
Qual è il miglior modello di AI rilasciato a luglio 2026? Non c’è una risposta univoca. GPT-5.6 Sol e Claude Opus 5 sono orientati a lavori di ragionamento e coding esigenti; Gemini 3.6 Flash enfatizza loop agentici efficienti; Kimi K3 combina lungo contesto con pesi aperti; e GLM-5.2 combina capacità a lungo orizzonte con una licenza MIT. La scelta giusta dipende dal carico di lavoro e dai vincoli di distribuzione.
GPT-5.6 è un modello o diversi? Tre: Sol (flagship, ragionamento di frontiera), Terra (bilanciato, uso quotidiano) e Luna (veloce ed economico, attività ad alto volume) — ciascuno prezzato separatamente, da $0.80/$4.80 per milione di token per Luna fino a $4.00/$24.00 per Sol.
Claude Opus 5 è ufficialmente rilasciato? Sì. Anthropic ha annunciato Claude Opus 5 il 24 luglio 2026. Il rilascio ufficiale descrive una finestra di contesto da 1M token e posiziona il modello per coding agentico complesso e lavoro di conoscenza; il prezzo ufficiale dell’API è $5 per milione di token in input e $25 per milione di token in output.
Quale di questi modelli è più economico da usare su larga scala? Sui prezzi di output elencati dai provider nella tabella, GLM-5.2 è l’opzione a costo più basso ed è disponibile sotto licenza MIT. Kimi K3 ha anch’esso pesi aperti, ma la sua distinta Licenza Kimi K3 e l’impronta di modello molto più grande cambiano l’economia del self-hosting. GPT-5.6 Luna è l’opzione proprietaria a minor costo, solo API, trattata qui.
Devo scegliere un modello e impegnarmi, o posso testarne diversi? Testarne più di uno contro i tuoi prompt e il tuo traffico effettivo di solito vale il costo di setup prima di impegnare il traffico di produzione — un’API unificata (CometAPI tra le altre) rende specificamente più economico farlo, poiché elimina gli oneri di account separati per eseguire il confronto, anche se non sostituisce la lettura della documentazione di ciascun modello.
Conclusioni
L’ondata di rilasci di luglio 2026 non ha prodotto un chiaro vincitore. Ha prodotto sei opzioni confermate che bilanciano in modo diverso profondità di ragionamento, prestazioni nel coding, costo per token, contesto e licenze. GPT-5.6 Sol e Claude Opus 5 puntano al lavoro di ragionamento e ingegneria del software più difficile; Gemini 3.6 Flash e GPT-5.6 Luna enfatizzano l’efficienza; Kimi K3 porta pesi aperti e un contesto multimodale da 1M sotto la propria licenza; e GLM-5.2 offre un’alternativa da 1M token con licenza MIT. Tutti sono accessibili tramite CometAPI con una sola chiave, il che rende più facile fare test controllati, ma la selezione del modello dovrebbe comunque basarsi su prompt, tool, obiettivi di latenza e criteri di successo del carico di lavoro reale.
