TLDR: Moonshot AI ha rilasciato Kimi K3 il 16 luglio 2026: un modello open-weights rivoluzionario da 2,8 trilioni di parametri (primo nella classe 3T) con multimodalità nativa, contesto da 1 milione di token e prestazioni di frontiera che rivaleggiano o superano modelli proprietari di punta come Claude Fable 5 e GPT-5.6 Sol in coding, compiti agentici, sviluppo frontend e knowledge work.
Punti chiave
- Scala e innovazione: 2,8T di parametri, MoE con 16/896 esperti attivi, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x efficienza di scaling rispetto a K2, Kimi K3 - Kimi API Platform
- Prestazioni: Artificial Analysis Intelligence Index ~57 (top 4, davanti a Claude Opus 4.8), in testa alla Frontend Code Arena, forte su Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Dietro a Fable 5/Sol nel complesso ma superiore alla maggior parte degli altri; #1 su Arena.ai Frontend Code Arena (1.679 Elo, battendo Fable 5), post di Arena su X e copertura di Tom's Hardware.
- Capacità: Vision/video nativi, contesto 1M per repository/codebase enormi, coding agentico, ragionamento 3D, video editing, dashboard di ricerca.
- Accesso: Immediato via kimi.com, API (modello kimi-k3, guida all’accesso); pesi open in arrivo. Moonshot ha temporaneamente sospeso le nuove sottoscrizioni a Kimi K3 dopo un picco di domanda. Integrazione semplice via CometAPI.
- Valore: Costo per task inferiore (~$0,94 in alcune valutazioni), meno rifiuti, ideale per workflow di coding/Vision.
Il Kimi K3 Tech Blog descrive Kimi K3 come “Open Frontier Intelligence, Kimi K3 segna un momento fondamentale nella democratizzazione dell’IA. Mentre i laboratori cinesi come Moonshot spingono i limiti nonostante i vincoli di calcolo, questo modello open sfida il dominio dei fronti chiusi statunitensi e dà potere agli sviluppatori in tutto il mondo.”
Che cos’è Kimi K3? Un modello open di classe 3T di Moonshot AI
Moonshot AI, startup con sede a Pechino, ha lanciato Kimi K3 il 16 luglio 2026 come suo modello di punta. È esplicitamente posizionato come il primo modello open nella classe di circa 3 trilioni di parametri, con 2,8 trilioni di parametri totali in un’architettura sparsa Mixture-of-Experts (MoE). Solo 16 su 896 esperti si attivano per token, bilanciando scala massiva ed efficienza.
Questo si basa sulla serie Kimi K2 (K2.5, K2.6, ecc.), già affermata per coding e multimodalità. K3 introduce innovazioni architetturali: Kimi Delta Attention (KDA) e Attention Residuals (AttnRes), oltre a Stable LatentMoE e training consapevole della quantizzazione (pesi MXFP4, attivazioni MXFP8 dallo stadio SFT). Queste forniscono ~2,5x di migliore efficienza di scaling e fino a 6,3x di decodifica più veloce rispetto ai predecessori.
Specifiche principali ( Kimi K3 Technical Specifications):
- Parametri: 2,8T totali (MoE sparso).
- Finestra di contesto: 1.048.576 token (~1M).
- Modalità: Comprensione nativa di testo + immagine + video; output testuale.
- Output massimo: Predefinito 131k token, fino al limite di contesto.
- Ragionamento: Sforzo massimo predefinito al lancio; in arrivo modalità inferiore/superiore.
- Pesi open: Promessi entro il 27 luglio 2026 (licenza stile MIT modificata, in linea con il precedente K2).
K3 è mirato a compiti a lungo orizzonte — non solo risposte rapide, ma completamento di workflow complessi di ingegneria, ricerca o agent con feedback visivo (“Vision in the Loop”). Le demo includono la costruzione autonoma di un compilatore GPU (rivale di Triton), design di chip su processo a 45 nm e rapida ricerca in astrofisica.
La domanda ha già messo sotto stress la capacità
La ricezione iniziale del modello è stata abbastanza forte da creare pressione sulla capacità. Moonshot ha pubblicato su X che la domanda nelle 48 ore precedenti aveva spinto vicino ai limiti GPU attuali e che le nuove sottoscrizioni sarebbero state temporaneamente sospese mentre l’azienda aggiungeva capacità. Business Insider ha riportato la stessa sospensione della capacità e ha notato che gli abbonati esistenti non sono stati interessati.
Questo conta per la pianificazione in produzione. Un modello può essere eccellente e comunque avere vincoli di disponibilità se la domanda supera il compute. I team che valutano Kimi K3 dovrebbero evitare la dipendenza da un unico provider, monitorare latenza e tassi di errore e usare routing di fallback tramite un provider unificato come CometAPI quando possibile.
Benchmark di coding: dove Kimi K3 è più forte
Il profilo di coding di Kimi K3 è il motivo principale per cui gli sviluppatori prestano attenzione. È quasi alla pari con GPT-5.6 Sol su Terminal-Bench 2.1, supera GPT-5.6 Sol e Claude Fable 5 su Program Bench ed è in testa a GPT-5.6 Sol con un margine significativo su FrontierSWE. Inoltre, supera i modelli comparati su SWE Marathon nella tabella OpenLM.
Il risultato su Arena frontend aggiunge un altro segnale pratico. Arena ha riportato Kimi K3 a 1679 punti su Frontend Code Arena, davanti a Claude Fable 5. Quel benchmark conta perché il lavoro frontend è spesso giudicato per preferenza umana, non solo per unit test. Un assistente di coding che può produrre UI pulite e visivamente coerenti a partire da un prompt è prezioso per team di prodotto, agenzie, builder SaaS e strumenti interni.
Classifiche generali
- Artificial Analysis AI Leaderboard: Esordio al #3. I punteggi dell’Intelligence Index lo collocano in maniera competitiva (ad es., ~57,1 in alcune valutazioni).
- Valutazione privata di knowledge work a lungo orizzonte: Elo 1547 (+732 da K2.6), dietro solo a Fable 5.
Benchmark di coding e agentici (autoriportati e indipendenti)
K3 brilla qui, sfruttando scala e architettura per prestazioni agentiche sostenute.
- Frontend Code Arena (Arena.ai): #1 con 1.679 punti, battendo Fable 5 e GPT-5.6 Sol. Eccelle nella preferenza sviluppatore “alla cieca” per il web dev.
- DeepSWE: 67,3–67,5 (forte, con harness KimiCode).
- Program Bench: #1 a 77,8.
- SWE Marathon: #1 a 42,0 (alcuni harness).
- Terminal-Bench 2.1: Competitivo, vicino a GPT-5.6 Sol.
Visione e multimodale
Training nativo (non un’aggiunta posticcia) produce risultati solidi:
- MMMU-Pro: 81,6%
- MathVision: Competitivo/alta 90 in alcuni report.
- OmniDocBench: 91,1% (in testa).
Supporta screenshot, diagrammi, video per task in ciclo chiuso come il perfezionamento UI o lo sviluppo di giochi.
Tabella di confronto: Kimi K3 vs modelli leader (Approssimativa/compilata da report; Max Effort ove indicato)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Note/Fonte |
|---|---|---|---|---|
| Frontend Code Arena | 1.679 (#1) | Inferiore | Inferiore | Arena.ai |
| DeepSWE | 67,3–67,5 | Competitivo | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Vicino | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Più alto | - | Moonshot interna |
| Costo per task (valut.) | ~$0,94 | Più alto | Più alto | Indipendente |
Dati provenienti dal blog tecnico di Moonshot, classifiche indipendenti e analisi. I risultati possono variare per harness/sforzo; verificare sempre i più recenti.
K3 mostra meno rifiuti su temi sensibili e forte coerenza nei flussi agentici. Test indipendenti (ad es., valutazioni su YouTube, Vals AI) lo confermano come uno dei migliori modelli open per il coding nel mondo reale.
Cosa può fare Kimi K3? Capacità in coding, visione e oltre
Coding e ingegneria agentica
K3 sostiene sessioni lunghe con supervisione minima: naviga repository enormi, usa tool, effettua debug tramite screenshot (“vision in the loop”).
Esempi:
- Ottimizzazione di kernel e sviluppo di compiler: Ha costruito MiniTriton (compiler in stile Triton) da zero, rivaleggiando con stack ottimizzati. Ha ottimizzato kernel GPU in modo competitivo con Fable 5.
- Sviluppo di giochi: Trasforma concetti/immagini/video in esperienze 3D/multiplayer giocabili con raffinamento iterativo.
- Design di chip: Esecuzione autonoma di 48 ore per progettare un chip nano-modello.
- Frontend: In cima alle classifiche per app web, task full-stack.
Visione e multimodale
La comprensione nativa di immagini/video abilita:
- Video editing: Ha montato il proprio teaser da 56 clip (selezione, tagli, sync, revisioni) – ore di lavoro in minuti.
- Ragionamento 3D, motion graphics, dashboard interattivi.
- “Vision in the loop” per iterazione del codice via screenshot.
Le API Kimi mostrano input immagine tramite data URL base64 e input video tramite file caricati referenziati da ms://. Avvertono anche che gli URL pubblici di immagini non sono supportati nell’input vision, quindi gli sviluppatori dovrebbero inviare riferimenti base64 o a file caricati e rendere il contenuto del messaggio un array di oggetti. Questo è un dettaglio di implementazione importante: non serializzare un messaggio misto immagine e testo in una singola stringa semplice.
Knowledge work e ricerca
Per le aziende, qui Kimi K3 può essere più prezioso di una normale chatbot. Il modello è progettato per lavoro “agentico” in cui può mantenere un piano, chiamare tool, processare risultati intermedi e produrre un artefatto finale. Esempi includono report di ricerche di mercato, assistant per pulizia dati, sintesi di conformità, manutenzione della knowledge base di supporto clienti e copiloti di ingegneria interni.
- Genera report di livello consulenziale, visualizzazioni interattive, dashboard (ad es., analisi dell’industria ASIC di 42 anni da migliaia di fonti).
- Pipeline scientifiche: Ha riprodotto relazioni di astrofisica, analizzato onde gravitazionali con sub-agent.
- Widget/Dashboard in Kimi Work per viste persistenti e data-driven.
K3 fa da ponte tra letteratura e codice eseguibile, producendo output di qualità da pubblicazione in modo efficiente.
Kimi K3 vs altri modelli di frontiera: confronto pratico
| Modello | Miglior impiego | Punti di forza | Attenzioni | Raccomandazione CometAPI |
|---|---|---|---|---|
| Kimi K3 | Coding long-context, knowledge work, agent, ragionamento visivo | Scala MoE 2,8T, contesto 1M, benchmark forti in coding e agent, roadmap open-weights | Pressione di capacità nella settimana di lancio, sensibilità alla cronologia del thinking, supporto vision variabile per route | Testarlo come modello di punta per coding e long-context |
| GPT-5.6 Sol | Ragionamento duro, coding, ricerca, ampie attività produttive | Profilo benchmark molto forte e tooling maturo | Prezzo più alto in molte route | Usarlo come modello di confronto ed escalation |
| Claude Fable 5 | Scrittura, coding, workflow agentici, task basati su preferenza umana | UX forte e prestazioni di frontiera ampie | Costo più elevato e possibili fallback di policy in alcuni task | Confronto per agent user-facing e app a forte scrittura |
| Claude Opus 4.8 | Ragionamento profondo e lavoro professionale affidabile | Comportamento high-end stabile | Più vecchio rispetto alle ultime release di punta | Tenerlo come fallback o baseline di benchmark |
| GLM-5.2 | Valutazioni cost-sensitive con modelli open | Alternativa open competitiva | Più debole in diversi confronti elencati con K3 | Includerlo nei test di routing costo/prestazioni |
Come accedere a Kimi K3: guida passo-passo
Come accedere a Kimi K3
1. Accedere a Kimi K3 tramite i prodotti Kimi
Il percorso più semplice per non sviluppatori è attraverso i prodotti consumer e di produttività di Kimi: Kimi web, app, Kimi Work e Kimi Code. È il modo più rapido per testare la scrittura, il coding, la ricerca e il comportamento orientato alla UI del modello senza prima costruire un’integrazione. La sospensione temporanea delle sottoscrizioni riportata il 20 luglio significa che l’accesso può variare, quindi controlla la pagina prodotto Kimi attuale prima di pianificare un rollout di team.
2. Accedere a Kimi K3 tramite la Kimi API Platform
Gli sviluppatori possono chiamare Kimi K3 tramite la Kimi API Platform usando un client in stile OpenAI. I documenti di Moonshot elencano:
- URL di base:
https://api.moonshot.ai/v1 - ID modello:
kimi-k3 - Variabile d’ambiente negli esempi:
MOONSHOT_API_KEY - Requisito SDK Python: OpenAI SDK 1.0 o successivo
Esempio Python di base:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 ha sempre abilitata la modalità di thinking e supporta valori di reasoning_effort low, high e max, con max come predefinito. L’API supporta streaming, output strutturato con schema JSON rigoroso, Partial Mode, chiamata di tool, caricamento dinamico di tool, caching automatico del contesto e integrazioni ufficiali dei tool tramite Formula. I documenti elencano anche diversi limiti importanti: max_completion_tokens è predefinito a 131.072 e può essere impostato fino a 1.048.576; temperature e top-p sono fissi; gli sviluppatori dovrebbero restituire il messaggio completo dell’assistente nei workflow multi-turn e di tool-call; e la ricerca web è in aggiornamento, quindi non è consigliata per l’uso in produzione nel prossimo futuro.
3. Accedere a Kimi K3 tramite CometAPI
Per molti team, CometAPI è la via più pratica perché fornisce un layer API unificato tra molti provider di modelli. La pagina di CometAPI su Kimi K3 elenca il modello come live con:
- ID modello:
kimi-k3 - provider: Moonshot AI
- finestra di contesto: fino a 1.000.000 token
- prezzo CometAPI: $2,4 input e $12 output per 1M token
- prezzo ufficiale elencato: $3 input e $15 output per 1M token
- endpoint:
/v1/chat/completions - URL di base:
https://api.cometapi.com/v1
Esempio Python con CometAPI:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
Se la tua applicazione usa già l’SDK OpenAI, il quickstart di CometAPI raccomanda di cambiare solo due impostazioni: impostare base_url su https://api.cometapi.com/v1 e usare COMETAPI_KEY invece della chiave del provider precedente. Successivamente, passa l’ID modello CometAPI nel campo model.
4. Accedere ai pesi open di Kimi K3 dopo il rilascio
Moonshot afferma che i pesi completi di Kimi K3 saranno rilasciati entro il 27 luglio 2026. Una volta accaduto, ricercatori, team infrastrutturali e utenti enterprise avanzati potranno valutare self-hosting, ottimizzazione o deployment privati. Per la maggior parte delle aziende, la domanda chiave sarà l’economia: il modello è open, ma servire un sistema MoE da 2,8T richiede infrastruttura GPU seria, ingegneria di inference e monitoraggio operativo.
Verdetto finale
Kimi K3 è uno dei lanci di modello più importanti del 2026 finora. Combina scala enorme, una strategia seria per pesi open, una finestra di contesto da 1M token, comprensione visiva nativa e risultati di benchmark che lo collocano vicino al top degli attuali sistemi di IA per coding e agentic. Non elimina la necessità di GPT, Claude, Gemini, DeepSeek, Qwen o altri modelli, ma offre agli sviluppatori un’opzione credibile per i workflow long-context più difficili.
Inizia oggi su kimi.com o via CometAPI per un’integrazione senza sforzo. Sperimenta con i suoi punti di forza in coding e vision – i risultati parlano da soli.
