TL;DR: Moonshot AI ha rilasciato il 16 luglio 2026 Kimi K3 – un modello rivoluzionario a pesi aperti con 2,8 trilioni di parametri (primo nella classe 3T), con multimodalità nativa, contesto da 1 milione di token e prestazioni di frontiera che rivaleggiano o superano modelli proprietari di punta come Claude Fable 5 e GPT-5.6 Sol in coding, compiti agentici, sviluppo frontend e knowledge work.
Punti chiave
- Scala e innovazione: 2,8T parametri, MoE con 16/896 esperti attivi, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x di efficienza di scaling rispetto a K2, Kimi K3 - Kimi API Platform
- Prestazioni: Artificial Analysis Intelligence Index ~57 (top 4, davanti a Claude Opus 4.8), guida la Frontend Code Arena, forte su Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). È dietro a Fable 5/Sol nel complesso ma supera la maggior parte degli altri; #1 su Arena.ai Frontend Code Arena (1,679 Elo, battendo Fable 5), post di Arena su X e copertura di Tom's Hardware.
- Capacità: Visione/video nativa, contesto da 1M per repository/codebase massivi, coding agentico, ragionamento 3D, video editing, research dashboard.
- Accesso: Immediato via kimi.com, API (modello kimi-k3, guida all’accesso); pesi aperti presto. Moonshot ha temporaneamente sospeso le nuove sottoscrizioni a Kimi K3 dopo un picco di domanda. Integrazione facile via CometAPI.
- Valore: Costo per attività più basso (~$0.94 in alcune valutazioni), meno rifiuti, ideale per flussi di lavoro di coding/Vision.
Il Kimi K3 Tech Blog descrive Kimi K3 come “Open Frontier Intelligence, Kimi K3 segna un momento cruciale nella democratizzazione dell’AI. Mentre i laboratori cinesi come Moonshot spingono i confini nonostante vincoli di calcolo, questo modello aperto sfida la dominanza dei fronti chiusi statunitensi ed emancipa gli sviluppatori in tutto il mondo”.
Che cos’è Kimi K3? Un modello open classe 3T di Moonshot AI
Moonshot AI, startup con sede a Pechino, ha lanciato Kimi K3 il 16 luglio 2026 come suo modello di punta. È esplicitamente posizionato come il primo modello open nella classe di circa 3 trilioni di parametri, con 2,8 trilioni di parametri totali in un’architettura sparsa Mixture-of-Experts (MoE). Solo 16 dei 896 esperti si attivano per token, bilanciando scala massiva ed efficienza.
Si basa sulla serie Kimi K2 (K2.5, K2.6, ecc.), già affermata per coding e multimodalità. K3 introduce innovazioni architetturali: Kimi Delta Attention (KDA) e Attention Residuals (AttnRes), oltre a Stable LatentMoE e training consapevole della quantizzazione (MXFP4 weights, MXFP8 activations from SFT stage). Queste portano a ~2,5x di migliore efficienza di scaling e fino a 6,3x di decodifica più veloce rispetto ai predecessori.
Specifiche chiave (Specifiche tecniche di Kimi K3):
- Parametri: 2,8T totali (MoE sparso).
- Finestra di contesto: 1.048.576 token (~1M).
- Modalità: Comprensione nativa di testo + immagine + video; output testuale.
- Output massimo: Default 131k token, fino al limite del contesto.
- Reasoning: Sforzo massimo di default al lancio; modalità più bassa/più alta in arrivo.
- Pesi aperti: Promessi entro il 27 luglio 2026 (stile MIT modificato, secondo il precedente di K2).
K3 è progettato per task a lungo orizzonte — non solo risposte rapide, ma completamento di flussi complessi di ingegneria, ricerca o agent con feedback visivo ("Vision in the Loop"). Le demo includono la costruzione autonoma di un compilatore GPU (in grado di rivaleggiare Triton), design di chip su processo a 45nm e ricerca astrofisica rapida.
La domanda ha già stressato la capacità
La ricezione iniziale del modello è stata tanto forte da creare pressione sulla capacità. Moonshot ha pubblicato su X che la domanda nelle 48 ore precedenti aveva spinto vicino ai limiti GPU attuali e che le nuove sottoscrizioni sarebbero state temporaneamente sospese mentre l’azienda aggiungeva capacità. Business Insider ha riportato la stessa pausa di capacità e ha osservato che gli abbonati esistenti non erano interessati.
Questo conta nella pianificazione di produzione. Un modello può essere eccellente e comunque affrontare vincoli di disponibilità se la domanda supera il compute. I team che valutano Kimi K3 dovrebbero evitare la dipendenza da un singolo provider, monitorare latenza e tassi di errore e usare instradamento di fallback tramite un provider unificato come CometAPI quando possibile.
Benchmark di coding: dove Kimi K3 appare più forte
Il profilo di coding di Kimi K3 è il motivo principale per cui gli sviluppatori prestano attenzione. È quasi alla pari con GPT-5.6 Sol su Terminal-Bench 2.1, supera GPT-5.6 Sol e Claude Fable 5 su Program Bench, e guida GPT-5.6 Sol con un margine significativo su FrontierSWE. Supera anche i modelli comparati su SWE Marathon nella tabella OpenLM.
Il risultato su Arena frontend aggiunge un altro segnale pratico. Arena ha riportato Kimi K3 a 1679 punti su Frontend Code Arena, davanti a Claude Fable 5. Quel benchmark è importante perché il lavoro frontend è spesso valutato per preferenza umana, non solo tramite unit test. Un assistente di coding che può produrre UI pulite e visivamente coerenti da un prompt è prezioso per team di prodotto, agenzie, costruttori SaaS e strumenti interni.
Classifiche complessive
- Artificial Analysis AI Leaderboard: Debutto al #3. I punteggi dell’Intelligence Index lo collocano in modo competitivo (ad es., ~57,1 in alcune valutazioni).
- Valutazione privata di knowledge work a lungo orizzonte: Elo 1547 (+732 rispetto a K2.6), dietro solo Fable 5.
Benchmark di coding e agentici (auto-riportati e indipendenti)
K3 brilla qui, sfruttando scala e architettura per prestazioni agentiche sostenute.
- Frontend Code Arena (Arena.ai): #1 con 1.679 punti, battendo Fable 5 e GPT-5.6 Sol. Eccelle nella preferenza cieca degli sviluppatori per il web dev.
- DeepSWE: 67,3–67,5 (forte, con harness KimiCode).
- Program Bench: #1 a 77,8.
- SWE Marathon: #1 a 42,0 (alcuni harness).
- Terminal-Bench 2.1: Competitivo, vicino a GPT-5.6 Sol.
Visione e multimodale
Training nativo (non aggiunto a posteriori) produce risultati solidi:
- MMMU-Pro: 81,6%
- MathVision: Competitivo/alte 90 in alcuni report.
- OmniDocBench: 91,1% (guida).
Supporta screenshot, diagrammi, video per task a ciclo chiuso come rifinitura UI o game dev.
Tabella di confronto: Kimi K3 vs. modelli leader (Approssimativo/compilato da report; Max Effort dove indicato)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Note/Fonte |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Inferiore | Inferiore | Arena.ai |
| DeepSWE | 67,3–67,5 | Competitivo | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Vicino | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Più alto | - | Moonshot interno |
| Costo per attività (valutazioni) | ~$0.94 | Maggiore | Maggiore | Indipendente |
Dati ricavati da blog tecnico di Moonshot, classifiche indipendenti e analisi. I risultati possono variare per harness/sforzo; verifica sempre i più recenti.
K3 mostra meno rifiuti su temi sensibili e forte coerenza nei flussi agentici. Test indipendenti (ad es., valutazioni su YouTube, Vals AI) lo confermano come uno dei modelli open più forti per il coding reale.
Cosa può fare Kimi K3? Capacità in coding, visione e oltre
Ingegneria di coding e agentica
K3 sostiene sessioni lunghe con minima supervisione: naviga repository massivi, usa strumenti, fa debug tramite screenshot ("vision in the loop").
Esempi:
- Ottimizzazione del kernel e sviluppo di compilatori: Ha costruito MiniTriton (compilatore simile a Triton) da zero, rivaleggiando stack ottimizzati. Ha ottimizzato kernel GPU in modo competitivo con Fable 5.
- Game dev: Trasforma concetti/immagini/video in esperienze 3D/multiplayer giocabili con raffinamento iterativo.
- Design di chip: Run autonoma di 48 ore progettando un chip nano-model.
- Frontend: In cima alle classifiche per web app, task full-stack.
Visione e multimodale
La comprensione nativa di immagini/video abilita:
- Video editing: Ha editato il suo teaser da 56 clip (selezione, tagli, sync, revisioni) – ore di lavoro in minuti.
- Ragionamento 3D, motion graphics, dashboard interattivi.
- "Vision in the loop" per iterazione del codice tramite screenshot.
La documentazione dell’API di Kimi mostra input immagine tramite data URL base64 e input video tramite file caricati referenziati da ms://. Avverte anche che gli URL pubblici di immagini non sono supportati nell’input vision, quindi gli sviluppatori dovrebbero inviare base64 o riferimenti a file caricati e rendere il contenuto dei messaggi un array di oggetti. Questo è un dettaglio implementativo importante: non serializzare un messaggio misto immagine e testo in una semplice stringa.
Knowledge work e ricerca
Per le aziende, qui Kimi K3 può essere più prezioso di un normale chatbot. Il modello è progettato per lavoro "agentico" dove può mantenere un piano, chiamare strumenti, processare risultati intermedi e produrre un artefatto finale. Esempi includono report di ricerche di mercato, assistenti di data-cleaning, sintesi di compliance, manutenzione di knowledge base per il supporto clienti e copiloti di ingegneria interna.
- Genera report di livello consulenziale, visualizzazioni interattive, dashboard (ad es., analisi dell’industria ASIC su 42 anni da migliaia di fonti).
- Pipeline scientifiche: Ha riprodotto relazioni astrofisiche, analizzato onde gravitazionali con sub-agent.
- Widget/Dashboard in Kimi Work per viste persistenti basate sui dati.
K3 mette in ponte la letteratura con codice eseguibile, producendo output di qualità pubblicazione in modo efficiente.
Kimi K3 vs altri modelli di frontiera: confronto pratico
| Modello | Miglior uso | Punti di forza | Attenzioni | Raccomandazione di CometAPI |
|---|---|---|---|---|
| Kimi K3 | Coding a lungo contesto, knowledge work, agent, ragionamento visivo | Scala MoE 2,8T, contesto 1M, benchmark forti su coding e agent, roadmap di pesi aperti | Pressione di capacità nella settimana di lancio, sensibilità alla cronologia del pensiero, supporto vision può variare per route | Testarlo come modello di punta per coding e lungo contesto |
| GPT-5.6 Sol | Ragionamento difficile, coding, ricerca, compiti produttivi ampi | Profilo benchmark molto forte e tooling maturo | Prezzo più alto in molte route | Usarlo come modello di confronto ed escalation |
| Claude Fable 5 | Scrittura, coding, flussi agentici, task a preferenza umana | UX forte e prestazioni di frontiera ampie | Costo più alto e possibili fallback di policy in alcuni compiti | Confronto per agent user-facing e app con molta scrittura |
| Claude Opus 4.8 | Ragionamento profondo e lavoro professionale affidabile | Comportamento di assistente di fascia alta stabile | Più vecchio rispetto ai rilasci flagship più recenti | Tenerlo come fallback o baseline di benchmark |
| GLM-5.2 | Valutazione di modelli open sensibili al costo | Alternativa open competitiva | Più debole in diversi confronti con K3 | Includerlo nei test di instradamento costo/prestazioni |
Come accedere a Kimi K3: guida passo passo
- Web/App: Visita kimi.com o scarica l’app Kimi (iOS/Android). Seleziona K3 (K3 Max o Swarm Max).
- Kimi Code: Focalizzato su terminale/IDE per sviluppatori. Ottimo per agent di coding.
- Accesso API:
- Base URL: https://api.moonshot.ai/v1
- Modello: kimi-k3
- Ottieni la chiave API su platform.moonshot.ai/console.
- Esempio SDK compatibile OpenAI (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Supporta strumenti, modalità JSON, caching del contesto. Prezzi: $3 input, $15 output per M token (cache $0.30).
- Aggregator: Usa CometAPI (cometapi.com) per accesso unificato a Kimi K3 + oltre 500 modelli con una sola chiave, costi più bassi (risparmio 20-40%) e switching facile. Perfetto per la produzione — compatibile OpenAI ready-to-drop-in, bassa latenza.
- Self-hosting: Dopo il rilascio dei pesi il 27 luglio su Hugging Face. Aspettati requisiti hardware pesanti (supernodi, 64+ accelerator raccomandati). Tool della community come vLLM seguiranno.
Raccomandazione CometAPI: Integra Kimi K3 via CometAPI per evitare chiavi/fatturazioni multiple. Testalo insieme a Claude/GPT per A/B, ottimizza i costi e scala in modo affidabile. Il loro dashboard traccia l’uso tra i modelli — ideale per monitorare esperimenti con K3. Iscriviti su cometapi.com per crediti gratuiti e accesso unificato.
Verdetto finale
Kimi K3 è uno dei lanci di modelli più importanti del 2026 finora. Combina scala enorme, una strategia seria di pesi aperti, una finestra di contesto da 1M token, comprensione visiva nativa e risultati di benchmark che lo collocano vicino alla cima dei sistemi AI per coding e agentic. Non elimina la necessità di GPT, Claude, Gemini, DeepSeek, Qwen o altri modelli, ma offre agli sviluppatori una nuova opzione credibile per i flussi di lavoro più difficili a lungo contesto.
Inizia oggi su kimi.com o via CometAPI per un’integrazione senza sforzo. Sperimenta con i suoi punti di forza in coding e visione – i risultati parlano da soli.
