Prima la risposta
Kimi K4 non è stato rilasciato ufficialmente e Moonshot AI non ha pubblicato specifiche finali, risultati di benchmark, prezzi dell’API o una data di uscita. Il segnale pubblico più forte finora proviene da articoli secondo cui Moonshot starebbe cercando ulteriore capacità Nvidia Blackwell per un successore previsto significativamente più grande di Kimi K3. È una prova significativa che un modello di nuova generazione è in preparazione, ma non è un annuncio ufficiale di prodotto.
Ciò di cui si può parlare responsabilmente è la direzione che K4 potrebbe prendere. L’attuale Kimi K3 da 2,8 trilioni di parametri già combina scaling sparso Mixture-of-Experts, visione nativa, una finestra di contesto da un milione di token e capacità agentiche su orizzonti lunghi. Kimi K4 sarà quindi probabilmente valutato più per l’esecuzione agentica affidabile, la profondità nel coding, il ragionamento multimodale e l’efficienza di scaling che non per il mero numero di parametri.
La conclusione centrale è semplice: Kimi K4 sembra essere in sviluppo, ma quasi ogni specifica numerica che circola al di fuori dell’azienda resta non confermata. Un’anteprima credibile deve separare i fatti verificati su K3, i report su K4 e le inferenze prospettiche.
Che cos’è Kimi K4?4
Kimi K4 è il nome pubblico usato per indicare il successore atteso da Moonshot AI di Kimi K3. Va attualmente trattato come un modello in sviluppo, non come un prodotto API annunciato. Moonshot AI non ha pubblicato una scheda del modello K4, un report tecnico, un identificatore API, una pagina prezzi, una licenza o una tabella di benchmark.
The Information riporta che Moonshot AI sta discutendo i piani per Kimi K4. Citando due persone a conoscenza della questione, il report descrive K4 come significativamente più grande di K3 e afferma che Moonshot sta cercando accesso a ulteriori chip Nvidia Blackwell per preparare il modello. Tuttavia, non conferma cinque trilioni, sei trilioni o qualsiasi altro conteggio preciso di parametri, né stabilisce se K4 sarà rilasciato come pesi aperti, offerto solo tramite prodotti ospitati o suddiviso in più varianti.
Questa incertezza è importante perché i rilasci Kimi hanno storicamente combinato pesi del modello, API ospitate, prodotti per utenti finali e sistemi agentici specializzati. Un futuro annuncio di K4 potrebbe riferirsi a un modello, a una famiglia di modelli o a un sistema più ampio costruito attorno a instradamento, strumenti, memoria e componenti multimodali.
Perché Kimi K4 attira attenzione così presto?
Kimi K3 ha alzato il tetto dello scaling a pesi aperti
Kimi K3 ha stabilito una base insolitamente ambiziosa. Il suo riassunto ufficiale elenca 2,8 trilioni di parametri totali, 104 miliardi di parametri attivati, 93 layer, 896 esperti instradati, 16 esperti selezionati per token, due esperti condivisi e una lunghezza di contesto di 1.048.576 token. Il modello include inoltre un encoder di visione MoonViT-V2 da 401 milioni di parametri.
Questa combinazione rende K3 importante per due motivi diversi. Primo, mostra che i modelli a pesi aperti possono scalare nella stessa ampia classe di capacità dei principali sistemi proprietari. Secondo, il suo design sparso dimostra che il conteggio totale dei parametri e il costo di inferenza non sono la stessa cosa: solo un sottoinsieme di esperti è attivo per ogni token.
I report indicano un successore ancora più grande
Le notizie di settore affermano che Moonshot AI sta cercando più compute di classe Blackwell per K4 e descrivono il modello pianificato come significativamente più grande di K3. Il report è la migliore prova pubblica che K4 è più di una speculazione della community, ma lascia irrisolti l’architettura finale, il calendario di training, la dimensione del modello e il piano di deployment.
La storia del compute è rilevante perché la scala crea due colli di bottiglia separati. L’addestramento richiede abbastanza acceleratori, networking, storage e stabilità ingegneristica per completare una corsa di frontiera. Il serving richiede poi una strategia di inferenza separata che possa fornire latenza e costo accettabili. Un K4 più grande necessiterebbe dunque di miglioramenti architetturali e di sistema, non solo di più hardware.
L’architettura di K3 è stata progettata per scalare ulteriormente
Il blog tecnico di Kimi K3 descrive Kimi Delta Attention e Attention Residuals come la spina dorsale architetturale di un modello progettato per scalare oltre il regime dei trilioni di parametri. Kimi Delta Attention fornisce una base di attenzione efficiente, mentre gli Attention Residuals recuperano selettivamente rappresentazioni lungo la profondità del modello invece di accumularle uniformemente.
K3 utilizza anche Stable LatentMoE, attivando di fatto 16 dei 896 esperti instradati. Quantile Balancing deriva l’allocazione degli esperti dai quantili dello score del router, e Per-Head Muon ottimizza indipendentemente le teste di attenzione. Queste scelte indicano i problemi che K4 deve risolvere: instradamento stabile, utilizzo bilanciato degli esperti, attenzione efficiente su lunghi contesti e training prevedibile a scala estrema.
Perché Kimi K4 sarebbe rilevante se Kimi K3 è già un modello da 2,8T?
Kimi K3 opera già a una scala insolitamente ampia, quindi K4 non può essere valutato semplicemente chiedendosi se abbia più parametri. La domanda più significativa è se un compute addizionale per l’addestramento produca migliore completamento dei compiti, maggiore affidabilità a lungo termine e minore costo di inferenza effettivo.
Una valutazione utile di K4 dovrebbe quindi concentrarsi su quattro metriche:
- Tasso di completamento delle attività
- Affidabilità degli agenti nel lungo periodo
- Tasso di successo nella programmazione
- Costo per attività completata con successo
L’ultima metrica è particolarmente importante per gli sviluppatori. Un modello che costa meno per ogni correzione di repository riuscita può essere più prezioso di un modello con punteggi di benchmark più alti ma molte più traiettorie fallite.
Specifiche attese di Kimi K4
La tabella seguente distingue la baseline tecnica confermata di K3 dai report e dalle inferenze su K4. Atteso non significa annunciato. I campi sconosciuti devono rimanere tali finché Moonshot AI non pubblica una scheda del modello o una documentazione API.
| Basi della specifica | Kimi K3 confermato | Kimi K4 report pubblico | Confidenza |
|---|---|---|---|
| Stato del modello | Rilasciato | In sviluppo | Riportato |
| Architettura | MoE sparsa | Non divulgata; probabile evoluzione di MoE | Inferenza |
| Parametri totali | 2,8T | Segnalato come significativamente più grande | Riportato; valore esatto ignoto |
| Parametri attivati | 104B | Non divulgato | Sconosciuto |
| Configurazione esperti | 896 instradati; 16 selezionati; 2 condivisi | Non divulgata | Sconosciuto |
| Finestra di contesto | 1.048.576 token | Probabilmente almeno 1M, ma non confermato | Atteso |
| Attenzione | KDA più Gated MLA | Possibile KDA di nuova generazione | Inferenza |
| Visione nativa | MoonViT-V2 | Probabile continuazione multimodale | Atteso |
| Pesi aperti | Disponibili | Non confermato | Sconosciuto |
| ID modello API | kimi-k3 | Non annunciato | Sconosciuto |
| Data di rilascio | Disponibile | Non annunciata | Sconosciuto |
La più importante cautela riguarda la riga dei parametri. Significativamente più grande non stabilisce una dimensione esatta. Allo stesso modo, la finestra di contesto da un milione di token, il design multimodale e il rilascio a pesi aperti di K3 non possono essere copiati nella scheda di K4 come fatti confermati. Sono aspettative plausibili in termini direzionali, non impegni di prodotto pubblicati.
Quali funzionalità potrebbe introdurre Kimi K4?
-
Scaling MoE più grande ma più efficiente
L’aspettativa ovvia è un modello Mixture-of-Experts più grande. La domanda più importante è se K4 migliori il rapporto tra capacità totale, capacità attivata e costo di serving. Aumentare il pool di esperti senza migliorare l’instradamento potrebbe creare specialisti sotto-utilizzati, esperti sovraccaricati, colli di bottiglia di comunicazione e training instabile.
Un avanzamento credibile per K4 combinerebbe capacità aggiuntiva con migliore bilanciamento del carico, esperti più specializzati, rapporti di attivazione più bassi o una più forte coordinazione tra esperti. Nessuno di questi dettagli è stato divulgato, quindi un articolo dovrebbe descriverli come obiettivi ingegneristici, non come funzionalità trapelate.
Una Kimi Delta Attention più avanzata
Kimi Delta Attention è centrale per il design a lungo contesto di K3. Una versione di nuova generazione potrebbe migliorare il recupero su input da milioni di token, ridurre la memoria dello stato di attenzione e preservare informazioni importanti durante lunghe esecuzioni agentiche. Il test pratico non sarebbe la sola dimensione della finestra di contesto, ma se il modello sa trovare, combinare e agire su evidenze lontane senza segmentazioni aggressive o recuperi ripetuti.
Agenti a lungo termine più affidabili
Kimi K3 è già posizionato per lavori tecnici e di conoscenza di lunga durata. Le sue demo ufficiali includono sviluppo di compiler, ottimizzazione di kernel GPU, coding scientifico, ricerca interattiva, sviluppo di giochi e flussi di lavoro per design di chip. K4 dovrebbe trasformare queste demo impressionanti in un’esecuzione quotidiana più coerente.
Le metriche che contano sono meno chiamate di strumenti non necessarie, maggiore tenuta degli obiettivi, migliore recupero dopo azioni fallite, verifica più affidabile e minore varianza tra esecuzioni. Un modello che completa una volta un benchmark difficile ma in produzione si comporta in modo imprevedibile è meno utile di un modello leggermente più debole con esecuzione affidabile.
Coding e ingegneria del software più forti
K4 probabilmente resterà fortemente focalizzato sul coding, ma il confine si è spostato oltre la generazione di funzioni isolate. I modelli competitivi per l’ingegneria del software devono mappare repository, comprendere dipendenze, operare terminali, modificare più file, eseguire test, diagnosticare fallimenti e rivedere l’approccio.
K3 è già forte su ProgramBench, SWE-Marathon, FrontierSWE e compiti da terminale. L’opportunità più chiara per K4 è colmare il gap residuo nella riparazione profonda delle codebase, preservando il vantaggio di K3 nel lavoro multi-step sostenuto.
Multimodalità nativa più profonda
K3 combina testo e visione a livello di modello, e gli esempi di prodotto di Moonshot estendono quella capacità al video editing e allo sviluppo con visione nel loop. K4 potrebbe migliorare i flussi di lavoro da screenshot a codice, il ragionamento su grafici e documenti, la comprensione temporale dei video, il testing di interfacce e agenti che ispezionano i risultati visivi prima di proseguire.
La distinzione chiave è tra accettare immagini e usare la percezione in un ciclo chiuso. Un agente multimodale deve osservare un risultato renderizzato, identificare la discrepanza, modificare il proprio lavoro e verificare la revisione. Questo è più impegnativo che rispondere a una singola domanda su un’immagine.
Migliore efficienza di inferenza e deployment
Un modello più grande di K3 potrebbe essere difficile da auto-ospitare anche se i suoi pesi fossero rilasciati. K4 trarrebbe beneficio da addestramento consapevole della quantizzazione, parallelismo efficiente degli esperti, decodifica speculativa, gestione ottimizzata dello stato KV e varianti ausiliarie più piccole. Per la maggior parte dei team, l’accesso tramite API ospitata potrebbe restare più pratico rispetto all’operare direttamente un modello sparso di frontiera.
Quale performance di benchmark sarebbe necessaria per Kimi K4?
K4 non ha risultati di benchmark pubblicati. L’approccio responsabile è stabilire la soglia di performance creata da K3 e dagli attuali concorrenti di frontiera, poi identificare dove un successore dovrebbe migliorare. La baseline ampliata qui sotto copre ragionamento, coding, operazioni da terminale, ricerca profonda, lavoro di conoscenza basato su agenti e compiti da foglio di calcolo. Tutti i valori provengono dalla scheda ufficiale di Kimi K3 collegata nell’intestazione della tabella.
| Suite di benchmark ufficiale | Kimi K3 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 4.8 |
|---|---|---|---|---|
| GPQA Diamond | 93,5 | 94,1 | 92,6 | 91,0 |
| DeepSWE | 67,5 | 73,0 | 70,0 | 59,0 |
| ProgramBench | 77,8 | 77,6 | 76,8 | 71,9 |
| Terminal-Bench 2.1 | 88,3 | 88,8 | 88,0 | 84,6 |
| FrontierSWE | 81,2 | 71,3 | 86,6 | 66,7 |
| SWE-Marathon | 42,0 | 39,0 | 35,0 | 40,0 |
| Kimi Code Bench 2.0 | 72,9 | 64,8 | 76,9 | 71,7 |
| BrowseComp | 91,2 | 90,4 | 88,0 | 84,3 |
| DeepSearchQA (F1) | 95,0 | Non riportato | 94,2 | 93,1 |
| ResearchRubrics | 76,2 | 73,8 | Non riportato | 73,5 |
| GDPval-AA v2 (Elo) | 1686 | 1736 | 1747 | 1593 |
| SpreadsheetBench 2 | 34,8 | 32,4 | 34,7 | 31,6 |
Questi sono risultati di confronto riportati da Moonshot anziché un’unica classifica indipendente controllata. Alcuni modelli sono stati valutati tramite diversi harness di agenti, e le note ufficiali descrivono fallback, cyberguard, sostituzioni hardware, impostazioni di ragionamento e procedure specifiche per benchmark. GDPval-AA v2 è una valutazione Elo e non dovrebbe essere confrontata numericamente con le righe basate su percentuali. Piccole differenze di punteggio non dovrebbero essere interpretate come superiorità universale.
Snapshot ufficiale dei benchmark di coding

Confronto ufficiale di coding di Kimi K3. L’immagine è una grafica pubblicata da Moonshot; consultare la scheda del modello e le note attuali per l’ultima tabella numerica e la metodologia di valutazione.
Risultati dei benchmark e interpretazione
GPT-5.6 Sol supera Kimi K3 su DeepSWE, indicando un vantaggio nella riparazione di software a livello di repository. Claude Fable 5 guida FrontierSWE, mentre K3 resta comodamente avanti rispetto a GPT-5.6 Sol e Claude Opus 4.8 su quel benchmark.
Il profilo di K3 diventa più distintivo nel lavoro sostenuto. Guida leggermente ProgramBench e registra il risultato SWE-Marathon più forte nel confronto selezionato. Guida anche BrowseComp e sostanzialmente è alla pari con Claude Fable 5 su SpreadsheetBench 2.
Per K4, l’obiettivo non dovrebbe essere un aumento percentuale fisso su ogni grafico. L’obiettivo più utile è migliorare la riparazione profonda di codebase e l’affidabilità nell’uso del computer senza perdere i punti di forza di K3 nel coding a lungo orizzonte, nel browsing e nel lavoro di conoscenza basato su agenti.

Confronto ufficiale degli agenti generali e visivi di Kimi K3. Fonte: pagina del modello Kimi K3 di Moonshot AI.
Kimi K4 vs Kimi K3, GPT-5.6 Sol e Claude Fable 5
Un confronto pre-release non può attribuire a K4 punteggi inesistenti. Può, però, mostrare la posizione competitiva che ci si aspetterebbe per K4 se estendesse la linea K3.
| Dimensione | Posizione attesa di Kimi K4 | Kimi K3 confermato | Riferimenti chiusi: GPT-5.6 Sol e Claude Fable 5 |
|---|---|---|---|
| Disponibilità | In sviluppo | Disponibile | Disponibile |
| Apertura del modello | Sconosciuta | Pesi aperti | Proprietario |
| Contesto confermato | Sconosciuto | 1M token | Definito dal provider o classe 1M |
| Forza primaria | Intelligenza di frontiera su scala maggiore (attesa) | Coding e lavoro di conoscenza a lungo termine | Ragionamento, coding e uso del computer di frontiera |
| Multimodalità | Attesa; non confermata | Visione nativa | Multimodale |
| Auto-ospitazione | Sconosciuta | Possibile con infrastruttura sostanziale | Non disponibile |
| Maturità agenti | Attesa in miglioramento | Forte | Forte |
| Costo di deployment | Sconosciuto e potenzialmente elevato | Alto per auto-ospitazione; API ospitata disponibile | Solo API ospitata |
| Motivo principale d’interesse | Scala più possibile apertura | Baseline di frontiera aperta verificata | Massima capacità dei modelli chiusi |
Risultato del confronto
Kimi K3 si distingue per pesi aperti, finestra di contesto da un milione di token e forte performance su orizzonti lunghi. GPT-5.6 Sol resta più forte su alcuni compiti di ragionamento difficile e riparazione di repository, mentre Claude Fable 5 è particolarmente competitivo nell’ingegneria del software e negli agenti di uso del computer.
Se K4 resterà aperto o ampiamente accessibile colmando questi gap di capacità, la sua rilevanza andrà oltre un più grande conteggio di parametri. Mostrerebbe che sistemi aperti o semi-aperti possono avvicinarsi all’affidabilità delle piattaforme agentiche proprietarie più forti. Se K4 diventasse chiuso e estremamente costoso da servire, la distinzione pratica sarebbe molto più piccola.
Cosa potrebbe significare Kimi K4 per l’AI a pesi aperti?
K3 dimostra già che lo sviluppo a pesi aperti sta entrando in una scala un tempo associata quasi esclusivamente ai laboratori proprietari. K4 potrebbe spingere ulteriormente questo confine, ma l’apertura ha diversi strati: pesi scaricabili, codice utilizzabile, una licenza praticabile, inferenza riproducibile, requisiti hardware accessibili e API ospitate.
Un modello può essere tecnicamente aperto ma economicamente inaccessibile. La scala 2,8T di K3 significa che un’auto-ospitazione seria richiede infrastruttura sostanziale, anche con attivazione sparsa e quantizzazione. Un K4 ancora più grande potrebbe ampliare il divario tra i ricercatori che possono ispezionare i pesi e le organizzazioni che possono operare il modello in modo efficiente.
Per l’ecosistema più ampio, il rilascio ideale di K4 combinerebbe pesi trasparenti, ricette di inferenza efficienti, forte comportamento nell’uso degli strumenti e un’API ospitata. Questa combinazione permetterebbe ai ricercatori di studiare il modello, alle imprese di distribuirlo tramite API e ai team specializzati di adattarlo a carichi di lavoro privati o regolamentati.
Quando sarà rilasciato Kimi K4?
Moonshot AI non ha annunciato una data di rilascio per Kimi K4. I report pubblici collegano il modello all’approvvigionamento di compute e alla pianificazione dello sviluppo. Questo rende inaffidabile prevedere un mese, un trimestre o un conto alla rovescia precisi.
È inoltre sconosciuto se K4 apparirà simultaneamente nel prodotto web Kimi, Kimi Code, Kimi Work, nella Moonshot API e in un repository a pesi aperti. K3 è disponibile su diverse di queste superfici, ma K4 potrebbe seguire un rollout scaglionato o una diversa strategia di distribuzione.
I segnali da monitorare sono un blog tecnico ufficiale di Moonshot, un repository di modello verificato, la documentazione della piattaforma Kimi, una licenza pubblicata e una scheda del modello con dettagli di valutazione riproducibili. I post social e le voci sui parametri dovrebbero rimanere secondari finché non appare una di queste fonti.
Come accedere ai modelli Kimi in attesa di K4
K4 non è attualmente invocabile. Gli sviluppatori possono invece valutare l’architettura attuale tramite Kimi K3 su CometAPI. L’ID modello attuale è testo in codice semplice: kimi-k3. La richiesta utilizza POST /v1/chat/completions. Non inviare richieste di produzione a un ipotetico identificatore kimi-k4 finché non viene pubblicata una pagina di integrazione ufficiale.
Crea un account CometAPI e genera una chiave API. Archivia la chiave in una variabile d’ambiente anziché inserirla hard-coded nel sorgente dell’applicazione.
from openai import OpenAI client = OpenAI( api_key="YOUR_COMETAPI_KEY", base_url="https://api.cometapi.com/v1", ) response = client.chat.completions.create( model="kimi-k3", messages=[ { "role": "user", "content": "Analyze the architecture of this software project." } ], ) print(response.choices[0].message.content)
Il blocco di codice è Python. L’endpoint, l’ID del modello, i nomi dei parametri e le parole chiave del codice sono intenzionalmente presentati come codice anziché come hyperlink. Quando K4 sarà disponibile, gli sviluppatori dovrebbero confermare il vero identificatore del modello, la compatibilità dell’endpoint, le modalità supportate e i prezzi prima di modificare il routing in produzione.
Cosa non sappiamo ancora su Kimi K4
Un articolo responsabile pre-release dovrebbe preservare le seguenti incognite invece di riempirle con stime della community:
- Conteggi finali dei parametri totali e attivati
- Numero di esperti, esperti condivisi e strategia di instradamento
- Finestra di contesto e lunghezza massima dell’output
- Modalità di input e output supportate
- Stato dei pesi aperti, repository e licenza
- ID modello API, endpoint, modalità di ragionamento e prezzi
- Risultati ufficiali dei benchmark e harness di valutazione
- Formati di quantizzazione e requisiti hardware per l’auto-ospitazione
- Disponibilità del prodotto e data di rilascio
Mantenere esplicita questa sezione impedisce che le specifiche previste vengano ripetute in seguito come fatti ufficiali. Rende anche l’articolo più facile da aggiornare quando Moonshot AI pubblica documentazione primaria.
FAQ
Kimi K4 è stato rilasciato?
No. Non esiste una scheda del modello K4, una documentazione API o un annuncio pubblico di rilascio ufficiale. La discussione attuale si basa principalmente su report secondo cui Moonshot AI sta preparando un successore più grande di K3.
Quanto sarà grande Kimi K4?
La dimensione esatta è sconosciuta. I report affermano che potrebbe essere significativamente più grande di K3, ma specifiche affermazioni multi-trilione non sono state confermate da Moonshot AI.
Kimi K4 sarà open source?
Non è stato confermato. K3 ha pesi aperti sotto la Kimi K3 License, ma una strategia di rilascio precedente non garantisce la stessa distribuzione per K4.
Kimi K4 avrà una finestra di contesto da un milione di token?
È ragionevole aspettarsi che K4 mantenga o migliori la capacità di lungo contesto di K3, ma Moonshot AI non ha pubblicato un limite di contesto per K4.
Gli sviluppatori possono usare Kimi K4 tramite CometAPI ora?
Non esiste un percorso modello K4 confermato. Gli sviluppatori possono attualmente testare Kimi K3 e confrontarlo con altri modelli di frontiera tramite lo stesso livello di integrazione.
Conclusione
Kimi K4 non dovrebbe essere ridotto a un conteggio di parametri rumorato. K3 dimostra già che Moonshot AI può combinare scala estrema di modelli sparsi, contesto da un milione di token, visione nativa, pesi aperti e comportamento agentico a lungo orizzonte. La vera domanda è se K4 può trasformare quella scala in ingegneria del software più affidabile, migliore uso del computer, loop di feedback multimodali più solidi ed inferenza più efficiente.
I dettagli più importanti restano sconosciuti: architettura esatta, data di rilascio, punteggi di benchmark, licenza, accesso API e costo di serving. Finché Moonshot non pubblica documentazione primaria, ogni specifica di K4 oltre al segnale di sviluppo riportato dovrebbe essere etichettata come aspettativa o inferenza.
Gli sviluppatori non devono aspettare per valutare la direzione attuale di Moonshot AI. Kimi K3 è già disponibile tramite CometAPI, fornendo una baseline pratica per coding, ragionamento a lungo contesto, analisi multimodale e flussi di lavoro agentici in vista dell’arrivo di Kimi K4.
