TLDR: Moonshot AI bracht op 16 juli 2026 Kimi K3 uit – een baanbrekend open-gewichtenmodel met 2,8 biljoen parameters (eerste in de 3T-klasse) met native multimodaliteit, een context van 1 miljoen tokens en frontier-prestaties die rivaliseren met of beter zijn dan topmodellen met gesloten gewichten zoals Claude Fable 5 en GPT-5.6 Sol op het gebied van coderen, agentische taken, frontend-ontwikkeling en kenniswerk.
Belangrijkste punten
- Schaal & innovatie: 2,8T parameters, MoE met 16/896 experts actief, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x schaal-efficiëntie t.o.v. K2, Kimi K3 - Kimi API-platform
- Prestaties: Artificial Analysis Intelligence Index ~57 (top 4, vóór Claude Opus 4.8), leidt Frontend Code Arena, sterk op Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Achter Fable 5/Sol overall maar beter dan de meeste anderen; #1 op Arena.ai Frontend Code Arena (1.679 Elo, boven Fable 5), Arena-post op X en Tom's Hardware-berichtgeving.
- Capabilities: Native vision/video, 1M context voor enorme repos/codebases, agentisch coderen, 3D-redeneren, videobewerking, research-dashboards.
- Toegang: Direct via kimi.com, API (model kimi-k3, toegangsgids); open gewichten binnenkort. Moonshot pauzeerde tijdelijk nieuwe Kimi K3-abonnementen na een vraagpiek. Eenvoudig integreren via CometAPI.
- Waarde: Lagere kosten per taak (~$0,94 in sommige evaluaties), minder weigeringen, ideaal voor coding/Vision-workflows.
Kimi K3 Techblog beschrijft Kimi K3 als "Open Frontier Intelligence, Kimi K3 markeert een kantelpunt in AI-democratisering. Terwijl Chinese AI-labs zoals Moonshot grenzen verleggen ondanks rekenbeperkingen, daagt dit open model de dominantie van gesloten Amerikaanse frontiers uit en stelt het ontwikkelaars wereldwijd in staat."
Wat is Kimi K3? Een open model uit de 3T-klasse van Moonshot AI
Moonshot AI, een startup uit Beijing, lanceerde op 16 juli 2026 Kimi K3 als hun vlaggenschipmodel. Het wordt expliciet gepositioneerd als het eerste open model in de circa 3 biljoen-klasse, met in totaal 2,8 biljoen parameters in een sparse Mixture-of-Experts (MoE) architectuur. Slechts 16 van de 896 experts worden per token geactiveerd, wat enorme schaal met efficiëntie balanceert.
Dit bouwt voort op de Kimi K2-serie (K2.5, K2.6, enz.), die al tractie kreeg voor coderen en multimodaliteit. K3 introduceert architecturale innovaties: Kimi Delta Attention (KDA) en Attention Residuals (AttnRes), plus Stable LatentMoE en quantization-aware training (MXFP4-gewichten, MXFP8-activaties vanaf de SFT-fase). Deze leveren ~2,5x betere schaal-efficiëntie en tot 6,3x snellere decodering vergeleken met voorgangers.
Belangrijkste specificaties (Kimi K3 technische specificaties):
- Parameters: 2,8T totaal (sparse MoE).
- Contextvenster: 1.048.576 tokens (~1M).
- Modaliteiten: Native tekst + beeld + video begrijpen; tekstoutput.
- Max output: Standaard 131k tokens, tot aan de contextlimiet.
- Redeneren: Max effort standaard bij lancering; lagere/hogere modi volgen.
- Open gewichten: Beloofd tegen 27 juli 2026 (gemodificeerde MIT-stijl, naar K2-voorbeeld).
K3 richt zich op long-horizon-taken — niet alleen snelle antwoorden, maar het afronden van complexe engineering-, research- of agent-workflows met visuele feedback ("Vision in the Loop"). Demo’s omvatten autonoom een GPU-compiler bouwen (rivaliserend met Triton), chipontwerp op een 45nm-proces en snelle astrofysica-research.
De vraag heeft de capaciteit al onder druk gezet
De vroege ontvangst van het model was zo sterk dat het capaciteitsdruk veroorzaakte. Moonshot postte op X dat de vraag in de voorafgaande 48 uur dicht bij de huidige GPU-limieten lag en dat nieuwe abonnementen tijdelijk zouden worden gepauzeerd terwijl het bedrijf capaciteit toevoegde. Business Insider meldde dezelfde capaciteits-pauze en merkte op dat bestaande abonnees niet werden getroffen.
Dit is relevant voor productieplanning. Een model kan excellent zijn en toch beschikbaarheidsproblemen hebben als de vraag de compute overstijgt. Teams die Kimi K3 evalueren moeten single-provider-afhankelijkheid vermijden, latency en foutpercentages monitoren en waar mogelijk fallback-routing gebruiken via een unified provider zoals CometAPI .
Code-benchmarks: waar Kimi K3 het sterkst lijkt
Het coderingsprofiel van Kimi K3 is de kernreden waarom ontwikkelaars opletten. Het staat bijna gelijk met GPT-5.6 Sol op Terminal-Bench 2.1, is GPT-5.6 Sol en Claude Fable 5 de baas op Program Bench, en leidt GPT-5.6 Sol met een betekenisvolle marge op FrontierSWE. Het presteert ook beter dan de vergeleken modellen op SWE Marathon in de OpenLM-tabel.
Het Arena-frontendresultaat geeft nog een praktisch signaal. Arena rapporteerde Kimi K3 op 1679 punten op de Frontend Code Arena, vóór Claude Fable 5. Die benchmark is belangrijk omdat frontend-werk vaak wordt beoordeeld op menselijke voorkeur, niet alleen unit tests. Een codeassistent die schone, visueel coherente UI kan produceren vanuit een prompt is waardevol voor productteams, agencies, SaaS-bouwers en interne tools.
Algemene ranglijsten
- Artificial Analysis AI Leaderboard: Binnengekomen op #3. Intelligence Index-scores plaatsen het competitief (bijv. ~57,1 in sommige evaluaties).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 t.o.v. K2.6), alleen achter Fable 5.
Coding & agentische benchmarks (zelf gerapporteerd & onafhankelijk)
K3 blinkt hier uit en benut zijn schaal en architectuur voor duurzame agentische prestaties.
- Frontend Code Arena (Arena.ai): #1 met 1.679 punten, vóór Fable 5 en GPT-5.6 Sol. Excelleert in blinde ontwikkelaarsvoorkeur voor webdev.
- DeepSWE: 67,3–67,5 (sterk, met KimiCode-harnas).
- Program Bench: #1 met 77,8.
- SWE Marathon: #1 met 42,0 (sommige harnesses).
- Terminal-Bench 2.1: Competitief, dicht bij GPT-5.6 Sol.
Visie & multimodaal
Native training (niet achteraf aangebouwd) levert solide resultaten:
- MMMU-Pro: 81,6%
- MathVision: Competitief/hoge 90’s in sommige rapporten.
- OmniDocBench: 91,1% (leidend).
Ondersteunt screenshots, diagrammen, video voor closed-loop-taken zoals UI-verfijning of gamedev.
Vergelijkingstabel: Kimi K3 vs. toonaangevende modellen (Bij benadering/gebundeld uit rapporten; Max Effort waar vermeld)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Opmerkingen/Bron |
|---|---|---|---|---|
| Frontend Code Arena | 1.679 (#1) | Lager | Lager | Arena.ai |
| DeepSWE | 67,3–67,5 | Competitief | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Dichtbij | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Hoger | - | Interne Moonshot |
| Kosten per taak (evals) | ~$0,94 | Hoger | Hoger | Onafhankelijk |
Gegevens afkomstig uit Moonshots technische blog, onafhankelijke ranglijsten en analyses. Resultaten kunnen variëren per harness/effort; verifieer altijd het laatste.
K3 vertoont minder weigeringen bij gevoelige onderwerpen en sterke consistentie in agentische flows. Onafhankelijke tests (bijv. YouTube-evaluaties, Vals AI) bevestigen het als een van de sterkste open modellen voor real-world coderen.
Wat kan Kimi K3? Capaciteiten in coderen, visie en meer
Coderen & agentische engineering
K3 houdt lange sessies vol met minimale supervisie: navigeert enorme repos, gebruikt tools, debugt via screenshots ("vision in the loop").
Voorbeelden:
- Kernel-optimalisatie & compiler-ontwikkeling: Bouwde MiniTriton (Triton-achtige compiler) vanaf nul, rivaliserend met geoptimaliseerde stacks. Optimaliseerde GPU-kernels competitief met Fable 5.
- Gamedev: Zet concepten/afbeeldingen/video’s om in speelbare 3D-/multiplayer-ervaringen met iteratieve verfijning.
- Chipontwerp: Autonome run van 48 uur voor het ontwerpen van een nano-modelchip.
- Frontend: Topprestaties op ranglijsten voor webapps, full-stack taken.
Visie & multimodaal
Native begrip van afbeeldingen/video maakt mogelijk:
- Videobewerking: Monteerde zijn eigen teaser uit 56 clips (selectie, cuts, sync, revisies) – uren werk in minuten.
- 3D-redenering, motion graphics, interactieve dashboards.
- "Vision in the loop" voor code-iteratie via screenshots.
De Kimi API-documentatie toont beeldinvoer via base64 data-URL’s en videoinvoer via geüploade bestanden gerefereerd met ms://. Ze waarschuwen dat publieke afbeeldings-URL’s niet worden ondersteund in vision-invoer, dus ontwikkelaars moeten base64 of geüploade bestandsreferenties sturen en de message content een array van objecten maken. Dat is een belangrijk implementatiedetail: serializeer geen gemengde afbeelding- en tekstboodschap tot één platte string.
Kenniswerk & research
Voor bedrijven kan dit waardevoller zijn dan een normale chatbot. Het model is ontworpen voor "agentisch" werk waarin het een plan kan aanhouden, tools kan aanroepen, tussenresultaten verwerken en een eindartefact produceren. Voorbeelden zijn marktonderzoeksrapporten, data-cleaning-assistenten, compliance-samenvattingen, onderhoud van customer-support-knowledgebases en interne engineering-copilots.
- Genereert consultancy-grade rapporten, interactieve visualisaties, dashboards (bijv. 42 jaar ASIC-industrieanalyse uit duizenden bronnen).
- Wetenschappelijke pipelines: Reproduceerde astrofysische relaties, analyseerde zwaartekrachtgolven met sub-agents.
- Widgets/dashboards in Kimi Work voor persistente, datagedreven views.
K3 overbrugt literatuur naar uitvoerbare code en produceert efficiënt output van publicatiekwaliteit.
Kimi K3 vs. andere frontier-modellen: praktische vergelijking
| Model | Best fit | Sterktes | Let op | CometAPI-aanbeveling |
|---|---|---|---|---|
| Kimi K3 | Long-context coderen, kenniswerk, agents, visuele redenering | 2,8T MoE-schaal, 1M context, sterke code- en agentische benchmarks, open-weight-roadmap | Capaciteitsdruk in lanceringsweek, gevoeligheid voor denkgeschiedenis, vision-ondersteuning kan per route variëren | Testen als vlaggenschip voor coderen en long-context |
| GPT-5.6 Sol | Hard reasoning, coderen, research, brede productie-taken | Zeer sterk algemeen benchmarkprofiel en volwassen tooling | Hogere prijs in veel routes | Gebruiken als vergelijkings- en escalatiemodel |
| Claude Fable 5 | Schrijven, coderen, agentische workflows, mens-voorkeurstaken | Sterke UX en brede frontier-prestaties | Hogere kosten en mogelijke policy-fallbacks bij sommige taken | Vergelijken voor user-facing agents en schrijf-zware apps |
| Claude Opus 4.8 | Diep redeneren en betrouwbaar professioneel werk | Stabiel high-end assistentgedrag | Ouder dan de nieuwste vlaggenschepen | Aanhouden als fallback of benchmark-baseline |
| GLM-5.2 | Kosten-gevoelige open-model-evaluatie | Competitief open-model-alternatief | Zwakker in meerdere genoemde K3-vergelijkingen | Opnemen in kosten/prestatie-routingtests |
Toegang tot Kimi K3: stapsgewijze gids
- Web/App: Bezoek kimi.com of download de Kimi-app (iOS/Android). Selecteer K3 (K3 Max of Swarm Max).
- Kimi Code: Terminal-/IDE-focussed voor ontwikkelaars. Uitstekend voor coding agents.
- API-toegang:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- Haal een API-sleutel op via platform.moonshot.ai/console.
- OpenAI-compatibele SDK-voorbeeld (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Uw prompt"}]
)
Ondersteunt tools, JSON-modus, contextcaching. Prijzen: $3 input, $15 output per M tokens (cache $0,30).
- Aggregators: Gebruik CometAPI (cometapi.com) voor uniforme toegang tot Kimi K3 + 500+ modellen met één sleutel, lagere kosten (20–40% besparing) en eenvoudig wisselen. Perfect voor productie — drop-in OpenAI-compatibel, lage latency.
- Self-hosting: Na 27 juli release van gewichten op Hugging Face. Reken op zware hardware-eisen (supernodes, 64+ accelerators aanbevolen). Community-tools zoals vLLM volgen.
CometAPI-aanbeveling: Integreer Kimi K3 via CometAPI om meerdere sleutels/facturatie te vermijden. Test naast Claude/GPT voor A/B, optimaliseer kosten en schaal betrouwbaar. Hun dashboard volgt gebruik over modellen — ideaal voor het monitoren van K3-experimenten. Meld je aan op cometapi.com voor gratis credits en uniforme toegang.
Eindoordeel
Kimi K3 is een van de belangrijkste modellanceringen van 2026 tot nu toe. Het combineert enorme schaal, een serieuze open-gewichtstrategie, een contextvenster van 1M tokens, native visueel begrip en benchmarkresultaten die het in de buurt brengen van de top van huidige code- en agentische AI-systemen. Het wist de behoefte aan GPT, Claude, Gemini, DeepSeek, Qwen of andere modellen niet uit, maar het geeft ontwikkelaars een geloofwaardig nieuw alternatief voor de moeilijkste long-context-workflows.
Begin vandaag op kimi.com of via CometAPI voor moeiteloze integratie. Experimenteer met de code- en visiestrengths – de resultaten spreken voor zich.
