TLDR: Moonshot AI udgav Kimi K3 den 16. juli 2026 – en banebrydende open-weights-model med 2,8 billioner parametre (første i 3T-klassen) med indbygget multimodalitet, kontekstvindue på 1 million tokens og frontier-ydelse, der matcher eller slår top-proprietære modeller som Claude Fable 5 og GPT-5.6 Sol inden for kodning, agentiske opgaver, frontend-udvikling og vidensarbejde.
Vigtigste pointer
- Skala og innovation: 2,8T parametre, MoE med 16/896 aktive eksperter, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x skaleringseffektivitet ift. K2, Kimi K3 - Kimi API Platform
- Ydelse: Artificial Analysis Intelligence Index ~57 (top 4, foran Claude Opus 4.8), fører Frontend Code Arena, stærk på Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Ligger efter Fable 5/Sol samlet set, men slår de fleste andre; nr. 1 på Arena.ai Frontend Code Arena (1.679 Elo, slår Fable 5), Arena-opslag på X og Tom’s Hardware-dækning.
- Kapabiliteter: Naturlig vision/video, 1M kontekst til massive repos/kodebaser, agentisk kodning, 3D-ræsonnering, videoredigering, forskningsdashboards.
- Adgang: Straks via kimi.com, API (modellen kimi-k3, adgangsvejledning); åbne vægte snart. Moonshot satte midlertidigt nye Kimi K3-abonnementer på pause efter en efterspørgselsstigning. Integrér nemt via CometAPI.
- Værdi: Lavere omkostning pr. opgave (~$0,94 i nogle evals), færre afslag, ideel til kodnings-/Vision-workflows.
Kimi K3 Tech Blog beskriver Kimi K3 som "Open Frontier Intelligence, Kimi K3 markerer et afgørende øjeblik i AI-demokratiseringen. Efterhånden som kinesiske AI-labs som Moonshot skubber grænserne trods beregningsmæssige begrænsninger, udfordrer denne åbne model dominansen af lukkede amerikanske frontier-modeller og giver udviklere over hele verden nye muligheder."
Hvad er Kimi K3? En åben 3T-klasse-model fra Moonshot AI
Moonshot AI, en Beijing-baseret startup, lancerede Kimi K3 den 16. juli 2026 som sin flagskibsmodel. Den positioneres eksplicit som den første åbne model i ca. 3 billioners-parameter-klassen med 2,8 billioner samlede parametre i en sparsom Mixture-of-Experts (MoE)-arkitektur. Kun 16 af 896 eksperter aktiveres pr. token, hvilket balancerer massiv skala med effektivitet.
Dette bygger på Kimi K2-serien (K2.5, K2.6 osv.), som allerede fik momentum inden for kodning og multimodalitet. K3 introducerer arkitektoniske innovationer: Kimi Delta Attention (KDA) og Attention Residuals (AttnRes) samt Stable LatentMoE og kvantisering-bevidst træning (MXFP4-vægte, MXFP8-aktiveringer fra SFT-stadiet). Disse giver ~2,5x bedre skaleringseffektivitet og op til 6,3x hurtigere dekodning sammenlignet med forgængerne.
Nøglespecifikationer ( Kimi K3 Technical Specifications):
- Parametre: 2,8T total (sparsom MoE).
- Kontekstvindue: 1,048,576 tokens (~1M).
- Modaliteter: Indbygget tekst + billede + videoforståelse; tekstoutput.
- Maks. output: Standard 131k tokens, op til kontekstgrænsen.
- Ræsonnering: Max effort som standard ved lancering; lavere/højere tilstande kommer.
- Åbne vægte: Lovet inden 27. juli 2026 (modificeret MIT-stil, jf. K2-præcedens).
K3 sigter mod opgaver med lang horisont — ikke kun hurtige svar, men at fuldføre komplekse ingeniør-, forsknings- eller agent-workflows med visuelt feedback ("Vision in the Loop"). Demoer inkluderer autonom GPU-compiler-udvikling (på niveau med Triton), chipdesign på 45nm-proces og hurtig astrofysikforskning.
Efterspørgslen har allerede presset kapaciteten
Modellens tidlige modtagelse har været så stærk, at den har skabt kapacitetspres. Moonshot skrev på X, at efterspørgslen over de foregående 48 timer havde presset tæt på de nuværende GPU-grænser, og at nye abonnementer midlertidigt ville blive sat på pause, mens virksomheden udvider kapaciteten. Business Insider rapporterede den samme kapacitetspause og bemærkede, at eksisterende abonnenter ikke var berørt.
Dette har betydning for produktionsplanlægning. En model kan være fremragende og stadig opleve tilgængelighedsproblemer, hvis efterspørgslen overstiger compute. Teams, der evaluerer Kimi K3, bør undgå afhængighed af én udbyder, overvåge latenstid og fejlrater og bruge fallback-routing via en samlet udbyder som CometAPI hvor det er muligt.
Kodningsbenchmarks: Hvor Kimi K3 ser stærkest ud
Kimi K3’s kodningsprofil er hovedårsagen til, at udviklere er opmærksomme. Den er næsten på linje med GPT-5.6 Sol på Terminal-Bench 2.1, overgår GPT-5.6 Sol og Claude Fable 5 på Program Bench og fører GPT-5.6 Sol med en meningsfuld margin på FrontierSWE. Den overgår også de sammenlignede modeller på SWE Marathon i OpenLM-tabellen.
Arena-frontend-resultatet tilføjer et andet praktisk signal. Arena rapporterede Kimi K3 på 1679 point på Frontend Code Arena, foran Claude Fable 5. Den benchmark er vigtig, fordi frontend-arbejde ofte vurderes efter menneskelig præference, ikke kun unit-tests. En kodningsassistent, der kan producere ren, visuelt sammenhængende UI ud fra en prompt, er værdifuld for produktteams, bureauer, SaaS-byggere og interne værktøjer.
Overordnede ranglister
- Artificial Analysis AI Leaderboard: Debut som #3. Intelligence Index-scorer placerer den konkurrencedygtigt (fx ~57,1 i nogle evals).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 fra K2.6), kun slået af Fable 5.
Kodning og agentiske benchmarks (selvrapporterede og uafhængige)
K3 skinner her og udnytter sin skala og arkitektur til vedvarende agentisk performance.
- Frontend Code Arena (Arena.ai): #1 med 1.679 point, slår Fable 5 og GPT-5.6 Sol. Ekscellerer i blind udviklerpræference for webudvikling.
- DeepSWE: 67,3–67,5 (stærk, med KimiCode-harness).
- Program Bench: #1 med 77,8.
- SWE Marathon: #1 med 42,0 (nogle harnesses).
- Terminal-Bench 2.1: Konkurrencedygtig, tæt på GPT-5.6 Sol.
Vision og multimodal
Naturlig træning (ikke bolt-on) giver solide resultater:
- MMMU-Pro: 81,6%
- MathVision: Konkurrencedygtig/høje 90’ere i nogle rapporter.
- OmniDocBench: 91,1% (fører).
Understøtter screenshots, diagrammer, video til closed-loop-opgaver som UI-forfining eller spiludvikling.
Sammenligningstabel: Kimi K3 vs. førende modeller (omtrentlig/kompileret fra rapporter; Max Effort hvor angivet)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Noter/Kilde |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Lavere | Lavere | Arena.ai |
| DeepSWE | 67.3–67.5 | Konkurrencedygtig | - | Moonshot/KimiCode |
| Program Bench | 77.8 (#1) | - | Tæt på | Vals.ai |
| Intelligence Index (AA) | ~57.1 | ~59.9 | ~58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Højere | - | Intern Moonshot |
| Omkostning pr. opgave (Evals) | ~$0.94 | Højere | Højere | Uafhængig |
Data hentet fra Moonshots tekniske blog, uafhængige ranglister og analyser. Resultater kan variere efter harness/indsats; verificér altid det seneste.
K3 viser færre afslag på følsomme emner og stærk konsistens i agentiske flows. Uafhængige tests (fx YouTube-evals, Vals AI) bekræfter den som en af de stærkeste åbne modeller til kodning i den virkelige verden.
Hvad kan Kimi K3 gøre? Kapabiliteter i kodning, vision og mere
Kodning og agentisk ingeniørarbejde
K3 fastholder lange sessioner med minimal supervision: navigerer i massive repos, bruger værktøjer, debugger via screenshots ("Vision in the Loop").
Eksempler:
- Kernel-optimering og compiler-udvikling: Byggede MiniTriton (Triton-lignende compiler) fra bunden og matcher optimerede stacks. Optimerede GPU-kernels på niveau med Fable 5.
- Spiludvikling: Omdanner koncepter/billeder/videoer til spilbare 3D-/multiplayer-oplevelser med iterativ forfining.
- Chipdesign: Autonom 48-timers kørsel, der designede en nanomodel-chip.
- Frontend: Topper ranglister for webapps, full-stack-opgaver.
Vision og multimodal
Indbygget forståelse af billeder/video muliggør:
- Videoredigering: Redigerede sin egen teaser ud fra 56 klip (udvælgelse, cuts, sync, revisioner) – timers arbejde på minutter.
- 3D-ræsonnering, motion graphics, interaktive dashboards.
- "Vision in the loop" til kodeiteration via screenshots.
Kimi API-dokumentationen viser billedinput via base64-data-URL’er og videoinput via uploadede filer refereret af ms://. De advarer også om, at offentlige billed-URL’er ikke understøttes i vision-input, så udviklere bør sende base64 eller referencer til uploadede filer og gøre beskedindhold til et array af objekter. Det er en vigtig implementeringsdetalje: serialiser ikke en blandet billede- og tekstbesked til én ren streng.
Vidensarbejde og forskning
For virksomheder kan dette være mere værdifuldt end en normal chatbot. Modellen er designet til "agentisk" arbejde, hvor den kan vedligeholde en plan, kalde værktøjer, behandle mellemliggende resultater og producere et endeligt artefakt. Eksempler inkluderer markedsundersøgelsesrapporter, dataoprydningsassistenter, compliance-resuméer, vedligeholdelse af kundesupport-vidensbaser og interne ingeniør-copilots.
- Genererer konsulent-grade rapporter, interaktive visualiseringer, dashboards (fx 42-årig ASIC-brancheanalyse fra tusindvis af kilder).
- Videnskabelige pipelines: Reproducerede astrofysiske relationer, analyserede gravitationsbølger med sub-agenter.
- Widgets/dashboards i Kimi Work til persistente, datadrevne visninger.
K3 bygger bro fra litteratur til eksekverbar kode og producerer publikation-kvalitets outputs effektivt.
Kimi K3 vs. andre frontier-modeller: Praktisk sammenligning
| Model | Bedst egnet | Styrker | Opmærksomhedspunkter | CometAPI-anbefaling |
|---|---|---|---|---|
| Kimi K3 | Lang-kontekst kodning, vidensarbejde, agenter, visuel ræsonnering | 2,8T MoE-skala, 1M kontekst, stærke kode- og agentiske benchmarks, open-weight-roadmap | Kapacitetspres i lanceringsugen, følsomhed over for tænkehistorik, vision-understøttelse kan variere efter rute | Test som flagskibsmodel til kodning og lang kontekst |
| GPT-5.6 Sol | Hård ræsonnering, kodning, forskning, brede produktionstasks | Meget stærk samlet benchmarkprofil og moden tooling | Højere pris på mange ruter | Brug som sammenligning og eskaleringsmodel |
| Claude Fable 5 | Skrivning, kodning, agentiske workflows, menneskepræference-opgaver | Stærk UX og bred frontier-ydelse | Højere omkostninger og mulige policy-fallbacks i nogle opgaver | Sammenlign til brugerrettede agenter og skrive-tunge apps |
| Claude Opus 4.8 | Dyb ræsonnering og pålideligt professionelt arbejde | Stabil high-end assistentadfærd | Ældre end de nyeste flagskibsudgivelser | Behold som fallback eller benchmark-baseline |
| GLM-5.2 | Omkostningssensitiv evaluering af åbne modeller | Konkurrencedygtigt åbent modelalternativ | Svagere i flere af de nævnte K3-sammenligninger | Medtag i cost/ydelses-routing-tests |
Sådan får du adgang til Kimi K3: Trin-for-trin
- Web/App: Besøg kimi.com eller download Kimi-appen (iOS/Android). Vælg K3 (K3 Max eller Swarm Max).
- Kimi Code: Terminal/IDE-fokuseret til udviklere. Fremragende til kodeagenter.
- API-adgang:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- Få API-nøgle på platform.moonshot.ai/console.
- OpenAI-kompatibelt SDK-eksempel (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Understøtter værktøjer, JSON-tilstand, kontekst-caching. Priser: $3 input, $15 output pr. M tokens (cache $0.30).
- Aggregatorer: Brug CometAPI (cometapi.com) for samlet adgang til Kimi K3 + 500+ modeller med én nøgle, lavere omkostninger (20–40% besparelse) og nem switching. Perfekt til produktion — drop-in OpenAI-kompatibel, lav latenstid.
- Self-hosting: Efter 27. juli frigivelse af vægte på Hugging Face. Forvent store hardwarekrav (supernoder, 64+ acceleratorer anbefales). Community-værktøjer som vLLM følger.
CometAPI-anbefaling: Integrér Kimi K3 via CometAPI for at undgå flere nøgler/fakturering. Test side om side med Claude/GPT til A/B, optimer omkostninger og skalér pålideligt. Deres dashboard sporer forbrug på tværs af modeller — ideelt til overvågning af K3-eksperimenter. Tilmeld dig på cometapi.com for gratis credits og samlet adgang.
Endelig vurdering
Kimi K3 er en af de vigtigste modellanceringer i 2026 indtil videre. Den kombinerer enorm skala, en seriøs open-weight-strategi, et kontekstvindue på 1M tokens, indbygget visuel forståelse og benchmarkresultater, der placerer den tæt på toppen af de nuværende kodnings- og agentiske AI-systemer. Den eliminerer ikke behovet for GPT, Claude, Gemini, DeepSeek, Qwen eller andre modeller, men giver udviklere en troværdig ny mulighed til de hårdeste lang-kontekst-workflows.
Start i dag på kimi.com eller via CometAPI for problemfri integration. Eksperimentér med dens styrker inden for kodning og vision – resultaterne taler for sig selv.
