TL;DR
Grok 4.6 er det stærkere standardvalg, hvis du vil have en administreret frontier-API til agentisk kodning og vidensarbejde: den scorer 61 på Artificial Analysis Intelligence Index, genererer hurtigere i aktuelle uafhængige målinger og starter ved $2/$6 pr. million input/output-tokens.
Kimi K3 er det mere fleksible valg, når kontekstk længde og modelåbenhed er vigtige. Den kombinerer 2,8 billioner parametre, 104B aktive parametre og et kontekstvindue på cirka 1M tokens, plus åbne vægte og native multimodale funktioner. Den hosted API-pris er højere med $3/$15 pr. million input/output-tokens, men cache-træf koster kun $0,30 pr. million tokens.
Kort sagt: vælg Grok 4.6 for en omkostningseffektiv hosted agent-API; vælg Kimi K3 for 1M kontekst, åbne vægte og infrastrukturkontrol. Til kodning: test begge på egne repositories, da leverandørerne offentliggør forskellige benchmark-versioner og harnesses.
Nøglepunkter
- Grok 4.6 blev udgivet den 12. august 2026 med specifikt fokus på langvarige agenter, arbejde med kodebaser, vidensarbejde og mere ambitiøse interaktive eller visuelle projekter.
- Kimi K3 er Moonshot AIs 2,8T-parameter open-weight flagskib med Kimi Delta Attention, Attention Residuals, native vision og et kontekstvindue på cirka 1M tokens.
- Uafhængig samlet intelligens er næsten lige: 61 for Grok 4.6 versus 60 for Kimi K3.
- Grok 4.6 har den lavere headline-tokenpris: $2 input / $6 output versus $3 input / $15 output for Kimi K3.
- Kimi K3 tilbyder omtrent dobbelt kontekstkapacitet og åbne vægte; Grok 4.6 er proprietær, men er mere klar-til-drift og omkostningseffektiv i flere uafhængige agentevalueringer.
Grok 4.6 vs Kimi K3: Hurtig sammenligning
| Specification | Grok 4.6 | Kimi K3 |
|---|---|---|
| Developer | SpaceXAI / xAI | Moonshot AI / Kimi |
| Release date | August 12, 2026 | July 16, 2026 |
| Model ID | grok-4.6 | kimi-k3 |
| Architecture | Not publicly disclosed | MoE; KDA + AttnRes + Stable LatentMoE |
| Total parameters | Not disclosed | 2.8T |
| Active parameters | Not disclosed | 104B |
| Experts | Not disclosed | 896 total; 16 activated/token |
| Context window | 500,000 tokens | 1,048,576 / about 1M tokens |
| Input / output | Text + image → text | Text + image → text |
| Reasoning | Configurable | Always-on; low / high / max |
| Function / tool use | Function calling + structured outputs | ToolCalls, tool_choice, dynamic tool loading |
| Open weights | No | Yes |
| AA Intelligence Index | 61 | 60 |
| Official input / output price | $2 / $6 per MTok | $3 / $15 per MTok |
| Best fit | Hosted agents, coding, knowledge work | Long context, open-weight deployment, coding + visual reasoning |
Hvad er Grok 4.6?
Grok 4.6 er SpaceXAIs frontier-model til kodning, agentiske opgaver og vidensarbejde. Virksomheden siger, at udgivelsen blev bygget op omkring langvarige agenter og mere ambitiært interaktivt og visuelt arbejde, frem for kun at være en statisk benchmark-opdatering. I praksis betyder det, at modellen er tiltænkt at blive på en opgave over mange trin: undersøge et emne, navigere i en kodebase, analysere information, kalde værktøjer og iterere frem mod en færdig applikation eller arbejdsartefakt.
Hvad ændrede sig fra Grok 4.5?
SpaceXAI rapporterer en længere supplemental training-kørsel med kuraterede modelgenererede ræsonneringsdata, avancerede tekniske koncepter, høj-kvalitets engineering-data og en forbedret optimizer og træningsopskrift. Teamet regenererede derefter SFT-forløb med Grok 4.5 på tværs af ræsonneringsindsats og agent-harnesses, filtrerede problematiske spor og anvendte agentisk reinforcement learning i miljøer, der spænder over generel kodning, kerneoptimering, webudvikling, CAD og vidensarbejde.
Det praktiske resultat er en model, der ikke kun scorer højere, men også udviser mere selvtest og verifikation på længere forløb. Den adfærd er vigtig for agenter, fordi omkostningen ved en lille fejl forstørres, når en model får lov at redigere filer, kalde værktøjer eller udføre en flertrinsplan uden konstant menneskelig intervention.
Grok 4.6-specifikationer
| Property | Grok 4.6 |
|---|---|
| Context | 500,000 tokens |
| Modalities | Text and image input; text output |
| Reasoning | Configurable reasoning |
| Native API capabilities | Function calling and structured outputs |
| Knowledge cutoff | February 1, 2026 |
| Short-context pricing | $2 input / $0.50 cached / $6 output per MTok |
| Long-context threshold | ≥200K prompt tokens; $4 / $1 / $12 |
Hvad er Kimi K3?
Kimi K3 er Moonshot AIs open-weight multimodale agentiske flagskibsmodel. Den kombinerer i alt 2,8 billioner parametre med et kontekstvindue på 1M tokens og native vision, hvilket positionerer den til langhorisont-kodning, end-to-end vidensarbejde, ræsonnering og visuelt forankrede softwareopgaver.
I modsætning til Grok 4.6 eksponerer Kimi K3 sine modelvægte. Det aktuelle officielle modelkort identificerer 104B aktive parametre under inferens, så dens compute-sti er langt mindre end det fulde tal på 2,8T parametre, selvom udrulning af den komplette model stadig kræver betydelig infrastruktur.
KDA, AttnRes og en mere sparsom MoE
Arkitekturen er en af K3’s største differentieringer. Moonshot siger, at Kimi Delta Attention (KDA) og Attention Residuals (AttnRes) er designet til at forbedre informationsflowet over lange sekvenser og dybe modellag. Stable LatentMoE øger sparsitet, så 16 af 896 eksperter aktiveres for hvert token. Sammen med trænings- og dataopskiftsændringer rapporterer Moonshot cirka 2,5× bedre samlet skalerings-effektivitet end Kimi K2.
Kimi K3-specifikationer
| Property | Kimi K3 |
|---|---|
| Total / active parameters | 2.8T / 104B |
| Architecture | MoE with KDA + AttnRes + Stable LatentMoE |
| Experts | 896; 16 activated per token |
| Context | 1M tokens |
| Vision | Native visual understanding |
| Reasoning | Always enabled; low / high / max |
| Tools | ToolCalls, tool_choice constraints, dynamic tool loading |
| Open weights | Available on Hugging Face |
| Official pricing | $0.30 cache hit / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: Benchmark-sammenligning
Den reneste direkte sammenligning er det uafhængige Artificial Analysis Intelligence Index, fordi begge modeller evalueres under samme ramme. De aktuelle scorer er 61 for Grok 4.6 (høj) og 60 for Kimi K3 (max). Et énpunktsgab er for lille til at retfærdiggøre et krav om, at den ene model kategorisk er “en generation foran.” Det mere nyttige spørgsmål er, hvor hver model henter sin score.
| Independent metric | Grok 4.6 | Kimi K3 | Edge |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 by 1 point |
| Output speed | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| Time to first token | ~32.3 s | 3.27 s | Kimi K3 |
| Context window | 500K | ~1.05M | Kimi K3 |
Kodningsydelse
SpaceXAI offentliggør flere kodnings- og software-engineering-resultater for Grok 4.6: 69,9% på CursorBench 3.2, 65,9% på DeepSWE 1.1, 61,3% på FrontierCode 1.1 Extended, 56,4% på APEX-SWE og 26,0% på Terminal-Bench 3.0. Disse er meningsfulde, fordi de dækker repository-redigering, agentisk software-engineering og terminalarbejde frem for kun kode-kompletteringstrivia.
| Grok 4.6 vendor-reported coding benchmark | Score |
|---|---|
| CursorBench 3.2 | 69.9% |
| DeepSWE 1.1 | 65.9% |
| FrontierCode 1.1 Extended | 61.3% |
| APEX-SWE | 56.4% |
| Terminal-Bench 3.0 | 26.0% |
For Kimi K3 offentliggør Moonshot en anden men bred kodningssuite. Den officielle lancering omtaler 67,5 på DeepSWE, 88,3 på Terminal-Bench 2.1, 81,2 på FrontierSWE, 77,8 på ProgramBench og 42,0 på SWE Marathon. Den vigtige caveat er, at Terminal-Bench 2.1 og 3.0 er forskellige versioner, og FrontierSWE er ikke den samme evaluering som FrontierCode. Disse rækker bør ikke behandles som æbler-til-æbler-sejre baseret alene på det rå tal.

Kilde: Moonshot AI / Kimi
Agentisk og vidensarbejde
Agentisk arbejde er der, hvor Grok 4.6 ser stærkest ud. SpaceXAI rapporterer 1753 Elo på GDPVal-AA v2, 57,5% på APEX-Agents og 1577 Elo på AA-Briefcase. Artificial Analysis fremhæver uafhængigt det samme mønster: Grok 4.6’s stærkeste gevinster er på langhorisont, værktøjsbrugende arbejde frem for kun statisk ræsonnering.
Kimi K3 målretter også vidensarbejdsagenter. Moonshots lanceringssuite viser stærke resultater på BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 og visuelle agent-evalueringer. Mere vigtigt for udviklere: Kimi-API’et eksponerer værktøjsvalgsbegrænsninger og dynamic tool loading, som er praktiske kontroller, når en agent skal bruge virksomhedssystemer eller hente fakta før besvarelse.

Kilde: Moonshot AI / Kimi
Multimodal og visuel ræsonnering
Kimi K3 har den tydeligere arkitektur-niveau multimodale historie: Moonshot beskriver native vision-kapaciteter og demonstrerer specifikt “vision in the loop” til spiludvikling, frontend-engineering og CAD, hvor modellen kan inspicere visuelt feedback og revidere kode.
Grok 4.6 accepterer også tekst- og billedinput, og SpaceXAI siger, at modellen producerer stærkere første forsøg på visuelle og interaktive projekter end Grok 4.5. Forskellen handler mindre om, hvorvidt en model kan se billeder, og mere om udrulningsfilosofi: Kimi eksponerer en åben multimodal model, mens Grok pakker visuel forståelse ind i en administreret frontier-API og agent-økosystem.
Kontekstvindue: 500K vs 1M
Grok 4.6 understøtter 500.000 tokens, mens Kimi K3 understøtter omkring 1 million tokens. Det gør Kimi til det oplagte valg, når arbejdsbelastningen reelt kræver mere end 500K tokens i én forespørgsel – for eksempel meget store repositories, flerbogs-forskningssamlinger eller exceptionelt lange agent-forløb.
Men kontekststørrelse er kapacitet, ikke en garanti for indhentning eller ræsonneringskvalitet. For produktionssystemer: test modellen på dine faktiske langkontekst-fejltilstande – sporing af afhængigheder på tværs af filer, fjern faktaindhentning, detektion af modsigelser og instruktionpersistens. Retrieval-augmented generation kan stadig være billigere og mere kontrollerbar end at sende en million tokens ved hver forespørgsel.
Hastighed og latenstid
Artificial Analysis måler i øjeblikket Grok 4.6 til 65,8 output-tokens pr. sekund og Kimi K3 til 40,7 tokens pr. sekund. Når genereringen først starter, er Grok væsentligt hurtigere i denne måling. Men mønstret for første token går den anden vej: Kimi K3 har en målt TTFT på 3,27 sekunder, mens Grok 4.6’s nuværende providermåling er meget langsommere til at begynde streaming.
Det skaber en nyttig produktdifferentiering. Til interaktiv chat eller IDE-oplevelser kan hurtig tid-til-første-token få Kimi til at føles responsiv, selv hvis det fulde svar tager længere. Til lange genereringer og agent-kørsler kan Groks højere genererings-throughput reducere halen af forespørgslen. Provider, region, ræsonneringsindsats, cachestatus og forespørgselsstørrelse kan alle ændre disse tal, så betragt dem som en aktuel snapshot frem for en permanent egenskab.
Grok 4.6 vs Kimi K3: API-priser
Ved standard kontekster koster Grok 4.6 $2 pr. million input-tokens, $0,50 pr. million cachede tokens og $6 pr. million output-tokens. For prompts på eller over 200K tokens fakturerer xAI hele forespørgslen til langkontekst-satser på $4 input, $1 cached og $12 output pr. million tokens.
Kimi bruger flad pay-as-you-go-prissætning på tværs af sit 1M kontekstvindue. Kimi-API’et angiver $0,30 pr. million cache-hit tokens, $3 pr. million input-tokens og $15 pr. million output-tokens. Det betyder, at Kimi er billigere ved cache-træf, men langt dyrere ved friske output-tokens; Groks prisfordel indsnævres, når Grok-forespørgsler krydser 200K langkontekst-tærsklen.

Headline officielle API-priser pr. 1M tokens. Grok-langkontekst-forespørgsler (≥200K prompt-tokens) bruger højere satser, som ikke vises i diagrammet. Kilde: SpaceXAI and Kimi API pricing
| Price / 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| Official short-context input | $2.00 | $3.00 |
| Official cache hit | $0.50 | $0.30 |
| Official output | $6.00 | $15.00 |
| Long-context pricing | ≥200K: $4 / $1 / $12 | Flat pricing through 1M context |
| CometAPI input | $1.60 | $2.40 |
| CometAPI output | $4.80 | $12.00 |
På CometAPI er Grok 4.6 i øjeblikket listet til $1,60 input / $4,80 output pr. million tokens, mens Kimi K3 er listet til $2,40 input / $12 output. Begge er 20% under leverandørernes headline input/output-priser, som vises på deres CometAPI-modelsider på tidspunktet for skrivning.
Åbne vægte vs. proprietær model
Kimi K3 er en open-weight model med downloadbare vægte. Det muliggør forskning, finmasket infrastrukturkontrol, private inferensarkitekturer og udrulning gennem tredjeparts inferensstakke. Det betyder ikke, at K3 er letvægts: en 2,8T-parameter model er et seriøst systemprojekt, selv med MoE-sparsitet og lavpræcisionsformater.
Grok 4.6 er proprietær. Dens arkitektur og parameterantal er ikke offentligt offentliggjort, og udviklere får adgang til den som en administreret tjeneste. Trade-off’et er operationel enkelhed: du behøver ikke opbygge en inferensklynge, administrere modelvægte eller optimere kerner for at få agent-præstation på frontier-niveau.
Styrker og svagheder
| Model | Strengths | Trade-offs |
|---|---|---|
| Grok 4.6 | Lower hosted API price; 61 AA Intelligence; faster measured generation; strong long-horizon agent results; integrated xAI tool stack | 500K context; closed weights; long-context pricing doubles; slower measured TTFT |
| Kimi K3 | ~1M context; open weights; 2.8T MoE; native multimodality; strong coding/agent suite; very low cache-hit price | Higher output price; slower measured token generation; full self-hosting is infrastructure-heavy |
Grok 4.6 vs Kimi K3: Hvad bør du vælge?
| Use case | Recommended | Why |
|---|---|---|
| Default frontier API | Grok 4.6 | Lower price with a slight independent intelligence lead |
| Long-running knowledge-work agent | Grok 4.6 | Strongest evidence from GDPVal-AA and AA-Briefcase |
| Repository-scale coding | Test both | Both are designed for long-horizon coding; benchmark suites differ |
| Prompt >500K tokens | Kimi K3 | About 1M context |
| Open-weight research | Kimi K3 | Weights and architecture are available |
| Private/self-managed inference | Kimi K3 | Open weights enable custom deployment |
| Low cache-hit cost | Kimi K3 | $0.30/MTok cache-hit pricing |
| Lower fresh output-token cost | Grok 4.6 | $6/MTok vs $15/MTok at standard context |
| Fast first visible response | Kimi K3 | Much lower measured TTFT |
| Faster long generation | Grok 4.6 | Higher measured output tokens/s |
| Visual coding / CAD / game workflows | Kimi K3 | Native vision + official vision-in-the-loop focus |
Den overordnede anbefaling: Grok 4.6 er den stærkere standard hosted API for de fleste agentudviklere. Kimi K3 er den mere fleksible frontier-model, når 1M kontekst, åbne vægte og udrulningskontrol er en del af kravet frem for valgfrie ekstraer.
Sådan får du adgang til Grok 4.6 og Kimi K3 via CometAPI
Begge modeller er live på CometAPI. Grok 4.6-modelsiden angiver model-ID’et grok-4.6 og support til Chat Completions/Responses-stil adgang, mens Kimi K3-modelsiden eksponerer kimi-k3 via den forenede CometAPI-endpoint. Det gør A/B-testning lettere, fordi du kan skifte model-ID’er, mens du bevarer autentificering og det meste af applikationsinfrastrukturen konstant.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Review this repository bug and propose a tested fix."}
],
)
print(model, response.choices[0].message.content)
Til en produktions-evaluering: hold prompt, værktøjer, repository-snapshot og succeskriterier identiske. Spor ikke kun svarenes kvalitet, men også værktøjskalds-succes, antal ture, totale input/output-tokens, latenstid og recovery fra mislykkede værktøjskald. Det er mere forudsigende for reel agentomkostning end en enkelt benchmark-score.
Konklusion
Det vigtigste resultat af sammenligningen Grok 4.6 vs Kimi K3 er, at deres top-line intelligens er langt tættere end deres produktdesign. Uafhængig evaluering placerer dem i øjeblikket på 61 versus 60, men de omkringliggende økonomier og udrulningsvalg er meget forskellige.
Grok 4.6 er optimeret som en administreret frontier-tjeneste: lavere pris for friske tokens, stærke agentiske benchmarks, hurtigere målt generering og en moden værktøjs-/API-vej. Kimi K3 er optimeret til fleksibilitet: et kontekstvindue på 1M, 2,8T MoE-skala, native multimodalitet og åbne vægte.
For de fleste udviklere, der blot har brug for den bedste standard hosted model til kodning og langvarige agenter, er Grok 4.6 det sikrere udgangspunkt. Hvis dit system afhænger af >500K kontekst, open-weight udrulning, visuel kodning eller kontrol over inferensstakken, kan Kimi K3 være det bedre arkitekturvalg, selv når dens hosted tokenpris er højere.
Ofte stillede spørgsmål
Er Grok 4.6 smartere end Kimi K3?
På det aktuelle Artificial Analysis Intelligence Index scorer Grok 4.6 61 og Kimi K3 60. Det er en snæver føring, ikke et afgørende gab. Opgaveniveauets præstation kan vende afhængigt af arbejdsbelastningen.
Hvilken er bedst til kodning?
Begge er troværdige kodningsmodeller. Grok 4.6 har stærke aktuelle agentiske kodningsresultater og lavere hosted prissætning; Kimi K3 tilbyder et større kontekstvindue, åbne vægte og stærke repository-/visuelle kodningsresultater. Brug din egen repo-benchmark, da leverandørerne rapporterer forskellige benchmark-versioner.
Hvilken model har det større kontekstvindue?
Kimi K3 understøtter omkring 1M tokens, cirka dobbelt Grok 4.6’s kontekstvindue på 500K tokens.
Hvilken er billigst?
Ved standard-kontekst friske tokens er Grok 4.6 billigere med $2 input / $6 output pr. MTok versus $3 / $15 for Kimi K3. Kimi har den billigere rate for cache-træf på $0,30/MTok, mens Grok anvender højere rater, når prompten når 200K tokens.
Kan jeg self-hoste Kimi K3?
Kimi K3 har åbne vægte tilgængelige på Hugging Face, så selvadministreret udrulning er mulig. Den fulde 2,8T-model er ikke desto mindre ekstremt stor og kræver seriøs multi-node eller specialiseret inferensinfrastruktur for praktisk ydeevne.
Kan jeg self-hoste Grok 4.6?
Der er ingen offentlige Grok 4.6-vægte tilgængelige. Grok 4.6 leveres som en proprietær administreret model via SpaceXAI og partner-API’er.
Kan jeg få adgang til begge via én API?
Ja. CometAPI lister i øjeblikket både Grok 4.6 og Kimi K3, hvilket giver udviklere mulighed for at sammenligne dem bag en forenet API- og faktureringslag.
