TL;DR
Grok 4.6 er det sterkere standardvalget hvis du vil ha en administrert frontier-API for agentisk koding og kunnskapsarbeid: den scorer 61 på Artificial Analysis Intelligence Index, genererer raskere i nåværende uavhengige målinger, og starter på $2/$6 per million input/output-tokens.
Kimi K3 er det mer fleksible valget når kontekstvindu og modellåpenhet er viktig. Den kombinerer 2,8 billioner (T) parametere, 104B aktive parametere og et kontekstvindu på omtrent 1M tokens, pluss åpne vekter og native multimodale egenskaper. Overskriftsprisen for den hostede API-en er høyere med $3/$15 per million input/output-tokens, men cache-treff koster kun $0.30 per million tokens.
Kort sagt: velg Grok 4.6 for en kostnadseffektiv hostet agent-API; velg Kimi K3 for 1M kontekst, åpne vekter og infrastrukturkontroll. For koding, test begge på dine egne repos fordi leverandørene publiserer ulike benchmark-versjoner og harnesses.
Key Takeaways
- Grok 4.6 ble lansert 12. august 2026 med spesifikt fokus på langvarige agenter, arbeid i kodebaser, kunnskapsarbeid og mer ambisiøse interaktive eller visuelle prosjekter.
- Kimi K3 er Moonshot AIs 2.8T-parameter open-weight flaggskip med Kimi Delta Attention, Attention Residuals, native visjon og et kontekstvindu på 1M tokens.
- Uavhengig samlet intelligens er nesten lik: 61 for Grok 4.6 versus 60 for Kimi K3.
- Grok 4.6 har lavere overskriftspris per token: $2 input / $6 output versus $3 input / $15 output for Kimi K3.
- Kimi K3 tilbyr omtrent dobbel kontekstkapasitet og åpne vekter; Grok 4.6 er proprietær, men er mer turn- og kostnadseffektiv i flere uavhengige agentevalueringer.
Grok 4.6 vs Kimi K3: Quick Comparison
| Spesifikasjon | Grok 4.6 | Kimi K3 |
|---|---|---|
| Utvikler | SpaceXAI / xAI | Moonshot AI / Kimi |
| Lanseringsdato | 12. august 2026 | 16. juli 2026 |
| Modell-ID | grok-4.6 | kimi-k3 |
| Arkitektur | Ikke offentliggjort | MoE; KDA + AttnRes + Stable LatentMoE |
| Totalt antall parametere | Ikke offentliggjort | 2.8T |
| Aktive parametere | Ikke offentliggjort | 104B |
| Eksperter | Ikke offentliggjort | 896 total; 16 aktivert/token |
| Kontekstvindu | 500,000 tokens | 1,048,576 / omtrent 1M tokens |
| Input / output | Tekst + bilde → tekst | Tekst + bilde → tekst |
| Resonnering | Konfigurerbar | Alltid på; lav / høy / maks |
| Funksjons-/verktøybruk | Funksjonskall + strukturerte utdata | ToolCalls, tool_choice, dynamisk verktøyinnlasting |
| Åpne vekter | Nei | Ja |
| AA Intelligence Index | 61 | 60 |
| Offisiell input-/outputpris | $2 / $6 per MTok | $3 / $15 per MTok |
| Best egnet | Hostede agenter, koding, kunnskapsarbeid | Lang kontekst, open-weight utrulling, koding + visuell resonnering |
What Is Grok 4.6?
Grok 4.6 er SpaceXAI sitt frontier-modell for koding, agentiske oppgaver og kunnskapsarbeid. Selskapet sier at lanseringen ble bygget rundt langvarige agenter og mer ambisiøst interaktivt og visuelt arbeid, snarere enn å være kun en statisk benchmark-oppfriskning. I praksis betyr det at modellen er ment å holde seg på en oppgave over mange steg: undersøke et tema, navigere i en kodebase, analysere informasjon, kalle verktøy og iterere mot en ferdig applikasjon eller arbeidsartefakt.
What Changed From Grok 4.5?
SpaceXAI rapporterer en lengre supplemental training-kjøring med kuratert modellgenerert resonneringsdata, avanserte tekniske konsepter, høykvalitets ingeniørdata og en forbedret optimizer og treningsoppskrift. Teamet regenererte deretter SFT-trajektorier med Grok 4.5 på tvers av resonnement og agent-harnesses, filtrerte problematiske spor, og anvendte agentisk forsterkningslæring i miljøer som spenner over generell koding, kjerneoptimalisering, webutvikling, CAD og kunnskapsarbeid.
Det praktiske resultatet er en modell som ikke bare scorer høyere, men også viser mer egen-testing og verifikasjon på lengre trajektorier. Denne oppførselen er viktig for agenter fordi kostnaden av en liten feil øker når en modell får lov til å redigere filer, kalle verktøy eller utføre en flerstegs plan uten konstant menneskelig intervensjon.
Grok 4.6 Specifications
| Egenskap | Grok 4.6 |
|---|---|
| Kontekst | 500,000 tokens |
| Modaliteter | Tekst og bildeinput; tekstoutput |
| Resonnering | Konfigurerbar resonnering |
| Native API-funksjoner | Funksjonskall og strukturerte utdata |
| Kunnskapsavskjæring | 1. februar 2026 |
| Prising for kort kontekst | $2 input / $0.50 cachet / $6 output per MTok |
| Terskel for lang kontekst | ≥200K prompt-tokens; $4 / $1 / $12 |
What Is Kimi K3?
Kimi K3 er Moonshot AIs flaggskip open-weight multimodal agentisk modell. Den kombinerer 2.8T totale parametere med et kontekstvindu på 1M tokens og native visjon, og posisjonerer seg for langhorisont koding, ende-til-ende kunnskapsarbeid, resonnering og visuelt forankrede programvareoppgaver.
I motsetning til Grok 4.6 eksponerer Kimi K3 modellvektene. Den nåværende offisielle modellkortet identifiserer 104B aktive parametere under inferens, så beregningsveien er langt mindre enn de fulle 2.8T parameterne, selv om utrulling av hele modellen fortsatt krever betydelig infrastruktur.
KDA, AttnRes and a More Sparse MoE
Arkitekturen er en av K3s største differensiatorer. Moonshot sier at Kimi Delta Attention (KDA) og Attention Residuals (AttnRes) er designet for å forbedre informasjonsflyt på tvers av lange sekvenser og dype modellag. Stable LatentMoE øker sparsomhet slik at 16 av 896 eksperter aktiveres for hver token. Sammen med endringer i trening og dataoppskrift rapporterer Moonshot omtrent 2,5× bedre samlet skaleringseffektivitet enn Kimi K2.
Kimi K3 Specifications
| Egenskap | Kimi K3 |
|---|---|
| Totale / aktive parametere | 2.8T / 104B |
| Arkitektur | MoE med KDA + AttnRes + Stable LatentMoE |
| Eksperter | 896; 16 aktivert per token |
| Kontekst | 1M tokens |
| Visjon | Native visuell forståelse |
| Resonnering | Alltid aktivert; lav / høy / maks |
| Verktøy | ToolCalls, tool_choice-begrensninger, dynamisk verktøyinnlasting |
| Åpne vekter | Tilgjengelig på Hugging Face |
| Offisiell prising | $0.30 cache-treff / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: Benchmark Comparison
Den reneste direkte sammenligningen er den uavhengige Artificial Analysis Intelligence Index fordi begge modellene evalueres under samme rammeverk. Nåværende scorer er 61 for Grok 4.6 (høy) og 60 for Kimi K3 (maks). En ett-poengs differanse er for liten til å begrunne et krav om at én modell er kategorisk «en generasjon foran». Det mer nyttige spørsmålet er hvor hver modell tjener sin score.
| Uavhengig målemetode | Grok 4.6 | Kimi K3 | Fordel |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 med 1 poeng |
| Utdatahastighet | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| Tid til første token | ~32.3 s | 3.27 s | Kimi K3 |
| Kontekstvindu | 500K | ~1.05M | Kimi K3 |
Coding Performance
SpaceXAI publiserer flere kode- og programvareingeniørresultater for Grok 4.6: 69,9 % på CursorBench 3.2, 65,9 % på DeepSWE 1.1, 61,3 % på FrontierCode 1.1 Extended, 56,4 % på APEX-SWE og 26,0 % på Terminal-Bench 3.0. Disse er meningsfulle fordi de dekker repository-redigering, agentisk programvareingeniørarbeid og terminalarbeid snarere enn kun kodefullførings-trivia.
| Grok 4.6 – leverandørrapporterte kodebenchmarker | Score |
|---|---|
| CursorBench 3.2 | 69,9% |
| DeepSWE 1.1 | 65,9% |
| FrontierCode 1.1 Extended | 61,3% |
| APEX-SWE | 56,4% |
| Terminal-Bench 3.0 | 26,0% |
For Kimi K3 publiserer Moonshot en annen, men bred kodepakke. Det offisielle lanseringsmaterialet rapporterer 67,5 på DeepSWE, 88,3 på Terminal-Bench 2.1, 81,2 på FrontierSWE, 77,8 på ProgramBench og 42,0 på SWE Marathon. Den viktige forbeholdet er at Terminal-Bench 2.1 og 3.0 er ulike versjoner, og at FrontierSWE ikke er samme evaluering som FrontierCode. Disse radene bør ikke behandles som direkte sammenlignbare seire kun basert på råtallet.

Kilde: Moonshot AI / Kimi
Agentic and Knowledge Work
Agentisk arbeid er der Grok 4.6 ser sterkest ut. SpaceXAI rapporterer 1753 Elo på GDPVal-AA v2, 57,5 % på APEX-Agents og 1577 Elo på AA-Briefcase. Artificial Analysis fremhever uavhengig det samme mønsteret: Grok 4.6s sterkeste gevinster er på langhorisont, verktøybrukende arbeid snarere enn kun statisk resonnering.
Kimi K3 retter seg også mot kunnskapsarbeidsagenter. Moonshots lanseringssuite viser sterke resultater på BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2 og visuelle agent-evalueringer. Viktigere for utviklere er at Kimi API eksponerer verktøyvalgsbegrensninger og dynamisk verktøyinnlasting, som er praktiske kontroller når en agent må bruke virksomhetssystemer eller hente fakta før den svarer.

Kilde: Moonshot AI / Kimi
Multimodal and Visual Reasoning
Kimi K3 har den tydeligere arkitektur-nivå multimodale historien: Moonshot beskriver native visuelle egenskaper og demonstrerer spesifikt «vision in the loop» for spillutvikling, frontend-ingeniørarbeid og CAD, der modellen kan inspisere visuell tilbakemelding og revidere kode.
Grok 4.6 aksepterer også tekst og bildeinput, og SpaceXAI sier at modellen produserer sterkere førsteutkast på visuelle og interaktive prosjekter enn Grok 4.5. Forskjellen handler mindre om hvorvidt begge modellene kan se bilder og mer om utrullingsfilosofi: Kimi eksponerer en åpen multimodal modell, mens Grok pakker visuell forståelse inn i en administrert frontier-API og agentøkosystem.
Context Window: 500K vs 1M
Grok 4.6 støtter 500,000 tokens, mens Kimi K3 støtter omtrent 1 million tokens. Det gjør Kimi til det åpenbare valget når arbeidsmengden genuint krever mer enn 500K tokens i én forespørsel—for eksempel svært store repositorier, flerbok-forskningssamlinger eller usedvanlig lange agentspor.
Men kontekststørrelse er kapasitet, ikke en garanti for gjenfinning eller resonnementskvalitet. For produksjonssystemer, test modellen på dine faktiske langkontekst-feilmoduser: sporing av avhengigheter på tvers av filer, gjenfinning av fjerne fakta, deteksjon av motsetninger og instruksjonspersistens. Retrieval-augmented generation kan fortsatt være billigere og mer kontrollerbart enn å sende en million tokens ved hver forespørsel.
Speed and Latency
Artificial Analysis måler for øyeblikket Grok 4.6 til 65,8 output-tokens per sekund og Kimi K3 til 40,7 tokens per sekund. Når genereringen først begynner, er Grok materiell raskere i denne målingen. Men mønsteret for første token går motsatt vei: Kimi K3 har målt TTFT på 3,27 sekunder, mens Grok 4.6s nåværende leverandørmåling er mye tregere før den begynner å strømme.
Det skaper et nyttig produktskille. For interaktiv chat eller IDE-opplevelser kan rask tid til første token gjøre at Kimi føles responsiv selv om det fulle svaret tar lengre tid. For lange genereringer og agentkjøringer kan Groks høyere genereringsthroughput redusere halen av forespørselen. Leverandør, region, resonnementsinnsats, cachestatus og forespørselsstørrelse kan alle endre disse tallene, så behandl dem som et nåværende øyeblikksbilde snarere enn en permanent egenskap.
Grok 4.6 vs Kimi K3: API Pricing
Ved standard kontekstklinger koster Grok 4.6 $2 per million input-tokens, $0.50 per million cachede tokens og $6 per million output-tokens. For prompts på eller over 200K tokens, fakturerer xAI hele forespørselen til langkontekst-rater på $4 input, $1 cached og $12 output per million tokens.
Kimi bruker flat pay-as-you-go prising over sitt 1M kontekstvindu. Kimi API oppgir $0.30 per million cache-treff-tokens, $3 per million input-tokens og $15 per million output-tokens. Det betyr at Kimi er billigere på cache-treff, men mye dyrere på ferske output-tokens; Groks prisfordel snevres inn når Grok-forespørsler krysser 200K langkontekstterskelen.

Overskriftspriser for offisiell API per 1M tokens. Grok langkontekst-forespørsler (≥200K prompt-tokens) bruker høyere satser som ikke vises i diagrammet. Kilde: SpaceXAI og Kimi API-prising
| Pris / 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| Offisiell input for kort kontekst | $2.00 | $3.00 |
| Offisielt cache-treff | $0.50 | $0.30 |
| Offisiell output | $6.00 | $15.00 |
| Prising for lang kontekst | ≥200K: $4 / $1 / $12 | Flat prising gjennom 1M kontekst |
| CometAPI input | $1.60 | $2.40 |
| CometAPI output | $4.80 | $12.00 |
På CometAPI er Grok 4.6 for øyeblikket oppført til $1.60 input / $4.80 output per million tokens, mens Kimi K3 er oppført til $2.40 input / $12 output. Begge er 20 % under leverandørenes overskriftspriser for input/output som vises på deres CometAPI modell-sider på tidspunktet for skrivingen.
Open Weights vs Proprietary Model
Kimi K3 er en open-weight modell med nedlastbare vekter. Det muliggjør forskning, finmasket infrastrukturkontroll, private inferens-arkitekturer og utrulling gjennom tredjeparts inferensstakker. Det betyr ikke at K3 er lettvekts: en modell på 2.8T parametere er et seriøst systemprosjekt selv med MoE-sparsomhet og lavpresisjonsformater.
Grok 4.6 er proprietær. Arkitektur og parameterantall er ikke offentliggjort, og utviklere får tilgang som en administrert tjeneste. Avveiningen er operasjonell enkelhet: du trenger ikke bygge en inferensklynge, administrere modellvekter eller optimalisere kjerner for å få agentytelse på frontier-nivå.
Strengths and Weaknesses
| Modell | Styrker | Avveininger |
|---|---|---|
| Grok 4.6 | Lavere hostet API-pris; 61 AA Intelligence; raskere målt generering; sterke resultater for langhorisont-agenter; integrert xAI verktøystakk | 500K kontekst; lukkede vekter; langkontekst-prising dobles; tregere målt TTFT |
| Kimi K3 | ~1M kontekst; åpne vekter; 2.8T MoE; native multimodalitet; sterk kode-/agent-suite | Høyere output-pris; tregere målt tokengenerering; full selvhosting er infrastruktur-tung |
Grok 4.6 vs Kimi K3: Which Should You Choose?
| Brukstilfelle | Anbefaling | Hvorfor |
|---|---|---|
| Standard frontier-API | Grok 4.6 | Lavere pris med en liten uavhengig intelligensledelse |
| Langvarig kunnskapsarbeidsagent | Grok 4.6 | Sterkest bevis fra GDPVal-AA og AA-Briefcase |
| Koding i repository-skala | Test begge | Begge er designet for langhorisont-koding; benchmark-suiter er ulike |
| Prompt >500K tokens | Kimi K3 | Omtrent 1M kontekst |
| Open-weight forskning | Kimi K3 | Vekter og arkitektur er tilgjengelige |
| Privat/selvstyrt inferens | Kimi K3 | Åpne vekter muliggjør egendefinert utrulling |
| Lav cache-treff-kostnad | Kimi K3 | $0.30/MTok cache-treff prising |
| Lavere fersk output-token-kostnad | Grok 4.6 | $6/MTok vs $15/MTok ved standard kontekst |
| Rask første synlige respons | Kimi K3 | Mye lavere målt TTFT |
| Raskere lang generering | Grok 4.6 | Høyere målt output tokens/s |
| Visuell koding / CAD / spillarbeidsflyter | Kimi K3 | Native visjon + offisiell «vision in the loop»-fokus |
Overordnet anbefaling: Grok 4.6 er det sterkere standardvalget for de fleste agentutviklere med hostet API. Kimi K3 er den mer fleksible frontier-modellen når 1M kontekst, åpne vekter og utrullingskontroll er del av kravet snarere enn valgfrie tillegg.
How to Access Grok 4.6 and Kimi K3 Through CometAPI
Begge modellene er live på CometAPI. Grok 4.6-modellsiden oppgir modell-ID grok-4.6 og støtte for Chat Completions / Responses-stil tilganger, mens Kimi K3-modellsiden eksponerer kimi-k3 gjennom CometAPI-unified endepunkt. Det gjør A/B-testing enklere fordi du kan bytte modell-ID-er mens du beholder autentisering og det meste av applikasjonsoppsettet konstant.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Gå gjennom denne repository-feilen og foreslå en testet fiks."}
],
)
print(model, response.choices[0].message.content)
For en produksjonsevaluering, hold prompt, verktøy, repository-øyeblikksbilde og suksesskriterier identiske. Spor ikke bare svarkvalitet, men også suksess for verktøyskall, antall turer, totale input/output-tokens, ventetid og gjenoppretting fra mislykkede verktøyskall. Det er mer prediktivt for reell agentkostnad enn en enkelt benchmark-score.
Conclusion
Det viktigste resultatet av Grok 4.6 vs Kimi K3-sammenligningen er at deres topplinje-intelligens er mye nærmere enn deres produktdesign. Uavhengig evaluering setter dem for øyeblikket til 61 versus 60, men den omkringliggende økonomien og utrullingsvalgene er svært ulike.
Grok 4.6 er optimalisert som en administrert frontier-tjeneste: lavere prising for ferske tokens, sterke agentiske benchmarks, raskere målt generering og en moden verktøy-/API-bane. Kimi K3 er optimalisert for fleksibilitet: et kontekstvindu på 1M tokens, 2.8T MoE-skala, native multimodalitet og åpne vekter.
For de fleste utviklere som enkelt trenger den beste standard hostede modellen for koding og langvarige agenter, er Grok 4.6 et tryggere utgangspunkt. Hvis systemet ditt er avhengig av >500K kontekst, open-weight utrulling, visuell koding eller kontroll over inferensstakken, kan Kimi K3 være det bedre arkitekturvalget selv når dens hostede tokenpris er høyere.
FAQs
Is Grok 4.6 smarter than Kimi K3?
På den nåværende Artificial Analysis Intelligence Index scorer Grok 4.6 61 og Kimi K3 60. Det er en knapp ledelse, ikke et avgjørende gap. Oppgave-nivå ytelse kan snu avhengig av arbeidslast.
Which is better for coding?
Begge er troverdige kodemodeller. Grok 4.6 har sterke nåværende agentiske koderesultater og lavere hostet prising; Kimi K3 tilbyr et større kontekstvindu, åpne vekter og sterke repository-/visuelle koderesultater. Bruk din egen repo-benchmark fordi leverandørene rapporterer ulike benchmark-versjoner.
Which model has the larger context window?
Kimi K3 støtter omtrent 1M tokens, omtrent dobbelt så mye som Grok 4.6 sitt kontekstvindu på 500K tokens.
Which is cheaper?
For ferske tokens ved standard kontekst, er Grok 4.6 billigere med $2 input / $6 output per MTok versus $3 / $15 for Kimi K3. Kimi har billigere cache-treff-rate på $0.30/MTok, mens Grok bruker høyere satser når prompten når 200K tokens.
Can I self-host Kimi K3?
Kimi K3 har åpne vekter tilgjengelig på Hugging Face, så selvstyrt utrulling er mulig. Den fulle 2.8T-modellen er likevel ekstremt stor og krever seriøs flernode- eller spesialisert inferensinfrastruktur for praktisk ytelse.
Can I self-host Grok 4.6?
Ingen offentlige Grok 4.6-vekter er tilgjengelige. Grok 4.6 leveres som en proprietær administrert modell gjennom SpaceXAI og partner-API-er.
Can I access both from one API?
Ja. CometAPI oppfører for tiden både Grok 4.6 og Kimi K3, slik at utviklere kan sammenligne dem bak et unified API- og faktureringslag.
