요약
Grok 4.6은 에이전트형 코딩과 지식 작업을 위한 관리형 최첨단 API를 원할 때 더 강력한 기본 선택지입니다. Artificial Analysis Intelligence Index에서 61점을 기록하고, 현재 독립 측정에서 더 빠르게 생성하며, 입력/출력 백만 토큰당 $2/$6부터 시작합니다.
Kimi K3는 문맥 길이와 모델 개방성이 중요할 때 더 유연한 선택입니다. 2.8조 파라미터, 104B 활성 파라미터, 약 100만 토큰 컨텍스트 윈도우, 오픈 웨이트, 네이티브 멀티모달 기능을 결합합니다. 호스팅 API의 헤드라인 가격은 입력/출력 백만 토큰당 $3/$15로 더 높지만, 캐시 히트는 백만 토큰당 $0.30만 비용이 듭니다.
결론: 비용 효율적인 호스팅 에이전트 API는 Grok 4.6를, 100만 컨텍스트, 오픈 웨이트, 인프라 제어가 필요하면 Kimi K3를 선택하세요. 코딩 용도로는 두 벤더가 서로 다른 벤치마크 버전과 하니스를 게시하므로 자체 저장소에서 모두 테스트하세요.
핵심 포인트
- Grok 4.6은 2026년 8월 12일 출시되었으며 장기 실행 에이전트, 코드베이스 작업, 지식 작업, 더 야심적인 인터랙티브/비주얼 프로젝트에 초점을 맞춥니다.
- Kimi K3는 Moonshot AI의 2.8조 파라미터 오픈 웨이트 플래그십으로 Kimi Delta Attention, Attention Residuals, 네이티브 비전, 약 100만 토큰 컨텍스트 윈도우를 갖습니다.
- 독립적 종합 지능은 거의 동률: Grok 4.6이 61, Kimi K3가 60.
- Grok 4.6은 헤드라인 토큰 가격이 더 낮음: 입력 $2 / 출력 $6, Kimi K3는 입력 $3 / 출력 $15.
- Kimi K3는 문맥 용량이 약 두 배이고 오픈 웨이트 제공; Grok 4.6은 독점 모델이지만 여러 독립 에이전트 평가에서 더 손쉽고 비용 효율적입니다.
Grok 4.6 vs Kimi K3: 빠른 비교
| Specification | Grok 4.6 | Kimi K3 |
|---|---|---|
| Developer | SpaceXAI / xAI | Moonshot AI / Kimi |
| Release date | August 12, 2026 | July 16, 2026 |
| Model ID | grok-4.6 | kimi-k3 |
| Architecture | Not publicly disclosed | MoE; KDA + AttnRes + Stable LatentMoE |
| Total parameters | Not disclosed | 2.8T |
| Active parameters | Not disclosed | 104B |
| Experts | Not disclosed | 896 total; 16 activated/token |
| Context window | 500,000 tokens | 1,048,576 / about 1M tokens |
| Input / output | Text + image → text | Text + image → text |
| Reasoning | Configurable | Always-on; low / high / max |
| Function / tool use | Function calling + structured outputs | ToolCalls, tool_choice, dynamic tool loading |
| Open weights | No | Yes |
| AA Intelligence Index | 61 | 60 |
| Official input / output price | $2 / $6 per MTok | $3 / $15 per MTok |
| Best fit | Hosted agents, coding, knowledge work | Long context, open-weight deployment, coding + visual reasoning |
Grok 4.6란?
Grok 4.6은 코딩, 에이전트형 작업, 지식 작업을 위한 SpaceXAI의 최첨단 모델입니다. 이번 릴리스는 단순한 벤치마크 갱신이 아니라, 장기 실행 에이전트와 더 야심적인 인터랙티브/비주얼 작업에 맞춰 설계됐다고 회사는 말합니다. 실전에서는 모델이 여러 단계를 거쳐 작업을 유지하도록 의도되었음을 의미합니다: 주제 조사, 코드베이스 탐색, 정보 분석, 도구 호출, 완성된 애플리케이션이나 작업 산출물로의 반복 등.
Grok 4.5에서 무엇이 달라졌나?
SpaceXAI는 큐레이션된 모델 생성 추론 데이터, 고급 기술 개념, 고품질 엔지니어링 데이터, 개선된 옵티마이저와 트레이닝 레시피를 사용한 더 긴 보조 학습 과정을 보고했습니다. 팀은 이후 Grok 4.5로 SFT 트래젝터리를 재생성하여 추론 노력과 에이전트 하니스 전반을 다듬고, 문제 있는 트레이스를 필터링했으며, 일반 코딩, 커널 최적화, 웹 개발, CAD, 지식 작업에 걸친 환경에서 에이전트형 강화학습을 적용했습니다.
실질적인 결과는 점수가 더 높아졌을 뿐 아니라 더 긴 트래젝터리에서 자체 테스트와 검증이 더 많아졌다는 것입니다. 모델이 파일을 편집하고, 도구를 호출하거나, 여러 단계의 계획을 사람의 지속적 개입 없이 실행하도록 허용될 때 작은 실수의 비용이 누적되므로, 그 행동은 에이전트에 중요합니다.
Grok 4.6 사양
| Property | Grok 4.6 |
|---|---|
| Context | 500,000 tokens |
| Modalities | Text and image input; text output |
| Reasoning | Configurable reasoning |
| Native API capabilities | Function calling and structured outputs |
| Knowledge cutoff | February 1, 2026 |
| Short-context pricing | $2 input / $0.50 cached / $6 output per MTok |
| Long-context threshold | ≥200K prompt tokens; $4 / $1 / $12 |
Kimi K3란?
Kimi K3는 Moonshot AI의 오픈 웨이트 네이티브 멀티모달 에이전트형 플래그십 모델입니다. 2.8조 총 파라미터와 100만 토큰 컨텍스트 윈도우, 네이티브 비전을 결합하여 장기 코딩, 엔드투엔드 지식 작업, 추론, 시각적으로 기반한 소프트웨어 작업에 적합합니다.
Grok 4.6과 달리 Kimi K3는 모델 웨이트를 공개합니다. 현재 공식 모델 카드에 따르면 추론 중 104B 활성 파라미터가 사용되므로 전체 2.8조 파라미터 수에도 불구하고 계산 경로는 훨씬 작지만, 완전한 모델을 배포하려면 여전히 상당한 인프라가 필요합니다.
KDA, AttnRes 및 더 높은 희소성의 MoE
아키텍처는 K3의 가장 큰 차별점 중 하나입니다. Moonshot은 Kimi Delta Attention(KDA)과 Attention Residuals(AttnRes)가 긴 시퀀스와 깊은 모델 레이어 전반의 정보 흐름을 개선하도록 설계되었다고 설명합니다. Stable LatentMoE는 희소성을 높여 토큰당 896개 전문가 중 16개가 활성화됩니다. 트레이닝과 데이터 레시피 변화와 함께, Moonshot은 Kimi K2 대비 전반적 스케일링 효율이 약 2.5배 향상되었다고 보고합니다.
Kimi K3 사양
| Property | Kimi K3 |
|---|---|
| Total / active parameters | 2.8T / 104B |
| Architecture | MoE with KDA + AttnRes + Stable LatentMoE |
| Experts | 896; 16 activated per token |
| Context | 1M tokens |
| Vision | Native visual understanding |
| Reasoning | Always enabled; low / high / max |
| Tools | ToolCalls, tool_choice constraints, dynamic tool loading |
| Open weights | Available on Hugging Face |
| Official pricing | $0.30 cache hit / $3 input / $15 output per MTok |
Grok 4.6 vs Kimi K3: 벤치마크 비교
가장 깔끔한 직접 비교는 두 모델이 동일한 프레임워크에서 평가되는 독립적인 Artificial Analysis Intelligence Index입니다. 현재 점수는 Grok 4.6이 61 (high), Kimi K3가 60 (max)입니다. 1점 차이는 어느 한쪽이 “세대 차이로 앞선다”고 주장할 근거로 보기엔 너무 작습니다. 보다 유용한 질문은 각 모델이 점수를 어디서 얻는가입니다.
| Independent metric | Grok 4.6 | Kimi K3 | Edge |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 61 | 60 | Grok 4.6 by 1 point |
| Output speed | 65.8 tok/s | 40.7 tok/s | Grok 4.6 |
| Time to first token | ~32.3 s | 3.27 s | Kimi K3 |
| Context window | 500K | ~1.05M | Kimi K3 |
코딩 성능
SpaceXAI는 Grok 4.6에 대한 여러 코딩/소프트웨어 엔지니어링 결과를 게시합니다: CursorBench 3.2에서 69.9%, DeepSWE 1.1에서 65.9%, FrontierCode 1.1 Extended에서 61.3%, APEX-SWE에서 56.4%, Terminal-Bench 3.0에서 26.0%. 이들은 저장소 편집, 에이전트형 소프트웨어 엔지니어링, 터미널 작업을 다루므로 단순 코드 완성 퀴즈만이 아닙니다.
| Grok 4.6 vendor-reported coding benchmark | Score |
|---|---|
| CursorBench 3.2 | 69.9% |
| DeepSWE 1.1 | 65.9% |
| FrontierCode 1.1 Extended | 61.3% |
| APEX-SWE | 56.4% |
| Terminal-Bench 3.0 | 26.0% |
Kimi K3의 경우 Moonshot은 다른지만 폭넓은 코딩 스위트를 게시합니다. 공식 런치 자료는 DeepSWE에서 67.5, Terminal-Bench 2.1에서 88.3, FrontierSWE에서 81.2, ProgramBench에서 77.8, SWE Marathon에서 42.0을 보고합니다. 중요한 점은 Terminal-Bench 2.1과 3.0은 서로 다른 버전이며, FrontierSWE는 FrontierCode와 동일한 평가가 아니라는 것입니다. 따라서 단순 수치만으로 일대일 승부로 취급하면 안 됩니다.

에이전트형 및 지식 작업
에이전트형 작업은 Grok 4.6이 가장 강해 보이는 영역입니다. SpaceXAI는 GDPVal-AA v2에서 1753 Elo, APEX-Agents에서 57.5%, AA-Briefcase에서 1577 Elo를 보고합니다. Artificial Analysis도 동일한 패턴을 강조합니다: Grok 4.6의 가장 강한 향상은 정적 추론만이 아니라 장기 수평선, 도구 사용 작업에서 나타납니다.
Kimi K3도 지식 작업 에이전트를 목표로 합니다. Moonshot의 런치 스위트는 BrowseComp, GDPval-AA v2, JobBench, SpreadsheetBench 2, 비주얼 에이전트 평가에서 강한 결과를 보여줍니다. 개발자에게 더 중요한 것은 Kimi API가 도구 선택 제약과 동적 도구 로딩을 공개한다는 점입니다. 이는 에이전트가 엔터프라이즈 시스템을 사용하거나 답변 전 사실을 검색해야 할 때 실용적인 제어 기능입니다.

멀티모달 및 시각적 추론
Kimi K3는 아키텍처 차원에서 더 명확한 멀티모달 스토리를 갖습니다: Moonshot은 네이티브 비전 기능을 설명하고, 게임 개발, 프론트엔드 엔지니어링, CAD에서 “루프 내 비전”을 구체적으로 시연하며 모델이 시각적 피드백을 검사하고 코드를 수정할 수 있음을 보여줍니다.
Grok 4.6도 텍스트와 이미지 입력을 받아들이며, SpaceXAI는 Grok 4.5 대비 비주얼 및 인터랙티브 프로젝트에서 더 강한 첫 시도를 산출한다고 말합니다. 차이는 두 모델이 이미지를 볼 수 있느냐가 아니라 배포 철학에 더 가깝습니다: Kimi는 오픈 멀티모달 모델을 공개하고, Grok은 관리형 최첨단 API와 에이전트 생태계 내부에 시각 이해를 패키징합니다.
컨텍스트 윈도우: 500K vs 1M
Grok 4.6은 500,000 토큰을 지원하고, Kimi K3는 약 100만 토큰을 지원합니다. 이는 요청당 500K 토큰을 실제로 초과하는 워크로드—매우 큰 저장소, 다권 연구 컬렉션, 예외적으로 긴 에이전트 트레이스—에서는 Kimi가 명백한 선택이 됩니다.
하지만 컨텍스트 크기는 용량이지, 검색이나 추론 품질에 대한 보장을 의미하지 않습니다. 프로덕션 시스템에서는 실제 장문맥 실패 모드에 대해 모델을 테스트하세요: 파일 간 의존성 추적, 먼 사실 검색, 모순 탐지, 지시사항 지속성. 요청마다 백만 토큰을 보내는 것보다 검색 증강 생성(RAG)이 더 저렴하고 더 제어 가능할 수 있습니다.
속도와 지연
Artificial Analysis는 현재 Grok 4.6을 초당 65.8 출력 토큰, Kimi K3를 초당 40.7 토큰으로 측정합니다. 스트리밍이 시작되면 이 측정에서 Grok이 의미 있게 더 빠릅니다. 하지만 첫 토큰 패턴은 반대입니다: Kimi K3는 측정된 TTFT가 3.27초인 반면, Grok 4.6의 현재 제공자 측정은 스트리밍을 시작하기까지 훨씬 느립니다.
이는 유용한 제품 구분을 만듭니다. 인터랙티브 채팅이나 IDE 경험에서는 응답이 전체적으로 더 오래 걸리더라도 첫 토큰까지 빠른 시간이 Kimi를 더 반응적으로 느끼게 합니다. 긴 생성과 에이전트 실행에서는 Grok의 더 높은 생성 처리량이 요청의 꼬리를 줄일 수 있습니다. 제공자, 지역, 추론 강도, 캐시 상태, 요청 크기가 이러한 수치를 모두 변경할 수 있으므로 이를 영구적 속성보다 현재 스냅샷으로 취급하세요.
Grok 4.6 vs Kimi K3: API 가격
표준 컨텍스트 길이에서 Grok 4.6은 입력 백만 토큰당 $2, 캐시 토큰은 $0.50, 출력은 $6가 듭니다. 프롬프트가 200K 토큰 이상이면 xAI는 전체 요청을 장문맥 요율인 입력 $4, 캐시 $1, 출력 $12(백만 토큰당)로 청구합니다.
Kimi는 100만 컨텍스트 윈도우 전반에 걸쳐 균등 종량제 가격을 사용합니다. Kimi API는 캐시 히트 백만 토큰당 $0.30, 입력 백만 토큰당 $3, 출력 백만 토큰당 $15를 게시합니다. 즉 Kimi는 캐시 히트가 더 저렴하지만, 신규 출력 토큰은 훨씬 더 비쌉니다; Grok 요청이 200K 장문맥 임계값을 넘으면 Grok의 가격 우위는 줄어듭니다.

헤드라인 공식 API 가격(백만 토큰당). Grok 장문맥 요청(≥200K 프롬프트 토큰)은 차트에 표시되지 않은 더 높은 요율을 사용합니다. 출처: SpaceXAI and Kimi API pricing
| Price / 1M tokens | Grok 4.6 | Kimi K3 |
|---|---|---|
| Official short-context input | $2.00 | $3.00 |
| Official cache hit | $0.50 | $0.30 |
| Official output | $6.00 | $15.00 |
| Long-context pricing | ≥200K: $4 / $1 / $12 | Flat pricing through 1M context |
| CometAPI input | $1.60 | $2.40 |
| CometAPI output | $4.80 | $12.00 |
CometAPI에서 Grok 4.6은 현재 입력 백만 토큰당 $1.60, 출력 $4.80로 게시되어 있으며, Kimi K3는 입력 $2.40, 출력 $12로 게시되어 있습니다. 두 모델 모두 작성 시점에 각 CometAPI 모델 페이지에 표시된 제공자 헤드라인 입력/출력 가격보다 20% 낮습니다.
오픈 웨이트 vs 독점 모델
Kimi K3는 다운로드 가능한 웨이트를 제공하는 오픈 웨이트 모델입니다. 이는 연구, 정밀한 인프라 제어, 프라이빗 추론 아키텍처, 서드파티 추론 스택을 통한 배포를 가능하게 합니다. K3가 경량이라는 뜻은 아닙니다: 2.8조 파라미터 모델은 MoE 희소성과 저정밀 형식이 있더라도 진지한 시스템 프로젝트입니다.
Grok 4.6은 독점입니다. 아키텍처와 파라미터 수는 공개되지 않았으며 개발자는 이를 관리형 서비스로 접근합니다. 트레이드오프는 운영 단순성입니다: 프런티어 수준 에이전트 성능을 얻기 위해 추론 클러스터를 구축하거나 모델 웨이트를 관리하거나 커널을 최적화할 필요가 없습니다.
강점과 약점
| Model | Strengths | Trade-offs |
|---|---|---|
| Grok 4.6 | Lower hosted API price; 61 AA Intelligence; faster measured generation; strong long-horizon agent results; integrated xAI tool stack | 500K context; closed weights; long-context pricing doubles; slower measured TTFT |
| Kimi K3 | ~1M context; open weights; 2.8T MoE; native multimodality; strong coding/agent suite; very low cache-hit price | Higher output price; slower measured token generation; full self-hosting is infrastructure-heavy |
Grok 4.6 vs Kimi K3: 어떤 것을 선택해야 할까?
| Use case | Recommended | Why |
|---|---|---|
| Default frontier API | Grok 4.6 | Lower price with a slight independent intelligence lead |
| Long-running knowledge-work agent | Grok 4.6 | Strongest evidence from GDPVal-AA and AA-Briefcase |
| Repository-scale coding | Test both | Both are designed for long-horizon coding; benchmark suites differ |
| Prompt >500K tokens | Kimi K3 | About 1M context |
| Open-weight research | Kimi K3 | Weights and architecture are available |
| Private/self-managed inference | Kimi K3 | Open weights enable custom deployment |
| Low cache-hit cost | Kimi K3 | $0.30/MTok cache-hit pricing |
| Lower fresh output-token cost | Grok 4.6 | $6/MTok vs $15/MTok at standard context |
| Fast first visible response | Kimi K3 | Much lower measured TTFT |
| Faster long generation | Grok 4.6 | Higher measured output tokens/s |
| Visual coding / CAD / game workflows | Kimi K3 | Native vision + official vision-in-the-loop focus |
전체 추천: Grok 4.6은 대부분의 에이전트 개발자에게 더 강력한 기본 호스팅 API입니다. Kimi K3는 100만 컨텍스트, 오픈 웨이트, 배포 제어가 선택이 아닌 요구사항일 때 더 유연한 프런티어 모델입니다.
CometAPI로 Grok 4.6과 Kimi K3에 접근하는 방법
두 모델 모두 CometAPI에서 사용 가능합니다. Grok 4.6 모델 페이지는 모델 ID grok-4.6과 Chat Completions / Responses 스타일 접근을 표시하고, Kimi K3 모델 페이지는 통합 CometAPI 엔드포인트를 통해 kimi-k3를 제공합니다. 인증과 대부분의 애플리케이션 배관을 유지한 채 모델 ID만 바꿔 A/B 테스트를 쉽게 할 수 있습니다.
from openai import OpenAI
import os
client = OpenAI(
base_url="https://api.cometapi.com/v1",
api_key=os.environ["COMETAPI_KEY"],
)
for model in ["grok-4.6", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=[
{"role": "user", "content": "Review this repository bug and propose a tested fix."}
],
)
print(model, response.choices[0].message.content)
프로덕션 평가에서는 프롬프트, 도구, 저장소 스냅샷, 성공 기준을 동일하게 유지하세요. 답변 품질뿐 아니라 도구 호출 성공, 턴 수, 총 입력/출력 토큰, 지연, 실패한 도구 호출에서의 복구도 추적하세요. 단일 벤치마크 점수보다 실제 에이전트 비용을 더 예측합니다.
결론
Grok 4.6 vs Kimi K3 비교에서 가장 중요한 결과는 최상위 지능이 제품 설계만큼 크게 다르지 않다는 점입니다. 독립 평가에서는 현재 61 대 60이지만, 주변 경제성과 배포 선택지는 매우 다릅니다.
Grok 4.6은 관리형 최첨단 서비스로 최적화되었습니다: 신규 토큰 가격이 낮고, 에이전트형 벤치마크가 강하며, 더 빠른 측정된 생성과 성숙한 도구/API 경로를 갖습니다. Kimi K3는 유연성에 최적화되었습니다: 100만 컨텍스트 윈도우, 2.8조 MoE 규모, 네이티브 멀티모달, 오픈 웨이트.
단순히 코딩과 장기 실행 에이전트를 위한 최고의 기본 호스팅 모델이 필요하다면, 대부분의 개발자에게 Grok 4.6이 더 안전한 출발점입니다. >500K 컨텍스트, 오픈 웨이트 배포, 비주얼 코딩, 추론 스택 제어에 시스템이 의존한다면, 호스팅 토큰 가격이 더 높더라도 Kimi K3가 더 나은 아키텍처 선택이 될 수 있습니다.
FAQs
Grok 4.6이 Kimi K3보다 더 똑똑한가요?
현재 Artificial Analysis Intelligence Index에서 Grok 4.6은 61점, Kimi K3는 60점입니다. 이는 좁은 격차이지, 결정적 차이는 아닙니다. 작업 수준 성능은 워크로드에 따라 반전될 수 있습니다.
코딩에는 어느 쪽이 더 좋은가요?
둘 다 믿을 만한 코딩 모델입니다. Grok 4.6은 현재 에이전트형 코딩 결과가 강하고 호스팅 가격이 낮습니다; Kimi K3는 더 큰 컨텍스트 윈도우, 오픈 웨이트, 강한 저장소/비주얼 코딩 결과를 제공합니다. 벤더가 서로 다른 벤치마크 버전을 보고하므로 자체 저장소 벤치마크를 사용하세요.
더 큰 컨텍스트 윈도우를 가진 모델은?
Kimi K3는 약 100만 토큰을 지원하며, Grok 4.6의 500K 토큰 컨텍스트보다 약 두 배입니다.
어느 쪽이 더 저렴한가요?
표준 컨텍스트의 신규 토큰 기준으로 Grok 4.6이 입력 $2 / 출력 $6(백만 토큰당)으로 Kimi K3의 $3 / $15보다 저렴합니다. Kimi는 캐시 히트 요율($0.30/백만 토큰)이 더 낮으며, Grok은 프롬프트가 200K 토큰에 도달하면 더 높은 요율을 적용합니다.
Kimi K3를 자체 호스팅할 수 있나요?
Kimi K3는 Hugging Face에서 오픈 웨이트를 제공하므로 자체 관리 배포가 가능합니다. 전체 2.8조 모델은 여전히 매우 크며, 실용적 성능을 위해서는 다중 노드 또는 전문 추론 인프라가 필요합니다.
Grok 4.6을 자체 호스팅할 수 있나요?
공개된 Grok 4.6 웨이트는 없습니다. Grok 4.6은 SpaceXAI 및 파트너 API를 통해 제공되는 독점 관리형 모델입니다.
하나의 API에서 둘 다 접근할 수 있나요?
가능합니다. CometAPI는 현재 Grok 4.6과 Kimi K3를 모두 제공하여 통합 API와 빌링 레이어 뒤에서 비교할 수 있게 합니다.
