DeepSeek V4 Pro 0813 is now live on CometAPI →

Grok 4.6 출시: GPT-5.6 수준의 벤치마크 결과 & 코딩 성능

CometAPI
AnnaAug 13, 2026
Grok 4.6 출시: GPT-5.6 수준의 벤치마크 결과 & 코딩 성능

TL; DR xAI는 2026년 8월 12일 Grok 4.6을 공식 출시하고 xAI API, Cursor, Grok Build를 통해 제공했다. 컨텍스트 윈도우는 500,000 토큰이며, 텍스트와 이미지 입력을 수용하고, 네 가지 추론 노력 수준을 제공하며, 지식 컷오프는 2026년 2월 1일이다. xAI의 공식 Grok 4.6 발표에 따르면, 9개 평가를 합성한 Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 동급이다.

API 가격은 백만 입력 토큰당 $2, 캐시된 입력 토큰당 $0.50, 백만 출력 토큰당 $6(프롬프트가 200,000 토큰 미만일 때)에서 시작한다. 프롬프트가 200,000 토큰에 도달하면 전체 요청이 장문맥 요율인 **입력 $4, 캐시된 입력 $1, 출력 $12(백만 토큰당)**로 청구된다. 유연한 멀티모델 액세스를 원하는 개발자를 위해 CometAPI 같은 플랫폼은 Grok 4.6을 다른 최전선 모델과 함께 손쉽게 통합할 수 있으며, API 가격은 xAI 가격의 80%다.

Key Takeaways

  • xAI가 2026년 8월 12일 Grok 4.6을 공식 출시했다. 이전의 출시 기간 보도는 이제 효력이 없다.
  • API 모델 ID는 , 그리고 이 모델은 Cursor와 Grok Build에서도 사용할 수 있다.grok-4.6
  • 컨텍스트 윈도우는 500K 토큰이며, 텍스트와 이미지 입력을 지원하고 출력은 텍스트 전용이다.
  • 200K 프롬프트 토큰 미만의 표준 가격은 입력 $2/M, 캐시된 입력 $0.50/M, 출력 $6/M이다.
  • 프롬프트가 200K 토큰에 도달하면 임계값을 초과한 부분만이 아니라 해당 요청의 모든 토큰에 장문맥 요율이 적용된다.
  • 추론 노력은 low, medium, high, xhigh로 설정할 수 있다; 는 문서에 기재된 기본값이다.
  • Grok 4.6은 Artificial Analysis Intelligence Index(점수 61)에서 GPT-5.6 Sol과 동일한 수준을 기록했으며, 에이전트형 코딩, 지식 작업, 장기 과제 전반에서 Grok 4.5 대비 큰 향상을 보인다.
  • Grok Imagine Image 2.0은 별도의 이미지 생성 API다. Grok 4.6은 이미지를 이해할 수 있지만 자체적으로 생성 이미지를 반환하지는 않는다.

Grok 4.6 Specifications and Price at a Glance

다음 사양은 xAI의 모델 문서8월 12일 릴리스 노트에서 확인되었다.

SpecificationGrok 4.6
Official release dateAugust 12, 2026
API model IDgrok-4.6
Positioning코딩, 에이전트 및 일반 워크로드용 플래그십 모델
Context window500,000 tokens
InputsText and images
OutputText
Documented text-output limitxAI가 명시한 텍스트 출력 한도 없음
Reasoning controlsLow, medium, high and xhigh
Default reasoning effortHigh
Knowledge cutoffFebruary 1, 2026
Native API accessAvailable
Coding-tool accessCursor and Grok Build
Current-events accessRequires Web Search or X Search tools

Official xAI API pricing

xAI의 최신 API 가격표는 단문맥 요청과 장문맥 요청을 구분한다.

Prompt sizeInput per 1M tokensCached input per 1M tokensOutput per 1M tokens
Below 200,000 tokens$2.00$0.50$6.00
200,000 tokens or more$4.00$1.00$12.00

이 임계값은 코드베이스 에이전트에서 특히 중요하다. 요청 프롬프트가 200,000 토큰에 도달하면, xAI는 임계값을 초과한 부분만이 아니라 해당 요청의 모든 토큰에 장문맥 요율을 적용한다. 따라서 199,000 프롬프트 토큰을 포함한 요청은 크기가 거의 동일하더라도 200,000 토큰을 포함한 요청보다 비용이 현저히 낮을 수 있다.

현재 xAI 가격 문서에는 Grok 4.6에 대한 배치 할인은 기재되어 있지 않다. 일부 다른 xAI 모델에 제공되는 할인과 달리, 팀은 오프라인 작업에 할인 적용을 가정해서는 안 된다.

What Is Grok 4.6?

Grok 4.6은 SpaceXAI가 2026년 8월 12일에 출시한 최신 플래그십 대규모 언어 모델이다. Grok 4.5를 직접 계승하며, 고급 추론과 기술 개념을 위한 선별된 모델 생성 데이터, 고품질 엔지니어링 데이터셋, 향상된 옵티마이저, 코딩과 지식 작업 시나리오를 위한 확장된 강화학습에 초점을 맞춘 추가 학습(run)을 적용했다.

모델은 전작과 동일한 1.5조 매개변수 기반을 유지하며, 향상은 주로 파라미터 규모 확대가 아닌 학습 이후(Post-training)에서 비롯된다. 주제 조사, 방대한 정보 분석, 익숙지 않은 코드베이스 탐색 및 편집, 고수준 아이디어를 완성된 애플리케이션이나 산출물로 전환하는 등 여러 단계를 거치더라도 효과를 유지하도록 설계되었다. SpaceXAI는 장기 프로젝트에서의 자기 검증 행동 개선과 상호작용 및 비주얼 작업에서의 더 강한 성능을 강조한다.

전통적인 챗봇과의 차이는 중요하다.

일반적인 LLM 워크플로는 다음과 같다:

Prompt → Generate answer

Grok 4.6은 다음과 더 유사한 워크플로를 지향한다:

Goal → Plan → Research → Use tools → Modify code → Test → Evaluate → Continue

xAI의 현재 포지셔닝은 모델이 더 오래 복잡한 프로젝트를 수행하고, 코드베이스 전반에서 작업하며, 낯선 주제를 연구하고, 애플리케이션을 구축하고, 스스로 작업을 검증하는 능력을 강조한다.

이는 Grok 4.6을 급속히 확장 중인 AI 코딩 에이전트 및 자율 에이전트 시장에 특히 관련성 있게 만든다.

What Are the Main Features of Grok 4.6?

Long-Running Agent Capability

Grok 4.6 개선의 핵심은 장기 실행 작업에 초점을 맞춘 것이다.

1회성 응답에만 최적화하는 대신, 모델은 프로젝트의 여러 단계를 거치며 진행 상황을 유지하도록 설계되었다.

대표적인 예:

  • 애플리케이션 구축
  • 대규모 리포지토리 디버깅
  • 낯선 주제 조사
  • 여러 컴포넌트 수정
  • 테스트 실행
  • 실패 조사
  • 구현 수정
  • 최종 결과 확인

이는 전통적인 지시 따르기형 벤치마크와는 근본적으로 다른 목표다.

Advanced Coding Performance

코딩은 Grok 4.6의 가장 뚜렷한 개선 영역 중 하나다.

현재 보고된 벤치마크:

  • DeepSWE 1.1에서 65.9%
  • CursorBench 3.2에서 69.9%
  • FrontierCode 1.1 Extended에서 61.3%

이 평가들은 단순 코드 완성보다 에이전트형 코딩 행동을 겨냥한다는 점에서 특히 중요하다.

DeepSWE 1.1에서 Grok 4.5 대비 Grok 4.6의 향상은 특히 눈에 띄며, 보고된 비교에서 약 **54%에서 65.9%**로 상승했다.

Multimodal Input

Grok 4.6은 텍스트와 이미지 입력을 지원하여 개발자가 시각 정보를 추론과 결합할 수 있도록 한다.

가능한 활용 사례:

  • 스크린샷 디버깅
  • UI 분석
  • 차트 해석
  • 문서 이해
  • 비주얼 리서치
  • 이미지 기반 코딩 작업

이는 Grok 4.6을 순수 텍스트 기반 코딩 모델보다 더 유연하게 만든다.

Grok의 검색 액세스는 생태계의 중요한 부분이다.

API는 다음을 지원한다:

  • 웹 검색
  • X 검색
  • 함수 호출
  • 코드 실행

xAI의 현재 Grok 4.5 API 문서는 Grok API 환경에서 이러한 도구 기능을 확인해준다.

리서치 에이전트에게 이는 모델이 정적인 사전 학습 지식에서 최신 정보 검색 + 추론으로 이동할 수 있음을 의미한다.

Configurable Reasoning

Grok의 API는 구성 가능한 추론 노력을 제공한다.

이를 통해 다음의 트레이드오프가 가능하다:

속도/비용 ↔ 추론 깊이

간단한 작업에는 낮은 추론을 사용해 불필요한 계산을 줄일 수 있다.

복잡한 코딩이나 리서치 작업에는 높은 추론을 통해 보다 신중한 문제 해결이 가능하다.

Cost-Competitive Frontier Performance

Grok 4.6의 가격은 상업적 강점 중 하나로 평가된다.

보고된 표준 API 가격은 다음과 같다:

  • 입력 1M 토큰당 $2
  • 출력 1M 토큰당 $6

이는 Grok 4.5에 보고된 가격과 동일하며, 상당한 성능 향상에도 불구하고 유지되고 있다.

이는 최전선 모델로서는 이례적으로 공격적인 비용/성능 구성을 만든다.


How Does Grok 4.6 Perform on Benchmarks?

현재 가장 유용한 벤치마크 데이터는 에이전트형 지능과 코딩에 집중되어 있다.

BenchmarkGrok 4.6What It Measures
Artificial Analysis Intelligence Index61최전선 모델의 광범위한 지능
CursorBench 3.269.9%코딩 에이전트 성능
DeepSWE 1.165.9%소프트웨어 엔지니어링 에이전트
FrontierCode 1.1 Extended61.3%고급 코딩
GDPVal-AA v21,753 Elo지식 작업 과제 성능

Artificial Analysis Intelligence Index 점수 61은 해당 지수에서 Grok 4.6이 GPT-5.6 Sol과 동일한 수준에 있음을 의미한다.

GDPVal-AA v2 점수 1,753 Elo도 중요하다. GDPVal은 순수한 학술적 질의응답이 아닌 전문 지식 작업 과제를 평가하기 때문이다.

The Important Benchmark Takeaway

Grok 4.6의 가장 강력한 증거는 단일 MMLU 스타일 점수가 아니다.

벤치마크 프로필은 다음을 지향한다:

코딩 + 에이전트 + 지식 작업 + 장기 실행

이는 현대 AI 개발이 향하는 방향과 정확히 일치한다.

CometAPI 같은 웹사이트에서는 이 구분을 유지하는 것이 중요하다. Grok 4.6은 또 하나의 범용 챗봇 모델이 아니라 에이전트형 최전선 모델로 주로 마케팅되어야 한다.

How does Grok 4.6 compare with its predecessor and competitors?

Grok 4.6 vs Grok 4.5

FeatureGrok 4.5Grok 4.6
Primary focus일반 추론 + 에이전트장기 실행 에이전트 + 코딩
Context500K-class deployment500K
InputText + imageText + image
Web searchYesYes
X searchYesYes
Code executionYesYes
Function callingYesYes
Input price$2/M$2/M
Output price$6/M$6/M
DeepSWE 1.1~54%65.9%
Intelligence Index~5661

중요한 점은 Grok 4.6이 단순한 가격대 대체로 보이지 않는다는 것이다. 이는 장기 에이전트 워크플로에 더 무게를 둔 능력 업그레이드다.

xAI의 현재 Grok 4.5 문서는 구성 가능한 추론과 도구 지원과 함께, 1M 토큰당 입력 $2/출력 $6의 가격을 명시한다.

Comparison Table: Grok 4.6 vs Key Competitors

AspectGrok 4.6GPT-5.6 SolClaude Fable 5 / Opus 5Notes
AA Intelligence Index616162 / 63Composite score
Input / Output $/1M$2 / $6~$5 / $30~$5 / $25Grok이 출력에서 훨씬 저렴
Context Window500KUp to 1M+Often 1M
Strengths에이전트, 코딩 효율, 비용광범위한 추론, 코딩장기 실행, 안전성
Cursor Integration네이티브, 강함사용 가능사용 가능Grok은 Cursor에 최적화
Turn Efficiency높음(적은 단계)경쟁력 있음더 많은 단계가 보고됨에이전트에 중요
AvailabilityAPI + Cursor + partnersOfficial + partnersOfficial + partnersCometAPI가 액세스 통합

데이터는 2026년 8월 13일 기준 SpaceXAI 발표, Artificial Analysis 및 공개 모델 카드에서 가져왔다.

현재 Artificial Analysis 비교는 특히 흥미롭다.

Grok 4.6은 Intelligence Index에서 61점을 기록해 GPT-5.6 Sol과 동급이라고 전해진다. 하지만 경제성은 매우 다르다.

경쟁 GPT 변형의 정확한 가격은 게시 전 최신 공급자 가격을 확인해야 하지만 핵심 시장 관찰은 분명하다. Grok 4.6은 비교적 공격적인 토큰 가격을 유지하면서도 최전선 수준의 벤치마크 성능과 경쟁하고 있다.

이는 고용량 에이전트 실행에서 프리미엄 최전선 모델의 비용이 부담이 되는 애플리케이션에 특히 매력적이다.

What Are the Limitations of Grok 4.6?

500K 컨텍스트는 일부 1M 컨텍스트 경쟁사보다 작다

Grok 4.6의 500K 컨텍스트는 크지만, 최전선 시장에서 제공되는 가장 큰 컨텍스트 윈도우는 아니다.

매우 큰 리포지토리나 방대한 문서 컬렉션의 경우, 1M 컨텍스트 모델이 유리할 수 있다.

Proprietary Model

MiMo-V2.5-Pro와 달리 Grok 4.6은 공개 가중치 모델이 아니다.

개발자가 모델을 다운로드하여 독립 배포할 수 없다.

Benchmark Comparisons Need Care

코딩 벤치마크마다 하네스, 프롬프트, 도구, 평가 절차가 다르다.

예를 들어, SWE-Bench Pro는 현실적인 장기 소프트웨어 엔지니어링 문제를 중심으로 설계되어 있으며, 에이전트 스캐폴드에 따라 결과가 크게 달라질 수 있다.

따라서 **CursorBench 69.9%를 “Grok 4.6이 다른 모델보다 69.9% 더 낫다”**고 해석해서는 안 된다.

올바른 해석은 해당 벤치마크의 특정 평가 설정에서 그 점수를 달성했다는 것이다.

Agent Cost Can Be Higher Than Token Pricing Suggests

$2/$6 토큰 가격은 매력적이지만, 자율 에이전트는 다음을 통해 막대한 토큰을 소비할 수 있다:

  • 도구 호출
  • 반복 검색
  • 코드 실행
  • 실패한 시도
  • 긴 컨텍스트
  • 자기 검증

따라서 실제 단위 경제성은 단순한 백만 토큰당 비용이 아니라 성공적으로 완료된 과제당 비용에 달려 있다.

Price and Access

공식 가격(표준 티어, 약 200K 프롬프트 토큰 미만):

  • 입력: 1M 토큰당 $2.00
  • 캐시된 입력: 1M 토큰당 약 $0.50
  • 출력: 1M 토큰당 $6.00

더 빠른 변형은 이 요율의 두 배로 책정된다. 매우 긴 컨텍스트(≥200K)의 경우 요율이 두 배가 될 수 있다. 에이전트 루프에서는 비용을 낮추기 위해 프롬프트 캐싱을 강력히 권장한다.

이용 가능성:

  • Cursor 및 Grok Build(첫 주 2× 포함 사용량)
  • SpaceXAI API(grok-4.6)
  • 파트너: OpenRouter, Vercel, Cloudflare 등
  • SuperGrok 채팅/앱(모델 피커를 통해)

CometAPI 권장 사항: 이미 여러 최전선 모델을 사용 중이거나 사용할 계획인 개발자에게 CometAPI는 단일 OpenAI 호환 엔드포인트(https://api.cometapi.com/v1)를 통해 Grok 4.6에 원활하게 액세스할 수 있도록 한다. 500개 이상의 모델(GPT, Claude, Gemini, DeepSeek, Grok 변형 포함)에 걸친 통합 청구, 사용 분석, 경쟁력 있는 실제 요율을 제공하며, 한 줄 변경만으로 모델을 전환할 수 있다. 이는 Grok 4.6을 다른 코딩 또는 에이전트 모델과 A/B 테스트하거나, 라우팅·폴백이 필요한 프로덕션 시스템을 구축할 때 특히 유용하다. cometapi.com에서 무료 API 키를 등록하고 라이브 모델 카탈로그를 탐색해 보라.

Should You Switch to Grok 4.6?

다음에 해당하면 예:

  • Cursor를 많이 사용하거나 장기 코딩/지식 에이전트를 구축하며, 합리적 비용으로 강한 다단계 신뢰성을 원한다.
  • 토큰 경제성이 중요하다—Grok 4.6은 가장 비싼 최전선 옵션의 출력 토큰 가격 대비 약 1/5 수준에서 GPT-5.6 Sol과 거의 동급의 지능을 제공한다.
  • 턴 효율(복잡한 작업을 완료하는 데 필요한 단계와 토큰 감소)을 중시한다.
  • 현대 개발에서 일반적인 상호작용형·시각형·에이전트형 워크플로에 대해 명시적으로 훈련된 모델에 즉시 액세스하길 원한다.

다음에 해당하면 현행 모델 유지 또는 혼용 고려:

  • 주된 워크로드가 순수 알고리즘 대회형 프로그래밍이거나 특정 폐쇄형 모델의 강점(예: 일부 Claude의 장문맥 또는 안전성 튜닝 시나리오)에 의존한다.
  • 비용과 무관하게 모든 개별 소프트웨어 엔지니어링 벤치마크에서 절대 최고 점수가 필요하다.
  • 단일 호출 워크로드에서 500K보다 큰 컨텍스트 윈도우가 필요하다(일부 경쟁사는 1M+ 제공).

대부분의 팀은 현재 스택과 나란히 Grok 4.6을 평가하면 이점을 누릴 수 있다. CometAPI 같은 통합 게이트웨이를 통해 제공되므로 전환 비용이 낮다—모델 이름만 바꾸고 실제 작업 완료율, 지연 시간, 비용을 자체 워크로드에서 측정해 보라.

Conclusion

Grok 4.6은 SpaceXAI에 중요한 도약을 의미한다. 핵심 합성 및 에이전트형 벤치마크에서 최전선 수준의 지능, 장기 코딩 및 지식 작업 성능의 의미 있는 향상, 다수의 폐쇄 소스 경쟁사보다 낮은 공격적 가격을 동시에 제공한다. Cursor에서의 네이티브 가용성과 강한 다단계 신뢰성은 실제 소프트웨어 에이전트와 상호작용형 애플리케이션을 구축하는 개발자에게 특히 매력적이다.

직접, Cursor/Grok Build를 통해, 또는 CometAPI 같은 통합 게이트웨이를 통해 액세스하든, Grok 4.6은 오늘 바로 프로덕션 평가에 적합하다. 전체 세부 사항과 모델 카드는 x.ai/news/grok-4-6 공식 발표에서 확인하고, cometapi.com의 라이브 카탈로그에서 다른 주요 모델과 나란히 비교하며, 새로운 기능으로 즉시 빌드를 시작하라.

Primary Sources

가격, 레이트 리밋, 벤치마크 수치는 AI 환경이 빠르게 변하므로 항상 공식 페이지에서 최신 정보를 확인하라.

0 회 조회
명확성, 출처 표기 및 최신 API 용어에 대해 검토되었습니다.

AI 개발 비용을 20% 절감할 준비가 되셨나요?

몇 분 안에 무료로 시작하세요. 무료 체험 크레딧 제공. 신용카드 불필요.

더 보기