TL;DR Grok 4.7는 2026년 9월 21일에 출시된 SpaceXAI의 코딩, 에이전트형 워크플로, 전문 지식 작업을 위한 프런티어 모델이다. 500,000토큰 컨텍스트 윈도우, 텍스트 및 이미지 입력, 구성 가능한 추론, 함수 호출, 웹 및 X 검색, 코드 실행을 결합한다.
200,000토큰 이하 프롬프트에 대해, 공식 xAI API는 입력 100만 토큰당 $2, 캐시된 입력 100만 토큰당 $0.50, 출력 100만 토큰당 $6로 안내한다. CometAPI는 동일 티어에서 Grok 4.7 가격을 입력 $1.60, 캐시된 입력 $0.40, 출력 $4.80으로 안내하고 있으며, 이는 해당 모델 페이지에 표시된 공식 요율 대비 20% 낮다.
실용적 가치 제안은 보편적 벤치마크 1등이 아니다. Grok 4.7은 엔지니어링 작업, 긴 에이전트 루프, 도구 사용, 대형 작업 컨텍스트, 출력 토큰 비용 민감성이 결합된 워크로드에서 가장 설득력이 크다. 팀은 프로덕션 라우팅 전에 자체 리포지토리와 워크플로에서 검증해야 한다.
Key Takeaways
- Grok 4.7은 Grok 4.6보다 더 큰 베이스 모델, 더 길어진 강화학습(여러 시간에 걸친 더 어려운 작업), 더 강한 자기 검증을 사용한다.
- API는 500,000토큰 컨텍스트 윈도우, 텍스트와 이미지 입력, 텍스트 출력, 네 가지 추론 레벨, 구조화된 출력, 함수 호출, 웹 및 X 검색, 코드 실행을 지원한다.
- SpaceXAI는 CursorBench 4.0에서 46.3%, DeepSWE v1.1에서 71.0%, Terminal-Bench 4.0에서 38.0%를 보고한다. 이는 벤더가 공개한 결과이며 보편적 우위의 증거는 아니다.
- CometAPI는 OpenAI 호환 엔드포인트로 Grok 4.7 제공을 표기하며, 현재 표시된 가격은 해당 카탈로그의 공식 xAI 요율 대비 20% 낮다.
- 엔지니어링 에이전트와 지속적인 도구 사용에서 비용 민감하다면 Grok 4.7을 선택하라; 매우 긴 컨텍스트가 더 중요하거나 특정 벤치마크에 결정적으로 의존한다면 대안을 선택하라.
What Is Grok 4.7?
Grok 4.7은 코딩, 자율 에이전트 작업, 전문 지식 업무에 포지셔닝된 SpaceXAI의 최신 프런티어 대형 언어 모델이다. 출시의 초점은 단발성 답변이 아니라, 지속적 상호작용, 도구 사용, 검증, 수정이 필요한 작업이다.
SpaceXAI는 더 어려운 작업 혼합에 대한 더 긴 강화학습 실행을 수행했으며, 수 시간에 걸릴 수 있는 문제에 가중치를 두었다고 말한다. 이러한 훈련 방향은 리포지토리 수준 소프트웨어 엔지니어링, 디버깅, 리서치, 문서 작성, 엔지니어링 분석, 다단계 자동화에 특히 관련성이 높다.
How Is Grok 4.7 Different From—and Better Than—Grok 4.6?
A Larger Base Model
Grok 4.7은 Grok 4.6보다 더 큰 베이스 모델로 전환한다. SpaceXAI는 확정된 공개 파라미터 수를 밝히지 않았으므로, 구체적 수치가 아니라 베이스 모델 용량 증가가 방어 가능한 결론이다.
Longer Reinforcement Learning on Harder Tasks
강화학습 단계가 연장되었고, 더 어렵고 더 긴 지평의 문제로 옮겨졌다. SpaceXAI는 수 시간의 작업이 필요한 태스크를 강조하며, 자율 코딩, 리서치, 전문 에이전트 워크플로와 정렬된다.
Stronger Self-Verification
Grok 4.7은 자신의 작업을 더 면밀히 점검하도록 훈련되었다. 이는 소프트웨어 엔지니어링에서 중요하다. 신뢰할 수 있는 에이전트는 첫 답변을 생성하는 데 그치지 않고, 반복적으로 점검, 수정, 테스트, 실패 진단, 재수정, 검증을 수행해야 하기 때문이다.
Measured Improvements Over Grok 4.6
| Dimension | Grok 4.6 | Grok 4.7 | Change |
|---|---|---|---|
| CursorBench 4.0 | 40.4% | 46.3% | +5.9점 |
| DeepSWE v1.1 | 65.2% | 71.0% | +5.8점 |
| EEBench | 53.0% | 64.0% | +11.0점 |
| AA Briefcase v1.1 | 1,546 | 1,657 | +111 |
| Terminal-Bench 4.0 | 20.3% | 38.0% | +17.7점 |
| Harvey Legal Agent Benchmark | 15.8% | 19.6% | +3.8점 |
| HealthBench Professional | 48.5% | 56.7% | +8.2점 |
공개된 출시 스위트 전반에서 Grok 4.7은 나열된 모든 결과에서 Grok 4.6을 상회한다. 절대값 기준 가장 큰 향상은 Terminal-Bench 4.0에서 나타나며, 이는 장시간 커맨드라인 및 도구 사용 워크플로에 초점을 맞춘 출시 방향과 일치한다. 이 수치들은 벤더가 공개한 값이며, 마이그레이션 결정을 내리기 전에 실제 작업에 대해 시험해야 한다.
How Good Is Grok 4.7 on Benchmarks?
SpaceXAI의 출시 평가에는 소프트웨어 엔지니어링, 터미널 작업, 전문 오피스 작업, 법률 업무, 임상 추론, 전기공학이 포함된다. 이는 벤더가 공개한 결과로, 조달 또는 라우팅 결정을 내리기 전에 프로덕션 워크로드에 대해 검증되어야 한다.
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Grok 4.7 출시 결과에서 SpaceXAI는 DeepSWE v1.1의 71.0%를 높은 추론 노력으로 표시한다.
출시 공지는 각 벤치마크별 하니스, 도구 구성, 실행 횟수, 평가 환경을 모두 공개하지 않는다. 이러한 값은 벤더가 공개한 결과로 간주하고, 프로덕션 워크를 라우팅하기 전에 자체 리포지토리, 도구, 지연 시간 목표, 실패 기준에 대해 모델을 검증하라.
What Does the Grok 4.7 Benchmark Profile Show?
Software Engineering
CursorBench 4.0은 Grok 4.6의 40.4%에서 Grok 4.7의 46.3%로 상승했고, DeepSWE v1.1은 65.2%에서 71.0%로 상승했다. 이는 단순 대화형 코딩 보조가 아닌 코딩 에이전트를 위한 모델이라는 Grok 4.7의 포지셔닝을 뒷받침한다.
Long-Running Terminal Work
Terminal-Bench 4.0은 가장 큰 세대 변화 중 하나를 보인다: Grok 4.6의 20.3% 대비 Grok 4.7은 38.0%다. 17.7포인트의 절대 상승은 장기 지평 강화학습과 자기 검증에 대한 SpaceXAI의 강조와 일치한다.
Electrical Engineering
EEBench에서 Grok 4.7은 64.0%에 도달했으며, Grok 4.6의 53.0%와 비교된다. 공개된 비교 중에서 이는 Grok 4.7의 가장 강한 상대적 결과 중 하나다.
Professional Knowledge Work
AA Briefcase v1.1은 1,546에서 1,657로 상승했다. 이 작업들은 문서, 프레젠테이션, 분석, 기타 구조화된 산출물 등 다시간에 걸친 전문 업무를 반영하도록 설계되었다.
Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: How Do They Compare?
공급사 기본 가격 점검: OpenAI는 GPT-5.6 Sol을 입력 100만 토큰당 $4, 출력 100만 토큰당 $20로, Anthropic은 Claude Fable 5.1을 입력 $10, 출력 $50로 안내한다.
| Dimension | Grok 4.7 | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Primary positioning | 코딩, 에이전트형 작업, 지식 업무 | 복잡한 전문 추론 및 코딩 | 장시간 에이전트, 코딩, 지식 업무 |
| Context window | 500,000 tokens | 1,050,000 tokens | 1,000,000 tokens |
| Modalities | 텍스트·이미지 입력; 텍스트 출력 | 텍스트·이미지 입력; 텍스트 출력 | 텍스트·이미지 입력; 텍스트 출력 |
| Reasoning control | low, medium, high, xhigh | None through max | Adaptive thinking with configurable effort |
| Provider API status | 공개 xAI API에서 사용 가능 | OpenAI Chat Completions 및 Responses에서 사용 가능 | Claude API 및 지원 클라우드 마켓플레이스에서 사용 가능 |
| Input price / 1M tokens | $2 | $4 | $10 |
| Output price / 1M tokens | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% | 72.7% | 70.0% |
| Best fit | 가격 민감한 엔지니어링 에이전트와 지속적 도구 사용 | 매우 긴 컨텍스트가 필요한 광범위 전문 추론 | 최대 성능 장시간 에이전트, 코딩, 지식 워크플로 |
Which Model Should You Choose?
- Grok 4.7을 선택: 엔지니어링 워크로드, 지속적 도구 사용, 구성 가능한 추론, 낮은 출력 토큰 비용이 우선일 때. 리포지토리 에이전트, 터미널 워크플로, 200K 가격 임계 이하에 머무는 대형 컨텍스트 리서치에 특히 매력적이다.
- GPT-5.6 Sol을 선택: 100만 토큰을 넘는 컨텍스트가 필요하거나, DeepSWE나 임상 추론처럼 비즈니스 핵심 평가에서 더 강한 결과가 자체 하니스에서 검증되었을 때.
- Claude Fable 5.1을 선택: 장시간 에이전트 성능, 코딩 품질, 터미널 실행, 임상 추론이 더 높은 토큰 가격을 정당화할 때.
- 모델 라우팅 사용: 워크로드가 다양할 때. 일상적 엔지니어링과 고빈도 에이전트 단계를 가장 비용 효율적이고 적격한 모델로 라우팅하고, 성공률이 프리미엄을 정당화하는 작업에는 더 비싼 모델을 예약하라.
올바른 선택은 단일 벤치마크나 입력 토큰 단가가 아니라, 종단 간 작업 성공, 지연 시간, 재시도, 도구 호출 정확도, 인간 재작업에 달려 있다.
How Much Does the Grok 4.7 API Cost?
아래 표는 2026년 9월 22일 기준 CometAPI의 Grok 4.7 모델 페이지에 표시된 가격과 공식 xAI 요율을 비교한다. CometAPI는 20% 할인이라 명시한다. 게이트웨이 가격과 프로모션 조건은 변동될 수 있으므로 프로덕션 전에 실시간 가격을 확인하라.
| Prompt tier | Price type | xAI official | CometAPI | Difference |
|---|---|---|---|---|
| Below 200K prompt tokens | Input / 1M | $2.00 | $1.60 | 20% lower |
| Cached input / 1M | $0.50 | $0.40 | 20% lower | |
| Output / 1M | $6.00 | $4.80 | 20% lower | |
| Above 200K prompt tokens | Input / 1M | $4.00 | $3.20 | 20% lower |
| Cached input / 1M | $1.00 | $0.80 | 20% lower | |
| Output / 1M | $12.00 | $9.60 | 20% lower |
Standard Context Pricing for Prompts Up to 200,000 Tokens
프롬프트가 200,000토큰을 넘지 않는 요청의 경우, Grok 4.7 비용은 입력 100만 토큰당 $2, 캐시된 입력 100만 토큰당 $0.50, 출력 100만 토큰당 $6이다. 캐시된 입력이 가장 저렴하므로, 반복되는 시스템 지침이나 재사용 가능한 컨텍스트가 캐시에 해당되면 비용을 줄일 수 있다.
간단한 예로, 100,000개의 비캐시 입력 토큰을 사용하고 10,000개의 출력 토큰을 생성하는 요청은 기타 플랫폼 요금을 제외하고 약 $0.26가 든다: 입력 $0.20, 출력 $0.06.
Long-Context Pricing Above 200,000 Prompt Tokens
프롬프트가 200,000토큰을 초과하면 요율이 입력 100만 토큰당 $4, 캐시된 입력 100만 토큰당 $1, 출력 100만 토큰당 $12로 두 배가 된다. 더 높은 티어는 프롬프트 길이로 인해 적용되므로, 팀은 각 요청을 보내기 전에 누적 대화 기록, 도구 트레이스, 검색된 문서, 리포지토리 컨텍스트를 모니터링해야 한다.
따라서 실질적 비용 결정은 토큰 수뿐만 아니라 프롬프트가 200,000토큰 경계를 넘는지 여부다. 완료된 작업을 요약하고, 불필요한 도구 출력을 제거하며, 가장 관련 높은 파일만을 검색하면 필요한 컨텍스트를 희생하지 않고 적합한 워크로드를 표준 티어에 유지할 수 있다.
SpaceXAI 릴리스 노트는 이 임계를 문서화한다. 프로덕션 예산은 또한 재시도, 에이전트 루프, 실패한 도구 호출, 출력 길이를 고려해야 하며, 공급자를 입력 토큰 단가만으로 비교하지 말아야 한다.
What Makes Grok 4.7 Useful for AI Agents?
- 500K 컨텍스트 윈도우: 하나의 작업 컨텍스트에 상당한 소스 코드, 명세, 도구 출력, 로그, 대화 기록을 담을 수 있다. 리포지토리 규모 코딩과 다문서 분석에 유용하지만, 컨텍스트는 여전히 적극적 프루닝이 필요하다.
- 구성 가능한 추론: 작업 난이도에 따라 지연과 연산을 맞바꾸며 low, medium, high, xhigh 중에서 선택할 수 있다.
- 함수 호출과 구조화된 출력: 에이전트가 데이터베이스 질의, 테스트 실행, 문서 검사, 내부 API 호출을 수행하고 기계가 읽을 수 있는 결과를 반환할 수 있다.
- 웹 및 X 검색: 모델의 학습 데이터가 불충분할 때 최신 정보를 검색 도구로 가져올 수 있다. 검색 결과는 신뢰되지 않은 입력으로 간주하고 검증해야 한다.
- 코드 실행: 모델이 계산을 검증하고, 데이터를 변환하며, 생성된 솔루션을 테스트할 수 있어, 언어 모델 추론에만 의존하지 않는다.
- 장기 지평 워크플로 초점: 다시간 작업, 컨텍스트 관리, 자기 검증에 대한 훈련 강조는 도구 트레이스가 누적되고 실패 후 복구가 필요한 에이전트 루프에 맞춰져 있다.
How Does Grok 4.7 Improve Safety?
SpaceXAI는 완전히 새로운 안전장치 스택을 도입했다고 하며, 탈옥 저항성과 이중 용도 안전이 강화되었다고 말한다. 출시 발표에서 LatchBio의 바이오안전 벤치마크 62.4%, HackerBench v0.3에서 위험한 이중 용도 프롬프트 허용률 3.3%를 보고한다.
이 수치는 벤더가 공개한 평가다. 출시 주장 이해에는 유용하지만, 현실 세계 안전 성능의 보편적 지표로 취급해서는 안 된다.
How Can Developers Use the Grok 4.7 API?
현재 Grok 4.7은 CometAPI를 통해 사용 가능하며 모델 ID는 grok-4.7이다. CometAPI는 OpenAI 호환 엔드포인트, 다수 모델 공급자에 걸친 단일 API 키와 빌링 워크플로, 손쉬운 나란히 모델 테스트와 라우팅을 제공하며, 현재 표시된 토큰 가격은 공식 xAI 요율 대비 20% 낮다. 프로덕션 사용 전에 라이브 모델 페이지, 엔드포인트 상태, 지원 파라미터, 가격, 데이터 처리 요건을 확인하라.
CometAPI 요청 예시:
curl "https://api.cometapi.com/v1/responses" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-d '{
"model": "grok-4.7",
"input": "Explain how a distributed task queue handles worker failure."
}'
Is Grok 4.7 Worth Switching To?
코딩 에이전트나 장시간 전문 워크플로에 의존하는 기존 Grok 4.6 사용자에게, Grok 4.7은 유의미한 업그레이드 후보이다. 출시 벤치마크 세트가 보고된 모든 차원에서 개선되었고, 장문 컨텍스트 임계 이하에서 표준 토큰 가격이 $2/$6 수준으로 유지되기 때문이다.
다른 프런티어 모델 사용자에게 결정은 워크로드별이다. Grok 4.7은 출력 토큰 비용, 엔지니어링 워크로드, 대형 컨텍스트, 지속적 도구 사용이 중요할 때 특히 흥미롭다. 다른 모델이 핵심 도메인에서 더 강하다면, 모든 작업을 한 공급자로 대체하기보다 모델 라우팅이 더 합리적일 수 있다.
Conclusion
Grok 4.7은 Grok 4.6의 단순한 수치 업데이트가 아니다. 이 릴리스는 도구를 통한 장시간 작업, 반복 검증, 대형 컨텍스트, 다중 실행 단계를 명시적으로 지향한다.
가장 큰 세대 향상은 그러한 훈련 방향이 중요해질 영역에서 나타난다: Terminal-Bench 4.0은 20.3%에서 38.0%로, EEBench는 53.0%에서 64.0%로, CursorBench 4.0은 40.4%에서 46.3%로 상승했으며, 200K 프롬프트 임계 이하의 표준 가격은 입력 $2/100만, 출력 $6/100만으로 유지된다.
따라서 실용적 가치 제안은 “Grok 4.7이 모든 벤치마크에서 승리한다”가 아니다. Grok 4.7은 프런티어급 에이전트 역량과 더 낮은 추론 비용의 간극을 좁혀, 일회성 답변이 아니라 많은 단계를 통해 작동해야 하는 코딩 에이전트, 리서치 시스템, 전문 워크플로에 특히 관련성이 크다.
