GPT-6.1 Sol are now live on CometAPI →
technology/CometAPI 리서치

CometAPI에서의 Grok 4.7 API 요금: 공식 기준 요금, 비용 추정 및 절감액

Grok 4.7 API 요금을 CometAPI 가격과 비교하고, 월간 지출을 추정하고, 캐싱, 컨텍스트 제어, 애플리케이션 수준 출력 상한을 통해 AI 앱 비용을 줄이십시오.

CometAPI
Bobby SpencerAI 모델 및 API 리서치 팀
업데이트됨 Oct 1, 2026 9 분 읽기
CometAPI에서의 Grok 4.7 API 요금: 공식 기준 요금, 비용 추정 및 절감액
이 패턴 사용

첫 API 호출하기.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

xAI는 Grok 4.7을 코딩, 에이전트형 작업, 지식 작업을 위한 프런티어 모델로 소개하며, 500K 토큰 컨텍스트 윈도우를 제공합니다. xAI의 최신 가격 페이지에 따르면, 200,000 프롬프트 토큰 미만의 직접 API 요율은 입력 토큰 백만 개당 $2.00, 캐시된 토큰 백만 개당 $0.50, 출력 토큰 백만 개당 $6.00입니다. 프롬프트가 200,000 토큰 이상에 도달하면 각각 $4.00, $1.00, $12.00로 기재되어 있습니다. 이는 xAI 직접 요율이며, 서드파티 플랫폼 전반에 적용되는 보편 가격이 아닙니다.

실제 지출은 표면적인 입력 요율 이상의 요인에 좌우됩니다. 신규 입력, 캐시된 입력, 출력, 재시도, 도구 호출, 그리고 에이전트 워크플로의 모델 호출 횟수 등이 청구액을 바꿉니다. 특히 200K 프롬프트 임계값이 중요한데, 이 경계를 넘으면 xAI와 CometAPI 모두 긴 컨텍스트 요율을 적용한다고 발표하고 있습니다.

본 가이드는 먼저 xAI 가격 기준을 정리한 뒤, 현재의 CometAPI Grok 4.7 목록을 비교합니다. 2026년 9월 28일 기준, CometAPI는 표준 티어에서 신규 입력/캐시된 입력/출력 토큰 각각 백만 개당 $1.60 / $0.40 / $4.80, 롱 컨텍스트 티어에서 $3.20 / $0.80 / $9.60로 기재하고 있으며, 해당 xAI 직접 요율 대비 20% 낮습니다. 이어지는 섹션에서는 워크로드 비용 계산법, 낭비를 줄이는 방법, CometAPI를 통한 모델 접근법을 설명합니다. 모든 가격은 시점별 스냅샷이므로, 프로덕션 사용 전 반드시 재확인해야 합니다.

xAI Direct vs. CometAPI Grok 4.7 Pricing

xAI 직접 요율(USD per 1M tokens)

Token categoryBelow 200K prompt tokensLong context (≥200K)
Fresh input$2.00$4.00
Cached input$0.50$1.00
Output$6.00$12.00

CometAPI 요율(USD per 1M tokens)

Token categoryCometAPI: below 200K prompt tokensCometAPI: long-context tier
Fresh input$1.60 / 1M tokens$3.20 / 1M tokens
Cached input$0.40 / 1M tokens$0.80 / 1M tokens
Output$4.80 / 1M tokens$9.60 / 1M tokens

200K 프롬프트 경계가 중요한 이유는, 두 플랫폼 모두 현재 Grok 4.7에 대해 표준 티어 요율의 정확히 두 배를 롱 컨텍스트 요율로 게시하고 있기 때문입니다. 이는 각 API 플랫폼의 가격 규칙이며, 모델의 기능 변화가 아닙니다. 애플리케이션이 큰 프롬프트를 반복적으로 전송하거나 에이전트 히스토리를 제어 없이 키우면 요청 비용이 증가합니다. 이는 Grok 4.7이 500K 컨텍스트 윈도우를 지원하기 때문이 아니라, 가격 규칙 때문에 발생합니다.

예산 책정 시에는 경계에 도달할 것으로 예상되는 요청을, 실제 청구 동작이 확인될 때까지 롱 컨텍스트로 취급하세요. 모델 가용성과 가격은 변경될 수 있으므로, 프로덕션 계산기는 xAI 직접 가격과 현재 CometAPI 모델 페이지를 고정값 대신 매번 확인해야 합니다.

The Formula for Estimating Grok 4.7 Cost

요청 1건의 비용은 토큰 범주별로 따로 가격을 매겨 추정합니다:

request cost = (fresh input tokens × input rate + cached input tokens × cached rate + output tokens × output rate) ÷ 1,000,000

그다음 요청 단위 추정을 워크로드 단위로 변환합니다:

monthly cost = request cost × requests per user × active users × days in billing period

하나의 평균값보다 현실적인 분위수를 사용하세요. p50 추정은 보통의 요청을 설명하지만, p95 입력 및 출력 길이는 청구액을 좌우하는 비싼 꼬리를 드러냅니다. 에이전트 워크플로의 경우, 완료된 작업당 예상 모델 호출 횟수를 곱하세요. 5단계 워크플로는 1건이 아니라 청구 가능한 5건의 호출입니다.

Worked Example 1: A Support Copilot

지원 요청 1건이 6,000개의 신규 입력 토큰을 보내고 800개의 출력 토큰을 생성한다고 가정합니다. 200K 임계값 미만이며 캐시 할인은 없습니다.

  • 입력: 6,000 × $1.60 ÷ 1,000,000 = $0.00960
  • 출력: 800 × $4.80 ÷ 1,000,000 = $0.00384
  • 합계: 요청당 $0.01344

월 100,000건 요청일 때, 추정 토큰 비용은 $1,344입니다. 평가 결과 400토큰 답변이 800토큰 답변과 동일하게 성능을 내는 것으로 확인되면, 추정치는 요청당 $0.01152, 월 $1,152로 감소합니다. 이 단일 출력 상한만으로 월 약 $192, 즉 14.3%를 절감합니다. 모델을 바꾸지 않고도 가능한 절감입니다.

이 때문에 출력 제어가 중요합니다. 현재 CometAPI 요율에서는 동일 티어에서 출력 토큰이 신규 입력 토큰보다 3배 비쌉니다.

Worked Example 2: Reusing a Stable 20K-Token Prefix

각 요청에 20,000토큰짜리 제품 매뉴얼, 2,000토큰의 신규 대화 컨텍스트, 600토큰의 응답이 포함된다고 가정합니다.

캐시 히트가 없으면 추정치는 다음과 같습니다:

  • 신규 입력 토큰 22,000개: $0.03520
  • 출력 토큰 600개: $0.00288
  • 합계: 요청당 $0.03808

20,000토큰의 안정적인 프리픽스가 캐시된 입력으로 청구되고, 2,000토큰만 신규 입력으로 남는다면 추정치는 다음과 같습니다:

  • 캐시된 입력 토큰 20,000개: $0.00800
  • 신규 입력 토큰 2,000개: $0.00320
  • 출력 토큰 600개: $0.00288
  • 합계: 요청당 $0.01408

100,000건 요청 시 $3,808이 아닌 $1,408으로, 약 $2,400(63.0%) 절감입니다. 다만 절감은 자동이 아닙니다. 최초 요청, 변경된 프리픽스, 캐시 히트가 발생하지 않는 라우트에서는 여전히 신규 입력 요율로 청구될 수 있습니다. 추정치를 달성된 절감으로 간주하기 전에 실제 사용 데이터에서 캐시된 토큰 수를 확인하세요.

Worked Example 3: The Cost of Crossing 200K

프롬프트 토큰이 210,000개이고 출력 토큰이 2,000개인 장시간 실행 에이전트 요청을 가정합니다. 게시된 롱 컨텍스트 요율을 사용하면:

  • 신규 입력 토큰 210,000개: $0.67200
  • 출력 토큰 2,000개: $0.01920
  • 합계: 실행당 $0.69120

컨텍스트 압축, 검색 필터링, 요약 체크포인트로 프롬프트를 180,000토큰으로 줄이면서 동일한 2,000토큰 출력을 유지하면 표준 티어 추정은 다음과 같습니다:

  • 신규 입력 토큰 180,000개: $0.28800
  • 출력 토큰 2,000개: $0.00960
  • 합계: 실행당 $0.29760

차이는 실행당 $0.39360, 약 56.9%입니다. 10,000회 실행 시 추정 절감액은 $3,936입니다. 교훈은 유용한 컨텍스트를 삭제하라는 뜻이 아닙니다. 답변에 영향을 주는 컨텍스트만 유지하고, 임계값을 넘기기 전에 나머지는 요약하거나 검색해 삽입하라는 뜻입니다.

A Python Calculator for Pre-Call Estimates

다음 함수는 CometAPI에 현재 게시된 Grok 4.7 요율을 사용합니다. 전체 프롬프트가 200,000토큰에 도달하면 보수적으로 롱 컨텍스트 티어를 적용합니다.

from dataclasses import dataclass

@dataclass(frozen=True)
class Rates:
    input_per_million: float
    cached_input_per_million: float
    output_per_million: float

SHORT = Rates(1.60, 0.40, 4.80)
LONG = Rates(3.20, 0.80, 9.60)

def estimate_grok_47_cost(
    fresh_input_tokens: int,
    cached_input_tokens: int,
    max_output_tokens: int,
) -> float:
    prompt_tokens = fresh_input_tokens + cached_input_tokens
    rates = LONG if prompt_tokens >= 200_000 else SHORT

    return (
        fresh_input_tokens * rates.input_per_million
        + cached_input_tokens * rates.cached_input_per_million
        + max_output_tokens * rates.output_per_million
    ) / 1_000_000

estimate = estimate_grok_47_cost(
    fresh_input_tokens=2_000,
    cached_input_tokens=20_000,
    max_output_tokens=600,
)
print(f"Estimated upper bound: ${estimate:.5f}")

이는 계획 수립을 위한 가드일 뿐, 인보이스가 아닙니다. 최종 비용은 실제 입력, 캐시된 입력, 출력, 재시도, 도구 호출, 실행 시점의 활성 가격에 따라 달라집니다. 각 응답 후 반환된 토큰 사용량, 모델 ID, 요청 상태, 작업 결과를 저장하고, 공급자의 청구 기록과 대조하세요.

Five Grok 4.7 Cost Controls, Ranked by Likely Impact

1. 반복 컨텍스트를 캐시 가능하도록 충분히 안정화

정적 지침, 제품 문서, 스키마, 재사용 예제를 요청별 콘텐츠 앞에 배치하세요. 큰 공용 프리픽스 내부에서 타임스탬프, ID, 공백, 순서를 변경하지 마세요. xAI의 Grok 4.7 가이드는 대화에 안정적인 캐시 라우팅 식별자를 권장합니다. 중개 라우트를 사용할 경우, 의존하기 전에 지원되는 캐시 제어와 사용량 필드를 확인하세요.

워크로드별 캐시 히트 토큰과 캐시 히트율을 측정하세요. 애플리케이션이 프리픽스를 지속적으로 변형한다면, 이론상의 캐시 할인은 가치가 없습니다.

2. 200K를 목표가 아닌 엔지니어링 예산으로 취급

임계값 아래에 시스템 지시문, 검색 결과, 도구 결과, 다음 사용자 턴을 위한 여유를 남겨두세요. 에이전트의 경우 오래된 턴을 검증된 요약으로 압축하고, 원본 대화 기록은 모델 컨텍스트 밖에 보관하세요. 검색의 경우 모든 매치를 삽입하지 말고 랭킹과 중복 제거를 거친 뒤 삽입하세요.

프롬프트 길이 분포를 추적하고 p95가 임계값에 접근하기 전에 경고를 발생시키세요. xAI 공식 요율표에 따르면, 프롬프트가 200K 토큰에 도달하면 해당 요청의 모든 토큰에 롱 컨텍스트 요율이 적용됩니다. CometAPI도 Grok 4.7에 대해 별도의, 더 높은 롱 컨텍스트 티어를 게시합니다. 이는 모델 기능이 아닌 플랫폼 가격 조건입니다.

3. 출력 상한과 추론 강도를 평가 세트에 맞춰 조정

제품에 맞는 애플리케이션 수준의 출력 상한을 설정하세요. 분류 결과는 수십 토큰이면 충분할 수 있고, 지원 답변은 수백 토큰, 연구 보고서는 더 필요할 수 있습니다. 이 상한은 Grok 4.7의 하드 리미트가 아니라 예산과 사용자 경험을 위한 제어장치입니다. xAI의 9월 21일 릴리스 노트는 Grok 4.7에 텍스트 출력 제한이 없다고 명시하지만, 애플리케이션 또는 특정 API 라우트가 자체 요청 상한을 강제할 수 있습니다. 실제 사용하는 라우트에서 엔드포인트 또는 SDK가 강제하는 요청 제한을 확인하세요.

Grok 4.7은 여러 추론 노력 수준을 지원합니다. 대표 평가 세트를 통과하는 가장 낮은 수준을 기본으로 사용하고, 측정 가능한 개선이 있는 작업에만 더 높은 수준을 사용하세요. 검증 없이 추론이나 출력을 줄이면 재시도를 유발해 절감을 상쇄할 수 있습니다.

4. API 호출 전에 비싼 요청을 거부하거나 재구성

입력 크기와 구성된 출력 상한으로 상한선을 추정하세요. 요청이 제품 예산을 초과하면, 애플리케이션이 사용자에게 작업 범위를 축소하도록 요청하거나, 업로드 자료를 요약하거나, 검색 컨텍스트를 줄이거나, 승인된 비동기 워크플로로 작업을 전환할 수 있습니다. 이는 생성 후 비용을 발견하는 것보다 예측 가능합니다.

문자 수 대비 토큰 수의 대략적 근사치는 초기 가드로 유용하지만, 토크나이저나 실제 사용 데이터의 대체물이 되어서는 안 됩니다. 언어, 코드, JSON, 서식은 매우 다른 토큰 밀도를 만들어낼 수 있습니다.

5. 호출당 비용이 아니라 성공한 작업당 비용 최적화

검증에서 두 번 실패하는 더 싼 호출은 한 번에 성공하는 호출보다 비쌀 수 있습니다. 다음을 추적하세요:

  • 승인된 답변당 비용
  • 완료된 에이전트 작업당 비용
  • 재시도 및 폴백 비용
  • 캐시 히트율과 캐시된 토큰 비중
  • p50/p95 프롬프트 및 출력 토큰
  • 품질 점수, 지연 시간, 인간 에스컬레이션율

일상 트래픽에 Grok 4.7의 품질이나 컨텍스트 용량이 필요 없다면, CometAPI의 통합 모델 카탈로그는 애플리케이션 주도형 모델 전환을 더 쉽게 해줄 수 있습니다. 라우팅 규칙을 명시적으로 유지하고, 동일한 작업 세트에서 각 모델을 평가한 뒤, Grok 4.7이 이점이 있는 요청만 이 라우트로 보내세요.

A Practical Monthly Cost Review

주 1회, 트래픽을 기능별로 그룹화하고 추정 비용과 실제 사용량을 비교하세요. 출력 토큰이 가장 많은 기능, 프롬프트가 가장 큰 기능, 캐시 히트율이 가장 낮은 기능부터 시작합니다. 그런 다음 중간값을 맹목적으로 최적화하지 말고, 비용이 큰 이상치를 검토하세요.

SignalLikely problemFirst action
Low cached-token shareShared prefix changes too oftenStabilize and version reusable context
Prompts cluster near 200KHistory or retrieval is unboundedCompact, rank, and reserve headroom
Output dominates spendResponses are longer than the product needsLower the cap and test answer quality
High retry costValidation, timeouts, or prompts are unstableFix the first-call failure mode
Low cost but poor task completionThe optimization reduced useful qualityMeasure cost per accepted result

Where CometAPI Fits in the Grok 4.7 Cost Model

CometAPI의 역할은 API 플랫폼 레벨입니다. CometAPI는 Grok 4.7 접근을 제공하고, 자체 토큰 요율을 게시하며, OpenAI 호환 엔드포인트를 문서화합니다. Grok 4.7의 기본 모델 능력을 바꾸지는 않습니다. 이미 OpenAI 스타일 클라이언트를 사용하는 팀은, 엔드포인트 호환성 범위 내에서 API 키, 베이스 URL, 모델 ID만 변경하고 동일한 클라이언트 패턴을 유지할 수 있습니다.

2026년 9월 28일 기준, CometAPI의 게시 요율은 표준 및 롱 컨텍스트 티어 모두에서 해당 xAI 직접 요율 대비 20% 낮습니다. 이는 플랫폼 가격 비교이지 모델 품질 주장과는 다릅니다. 프로덕션 롤아웃 전에는 활성 모델 ID, 엔드포인트 파라미터, 캐시 동작, 요청 속도 제한, 신뢰성, 지원, 청구 조건도 검증해야 합니다.

모델을 테스트하려면 CometAPI Grok 4.7 모델 페이지에서 최신 가격과 접근 정보를 확인하세요. 가격표를 구성에 보관하고, 호출마다 실제 사용량을 기록하며, 모델이나 제품 동작이 바뀔 때마다 워크로드 추정을 다시 실행하세요.

FAQ

CometAPI에서 Grok 4.7의 토큰당 가격은 얼마인가요?

프롬프트가 200K 토큰 미만일 때, CometAPI는 현재 신규 입력/캐시된 입력/출력 토큰 백만 개당 각각 $1.60, $0.40, $4.80를 게시하고 있습니다. 롱 컨텍스트 게시 요율은 각각 $3.20, $0.80, $9.60입니다.

Grok 4.7 API 요청 1건의 비용은 얼마인가요?

신규 입력, 캐시된 입력, 출력, 활성 컨텍스트 티어에 따라 달라집니다. 각 토큰 수에 해당하는 백만당 요율을 곱해 더한 뒤 백만으로 나누세요. 또한 재시도와 다단계 워크플로의 모든 모델 호출을 포함해야 합니다.

Grok 4.7 API 비용을 줄이는 가장 쉬운 방법은 무엇인가요?

가장 큰 비용 요인을 측정해 그 지점부터 시작하세요. 반복적인 긴 지시는 캐시가 유리하고, 커지는 에이전트 히스토리는 압축이 유리하며, 장황한 답변은 낮은 출력 상한이 유리합니다. 변경 후 품질이 허용 가능한지 확인하세요.

500K 컨텍스트 윈도우를 지원한다면 500K 토큰을 보내야 하나요?

아닙니다. 컨텍스트 윈도우는 용량 한도일 뿐 권장치가 아닙니다. xAI 직접 가격과 CometAPI의 현재 게시에 따르면, 200K 프롬프트 임계값에서 더 높은 롱 컨텍스트 요율이 적용되므로, 작업에 필요한 컨텍스트만 보내는 것이 좋습니다.

Grok 4.7 호출 전에 비용을 추정할 수 있나요?

예. 입력 토큰을 추정하고 올바른 컨텍스트 티어를 선택한 뒤, 현실적인 출력 상한을 더해 상한선을 계산하세요. 호출 후에는 보고와 최적화를 위해 추정치를 실제 사용 데이터로 대체하세요.

학습 계속하기

이 글을 다음 결정과 연결하세요.

모든 주제 보기
게시일 Oct 1, 2026
최종 업데이트 Oct 1, 2026
0 회 조회
명확성, 출처 표기 및 최신 API 용어에 대해 검토되었습니다.

더 보기