DR
캐시된 입력 가격은 큰 고정 프롬프트 프리픽스를 반복해서 보내는 워크로드의 비용을 실질적으로 줄일 수 있지만, 절감 폭은 모델별 캐시 읽기/쓰기, 스토리지, 라우팅, 보존 규칙에 따라 달라집니다. 일반적인 “캐싱 지원” 라벨만으로는 비용을 가늠할 수 없습니다. 정확한 모델과 라우트에 대해 현재 공표된 가격을 사용하세요.
TL;DR
- GPT-5.6 Terra는 OpenAI, CometAPI, OpenRouter에서 명시적인 캐시 읽기/쓰기 가격이 있으며, 게이트웨이 라우트와 롱 컨텍스트 티어에 따라 금액이 달라질 수 있습니다.
- Google은 Gemini 3.6 Flash에 대해 Standard 컨텍스트 캐싱 요금을 1M 토큰당 $0.15로, 여기에 스토리지 요금을 추가로 공표합니다. CometAPI는 현재 이 모델의 표준 입력/출력 가격만 게시하고 별도의 캐시된 입력 라인은 제공하지 않습니다.
- 관련 비교는 표준 입력과 캐시 읽기만이 아닙니다. 최초 캐시 쓰기 비용, 스토리지 요금, 캐시 수명, 라우트 일관성, 이후 캐시 히트 횟수까지 포함됩니다.
Key messages
- 게이트웨이 전체에 일괄 곱셈을 적용하기보다 모델 및 서비스 티어 수준에서 가격을 확인하세요.
- 비용 계산에서 캐시 읽기, 캐시 쓰기, 스토리지, 응답 캐싱을 구분하세요.
- 공표된 요율로 절감을 예측하기 전에 API 응답 메타데이터에서 실제 캐시 사용 여부를 검증하세요.
큰, 변하지 않는 프리픽스(시스템 프롬프트, 도구 스키마 집합, 긴 참조 문서 등)를 반복하는 요청은 매번 전체 입력 단가로 과금되지 않아도 됩니다. 최신 세대의 대부분 모델은 캐시된 입력 가격을 지원합니다. 이는 제공자가 이미 처리한 프롬프트 일부에 대해 할인된 요율을 적용하는 메커니즘입니다. 메커니즘, 할인 폭, 공개의 명확성은 제공자와 게이트웨이에 따라 다르며, 이를 “캐싱 지원”이라는 획일적 기능으로 취급하기보다 구체적으로 구분하는 것이 좋습니다.
캐시된 입력 가격: 무엇이고 무엇이 아닌가
캐시된 입력 가격은 이전에 보낸 프리픽스와 일치하는 요청의 입력 토큰에 할인을 적용합니다. 출력 토큰에는 할인이 적용되지 않으며, 완전히 동일한 두 요청을 게이트웨이가 중복 제거하고 하나의 응답을 무료로 반환하는 것과도 다릅니다. 캐시된 입력 가격은 생성 자체를 건너뛰는 것이 아니라, 제공자가 최근에 본 프롬프트 일부에 대해 더 적게 지불하는 것에 초점을 둡니다.
또한 캐시 생성은 무료가 아닙니다. OpenAI의 GPT-5.6 가격 안내에 따르면 캐시 쓰기는 비캐시 입력 요율의 1.25배로 과금되며, 캐시 읽기는 90% 할인을 받습니다. 이 최초 쓰기 가산 요금은 손익분기점에 영향을 주며, 비교가 할인된 읽기 요율만 보여줄 경우 쉽게 간과됩니다. 다른 제공자는 동일한 쓰기 모델 대신 스토리지 기반 요금을 사용할 수 있으므로, 쓰기 및 스토리지 비용을 별도로 확인해야 합니다.
실무적으로 과금 기준 캐시 단위는 임의의 반복 문장 모음이 아니라 재사용 가능한 프롬프트 프리픽스인 경우가 대부분입니다. 제공자는 콘텐츠를 순서대로 토큰화하고 매칭하므로, 재사용 가능한 자료는 요청별 꼬리보다 앞에 위치해야 합니다. 안정적인 시스템 지침, 도구 정의, 정책, 참조 자료는 앞부분에, 변하는 사용자 메시지, 타임스탬프, 요청 ID, 검색 스니펫 등은 뒷부분에 두세요. 앞부분의 의미상 무해한 변경조차 토큰화를 바꾸거나 이후 전체 매칭을 깨뜨릴 수 있습니다.
적격성 규칙도 모델별입니다. 최소 프롬프트 길이를 요구하거나, 문서화된 분기점만 인식하거나, 명시적 캐시 제어 필드를 노출할 수 있습니다. 캐시 항목은 호출 사이에 만료될 수 있고, 게이트웨이는 관련 요청을 호환 가능한 업스트림 라우트로 유지해야 할 수 있습니다. 따라서 캐시 히트는 프롬프트 유사성에서 추정하기보다 관측된 결과로 다뤄야 합니다. 잘 구성된 프롬프트는 재사용 가능성을 높이지만, 할인 적용 여부는 응답 메타데이터와 청구서가 결정합니다.
모델 및 게이트웨이별로 실제로 공개된 사항
아래 표는 2026년 7월 29일에 확인한 가격 스냅샷입니다. 별도 기재가 없는 경우 단위는 1백만 토큰(1M)당 미화 달러입니다. 행은 GPT-5.6 Terra와 Gemini 3.6 Flash에 대해 모델 제공자, CometAPI, OpenRouter의 최신 공개 정보를 비교합니다. 영구적인 요금으로 취급하지 마세요.
| 모델 | 게이트웨이 | 표준 입력 | 캐시된 입력(읽기) | 캐시 쓰기 | 할인 공개 여부? |
|---|---|---|---|---|---|
| GPT-5.6 Terra | 공식 OpenAI 요금 | $2.50 / 1M | $0.25 / 1M | $3.13 / 1M | 예 — 90% 할인, 명시 |
| GPT-5.6 Terra | CometAPI | $2.00 / 1M | $0.20 / 1M | $2.50 / 1M | 예 — CometAPI의 자체 가격 페이지에 표기 |
| GPT-5.6 Terra | OpenRouter | $2.50 / 1M | 구체적 요금으로 미표기 | 미표기 | 아니오 — 전체적으로 "60–80% 저렴"으로만 설명, 모델별 수치는 없음 |
| Gemini 3.6 Flash | 공식 Google 요금 | $1.50 / 1M | $0.15 / 1M (Google 자체 발표 기준) | 비공개 | 예, 출시 시 — Google의 모델 문서에 따름 |
| Gemini 3.6 Flash | CometAPI | $1.20 / 1M | 구체적 요금으로 미표기 | 비공개 | 아니오 — CometAPI 페이지에 “Caching” 지원 표시는 있으나, 본 문서 작성 시점에 이 특정 모델의 할인된 캐시 입력 수치는 게시되지 않음 |
| Gemini 3.6 Flash | OpenRouter | $1.50 / 1M | 구체적 요금으로 미표기 | 비공개 | 아니오 — OpenRouter 문서는 Google의 캐시 승수를 일반적으로(리스트 입력의 0.25배) 설명할 뿐, 이 모델의 구체적 요율을 확인해 주지는 않음 |
표는 모델 및 라우트별 스냅샷으로 읽으세요. CometAPI GPT-5.6 모델 페이지는 GPT-5.6 Terra를 1M당 표준 입력 $2.00, 캐시 입력 $0.20, 캐시 쓰기 $2.50로 항목별 기재합니다. Gemini 3.6 Flash 모델 페이지는 현재 입력 $1.20, 출력 $6.00을 게시하지만, 별도의 캐시 입력 또는 캐시 스토리지 가격은 표시하지 않습니다. Google의 Gemini Developer API 가격은 Standard 티어에서 입력 $1.50, 컨텍스트 캐싱 $0.15, 스토리지 시간당 1M 토큰당 $1.00을 기재합니다. OpenRouter는 이제 Models API를 통해 모델별 캐시 필드를 노출합니다. GPT-5.6 Terra의 기본 라우트에는 더 낮은 프로모션 가격과 별도의 더 높은 롱 컨텍스트 티어가 있으며, Gemini 3.6 Flash 항목은 서로 다른 Standard, Flex, Priority 값을 노출합니다. 이는 모든 모델에 하나의 일반적인 캐시 승수를 적용하는 것보다 정밀합니다.
게이트웨이와 제공자 요금이 달라질 수 있는 이유
게이트웨이 가격은 하나의 불변 업스트림 리스트 가격에 단순 마크업을 적용한 것이 아닐 수 있습니다. 협상된 용량, 임시 프로모션, 다른 서비스 티어, 라우트별 상업적 조건을 반영할 수 있습니다. 하나의 모델명이 컨텍스트 길이 또는 지연 보장에 따라 가격이 달라지는 여러 업스트림 변형에 매핑될 수도 있습니다. 예를 들어 OpenRouter의 GPT-5.6 Terra 항목은 기본 라우트와, 입력이 롱 컨텍스트 임계값에 도달하면 더 높은 가격의 오버라이드를 공개합니다. Google은 Gemini 3.6 Flash에 대해 Standard, Batch, Flex, Priority 가격을 구분합니다. 따라서 단일 비교 행이 의미 있으려면 날짜, 라우트, 티어, 컨텍스트 가정을 함께 명시해야 합니다.
역도 중요합니다. 게이트웨이 페이지에 별도의 캐시 읽기 라인이 없다고 해서 이를 “캐싱 불가” 또는 “제공자의 직접 할인 자동 적용”으로 해석하면 안 됩니다. 게이트웨이는 업스트림 기능을 항목화 없이 패스스루 하거나, 특정 라우트에서만 노출하거나, 요청을 일반 입력 요율로 과금할 수 있습니다. 방어 가능한 접근법은 게이트웨이의 최신 모델 페이지를 계획에 사용하고, 이후 사용 기록이나 청구 데이터로 실제 요율을 확인하는 것입니다. 제공자 문서는 메커니즘을 이해하는 데는 유용하지만, 중개자의 상업 조건을 그 자체로 확정하지는 않습니다.
할인 효과가 실제로 큰 경우
현실적으로 비용이 크게 변하는 시나리오는 큰 정적 프리픽스에 작은 가변 요청이 붙는 경우입니다. 에이전트 루프에서 매 호출마다 재전송되는 시스템 프롬프트나 도구 스키마 집합, 다른 질문으로 반복 조회하는 긴 참조 문서, 매 챗봇 턴마다 재전송되는 대화 이력 등이 이에 해당합니다. 이러한 워크로드에서는 프리픽스 전체를 매번 전체 입력 가격으로 지불하는 것과, 최초 쓰기 프리미엄을 한 번 지불한 후 이후에 할인된 읽기 요율로 지불하는 것의 차이가 호출량과 함께 누적됩니다. 반대로 프리픽스를 반복하지 않는 워크로드에는 아무 효과가 없습니다. 일회성 요청에는 할인할 캐시 콘텐츠가 없기 때문입니다.
실용적인 손익분기 계산은 모든 호출에서 반복 프리픽스의 비캐시 비용과, 캐시 쓰기 또는 스토리지 비용 및 이후 호출에서의 할인된 캐시 읽기를 비교합니다. 결과는 프리픽스 크기, 성공적인 캐시 히트 수, 캐시 만료, 게이트웨이가 요청을 호환되는 제공자 라우트로 유지하는지에 따라 달라집니다. 이러한 조건이 불안정하면, 표면적인 할인율이 실제 프로덕션 절감 효과를 과대평가할 수 있습니다.
반복 프리픽스를 위한 단순 비용 모델
P를 안정적인 프리픽스의 토큰 수, N을 이를 재사용하는 호출 수라고 합시다. 비캐시 입력 토큰당 가격이 U라면, 캐싱 없이 프리픽스 비용은 N × P × U입니다. 단순화한 캐시 추정치는 P × W + (N − 1) × P × R + S이며, 여기서 W는 캐시 쓰기 가격, R은 캐시 읽기 가격, S는 기간 중 스토리지 요금입니다. 이 공식은 첫 호출이 캐시를 생성하고 이후 모든 호출이 성공적으로 히트한다고 가정합니다. 각 요청의 가변 꼬리, 출력 토큰, 재시도, 라우트 변경으로 인한 미스는 제외합니다.
공식 GPT-5.6 Terra 요율에서 100,000토큰 프리픽스를 20회 재사용하는 예를 생각해 봅시다. 1M 비캐시 입력 토큰당 $2.50일 때, 해당 프리픽스를 반복 처리하면 $5.00가 듭니다. 공표된 1.25배 쓰기 요율과 90% 할인 읽기 요율을 사용할 경우, 100,000토큰 1회 쓰기는 약 $0.3125, 열아홉 번의 읽기는 약 $0.475로, 프리픽스 결합 비용은 대략 $0.7875입니다. 차이는 가변 입력 및 출력 비용 전 기준으로 약 $4.21입니다. 이는 견적이 아닌 예시입니다. 열아홉 번의 이후 호출이 모두 동일한 유효 캐시를 히트하고 추가 스토리지 또는 라우팅 요금이 적용되지 않을 때만 성립합니다.
손익분기점은 동일한 모델에서 직접 도출됩니다. 쓰기 가산 요금은 만료 전에 충분한 할인 읽기가 발생할 때에만 정당화됩니다. 세션이 짧거나, 프롬프트 편집이 잦거나, 라우트 결속이 약한 워크로드에서는 캐시가 예상보다 자주 재생성될 수 있습니다. 반면 안정적인 프리픽스를 가진 장수 에이전트 루프나 반복 문서 분석에서는 히트 횟수가 훨씬 더 많을 수 있습니다. 따라서 예측 시에는 첫 호출 이후 완벽한 연속을 가정하기보다 관측된 히트율 범위를 사용하세요.
캐시 재사용률을 높이는 구현 패턴
프롬프트 구성은 많은 가격 계산표가 암시하는 것보다 히트율에 더 큰 영향을 줍니다. 가장 안정적인 자료를 앞에 두고 직렬화가 항상 동일하게 유지되도록 하세요. 시스템 지침, 도구 스키마, 정책 텍스트, 공유 참조 컨텍스트는 관련 호출 간에 동일한 순서, 공백, 필드 표현을 유지하고, 변동하는 콘텐츠는 뒤에 추가하세요. 타임스탬프, 랜덤 식별자, 지속 증가 카운터, 요청별 검색 결과는 정말 필요한 경우가 아니라면 재사용 프리픽스에 주입하지 마세요.
안정적인 자료에 버전을 의도적으로 부여하세요. 도구 스키마나 정책이 변경되면 거의 동일한 여러 변형이 떠돌지 않도록 새 버전을 일관되게 지정하세요. 대화형 또는 에이전트형 워크로드에서는 API가 지원할 경우 안정적인 세션 식별자 또는 캐시 키를 재사용하고, 동일한 캐시에 의존하는 시퀀스 중에는 제공자 전환을 피하세요. OpenRouter는 프롬프트 캐싱을 위한 제공자 고정 라우팅을 문서화하고 session_id, prompt_cache_key와 같은 제어를 노출합니다. 이러한 제어는 연속성을 개선할 수 있지만, 업스트림 캐시가 콜드이거나 만료된 경우 히트를 보장하지는 않습니다.
애플리케이션은 미스 시에도 정상적으로 동작해야 합니다. 캐싱은 비용 및 지연 최적화일 뿐, 정합성 의존성이 아닙니다. 캐시가 없을 때도 요청은 동일하게 유효한 결과를 생성해야 하며, 재시도 로직이 무분별하게 반복 쓰기를 만들지 않아야 합니다. 이 분리를 통해 라우트 비교가 더 안전해집니다. 팀은 애플리케이션의 의미적 동작을 변경하지 않고도 캐싱 정책이나 게이트웨이 구성을 변경할 수 있습니다.
프로덕션에서 캐시 경제성을 검증하는 방법
월별 청구서보다 요청 단위 텔레메트리부터 시작하세요. 노출되는 경우 정확한 모델 식별자, 게이트웨이 라우트 또는 제공자, 서비스 티어, 총 입력 토큰, 캐시 읽기 토큰, 캐시 쓰기 토큰, 출력 토큰, 지연 시간, 과금 비용을 로그로 남기세요. OpenRouter의 사용량 객체에는 cached_tokens 및 cache_write_tokens가 포함됩니다. 다른 제공자는 다른 필드명으로 동등한 세부 정보를 노출합니다. 이후 가격 변경이 증거를 지워버리지 않도록 원시 사용량 필드를 보존하세요.
데이터는 모델뿐 아니라 프롬프트 버전과 워크로드 단위로 집계하세요. 유용한 지표로는 캐시에 적격한 요청 중 히트 비율, 읽기 요율로 과금된 입력 토큰 비중, 성공적 읽기당 쓰기 횟수, 쓰기와 마지막 히트 사이의 시간, 요청당 실현 비용 등이 있습니다. 요청 수준 히트율이 높아도 캐시 프리픽스가 작다면 가치가 낮을 수 있고, 히트율이 다소 낮아도 매우 큰 프리픽스에서는 더 많이 절감할 수 있습니다. 반복 미스나 재라우팅이 잦은 더 저렴한 라우트는 운영 면에서 더 나쁠 수 있으므로 지연 시간 퍼센타일과 함께 보세요.
마지막으로 이상 징후를 평균으로 희석하지 말고 검토하세요. 캐시된 토큰이 갑자기 감소하면 프롬프트 버전 롤아웃, 불안정한 직렬화, 만료된 항목, 롱 컨텍스트 티어 경계, 게이트웨이 라우트 변경을 의심할 수 있습니다. 영향을 받은 요청을 현재 모델 페이지와 제공자 문서와 비교하고, 과금 요율을 확인하세요. 이렇게 해야 공표된 할인과 애플리케이션이 실제로 실현하는 절감 사이의 간극을 줄일 수 있습니다.
요금 적용을 가정하기 전에 확인할 사항
예산에 공표 요율을 적용하기 전에 다섯 가지를 확인하세요. 정확한 모델과 서비스 티어, 최소 재사용 프리픽스 또는 명시적 캐시 분기점, 최초 쓰기 또는 스토리지 요금, 캐시 수명, 실제로 캐시를 히트하고 있다는 증거입니다. OpenAI는 현재 GPT-5.6에 대해 최소 30분 캐시 수명을 명시하지만, 이는 보편적 보존 규칙이 아닙니다. Google은 Standard, Batch, Flex, Priority 서비스 티어별로 다른 요율을 공표합니다. 게이트웨이는 제공자나 티어 간 라우팅할 수도 있으므로 선택한 라우트가 중요합니다. OpenRouter의 프롬프트 캐싱 문서는 cached_tokens 및 cache_write_tokens 같은 응답 사용량 필드를 확인할 것을 권장합니다. 어떤 프로덕션 추정치든 일반적인 “캐싱 지원” 라벨만 의존하지 말고, 현재 모델 페이지를 실제 청구 및 사용 메타데이터와 함께 비교하세요.
