GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.7 Flash 비용은 얼마인가?
서로 다른 제공업체의 AI 모델 가격을 어떻게 비교할 수 있을까? 동일한 입력-출력 비중, 동일한 통화, 동일한 “성공적 결과” 정의부터 시작하자. 단일한 “1M 토큰당 가격”만으로는 불완전하다. 입력과 출력 토큰은 요금이 다르고, 긴 컨텍스트 요청은 더 높은 구간으로 들어갈 수 있으며, 재시도나 거부된 답변은 실효 비용을 크게 높일 수 있다.
2026년 8월 26일 기준, 캐시되지 않은 입력 토큰 800,000개와 출력 토큰 200,000개로 구성된 워크로드는 현재 CometAPI 요금으로 GPT-5.6 Sol 약 $5.76, Claude Sonnet 5 약 $2.88, Gemini 3.7 Flash 약 $1.08가 든다. 이 모델들은 속도와 능력에서 서로 다른 위치에 있으므로, 이는 청구서 비교일 뿐 동일한 품질을 보장한다는 주장과는 다르다.
공급업체별 AI API 가격을 비교하는 방법
이 글은 백만(1M)개의 과금 대상 텍스트 토큰당 미 달러(USD)를 사용한다. 사례 시나리오는 여러 요청에 걸친 입력 800,000, 출력 200,000 토큰의 고볼륨 지원/지식 워크플로를 나타낸다. 각 요청은 GPT-5.6 Terra의 272,000토큰 단기 컨텍스트 가격 임계값 아래에 머문다.
기본선에는 프롬프트 캐싱, 배치 할인, 도구 비용, 이미지, 오디오, 실패 또는 반복 호출이 제외된다. 또한 하나의 생성된 답변이 승인된다고 가정한다. 공식은 다음과 같다:
cost = (input tokens / 1M × input rate) + (output tokens / 1M × output rate)
문자 수로 추정하지 말고 각 응답에서 반환된 실제 토큰 수를 사용하라. 토크나이저는 모델 계열마다 다르므로 동일한 텍스트라도 과금되는 토큰 수가 같지 않을 수 있다.
GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.7 Flash API 가격
아래 세 가지 모델 ID와 요금은 2026년 8월 26일 CometAPI의 실시간 모델 디렉터리와 대조되었다. CometAPI 요금은 계산 예시에서 사용된 값이다. 공식 가격 열은 참고 기준으로 포함한다.
GPT-5.6 Sol API 가격
GPT-5.6 Terra: CometAPI에는 1M 입력 토큰당 $1.60, 1M 출력 토큰당 $9.60으로, 공식 $2 / $12 요금과 비교된다. 가격 업데이트 참고: 라이브 요금은 20% 인하를 반영한다. CometAPI 변경 로그에는 2026년 7월 31일 Terra 인하가 기록되어 있으며, 8월 22일 가격 검토 이후 수치가 재확인되었다.
검증된 업데이트(2026년 8월 26일): 위의 주석은 검토 앵커를 유지하기 위해 보존한다. 이 글의 계산에는 GPT-5.6 Sol 1M 입력 $3.20, 1M 출력 $16을 사용하라. 공식 $4 / $20와 비교된다. CometAPI는 2026년 8월 24일 이 프로모션을 발표했고, 2026년 11월 21일까지로 표기하고 있다.
Claude Sonnet 5 API 가격
Claude Sonnet 5: 2026년 8월 26일 기준, CometAPI에는 1M 입력 $1.60, 1M 출력 $8로, Anthropic의 현재 $2 / $10 리스트 가격과 비교된다. Anthropic은 2026년 8월 10일 출시 글을 업데이트하여 $2 / $10을 상시 가격으로 만들었고, 9월 1일 $3 / $15로 인상하겠다는 이전 공지는 더 이상 적용되지 않는다.
Gemini 3.7 Flash API 가격
Gemini 3.7 Flash: 2026년 8월 26일 기준, CometAPI에는 1M 입력 $0.60, 1M 출력 $3로, Google의 2026년 12월 31일까지 도입 가격 $0.75 / $3.75와 비교된다.
| 모델 ID | CometAPI 입력 / 출력 | 공식 입력 / 출력 | 800K 입력 + 200K 출력 |
|---|---|---|---|
| gpt-5.6-sol | $3.20 / $16 | $4 / $20 | $5.76 |
| claude-sonnet-5 | $1.60 / $8 | $2 / $10 | $2.88 |
| gemini-3.7-flash | $0.60 / $3 | $0.75 / $3.75 | $1.08 |
모든 가격은 USD 기준 1M 토큰당이다. 날짜가 명시된 모델 페이지인 GPT-5.6, Claude Sonnet 5, Gemini 3.7 Flash와 CometAPI 가격 가이드를 참고하라. Claude Sonnet 5: CometAPI에는 1M 입력 $1.60, 1M 출력 $8로, Anthropic의 현재 $2 / $10 리스트 가격과 비교된다. Anthropic은 원래 2026년 9월 표준 가격 $3 / $15를 발표했지만, 2026년 8월 10일 가격을 업데이트하여 $2 / $10을 상시로 전환했다. GPT-5.6 Terra에는 더 높은 장문 컨텍스트 요금 구간도 있으므로, 게시된 임계값을 초과하는 요청에 단기 컨텍스트 숫자를 적용하지 말라.
이 시나리오에서 Gemini 3.7 Flash가 가장 낮은 토큰 요금을 보이며, 효율적인 Flash 모델로 포지셔닝되어 있다. Claude Sonnet 5는 균형 잡힌 프로덕션 모델이고, GPT-5.6 Sol은 더 어려운 추론 및 코딩 워크로드를 위한 플래그십 옵션이다. 유용한 의사결정은 “어느 행이 가장 싸지?”가 아니라 “어떤 모델이 총 토큰, 재시도, 재실행을 최소화하면서 허용 가능한 결과를 내는가?”이다.
GPT, Claude, Gemini에서 1M 토큰 비용은 얼마인가?
800K 입력과 200K 출력의 기본선에서는 계산이 단순하다. GPT-5.6 Sol 비용은 0.8 × $3.20 + 0.2 × $16 = $5.76. Claude Sonnet 5 비용은 0.8 × $1.60 + 0.2 × $8 = $2.88. Gemini 3.7 Flash 비용은 0.8 × $0.60 + 0.2 × $3 = $1.08이다.
이 산수는 예산 책정에 유용하지만, 승인된 출력 기준 비용이 더 나은 운영 지표다. 아래 표는 동일한 워크로드에 일반적인 운영 오버헤드가 발생했을 때를 보여준다.
| 모델 | 기본선 | 5% 재시도 | 10% 재실행 | 40% 출력 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.76 | $6.05 | $6.34 | $8.32 |
| Claude Sonnet 5 | $2.88 | $3.02 | $3.17 | $4.16 |
| Gemini 3.7 Flash | $1.08 | $1.13 | $1.19 | $1.56 |
“5% 재시도”는 전체 토큰 워크로드의 5%가 다시 전송된다고 가정한다. “10% 재실행”은 출력 10개 중 1개가 품질 검사에서 실패하여 동일한 토큰 비중으로 재생성된다고 가정한다. “40% 출력”은 총 1M 토큰을 유지하되 비중을 입력 600K, 출력 400K로 바꾼다. 출력 토큰의 단가가 더 비싸기 때문에, 장황함은 트래픽 증가보다 더 빠르게 청구액을 키울 수 있다.
재시도와 실패한 출력은 비용에 얼마나 더해지는가?
API 재시도와 재실행 비용은 얼마나 드는가?
재시도는 과금 작업을 복제할 수 있다. 기본선에서 워크로드의 5%를 재시도하면 GPT-5.6 Sol은 $5.76에서 약 $6.05로, 품질 실패 후 10%를 재실행하면 약 $6.34로 오른다. 재시도는 전송 또는 서비스 실패 후 요청을 다시 보내는 것이고, 재실행은 전달되었지만 거부된 답변을 재생성하는 것이다. 재시도는 레이트 리밋, 타임아웃, 일시적 서버 장애에만 적용하라. CometAPI의 오류 및 재시도 가이드는 지터를 포함한 지수적 백오프를 권장하며, 잘못된 요청이나 인증 오류에 대한 자동 재시도는 금지한다. 제공업체 장애가 재시도 폭주를 유발하지 않도록 시도 횟수를 제한하라.
프롬프트 캐싱은 얼마나 절약되는가?
캐시 절감은 재사용률에 달려 있다. GPT-5.6 Sol의 단기 컨텍스트 CometAPI 요금은 캐시 읽기 $0.32/M, 캐시 쓰기 $4/M로 표기되어 있다. 800K 입력의 절반이 재사용 가능한 캐시 접두사라면, 첫 실행 비용은 약 $6.08인데 이는 400K 캐시 토큰 쓰기가 일반 입력 대비 $0.32 프리미엄을 추가하기 때문이다. 이후 캐시 적중 실행은 약 $4.61로 $5.76 대비 약 $1.15를 절약한다. 손익분기점: 한 번의 성공적 재사용만으로도 초기 쓰기 프리미엄을 만회한다. 처음 두 번의 실행을 합치면, 캐시 경로는 약 $10.69로 캐시 없이 $11.52보다 저렴하다. 다른 모델은 캐시 규칙과 최소치가 다르므로 예산 책정 전에 확인하라.
출력 길이는 AI API 비용에 어떤 영향을 주는가?
긴 답변은 비싸다. 세 모델 모두에서 출력 단가는 입력의 5배다. 작업에 맞는 출력 제한을 설정하고, 간결한 형식을 요청하며, 필요한 구조가 완성되면 생성을 중단하라.
실패한 AI 출력은 비용이 얼마나 드는가?
실패한 작업도 토큰을 소모할 수 있다. 쓸모없는 답변을 반환한 요청도 기술적으로 성공이고 전액 과금될 수 있다. 형식 위반, 환각, 도구 실패, 사람에 의한 거부를 HTTP 오류와 구분하여 추적하라.
토큰 단가는 엔지니어링 비용을 측정하지 않는다. 공급업체별 SDK, 분리된 청구서, 모니터링 중복, 마이그레이션 작업은 모두 운영 비용을 더한다. 세 계열을 CometAPI로 비교할 때는 OpenAI 호환 기본 URL—https://api.cometapi.com/v1—을 동일하게 사용하고 모델 ID만 바꾸어 하나의 과금/가시화 레이어를 유지할 수 있다. 모델별 기능은 여전히 테스트가 필요하다.
GPT, Claude, Gemini API 비용을 줄이는 방법
Batch와 Flex는 비용을 얼마나 줄일 수 있는가?
Batch와 Flex는 모든 요청에 자동 할인이 붙는 모드가 아니라 처리 방식이다. CometAPI의 GPT-5.6 가격 가이드는 적용 가능한 Batch와 Flex 토큰 요금이 Standard 대비 약 50% 낮다고 밝히고, Anthropic은 배치 처리로 최대 50% 절감을 표기한다. $5.76 GPT-5.6 Sol 기본선에 50% 민감도를 적용하면 약 $2.88이지만, 동일한 모드와 요금이 CometAPI 계정에 실제로 표시되기 전까지는 예시로만 취급하라. Batch는 비동기 작업에, Flex는 가변 지연을 수용할 수 있을 때만 사용하라.
GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: 무엇이 가장 저렴한가?
2026년 8월 26일 확인된 CometAPI 요금으로 동일한 800K 입력과 200K 출력 워크로드를 사용하면 Gemini 3.7 Flash는 $1.08, Claude Sonnet 5는 $2.88, GPT-5.6 Terra는 $3.20이 든다. 이 비교에서 원시 토큰 비용 기준으로 Gemini가 가장 저렴하다. 더 어려운 작업에서는 GPT-5.6 Terra가 재시도나 사람의 수정이 줄어든다면 여전히 경제적일 수 있으므로, 프로덕션 경로를 선택하기 전에 승인된 결과당 비용을 비교하라.
작업 난이도에 따라 라우팅하라. 분류, 추출, 일상적 초안에는 저비용 모델을 쓰고, 모호하거나 고가치 요청만 상향 조정하라. 폴백은 단지 더 낮은 요금이 아니라 필요한 모달리티, 도구 지원, 출력 형식을 충족해야 한다.
호출 전에 출력을 예산화하라. 현실적인 최대 출력을 설정하고, 응답에서 실제 입력/출력/캐시 토큰을 기록하라. CometAPI 비용 추정 가이드는 사전 추정을 예산 가드로, 실제 사용량을 최종 측정으로 취급한다.
변하지 않는 콘텐츠를 캐시하라. 시스템 지침, 제품 정책, 반복되는 긴 참조 문서는 좋은 후보이다. 캐시 히트율을 측정하고 캐시 쓰기 비용을 포함하라. 그렇지 않으면 캐시는 이론상 저렴해 보이지만 실제로는 거의 절약하지 못할 수 있다.
선별적으로 재시도하라. 지수 백오프, 지터, 최대 시도 횟수를 추가하라. 모델 ID, 상태, 요청 ID, 토큰, 재시도 여부를 로깅하라. 이는 중복 지출을 가시화한다.
승인된 결과당 비용을 최적화하라. 고정된 평가 세트를 실행하고 total API spend / accepted outputs를 계산하라. 더 비싼 모델이 재시도, 짧은 프롬프트, 적은 사람 수정으로 전체 비용을 낮출 수 있다.
출시 전 재확인하라. 모델 가용성, 도입 요금, 구간 임계값, 할인은 변경된다. 게시 또는 예산 승인 당일 Models API를 조회하거나 공개 모델 디렉터리를 검토하라.
FAQ
“1M 토큰당 비용”은 실제로 무엇을 의미하는가?
정규화된 요율이지, 모든 요청의 가격이 아니다. 모델의 입력/출력 요율에 워크로드가 실제로 사용한 토큰 수를 곱하라. 캐시 토큰, 장문 컨텍스트 구간, 작업 기반 요금은 별도로 관리하라.
어느 것이 가장 저렴한가: GPT, Claude, Gemini?
2026년 8월 26일에 확인된 특정 모델과 800K 입력/200K 출력 워크로드 기준으로, Gemini 3.7 Flash가 CometAPI에서 $1.08로 최저가이며, Claude Sonnet 5가 $2.88, GPT-5.6 Sol이 $5.76이다. 모든 작업에서 자동으로 최선의 선택은 아니다. 자체 프롬프트로 품질, 지연, 승인된 출력 비용을 비교하라.
공식 가격과 애그리게이터 가격 중 무엇을 비교해야 하는가?
실제로 지불할 가격을 먼저 비교하고, 공식 요금은 참고로 유지하라. 모든 항목에 동일한 날짜, 통화, 토큰 비중, 구간, 할인 가정을 사용하라.
재시도는 항상 과금되는가?
무료라고 가정하지 말라. 실패한 전송 요청은 추론에 도달하지 못할 수 있지만, 타임아웃이나 거부된 애플리케이션 결과는 이미 모델 작업을 소모했을 수 있다. 실제 사용량과 청구 기록을 사용하고, 재시도 불가 오류의 자동 재시도를 방지하라.
프롬프트 캐싱은 항상 비용을 줄이는가?
아니다. 캐시 쓰기는 일반 입력보다 더 비쌀 수 있고, 절감액은 반복 읽기에 달려 있다. 현재 쓰기/읽기 요금에서 손익분기점을 계산한 후 실제 캐시 적중을 모니터링하라.
가격은 얼마나 자주 확인해야 하는가?
가격을 공개하기 전, 프로덕션 모델을 변경하기 전, 또는 예측을 승인하기 전에 확인하라. 모델 ID와 검증 날짜를 계산과 함께 저장하여 나중에 추정치를 재현할 수 있게 하라.
결론: 내 워크로드에 가장 저렴한 AI API는 무엇인가?
공정한 GPT vs Claude vs Gemini 가격 비교는 하나의 날짜가 명시된 출처, 하나의 토큰 비중, 하나의 성공 정의를 사용한다. 토큰당 요율이 기본선을 만들고, 캐싱, 재시도, 출력 길이, 품질 실패가 실제 청구서를 결정한다. CometAPI는 엔드포인트와 과금 레이어를 일관되게 유지하여 공급업체 간 테스트를 쉽게 해주지만, 최저 비용 모델은 여전히 목표 품질을 최소 총 작업량으로 달성하는 모델이다.
