TL;DR
Gemini 3.6 Flash의 비용은 입력 $1.50/M, 출력 $7.50/M이며, Gemini 3.5 Flash 대비 출력 단가가 낮고 코드 및 에이전트 성능이 더 좋다고 보고됩니다. 프로덕션에서는 복잡한 추론과 에이전트에 3.6 Flash를 사용하고, 단순하고 대량의 워크로드는 더 저렴한 Gemini 3.5 Flash-Lite로 라우팅하세요.
Gemini 3.6 Flash는 단순한 모델 ID 업데이트 이상의 변화입니다.
이미 Gemini 3.5 Flash를 사용하는 개발자에게 더 큰 변화는 경제적 측면입니다. Google은 입력 가격을 백만 토큰당 $1.50로 유지하면서, 출력 가격을 $9.00에서 $7.50으로 낮췄고, 여러 코딩 및 에이전트 벤치마크에서 더 나은 성능을 보고했습니다.
실용적인 질문은 이러한 개선이 프로덕션 워크로드를 옮길 만큼 충분히 큰가 하는 점입니다.
그 답은 워크로드에 따라 달라집니다. 코딩 에이전트, 멀티모달 분석, 다단계 도구 사용은 단순 추출이나 분류보다 더 큰 이점을 얻을 수 있습니다. 마이그레이션에는 모델 이름만 바꾸면 놓치기 쉬운 몇 가지 API 호환성 점검도 필요합니다.
이 가이드는 Gemini 3.6 Flash API 가격, 무료 티어 접근, 벤치마크 결과, 마이그레이션 변경점, Python 예시, 프로덕션 전 테스트 항목을 다룹니다.
Gemini 3.6 Flash란 무엇인가?
Gemini 3.6 Flash는 코딩, 멀티모달 추론, 다단계 에이전트 워크플로를 위한 Google의 최신 Flash 모델입니다. 2026년 7월 21일에 출시되었으며, Google의 Flash 모델 티어 내에서 더 강한 추론 및 에이전트 성능이 필요한 프로덕션 워크로드를 위해 설계되었습니다.
주요 사양은 다음과 같습니다:
| 항목 | Gemini 3.6 Flash |
|---|---|
| 모델 ID | gemini-3.6-flash |
| 표준 입력 가격 | $1.50 / 1M tokens |
| 표준 출력 가격 | $7.50 / 1M tokens |
| 표준 캐시된 입력 | $0.15 / 1M tokens |
| 기본 사고 수준 | medium |
| 입력 컨텍스트 | 1,048,576 tokens |
| 최대 출력 | 65,536 tokens |
| 입력 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 | 텍스트 |
| 적합한 용도 | 코딩, 멀티모달 추론, 복잡한 에이전트 |
Google은 Gemini 3.6 Flash를 코딩, 공간 및 멀티모달 추론, 다단계 에이전트 작업과 같은 워크로드에 적합하다고 포지셔닝합니다.
이 모델은 함수 호출, 구조화된 출력, 코드 실행, 컨텍스트 캐싱, File Search, URL 컨텍스트, Google Search 그라운딩, Google Maps 그라운딩 등의 기능도 지원합니다.
최신 사양과 마이그레이션 가이드는 Google의 최신 Gemini 모델 가이드에서 확인하세요.
이전 세대에서 오는 개발자에게는 CometAPI Gemini 3.5 Flash API 가이드가 유용한 통합 기준점을 제공합니다.
Gemini 3.6 Flash API 비용은 얼마인가요?
Gemini 3.6 Flash는 Google의 Standard 유료 티어에서 입력 백만 토큰당 $1.50, 출력 백만 토큰당 $7.50가 책정됩니다.
Gemini 3.5 Flash와 비교하면 입력 가격은 동일하며, 출력 가격은 백만 토큰당 $9.00에서 $7.50으로 16.7% 인하되었습니다.
Google은 Batch, Flex, Priority 처리도 제공합니다.
| Gemini 3.6 Flash 티어 | 입력 / 1M | 캐시된 입력 / 1M | 출력 / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
중요:** 사고 토큰은 출력 토큰 요율로 청구됩니다. 따라서 눈에 보이는 응답이 짧더라도 최종 답변 길이보다 더 많은 과금 가능한 출력 토큰을 사용할 수 있습니다.
컨텍스트 캐싱은 동일한 대형 시스템 프롬프트, 저장소 컨텍스트, 문서 집합 또는 대화 이력을 반복해서 보내는 애플리케이션에서 의미 있는 차이를 만들 수 있습니다.
Standard 유료 티어에서 Gemini 3.6 Flash의 캐시된 입력 비용은 백만 토큰당 $0.15이며, 일반 입력 $1.50과 비교됩니다.
예시: 입력 토큰 15,000 + 출력 토큰 8,000
15,000 입력 토큰과 8,000 출력 토큰을 사용하는 작업을 고려해 봅니다.
| 모델 | 예상 비용 |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| 동일 토큰 사용량의 Gemini 3.6 Flash | $0.0825 |
| 출력 토큰 17% 감소한 Gemini 3.6 Flash | $0.0723 |
| 동일 토큰 사용량의 Gemini 3.5 Flash-Lite | $0.0245 |
동일한 토큰 사용량에서, 이 예시에서 Gemini 3.6 Flash는 Gemini 3.5 Flash보다 약 12.7% 더 저렴합니다.
Google은 Gemini 3.6 Flash가 Artificial Analysis Index에서 출력 토큰을 17% 적게 사용했다고도 보고합니다. 프로덕션 워크로드가 이 감소를 재현한다면, 이 예시의 모델링된 절감 효과는 대략 **23.5%**로 증가합니다.
Google은 별도로 DeepSWE에서 최대 65% 출력 토큰 감소를 보고합니다. 이러한 수치는 서로 다른 워크로드를 측정하므로 상호 교환적으로 취급해서는 안 됩니다: 17%는 Artificial Analysis Index를, 65%는 특정 코딩 벤치마크를 의미합니다.
기본 토큰 비용 계산식은 다음과 같습니다:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
에이전트의 실제 비용은 더 넓습니다:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
이 때문에 토큰당 가장 저렴한 모델이 항상 작업 완료 비용도 가장 낮은 것은 아닙니다.
Gemini 3.6 Flash는 무료인가요?
예. Google의 현재 Gemini Developer API 가격에는 Gemini 3.6 Flash Standard 사용에 대한 Free Tier 접근이 명시되어 있습니다.
무료 티어 가능 여부가 무제한 프로덕션 용량을 의미하는 것은 아닙니다. API 제한은 프로젝트와 사용 티어에 따라 달라지므로, 개발자는 제3자 글의 고정된 분당 요청 수치에 의존하기보다 자신의 프로젝트에 적용된 레이트 리밋을 확인해야 합니다.
프로덕션 계획에서는 Google의 최신 Gemini API 가격과 레이트 리밋 문서를 사용해 용량을 추정하세요.
개발자는 Gemini API와 Google AI Studio를 통해 Gemini 3.6 Flash에 접근할 수 있습니다. 통합 멀티 모델 워크플로를 사용하는 팀은 CometAPI Gemini 3.6 Flash 모델 페이지를 통해서도 모델을 테스트할 수 있습니다.
Gemini 3.6 Flash와 Gemini 3.5 Flash 비교
Google이 공개한 결과는 코딩, 에이전트 실행, 컴퓨터 사용, 지식 작업에서 가장 큰 개선을 보여줍니다.
| 벤치마크 | Gemini 3.6 Flash | Gemini 3.5 Flash | 변화 |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 points |
| MLE-Bench | 63.90% | 49.70% | +14.2 points |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 points |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google은 Gemini 3.6 Flash가 다단계 워크플로를 더 적은 추론 단계, 대화 라운드, 도구 호출로 완수한다고도 말합니다.
회사 보고에 따르면:
- Artificial Analysis Index에서 출력 토큰 17% 감소.
- DeepSWE에서 최대 65% 출력 토큰 감소.
- 원치 않는 코드 편집과 실행 루프 감소.
- 향상된 멀티모달 및 공간 추론.
원문 결과는 Google의 Gemini 3.6 Flash 출시 발표에서 확인할 수 있습니다.
이러한 벤치마크는 특히 하나의 요청이 여러 차례의 추론, 도구 호출, 수정으로 이어질 수 있는 워크로드에서 3.6 Flash를 평가할 강력한 후보로 만듭니다.
그러나 이것이 자체 애플리케이션 테스트를 대체해서는 안 됩니다.
Google은 3.6 Flash가 코드 변경 전 더 많은 사전 프로그램적 검사를 수행할 수 있다고도 언급합니다. 대형 저장소에서는 정확도를 개선할 수 있지만, 좁게 범위가 지정된 프런트엔드 수정에서는 단지 불필요한 탐색을 추가할 수 있습니다.
명확한 파일 경계, 승인 기준, 구현 지침은 여전히 중요합니다.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: 무엇을 사용할까요?
Gemini 3.6 Flash를 테스트할 가치가 있다고 판단했다면, 다음 질문은 모든 요청에 실제로 이것이 필요한가 하는 점입니다.
많은 프로덕션 시스템에서는 답이 ‘아니오’일 수 있습니다.
Gemini 3.5 Flash-Lite는 훨씬 저렴하며 예측 가능하고 대량의 워크로드에 기본값으로 더 적합할 수 있습니다.
| 항목 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| 표준 입력 가격 | $1.50 / 1M tokens | $0.30 / 1M tokens |
| 표준 출력 가격 | $7.50 / 1M tokens | $2.50 / 1M tokens |
| 표준 캐시된 입력 | $0.15 / 1M tokens | $0.03 / 1M tokens |
| 기본 사고 수준 | medium | minimal |
| 적합한 용도 | 복잡한 추론, 코딩, 에이전트 | 추출, 라우팅, 분류 |
Standard 가격에서 Flash-Lite는 Gemini 3.6 Flash 대비 입력 5배, 출력 3배 저렴합니다.
다음 용도는 Gemini 3.5 Flash-Lite로 시작하세요:
- 분류
- 요청 라우팅
- JSON 및 구조화된 추출
- 문서 처리
- 데이터 변환
- 대규모 번역
- 경량 서브에이전트
- 대량의 반복 가능한 작업
실용적인 라우팅 전략은 다음과 같을 수 있습니다:
| 워크로드 | 초기 라우팅 | 에스컬레이션 |
|---|---|---|
| 분류 또는 라우팅 | Gemini 3.5 Flash-Lite | 검증 실패 시 3.6 Flash |
| 구조화된 추출 | Gemini 3.5 Flash-Lite | 복잡한 문서에 3.6 Flash |
| 경량 서브에이전트 | Gemini 3.5 Flash-Lite | 사고 수준 상향 또는 3.6 Flash 사용 |
| 다중 파일 코딩 | Gemini 3.6 Flash | 미해결 시 더 강한 폴백 |
| 복잡한 도구 워크플로 | Gemini 3.6 Flash | 도구 또는 검증 실패 후 폴백 |
| 멀티모달 추론 | Gemini 3.6 Flash | 작업별 폴백 |
혼합 프로덕션 트래픽에서 더 유용한 지표는 다음과 같습니다:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
첫 호출이 저렴하더라도 반복적으로 실패하고 결국 더 강한 모델이 필요하다면 매력은 떨어집니다.
반대로, Flash-Lite가 이미 요구 정확도를 충족한다면, 수백만 건의 예측 가능한 분류 요청을 Gemini 3.6 Flash로 보낼 이유는 거의 없습니다.
이런 라우팅이 필요한 애플리케이션의 경우, OpenAI 호환 기본 URL을 사용해 여러 AI 모델 호출하기 가이드를 참고하세요.
Gemini 3.6 Flash로 마이그레이션 시 무엇이 바뀌나요?
Gemini 3.5 Flash에서 Gemini 3.6 Flash로 이동하는 것은 모델 ID만 변경하는 것 이상입니다.
프로덕션 트래픽 전환 전 다음 다섯 가지 영역을 검토하세요: 사용 중단된 샘플링 파라미터, 사고 제어, candidate_count, 모델 턴 프리필, 함수 호출 상태.
1. temperature, top_p, top_k 제거
Google은 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite에서 이러한 샘플링 제어를 사용 중단했습니다:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
새 모델은 현재 이러한 파라미터를 무시합니다. Google은 향후 Gemini 모델 세대에서 이를 제공하면 HTTP 400 오류를 반환할 수 있다고 말합니다.
예측 가능한 출력 형식에는 더 명확한 시스템 지시문과 구조화된 출력을 대신 사용하세요.
2. thinking_budget를 thinking_level로 교체
Gemini 3.6 Flash는 기본적으로 medium 사고를 사용합니다.
Google의 마이그레이션 가이드는 수치 기반 thinking_budget 구성에서 thinking_level로 전환할 것을 권장합니다.
Gemini 3.5 Flash-Lite는 기본값이 minimal이며, 대량 추출, 분류, 라우팅과 같은 많은 워크로드에 적합합니다.
사고 수준을 높이는 설정은 다단계 추론, 코드 실행, 도구 사용을 포함하는 작업에서 테스트해야 합니다.
3. candidate_count 제거
Google은 candidate_count를 Gemini 3.x에서 지원하지 않는다고 명시합니다.
여러 모델이 동일한 생성 구성을 공유할 때 놓치기 쉬운 항목입니다. 프로덕션 요청으로 마이그레이션하기 전에 제거하세요.
4. 모델 턴 프리필 중단
요청은 더 이상 비어 있지 않은 model 역할 턴으로 끝날 수 없습니다.
이전 애플리케이션은 다음과 같은 페이로드를 사용했을 수 있습니다:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
이 패턴은 이제 HTTP 400을 반환할 수 있습니다.
이전에는 프리필을 사용해 답변 형식을 강제했다면, 요구 사항을 system_instruction으로 옮기거나 구조화된 출력을 사용하세요.
5. 함수 호출 및 멀티 턴 상태 재테스트
도구를 사용하는 에이전트에는 별도의 마이그레이션 테스트가 필요합니다.
Google은 Interactions API에서 서버 측 멀티 턴 상태에 previous_interaction_id 사용을 권장합니다.
함수 결과를 반환할 때는 함수 이름과 원래 호출 ID를 모두 유지하세요:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
generateContent를 사용하는 애플리케이션은 FunctionResponse 페이로드를 검증하고 마이그레이션 후 도구 호출 오류를 모니터링해야 합니다.
구현 세부 정보는 Google의 최신 모델 마이그레이션 가이드와 함수 호출 문서를 참조하세요.
Python에서 Gemini 3.6 Flash를 호출하려면?
Google의 GenAI SDK를 설치 또는 업데이트하세요:
pip install -U google-genai
API 키를 설정하세요:
export GEMINI_API_KEY="your-api-key"
그런 다음 Gemini 3.6 Flash를 호출하세요:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
더 많은 추론이 필요한 작업의 경우 사고 수준을 구성하세요:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
주요 마이그레이션 차이는 다음과 같이 요약할 수 있습니다:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
사고 수준이 높다고 항상 더 나은 것은 아닙니다. 자체 작업에서 지연 시간, 토큰 소비, 완료율을 측정하세요.
프로덕션 전 Gemini 3.6 Flash를 어떻게 테스트할까요?
공개 대규모 벤치마크 모음이 없어도 Gemini 3.6 Flash가 프로덕션 스택에 적합한지 판단할 수 있습니다.
더 나은 출발점은 실제 트래픽을 닮은 최근 작업 30~50개입니다.
다음의 혼합을 포함하세요:
- 코딩 및 디버깅
- 다단계 도구 사용
- 멀티모달 문서
- 데이터 추출
- 분류 및 라우팅
다음에 동일 입력을 실행하세요:
- 현재 프로덕션 모델
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
프롬프트, 도구, 검증기, 승인 기준은 변경하지 마세요.
다음을 추적하세요:
- 입력 토큰
- 출력 및 사고 토큰
- 지연 시간
- 도구 호출
- 재시도
- 함수 호출 오류
- 검증기 통과율
- 사람 교정 시간
- 최종 작업 성공
그런 다음 승인 결과를 생성하는 데 필요한 총 비용을 비교하세요.
$0.08이 들고 첫 시도에 성공하는 코딩 요청은, $0.02가 들지만 두 번 실패하고 결국 더 강한 모델로 에스컬레이션되는 요청보다 저렴할 수 있습니다.
동시에, 단순 분류 작업에 Gemini 3.6 Flash 가격을 지불하는 것은 Flash-Lite가 안정적으로 처리한다면 의미가 없습니다.
목표는 모든 요청에 하나의 모델을 찾는 것이 아닙니다. 추가 성능이 실제로 결과를 바꾸는 곳에서만 더 강한 모델을 사용하는 것입니다.
개발자는 동일한 평가 세트를 사용해 CometAPI를 통해 현재 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite 라우트를 비교할 수 있습니다.
자주 묻는 질문
Gemini 3.6 Flash API 비용은 얼마인가요?
Google의 Standard 유료 요금은 입력 백만 토큰당 $1.50, 출력 백만 토큰당 $7.50입니다. 표준 캐시된 입력은 $0.15/M입니다. Batch와 Flex는 입력 $0.75/M, 출력 $3.75/M입니다.
Gemini 3.6 Flash는 무료인가요?
예. Google의 현재 Gemini Developer API 가격에는 Gemini 3.6 Flash Standard 사용에 대한 Free Tier가 명시되어 있습니다. 무료 접근은 프로젝트 및 사용 티어의 레이트 리밋이 적용됩니다.
Gemini 3.6 Flash는 일반 공급(GA)인가요?
예. Google은 2026년 7월 21일에 gemini-3.6-flash를 출시했으며, Gemini API 문서에서 프로덕션 모델로 명시하고 있습니다.
Gemini 3.6 Flash의 컨텍스트 윈도우는?
Gemini 3.6 Flash는 최대 1,048,576 입력 토큰과 65,536 출력 토큰을 지원합니다. 텍스트, 이미지, 비디오, 오디오, PDF 입력을 수용하며 텍스트 출력을 생성합니다.
Gemini 3.6 Flash가 Gemini 3.5 Flash보다 저렴한가요?
출력 토큰에 대해 그렇습니다. 두 모델 모두 표준 입력은 $1.50/M이지만, Gemini 3.6 Flash는 출력 가격을 $9.00/M에서 $7.50/M으로 낮췄습니다.
Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite 중 무엇을 사용해야 하나요?
코딩 품질, 멀티모달 추론, 복잡한 에이전트 실행이 실패와 재시도를 줄일 수 있는 경우 Gemini 3.6 Flash를 사용하세요. 대량 추출, 분류, 라우팅 등 예측 가능한 워크로드에서는 비용이 더 중요한 만큼 Flash-Lite로 시작하세요.
Gemini 3.6 Flash로 마이그레이션하기 전에 무엇을 변경해야 하나요?
temperature, top_p, top_k, candidate_count를 제거하고; thinking_budget를 thinking_level로 교체하며; 모델 턴 프리필을 중단하고; 함수 호출과 멀티 턴 상태 관리를 재테스트하세요.
최종 정리
코딩, 멀티모달 작업, 에이전트 워크플로에 Gemini 3.5 Flash를 이미 사용 중이라면 Gemini 3.6 Flash는 벤치마킹할 가치가 있습니다.
출력 가격이 낮고, 초기 결과는 일부 워크로드에서 필요한 토큰과 실행 단계를 줄일 수 있음을 시사합니다. 반복적으로 추론하고 도구를 호출하며 실패 작업을 재시도하는 에이전트의 경우, 이러한 절감은 표면적인 가격 차이보다 더 중요한 의미를 가질 수 있습니다.
그렇다고 해서 모든 요청을 3.6 Flash로 옮겨야 한다는 뜻은 아닙니다.
Gemini 3.5 Flash-Lite는 훨씬 저렴하며, 추출, 분류, 라우팅 같은 예측 가능한 작업에는 충분할 수 있습니다.
더 나은 프로덕션 전략은 추가 능력이 실제로 결과를 바꾸는 곳에서만 더 강한 모델을 사용하는 것입니다: 단순하고 대량의 작업에는 Flash-Lite, 첫 시도에 제대로 끝낼 가능성을 높이는 복잡한 추론에는 3.6 Flash.
그리고 진짜로 중요한 지표를 측정하세요 — 승인된 답변을 얻는 총 비용.
동일한 워크플로에서 두 모델을 비교하려면 CometAPI의 Gemini 3.6 Flash 모델 페이지와 Gemini 3.5 Flash-Lite 모델 페이지, 또는 CometAPI 가격 페이지의 현재 모델 라우트를 확인하세요.
