요약: Gemini 3.7 Flash(model ID gemini-3.7-flash)는 2026년 8월 13일에 출시된 Google의 가장 능력 있는 Flash급 주력 모델로, 코딩, 에이전트형 워크플로, 웹 개발, 지식 집약형 작업에 적합합니다.
이 모델은 1,048,576토큰 컨텍스트 윈도, 최대 65,536 출력 토큰, 조절 가능한 추론 수준(낮음/보통/높음), 강력한 멀티모달 지원, 그리고 2026년 12월 31일까지 1M 입력 토큰당 $0.75 / 1M 출력 토큰당 $3.75의 도입 가격을 제공합니다. Google의 Interactions API 또는 멀티 모델 스택에 더 편리한 CometAPI 통합 엔드포인트를 통해 액세스할 수 있습니다. 본 가이드는 새로운 사항, API 파라미터, CometAPI를 통한 단계별 사용법, 코드 예시, 벤치마크, 모범 사례를 다룹니다.
핵심 요약
- Gemini 3.7 Flash는 코딩(FrontierCode 1.1 Main: 43.6% vs 34.4%; DeepSWE v1.1: 65.3% vs ~49%), 웹 개발(WebDev Arena Elo 1588 vs 1538), 문서 처리(GDP.pdf 34% vs 22%), 비즈니스 자동화(AutomationBench 30.4% vs 17%)에서 3.6 Flash 대비 큰 향상을 제공합니다.
- 최신 기능을 위해 Interactions API(
client.interactions.create)를 사용하세요; thinking_level이 기존 예산 파라미터를 대체합니다. - CometAPI는 단일 API 키로 Gemini 3.7 Flash와 500+ 개 모델(오픈AI 호환 또는 네이티브 Gemini)을 제공하여 과금, 전환, 비용 통제를 단순화합니다.
- 멀티모달 입력(텍스트, 이미지, 비디오, 오디오, PDF)과 텍스트 출력 지원; 내장 도구로 함수 호출, 코드 실행, 검색 그라운딩, 컴퓨터 사용(프리뷰) 등이 포함됩니다.
- 2026년 12월 31일까지 1M 입력 토큰당 $0.75 및 1M 출력 토큰당 $3.75, 도입 가격은 2026년 12월 31일 종료; 이후 표준 요금 $1.50 / $7.50를 대비하세요.
- 프로덕션 에이전트, 고정확도 코드 생성, 비용 효율성과 신뢰성이 중요한 다단계 워크플로에 이상적입니다.
Google은 2026년 8월 13일, Gemini 3.6 Flash 출시 불과 3주 후에 Gemini 3.7 Flash를 출시했습니다. 이는 코딩과 에이전트에 최적화된 가장 지능적인 주력급 모델입니다. 복잡한 소프트웨어 엔지니어링, 에이전트형 다단계 실행, 강력한 디자인 준수의 웹/UI 생성, 금융·법률·생명과학 등 지식 밀도가 높은 분야를 주요 타깃으로 합니다.
중요: Gemini 3.7 Flash는 중요한 Gemini 3.x API 동작 변경 사항을 도입하거나 계승합니다. 특히 구형 Gemini 애플리케이션을 마이그레이션하는 개발자는
temperature,top_p,top_k를 제거하고,thinking_budget를thinking_level로 교체하며, 지원되지 않는candidate_count를 제거하고, 모델 턴 사전 프리필을 중단해야 합니다.
Gemini 3.7 Flash란?
Gemini 3.7 Flash는 Google이 2026년 8월 13일 출시한 최신 Flash급 생성형 AI 모델입니다.
Google은 이를 “코딩과 에이전트를 위한 가장 지능적인 주력 모델”이라고 설명합니다. 출시가 Gemini 3.6 Flash 이후 불과 3주 만에 이뤄졌다는 점은, 개발자 지향 Flash 모델의 반복 주기가 가속화되고 있음을 시사합니다.
Gemini 3.7 Flash는 단순히 더 빠른 챗봇 모델이 아니라, 다음과 같은 작업에 초점을 맞춥니다.
- 여러 단계를 통한 추론
- 소프트웨어 작성 및 디버깅
- 도구 사용
- 외부 시스템과의 상호작용
- 대용량 문서 분석
- 디자인을 동작하는 인터페이스로 전환
- 비즈니스 워크플로 실행
- AI 에이전트의 일부로서 동작
이 구분은 중요합니다.
전통적인 챗봇은 다음과 같이 답할 수 있습니다.
“OAuth를 어떻게 구현하나요?”
에이전트 지향 코딩 모델은 리포지토리를 이해하고, 파일을 검사하며, 종속성을 파악하고, 변경을 제안하고, 도구를 실행하고, 오류를 진단하며, 구현이 작동할 때까지 반복하는 것으로 기대됩니다.
Gemini 3.7 Flash는 후자 시나리오에 훨씬 더 초점을 맞춰 설계되었습니다.
Gemini 3.7 Flash API: 핵심 사양
공식 Gemini API 문서는 Gemini 3.7 Flash를 일반 제공(Generally Available)으로 다음과 같은 주요 사양과 함께 게시하고 있습니다.
| 사양 | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| 제공 상태 | Generally Available |
| 컨텍스트 윈도 | 1,000,000 tokens |
| 최대 출력 | 64,000 tokens |
| 기본 추론 수준 | Medium |
| 추론 수준 | Low, Medium, High |
| 입력 | Gemini 플랫폼을 통한 멀티모달 기능 지원 |
| 주요 초점 | 코딩, 에이전트, 웹 개발, 지식 작업 |
| 도입기 입력 가격 | $0.75 / 1M tokens |
| 도입기 출력 가격 | $3.75 / 1M tokens |
| 도입가 종료 | December 31, 2026 |
| 도입가 이후 표준 입력 가격 | $1.50 / 1M tokens |
| 도입가 이후 표준 출력 가격 | $7.50 / 1M tokens |
1M 토큰 컨텍스트 윈도는 대규모 리포지토리, 장문의 기술 문서, 엔터프라이즈 문서, 다단계 에이전트 세션에 특히 유용합니다.
Gemini 3.7 Flash API의 변경점은?
이 섹션은 개발자에게 가장 중요합니다.
Gemini 3.7 Flash는 단순히 다음을
gemini-3.6-flash
이렇게 바꾸는 문제로 끝나지 않습니다:
gemini-3.7-flash
Google의 Gemini 3.x 세대는 기존 애플리케이션을 깨뜨릴 수 있는 API 동작 변화를 도입했습니다. Gemini 3.7 마이그레이션 문서는 특히 몇 가지 변경을 지적합니다.
1. temperature, top_p, top_k가 더 이상 사용되지 않음
이전 Gemini 통합에서는 흔히 다음과 같은 구성이 있었습니다:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
Gemini 3.x에서는 이러한 샘플링 파라미터를 제거해야 합니다.
Google은 이 파라미터들이 더 이상 사용되지 않으며, 향후 모델 세대에서는 조용히 수용하지 않고 거부할 수 있다고 말합니다.
Gemini 3.7 Flash에서는 대신 추론 제어를 사용하세요:
generation_config = {
"thinking_level": "medium"
}
이는 중요한 개념적 변화입니다.
무작위성을 주로 제어하는 대신, 개발자는 추론 노력의 양을 명시적으로 제어할 수 있습니다.
2. thinking_budget가 thinking_level로 변경
이전 추론 구성을 사용하는 애플리케이션에는 다음과 같은 항목이 있을 수 있습니다:
{
"thinking_budget": 4096
}
Gemini 3.7 Flash는 다음을 사용합니다:
{
"thinking_level": "medium"
}
지원되는 수준은 다음과 같습니다.
lowmediumhigh
Google은 낮음을 지연 민감 작업에 유용, 보통을 기본 및 범용 설정, 높음을 어려운 추론·수학·코딩·에이전트 작업에 적합하다고 설명합니다.
3. candidate_count 제거
Google의 마이그레이션 체크리스트는 Gemini 3.x에서 지원되지 않는 candidate_count를 제거하라고 합니다.
따라서 다음과 같은 레거시 구성은:
{
"candidate_count": 3
}
Gemini 3.7 Flash로 그대로 가져가면 안 됩니다.
4. 모델 턴 사전 프리필이 더 이상 지원되지 않음
이전 대화형 아키텍처는 요청 끝에 부분적으로 사전 프리필된 모델 턴을 포함하기도 했습니다.
Gemini의 최신 API 동작은 이 패턴을 재고하도록 요구합니다.
Google은 다중 턴 상호작용을 위해 previous_interaction_id를 통한 서버 측 대화 상태 사용을 권장하고, 사전 프리필된 모델 턴을 제거하라고 권장합니다.
5. 함수 호출은 추가적인 주의가 필요
마이그레이션 가이드는 함수 호출 변경점도 강조합니다.
도구를 사용하는 애플리케이션의 경우 다음에 주의를 기울여야 합니다.
- 멀티모달 에셋
- 인라인 지침
- 함수 응답 메타데이터
call_id- 함수명
- 잘못된 함수 호출 오류
특히 generateContent API의 경우, Google은 FunctionResponse 객체에 call_id와 name 모두를 포함하라고 말합니다.
이는 함수 호출이 더 이상 선택적 “있으면 좋은” 기능이 아니라는 점에서, 에이전트 애플리케이션에 특히 중요합니다. 코딩 및 워크플로 에이전트의 핵심 방식이기 때문입니다.
CometAPI로 Gemini 3.7 Flash API 사용하기
CometAPI는 단일 API 키로 500개 이상의 모델(전체 Gemini 패밀리 포함)에 접근할 수 있는 통합 API 게이트웨이로, OpenAI 호환 엔드포인트, 경쟁력 있는 가격, 단순화된 멀티 벤더 관리를 제공합니다. 이미 OpenAI SDK를 사용하거나 Gemini, Claude, GPT 등 모델 간 전환이 필요하지만 인증이나 과금 로직을 재작성하고 싶지 않은 애플리케이션에 특히 유용합니다.
아래는 프로덕션 지향의 전체 워크스루입니다. 각 주요 단계는 명확성과 SEO를 위해 H2로 구성되어 있습니다.
CometAPI 가입 및 API 키 발급
- https://www.cometapi.com/에서 계정을 생성합니다(Google, GitHub 또는 이메일).
- API Keys / 콘솔 섹션으로 이동: https://www.cometapi.com/console/token.
- Create API Key를 클릭하고 설명이 있는 이름(예: gemini-3.7-flash-prod)을 지정한 뒤 키를 복사합니다.
- 환경 변수로 안전하게 저장합니다:Bash
export COMETAPI_KEY="your-key-here"
키를 버전 관리에 커밋하거나 클라이언트 사이드 코드에 노출하지 마세요.
CometAPI는 사용량 기반(pay-as-you-go) 요금제를 사용하며, 일반적으로 벤더 직통 가격과 경쟁력 있는 요율과 월 최소 사용료 없음 정책을 제공합니다.
필요한 SDK 설치
네이티브 Gemini 스타일(전체 기능 동등성에 권장):
Bash
pip install google-genai
OpenAI 호환 호출(마이그레이션이 가장 쉬움):
Bash
pip install openai
Node.js용 동등 패키지도 제공됩니다(@google/genai 또는 OpenAI Node SDK).
CometAPI용 클라이언트 구성
옵션 A – CometAPI를 가리키는 네이티브 Google GenAI 클라이언트(Interactions API와 추론 제어 유지):
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
옵션 B – OpenAI 호환 클라이언트(이미 OpenAI 기반 코드베이스라면 이상적):
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
두 접근 모두 CometAPI를 통해 트래픽을 라우팅하며, 모델 선택은 model 파라미터로 지정합니다.
Gemini 3.7 Flash에 첫 호출 보내기
Interactions API 스타일 사용(구성된 GenAI 클라이언트 경유):
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
OpenAI 호환 채팅 컴플리션 스타일:
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
cURL 예시(OpenAI 호환):
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
애그리게이터는 때때로 약간 다른 식별자나 별칭을 사용할 수 있으므로, CometAPI Models 대시보드에서 사용 가능한 정확한 모델 문자열을 항상 확인하세요.
추론 수준과 고급 생성 옵션 구성
복잡한 코딩 또는 에이전트 작업에는 추론 수준을 명시적으로 설정하세요:
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- 낮음: 가장 빠름, 실시간 채팅이나 간단한 초안 작성에 적합.
- 보통(기본): 대부분의 코딩 및 에이전트형 작업에 가장 균형 잡힌 설정.
- 높음: 최대 추론 깊이와 도구 사용; 토큰/비용 소비 증가.
멀티모달 입력 추가(이미지, PDF, 비디오, 오디오)
Gemini 3.7 Flash는 혼합 모달리티를 네이티브로 수용합니다. 이미지 + 텍스트 프롬프트 예시(GenAI 클라이언트 사용):
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
PDF, 비디오, 오디오 입력에도 유사한 패턴이 적용됩니다. 디자인-투-코드, 문서 질의응답, 비디오 분석 워크플로에 강력합니다.
함수 호출/도구 사용 구현
요청에서 도구를 선언하고, 모델이 호출 시점을 결정하도록 합니다. CometAPI는 이를 기본 Gemini 백엔드로 전달합니다. 공식 Gemini 함수 호출 스키마(이름, 설명, JSON Schema 파라미터)를 따르세요. 함수 호출을 받은 후 도구를 실행하고, 후속 턴에서 결과를 반환합니다.
Gemini 3.7 Flash의 API 파라미터
Interactions API(권장)를 통해 호출할 때 핵심 파라미터는 다음과 같습니다.
- model: "gemini-3.7-flash"(필수)
- input: 문자열 또는 구조화된 콘텐츠(텍스트 + 멀티모달 파트)
- generation_config(선택 객체):
- thinking_level: "low" | "medium" | "high"(기본 medium)
- 구조화 출력, 안전성 등 지원되는 기타 구성 필드
- tools / 도구 사용을 위한 함수 선언
- 시스템 지침(클라이언트에 따라 system 역할 또는 전용 필드)
- 관리형 에이전트 사용 시 환경/에이전트 설정(예: Antigravity)
네이티브 generateContent 스타일 호출도 가능하지만, 전체 기능 접근 및 에이전트 오케스트레이션에는 Interactions API가 선호됩니다.
토큰 카운팅, 캐싱(암묵적 + 명시적), 배치 추론, 우선순위/유연 옵션을 지원합니다.
가장 중요한 파라미터와 구성 개념은 아래에 요약되어 있습니다.
| 파라미터 | 목적 | Gemini 3.7 Flash 가이드 |
|---|---|---|
| model | 모델 선택 | gemini-3.7-flash |
| input | Interactions API의 사용자 지시 | 필수 |
| generation_config | 생성 제어 | 지원되는 Gemini 3.x 필드를 사용 |
| thinking_level | 추론 노력 제어 | low, medium, high |
| contents | Gemini generateContent 입력 | Gemini 형식 요청에 사용 |
| parts | 개별 콘텐츠 컴포넌트 | 텍스트/멀티모달 콘텐츠 |
| temperature | 샘플링 무작위성 | 사용하지 않음 |
| top_p | 누클리어스 샘플링 | 사용하지 않음 |
| top_k | Top-K 샘플링 | 사용하지 않음 |
| thinking_budget | 이전 추론 제어 | thinking_level로 대체 |
| candidate_count | 다중 후보 | Gemini 3.x에서 미지원 |
| previous_interaction_id | 대화 연속성 | 다중 턴 Interactions API 워크플로에 권장 |
Google의 마이그레이션 문서는 사용 중단/미지원 파라미터와 새로운 대화 패턴을 명시적으로 강조합니다.
프로덕션 모범 사례와 마이그레이션 팁
- thinking_level="medium"으로 시작해 품질 대비 지연/비용을 측정하세요.
- 사용 중단 파라미터(temperature, top_p, top_k, 옛 추론 예산)를 제거하세요.
- 에이전트형 다단계 플로우와 Antigravity 통합을 위해 Interactions API를 선호하세요.
- 멀티 모델 애플리케이션에서는 CometAPI의 base URL을 유지하고 모델 문자열만 변경하세요—재인증이 필요 없습니다.
- 특정 에이전트 루프에서 철저히 테스트하세요. 3.7 Flash는 실패 루프를 줄였지만 명확한 시스템 지침과 도구 스키마의 이점을 여전히 봅니다.
- Gemini 3.7 Flash가 하위 작업에 최적이 아닐 때는 CometAPI의 다른 모델(예: 특화 이미지 생성기 또는 대체 추론 모델)과 조합하세요.
스트리밍, 캐싱, 배치 요청 처리
- 스트리밍은 OpenAI 호환 및 네이티브 클라이언트 모두에서 표준 스트림 플래그로 지원됩니다.
- 컨텍스트 캐싱(암묵/명시)은 반복되는 대규모 컨텍스트의 비용을 줄입니다.
- 대량 또는 지연 민감 워크로드를 위해 배치 및 우선순위 추론 옵션이 제공됩니다—CometAPI의 최신 지원 매트릭스와 공식 Gemini 소비 옵션을 확인하세요.
사용량, 비용, 오류 모니터링
CometAPI 대시보드로 실시간 사용량, 비용 추적, 속도 제한 가시화를 확보하세요. 429 오류에는 지수 백오프를 구현하고 문서화된 속도 제한을 준수하세요. 정확한 비용 배분을 위해 응답 메타데이터의 토큰 사용량을 로깅하세요.
Gemini 3.7 Flash API 마이그레이션 체크리스트
배포 전에 기존 Gemini 애플리케이션의 다음 항목을 모두 확인하세요.
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
Google의 마이그레이션 가이드는 Gemini 3.7 Flash로 이동할 때 특히 이러한 변경을 권장합니다.
자주 묻는 질문
Gemini 3.7 Flash API란?
Gemini 3.7 Flash API는 Google의 Gemini 3.7 Flash 모델에 대한 프로그래밍적 접근을 제공합니다. Google은 이 모델을 코딩, 에이전트, 웹 개발, 지식 작업, 복잡한 다단계 워크플로에 적합하다고 포지셔닝합니다.
Gemini 3.7 Flash의 가격은?
2026년 12월 31일까지 도입 가격은 1M 입력 토큰당 $0.75, 1M 출력 토큰당 $3.75입니다.
2027년 1월 1일부터는 1M 입력 토큰당 $1.50, 1M 출력 토큰당 $7.50으로 전환된다고 합니다.
Gemini 3.7 Flash에서 temperature를 계속 사용할 수 있나요?
권장하지 않습니다. Google의 Gemini 3.x 마이그레이션 문서는 temperature, top_p, top_k가 더 이상 사용되지 않으며 제거해야 한다고 명시합니다.
CometAPI를 통해 Gemini 3.7 Flash를 사용할 수 있나요?
CometAPI 플랫폼은 현재 Gemini 3.7 Flash 제공을 광고하고 있으며, Gemini 형식 및 OpenAI 호환 API 패턴을 제공합니다. 모델이 새로 출시된 만큼, 프로덕션 배포 전 최신 모델 페이지와 엔드포인트 기능을 확인하세요.
CometAPI가 공식 Gemini API보다 낫나요?
보편적으로 “더 낫다”라고 할 수는 없습니다. Google의 네이티브 생태계와 공급자 전용 기능을 원한다면 공식 Gemini API가 자연스러운 선택입니다. 멀티 벤더 공통 인터페이스, 중앙 집중식 관리, 쉬운 모델 전환이 필요하다면 CometAPI가 더 매력적일 수 있습니다.
최종 결론: Gemini 3.7 Flash는 사용할 가치가 있나요?
2026년에 AI 애플리케이션을 구축하는 개발자에게 Gemini 3.7 Flash는 진지하게 검토할 가치가 있습니다.
이 릴리스는 챗봇을 약간 더 똑똑하게 만드는 것이 아니라, 비교적 저렴한 모델이 실제로 “일을 해내는” 능력을 강화하는 데 의의가 있습니다.
가장 큰 기술적 고려사항은 마이그레이션입니다.
구형 Gemini API를 기반으로 작성된 애플리케이션이라면, 단순히 모델 이름만 바꾸지 마세요. 사용 중단된 샘플링 파라미터를 제거하고, thinking_level로 마이그레이션하며, 지원되지 않는 candidate_count를 제거하고, 모델 턴 사전 프리필을 중단하며, 함수 호출 동작을 재검토하세요.
Google 중심으로만 구축하는 팀이라면 네이티브 Gemini API가 분명한 출발점입니다.
멀티 모델 AI 스택을 구축하는 팀이라면, CometAPI는 하나의 API 레이어, 중앙 모델 접근, 각 공급자별 별도 통합 없이도 Gemini와 다른 주요 모델 패밀리를 나란히 실험할 수 있는 매력적인 대안을 제공합니다.
실용적인 권장사항은 단순합니다.
우선 보통 추론 노력의 Gemini 3.7 Flash로 시작해 실제 워크로드에서 벤치마크한 다음, 지연·품질·비용 요구사항에 따라 낮음 또는 높음을 선택적으로 사용하세요. 제품이 여러 AI 공급자를 필요로 한다면, 애플리케이션 아키텍처를 재설계하지 않고도 동일 워크로드를 CometAPI로 비교 평가하세요.
강화된 에이전트 성능, 1M 토큰 컨텍스트 윈도, 구성 가능한 추론, 공격적인 2026년 가격 책정—이 조합은 지금 프로덕션 AI 에이전트를 구축하는 개발자에게 Gemini 3.7 Flash를 가장 흥미로운 API 릴리스 중 하나로 만듭니다.
