Gemini 3.6 Flash의 기술 사양
| 항목 | Gemini 3.6 Flash |
|---|---|
| 제공자 | Google DeepMind |
| 모델 ID | gemini-3.6-flash |
| 모델 계열 | Gemini 3.x |
| 제공 상태 | General Availability (GA) |
| 입력 유형 | Text, Image, Video, Audio, PDF |
| 출력 유형 | Text |
| 컨텍스트 윈도 | 1,048,576 tokens |
| 최대 출력 | 65,536 tokens |
| Thinking | 지원됨(중간/높음) |
| Function calling | Yes |
| Code execution | Yes |
| File Search | Yes |
| URL Context | Yes |
| Search Grounding | Yes |
| Computer Use | Preview |
| Structured Output | Yes |
| Caching | Supported |
출처: Google Gemini API 문서.
Gemini 3.6 Flash란?
Gemini 3.6 Flash는 Google의 최신 프로덕션 준비 완료 Flash 모델로, Flash 시리즈가 지니는 낮은 지연시간과 비용 효율성을 유지하면서도 최첨단 수준의 지능을 제공하도록 설계되었습니다. 코딩, 멀티모달 이해, 추론, 에이전트형 워크플로에 최적화되어 있습니다.
Gemini 3.5 Flash와 비교해 이 모델은 코드 생성 품질, 추론 정확도, 도구 사용, 토큰 효율성이 향상되었으며, 100만 토큰의 대규모 컨텍스트 윈도를 지원합니다. Google은 이를 AI 에이전트와 복잡한 자동화 시스템을 구축하는 개발자를 위한 기본 주력 모델로 포지셔닝하고 있습니다.
Gemini 3.6 Flash의 주요 기능
- 1M-token 긴 컨텍스트 처리 지원.
- 텍스트, 이미지, 비디오, 오디오, PDF 문서를 포함한 네이티브 멀티모달 입력.
- 코드 생성 및 소프트웨어 엔지니어링 작업에서 대폭 향상.
- Function Calling, File Search, URL Context, Search Grounding, Computer Use에 대한 내장 지원.
- Gemini 3.5 Flash 대비 더 높은 토큰 효율성으로, 더 높은 품질을 유지하면서 추론 비용을 절감.
- 다단계 AI 에이전트와 자율형 워크플로를 위해 설계.
벤치마크 성능
Google에 따르면 Gemini 3.6 Flash는 Gemini 3.5 Flash보다 코딩, 추론, 멀티모달 성능이 더 강력하며, 출력 토큰을 크게 줄입니다. 회사는 내부 코딩 및 에이전트형 벤치마크에서의 개선을 강조하며, DeepSWE와 같은 일부 소프트웨어 엔지니어링 평가에서 출력 토큰 사용량을 최대 **65%**까지 줄여 전체 추론 비용을 낮출 수 있다고 밝혔습니다. 이번 릴리스에 대해 MMLU, GPQA, SWE-bench Verified 등의 포괄적인 공개 벤치마크 표는 공개되지 않았습니다.

Gemini 3.6 Flash vs Gemini 3.5 Flash vs Gemini 3.1 Pro
| 측면 | Gemini 3.6 Flash | Gemini 3.5 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| 출시 | 2026년 7월 21일(GA) | 2026년 초 | ~2026년 2월(프리뷰) |
| 포지셔닝 | 에이전트, 코딩, 멀티모달을 위한 효율적 주력 모델 | 이전 세대 에이전트형 Flash 모델 | 고급 Pro 등급의 심층 추론 |
| 가격(1M 토큰당) | 입력: $1.50출력: $7.50 | 입력: $1.50출력: $9.00 | 더 높음(예: 입력 ~$2 / 출력 $12) |
| 토큰 효율성 | 3.5 Flash 대비 출력 토큰 17% 감소; 단계/도구 호출 감소 | 기준선 | 에이전트형 워크플로에서 효율성 낮음 |
| 속도 | 높음(Flash 패밀리) | 높음 | Flash 모델보다 느림 |
| 컨텍스트 윈도 | 1M tokens | 1M tokens | 유사할 것으로 보임 |
| 강점 | 코딩, 지식 작업, 멀티모달(차트/문서), Computer Use, 에이전트형 효율성 | 에이전트/코딩의 균형적 성능 | 복잡한 문제에서 더 깊은 추론 |
빠른 요약
- 3.6 Flash → 현재 대부분의 사용자에게 최적의 전반적 선택: 3.5 Flash보다 더 빠르고 작업당 비용이 낮으며, 더 효율적이고, 많은 실무/에이전트형 벤치마크에서 3.1 Pro를 능가.
- 3.5 Flash → 탄탄한 전작; 여전히 유능하지만 3.6 Flash에 의해 대체되는 중(출력 토큰 비용이 더 높고 효율성 낮음).
- 3.1 Pro → 일부 심층 추론 시나리오에서는 더 강력하지만 더 느리고 비용이 높으며, 속도·효율·다수의 실사용/에이전트 작업에서 최신 Flash 모델에 전반적으로 뒤처짐.
제한 사항
- 이미지 생성은 직접 지원되지 않습니다.
- 오디오 생성은 사용할 수 없습니다.
- Computer Use는 여전히 프리뷰 상태입니다.
- 일부 레거시 생성 파라미터(
temperature,top_p,top_k)는 새로운 API 인터페이스에서 제거되었습니다. - 최신 Gemini Interactions API를 통해 최상의 성능을 발휘합니다.
Gemini 3.6 Flash API에 액세스하는 방법
1단계: API 액세스 받기
cometAPI에 로그인하세요. 아직 사용자라면 먼저 가입해 주세요. CometAPI 콘솔에 로그인합니다. 인터페이스의 액세스 자격 API 키를 발급받습니다. 개인 센터의 API 토큰에서 “Add Token”을 클릭해 토큰 키 sk-xxxxx를 발급받아 제출하세요.

2단계: Gemini 3.6 Flash API로 요청 보내기
“ gemini-3.6-flash" "gemini-3.6-flash-thinking” 엔드포인트를 선택해 API 요청을 전송하고 요청 본문을 설정합니다. 요청 메서드와 요청 본문은 웹사이트의 API 문서에서 확인할 수 있습니다. 편의를 위해 웹사이트에서 Apifox 테스트도 제공합니다. 계정의 실제 CometAPI 키로 <YOUR_API_KEY>를 교체하세요. 기본 URL은 Gemini Generating Content입니다.
content 필드에 질문이나 요청을 입력하세요—모델은 여기에 응답합니다. API 응답을 처리해 생성된 답변을 얻습니다.
3단계: 응답 처리
API는 생성된 텍스트, 출처 표기, 안전성 메타데이터, 선택적 도구 출력 등을 포함한 구조화된 후보 응답을 반환합니다.