TLDR Google의 최신 Gemini 출시작은 기다리던 Gemini 3.5 Pro가 아니다. 대신 Google은 효율성에 초점을 맞춘 세 가지 모델을 공개했다: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber. 실용적인 메시지는 분명하다. Google은 플래그십 Pro 모델을 여전히 테스트하는 동안 에이전트 경제성, 지연 시간, 토큰 효율, 그리고 보안 자동화 특화에 우선순위를 두고 있다.
개발자에게 최선의 선택은 Gemini 3.5 Pro를 수동적으로 기다리지 않는 것이다. 복잡한 에이전트와 코딩 워크플로에는 기본 업그레이드 후보로 Gemini 3.6 Flash를, 대량 추출과 라우팅에는 Gemini 3.5 Flash-Lite를 사용하라. 또한 최전선급 추론 작업에는 교차 모델 폴백 전략을 유지하라. CometAPI는 OpenAI 호환 단일 API 키로 500개 이상의 모델에 대한 통합 접근을 제공하므로, 기존 통합을 재구축하지 않고도 Gemini를 GPT, Claude, DeepSeek, Kimi, Qwen 등과 함께 테스트할 수 있다.
핵심 요약
- Google은 2026년 7월 21일 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber를 발표했다. 이번 출시에는 Gemini 3.5 Pro가 포함되지 않았다. Google은 파트너와 테스트 중이며 준비되면 폭넓게 제공할 것이라고 밝혔다.
- Gemini 3.6 Flash는 Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, Gemini 앱, Google Antigravity에서 일반 제공된다. Gemini 3.5 Flash-Lite는 Gemini API에서 일반 제공되며 고처리량·저비용 워크플로를 목표로 한다.
- Gemini 3.5 Flash Cyber는 제한적 접근 모델로, CodeMender 내에서 취약점 탐지, 검증, 패치에 맞게 설계되었다.
- Google 보고에 따르면 Gemini 3.6 Flash는 Artificial Analysis에서 3.5 Flash 대비 출력 토큰을 17% 덜 사용하며, DeepSWE 스타일 테스트에서는 최대 65%까지 출력 토큰을 줄인다.
- Artificial Analysis는 독립적으로 Gemini 3.6 Flash의 Intelligence Index 점수를 50으로, 출력 속도를 251.3 tokens/s로 보고했으며, 작업당 평균 비용은 Gemini 3.5 Flash 대비 $0.59에서 $0.50로 감소했다고 밝혔다.
- DeepSWE는 Gemini 3.6 Flash가 pass@1 49%, 작업당 평균 비용 $3.53으로, Gemini 3.5 Flash의 pass@1 37%, 작업당 평균 비용 $7.34와 비교된다고 나열한다.
- CometAPI는 현재 Gemini 3.6 Flash를 입력 $1.20/M, 출력 $6.00/M, Gemini 3.5 Flash-Lite를 입력 $0.24/M, 출력 $2.016/M로 표시한다. 제품 UI에 가격을 표기하기 전에 라이브 대시보드를 확인하라.
Google은 무엇을 공개했나?
Gemini 3.6 Flash
Gemini 3.6 Flash는 일반 개발자에게 이번 출시에서 가장 중요한 모델이다. 프로덕션 에이전트, 코딩, 멀티모달 워크플로, 문서 분석, 장문맥 추론, 지식 작업을 위해 제작된 안정적인 Flash 등급 모델이다.
Google은 Gemini 3.6 Flash를 작업용 모델로 설명하며, Gemini 3.5 Flash 대비 코딩, 지식 작업, 멀티모달 성능을 개선하면서 토큰 효율을 높인다고 한다. 공식 Gemini API 페이지는 이 모델이 에이전트 시대를 위해 설계되었으며 빠른 코딩과 반복 루프에 특히 효과적이라고 밝힌다.
모델의 공개 ID는 다음과 같다:
gemini-3.6-flash
핵심 사양은 Gemini 3.6 Flash 모델 페이지를 참조.
Gemini 3.5 Flash-Lite
Gemini 3.5 Flash-Lite는 이번 릴리스의 효율성 모델이다. Google은 이를 3.5 계열에서 가장 빠르고 비용 효율적인 모델로 포지셔닝하며, 고처리량 실행, 문서 파싱, 번역, 분류, 라우팅, 단순 데이터 추출에 최적화했다고 한다.
모델의 공개 ID는 다음과 같다:
gemini-3.5-flash-lite
핵심 사양은 Gemini 3.5 Flash-Lite 모델 페이지 참조.
핵심 차이는 컨텍스트 윈도우가 아니다. Flash-Lite는 3.6 Flash와 동일한 입력 1M, 출력 64K 프로파일을 유지한다. 차이는 라우팅 목적이다. Flash-Lite는 처리량과 비용 통제를 위한 것이고, 3.6 Flash는 품질과 도구 신뢰성이 더 중요한 어려운 작업을 위한 것이다.
Gemini 3.5 Flash Cyber
Gemini 3.5 Flash Cyber는 Gemini 3.5 Flash를 기반으로 구축되어 취약점 발견, 검증, 패치 생성에 맞게 파인튜닝된 특화 사이버보안 모델이다.
이는 일반 공개 API 모델이 아니다. Google은 이를 제한적 접근 파일럿 프로그램의 일부로 CodeMender를 통해 정부 및 신뢰할 수 있는 파트너에게 제공할 것이라고 말한다. 이 제한은 개발자에게 중요하다. 그 파일럿이나 검증된 방어 보안 프로그램의 일부가 아니라면 Flash Cyber에 대한 직접 접근을 전제로 공개 SaaS 로드맵을 설계하지 말라.
이 모델은 여전히 중요하다. Google이 지향하는 Gemini의 방향을 보여주기 때문이다. 에이전트 인프라에 의해 조정되는 효율적인 전문가형 모델들. 하나의 프런티어 모델이 모든 것을 하도록 만드는 대신, Google은 반복 스캔을 실행하고 보고서를 결합하며 더 낮은 비용으로 코드를 패치할 수 있는 작은 특화 시스템들을 구축하고 있다.
Gemini 3.5 Pro를 건너뛰어야 할까?
실용적인 답변
대부분의 프로덕션 팀에겐 그렇다. Gemini 3.5 Pro나 Gemini 4 Pro를 기다리지 말고 지금 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite를 평가하라.
이는 Gemini 3.5 Pro가 중요하지 않다는 뜻이 아니다. 최신 이용 가능한 모델들이 이미 대량의 AI 워크로드를 포괄한다는 뜻이다. 코딩 에이전트, 검색·조회 에이전트, 문서 워크플로, 멀티모달 파싱, 데이터 추출, 프롬프트 라우팅, UI 자동화, 장문맥 검토, 에이전트 하위 작업 실행 등.
Google의 발표에 따르면 Gemini 3.5 Pro는 여전히 파트너와 테스트 중이며 준비되면 폭넓게 출시된다. 오늘 당장 프로덕션 경제성을 개선하는 데 gemini-3.5-pro API 모델 페이지, 최종 가격표, 모델 카드가 공개되어 있을 필요는 없다.
Gemini 3.5 Pro를 기다리는 것이 여전히 합리적인 경우
처리량보다 프런티어급 추론이 더 필요한 워크로드라면 Gemini 3.5 Pro나 Gemini 4 Pro를 주시해야 한다. 예: 고급 연구 종합, 매우 복잡한 다중 파일 엔지니어링, 어려운 수학, 과학적 추론, 고위험 엔터프라이즈 분석, 그리고 신중한 프롬프트·도구 설계 후에도 Flash 모델이 실패하는 작업.
가장 강력한 모델 전략은 “Pro를 기다린다” 또는 “모두 Flash로 대체한다”가 아니다. 계층적 라우팅이다.
- 저비용·대량 하위 작업에는 Gemini 3.5 Flash-Lite를 사용한다.
- 코딩, 멀티모달 분석, 문서 검토, 장문맥 종합, 에이전트형 워크플로에는 Gemini 3.6 Flash를 사용한다.
- 가장 어렵거나 위험도가 높은 요청은 CometAPI를 통해 프런티어급 추론 모델로 라우팅한다.
- Google과 CometAPI가 이용 가능하게 만들면 Gemini 3.5 Pro를 벤치마크 스위트에 추가한다.
Gemini 3.6 Flash 벤치마크: 무엇이 개선되었나?
Google DeepMind 벤치마크 표
Google DeepMind의 Gemini 3.6 Flash 페이지는 다음과 같이 Gemini 3.5 Flash 대비 비교를 제시한다:
| 벤치마크 | 측정 항목 | Gemini 3.6 Flash | Gemini 3.5 Flash | 변화 |
|---|---|---|---|---|
| SWE-Bench Pro | 다양한 에이전트형 코딩 작업 | 58.7% | 55.1% | +3.6 pts |
| DeepSWE v1.1 | 장기 호라이즌 소프트웨어 엔지니어링 | 49% | 37% | +12 pts |
| Terminal-Bench 2.1 | 에이전트형 터미널 코딩 | 78.0% | 76.2% | +1.8 pts |
| MLE-Bench | 머신러닝 엔지니어링 | 63.9% | 49.7% | +14.2 pts |
| GDPval-AA v2 | 지식 작업 Elo | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | 에이전트형 컴퓨터 사용 | 83.0% | 78.4% | +4.6 pts |
| CharXiv 추론, 도구 없음 | 차트·정보 종합 | 85.2% | 84.2% | +1.0 pt |
| CharXiv 추론, 도구 사용 | 차트·정보 종합 | 89.4% | 84.9% | +4.5 pts |
| GDM-MRCR v2, 128K 평균 | 장문맥 검색 | 91.8% | 77.3% | +14.5 pts |
| GDM-MRCR v2, 1M 포인트와이즈 | 장문맥 검색 | 54.0% | 26.6% | +27.4 pts |
가장 큰 향상은 에이전트에 핵심적인 영역에서 나타난다. 장기 호라이즌 코딩, 머신러닝 엔지니어링, 장문맥 검색, 컴퓨터 사용. Terminal-Bench와 CharXiv의 소폭 향상은 이것이 “모든 것이 두 배로 좋아진” 일괄 업그레이드가 아니라는 점을 보여준다. 신뢰성, 토큰 효율, 어려운 다단계 실행에 대한 표적 개선이다.
Artificial Analysis의 독립 데이터
Artificial Analysis는 벤더 벤치마크 표에 대한 유용한 견제 장치다. 2026년 7월 분석에 따르면 Gemini 3.6 Flash는 Gemini 3.5 Flash와 동일한 Intelligence Index 점수 50을 유지한다. 이는 Gemini 3.6 Flash가 반드시 “순수 지능”이 도약한 것은 아니라는 시사점을 준다.
큰 개선은 효율성이다:
| 지표 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| 작업당 평균 시간 | 1.3분 | 2.7분 |
| 작업당 평균 비용 | $0.50 | $0.59 |
| 출력 속도 | 251.3 tokens/s | 이 표에 없음 |
| 첫 토큰까지의 시간 | 14.00s | 이 표에 없음 |
따라서 가장 적절한 헤드라인은 “Gemini 3.6 Flash가 모든 것보다 더 똑똑하다”가 아니다. 더 정확한 헤드라인은 이렇다: Gemini 3.6 Flash는 Gemini 3.5 Flash의 지능 수준을 유지하면서 에이전트 워크로드를 더 싸고 빠르게 만든다.
DeepSWE: 장기 호라이즌 코딩 데이터
Datacurve의 DeepSWE는 특히 관련성이 높다. 원천의 장기 호라이즌 소프트웨어 엔지니어링 작업에 초점을 맞추기 때문이다. 리더보드는 91개 리포지토리, 5개 언어에 걸친 113개 작업을 설명한다.
2026년 7월 21일 리더보드:
| 모델 | Pass@1 | 평균 비용 | 출력 토큰 | 에이전트 단계 수 |
|---|---|---|---|---|
| Gemini 3.6 Flash high | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash medium | 37% ±2 | $7.34 | 276K | 86 |
가장 흥미로운 수치는 단지 12포인트 pass@1 향상이 아니다. 출력 토큰 감소다. 97K 대 276K. 대략 65% 적은 출력 토큰으로, Google의 출시 주장과 일치한다. 코딩 에이전트에 있어 출력 토큰 감소는 드리프트 감소, 장황한 수정 루프 축소, 컨텍스트 오염 감소, 이슈당 비용 절감으로 이어질 수 있다.

출처: Gemini
Gemini 3.5 Flash-Lite 벤치마크: 왜 중요한가
Flash-Lite는 처리량 모델이다
Gemini 3.5 Flash-Lite는 대량 실행을 위해 설계되었다. 시스템이 수천~수백만 건의 소/중형 작업을 처리해야 할 때 테스트해야 할 모델이다.
- 영수증 추출
- 상품 카탈로그 파싱
- 문서 청크 라벨링
- 번역
- 분류
- 검색 결과 종합
- 쿼리 재작성
- 툴 호출 라우팅
- 경량 코딩 작업
- 에이전트 하위 작업 실행
- 멀티모달 데이터 추출
Google에 따르면 Flash-Lite는 Artificial Analysis 기준 초당 350 출력 토큰에 도달하며, 표준 Gemini API 티어에서 입력 토큰 1M당 $0.30, 출력 토큰 1M당 $2.50로 책정되어 있다.
Flash-Lite 대 Gemini 3.1 Flash-Lite
Google DeepMind의 모델 카드는 Gemini 3.1 Flash-Lite 대비 큰 향상을 보여준다:
| 벤치마크 | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | 변화 |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 pts |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 pts |
| MLE-Bench | 39.2% | 22.0% | +17.2 pts |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 pts |
| CharXiv, 도구 없음 | 74.5% | 73.2% | +1.3 pts |
| CharXiv, 도구 사용 | 76.5% | 75.6% | +0.9 pts |
| GDM-MRCR v2, 128K 평균 | 72.2% | 60.1% | +12.1 pts |
| GDM-MRCR v2, 1M 포인트와이즈 | 21.3% | 12.3% | +9.0 pts |
Artificial Analysis는 또한 Gemini 3.1 Flash-Lite의 Intelligence Index 25에서 Gemini 3.5 Flash-Lite는 36으로 상승했으며, 작업당 시간은 1.0분에서 0.6분으로 감소했다고 보고한다. 트레이드오프는 이번 벤치마크 세트에서 작업당 비용이 $0.04에서 $0.09로 상승했다는 점인데, 이는 새 모델의 가격이 3.1 Flash-Lite보다 높기 때문이다.

출처: Gemini
이 트레이드오프는 개선된 품질이 다운스트림 재시도, 휴먼 리뷰, 더 비싼 모델로의 에스컬레이션을 줄여준다면 수용 가능하다. 이미 Gemini 3.1 Flash-Lite로 완벽히 해결된 워크로드라면 매력이 떨어진다. 전체 트래픽을 이전하기 전에 테스트하라.
이번 Gemini 출시의 의미
“가장 큰 모델”에서 “최고의 일꾼 모델”로의 전환을 확인
AI 시장은 종종 프런티어 플래그십 모델에 주목한다. Gemini 3.6 Flash는 다른 방향을 가리킨다. 프로덕션 AI 시스템에는 낭비 없이 많은 실제 작업을 완수할 수 있는 신뢰성 높고 빠르며 비용 효율적인 모델이 필요하다.
그래서 이번 릴리스는 토큰 효율, 더 적은 도구 호출, 더 낮은 지연 시간, 더 적은 수정 루프를 강조한다. 개발자에게 이는 부차적 지표가 아니다. AI 에이전트가 재무팀을 놀라게 하지 않고 확장 운영될 수 있는지를 결정한다.
Gemini 3.5 Pro를 기다리는 동안 Google은 더 강한 프로덕션 모델을 제공
Gemini 3.5 Pro는 여전히 파트너 테스트 중이다. Pro를 기다리는 대신, Google은 더 강한 Flash 모델과 더 저렴한 Flash-Lite 모델을 출시했다. 이는 개발자에게 즉시 사용할 수 있는 두 가지 옵션을 제공한다.
- 더 강한 작업용 지능을 위한 Gemini 3.6 Flash
- 더 저렴하고 빠른 대량 실행을 위한 Gemini 3.5 Flash-Lite
이는 실용적인 제품 전략이다. 많은 비즈니스는 모든 요청에 가장 비싼 모델이 필요하지 않다. 필요한 것은 모델 포트폴리오와 라우팅 로직이다.
모델 라우팅의 중요성 강화
Gemini 3.6 Flash를 모든 곳에 쓰면 안 된다. Flash-Lite도 마찬가지다. 2026년의 최고의 AI 시스템은 동적으로 라우팅할 것이다.
- 작업이 단순하면 저렴한 것부터 시작하라.
- 추론, 멀티모달 이해, 도구 사용이 중요하면 Gemini 3.6 Flash를 사용하라.
- 요청이 신뢰도 임계값에 미달하면에만 상향 에스컬레이션하라.
- 반복되는 장문 컨텍스트를 캐시하라.
- 토큰당 비용만이 아니라 성공한 작업당 비용을 모니터링하라.
이는 기사에서 제시하는 가장 강력한 CometAPI 권고다. 단일 모델을 전체 AI 전략으로 삼지 말라. 라우터를 구축하고 각 모델이 트래픽을 얻을 만한 성과를 내도록 하라.
FAQ
Gemini 3.5 Pro는 지금 사용 가능한가?
작성 시점인 2026년 7월 기준, 일반 제공되는 Gemini API 모델이 아니다. Google은 Gemini 3.5 Pro가 파트너와 테스트 중이며 준비되면 폭넓게 제공될 것이라고 말한다.
Gemini 3.6 Flash가 Gemini 3.5 Flash보다 나은가?
많은 프로덕션 에이전트와 코딩 워크플로에서는 그렇다. Google은 더 나은 벤치마크 결과와 더 낮은 출력 토큰 사용을 보고한다. Artificial Analysis는 유사한 Intelligence Index 품질과 함께 작업당 시간 및 비용이 낮다고 보고한다.
Gemini 3.5 Flash-Lite는 어떤 용도에 가장 적합한가?
Gemini 3.5 Flash-Lite는 추출, 분류, 번역, 검색, 라우팅, 서브에이전트 실행 등 고처리량·저지연·저비용 워크로드에 가장 적합하다.
Gemini 3.5 Flash Cyber를 공개 Gemini API로 사용할 수 있는가?
Google은 Gemini 3.5 Flash Cyber를 CodeMender를 통해 정부 및 신뢰할 수 있는 파트너에게 제공하는 제한적 접근 모델로 설명한다. 표준 공개 API 모델로 포지셔닝되어 있지 않다.
Gemini 3.6 Flash의 비용은 얼마인가?
Google의 표준 Gemini API 가격은 입력 토큰 1M당 $1.50, 출력 토큰 1M당 $7.50로 안내한다. CometAPI는 현재 입력 $1.20/M, 출력 $6.00/M로 표시한다. 프로덕션 롤아웃 전에 항상 라이브 가격을 확인하라.
Gemini 3.5 Flash-Lite의 비용은 얼마인가?
Google의 표준 Gemini API 가격은 입력 토큰 1M당 $0.30, 출력 토큰 1M당 $2.50로 안내한다. CometAPI는 현재 입력 $0.24/M, 출력 $2.016/M로 표시한다. 프로덕션 롤아웃 전에 항상 라이브 가격을 확인하라.
개발자는 Gemini 3.5 Pro를 기다려야 하는가?
대부분의 팀은 기다리지 말아야 한다. 지금 바로 복잡한 워크플로에는 Gemini 3.6 Flash를, 대량 하위 작업에는 Gemini 3.5 Flash-Lite를 테스트하라. 공개 사양·가격·가용성이 확정되면 Gemini 3.5 Pro를 벤치마크 스위트에 추가하라.
최종 결론
Google의 2026년 7월 Gemini 출시는 플래그십 Pro 릴리스가 아닌 효율성 릴리스로 이해하는 것이 가장 정확하다. Gemini 3.6 Flash는 미래의 Gemini 3.5 Pro 필요성을 없애지는 않지만, 개발자에게 즉시 유용한 것을 제공한다. Gemini 3.5 Flash 대비 더 낮은 출력 토큰 비용으로 강력한 코딩, 멀티모달, 장문맥, 에이전트형 성능을 갖춘 일반 제공 모델이다.
Gemini 3.5 Flash-Lite는 프로덕션 스택의 다른 한 축을 담당한다. 최대한의 추론 깊이가 필요하지 않은 하위 작업을 위한 저렴하고 빠른 모델이다. Gemini 3.5 Flash Cyber는 특화된 방어 보안 에이전트의 미래를 시사하지만, 제한적 접근으로 인해 오늘날 일반 개발자 도구라기보다는 전략적 신호로서의 의미가 크다.
