Gemini 3.5 Flash-Lite의 기술 사양
| 항목 | Gemini 3.5 Flash-Lite |
|---|---|
| 제공자 | Google DeepMind |
| 모델 ID | gemini-3.5-flash-lite |
| 모델 계열 | Gemini 3.5 |
| 가용성 | 일반 공급(GA) |
| 입력 유형 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 유형 | 텍스트 |
| 컨텍스트 윈도우 | 1,048,576 토큰 |
| 최대 출력 | 65,536 토큰 |
| 사고 | 지원됨(기본값: minimal; medium 및 high도 제공) |
| 함수 호출 | 예 |
| 코드 실행 | 예 |
| 파일 검색 | 예 |
| URL 컨텍스트 | 예 |
| Search Grounding | 예 |
| 구조화된 출력 | 예 |
| 컴퓨터 사용 | 지원되지 않음 |
| 캐싱 | 지원됨 |
| 주요 초점 | 고처리량, 저지연, 저비용 추론 |
Gemini 3.5 Flash-Lite란?
Gemini 3.5 Flash-Lite는 Gemini 3.5 계열에서 Google의 가장 빠르고 비용 효율적인 모델입니다. 최대한의 추론 성능보다 지연 시간, 처리량, API 비용이 더 중요한 워크로드에 최적화되어 있습니다. 일반적인 활용 사례로는 문서 파싱, 구조화된 데이터 추출, 라우팅, 경량 코딩, 대규모로 작동하는 자율 서브에이전트 등이 포함됩니다. Google은 프로덕션 배포에서 Gemini 3.1 Flash-Lite와 Gemini 2.5 Flash의 권장 업그레이드 경로로 본 모델을 제시합니다.
Gemini 3.5 Flash-Lite의 주요 기능
- 대량, 저비용 추론에 최적화.
- 긴 문서와 리포지토리를 위해 100만 토큰 컨텍스트 윈도우 지원.
- 텍스트, 이미지, 비디오, 오디오, PDF 등 네이티브 멀티모달 입력 지원.
- 함수 호출, 코드 실행, 파일 검색, URL 컨텍스트, Search Grounding, 구조화된 출력 지원.
- 속도와 추론 품질의 균형을 위해 구성 가능한 사고 레벨(
minimal,medium,high). - 매우 낮은 지연을 유지하면서 Gemini 3.1 Flash-Lite 대비 코딩, 추론, 에이전트형 워크플로우를 크게 개선.
Gemini 3.5 Flash-Lite의 벤치마크 성능
Google에 따르면 Gemini 3.5 Flash-Lite는 코딩, 문서 이해, 에이전트형 워크플로우에서 이전 Flash-Lite 세대를 크게 앞서면서도 Gemini 3.5 라인업에서 가장 저렴한 모델로 유지됩니다. Gemini 3.5 Flash-Lite는 Terminal-Bench 2.1 테스트에서 54%를 기록했으며, 전작의 31% 대비 크게 향상되었습니다.
이 모델의 강점은 분류, 추출, 채팅 응답, 간단한 검색 강화 답변에 있습니다. 이는 빠르고 저렴한 모델이 뛰어날 수 있는 정확한 영역입니다.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| 항목 | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| 포지셔닝 | 대량의 일상 작업(예: 문서 처리, 검색)에 대해 가장 빠르고 저렴함 | 현재 플래그십 Flash: 지능, 효율, 에이전트 성능의 최적 균형 | 강력한 에이전트/코딩 모델(현재는 3.6에 의해 대부분 대체) |
| 최적 용도 | 고처리량, 저비용 워크플로우 | 코딩, 멀티모달, 복잡한 에이전트, 지식 작업 | 일반적인 에이전트 및 코딩 작업 |
| 지능/성능 | 우수(구형 Lite 대비 우수; 많은 에이전트 작업에서 경쟁력) | 세 가지 중 최고(코딩 및 에이전트에서 뚜렷한 향상) | 강력(Flash 시리즈의 최전선에 근접) |
| 주요 벤치마크 | - Terminal-Bench: ~54%- 문서 및 대량 작업에 강함 | - DeepSWE: 49%(vs 37%)- MLE-Bench: 63.9%(vs 49.7%)- OSWorld: 83%(vs 78.4%) | - Terminal-Bench: 76.2%- 대부분의 코딩/에이전트에서 3.6보다 낮음 |
| 속도 | 가장 빠름(~초당 출력 토큰 350개) | 매우 빠름(~280 t/s) | 빠름 |
| 효율성 | 대량 처리에 탁월 | 최상(평균 출력 토큰 17% 감소; 코딩에서는 최대 65%) | 우수 |
| 멀티모달 | 텍스트 + 이미지 + 비디오 + 오디오 | 텍스트 + 이미지 + 비디오 + 오디오(추론이 더 강함) | 텍스트 + 이미지 + 비디오 + 오디오 |
| 컨텍스트 윈도우 | ~100만 토큰 | ~100만 토큰 | ~100만 토큰 |
| 최대 출력 토큰 | ~64k | ~64k | ~64k |
| 가격(토큰 100만개당) | 가장 저렴: 입력 ~$0.30 / 출력 $2.50 | 입력 $1.50 / 출력 $7.50 | 입력 $1.50 / 출력 $9.00 |
| 실효 비용 | 단순 작업에서 작업당 비용이 가장 낮음 | 효율 향상으로 3.5보다 낮음 | 3.6보다 높음 |
요약 권장 사항
- 3.5 Flash-Lite 선택 — 대량 또는 단순 작업에서 최대 속도와 최소 비용이 필요할 때.
- 3.6 Flash 선택 — 대부분의 사용자와 개발자에게 적합(현재 전반적으로 최선의 선택).
- 3.5 Flash 선택 — 기존 워크플로우가 이 모델에 묶여 있는 경우에만(3.6으로 업그레이드 계획 권장).
Gemini 3.5 Flash-Lite의 제한 사항
- 최첨단 수준의 추론보다는 효율성에 최적화.
- 컴퓨터 사용은 지원되지 않음.
- 네이티브 이미지 및 오디오 생성은 불가능.
- 파인튜닝은 현재 지원되지 않음.
- 복잡한 다단계 추론 작업은 일반적으로 Gemini 3.5 Flash 또는 Gemini 3.6 Flash에 더 적합.