Gemini 3.5 Flash-Lite의 기술 사양
| 항목 | Gemini 3.5 Flash-Lite |
|---|---|
| 제공자 | Google DeepMind |
| 모델 ID | gemini-3.5-flash-lite |
| 모델 패밀리 | Gemini 3.5 |
| 가용성 | 일반 출시 (GA) |
| 입력 유형 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 유형 | 텍스트 |
| 컨텍스트 윈도우 | 1,048,576 토큰 |
| 최대 출력 | 65,536 토큰 |
| 사고 | 지원됨(기본값: minimal; medium 및 high도 지원) |
| 함수 호출 | 예 |
| 코드 실행 | 예 |
| 파일 검색 | 예 |
| URL 컨텍스트 | 예 |
| 검색 그라운딩 | 예 |
| 구조화된 출력 | 예 |
| 컴퓨터 사용 | 지원되지 않음 |
| 캐싱 | 지원됨 |
| 주요 초점 | 대량 처리, 저지연, 저비용 추론 |
Gemini 3.5 Flash-Lite란?
Gemini 3.5 Flash-Lite는 Gemini 3.5 패밀리 중 Google의 가장 빠르고 비용 효율적인 모델입니다. 최대 추론 성능보다 지연 시간, 처리량, API 비용이 더 중요한 워크로드에 최적화되어 있습니다. 대표적인 적용 분야로는 문서 파싱, 구조화 데이터 추출, 라우팅, 경량 코딩, 그리고 대규모로 운영되는 자율 서브에이전트가 포함됩니다. Google은 프로덕션 배포에서 Gemini 3.1 Flash-Lite 및 Gemini 2.5 Flash에서 업그레이드할 권장 경로로 포지셔닝하고 있습니다.
Gemini 3.5 Flash-Lite의 주요 기능
- 대량·저비용 추론에 최적화.
- 긴 문서와 리포지토리를 위한 100만 토큰 컨텍스트 윈도우 지원.
- 텍스트, 이미지, 비디오, 오디오, PDF 등 네이티브 멀티모달 입력 지원.
- 함수 호출, 코드 실행, 파일 검색, URL 컨텍스트, 검색 그라운딩, 구조화된 출력 지원.
- 속도와 추론 품질의 균형을 위한 구성 가능한 사고 수준(
minimal,medium,high). - 매우 낮은 지연을 유지하면서 Gemini 3.1 Flash-Lite 대비 코딩, 추론, 에이전트형 워크플로우가 크게 향상.
Gemini 3.5 Flash-Lite의 벤치마크 성능
Google에 따르면 Gemini 3.5 Flash-Lite는 코딩, 문서 이해, 에이전트형 워크플로우에서 이전 Flash-Lite 세대보다 크게 앞서면서도 Gemini 3.5 라인업 중 가장 저렴한 모델로 유지됩니다. Gemini 3.5 Flash-Lite는 Terminal-Bench 2.1 테스트에서 54%를 기록했으며, 전작의 31% 대비 큰 폭의 개선을 보였습니다.
이 모델의 강점은 분류, 추출, 채팅 응답, 간단한 검색 강화된 답변에 있습니다. 이런 영역은 빠르고 저비용인 모델이 특히 뛰어날 수 있는 부분입니다.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| 측면 | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| 포지셔닝 | 일상적인 대량 작업(예: 문서 처리, 검색)에 대해 가장 빠르고 가장 저렴 | 현재 플래그십 Flash: 지능, 효율, 에이전트 성능의 최적 균형 | 강력한 에이전트/코딩 모델(현재 대부분 3.6에 의해 대체됨) |
| 적합한 용도 | 대량 처리, 저비용 워크플로우 | 코딩, 멀티모달, 복잡한 에이전트, 지식 업무 | 일반적인 에이전트·코딩 작업 |
| 지능/성능 | 좋음(구형 Lite보다 우수; 다수의 에이전트 작업에서 경쟁력) | 셋 중 최고(코딩 및 에이전트에서 뚜렷한 향상) | 강력함(Flash 시리즈에서 선도에 근접) |
| 주요 벤치마크 | - Terminal-Bench: ~54% - 문서 및 대량 작업에 강함 | - DeepSWE: 49% (vs 37%) - MLE-Bench: 63.9% (vs 49.7%) - OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2% - 대부분의 코딩/에이전트에서 3.6보다 낮음 |
| 속도 | 가장 빠름(~350 출력 토큰/초) | 매우 빠름(~280 t/s) | 빠름 |
| 효율성 | 대량 처리에 탁월 | 최고(평균 출력 토큰 17% 감소; 코딩에서는 최대 65%) | 좋음 |
| 멀티모달 | 텍스트 + 이미지 + 비디오 + 오디오 | 텍스트 + 이미지 + 비디오 + 오디오(더 강한 추론) | 텍스트 + 이미지 + 비디오 + 오디오 |
| 컨텍스트 윈도우 | ~1M 토큰 | ~1M 토큰 | ~1M 토큰 |
| 최대 출력 토큰 | ~64k | ~64k | ~64k |
| 가격(100만 토큰 기준) | 가장 저렴: ~$0.30 입력 / $2.50 출력 | $1.50 입력 / $7.50 출력 | $1.50 입력 / $9.00 출력 |
| 실효 비용 | 단순 작업에서 최저 | 효율 향상으로 3.5보다 낮음 | 3.6보다 높음 |
요약 권장사항
- 3.5 Flash-Lite 선택 — 대량 또는 단순 작업에서 최대 속도와 최소 비용이 필요할 때.
- 3.6 Flash 선택 — 대부분의 사용자와 개발자에게 권장(현재 최적의 종합 선택).
- 3.5 Flash 선택 — 기존 워크플로우가 이에 묶여 있는 경우에만(3.6으로 업그레이드 계획 권장).
Gemini 3.5 Flash-Lite의 제한 사항
- 최첨단 수준의 추론보다는 효율에 최適화.
- 컴퓨터 사용은 지원되지 않음.
- 네이티브 이미지 및 오디오 생성은 제공되지 않음.
- 현재 파인튜닝 미지원.
- 복잡한 다단계 추론 작업에는 일반적으로 Gemini 3.5 Flash 또는 Gemini 3.6 Flash가 더 적합.