Spesifikasi Teknis Gemini 3.5 Flash-Lite
| Item | Gemini 3.5 Flash-Lite |
|---|---|
| Penyedia | Google DeepMind |
| ID Model | gemini-3.5-flash-lite |
| Keluarga Model | Gemini 3.5 |
| Ketersediaan | Ketersediaan Umum (GA) |
| Jenis Input | Teks, Gambar, Video, Audio, PDF |
| Jenis Output | Teks |
| Jendela Konteks | 1,048,576 tokens |
| Output Maksimum | 65,536 tokens |
| Penalaran | Didukung (default: minimal; juga medium dan high) |
| Function calling | Ya |
| Code execution | Ya |
| File Search | Ya |
| URL Context | Ya |
| Search Grounding | Ya |
| Structured Output | Ya |
| Computer Use | Tidak didukung |
| Caching | Didukung |
| Fokus Utama | Inferensi throughput tinggi, latensi rendah, biaya rendah |
Apa itu Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite adalah model tercepat dan paling hemat biaya dari Google dalam keluarga Gemini 3.5. Model ini dioptimalkan untuk beban kerja di mana latensi, throughput, dan biaya API lebih penting daripada performa penalaran maksimum. Aplikasi umum mencakup parsing dokumen, ekstraksi data terstruktur, perutean, pengodean ringan, dan subagen otonom dalam skala besar. Google memposisikannya sebagai jalur peningkatan yang direkomendasikan dari Gemini 3.1 Flash-Lite dan Gemini 2.5 Flash untuk penerapan produksi.
Fitur Utama Gemini 3.5 Flash-Lite
- Dioptimalkan untuk inferensi volume tinggi dan berbiaya rendah.
- Mendukung jendela konteks 1 juta token untuk dokumen dan repositori panjang.
- Input multimodal native yang mencakup teks, gambar, video, audio, dan PDF.
- Mendukung Function Calling, Code Execution, File Search, URL Context, Search Grounding, dan Structured Outputs.
- Tingkat penalaran yang dapat dikonfigurasi (
minimal,medium,high) untuk menyeimbangkan kecepatan dan kualitas penalaran. - Secara signifikan meningkatkan pengodean, penalaran, dan alur kerja berbasis agen dibandingkan Gemini 3.1 Flash-Lite sambil tetap mempertahankan latensi yang sangat rendah.
Performa Benchmark Gemini 3.5 Flash-Lite
Google menyatakan bahwa Gemini 3.5 Flash-Lite secara substansial melampaui generasi Flash-Lite sebelumnya dalam pengodean, pemahaman dokumen, dan alur kerja berbasis agen, sekaligus tetap menjadi model berbiaya terendah di lini Gemini 3.5. Gemini 3.5 Flash-Lite meraih skor 54% dalam uji Terminal-Bench 2.1, sebuah peningkatan signifikan dibandingkan pendahulunya yang 31%.
Kekuatan utamanya terletak pada klasifikasi, ekstraksi, balasan chat, dan jawaban sederhana yang ditingkatkan oleh retrieval. Inilah area di mana model cepat dan berbiaya rendah benar-benar unggul.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspek | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posisi | Paling cepat & termurah untuk tugas sehari-hari ber-volume tinggi (mis. pemrosesan dokumen, pencarian) | Flash unggulan saat ini: Keseimbangan terbaik antara kecerdasan, efisiensi, dan performa berbasis agen | Model berbasis agen/pengodean yang kuat (kini sebagian besar digantikan oleh 3.6) |
| Terbaik Untuk | Alur kerja throughput tinggi, biaya rendah | Pengodean, multimodal, agen kompleks, pekerjaan berbasis pengetahuan | Tugas umum berbasis agen & pengodean |
| Kecerdasan / Performa | Baik (melampaui Lite generasi lama; kompetitif pada banyak tugas berbasis agen) | Tertinggi di antara ketiganya (peningkatan nyata pada pengodean & berbasis agen) | Kuat (mendekati frontier untuk seri Flash) |
| Benchmark Utama | - Terminal-Bench: ~54%- Kuat pada tugas dokumen & volume tinggi | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Lebih rendah daripada 3.6 pada sebagian besar pengodean/berbasis agen |
| Kecepatan | Paling cepat (~350 output tokens/sec) | Sangat cepat (~280 t/s) | Cepat |
| Efisiensi | Sangat baik untuk volume | Terbaik (rata-rata 17% lebih sedikit token output; hingga 65% pada pengodean) | Baik |
| Multimodal | Teks + Gambar + Video + Audio | Teks + Gambar + Video + Audio (penalaran lebih kuat) | Teks + Gambar + Video + Audio |
| Jendela Konteks | ~1M token | ~1M token | ~1M token |
| Token Output Maksimum | ~64k | ~64k | ~64k |
| Harga (per 1M token) | Termurah: ~$0.30 input / $2.50 output | $1.50 input / $7.50 output | $1.50 input / $9.00 output |
| Biaya Efektif | Terendah per tugas untuk pekerjaan sederhana | Lebih rendah daripada 3.5 berkat peningkatan efisiensi | Lebih tinggi daripada 3.6 |
Rekomendasi Ringkas
- Pilih 3.5 Flash-Lite — saat Anda memerlukan kecepatan maksimum dan biaya minimum untuk tugas ber-volume tinggi atau sederhana.
- Pilih 3.6 Flash — untuk sebagian besar pengguna dan pengembang (pilihan keseluruhan terbaik saat ini).
- Pilih 3.5 Flash — hanya jika Anda memiliki alur kerja yang sudah terikat padanya (rencanakan peningkatan ke 3.6).
Keterbatasan Gemini 3.5 Flash-Lite
- Dioptimalkan untuk efisiensi alih-alih penalaran tingkat terdepan.
- Computer Use tidak didukung.
- Pembuatan gambar dan audio native tidak tersedia.
- Fine-tuning saat ini tidak didukung.
- Tugas penalaran multi-langkah yang kompleks umumnya lebih cocok ditangani oleh Gemini 3.5 Flash atau Gemini 3.6 Flash.