TLDR: Gemini 3.6 Flash adalah model Flash produksi Google per Juli 2026 untuk pengodean, kerja pengetahuan, analisis multimodal, dan alur kerja agen. Model ini mempertahankan jendela input 1,048,576-token dan batas keluaran 65,536-token dari Gemini 3.5 Flash, namun Google melaporkan hasil yang lebih baik dalam pengodean, penggunaan komputer, kerja pengetahuan, dan efisiensi token dengan harga token keluaran yang lebih rendah.
Gemini 3.6 Flash sebaiknya diperlakukan sebagai model Flash pilihan pertama baru untuk pengodean kompleks, penalaran multimodal, dan agen multi-langkah. Pertahankan Gemini 3.5 Flash hanya jika Anda memerlukan kontinuitas keluaran atau belum menyelesaikan pengujian migrasi. Gunakan Gemini 3.5 Flash-Lite untuk ekstraksi volume tinggi, perutean, klasifikasi, dan tugas-tugas terprediksi lainnya di mana biaya terendah lebih penting daripada kedalaman penalaran maksimum.
Poin Penting
- Gemini 3.6 Flash tersedia umum sebagai
gemini-3.6-flash; dokumentasi Gemini API Google mencantumkan pembaruan terbaru pada Juli 2026. - Gemini 3.6 Flash menargetkan pengodean, kerja pengetahuan, analisis multimodal, tugas penggunaan komputer, dan alur kerja agen multi-langkah.
- Google melaporkan hasil lebih baik daripada Gemini 3.5 Flash pada DeepSWE, MLE Bench, OSWorld-Verified, dan GDPval-AA v2. Google melaporkan 17% lebih sedikit token keluaran daripada Gemini 3.5 Flash pada Artificial Analysis Index dan hingga 65% lebih sedikit token keluaran dalam evaluasi pengodean terkait DeepSWE.
- Harga resmi Gemini API Standard adalah $1.50/M token input dan $7.50/M token keluaran, dibandingkan $1.50/M dan $9.00/M untuk Gemini 3.5 Flash. Harga Batch dan Flex untuk Gemini 3.6 Flash adalah $0.75/M input dan $3.75/M keluaran; harga Prioritas adalah $2.70/M input dan $13.50/M keluaran. Halaman model Gemini 3.6 Flash di CometAPI mencantumkan $1.20/M input dan $6.00/M keluaran, 20% di bawah harga resmi Standard berbayar Google saat diperiksa.
- Gemini 3.6 Flash dapat menggantikan Gemini 3.5 Flash untuk banyak beban kerja produksi baru, tetapi migrasi harus mencakup pengujian prompt, pemanggilan alat, parameter, latensi, biaya, dan regresi.
- Gemini 3.5 Pro tidak termasuk dalam peluncuran ini; Google mengatakan masih diuji dengan mitra dan akan dirilis secara luas ketika siap.
Apa itu Gemini 3.6 Flash?
Gemini 3.6 Flash adalah model tingkat Flash default baru untuk dievaluasi jika Anda membangun agen AI, alat pengodean, alur kerja dokumen, asisten berbasis penelusuran, atau otomasi multimodal. Google merilisnya pada 21 Juli 2026 bersama Gemini 3.5 Flash-Lite dan Gemini 3.5 Flash Cyber, membingkai peluncuran seputar ekonomi agen produksi: efisiensi token lebih tinggi, latensi lebih rendah, loop alat lebih sedikit, dan biaya per tugas berhasil lebih rendah.
Perubahan paling penting bukan nama model. Peningkatannya adalah kualitas dan ekonomi: Google mengatakan Gemini 3.6 Flash menggunakan 17% lebih sedikit token keluaran daripada Gemini 3.5 Flash pada Artificial Analysis Index dan hingga 65% lebih sedikit token keluaran pada pekerjaan pengodean gaya DeepSWE, sambil menurunkan harga keluaran standar dari $9.00/M menjadi $7.50/M.
Kemampuan Inti:
- Input Multimodal: Teks, gambar, video, audio, PDF.
- Jendela Konteks: 1 juta token input, 64k token keluaran.
- Penggunaan Alat: Pemanggilan fungsi native, penelusuran sebagai alat, dan penggunaan komputer untuk otomasi UI berbasis agen.
- Terbaik Untuk: Tugas sehari-hari, pengodean agen, penalaran lanjutan, pemahaman konteks panjang, dan generasi kode siap produksi.
Berbeda dari model “Pro” yang lebih besar dan berfokus pada kecerdasan maksimum, varian Flash menekankan kecepatan, skala, dan efisiensi biaya sembari menghadirkan kinerja setara frontier di area yang ditargetkan. Gemini 3.6 Flash memajukannya dengan mengurangi verbositas keluaran dan meningkatkan presisi.
Batas Pengetahuan: Diperbarui ke Maret 2026 (dari Januari 2025 pada versi sebelumnya), menyediakan pengetahuan dunia nyata yang lebih baru.
Model card menambahkan detail arsitektural penting: Gemini 3.6 Flash berbasis Gemini 3.5 Flash. Ini membuat rilisnya lebih dekat ke peningkatan terarah dan berfokus produksi daripada keluarga yang sepenuhnya baru. Google tampaknya berfokus pada masalah yang ditemukan pengembang dalam alur kerja agen nyata: terlalu banyak token keluaran, terlalu banyak pemanggilan alat yang tidak perlu, pengeditan yang tidak diinginkan selama tugas diagnostik, loop revisi pengodean, interpretasi grafik, pekerjaan dokumen, dan penalaran multimodal bergaya UI.
Mengapa Google Merilis Gemini 3.6 Flash Sekarang?
Berita Terbaru di Balik Peluncuran
Pengumuman 21 Juli Google melakukan tiga hal sekaligus:
- Meluncurkan Gemini 3.6 Flash sebagai model pekerja yang lebih kuat.
- Meluncurkan Gemini 3.5 Flash-Lite sebagai model kelas 3.5 tercepat dan termurah untuk alur kerja throughput tinggi.
- Memperkenalkan Gemini 3.5 Flash Cyber di CodeMender untuk kasus penggunaan pertahanan keamanan siber akses terbatas.
Pengumuman yang sama juga memperjelas status Gemini 3.5 Pro: masih diuji dengan mitra dan Google berencana membuatnya tersedia secara luas ketika siap. Google juga mengatakan pra-pelatihan Gemini 4 telah dimulai.
Konteks itu penting. Gemini 3.6 Flash bukan pengganti Pro. Ini adalah jawaban Google untuk masalah produksi yang berbeda: banyak sistem AI menjadi terlalu mahal, terlalu verbose, dan terlalu tidak andal ketika model berulang kali memanggil alat, bernalar di konteks panjang, dan mencoba ulang tindakan. Model Flash yang lebih cepat dan efisien dapat berdampak lebih langsung daripada flagship yang tertunda jika mengurangi jumlah token, giliran, dan percobaan ulang yang diperlukan untuk menyelesaikan tugas umum.
Peluncuran Ini Tentang Biaya per Tugas yang Berhasil
Tim AI sering membandingkan model berdasarkan harga token. Itu berguna, tetapi tidak lengkap. Beban kerja agen memperkenalkan variabel biaya tambahan:
- Berapa banyak langkah penalaran yang diambil model?
- Berapa banyak pemanggilan alat yang dilakukannya?
- Seberapa sering membuat edit yang tidak perlu?
- Seberapa sering gagal dan memerlukan coba ulang?
- Berapa banyak token keluaran yang dihabiskan untuk menjelaskan alih-alih menyelesaikan?
- Seberapa sering lalu lintas harus meningkat ke model yang lebih mahal?
Gemini 3.6 Flash signifikan karena Google memasarkan model ini seputar variabel operasional tersebut, bukan hanya skor benchmark utama. Jika sebuah model mengurangi token keluaran sebesar 17%, menghindari loop edit yang tidak perlu, dan menghasilkan kode lebih benar pada percobaan pertama, penghematan nyata dapat lebih besar daripada yang disarankan tabel harga.
Performa Benchmark dan Perbandingan
Evaluasi Google dan pihak ketiga menyoroti peningkatan seimbang 3.6 Flash. Model ini tidak menduduki puncak setiap leaderboard frontier tetapi unggul dalam kinerja yang disesuaikan efisiensi untuk penggunaan praktis.
Benchmark Terpilih (Gemini 3.6 Flash vs. 3.5 Flash):
- DeepSWE (Datacurve – rekayasa perangkat lunak multi-langkah): 49% vs. 37% (peningkatan presisi signifikan, loop/edit lebih sedikit); penggunaan token berkurang hingga 65% dalam beberapa kasus (misalnya, 276k ke 97k token).
- MLE-Bench (Riset ML): 63.9% vs. 49.7%
- OSWorld-Verified (Penggunaan Komputer): 83.0% vs. 78.4% (penggunaan komputer bawaan kini standar)
- GDPval-AA v2 (Kerja Pengetahuan): 1421 vs. 1349
- Artificial Analysis Intelligence Index: Sekitar 50 (solid, meski di belakang beberapa pemimpin seperti varian Claude di ~60); menonjol dalam efisiensi token.
- Lainnya: Peningkatan pada Terminal-Bench, konteks panjang (misalnya GDM-MRCR v2), SWE-Bench Pro, dan tugas multimodal seperti parsing dokumen dan analisis grafik.
Tabel Perbandingan: Gemini 3.6 Flash vs. Pesaing Kunci (Perkiraan, berdasarkan data Juli 2026)
| Fitur/Model | Gemini 3.6 Flash | Gemini 3.5 Flash | GPT-5.6 Luna (perkiraan) | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|---|
| Efisiensi Token Keluaran | Sangat baik (17% lebih baik) | Baik | Tinggi | Kuat | Baik |
| Pengodean (DeepSWE) | 49% | 37% | 67% | 54% | 54% |
| Penggunaan Komputer (OSWorld) | 83% | 78.4% | 72.6% | - | 81.2% |
| Kerja Pengetahuan (Elo) | 1421 | 1349 | 1584 | 1535 | 1607 |
| Harga Keluaran ($/1M) | $7.50 | $9.00 | $6.00 | $6.00 | $10-15 |
| Terbaik Untuk | Agen efisien | Agen umum | Kecerdasan tinggi | Penalaran | Kreatif |
Catatan Tambahan:
- SWE-Bench Pro: 58.7% (vs. 55.1% untuk 3.5 Flash).
- Terminal-Bench 2.1: 78.0% (vs. 76.2%).
- Model ini unggul dalam skenario agenik dan multimodal sambil mempertahankan kecepatan tingkat Flash.
Uji independen (misalnya Artificial Analysis, diskusi Reddit) mencatat kecepatan dan efisiensi yang kuat, meski mungkin mengonsumsi lebih banyak token daripada beberapa pesaing yang sangat dioptimalkan pada kondisi tertentu. Umpan balik dunia nyata memuji model ini untuk analisis dokumen, penyusunan laporan, dan tugas multimodal (misalnya dari pelanggan seperti Hebbia dan Harvey).

Apa yang Baru dibanding Gemini 3.5 Flash?
1. Efisiensi Token Lebih Baik
Gemini 3.6 Flash dirancang untuk menggunakan lebih sedikit token keluaran daripada Gemini 3.5 Flash. Google mengutip pengurangan token keluaran 17% pada Artificial Analysis Index dan hingga 65% pada beberapa beban kerja pengodean DeepSWE.
Ini penting karena token keluaran biasanya lebih mahal daripada token input. Dalam harga resmi Gemini API Standard, input Gemini 3.6 Flash tetap $1.50/M, tetapi keluaran turun menjadi $7.50/M. Keluaran Gemini 3.5 Flash adalah $9.00/M. Ketika harga keluaran yang lebih rendah dan token keluaran yang lebih sedikit digabungkan, biaya per tugas agen yang selesai dapat turun secara berarti.
2. Pengodean Lebih Kuat dan Edit yang Tidak Diinginkan Lebih Sedikit
Dokumentasi Google Cloud Gemini Enterprise Agent Platform menyatakan Gemini 3.6 Flash meningkatkan generasi kode dengan tingkat kegagalan kompilasi dan revisi yang lebih rendah di lingkungan pembangunan, prototyping, dan agen IDE. Model ini juga mengurangi "bias tindakan," artinya lebih baik menangani tugas diagnostik hanya-baca tanpa melakukan edit yang tidak diminta.
- Peningkatan Alur Kerja: Langkah penalaran lebih sedikit, giliran percakapan lebih sedikit, pemanggilan alat lebih sedikit, dan pengurangan spiral loop eksekusi. Model ini lebih memilih skrip diagnostik awal sebelum edit, meningkatkan akurasi.
- Generasi Kode: Kode berkualitas lebih tinggi, siap produksi dengan edit yang tidak diinginkan dan loop debug yang lebih sedikit.
- Penggunaan Komputer: Meningkat dari 78.4% menjadi 83.0% pada OSWorld-Verified; dukungan alat sisi klien native.
3. Peningkatan Kualitas dan Kecepatan
Peningkatan Agenik: Langkah penalaran/pemanggilan alat lebih sedikit; penggunaan komputer bawaan; dukungan lebih kuat untuk orkestrasi multi-agen dan alur kerja iteratif.
Kecepatan & Keandalan: Latensi dioptimalkan untuk produksi volume tinggi; terintegrasi dengan alat seperti Google Slides untuk menghasilkan presentasi yang dapat diedit dari dokumen/PDF.
Keamanan: Perlindungan yang ditingkatkan terhadap C
4. Harga Keluaran Lebih Rendah
Google menurunkan harga keluaran Standard resmi dari $9.00/M pada Gemini 3.5 Flash menjadi $7.50/M pada Gemini 3.6 Flash. Harga input tetap $1.50/M.
Ini adalah peningkatan harga langsung bahkan sebelum memperhitungkan keuntungan efisiensi token.
5. Perubahan Migrasi dan Parameter
Beberapa perilaku dapat berbeda dari model Gemini sebelumnya. Halaman Agent Platform Google Cloud mencantumkan perubahan yang berpotensi mematahkan: nilai khusus untuk parameter seperti temperature, top-K, dan top-P tidak didukung pada permukaan tersebut, nilai khusus untuk frequency dan presence penalty dapat menyebabkan error, dan permintaan yang diakhiri dengan peran model tidak didukung di API tertentu.
Pelajaran migrasi sederhana: jangan hanya mengubah string model. Tinjau permukaan API yang Anda gunakan, hapus parameter generasi yang tidak didukung, uji ulang penanganan state multi-giliran, dan periksa perilaku pemanggilan alat.
Bisakah Gemini 3.6 Flash Menggantikan Gemini 3.5 Flash?
Ya, untuk mayoritas skenario produksi. Google secara efektif memposisikan 3.6 Flash sebagai pekerja default baru, dengan 3.5 Flash kemungkinan ter-deprecate atau menjadi legacy di banyak antarmuka.
Alasan untuk Beralih:
- Penghematan Biaya: Biaya per tugas lebih rendah karena harga + efisiensi.
- Keluaran Lebih Baik: Metrik kualitas meningkat di pengodean, agen, dan tugas pengetahuan.
- Siap Masa Depan: Fitur baru seperti penggunaan komputer yang ditingkatkan dan integrasi.
Kapan Tetap pada 3.5 atau Pertimbangkan Alternatif:
- Tugas volume tinggi yang sangat sensitif terhadap latensi (pertimbangkan model pendamping 3.5 Flash-Lite dengan biaya/kecepatan yang lebih rendah).
- Kebutuhan kecerdasan mentah maksimum (tunggu 3.5 Pro atau gunakan model yang lebih besar).
- Kompatibilitas legacy spesifik.
Untuk sebagian besar pengembang yang membangun agen, aplikasi, atau otomasi di Cometapi, migrasi ke 3.6 Flash melalui proxy adalah langsung dan direkomendasikan untuk ROI segera.
Cara Mengakses Gemini 3.6 Flash
- Google AI Studio / Gemini API: Dapatkan kunci API gratis di aistudio.google.com. Gunakan model
gemini-3.6-flash. Mulai cepat dengan SDK resmi (Python, JS, dll.). - Vertex AI / Google Cloud: Kelas enterprise dengan kuota lebih tinggi, grounding, dan keamanan.
- Aplikasi Gemini & Integrasi: Tersedia di Android Studio, GitHub Copilot (dengan toggle), Google Slides, dll.
- Melalui Cometapi (Disarankan untuk Kemudahan): Cometapi menyediakan proxy seragam yang kompatibel dengan OpenAI untuk Gemini 3.6 Flash dan model lainnya. Keuntungan meliputi batas laju lebih tinggi, autentikasi sederhana, perpindahan multi-penyedia, dan pengurangan overhead manajemen. Ideal untuk menskalakan aplikasi tanpa terkena batas penyedia individual. Kunjungi Cometapi.com untuk panduan penyiapan dan harga yang melengkapi tier Google.
Contoh Panggilan Python (Resmi atau melalui Proxy):
import google.generativeai as genai
genai.configure(api_key="YOUR_KEY")
model = genai.GenerativeModel('gemini-3.6-flash')
response = model.generate_content("Prompt Anda di sini")
Uji di AI Studio terlebih dahulu, lalu integrasikan. Caching dan API batch semakin mengoptimalkan biaya.
Kesimpulan & Rekomendasi
Gemini 3.6 Flash adalah peningkatan pragmatis bernilai tinggi yang menyempurnakan lini Flash Google untuk tuntutan dunia nyata. Kombinasi kecerdasan, efisiensi, dan aksesibilitasnya menjadikannya pilihan utama untuk pengembangan AI tahun 2026.
CometAPI Rekomendasi: Integrasikan melalui Cometapi untuk pengalaman paling mulus—API seragam, kuota lebih baik, dan A/B testing mudah lintas model. Baik Anda membangun agen, memproses dokumen, atau menggerakkan aplikasi, mulai bereksperimen dengan 3.6 Flash hari ini untuk memangkas biaya dan meningkatkan performa.
FAQ
Apa itu Gemini 3.6 Flash?
Gemini 3.6 Flash adalah model Flash stabil Google per Juli 2026 untuk pengodean, kerja pengetahuan, penalaran multimodal, dan alur kerja agen. Model ini berbasis Gemini 3.5 Flash namun meningkatkan efisiensi token, perilaku pengodean, performa penggunaan komputer, dan benchmark kerja pengetahuan.
Berapa biaya Gemini 3.6 Flash?
Harga resmi Gemini API Standard berbayar Google adalah $1.50 per juta token input dan $7.50 per juta token keluaran. Batch dan Flex adalah $0.75/M input dan $3.75/M keluaran. Prioritas adalah $2.70/M input dan $13.50/M keluaran. Halaman model CometAPI mencantumkan $1.20/M input dan $6.00/M keluaran saat diperiksa.
Apakah Gemini 3.6 Flash lebih murah daripada Gemini 3.5 Flash?
Ya untuk token keluaran. Kedua model mencantumkan $1.50/M token input pada tier Standard berbayar Google, tetapi keluaran Gemini 3.6 Flash adalah $7.50/M dibanding $9.00/M untuk Gemini 3.5 Flash. Google juga melaporkan token keluaran lebih sedikit pada banyak tugas, yang dapat semakin mengurangi total biaya.
Bisakah Gemini 3.6 Flash menggantikan Gemini 3.5 Flash?
Untuk banyak beban kerja, ya. Ini adalah kandidat default yang lebih baik untuk agen pengodean, analisis multimodal, dan alur kerja alat yang kompleks. Namun, pengguna produksi harus melakukan benchmark sebelum mengganti 3.5 Flash, terutama jika bergantung pada gaya keluaran yang stabil, format JSON yang tepat, atau parameter generasi legacy.
Apa peningkatan benchmark utama?
Google melaporkan Gemini 3.6 Flash mengungguli Gemini 3.5 Flash pada DeepSWE (49% vs 37%), MLE Bench (63.9% vs 49.7%), OSWorld-Verified (83.0% vs 78.4%), dan GDPval-AA v2 (1421 vs 1349). Google juga melaporkan 17% lebih sedikit token keluaran pada Artificial Analysis Index.
Bagaimana cara mengakses Gemini 3.6 Flash melalui CometAPI?
Buat kunci CometAPI, gunakan https://api.cometapi.com/v1 untuk panggilan yang kompatibel dengan OpenAI, dan setel model ke gemini-3.6-flash jika tersedia di dasbor Anda. Untuk fitur native Gemini, gunakan rute penyedia-native yang didokumentasikan di halaman model Gemini 3.6 Flash CometAPI.
