TL;DR
Gemini 3.6 Flash berbiaya $1.50/M input dan $7.50/M output, dengan harga output lebih rendah serta kinerja pengodean dan agen yang dilaporkan lebih baik dibanding Gemini 3.5 Flash. Untuk produksi, gunakan 3.6 Flash pada penalaran kompleks dan agen, sementara alihkan beban kerja sederhana ber-volume tinggi ke Gemini 3.5 Flash-Lite yang lebih murah.
Gemini 3.6 Flash lebih dari sekadar pembaruan ID model.
Bagi developer yang sudah memakai Gemini 3.5 Flash, perubahan yang lebih besar adalah sisi ekonomi. Google mempertahankan harga input di $1.50 per juta token, menurunkan harga output dari $9.00 menjadi $7.50, dan melaporkan kinerja yang lebih baik pada sejumlah tolok ukur pengodean dan agen.
Pertanyaan praktisnya adalah apakah perbaikan itu cukup besar untuk membenarkan pemindahan beban produksi.
Jawabannya bergantung pada beban kerja. Agen pengodean, analisis multimodal, dan penggunaan alat multi-langkah mungkin mendapat manfaat lebih besar dibanding ekstraksi atau klasifikasi sederhana. Migrasi juga memerlukan beberapa pemeriksaan kompatibilitas API yang mudah terlewat jika Anda hanya mengganti nama model.
Panduan ini mencakup harga API Gemini 3.6 Flash, akses tingkat gratis, hasil benchmark, perubahan migrasi, contoh Python, serta apa yang perlu diuji sebelum mengalihkan trafik produksi.
Apa itu Gemini 3.6 Flash?
Gemini 3.6 Flash adalah model Flash terbaru Google untuk pengodean, penalaran multimodal, dan alur kerja agen multi-langkah. Dirilis pada 21 Juli 2026, model ini dirancang untuk beban produksi yang membutuhkan penalaran dan kinerja agen yang lebih kuat sambil tetap berada dalam tier model Flash Google.
Spesifikasi utamanya mencakup:
| Item | Gemini 3.6 Flash |
|---|---|
| Model ID | gemini-3.6-flash |
| Standard input price | $1.50 / 1M tokens |
| Standard output price | $7.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens |
| Default thinking level | medium |
| Input context | 1,048,576 tokens |
| Maximum output | 65,536 tokens |
| Inputs | Teks, gambar, video, audio, PDF |
| Output | Teks |
| Best suited for | Pengodean, penalaran multimodal, agen kompleks |
Google memposisikan Gemini 3.6 Flash untuk beban kerja seperti pengodean, penalaran spasial dan multimodal, serta tugas agen multi-langkah.
Model ini juga mendukung fitur termasuk function calling, structured outputs, code execution, context caching, File Search, konteks URL, Google Search grounding, dan Google Maps grounding.
Anda dapat meninjau spesifikasi terbaru dan panduan migrasi di panduan model Gemini terbaru Google.
Bagi developer yang datang dari generasi sebelumnya, panduan API Gemini 3.5 Flash CometAPI menyediakan baseline integrasi yang berguna.
Berapa Biaya API Gemini 3.6 Flash?
Gemini 3.6 Flash berbiaya $1.50 per juta token input dan $7.50 per juta token output pada tier Berbayar Standar Google.
Dibandingkan dengan Gemini 3.5 Flash, harga input tetap, sementara harga output turun dari $9.00 ke $7.50 per juta token—penurunan 16.7%.
Google juga menawarkan pemrosesan Batch, Flex, dan Priority.
| Tier Gemini 3.6 Flash | Input / 1M | Input cache / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Penting:** Token thinking ditagihkan dengan tarif token output. Respons yang terlihat singkat karenanya dapat mengonsumsi lebih banyak token output yang ditagihkan daripada yang disiratkan oleh panjang jawaban akhir.
Cache konteks juga dapat membuat perbedaan berarti untuk aplikasi yang berulang kali mengirim sistem prompt besar yang sama, konteks repositori, kumpulan dokumen, atau riwayat percakapan.
Pada tier Berbayar Standar, input cache Gemini 3.6 Flash berbiaya $0.15 per juta token, dibanding $1.50 untuk input normal.
Contoh: 15,000 Input Tokens + 8,000 Output Tokens
Pertimbangkan sebuah tugas yang menggunakan 15,000 token input dan 8,000 token output.
| Model | Perkiraan Biaya |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash pada volume token yang sama | $0.0825 |
| Gemini 3.6 Flash dengan 17% token output lebih sedikit | $0.0723 |
| Gemini 3.5 Flash-Lite pada volume token yang sama | $0.0245 |
Pada penggunaan token yang identik, Gemini 3.6 Flash sekitar 12.7% lebih murah daripada Gemini 3.5 Flash dalam contoh ini.
Google juga melaporkan bahwa Gemini 3.6 Flash menggunakan 17% token output lebih sedikit pada Artificial Analysis Index. Jika beban produksi mereplikasi pengurangan itu, penghematan yang dimodelkan dalam contoh ini akan meningkat menjadi sekitar 23.5%.
Google secara terpisah melaporkan pengurangan token output hingga 65% pada DeepSWE. Angka-angka ini mengukur beban kerja berbeda dan tidak boleh dipertukarkan: 17% merujuk pada Artificial Analysis Index, sementara 65% berasal dari tolok ukur pengodean spesifik.
Perhitungan biaya token dasar adalah:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Untuk agen, biaya sesungguhnya lebih luas:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Inilah sebabnya model termurah per token tidak selalu menjadi model termurah untuk menyelesaikan suatu tugas.
Apakah Gemini 3.6 Flash Gratis?
Ya. Harga Gemini Developer API saat ini dari Google mencantumkan akses Tier Gratis untuk penggunaan Standard Gemini 3.6 Flash.
Ketersediaan Tier Gratis tidak berarti kapasitas produksi tanpa batas. Batas API bergantung pada proyek dan tier penggunaan, jadi developer harus memeriksa batas laju yang diterapkan pada proyek mereka sendiri alih-alih mengandalkan angka permintaan-per-menit tetap dari artikel pihak ketiga.
Untuk perencanaan produksi, gunakan harga Gemini API dan dokumentasi rate-limit Google saat ini ketika memperkirakan kapasitas.
Developer dapat mengakses Gemini 3.6 Flash melalui Gemini API dan Google AI Studio. Tim yang menggunakan alur kerja multi-model terpadu juga dapat menguji model ini melalui halaman model Gemini 3.6 Flash CometAPI.
Bagaimana Perbandingan Gemini 3.6 Flash dengan Gemini 3.5 Flash?
Hasil yang dipublikasikan Google menunjukkan peningkatan terbesar pada pengodean, eksekusi agen, penggunaan komputer, dan pekerjaan pengetahuan.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Perubahan |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 poin |
| MLE-Bench | 63.90% | 49.70% | +14.2 poin |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 poin |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google juga mengatakan Gemini 3.6 Flash menyelesaikan alur kerja multi-langkah dengan lebih sedikit langkah penalaran, giliran percakapan, dan panggilan alat dibanding Gemini 3.5 Flash.
Perusahaan melaporkan:
- 17% token output lebih sedikit pada Artificial Analysis Index.
- Hingga 65% token output lebih sedikit pada DeepSWE.
- Lebih sedikit suntingan kode yang tidak diinginkan dan loop eksekusi.
- Peningkatan penalaran multimodal dan spasial.
Hasil asli tersedia di pengumuman peluncuran Gemini 3.6 Flash Google.
Benchmark ini menjadikan 3.6 Flash kandidat kuat untuk evaluasi, terutama untuk beban kerja di mana satu permintaan dapat berubah menjadi beberapa putaran penalaran, panggilan alat, dan koreksi.
Namun, itu tidak boleh menggantikan pengujian pada aplikasi Anda sendiri.
Google juga mencatat bahwa 3.6 Flash mungkin melakukan inspeksi programatik di awal sebelum membuat perubahan kode. Pada repositori besar, itu dapat meningkatkan akurasi. Pada suntingan frontend yang ruang lingkupnya sempit, hal itu mungkin hanya menambah eksplorasi yang tidak perlu.
Batasan file yang jelas, kriteria penerimaan, dan instruksi implementasi tetap penting.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Mana yang Harus Anda Gunakan?
Setelah Anda memutuskan bahwa Gemini 3.6 Flash layak diuji, pertanyaan berikutnya adalah apakah setiap permintaan benar-benar membutuhkannya.
Untuk banyak sistem produksi, jawabannya adalah tidak.
Gemini 3.5 Flash-Lite jauh lebih murah dan bisa menjadi default yang lebih baik untuk beban kerja yang dapat diprediksi dan ber-volume tinggi.
| Item | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Standard input price | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Standard output price | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Standard cached input | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Default thinking level | medium | minimal |
| Best suited for | Penalaran kompleks, pengodean, agen | Ekstraksi, perutean, klasifikasi |
Pada harga Standar, Flash-Lite 5× lebih murah pada input dan 3× lebih murah pada output dibanding Gemini 3.6 Flash.
Mulai dengan Gemini 3.5 Flash-Lite untuk:
- Klasifikasi
- Perutean permintaan
- Ekstraksi JSON dan terstruktur
- Pemrosesan dokumen
- Transformasi data
- Penerjemahan skala besar
- Sub-agen ringan
- Tugas berulang ber-volume tinggi
Strategi perutean praktis dapat terlihat seperti ini:
| Beban kerja | Rute awal | Eskalasi |
|---|---|---|
| Klasifikasi atau perutean | Gemini 3.5 Flash-Lite | 3.6 Flash setelah kegagalan validasi |
| Ekstraksi terstruktur | Gemini 3.5 Flash-Lite | 3.6 Flash untuk dokumen kompleks |
| Sub-agen ringan | Gemini 3.5 Flash-Lite | Naikkan tingkat thinking atau gunakan 3.6 Flash |
| Pengodean multi-file | Gemini 3.6 Flash | Fallback yang lebih kuat jika belum terselesaikan |
| Alur alat yang kompleks | Gemini 3.6 Flash | Fallback setelah kegagalan alat atau validasi |
| Penalaran multimodal | Gemini 3.6 Flash | Fallback khusus tugas |
Untuk trafik produksi campuran, metrik yang lebih berguna adalah:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Panggilan pertama yang murah menjadi kurang menarik jika sering gagal dan akhirnya memerlukan model yang lebih kuat juga.
Sebaliknya juga penting. Hampir tidak ada alasan untuk mengirim jutaan permintaan klasifikasi yang dapat diprediksi ke Gemini 3.6 Flash jika Flash-Lite sudah memenuhi akurasi yang diperlukan.
Untuk aplikasi yang membutuhkan perutean semacam ini, lihat panduan kami tentang memanggil beberapa model AI melalui base URL yang kompatibel dengan OpenAI.
Perubahan Apa Saat Migrasi ke Gemini 3.6 Flash?
Beralih dari Gemini 3.5 Flash ke Gemini 3.6 Flash melibatkan lebih dari sekadar mengganti ID model.
Developer harus meninjau lima area sebelum mengalihkan trafik produksi: parameter sampling yang usang, kontrol thinking, candidate_count, prefilled model turns, dan state pemanggilan fungsi.
1. Hapus temperature, top_p, dan top_k
Google telah menonaktifkan kontrol sampling ini untuk Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Model-model baru saat ini mengabaikan parameter ini. Google mengatakan generasi model Gemini mendatang mungkin mengembalikan error HTTP 400 ketika parameter tersebut disuplai.
Untuk format output yang dapat diprediksi, gunakan instruksi sistem yang lebih jelas dan structured outputs sebagai gantinya.
2. Ganti thinking_budget dengan thinking_level
Gemini 3.6 Flash menggunakan default medium thinking.
Panduan migrasi Google merekomendasikan beralih dari konfigurasi numerik thinking_budget ke thinking_level.
Gemini 3.5 Flash-Lite menggunakan default minimal, yang sesuai untuk banyak beban ekstraksi, klasifikasi, dan perutean ber-volume tinggi.
Tingkat thinking yang lebih tinggi harus diuji ketika tugas melibatkan penalaran multi-langkah, eksekusi kode, atau penggunaan alat.
3. Hapus candidate_count
Google mencantumkan candidate_count sebagai tidak didukung di Gemini 3.x.
Ini mudah terlewat saat beberapa model berbagi konfigurasi generasi yang sama. Hapus sebelum memigrasikan permintaan produksi.
4. Hentikan pra-mengisi giliran model
Permintaan tidak lagi boleh diakhiri dengan giliran model yang tidak kosong.
Aplikasi lama mungkin menggunakan payload seperti:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Pola itu kini dapat mengembalikan HTTP 400.
Jika sebelumnya Anda menggunakan prefilling untuk memaksa format jawaban, pindahkan persyaratan itu ke system_instruction atau gunakan structured outputs sebagai gantinya.
5. Uji ulang pemanggilan fungsi dan state multi-giliran
Agen yang menggunakan alat membutuhkan pengujian migrasi terpisah.
Google merekomendasikan menggunakan previous_interaction_id untuk state multi-giliran di sisi server dalam Interactions API.
Saat mengembalikan hasil fungsi, pertahankan nama fungsi dan ID panggilan asli:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Aplikasi yang menggunakan generateContent juga harus memverifikasi payload FunctionResponse mereka dan memantau error panggilan alat setelah migrasi.
Lihat panduan migrasi model terbaru dan dokumentasi function-calling Google untuk detail implementasi saat ini.
Bagaimana Memanggil Gemini 3.6 Flash di Python?
Instal atau perbarui SDK GenAI Google:
pip install -U google-genai
Setel kunci API Anda:
export GEMINI_API_KEY="your-api-key"
Lalu panggil Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Untuk tugas yang membutuhkan lebih banyak penalaran, konfigurasikan tingkat thinking:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Perbedaan utama migrasi dapat diringkas sebagai:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Jangan berasumsi tingkat thinking yang lebih tinggi selalu lebih baik. Ukur latensi, konsumsi token, dan tingkat penyelesaian pada tugas Anda sendiri.
Bagaimana Anda Harus Menguji Gemini 3.6 Flash Sebelum Produksi?
Anda tidak memerlukan suite benchmark publik besar untuk memutuskan apakah Gemini 3.6 Flash layak berada di stack produksi Anda.
Titik awal yang lebih baik adalah 30–50 tugas terbaru yang menyerupai trafik aktual Anda.
Sertakan campuran:
- Pengodean dan debugging
- Penggunaan alat multi-langkah
- Dokumen multimodal
- Ekstraksi data
- Klasifikasi dan perutean
Jalankan input yang sama melalui:
- Model produksi Anda saat ini
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Biarkan prompt, alat, validator, dan kriteria penerimaan tidak berubah.
Lacak:
- Token input
- Token output dan thinking
- Latensi
- Panggilan alat
- Retry
- Error panggilan fungsi
- Tingkat lolos validator
- Waktu koreksi manusia
- Keberhasilan tugas akhir
Lalu bandingkan total biaya yang diperlukan untuk menghasilkan hasil yang diterima.
Permintaan pengodean yang berbiaya $0.08 dan berhasil pada percobaan pertama mungkin lebih murah daripada permintaan $0.02 yang gagal dua kali dan akhirnya ditingkatkan.
Pada saat yang sama, membayar harga Gemini 3.6 Flash untuk tugas klasifikasi sederhana tidak masuk akal jika Flash-Lite menanganinya secara andal.
Tujuannya bukan menemukan satu model untuk setiap permintaan. Tujuannya adalah menggunakan model yang lebih kuat hanya di tempat kemampuannya benar-benar mengubah hasil.
Developer dapat membandingkan rute Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite saat ini melalui CometAPI menggunakan set evaluasi yang sama.
FAQ
Berapa biaya API Gemini 3.6 Flash?
Tarif Berbayar Standar Google adalah $1.50 per juta token input dan $7.50 per juta token output. Input cache Standar berharga $0.15/M. Batch dan Flex berharga $0.75/M input dan $3.75/M output.
Apakah Gemini 3.6 Flash gratis?
Ya. Harga Gemini Developer API saat ini mencantumkan penggunaan Standar Tier Gratis untuk Gemini 3.6 Flash. Akses gratis tetap tunduk pada batas laju proyek dan tier penggunaan.
Apakah Gemini 3.6 Flash tersedia secara umum?
Ya. Google merilis gemini-3.6-flash pada 21 Juli 2026 dan mencantumkannya sebagai model produksi dalam dokumentasi Gemini API.
Berapa jendela konteks Gemini 3.6 Flash?
Gemini 3.6 Flash mendukung hingga 1,048,576 token input dan 65,536 token output. Model ini menerima input teks, gambar, video, audio, dan PDF, serta menghasilkan output teks.
Apakah Gemini 3.6 Flash lebih murah daripada Gemini 3.5 Flash?
Ya untuk token output. Kedua model berharga $1.50/M token input standar, sementara Gemini 3.6 Flash menurunkan harga output dari $9.00/M menjadi $7.50/M.
Haruskah saya menggunakan Gemini 3.6 Flash atau Gemini 3.5 Flash-Lite?
Gunakan Gemini 3.6 Flash ketika kualitas pengodean, penalaran multimodal, atau eksekusi agen yang kompleks dapat mengurangi kegagalan dan retry. Mulailah dengan Flash-Lite untuk ekstraksi, klasifikasi, perutean, dan beban kerja lain yang dapat diprediksi di mana biaya lebih rendah lebih penting.
Apa yang perlu saya ubah sebelum migrasi ke Gemini 3.6 Flash?
Hapus temperature, top_p, top_k, dan candidate_count; ganti thinking_budget dengan thinking_level; hapus giliran model yang dipra-isi; dan uji ulang pemanggilan fungsi serta manajemen state multi-giliran.
Kesimpulan
Gemini 3.6 Flash layak dibenchmark jika Anda sudah menggunakan Gemini 3.5 Flash untuk pengodean, pekerjaan multimodal, atau alur kerja agen.
Harga outputnya lebih rendah, dan hasil awal dari Google menunjukkan bahwa beberapa beban kerja juga mungkin membutuhkan lebih sedikit token dan langkah eksekusi. Untuk agen yang berulang kali bernalar, memanggil alat, dan mengulang aksi yang gagal, penghematan tersebut bisa lebih penting daripada perbedaan harga utama.
Namun bukan berarti setiap permintaan harus beralih ke 3.6 Flash.
Gemini 3.5 Flash-Lite jauh lebih murah dan mungkin sudah cukup untuk pekerjaan yang dapat diprediksi seperti ekstraksi, klasifikasi, dan perutean.
Strategi produksi yang lebih baik adalah menggunakan setiap model di tempat yang masuk akal secara ekonomis: Flash-Lite untuk tugas sederhana ber-volume tinggi; 3.6 Flash di tempat penalaran yang lebih kuat dapat meningkatkan peluang selesai dengan benar pada percobaan pertama.
Lalu ukur hasil yang benar-benar penting—total biaya untuk mendapatkan jawaban yang diterima.
Untuk membandingkan kedua model melalui alur kerja yang sama, lihat halaman model Gemini 3.6 Flash dan halaman model Gemini 3.5 Flash-Lite di CometAPI, atau tinjau rute model saat ini di halaman harga CometAPI.
