TL;DR
Gemini 3.6 Flash berharga $1.50/M input dan $7.50/M output, dengan harga output yang lebih rendah serta prestasi pengkodan dan agen yang dilaporkan lebih baik berbanding Gemini 3.5 Flash. Untuk produksi, gunakan 3.6 Flash bagi penaakulan kompleks dan agen, manakala halakan beban kerja volum tinggi yang lebih ringkas kepada Gemini 3.5 Flash-Lite yang lebih murah.
Gemini 3.6 Flash lebih daripada sekadar kemas kini ID model.
Bagi pembangun yang sudah menggunakan Gemini 3.5 Flash, perubahan yang lebih besar ialah ekonomi. Google mengekalkan harga input pada $1.50 per juta token, menurunkan harga output daripada $9.00 kepada $7.50, dan melaporkan prestasi yang lebih baik pada beberapa penanda aras pengkodan dan agen.
Persoalan praktikalnya ialah sama ada peningkatan tersebut cukup besar untuk membenarkan pemindahan beban kerja produksi.
Jawapan itu bergantung pada beban kerja. Agen pengkodan, analisis multimodal, dan penggunaan alat berbilang langkah mungkin mendapat lebih banyak manfaat berbanding pengekstrakan atau pengelasan ringkas. Migrasi juga memerlukan beberapa semakan keserasian API yang mudah terlepas jika anda hanya menukar nama model.
Panduan ini merangkumi harga API Gemini 3.6 Flash, akses peringkat percuma, keputusan penanda aras, perubahan migrasi, contoh Python, dan perkara yang perlu diuji sebelum menukar trafik produksi.
Apakah itu Gemini 3.6 Flash?
Gemini 3.6 Flash ialah model Flash terbaharu Google untuk pengkodan, penaakulan multimodal, dan aliran kerja agen berbilang langkah. Dilancarkan pada 21 Julai 2026, ia direka untuk beban kerja produksi yang memerlukan penaakulan lebih kukuh dan prestasi agen yang lebih baik sambil kekal dalam peringkat model Flash Google.
Spesifikasi utamanya termasuk:
| Perkara | Gemini 3.6 Flash |
|---|---|
| ID Model | gemini-3.6-flash |
| Harga input Standard | $1.50 / 1M token |
| Harga output Standard | $7.50 / 1M token |
| Input cache Standard | $0.15 / 1M token |
| Tahap pemikiran lalai | medium |
| Konteks input | 1,048,576 token |
| Output maksimum | 65,536 token |
| Input | Teks, imej, video, audio, PDF |
| Output | Teks |
| Paling sesuai untuk | Pengkodan, penaakulan multimodal, agen kompleks |
Google memposisikan Gemini 3.6 Flash untuk beban kerja seperti pengkodan, penaakulan ruang dan multimodal, serta tugas agen berbilang langkah.
Model ini juga menyokong ciri termasuk panggilan fungsi, output berstruktur, pelaksanaan kod, cache konteks, File Search, konteks URL, Google Search grounding, dan Google Maps grounding.
Anda boleh menyemak spesifikasi dan panduan migrasi terkini dalam panduan model Gemini terkini Google.
Bagi pembangun yang datang daripada generasi sebelumnya, panduan API Gemini 3.5 Flash CometAPI menyediakan garis dasar integrasi yang berguna.
Berapakah Kos API Gemini 3.6 Flash?
Gemini 3.6 Flash berharga $1.50 per juta token input dan $7.50 per juta token output pada peringkat berbayar Standard Google.
Berbanding Gemini 3.5 Flash, harga input kekal tidak berubah, manakala harga output turun daripada $9.00 kepada $7.50 per juta token - pengurangan 16.7%.
Google juga menawarkan pemprosesan Batch, Flex, dan Priority.
| Tahap Gemini 3.6 Flash | Input / 1M | Input cache / 1M | Output / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Penting:** Token pemikiran dibilkan pada kadar token output. Respons kelihatan yang pendek oleh itu boleh menggunakan lebih banyak token output yang dibilkan daripada yang disarankan oleh panjang jawapan akhir.
Cache konteks juga boleh memberikan perbezaan bermakna untuk aplikasi yang berulang kali menghantar gesaan sistem yang besar, konteks repositori, set dokumen, atau sejarah perbualan yang sama.
Pada peringkat berbayar Standard, input cache Gemini 3.6 Flash berharga $0.15 per juta token, berbanding $1.50 untuk input biasa.
Contoh: 15,000 Token Input + 8,000 Token Output
Pertimbangkan tugas yang menggunakan 15,000 token input dan 8,000 token output.
| Model | Anggaran Kos |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash pada volum token yang sama | $0.0825 |
| Gemini 3.6 Flash dengan 17% token output lebih sedikit | $0.0723 |
| Gemini 3.5 Flash-Lite pada volum token yang sama | $0.0245 |
Pada penggunaan token yang sama, Gemini 3.6 Flash adalah kira-kira 12.7% lebih murah daripada Gemini 3.5 Flash dalam contoh ini.
Google juga melaporkan bahawa Gemini 3.6 Flash menggunakan 17% lebih sedikit token output pada Artificial Analysis Index. Jika beban kerja produksi menghasilkan pengurangan tersebut, penjimatan termodel dalam contoh ini akan meningkat kira-kira kepada 23.5%.
Google secara berasingan melaporkan pengurangan token output sehingga 65% pada DeepSWE. Angka-angka ini mengukur beban kerja yang berbeza dan tidak boleh dianggap boleh ditukar ganti: 17% merujuk kepada Artificial Analysis Index, manakala 65% datang daripada penanda aras pengkodan tertentu.
Pengiraan kos token asas adalah:
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Bagi agen, kos sebenar adalah lebih luas:
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
Inilah sebabnya model termurah per token tidak semestinya model termurah untuk menyiapkan sesuatu tugas.
Adakah Gemini 3.6 Flash Percuma?
Ya. Harga semasa Gemini Developer API Google menyenaraikan akses Peringkat Percuma untuk penggunaan Standard Gemini 3.6 Flash.
Ketersediaan peringkat percuma tidak bermakna kapasiti produksi tanpa had. Had API bergantung pada projek dan peringkat penggunaan, jadi pembangun harus menyemak had kadar yang digunakan pada projek mereka sendiri dan bukannya bergantung pada angka permintaan per minit tetap daripada artikel pihak ketiga.
Untuk perancangan produksi, gunakan harga Gemini API semasa Google dan dokumentasi had kadar apabila menganggar kapasiti.
Pembangun boleh mengakses Gemini 3.6 Flash melalui Gemini API dan Google AI Studio. Pasukan yang menggunakan aliran kerja berbilang model bersepadu juga boleh menguji model ini melalui halaman model Gemini 3.6 Flash di CometAPI.
Bagaimanakah Gemini 3.6 Flash Berbanding Dengan Gemini 3.5 Flash?
Keputusan yang diterbitkan Google menunjukkan peningkatan terbesar dalam pengkodan, pelaksanaan agen, penggunaan komputer, dan kerja pengetahuan.
| Penanda aras | Gemini 3.6 Flash | Gemini 3.5 Flash | Perubahan |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 mata |
| MLE-Bench | 63.90% | 49.70% | +14.2 mata |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 mata |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google juga mengatakan Gemini 3.6 Flash menyiapkan aliran kerja berbilang langkah dengan lebih sedikit langkah penaakulan, giliran perbualan, dan panggilan alat berbanding Gemini 3.5 Flash.
Syarikat itu melaporkan:
- 17% token output lebih sedikit pada Artificial Analysis Index.
- Sehingga 65% token output lebih sedikit pada DeepSWE.
- Lebih sedikit suntingan kod yang tidak diingini dan gelung pelaksanaan.
- Peningkatan penaakulan multimodal dan spatial.
Keputusan asal tersedia dalam pengumuman pelancaran Gemini 3.6 Flash Google.
Penanda aras ini menjadikan 3.6 Flash calon yang kukuh untuk penilaian, terutamanya untuk beban kerja di mana satu permintaan boleh bertukar menjadi beberapa pusingan penaakulan, panggilan alat, dan pembetulan.
Namun, ia tidak seharusnya menggantikan pengujian pada aplikasi anda sendiri.
Google juga menyatakan bahawa 3.6 Flash mungkin melakukan lebih banyak pemeriksaan berprogram di peringkat awal sebelum membuat perubahan kod. Pada repositori yang besar, itu boleh meningkatkan ketepatan. Pada suntingan frontend yang skopnya sempit, ia mungkin hanya menambah penerokaan yang tidak perlu.
Sempadan fail yang jelas, kriteria penerimaan, dan arahan pelaksanaan masih penting.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Yang Mana Patut Anda Guna?
Apabila anda telah memutuskan bahawa Gemini 3.6 Flash berbaloi untuk diuji, soalan seterusnya ialah sama ada setiap permintaan benar-benar memerlukannya.
Bagi banyak sistem produksi, jawapannya ialah tidak.
Gemini 3.5 Flash-Lite jauh lebih murah dan boleh menjadi lalai yang lebih baik untuk beban kerja volum tinggi yang boleh diramal.
| Perkara | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Harga input Standard | $1.50 / 1M token | $0.30 / 1M token |
| Harga output Standard | $7.50 / 1M token | $2.50 / 1M token |
| Input cache Standard | $0.15 / 1M token | $0.03 / 1M token |
| Tahap pemikiran lalai | medium | minimal |
| Paling sesuai untuk | Penaakulan kompleks, pengkodan, agen | Pengekstrakan, penghalaan, pengelasan |
Pada harga Standard, Flash-Lite adalah 5ร lebih murah pada input dan 3ร lebih murah pada output berbanding Gemini 3.6 Flash.
Mulakan dengan Gemini 3.5 Flash-Lite untuk:
- Pengelasan
- Penghalaan permintaan
- JSON dan pengekstrakan berstruktur
- Pemprosesan dokumen
- Transformasi data
- Terjemahan pada skala
- Subagen ringan
- Tugas volum tinggi yang berulang
Strategi penghalaan praktikal mungkin seperti berikut:
| Beban kerja | Laluan pertama | Eskalasi |
|---|---|---|
| Pengelasan atau penghalaan | Gemini 3.5 Flash-Lite | 3.6 Flash selepas kegagalan pengesahan |
| Pengekstrakan berstruktur | Gemini 3.5 Flash-Lite | 3.6 Flash untuk dokumen kompleks |
| Subagen ringan | Gemini 3.5 Flash-Lite | Naikkan tahap pemikiran atau guna 3.6 Flash |
| Pengkodan berbilang fail | Gemini 3.6 Flash | Fallback lebih kuat jika tidak diselesaikan |
| Aliran kerja alat kompleks | Gemini 3.6 Flash | Fallback selepas kegagalan alat atau pengesahan |
| Penaakulan multimodal | Gemini 3.6 Flash | Fallback khusus tugas |
Untuk trafik produksi bercampur, metrik yang lebih berguna ialah:
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Panggilan pertama yang murah menjadi kurang menarik jika ia gagal berulang kali dan akhirnya memerlukan model yang lebih kuat juga.
Sebaliknya juga penting. Tidak banyak sebab untuk menghantar berjuta-juta permintaan pengelasan yang boleh diramal ke Gemini 3.6 Flash jika Flash-Lite sudah memenuhi ketepatan yang diperlukan.
Untuk aplikasi yang memerlukan penghalaan seperti ini, lihat panduan kami tentang memanggil berbilang model AI melalui URL asas serasi OpenAI.
Apakah Yang Berubah Apabila Bermigrasi ke Gemini 3.6 Flash?
Berpindah dari Gemini 3.5 Flash ke Gemini 3.6 Flash melibatkan lebih daripada sekadar menukar ID model.
Pembangun harus menyemak lima bidang sebelum menukar trafik produksi: parameter pensampelan yang ditamatkan, kawalan pemikiran, candidate_count, pra-isian giliran model, dan keadaan panggilan fungsi.
1. Alih keluar temperature, top_p, dan top_k
Google telah menamatkan kawalan pensampelan ini untuk Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Model baharu pada masa ini mengabaikan parameter ini. Google mengatakan generasi model Gemini pada masa hadapan mungkin memulangkan ralat HTTP 400 apabila ia dibekalkan.
Untuk format output yang boleh diramal, gunakan arahan sistem yang lebih jelas dan output berstruktur sebaliknya.
2. Gantikan thinking_budget Dengan thinking_level
Gemini 3.6 Flash lalai kepada medium thinking.
Panduan migrasi Google mengesyorkan beralih daripada konfigurasi thinking_budget berangka kepada thinking_level.
Gemini 3.5 Flash-Lite lalai kepada minimal, yang sesuai untuk banyak beban kerja volum tinggi seperti pengekstrakan, pengelasan, dan penghalaan.
Tahap pemikiran yang lebih tinggi harus diuji apabila tugas melibatkan penaakulan berbilang langkah, pelaksanaan kod, atau penggunaan alat.
3. Alih keluar candidate_count
Google menyenaraikan candidate_count sebagai tidak disokong dalam Gemini 3.x.
Ini mudah terlepas apabila beberapa model berkongsi konfigurasi penjanaan yang sama. Alih keluar ia sebelum memindahkan permintaan produksi.
4. Hentikan pra-isian giliran model
Permintaan tidak lagi boleh berakhir dengan giliran peranan model yang tidak kosong.
Aplikasi lama mungkin menggunakan payload seperti:
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Corak itu kini boleh memulangkan HTTP 400.
Jika anda sebelum ini menggunakan pra-isian untuk memaksa format jawapan, pindahkan keperluan ke system_instruction atau gunakan output berstruktur sebaliknya.
5. Uji semula Panggilan Fungsi dan Keadaan Berbilang Giliran
Agen yang menggunakan alat memerlukan pengujian migrasi berasingan.
Google mengesyorkan menggunakan previous_interaction_id untuk keadaan berbilang giliran bahagian pelayan dalam Interactions API.
Apabila memulangkan hasil fungsi, kekalkan kedua-dua nama fungsi dan ID panggilan asal:
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Aplikasi yang menggunakan generateContent juga harus mengesahkan payload FunctionResponse mereka dan memantau ralat panggilan alat selepas migrasi.
Lihat panduan migrasi model terkini Google dan dokumentasi panggilan fungsi untuk butiran pelaksanaan semasa.
Bagaimana Memanggil Gemini 3.6 Flash dalam Python?
Pasang atau kemas kini SDK GenAI Google:
pip install -U google-genai
Tetapkan kunci API anda:
export GEMINI_API_KEY="your-api-key"
Kemudian panggil Gemini 3.6 Flash:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Untuk tugas yang memerlukan lebih banyak penaakulan, tetapkan tahap pemikiran:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
Perbezaan migrasi utama boleh dirumuskan seperti berikut:
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
Jangan anggap tahap pemikiran yang lebih tinggi sentiasa lebih baik. Ukur kependaman, penggunaan token, dan kadar penyiapan pada tugas anda sendiri.
Bagaimana Patut Anda Uji Gemini 3.6 Flash Sebelum Produksi?
Anda tidak memerlukan suite penanda aras awam yang besar untuk memutuskan sama ada Gemini 3.6 Flash patut berada dalam timbunan produksi anda.
Permulaan yang lebih baik ialah 30-50 tugas terkini yang menyerupai trafik sebenar anda.
Sertakan campuran:
- Pengkodan dan nyahpepijat
- Penggunaan alat berbilang langkah
- Dokumen multimodal
- Pengekstrakan data
- Pengelasan dan penghalaan
Jalankan input yang sama melalui:
- Model produksi anda sekarang
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Kekalkan gesaan, alat, validator, dan kriteria penerimaan tidak berubah.
Jejaki:
- Token input
- Token output dan pemikiran
- Kependaman
- Panggilan alat
- Percubaan semula
- Ralat panggilan fungsi
- Kadar lulus validator
- Masa pembetulan manusia
- Kejayaan tugas akhir
Kemudian bandingkan kos keseluruhan yang diperlukan untuk menghasilkan hasil yang diterima.
Permintaan pengkodan yang berharga $0.08 dan berjaya pada cubaan pertama mungkin lebih murah daripada permintaan $0.02 yang gagal dua kali dan akhirnya meningkat.
Pada masa yang sama, membayar harga Gemini 3.6 Flash untuk tugas pengelasan ringkas tidak masuk akal jika Flash-Lite menanganinya dengan boleh dipercayai.
Matlamatnya bukan untuk mencari satu model untuk setiap permintaan. Ia adalah untuk menggunakan model yang lebih kuat hanya di tempat keupayaan tambahannya benar-benar mengubah hasil.
Pembangun boleh membandingkan laluan Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite semasa melalui CometAPI menggunakan set penilaian yang sama.
Soalan Lazim
Berapakah kos API Gemini 3.6 Flash?
Kadar berbayar Standard Google ialah $1.50 per juta token input dan $7.50 per juta token output. Input cache Standard berharga $0.15/M. Batch dan Flex berharga $0.75/M input dan $3.75/M output.
Adakah Gemini 3.6 Flash percuma?
Ya. Harga semasa Gemini Developer API Google menyenaraikan penggunaan Standard Peringkat Percuma untuk Gemini 3.6 Flash. Akses percuma tertakluk kepada had kadar projek dan peringkat penggunaan.
Adakah Gemini 3.6 Flash tersedia secara umum?
Ya. Google melancarkan gemini-3.6-flash pada 21 Julai 2026 dan menyenaraikannya sebagai model produksi dalam dokumentasi Gemini API.
Apakah tetingkap konteks Gemini 3.6 Flash?
Gemini 3.6 Flash menyokong sehingga 1,048,576 token input dan 65,536 token output. Ia menerima input teks, imej, video, audio, dan PDF serta menghasilkan output teks.
Adakah Gemini 3.6 Flash lebih murah daripada Gemini 3.5 Flash?
Ya untuk token output. Kedua-dua model berharga $1.50/M token input Standard, manakala Gemini 3.6 Flash mengurangkan harga output daripada $9.00/M kepada $7.50/M.
Patutkah saya menggunakan Gemini 3.6 Flash atau Gemini 3.5 Flash-Lite?
Gunakan Gemini 3.6 Flash apabila kualiti pengkodan, penaakulan multimodal, atau pelaksanaan agen kompleks boleh mengurangkan kegagalan dan percubaan semula. Mulakan dengan Flash-Lite untuk pengekstrakan, pengelasan, penghalaan volum tinggi, dan beban kerja boleh diramal lain di mana kos lebih rendah lebih penting.
Apa yang perlu saya ubah sebelum bermigrasi ke Gemini 3.6 Flash?
Alih keluar temperature, top_p, top_k, dan candidate_count; gantikan thinking_budget dengan thinking_level; alih keluar pra-isian giliran model; dan uji semula panggilan fungsi serta pengurusan keadaan berbilang giliran.
Kesimpulan Akhir
Gemini 3.6 Flash berbaloi dibenchmark jika anda sudah menggunakan Gemini 3.5 Flash untuk pengkodan, kerja multimodal, atau aliran kerja agen.
Harganya untuk output lebih rendah, dan keputusan awal Google menunjukkan bahawa beberapa beban kerja juga mungkin memerlukan lebih sedikit token dan langkah pelaksanaan. Bagi agen yang kerap berfikir, memanggil alat, dan mencuba semula tindakan yang gagal, penjimatan tersebut boleh lebih penting daripada perbezaan harga utama.
Tetapi itu tidak bermakna setiap permintaan harus berpindah ke 3.6 Flash.
Gemini 3.5 Flash-Lite jauh lebih murah dan mungkin sudah memadai untuk kerja boleh diramal seperti pengekstrakan, pengelasan, dan penghalaan.
Strategi produksi yang lebih baik ialah menggunakan setiap model di tempat yang masuk akal dari segi ekonomi: Flash-Lite untuk tugas ringkas dan volum tinggi; 3.6 Flash di mana penaakulan lebih kuat boleh meningkatkan peluang untuk menyiapkan dengan betul pada cubaan pertama.
Kemudian ukur hasil yang benar-benar penting - kos keseluruhan untuk mendapatkan jawapan yang diterima.
Untuk membandingkan kedua-dua model melalui aliran kerja yang sama, lihat halaman model Gemini 3.6 Flash dan halaman model Gemini 3.5 Flash-Lite di CometAPI, atau semak laluan model semasa pada halaman harga CometAPI.
