Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI โ†’

Panduan Harga & Migrasi API Gemini 3.6 Flash (2026)

CometAPI
Mia MarenJul 22, 2026
Panduan Harga & Migrasi API Gemini 3.6 Flash (2026)

TL;DR

Gemini 3.6 Flash berharga $1.50/M input dan $7.50/M output, dengan harga output yang lebih rendah serta prestasi pengkodan dan agen yang dilaporkan lebih baik berbanding Gemini 3.5 Flash. Untuk produksi, gunakan 3.6 Flash bagi penaakulan kompleks dan agen, manakala halakan beban kerja volum tinggi yang lebih ringkas kepada Gemini 3.5 Flash-Lite yang lebih murah.

Gemini 3.6 Flash lebih daripada sekadar kemas kini ID model.

Bagi pembangun yang sudah menggunakan Gemini 3.5 Flash, perubahan yang lebih besar ialah ekonomi. Google mengekalkan harga input pada $1.50 per juta token, menurunkan harga output daripada $9.00 kepada $7.50, dan melaporkan prestasi yang lebih baik pada beberapa penanda aras pengkodan dan agen.

Persoalan praktikalnya ialah sama ada peningkatan tersebut cukup besar untuk membenarkan pemindahan beban kerja produksi.

Jawapan itu bergantung pada beban kerja. Agen pengkodan, analisis multimodal, dan penggunaan alat berbilang langkah mungkin mendapat lebih banyak manfaat berbanding pengekstrakan atau pengelasan ringkas. Migrasi juga memerlukan beberapa semakan keserasian API yang mudah terlepas jika anda hanya menukar nama model.

Panduan ini merangkumi harga API Gemini 3.6 Flash, akses peringkat percuma, keputusan penanda aras, perubahan migrasi, contoh Python, dan perkara yang perlu diuji sebelum menukar trafik produksi.

Apakah itu Gemini 3.6 Flash?

Gemini 3.6 Flash ialah model Flash terbaharu Google untuk pengkodan, penaakulan multimodal, dan aliran kerja agen berbilang langkah. Dilancarkan pada 21 Julai 2026, ia direka untuk beban kerja produksi yang memerlukan penaakulan lebih kukuh dan prestasi agen yang lebih baik sambil kekal dalam peringkat model Flash Google.

Spesifikasi utamanya termasuk:

PerkaraGemini 3.6 Flash
ID Modelgemini-3.6-flash
Harga input Standard$1.50 / 1M token
Harga output Standard$7.50 / 1M token
Input cache Standard$0.15 / 1M token
Tahap pemikiran lalaimedium
Konteks input1,048,576 token
Output maksimum65,536 token
InputTeks, imej, video, audio, PDF
OutputTeks
Paling sesuai untukPengkodan, penaakulan multimodal, agen kompleks

Google memposisikan Gemini 3.6 Flash untuk beban kerja seperti pengkodan, penaakulan ruang dan multimodal, serta tugas agen berbilang langkah.

Model ini juga menyokong ciri termasuk panggilan fungsi, output berstruktur, pelaksanaan kod, cache konteks, File Search, konteks URL, Google Search grounding, dan Google Maps grounding.

Anda boleh menyemak spesifikasi dan panduan migrasi terkini dalam panduan model Gemini terkini Google.

Bagi pembangun yang datang daripada generasi sebelumnya, panduan API Gemini 3.5 Flash CometAPI menyediakan garis dasar integrasi yang berguna.

Berapakah Kos API Gemini 3.6 Flash?

Gemini 3.6 Flash berharga $1.50 per juta token input dan $7.50 per juta token output pada peringkat berbayar Standard Google.

Berbanding Gemini 3.5 Flash, harga input kekal tidak berubah, manakala harga output turun daripada $9.00 kepada $7.50 per juta token - pengurangan 16.7%.

Google juga menawarkan pemprosesan Batch, Flex, dan Priority.

Tahap Gemini 3.6 FlashInput / 1MInput cache / 1MOutput / 1M
Standard$1.50$0.15$7.50
Batch$0.75$0.075$3.75
Flex$0.75$0.075$3.75
Priority$2.70$0.27$13.50

Penting:** Token pemikiran dibilkan pada kadar token output. Respons kelihatan yang pendek oleh itu boleh menggunakan lebih banyak token output yang dibilkan daripada yang disarankan oleh panjang jawapan akhir.

Cache konteks juga boleh memberikan perbezaan bermakna untuk aplikasi yang berulang kali menghantar gesaan sistem yang besar, konteks repositori, set dokumen, atau sejarah perbualan yang sama.

Pada peringkat berbayar Standard, input cache Gemini 3.6 Flash berharga $0.15 per juta token, berbanding $1.50 untuk input biasa.

Contoh: 15,000 Token Input + 8,000 Token Output

Pertimbangkan tugas yang menggunakan 15,000 token input dan 8,000 token output.

ModelAnggaran Kos
Gemini 3.5 Flash$0.0945
Gemini 3.6 Flash pada volum token yang sama$0.0825
Gemini 3.6 Flash dengan 17% token output lebih sedikit$0.0723
Gemini 3.5 Flash-Lite pada volum token yang sama$0.0245

Pada penggunaan token yang sama, Gemini 3.6 Flash adalah kira-kira 12.7% lebih murah daripada Gemini 3.5 Flash dalam contoh ini.

Google juga melaporkan bahawa Gemini 3.6 Flash menggunakan 17% lebih sedikit token output pada Artificial Analysis Index. Jika beban kerja produksi menghasilkan pengurangan tersebut, penjimatan termodel dalam contoh ini akan meningkat kira-kira kepada 23.5%.

Google secara berasingan melaporkan pengurangan token output sehingga 65% pada DeepSWE. Angka-angka ini mengukur beban kerja yang berbeza dan tidak boleh dianggap boleh ditukar ganti: 17% merujuk kepada Artificial Analysis Index, manakala 65% datang daripada penanda aras pengkodan tertentu.

Pengiraan kos token asas adalah:

Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000

Bagi agen, kos sebenar adalah lebih luas:

Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs

Inilah sebabnya model termurah per token tidak semestinya model termurah untuk menyiapkan sesuatu tugas.

Adakah Gemini 3.6 Flash Percuma?

Ya. Harga semasa Gemini Developer API Google menyenaraikan akses Peringkat Percuma untuk penggunaan Standard Gemini 3.6 Flash.

Ketersediaan peringkat percuma tidak bermakna kapasiti produksi tanpa had. Had API bergantung pada projek dan peringkat penggunaan, jadi pembangun harus menyemak had kadar yang digunakan pada projek mereka sendiri dan bukannya bergantung pada angka permintaan per minit tetap daripada artikel pihak ketiga.

Untuk perancangan produksi, gunakan harga Gemini API semasa Google dan dokumentasi had kadar apabila menganggar kapasiti.

Pembangun boleh mengakses Gemini 3.6 Flash melalui Gemini API dan Google AI Studio. Pasukan yang menggunakan aliran kerja berbilang model bersepadu juga boleh menguji model ini melalui halaman model Gemini 3.6 Flash di CometAPI.

Bagaimanakah Gemini 3.6 Flash Berbanding Dengan Gemini 3.5 Flash?

Keputusan yang diterbitkan Google menunjukkan peningkatan terbesar dalam pengkodan, pelaksanaan agen, penggunaan komputer, dan kerja pengetahuan.

Penanda arasGemini 3.6 FlashGemini 3.5 FlashPerubahan
DeepSWE49.00%37.00%+12.0 mata
MLE-Bench63.90%49.70%+14.2 mata
OSWorld-Verified83.00%78.40%+4.6 mata
GDPval-AA v21,4211,34972

Google juga mengatakan Gemini 3.6 Flash menyiapkan aliran kerja berbilang langkah dengan lebih sedikit langkah penaakulan, giliran perbualan, dan panggilan alat berbanding Gemini 3.5 Flash.

Syarikat itu melaporkan:

  • 17% token output lebih sedikit pada Artificial Analysis Index.
  • Sehingga 65% token output lebih sedikit pada DeepSWE.
  • Lebih sedikit suntingan kod yang tidak diingini dan gelung pelaksanaan.
  • Peningkatan penaakulan multimodal dan spatial.

Keputusan asal tersedia dalam pengumuman pelancaran Gemini 3.6 Flash Google.

Penanda aras ini menjadikan 3.6 Flash calon yang kukuh untuk penilaian, terutamanya untuk beban kerja di mana satu permintaan boleh bertukar menjadi beberapa pusingan penaakulan, panggilan alat, dan pembetulan.

Namun, ia tidak seharusnya menggantikan pengujian pada aplikasi anda sendiri.

Google juga menyatakan bahawa 3.6 Flash mungkin melakukan lebih banyak pemeriksaan berprogram di peringkat awal sebelum membuat perubahan kod. Pada repositori yang besar, itu boleh meningkatkan ketepatan. Pada suntingan frontend yang skopnya sempit, ia mungkin hanya menambah penerokaan yang tidak perlu.

Sempadan fail yang jelas, kriteria penerimaan, dan arahan pelaksanaan masih penting.

Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite: Yang Mana Patut Anda Guna?

Apabila anda telah memutuskan bahawa Gemini 3.6 Flash berbaloi untuk diuji, soalan seterusnya ialah sama ada setiap permintaan benar-benar memerlukannya.

Bagi banyak sistem produksi, jawapannya ialah tidak.

Gemini 3.5 Flash-Lite jauh lebih murah dan boleh menjadi lalai yang lebih baik untuk beban kerja volum tinggi yang boleh diramal.

PerkaraGemini 3.6 FlashGemini 3.5 Flash-Lite
Harga input Standard$1.50 / 1M token$0.30 / 1M token
Harga output Standard$7.50 / 1M token$2.50 / 1M token
Input cache Standard$0.15 / 1M token$0.03 / 1M token
Tahap pemikiran lalaimediumminimal
Paling sesuai untukPenaakulan kompleks, pengkodan, agenPengekstrakan, penghalaan, pengelasan

Pada harga Standard, Flash-Lite adalah 5ร— lebih murah pada input dan 3ร— lebih murah pada output berbanding Gemini 3.6 Flash.

Mulakan dengan Gemini 3.5 Flash-Lite untuk:

  • Pengelasan
  • Penghalaan permintaan
  • JSON dan pengekstrakan berstruktur
  • Pemprosesan dokumen
  • Transformasi data
  • Terjemahan pada skala
  • Subagen ringan
  • Tugas volum tinggi yang berulang

Strategi penghalaan praktikal mungkin seperti berikut:

Beban kerjaLaluan pertamaEskalasi
Pengelasan atau penghalaanGemini 3.5 Flash-Lite3.6 Flash selepas kegagalan pengesahan
Pengekstrakan berstrukturGemini 3.5 Flash-Lite3.6 Flash untuk dokumen kompleks
Subagen ringanGemini 3.5 Flash-LiteNaikkan tahap pemikiran atau guna 3.6 Flash
Pengkodan berbilang failGemini 3.6 FlashFallback lebih kuat jika tidak diselesaikan
Aliran kerja alat kompleksGemini 3.6 FlashFallback selepas kegagalan alat atau pengesahan
Penaakulan multimodalGemini 3.6 FlashFallback khusus tugas

Untuk trafik produksi bercampur, metrik yang lebih berguna ialah:

Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks

Panggilan pertama yang murah menjadi kurang menarik jika ia gagal berulang kali dan akhirnya memerlukan model yang lebih kuat juga.

Sebaliknya juga penting. Tidak banyak sebab untuk menghantar berjuta-juta permintaan pengelasan yang boleh diramal ke Gemini 3.6 Flash jika Flash-Lite sudah memenuhi ketepatan yang diperlukan.

Untuk aplikasi yang memerlukan penghalaan seperti ini, lihat panduan kami tentang memanggil berbilang model AI melalui URL asas serasi OpenAI.

Apakah Yang Berubah Apabila Bermigrasi ke Gemini 3.6 Flash?

Berpindah dari Gemini 3.5 Flash ke Gemini 3.6 Flash melibatkan lebih daripada sekadar menukar ID model.

Pembangun harus menyemak lima bidang sebelum menukar trafik produksi: parameter pensampelan yang ditamatkan, kawalan pemikiran, candidate_count, pra-isian giliran model, dan keadaan panggilan fungsi.

1. Alih keluar temperature, top_p, dan top_k

Google telah menamatkan kawalan pensampelan ini untuk Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40,
}

Model baharu pada masa ini mengabaikan parameter ini. Google mengatakan generasi model Gemini pada masa hadapan mungkin memulangkan ralat HTTP 400 apabila ia dibekalkan.

Untuk format output yang boleh diramal, gunakan arahan sistem yang lebih jelas dan output berstruktur sebaliknya.

2. Gantikan thinking_budget Dengan thinking_level

Gemini 3.6 Flash lalai kepada medium thinking.

Panduan migrasi Google mengesyorkan beralih daripada konfigurasi thinking_budget berangka kepada thinking_level.

Gemini 3.5 Flash-Lite lalai kepada minimal, yang sesuai untuk banyak beban kerja volum tinggi seperti pengekstrakan, pengelasan, dan penghalaan.

Tahap pemikiran yang lebih tinggi harus diuji apabila tugas melibatkan penaakulan berbilang langkah, pelaksanaan kod, atau penggunaan alat.

3. Alih keluar candidate_count

Google menyenaraikan candidate_count sebagai tidak disokong dalam Gemini 3.x.

Ini mudah terlepas apabila beberapa model berkongsi konfigurasi penjanaan yang sama. Alih keluar ia sebelum memindahkan permintaan produksi.

4. Hentikan pra-isian giliran model

Permintaan tidak lagi boleh berakhir dengan giliran peranan model yang tidak kosong.

Aplikasi lama mungkin menggunakan payload seperti:

{
  "contents": [
    {
      "role": "user",
      "parts": [{"text": "Translate 'Hello world' to Spanish."}]
    },
    {
      "role": "model",
      "parts": [{"text": "Translation:"}]
    }
  ]
}

Corak itu kini boleh memulangkan HTTP 400.

Jika anda sebelum ini menggunakan pra-isian untuk memaksa format jawapan, pindahkan keperluan ke system_instruction atau gunakan output berstruktur sebaliknya.

5. Uji semula Panggilan Fungsi dan Keadaan Berbilang Giliran

Agen yang menggunakan alat memerlukan pengujian migrasi berasingan.

Google mengesyorkan menggunakan previous_interaction_id untuk keadaan berbilang giliran bahagian pelayan dalam Interactions API.

Apabila memulangkan hasil fungsi, kekalkan kedua-dua nama fungsi dan ID panggilan asal:

final_interaction = client.interactions.create(
    model="gemini-3.6-flash",
    previous_interaction_id=interaction.id,
    tools=tools,
    input=[
        {
            "type": "function_result",
            "name": step.name,
            "call_id": step.id,
            "result": [
                {
                    "type": "text",
                    "text": json.dumps(result),
                }
            ],
        }
    ],
)

Aplikasi yang menggunakan generateContent juga harus mengesahkan payload FunctionResponse mereka dan memantau ralat panggilan alat selepas migrasi.

Lihat panduan migrasi model terkini Google dan dokumentasi panggilan fungsi untuk butiran pelaksanaan semasa.

Bagaimana Memanggil Gemini 3.6 Flash dalam Python?

Pasang atau kemas kini SDK GenAI Google:

pip install -U google-genai

Tetapkan kunci API anda:

export GEMINI_API_KEY="your-api-key"

Kemudian panggil Gemini 3.6 Flash:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input=(
        "Review this migration plan and list the three "
        "highest-risk compatibility issues."
    ),
)

print(interaction.output_text)

Untuk tugas yang memerlukan lebih banyak penaakulan, tetapkan tahap pemikiran:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Analyze this multi-step debugging problem.",
    generation_config={
        "thinking_level": "medium",
    },
)

print(interaction.output_text)

Perbezaan migrasi utama boleh dirumuskan seperti berikut:

# Older shared configuration
old_config = {
    "temperature": 0.2,
    "top_p": 0.9,
    "top_k": 40,
    "candidate_count": 1,
    "thinking_budget": 4096,
}

# Gemini 3.6 Flash
new_config = {
    "thinking_level": "medium",
}

Jangan anggap tahap pemikiran yang lebih tinggi sentiasa lebih baik. Ukur kependaman, penggunaan token, dan kadar penyiapan pada tugas anda sendiri.

Bagaimana Patut Anda Uji Gemini 3.6 Flash Sebelum Produksi?

Anda tidak memerlukan suite penanda aras awam yang besar untuk memutuskan sama ada Gemini 3.6 Flash patut berada dalam timbunan produksi anda.

Permulaan yang lebih baik ialah 30-50 tugas terkini yang menyerupai trafik sebenar anda.

Sertakan campuran:

  1. Pengkodan dan nyahpepijat
  2. Penggunaan alat berbilang langkah
  3. Dokumen multimodal
  4. Pengekstrakan data
  5. Pengelasan dan penghalaan

Jalankan input yang sama melalui:

  • Model produksi anda sekarang
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash-Lite

Kekalkan gesaan, alat, validator, dan kriteria penerimaan tidak berubah.

Jejaki:

  • Token input
  • Token output dan pemikiran
  • Kependaman
  • Panggilan alat
  • Percubaan semula
  • Ralat panggilan fungsi
  • Kadar lulus validator
  • Masa pembetulan manusia
  • Kejayaan tugas akhir

Kemudian bandingkan kos keseluruhan yang diperlukan untuk menghasilkan hasil yang diterima.

Permintaan pengkodan yang berharga $0.08 dan berjaya pada cubaan pertama mungkin lebih murah daripada permintaan $0.02 yang gagal dua kali dan akhirnya meningkat.

Pada masa yang sama, membayar harga Gemini 3.6 Flash untuk tugas pengelasan ringkas tidak masuk akal jika Flash-Lite menanganinya dengan boleh dipercayai.

Matlamatnya bukan untuk mencari satu model untuk setiap permintaan. Ia adalah untuk menggunakan model yang lebih kuat hanya di tempat keupayaan tambahannya benar-benar mengubah hasil.

Pembangun boleh membandingkan laluan Gemini 3.6 Flash dan Gemini 3.5 Flash-Lite semasa melalui CometAPI menggunakan set penilaian yang sama.

Soalan Lazim

Berapakah kos API Gemini 3.6 Flash?

Kadar berbayar Standard Google ialah $1.50 per juta token input dan $7.50 per juta token output. Input cache Standard berharga $0.15/M. Batch dan Flex berharga $0.75/M input dan $3.75/M output.

Adakah Gemini 3.6 Flash percuma?

Ya. Harga semasa Gemini Developer API Google menyenaraikan penggunaan Standard Peringkat Percuma untuk Gemini 3.6 Flash. Akses percuma tertakluk kepada had kadar projek dan peringkat penggunaan.

Adakah Gemini 3.6 Flash tersedia secara umum?

Ya. Google melancarkan gemini-3.6-flash pada 21 Julai 2026 dan menyenaraikannya sebagai model produksi dalam dokumentasi Gemini API.

Apakah tetingkap konteks Gemini 3.6 Flash?

Gemini 3.6 Flash menyokong sehingga 1,048,576 token input dan 65,536 token output. Ia menerima input teks, imej, video, audio, dan PDF serta menghasilkan output teks.

Adakah Gemini 3.6 Flash lebih murah daripada Gemini 3.5 Flash?

Ya untuk token output. Kedua-dua model berharga $1.50/M token input Standard, manakala Gemini 3.6 Flash mengurangkan harga output daripada $9.00/M kepada $7.50/M.

Patutkah saya menggunakan Gemini 3.6 Flash atau Gemini 3.5 Flash-Lite?

Gunakan Gemini 3.6 Flash apabila kualiti pengkodan, penaakulan multimodal, atau pelaksanaan agen kompleks boleh mengurangkan kegagalan dan percubaan semula. Mulakan dengan Flash-Lite untuk pengekstrakan, pengelasan, penghalaan volum tinggi, dan beban kerja boleh diramal lain di mana kos lebih rendah lebih penting.

Apa yang perlu saya ubah sebelum bermigrasi ke Gemini 3.6 Flash?

Alih keluar temperature, top_p, top_k, dan candidate_count; gantikan thinking_budget dengan thinking_level; alih keluar pra-isian giliran model; dan uji semula panggilan fungsi serta pengurusan keadaan berbilang giliran.

Kesimpulan Akhir

Gemini 3.6 Flash berbaloi dibenchmark jika anda sudah menggunakan Gemini 3.5 Flash untuk pengkodan, kerja multimodal, atau aliran kerja agen.

Harganya untuk output lebih rendah, dan keputusan awal Google menunjukkan bahawa beberapa beban kerja juga mungkin memerlukan lebih sedikit token dan langkah pelaksanaan. Bagi agen yang kerap berfikir, memanggil alat, dan mencuba semula tindakan yang gagal, penjimatan tersebut boleh lebih penting daripada perbezaan harga utama.

Tetapi itu tidak bermakna setiap permintaan harus berpindah ke 3.6 Flash.

Gemini 3.5 Flash-Lite jauh lebih murah dan mungkin sudah memadai untuk kerja boleh diramal seperti pengekstrakan, pengelasan, dan penghalaan.

Strategi produksi yang lebih baik ialah menggunakan setiap model di tempat yang masuk akal dari segi ekonomi: Flash-Lite untuk tugas ringkas dan volum tinggi; 3.6 Flash di mana penaakulan lebih kuat boleh meningkatkan peluang untuk menyiapkan dengan betul pada cubaan pertama.

Kemudian ukur hasil yang benar-benar penting - kos keseluruhan untuk mendapatkan jawapan yang diterima.

Untuk membandingkan kedua-dua model melalui aliran kerja yang sama, lihat halaman model Gemini 3.6 Flash dan halaman model Gemini 3.5 Flash-Lite di CometAPI, atau semak laluan model semasa pada halaman harga CometAPI.

Bersedia untuk mengurangkan kos pembangunan AI sebanyak 20%?

Mulakan secara percuma dalam beberapa minit. Kredit percubaan percuma disertakan. Tiada kad kredit diperlukan.

Baca Lagi