Berapa Biaya GPT-5.6 Sol, Claude Sonnet 5, dan Gemini 3.7 Flash?
Bagaimana cara membandingkan harga model AI di berbagai penyedia? Mulailah dengan campuran input-output yang sama, mata uang yang sama, dan definisi hasil sukses yang sama. Satu โharga per 1M tokenโ tidak lengkap karena token input dan output ditagih pada tarif berbeda, permintaan ber-konteks panjang dapat masuk tier lebih tinggi, dan retry atau jawaban yang ditolak dapat membuat biaya efektif jauh lebih tinggi.
Per 26 Agustus 2026, sebuah beban kerja yang berisi 800.000 token input tanpa cache dan 200.000 token output akan menelan biaya sekitar $5.76 dengan GPT-5.6 Sol, $2.88 dengan Claude Sonnet 5, atau $1.08 dengan Gemini 3.7 Flash pada tarif CometAPI saat ini. Model-model ini berada pada posisi kecepatan dan kapabilitas yang berbeda, jadi ini adalah perbandingan penagihanโbukan klaim bahwa mereka memberikan kualitas yang identik.
Cara Membandingkan Harga API AI di Berbagai Penyedia
Artikel ini menggunakan dolar AS per 1M token teks yang dapat ditagih. Skenario contoh mewakili alur dukungan atau pengetahuan ber-volume tinggi dengan 800.000 token input dan 200.000 token output pada banyak permintaan. Setiap permintaan tetap di bawah ambang harga konteks pendek GPT-5.6 Terra sebesar 272.000 token.
Baseline mengecualikan cache prompt, diskon batch, biaya tool, gambar, audio, dan panggilan gagal atau berulang. Ini juga mengasumsikan bahwa satu jawaban yang dihasilkan diterima. Rumusnya adalah:
cost = (input tokens / 1M ร input rate) + (output tokens / 1M ร output rate)
Gunakan jumlah token aktual yang dikembalikan pada setiap respons alih-alih memperkirakan dari karakter. Tokenizer berbeda antar keluarga model, yang berarti teks yang sama tidak selalu menghasilkan jumlah token yang dapat ditagih yang sama.
Harga API GPT-5.6 Sol, Claude Sonnet 5, dan Gemini 3.7 Flash
Tiga ID model dan tarif di bawah ini diperiksa ulang terhadap direktori model live CometAPI pada 26 Agustus 2026. Tarif CometAPI adalah jumlah yang digunakan dalam perhitungan contoh. Kolom resmi disertakan sebagai baseline referensi.
Harga API GPT-5.6 Sol
GPT-5.6 Terra: CometAPI mencantumkan $1.60 per 1M token input dan $9.60 per 1M token output, dibandingkan dengan tarif resmi $2 / $12. Catatan pembaruan harga: tarif live mencerminkan penurunan 20%; catatan perubahan CometAPI mencatat penurunan Terra pada 31 Juli 2026, dan angka tersebut diperiksa ulang setelah tinjauan harga 22 Agustus.
Pembaruan terverifikasi (26 Agustus 2026): Catatan berkomentar sebelumnya dipertahankan agar jangkar tinjauannya tetap terlihat. Untuk perhitungan dalam artikel ini, gunakan GPT-5.6 Sol pada $3.20 per 1M token input dan $16 per 1M token output, dibandingkan dengan tarif resmi $4 / $20. CometAPI mengumumkan promosi tersebut pada 24 Agustus 2026, dan mencantumkannya hingga 21 November 2026.
Harga API Claude Sonnet 5
Claude Sonnet 5: Per 26 Agustus 2026, CometAPI mencantumkan $1.60 per 1M token input dan $8 per 1M token output, dibandingkan dengan harga daftar Anthropic saat ini $2 / $10. Anthropic memperbarui posting peluncurannya pada 10 Agustus 2026 untuk menjadikan $2 / $10 permanen; kenaikan yang sebelumnya diumumkan pada 1 September menjadi $3 / $15 tidak lagi berlaku.
Harga API Gemini 3.7 Flash
Gemini 3.7 Flash: Per 26 Agustus 2026, CometAPI mencantumkan $0.60 per 1M token input dan $3 per 1M token output, dibandingkan dengan tarif perkenalan Google $0.75 / $3.75 hingga 31 Desember 2026.
| Model ID | CometAPI input / output | Resmi input / output | 800K in + 200K out |
|---|---|---|---|
| gpt-5.6-sol | $3.20 / $16 | $4 / $20 | $5.76 |
| claude-sonnet-5 | $1.60 / $8 | $2 / $10 | $2.88 |
| gemini-3.7-flash | $0.60 / $3 | $0.75 / $3.75 | $1.08 |
Semua harga adalah USD per 1M token. Lihat halaman model bertanggal untuk GPT-5.6, Claude Sonnet 5, dan Gemini 3.7 Flash, serta panduan harga CometAPI. Claude Sonnet 5: CometAPI mencantumkan $1.60 per 1M token input dan $8 per 1M token output, dibandingkan dengan harga daftar Anthropic $2 / $10 saat ini. Anthropic awalnya mengumumkan harga standar $3 / $15 untuk September 2026, tetapi memperbarui harga pada 10 Agustus 2026 dan menjadikan tarif $2 / $10 permanen. GPT-5.6 Terra juga memiliki tier konteks panjang yang lebih tinggi, jadi jangan menerapkan angka konteks pendek pada permintaan di atas ambang yang dipublikasikan.
Gemini 3.7 Flash memiliki tagihan token terendah dalam skenario ini dan diposisikan sebagai model Flash yang efisien. Claude Sonnet 5 adalah model produksi yang seimbang, sementara GPT-5.6 Sol adalah opsi flagship untuk beban kerja penalaran dan pengkodean yang lebih sulit. Keputusan yang berguna bukan hanya โbaris mana yang termurah?โ tetapi โmodel mana yang menghasilkan hasil yang dapat diterima dengan total token, retry, dan rerun paling sedikit?โ
Berapa Biaya 1M Token untuk GPT, Claude, dan Gemini?
Untuk baseline 800K input dan 200K output, perhitungannya langsung. GPT-5.6 Sol berbiaya 0.8 ร $3.20 + 0.2 ร $16 = $5.76. Claude Sonnet 5 berbiaya 0.8 ร $1.60 + 0.2 ร $8 = $2.88. Gemini 3.7 Flash berbiaya 0.8 ร $0.60 + 0.2 ร $3 = $1.08.
Aritmetika tersebut berguna untuk penyusunan anggaran, tetapi biaya output yang diterima adalah metrik produksi yang lebih baik. Tabel di bawah menunjukkan apa yang terjadi ketika beban kerja yang sama mengalami overhead operasional umum.
| Model | Baseline | 5% retried | 10% rerun | 40% output |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.76 | $6.05 | $6.34 | $8.32 |
| Claude Sonnet 5 | $2.88 | $3.02 | $3.17 | $4.16 |
| Gemini 3.7 Flash | $1.08 | $1.13 | $1.19 | $1.56 |
โ5% retriedโ mengasumsikan bahwa 5% dari seluruh beban token dikirim ulang. โ10% rerunโ mengasumsikan bahwa satu dari sepuluh output gagal pemeriksaan kualitas dan dihasilkan ulang dengan campuran token yang sama. โ40% outputโ menjaga total pada 1M token tetapi mengubah campurannya menjadi 600K input dan 400K output. Karena token output berbiaya lebih tinggi, verbositas dapat mendorong tagihan lebih cepat daripada pertumbuhan trafik.
Seberapa Besar Tambahan Biaya dari Retry dan Keluaran Gagal?
Berapa Biaya Retry dan Rerun API?
Retry dapat menduplikasi pekerjaan yang dapat ditagih. Pada baseline, me-retry 5% beban kerja menaikkan GPT-5.6 Sol dari $5.76 menjadi sekitar $6.05, sementara menjalankan ulang 10% setelah kegagalan kualitas menaikkannya menjadi sekitar $6.34. Retry mengulangi permintaan setelah kegagalan transport atau layanan; rerun menghasilkan ulang jawaban yang sudah dikirim tetapi ditolak. Lakukan retry hanya pada rate limit, timeout, dan kegagalan server sementara. Panduan error dan retry CometAPI merekomendasikan exponential backoff dengan jitter dan tanpa retry otomatis untuk permintaan yang salah format atau error autentikasi. Batasi jumlah upaya agar insiden penyedia tidak membuat badai retry.
Seberapa Besar Penghematan dari Prompt Caching?
Penghematan cache bergantung pada reuse. Tarif konteks pendek GPT-5.6 Sol di CometAPI mencantumkan pembacaan cache sebesar $0.32/M dan penulisan cache sebesar $4/M. Jika setengah dari 800K input adalah prefix yang dapat digunakan ulang dalam cache, run pertama berbiaya sekitar $6.08 karena menulis 400K token cache menambah premium $0.32 dibanding input normal. Run dengan cache-hit berikutnya berbiaya sekitar $4.61 alih-alih $5.76, menghemat sekitar $1.15. Titik impas: satu reuse yang berhasil sudah menutupi premium penulisan awal; di dua run pertama, jalur cache berbiaya sekitar $10.69 dibanding $11.52 tanpa caching. Model lain memiliki aturan dan minimum cache yang berbeda, jadi verifikasi sebelum membuat anggaran.
Bagaimana Panjang Output Mempengaruhi Biaya API AI?
Jawaban panjang itu mahal. Tarif output di ketiga baris lima kali tarif input. Tetapkan batas output yang sesuai dengan tugas, minta format ringkas, dan hentikan generasi begitu struktur yang diperlukan selesai.
Berapa Biaya Output AI yang Gagal?
Tugas yang gagal tetap dapat mengonsumsi token. Permintaan yang mengembalikan jawaban tak dapat digunakan mungkin secara teknis sukses dan sepenuhnya dapat ditagih. Lacak pelanggaran format, halusinasi, kegagalan tool, dan penolakan manusia secara terpisah dari error HTTP.
Harga token tidak mencerminkan biaya engineering. SDK spesifik penyedia, tagihan terpisah, pemantauan yang diduplikasi, dan pekerjaan migrasi semuanya menambah biaya operasional. Saat membandingkan ketiga keluarga melalui CometAPI, tim dapat menggunakan base URL kompatibel OpenAI yang samaโhttps://api.cometapi.com/v1โdan mengganti ID model sambil mempertahankan satu layer penagihan dan observabilitas. Kapabilitas spesifik model tetap perlu diuji.
Cara Menurunkan Biaya API GPT, Claude, dan Gemini
Seberapa Banyak Batch dan Flex Dapat Menurunkan Biaya API?
Batch dan Flex adalah mode pemrosesan, bukan diskon otomatis pada setiap permintaan. Panduan harga GPT-5.6 CometAPI menyatakan tarif token Batch dan Flex yang memenuhi syarat sekitar 50% di bawah Standard, sementara Anthropic mencantumkan penghematan hingga 50% untuk pemrosesan batch. Menerapkan sensitivitas 50% ke baseline GPT-5.6 Sol sebesar $5.76 menghasilkan sekitar $2.88, tetapi perlakukan itu sebagai ilustrasi sampai mode dan tarif yang sama muncul di akun CometAPI Anda. Gunakan Batch untuk pekerjaan asinkron; gunakan Flex hanya ketika latensi variabel dapat diterima.
GPT-5.6 Terra vs Claude Sonnet 5 vs Gemini 3.7 Flash: Mana yang Paling Murah?
Menggunakan beban kerja yang sama 800K input dan 200K output pada tarif CometAPI yang diperiksa pada 26 Agustus 2026, Gemini 3.7 Flash berbiaya $1.08, Claude Sonnet 5 berbiaya $2.88, dan GPT-5.6 Terra berbiaya $3.20. Gemini adalah yang termurah pada biaya token mentah dalam perbandingan ini. GPT-5.6 Terra mungkin tetap ekonomis untuk tugas yang lebih sulit jika kapabilitasnya mengurangi retry atau koreksi manusia, jadi bandingkan biaya per hasil yang diterima sebelum memilih rute produksi.
Rutekan berdasarkan tingkat kesulitan tugas. Gunakan model berbiaya rendah untuk klasifikasi, ekstraksi, dan draf rutin, lalu eskalasi hanya permintaan yang ambigu atau bernilai tinggi. Fallback harus cocok dengan modalitas yang diperlukan, dukungan tool, dan format outputโbukan sekadar memiliki tarif lebih rendah.
Anggarkan output sebelum pemanggilan. Tetapkan maksimum output yang realistis dan catat token input, output, dan cache aktual dari respons. Panduan estimasi biaya CometAPI memperlakukan estimasi pra-panggilan sebagai penjaga anggaran dan penggunaan aktual sebagai pengukuran final.
Cache konten yang stabil, bukan konteks yang berubah. Instruksi sistem, kebijakan produk, dan dokumen referensi panjang adalah kandidat yang baik ketika berulang. Ukur rasio hit cache dan sertakan biaya penulisan cache; jika tidak, cache dapat terlihat lebih murah secara teori namun sedikit menghemat di produksi.
Retry secara selektif. Tambahkan exponential backoff, jitter, dan jumlah upaya maksimum. Log ID model, status, ID permintaan, token, dan apakah permintaan tersebut adalah retry. Ini membuat pengeluaran yang terduplikasi terlihat.
Optimalkan biaya per hasil yang diterima. Jalankan set evaluasi tetap dan hitung total pengeluaran API / output yang diterima. Model yang lebih mahal bisa lebih murah secara keseluruhan jika membutuhkan lebih sedikit retry, prompt yang lebih pendek, atau koreksi manusia yang lebih sedikit.
Periksa ulang sebelum peluncuran. Ketersediaan model, tarif perkenalan, ambang tier, dan diskon berubah. Query Models API atau tinjau direktori model publik pada hari Anda menerbitkan atau menyetujui anggaran.
FAQ
Apa arti โbiaya per 1M tokenโ sebenarnya?
Ini adalah tarif yang dinormalisasi, bukan harga setiap permintaan. Kalikan tarif input dan output model dengan token yang benar-benar digunakan beban kerja Anda. Pisahkan token cache, tier konteks panjang, dan biaya berbasis tugas.
Mana yang paling murah: GPT, Claude, atau Gemini?
Untuk model spesifik dan beban kerja 800K input/200K output yang diperiksa pada 26 Agustus 2026, Gemini 3.7 Flash adalah opsi berbiaya terendah sebesar $1.08 melalui CometAPI, diikuti oleh Claude Sonnet 5 sebesar $2.88 dan GPT-5.6 Sol sebesar $5.76. Ini tidak otomatis menjadi pilihan terbaik untuk setiap tugas; bandingkan kualitas, latensi, dan biaya output yang diterima pada prompt Anda sendiri.
Haruskah saya membandingkan harga resmi atau harga agregator?
Bandingkan harga yang benar-benar akan Anda bayar, lalu pertahankan tarif resmi sebagai referensi. Gunakan tanggal, mata uang, campuran token, tier, dan asumsi diskon yang sama untuk setiap baris.
Apakah retry selalu ditagih?
Jangan berasumsi gratis. Permintaan transport yang gagal mungkin tidak mencapai inferensi, sementara hasil aplikasi yang timeout atau ditolak mungkin sudah mengonsumsi pekerjaan model. Gunakan catatan penggunaan dan penagihan aktual, dan cegah retry otomatis atas error yang tidak dapat di-retry.
Apakah prompt caching selalu mengurangi biaya?
Tidak. Penulisan cache bisa lebih mahal daripada input normal, dan penghematan bergantung pada pembacaan ulang. Hitung titik impas dari tarif tulis dan baca saat ini untuk model, lalu pantau hit cache nyata.
Seberapa sering harga harus diperiksa?
Periksalah sebelum menerbitkan klaim harga, mengubah model produksi, atau menyetujui perkiraan. Simpan ID model dan tanggal verifikasi bersama perhitungan agar estimasi dapat direproduksi nanti.
Kesimpulan: API AI Mana yang Paling Murah untuk Beban Kerja Anda?
Perbandingan harga GPT vs Claude vs Gemini yang adil menggunakan satu sumber bertanggal, satu campuran token, dan satu definisi sukses. Tarif per token membentuk baseline; caching, retry, panjang output, dan kegagalan kualitas menentukan tagihan nyata. CometAPI memudahkan pengujian lintas penyedia dengan menjaga endpoint dan layer penagihan konsisten, tetapi model berbiaya terendah tetap yang memenuhi target kualitas Anda dengan total pekerjaan paling sedikit.
