DR
Penetapan harga input dicache boleh mengurangkan kos beban kerja yang menghantar semula awalan prompt besar yang tidak berubah, tetapi penjimatan bergantung pada peraturan bacaan cache, tulisan cache, penyimpanan, penghalaan, dan pengekalan yang khusus bagi model. Label umum “caching disokong” tidak memadai untuk menganggar kos; gunakan harga semasa yang diterbitkan untuk model dan laluan yang tepat.
TL;DR
- GPT-5.6 Terra mempunyai harga bacaan cache dan tulisan cache yang dinyatakan secara jelas oleh OpenAI, CometAPI, dan OpenRouter, walaupun laluan gerbang dan peringkat konteks panjang boleh mengubah amaunnya.
- Google menerbitkan kadar cache konteks Standard $0.15 per 1M token untuk Gemini 3.6 Flash serta caj penyimpanan; CometAPI pada masa ini menerbitkan harga input dan output standard model tersebut tanpa baris input dicache yang berasingan.
- Perbandingan yang relevan bukan hanya input standard berbanding bacaan cache. Ia juga merangkumi tulisan cache pertama, sebarang caj penyimpanan, jangka hayat cache, konsistensi laluan, dan bilangan hit cache kemudian.
Mesej utama
- Semak harga di peringkat model dan peringkat perkhidmatan dan bukannya menggunakan pengganda seluruh gerbang.
- Kekalkan bacaan cache, tulisan cache, penyimpanan, dan caching respons sebagai komponen berasingan dalam pengiraan kos.
- Sahkan penggunaan cache sebenar dalam metadata respons API sebelum meramalkan penjimatan berdasarkan kadar yang diterbitkan.
Permintaan yang mengulangi awalan besar yang tidak berubah — prompt sistem, set skema alatan, dokumen rujukan panjang — tidak perlu dicaj pada kadar input penuh bagi setiap panggilan. Kebanyakan model generasi semasa menyokong beberapa bentuk penetapan harga input dicache: kadar dikurangkan untuk bahagian prompt yang dikenali oleh penyedia sebagai sudah diproses. Mekanisme, saiz diskaun, dan sejauh mana ia diterbitkan berbeza mengikut penyedia dan gerbang, dan variasi itu wajar ditangani secara khusus dan bukannya menganggap “caching disokong” sebagai satu ciri seragam.
Apakah penetapan harga input dicache, dan apakah yang bukan
Penetapan harga input dicache memberikan diskaun pada token input dalam permintaan yang sepadan dengan awalan yang dihantar sebelum ini. Ia tidak memberikan diskaun pada token output, dan ia bukan perkara yang sama seperti gerbang menyahgandakan dua permintaan yang sama sepenuhnya dan memulangkan satu respons secara percuma — itu ialah mekanisme berbeza yang sesetengah gerbang tawarkan secara berasingan. Penetapan harga input dicache adalah khusus tentang membayar lebih rendah untuk bahagian prompt yang penyedia model telah lihat baru-baru ini, bukan tentang melangkau penjanaan sepenuhnya.
Ia juga bukan percuma untuk dicipta. Nota harga GPT-5.6 OpenAI menyatakan bahawa tulisan cache dicaj pada 1.25 kali kadar input tanpa cache, manakala bacaan cache menerima diskaun 90%. Premium tulisan pertama itu menjejaskan titik pulang modal dan mudah terlepas pandang jika perbandingan hanya menunjukkan kadar bacaan yang didiskaunkan. Penyedia lain mungkin menggunakan caj berasaskan penyimpanan dan bukannya model tulisan yang sama, jadi kos tulisan dan penyimpanan harus disemak secara berasingan.
Dalam amalan, unit cache boleh dibil ialah awalan prompt boleh guna semula dan bukannya koleksi ayat berulang yang sewenang-wenangnya. Penyedia melakukan tokenisasi dan padanan kandungan mengikut tertib, jadi bahan yang boleh diguna semula perlu muncul sebelum bahagian hujung yang khusus permintaan. Arahan sistem yang stabil, definisi alatan, polisi, dan bahan rujukan patut berada berhampiran permulaan; mesej pengguna yang berubah, setem masa, ID permintaan, atau petikan carian yang diambil patut berada kemudian. Malah perubahan yang secara semantik tidak memudaratkan berhampiran bahagian depan boleh mengalihkan tokenisasi atau memecahkan padanan untuk semua yang mengikutinya.
Peraturan kelayakan juga khusus model. Penyedia mungkin memerlukan panjang prompt minimum, hanya mengenali titik hentian yang didokumenkan, atau mendedahkan medan cache-control yang jelas. Entri cache boleh luput antara panggilan, dan gerbang mungkin perlu mengekalkan permintaan berkaitan pada laluan huluan yang serasi. Ini bermakna penyebaran harus menganggap hit cache sebagai hasil yang diperhatikan, bukan sebagai andaian yang dibuat daripada keserupaan prompt. Prompt yang distrukturkan dengan baik meningkatkan kebarangkalian guna semula, tetapi metadata respons dan invois menentukan sama ada kadar diskaun sebenarnya digunakan.
Apa yang sebenarnya diterbitkan, mengikut model dan mengikut gerbang
Jadual di bawah ialah snapshot harga yang disemak pada 29 Julai 2026. Harga dalam dolar AS per 1 juta token kecuali dinyatakan sebaliknya. Baris-baris membandingkan maklumat umum semasa untuk GPT-5.6 Terra dan Gemini 3.6 Flash merentas penyedia model, CometAPI, dan OpenRouter; ia tidak harus dianggap sebagai tarif kekal.
| Model | Gerbang | Input standard | Input dicache (bacaan) | Tulis cache | Diskaun dinyatakan? |
|---|---|---|---|---|---|
| GPT-5.6 Terra | Kadar rasmi OpenAI | $2.50 / 1M | $0.25 / 1M | $3.13 / 1M | Ya — 90% diskaun, dinyatakan secara langsung |
| GPT-5.6 Terra | CometAPI | $2.00 / 1M | $0.20 / 1M | $2.50 / 1M | Ya — disenaraikan pada halaman harga CometAPI sendiri |
| GPT-5.6 Terra | OpenRouter | $2.50 / 1M | Tidak disenaraikan sebagai kadar khusus | Tidak disenaraikan | Tidak — diterangkan hanya sebagai "60–80% lebih murah" secara agregat, tiada angka khusus per model |
| Gemini 3.6 Flash | Kadar rasmi Google | $1.50 / 1M | $0.15 / 1M (mengikut pengumuman Google) | Tidak didedahkan | Ya, semasa pelancaran — melalui dokumentasi model Google |
| Gemini 3.6 Flash | CometAPI | $1.20 / 1M | Tidak disenaraikan sebagai kadar khusus | Tidak didedahkan | Tidak — halaman CometAPI menanda "Caching" sebagai ciri disokong tetapi tidak menerbitkan angka input dicache khusus untuk model ini setakat tulisan ini |
| Gemini 3.6 Flash | OpenRouter | $1.50 / 1M | Tidak disenaraikan sebagai kadar khusus | Tidak didedahkan | Tidak — dokumentasi OpenRouter menerangkan pengganda cache Google secara umum (0.25x input senarai) dan bukan mengesahkan kadar khusus model ini |
Bacalah jadual sebagai snapshot khusus model dan laluan. Halaman model GPT-5.6 CometAPI memperincikan GPT-5.6 Terra pada $2.00 input standard, $0.20 input dicache, dan $2.50 tulisan cache per 1 juta token. Halaman model Gemini 3.6 Flash CometAPI pada masa ini menerbitkan $1.20 input dan $6.00 output, tetapi tidak menunjukkan harga input dicache atau penyimpanan cache yang berasingan. Harga API Pembangun Gemini Google menyenaraikan peringkat Standard pada $1.50 input, $0.15 cache konteks, dan $1.00 per 1 juta token per jam untuk penyimpanan. OpenRouter kini mendedahkan medan cache khusus model melalui Models API: laluan lalai GPT-5.6 Terra termasuk harga promosi lebih rendah dan peringkat konteks panjang yang berasingan lebih tinggi, manakala entri Gemini 3.6 Flash memaparkan nilai Standard, Flex, dan Priority yang berbeza. Ini lebih tepat daripada menggunakan satu pengganda cache generik kepada setiap model.
Mengapa harga gerbang dan penyedia boleh berbeza
Harga gerbang tidak semestinya markup ke atas satu harga senarai huluan yang tidak berubah. Ia mungkin mencerminkan kapasiti yang dirundingkan, promosi sementara, peringkat perkhidmatan yang berbeza, atau aturan komersial khusus laluan. Nama model juga boleh memetakan kepada pelbagai varian huluan yang harganya berubah mengikut panjang konteks atau jaminan latensi. Entri GPT-5.6 Terra OpenRouter, sebagai contoh, menerbitkan laluan lalai dan ganti lebih mahal apabila input mencapai ambang konteks panjangnya. Google memisahkan harga Standard, Batch, Flex, dan Priority untuk Gemini 3.6 Flash. Satu baris perbandingan oleh itu memerlukan tarikh, laluan, peringkat, dan andaian konteks untuk kekal bermakna.
Sebaliknya juga penting: jika halaman gerbang tidak menerbitkan baris bacaan cache yang berasingan, ketiadaan itu tidak sepatutnya ditafsirkan sebagai sama ada “caching tidak tersedia” atau “diskaun langsung penyedia terpakai secara automatik.” Gerbang mungkin meneruskan ciri huluan tanpa memperincikannya, mendedahkannya hanya pada laluan tertentu, atau mengebil permintaan di bawah kadar input normalnya. Pendekatan yang wajar ialah menggunakan halaman model semasa gerbang sendiri untuk perancangan, kemudian mengesahkan kadar sebenar daripada rekod penggunaan atau data pengebilan. Dokumentasi penyedia masih berguna untuk memahami mekanisme, tetapi ia tidak dengan sendirinya menetapkan terma komersial perantara.
Di mana diskaun benar-benar penting
Senario yang benar-benar mengubah kos dengan ketara ialah awalan statik yang besar dipasangkan dengan permintaan kecil yang berubah — prompt sistem atau set skema alatan yang dihantar semula pada setiap panggilan dalam gelung ejen, dokumen rujukan panjang yang ditanya berulang kali dengan soalan berbeza, atau sejarah perbualan yang dihantar semula pada setiap giliran chatbot. Untuk beban kerja sebegitu, jurang antara membayar harga input penuh pada keseluruhan awalan setiap kali berbanding membayar premium tulisan sekali dan kadar bacaan yang didiskaunkan selepas itu akan bertambah mengikut volum panggilan. Ia tidak memberikan apa-apa untuk beban kerja yang tidak mengulangi awalan — permintaan sekali sahaja tidak mempunyai kandungan dicache untuk didiskaunkan pada awalnya.
Pengiraan pulang modal praktikal membandingkan kos tanpa cache bagi awalan berulang merentas semua panggilan dengan kos tulisan cache atau penyimpanan ditambah bacaan cache yang didiskaunkan pada panggilan kemudian. Keputusan bergantung pada saiz awalan, bilangan hit cache yang berjaya, luput cache, dan sama ada gerbang mengekalkan permintaan pada laluan penyedia yang serasi. Jika keadaan tersebut tidak stabil, diskaun utama boleh melebih anggar penjimatan yang direalisasikan dalam produksi.
Model kos ringkas untuk awalan berulang
Biarkan P ialah bilangan token dalam awalan stabil dan N bilangan panggilan yang menggunanya semula. Jika U ialah harga input tanpa cache per token, awalan tersebut berharga N × P × U tanpa caching. Anggaran dicache yang dipermudah ialah P × W + (N − 1) × P × R + S, di mana W ialah harga tulisan cache, R ialah harga bacaan cache, dan S ialah sebarang caj penyimpanan sepanjang tempoh. Formula menganggap panggilan pertama mencipta cache dan setiap panggilan kemudian ialah hit yang berjaya. Ia mengecualikan bahagian hujung berubah setiap permintaan, token output, percubaan semula, dan sebarang perubahan laluan yang menyebabkan miss.
Pertimbangkan contoh ilustratif awalan 100,000 token yang digunakan semula untuk 20 panggilan pada kadar rasmi GPT-5.6 Terra. Pada $2.50 per 1 juta token input tanpa cache, memproses berulang awalan itu akan berharga $5.00. Menggunakan kadar tulisan 1.25 kali dan kadar bacaan dengan diskaun 90% yang diterbitkan, satu tulisan 100,000 token akan berharga kira-kira $0.3125 dan sembilan belas bacaan berharga kira-kira $0.475, untuk kos awalan gabungan lebih kurang $0.7875. Perbezaannya kira-kira $4.21 sebelum kos input dan output berubah. Ini ialah ilustrasi, bukan sebut harga: ia hanya terpakai jika kesemua sembilan belas panggilan kemudian mengenai cache yang sama dan sah serta tiada caj penyimpanan atau penghalaan tambahan dikenakan.
Titik pulang modal datang terus daripada model yang sama. Premium tulisan dibenarkan hanya apabila bacaan didiskaunkan mencukupi berlaku sebelum luput. Untuk beban kerja dengan sesi pendek, pengeditan prompt kerap, atau pertautan laluan yang lemah, cache mungkin dicipta semula lebih kerap daripada jangkaan. Untuk gelung ejen jangka panjang atau analisis dokumen berulang dengan awalan stabil, bilangan hit boleh jauh lebih tinggi. Oleh itu, ramalan harus menggunakan julat kadar hit yang diperhatikan dan bukan menganggap urutan sempurna selepas panggilan pertama.
Corak pelaksanaan yang meningkatkan guna semula cache
Pembinaan prompt mempunyai kesan lebih besar ke atas kadar hit daripada yang dibayangkan oleh banyak hamparan harga. Letakkan bahan yang paling stabil dahulu dan kekalkan serialisasinya deterministik: arahan sistem, skema alatan, teks polisi, dan konteks rujukan bersama harus mengekalkan tertib, jarak kosong, dan representasi medan yang sama merentas panggilan berkaitan. Lampirkan kandungan volatil kemudian. Elakkan menyuntik setem masa, pengecam rawak, kaunter yang sentiasa berubah, atau hasil carian khusus permintaan ke dalam awalan boleh guna semula melainkan ia benar-benar diperlukan di situ.
Versikan bahan stabil secara sengaja. Jika skema alatan atau polisi berubah, tetapkan versi baharu secara konsisten dan bukannya membenarkan pelbagai varian yang hampir sama beredar. Untuk beban kerja perbualan atau berasaskan ejen, guna semula pengecam sesi stabil atau kunci cache apabila API menyokongnya, dan elakkan menukar penyedia dalam urutan yang bergantung pada cache yang sama. OpenRouter mendokumenkan penghalaan melekat-pada-penyedia untuk caching prompt dan mendedahkan kawalan seperti session_id dan prompt_cache_key; kawalan ini boleh menambah baik kesinambungan, tetapi ia tidak menjamin hit apabila cache huluan sejuk atau luput.
Aplikasi juga harus merendah tara dengan kemas apabila berlaku miss. Caching ialah pengoptimuman kos dan latensi, bukan kebergantungan terhadap ketepatan. Permintaan mesti tetap menghasilkan hasil yang sah sama ada cache tersedia atau tidak, dan logik percubaan semula tidak sepatutnya secara membuta tuli mencipta tulisan berulang. Pemisahan itu menjadikannya lebih selamat untuk membandingkan laluan: pasukan boleh menukar polisi caching atau konfigurasi gerbang tanpa menukar tingkah laku semantik aplikasi.
Cara mengesahkan ekonomi cache dalam produksi
Mulakan dengan telemetri per permintaan dan bukannya invois bulanan. Log pengenal pasti model yang tepat, laluan gerbang atau penyedia apabila didedahkan, peringkat perkhidmatan, jumlah token input, token bacaan cache, token tulisan cache, token output, latensi, dan kos dibil. Objek penggunaan OpenRouter merangkumi cached_tokens dan cache_write_tokens; penyedia lain mendedahkan butiran setara di bawah nama medan yang berbeza. Simpan medan penggunaan mentah supaya perubahan harga kemudian tidak memadam bukti yang diperlukan untuk membina semula kos.
Agregatkan data mengikut versi prompt dan beban kerja, bukan hanya mengikut model. Ukuran berguna termasuk bahagian permintaan layak yang mengenai cache, bahagian token input yang dibil pada kadar bacaan, tulisan per bacaan yang berjaya, masa antara tulisan dan hit terakhir, dan kos yang direalisasikan per permintaan. Kadar hit peringkat permintaan yang tinggi masih boleh memberikan nilai kecil jika awalan dicache kecil, manakala kadar hit lebih rendah pada awalan yang sangat besar mungkin menjimatkan lebih banyak. Pasangkan ukuran itu dengan persentil latensi, kerana laluan lebih murah yang kerap miss atau menukar laluan mungkin lebih buruk dari segi operasi.
Akhirnya, semak anomali dan bukannya melicinkannya. Penurunan mendadak dalam token dicache mungkin menunjukkan pelancaran versi prompt, serialisasi tidak stabil, entri luput, sempadan peringkat konteks panjang, atau perubahan laluan gerbang. Bandingkan permintaan yang terjejas dengan halaman model semasa dan dokumentasi penyedia, kemudian sahkan kadar dibil. Ini menutup jurang antara diskaun yang diterbitkan dan penjimatan yang sebenarnya direalisasikan aplikasi.
Apa yang perlu diperiksa sebelum menganggap kadar terpakai
Sahkan lima perkara sebelum menggunakan kadar yang diterbitkan dalam belanjawan: model dan peringkat perkhidmatan yang tepat, awalan boleh guna semula minimum atau titik hentian cache yang jelas, caj tulisan pertama atau penyimpanan, jangka hayat cache, dan bukti bahawa permintaan sebenarnya mengenai cache. OpenAI pada masa ini menyatakan hayat cache minimum 30 minit untuk GPT-5.6, tetapi itu bukan peraturan pengekalan sejagat. Google menerbitkan kadar berbeza untuk peringkat Standard, Batch, Flex, dan Priority. Gerbang juga boleh menghala antara penyedia atau peringkat, jadi laluan yang dipilih penting. Dokumentasi prompt-caching OpenRouter mengesyorkan menyemak medan penggunaan respons seperti cached_tokens dan cache_write_tokens. Untuk sebarang anggaran produksi, bandingkan halaman model semasa dengan pengebilan dan metadata penggunaan sebenar dan bukannya bergantung semata-mata pada label umum “caching disokong”.
