TL;DR
Kos token ejen AI meningkat apabila setiap langkah berulang kali memproses arahan, sejarah perbualan, hasil alat dan keadaan perantaraan.
Kurangkan volum token dengan bajet peringkat larian, penapisan hasil alat, pemadatan konteks, had percubaan semula dan penaakulan terkawal. Guna cache prompt untuk input berulang yang stabil, tetapi optimumkan gelung ejen sebelum menukar kepada model yang lebih murah.
Metrik produksi paling berguna ialah kos per tugas berjaya, diukur merentas keseluruhan larian—bukan harga per permintaan atau saiz konteks panggilan terakhir.
Panduan ini memberi tumpuan khusus kepada ejen AI berbilang langkah. Ia menerangkan bagaimana konteks berulang berganda sepanjang larian, bagaimana mengenal pasti punca pembaziran terbesar, dan kawalan mana yang perlu dilaksanakan dahulu.
Introduction
Bot sembang mungkin membuat satu permintaan model bagi setiap mesej pengguna. Ejen AI boleh membuat 10, 20, atau lebih panggilan sebelum menyiapkan satu tugas.
Setiap langkah mungkin menghantar semula arahan, sejarah perbualan, hasil alat, dan keadaan perantaraan. Percubaan semula, penaakulan, dan subejen menambah lagi penggunaan, jadi jawapan akhir yang pendek masih boleh menggunakan sejumlah besar token.
Apabila penggunaan meningkat, kos ini menjadi sukar diramal dan boleh dengan cepat mengurangkan margin produk. Untuk menurunkannya, perlu mengoptimumkan keseluruhan gelung ejen—bukan sekadar bertukar kepada model yang lebih murah.
Artikel ini menumpukan pada kos khusus ejen. Untuk panduan lebih luas yang meliputi cache prompt, cache respons tepat, cache semantik, perutean model dan pengurusan kos API umum, lihat How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).
Why Do AI Agent Token Costs Compound?
Dalam ejen berbilang langkah, kos satu tugas ialah jumlah setiap panggilan model—bukan hanya respons akhir.
Sumber utama penggunaan Token Ejen ialah:
| Punca kos | Puncanya | Kawalan pertama untuk diuji |
|---|---|---|
| Arahan berulang | Prompt sistem, skema alat, dasar, contoh | Menstabilkan prefiks boleh guna semula |
| Sejarah yang bertambah | Giliran terdahulu dihantar semula pada setiap langkah | Padatkan atau ambil keadaan secara terpilih |
| Hasil alat | Halaman carian, fail, log dan rekod pangkalan data | Tapis sebelum menambah ke konteks |
| Output perantaraan | Pelan, mesej status dan keputusan alat yang verbose | Gunakan output berstruktur yang padat |
| Token penaakulan | Usaha penaakulan tinggi pada langkah rutin | Selaraskan usaha dengan kerumitan tugas |
| Percubaan semula | Output tidak sah, tamat masa, ralat alat dan had kadar | Klasifikasikan kegagalan dan hadkan percubaan semula |
| Subejen | Pekerja menggandakan konteks, alat dan analisis | Hantar setiap pekerja sebahagian konteks yang sempit |
Terdapat dua cara berbeza untuk mengurangkan bil:
- Memproses lebih sedikit token melalui penapisan, pemadatan, had output dan kawalan gelung.
- Mengurangkan harga efektif token yang diperlukan melalui cache prompt atau pemilihan model.
Perbezaan utama: Cache prompt menurunkan kos input berulang. Pemadatan konteks mengurangkan input berulang itu sendiri.
How Can a 12-Step Agent Process 147,000 Tokens?
Pertimbangkan ejen sokongan hipotetikal dengan:
- Prefiks stabil 4,000 token
- 1,500 token baharu ditambah selepas setiap langkah
- Keseluruhan sejarah terkumpul dihantar semula pada setiap permintaan
- 12 jumlah panggilan model
Input pada langkah n ialah:
Input at step n = 4,000 + 1,500 × (n - 1)
Input kumulatif merentas 12 panggilan ialah:
Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens
Panggilan akhir hanya mengandungi 20,500 token input, tetapi keseluruhan larian memproses 147,000 token input kumulatif.
Kini terapkan dua kawalan:
- Cache prefiks stabil 4,000 token selepas panggilan pertama.
- Padatkan sejarah selepas langkah keenam menjadi ringkasan keadaan 2,500 token.
| Senario | Input tidak dicache | Input dicache | Jumlah input diproses | Perubahan |
|---|---|---|---|---|
| Sejarah penuh pada setiap langkah | 147,000 | 0 | 147,000 | Garis asas |
| Prefiks stabil dicache | 103,000 | 44,000 | 147,000 | Volum sama, campuran lebih murah |
| Cache + pemadatan | 64,000 | 44,000 | 108,000 | 26.5% lebih sedikit token diproses |
Ini ialah pengiraan perancangan, bukan penanda aras penyedia.
Ia mengandaikan bahawa setiap permintaan termasuk keseluruhan sejarah terkumpul. Ejen yang membina keadaan secara terpilih, meringkaskan mesej lama atau hanya mendapatkan maklumat berkaitan mungkin mengikuti lengkung kos berbeza.
Peraturan pertumbuhan kos: Ukur input kumulatif merentas keseluruhan larian. Saiz konteks akhir tidak mewakili jumlah token yang diproses.

Which Metrics Reveal Agent Token Waste?
Jangan mula dengan menukar model. Kenal pasti dahulu di mana aliran kerja membelanjakan token tanpa memperbaiki hasil.
Rekod medan-medan ini bagi setiap langkah Ejen:
| Medan | Sebab penting |
|---|---|
run_id, step_id, parent_step_id | Membina semula pokok Ejen dan subejen |
| Rendered input tokens | Menunjukkan bagaimana konteks berkembang antara panggilan |
| Cached and uncached input | Memisahkan semula guna daripada konteks baharu |
| Output and reasoning tokens | Mengenal pasti langkah penjanaan yang mahal |
| Tool result size and retained tokens | Menunjukkan berapa banyak bukti mentah memasuki prompt seterusnya |
| Retry reason and attempt number | Mengenal pasti kegagalan berulang |
| Compaction tokens before and after | Mengukur pengurangan konteks sebenar |
| Worker ID and returned tokens | Mendedahkan kerja subejen yang berganda |
| Accepted, rejected, or escalated result | Menghubungkan kos kepada kualiti tugas |
Metrik utama sepatutnya:
cost per successful task
= total workflow cost
/ accepted tasks
Larian yang lebih murah bukanlah peningkatan apabila ia menyebabkan lebih banyak tugas gagal, alat diulang, atau pembetulan manusia.
Empat metrik khusus ejen membantu mencari punca.
Context Amplification
context amplification
= cumulative input tokens
/ final-step input tokens
Nilai tinggi menunjukkan konteks awal telah diproses berulang kali.
Tool Retention Ratio
tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools
Nisbah tinggi boleh menunjukkan bahawa ejen membawa terlalu banyak bukti mentah antara langkah.
Retry Tax
retry tax
= retry and repair cost
/ total workflow cost
Reasoning Share
reasoning share
= reasoning-token cost
/ total model cost
Ukur setiap beban kerja secara berasingan. Ejen penyelidikan, pengekodan, pelayar, dan sokongan pelanggan tidak sepatutnya berkongsi garis dasar global yang sama.
Six Ways to Reduce AI Agent Token Costs
1. Set a Budget for the Complete Run
Had output per permintaan tidak mengawal ejen berbilang langkah.
Tetapkan had peringkat larian untuk:
- Jumlah langkah model
- Input dan output kumulatif
- Panggilan alat dan saiz hasil alat
- Percubaan semula mengikut jenis kegagalan
- Subejen
- Jumlah masa berlalu atau kos dianggar
Contoh Python neutral penyedia berikut menilai larian sebelum setiap panggilan model:
from dataclasses import dataclass
from enum import Enum
class Action(str, Enum):
CONTINUE = "continue"
COMPACT = "compact"
STOP = "stop"
@dataclass(frozen=True)
class Budget:
max_steps: int = 12
max_input_tokens: int = 120_000
max_output_tokens: int = 18_000
compact_at: float = 0.80
@dataclass
class Usage:
steps: int = 0
input_tokens: int = 0
output_tokens: int = 0
def evaluate_budget(usage: Usage, budget: Budget) -> Action:
if (
usage.steps >= budget.max_steps
or usage.input_tokens >= budget.max_input_tokens
or usage.output_tokens >= budget.max_output_tokens
):
return Action.STOP
input_ratio = usage.input_tokens / budget.max_input_tokens
if input_ratio >= budget.compact_at:
return Action.COMPACT
return Action.CONTINUE
Jalankan semakan sebelum setiap permintaan model dan kemas kini Usage daripada data token yang dilaporkan penyedia.
Pada 80% bajet input, padatkan keadaan atau sempitkan pertanyaan alat seterusnya. Pada 100%, hentikan dengan sebab berstruktur.
Kesilapan biasa: Mengehadkan setiap respons sambil membenarkan langkah, alat dan percubaan semula tanpa had.
2. Filter Tool Results Before They Enter the Transcript
Pulangkan hanya bukti yang diperlukan untuk keputusan ejen seterusnya.
Jangan lampirkan keseluruhan:
- Halaman web
- Fail log
- Struktur repositori
- Respons pangkalan data
- Sesi terminal
- Muatan API
apabila langkah seterusnya hanya memerlukan beberapa medan.
Alat carian mungkin memulangkan:
{
"source_id": "search_17",
"title": "Relevant page title",
"url": "https://example.com/page",
"relevant_passage": "A short evidence block"
}
Simpan artifak penuh di luar prompt dan ambil semula bahagian yang lebih sempit kemudian.
Peraturan penapisan alat: Pulangkan medan yang diperlukan untuk keputusan seterusnya—bukan setiap medan yang mungkin berguna kemudian.
Kesilapan biasa: Memotong 1,000 aksara pertama muatan JSON. Ini boleh merosakkan struktur atau mengalih keluar rekod yang sebenarnya diperlukan ejen.
Huraikan muatan terlebih dahulu, pilih medan secara berstruktur, hadkan tatasusunan, kemudian serialkan JSON yang sah.
3. Compact Operational State, Not Just Conversation Text
Pemadatan harus mengekalkan maklumat yang diperlukan untuk meneruskan tugas sambil membuang sejarah yang tidak lagi mempengaruhi tindakan seterusnya.
Keadaan padat yang berguna mengandungi:
- Matlamat pengguna dan kriteria kejayaan
- Keputusan yang telah dibuat
- Fakta yang disahkan dan ID sumber
- Fail atau rekod yang diubah
- Pendekatan yang gagal
- Soalan terbuka
- Tindakan seterusnya
- Kekangan keselamatan dan output
Ia tidak sepatutnya menceritakan semula keseluruhan perbualan.
OpenAI mendokumenkan pemadatan untuk interaksi jangka panjang Responses API. Anthropic menyediakan kawalan pengurusan konteks untuk membersihkan atau meringkaskan kandungan lama. Pelaksanaannya berbeza, jadi semak medan penyedia semasa sebelum integrasi.
Peraturan pemadatan: Kekalkan keputusan dan kerja yang belum diselesaikan. Buang naratif dan bukti yang boleh diambil semula.
Kesilapan biasa: Menggugurkan ID sumber, nama fail yang diubah, pendekatan yang ditolak, atau kekangan yang belum diselesaikan.
Selepas menambah pemadatan, ukur sama ada ejen mengulangi carian atau panggilan alat. Prompt yang lebih pendek tidak lebih murah jika ejen perlu membina semula keadaan yang hilang.
4. Keep the Reusable Prefix Stable
Prompt ejen sering mengandungi blok boleh guna semula yang besar:
- Arahan sistem
- Skema alat
- Dasar keselamatan
- Format output
- Bahan rujukan dikongsi
- Arahan repositori atau produk
Letakkan unsur stabil ini sebelum data khusus permintaan:
- Arahan sistem
- Dasar dan kekangan
- Definisi alat
- Contoh stabil
- Bahan rujukan dikongsi
- Data khusus permintaan
Elakkan meletakkan cap masa, ID permintaan, data sesi, atau nilai yang kerap berubah berhampiran permulaan.
Cache paling berguna apabila prefiks panjang, stabil, dan digunakan semula. Ia mungkin tidak menjimatkan untuk sesi pendek atau prompt yang sering berubah.
Kesilapan biasa: Mengoptimumkan kadar kejayaan cache tanpa mengukur kos tulis cache, baca, atau storan.
Untuk perbandingan lebih luas antara cache prompt penyedia, cache respons tepat, dan cache semantik, lihat How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).
5. Prevent Retries From Replaying the Same Context
Percubaan semula ialah satu lagi langkah ejen, selalunya dengan prompt besar yang sama.
Jangan ulang permintaan yang gagal tanpa menukar punca kegagalan.
| Kegagalan | Respons yang lebih baik |
|---|---|
| Output berstruktur tidak sah | Pulangkan ralat validasi dan cuba semula sekali |
| Tamat masa alat | Cuba semula operasi idempotensi sekali, kemudian hentikan atau guna fallback |
| Limpahan konteks | Padatkan keadaan atau ambil bukti yang kurang |
| Panggilan alat berulang | Nyahgandakan menggunakan hash operasi |
| Had kadar | Undur berperingkat atau guna laluan fallback yang telah diuji |
| Hasil keyakinan rendah | Minta maklumat yang hilang atau eskalasi |
Guna kunci idempotensi untuk operasi yang mempunyai kesan sampingan seperti pembayaran, e-mel, deployment dan tulis pangkalan data.
Kesilapan biasa: Mengulang model yang dihadkan kadar beberapa kali sambil menghantar semula keseluruhan konteks ejen pada setiap percubaan.
Jejaki cukai percubaan semula mengikut jenis kegagalan supaya pasukan boleh membaiki gelung terbesar dahulu.
6. Limit Reasoning and Subagents to Steps That Need Them
Tidak setiap langkah ejen memerlukan penaakulan mendalam.
Pengekstrakan, pemformatan, pengelasan, validasi, dan pemilihan alat rutin selalunya boleh menggunakan usaha penaakulan lebih rendah dan output berstruktur yang padat.
Simpan usaha penaakulan lebih tinggi untuk tugas seperti:
- Perancangan kompleks
- Pengekodan sukar
- Sintesis berbilang dokumen
- Keputusan yang samar
- Pemulihan daripada kegagalan pelaksanaan
Peraturan penaakulan: Gunakan usaha penaakulan paling rendah yang mengekalkan kadar tugas diterima.
Subejen juga memerlukan sempadan yang jelas. Berikan setiap pekerja:
- Tugas yang sempit
- Bahagian konteks khusus tugas
- Senarai benarkan alat
- Bajet token
- Skema output yang padat
Ejen akar biasanya memerlukan penemuan, ID bukti, keyakinan, dan isu yang belum selesai—bukan transkrip penuh pekerja.
Peraturan subejen: Paralelkan kerja bebas, bukan konteks yang diduplikasi.
Kesilapan biasa: Menghantar sejarah ejen akar yang lengkap kepada setiap pekerja sebelum memberikan tugas yang sempit.
Which Optimization Should You Apply First?
Gunakan telemetri ejen untuk memilih intervensi pertama.
Ambang di bawah ialah pencetus siasatan, bukan standard sejagat.
| Isyarat yang diperhatikan | Mulakan di sini |
|---|---|
| Amplifikasi konteks tinggi | Padatkan sejarah dan ambil keadaan secara terpilih |
| Output alat mendominasi prompt | Tapis medan dan simpan artifak penuh secara luaran |
| Cukai percubaan semula tinggi | Baiki validasi, tamat masa, dan panggilan alat berulang |
| Bahagian penaakulan tinggi | Rendahkan usaha pada langkah rutin |
| Subejen mengulang bukti yang sama | Sempitkan skop pekerja dan bahagian konteks |
| Input cache kekal rendah | Stabilkan prefiks boleh guna semula |
| Kos kekal tinggi selepas pembersihan gelung | Bandingkan laluan model kos lebih rendah |
Urutan pelaksanaan yang selamat ialah:
- Ukur input kumulatif, pengekalan alat, percubaan semula, dan penaakulan.
- Tambah had tegar untuk langkah, alat, percubaan semula, dan jumlah token.
- Tapis hasil alat yang besar.
- Padatkan keadaan lama pada ambang yang diukur.
- Stabilkan prefiks prompt boleh guna semula.
- Bandingkan laluan model hanya selepas gelung ejen bersih.
Ubah satu pemboleh ubah utama pada satu masa dan ulang set penilaian yang sama.
Bandingkan:
- Kadar tugas diterima
- Kos per tugas berjaya
- Input kumulatif
- Kiraan panggilan alat
- Cukai percubaan semula
- Bahagian penaakulan
- Kependaman p50 dan p95
- Masa semakan manusia
Kembalikan perubahan yang menjimatkan token dengan mengurangkan kualiti tugas atau mengeluarkan bukti yang diperlukan.
Test Agent Workflows With CometAPI
Sebelum menjalankan penilaian berbilang model, gunakan halaman harga CometAPI (https://www.cometapi.com/pricing/?utm_source=chatgpt.com) dan panduan anggaran kos (https://apidoc.cometapi.com/guides/how-to-estimate-cost-before-calling-a-model) untuk menganggarkan kos input, output, token cache, dan penaakulan.
Kemudian gunakan katalog model (https://www.cometapi.com/models/?utm_source=chatgpt.com) untuk mengenal pasti laluan yang layak dan Quickstart (https://www.cometapi.com/quickstart/?utm_source=chatgpt.com) untuk mengkonfigurasi klien serasi OpenAI.
Untuk fallback produksi, ikuti panduan fallback model CometAPI (https://apidoc.cometapi.com/guides/model-fallback-with-cometapi) untuk menukar laluan tanpa mengulang panggilan alat yang telah selesai atau membuang keadaan yang telah divalidasi.
Akses bersatu memudahkan perbandingan model dan integrasi fallback. Bajet token, pemadatan, validasi, penapisan alat, had percubaan semula, dan kriteria penerimaan masih berada di peringkat aplikasi.
FAQ
Mengapa ejen AI menggunakan lebih banyak token daripada bot sembang?
Ejen membuat berbilang panggilan model dan mungkin menghantar semula mesej terdahulu, hasil alat, arahan, dan keadaan perantaraan pada setiap langkah. Ini menyebabkan konteks awal diproses berulang kali.
Adakah cache prompt mengurangkan penggunaan tetingkap konteks?
Tidak. Cache prompt boleh mengurangkan harga efektif atau kependaman input berulang, tetapi token cache masih menjadi sebahagian daripada konteks yang diproses. Gunakan pemadatan, penapisan, atau pengambilan terpilih untuk mengurangkan saiz prompt.
Bilakah ejen AI perlu memadatkan konteksnya?
Padatkan sebelum pertumbuhan konteks mula menjejaskan kos, kependaman, atau ruang output yang tersedia. Sahkan bahawa keadaan padat mengekalkan keputusan, ID bukti, fail yang diubah, soalan terbuka, dan kekangan keselamatan.
Adakah subejen mengurangkan kos token?
Tidak secara automatik. Ia boleh mengurangkan masa berlalu atau meningkatkan liputan untuk kerja bebas, tetapi konteks berganda dan analisis bertindih sering meningkatkan jumlah penggunaan token.
Apakah metrik terbaik untuk pengoptimuman kos ejen AI?
Gunakan kos per tugas berjaya sebagai metrik utama. Diagnosa dengan input kumulatif, amplifikasi konteks, pengekalan alat, cukai percubaan semula, bahagian penaakulan, kependaman, dan masa semakan manusia.
