DeepSeek Vision and Grok Imagine models are now live on CometAPI →
guide/Penyelidikan CometAPI

Cara Mengurangkan Kos Token Ejen AI dalam Persekitaran Pengeluaran

Kurangkan kos token ejen AI dengan mengawal pengembangan konteks, keluaran alat, percubaan semula, penaakulan dan subejen. Termasuk contoh kos 12 langkah.

CometAPI
Mia MarenPasukan penyelidikan model AI dan API
Dikemas kini Aug 24, 2026 12 min baca
Cara Mengurangkan Kos Token Ejen AI dalam Persekitaran Pengeluaran
Guna corak ini

Buat panggilan API pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Kos token ejen AI meningkat apabila setiap langkah berulang kali memproses arahan, sejarah perbualan, hasil alat dan keadaan perantaraan.

Kurangkan volum token dengan bajet peringkat larian, penapisan hasil alat, pemadatan konteks, had percubaan semula dan penaakulan terkawal. Guna cache prompt untuk input berulang yang stabil, tetapi optimumkan gelung ejen sebelum menukar kepada model yang lebih murah.

Metrik produksi paling berguna ialah kos per tugas berjaya, diukur merentas keseluruhan larian—bukan harga per permintaan atau saiz konteks panggilan terakhir.

Panduan ini memberi tumpuan khusus kepada ejen AI berbilang langkah. Ia menerangkan bagaimana konteks berulang berganda sepanjang larian, bagaimana mengenal pasti punca pembaziran terbesar, dan kawalan mana yang perlu dilaksanakan dahulu.

Introduction

Bot sembang mungkin membuat satu permintaan model bagi setiap mesej pengguna. Ejen AI boleh membuat 10, 20, atau lebih panggilan sebelum menyiapkan satu tugas.

Setiap langkah mungkin menghantar semula arahan, sejarah perbualan, hasil alat, dan keadaan perantaraan. Percubaan semula, penaakulan, dan subejen menambah lagi penggunaan, jadi jawapan akhir yang pendek masih boleh menggunakan sejumlah besar token.

Apabila penggunaan meningkat, kos ini menjadi sukar diramal dan boleh dengan cepat mengurangkan margin produk. Untuk menurunkannya, perlu mengoptimumkan keseluruhan gelung ejen—bukan sekadar bertukar kepada model yang lebih murah.

Artikel ini menumpukan pada kos khusus ejen. Untuk panduan lebih luas yang meliputi cache prompt, cache respons tepat, cache semantik, perutean model dan pengurusan kos API umum, lihat How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).

Why Do AI Agent Token Costs Compound?

Dalam ejen berbilang langkah, kos satu tugas ialah jumlah setiap panggilan model—bukan hanya respons akhir.

Sumber utama penggunaan Token Ejen ialah:

Punca kosPuncanyaKawalan pertama untuk diuji
Arahan berulangPrompt sistem, skema alat, dasar, contohMenstabilkan prefiks boleh guna semula
Sejarah yang bertambahGiliran terdahulu dihantar semula pada setiap langkahPadatkan atau ambil keadaan secara terpilih
Hasil alatHalaman carian, fail, log dan rekod pangkalan dataTapis sebelum menambah ke konteks
Output perantaraanPelan, mesej status dan keputusan alat yang verboseGunakan output berstruktur yang padat
Token penaakulanUsaha penaakulan tinggi pada langkah rutinSelaraskan usaha dengan kerumitan tugas
Percubaan semulaOutput tidak sah, tamat masa, ralat alat dan had kadarKlasifikasikan kegagalan dan hadkan percubaan semula
SubejenPekerja menggandakan konteks, alat dan analisisHantar setiap pekerja sebahagian konteks yang sempit

Terdapat dua cara berbeza untuk mengurangkan bil:

  1. Memproses lebih sedikit token melalui penapisan, pemadatan, had output dan kawalan gelung.
  2. Mengurangkan harga efektif token yang diperlukan melalui cache prompt atau pemilihan model.

Perbezaan utama: Cache prompt menurunkan kos input berulang. Pemadatan konteks mengurangkan input berulang itu sendiri.

How Can a 12-Step Agent Process 147,000 Tokens?

Pertimbangkan ejen sokongan hipotetikal dengan:

  • Prefiks stabil 4,000 token
  • 1,500 token baharu ditambah selepas setiap langkah
  • Keseluruhan sejarah terkumpul dihantar semula pada setiap permintaan
  • 12 jumlah panggilan model

Input pada langkah n ialah:

Input at step n = 4,000 + 1,500 × (n - 1)

Input kumulatif merentas 12 panggilan ialah:

Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens

Panggilan akhir hanya mengandungi 20,500 token input, tetapi keseluruhan larian memproses 147,000 token input kumulatif.

Kini terapkan dua kawalan:

  1. Cache prefiks stabil 4,000 token selepas panggilan pertama.
  2. Padatkan sejarah selepas langkah keenam menjadi ringkasan keadaan 2,500 token.
SenarioInput tidak dicacheInput dicacheJumlah input diprosesPerubahan
Sejarah penuh pada setiap langkah147,0000147,000Garis asas
Prefiks stabil dicache103,00044,000147,000Volum sama, campuran lebih murah
Cache + pemadatan64,00044,000108,00026.5% lebih sedikit token diproses

Ini ialah pengiraan perancangan, bukan penanda aras penyedia.

Ia mengandaikan bahawa setiap permintaan termasuk keseluruhan sejarah terkumpul. Ejen yang membina keadaan secara terpilih, meringkaskan mesej lama atau hanya mendapatkan maklumat berkaitan mungkin mengikuti lengkung kos berbeza.

Peraturan pertumbuhan kos: Ukur input kumulatif merentas keseluruhan larian. Saiz konteks akhir tidak mewakili jumlah token yang diproses.

imej

Which Metrics Reveal Agent Token Waste?

Jangan mula dengan menukar model. Kenal pasti dahulu di mana aliran kerja membelanjakan token tanpa memperbaiki hasil.

Rekod medan-medan ini bagi setiap langkah Ejen:

MedanSebab penting
run_id, step_id, parent_step_idMembina semula pokok Ejen dan subejen
Rendered input tokensMenunjukkan bagaimana konteks berkembang antara panggilan
Cached and uncached inputMemisahkan semula guna daripada konteks baharu
Output and reasoning tokensMengenal pasti langkah penjanaan yang mahal
Tool result size and retained tokensMenunjukkan berapa banyak bukti mentah memasuki prompt seterusnya
Retry reason and attempt numberMengenal pasti kegagalan berulang
Compaction tokens before and afterMengukur pengurangan konteks sebenar
Worker ID and returned tokensMendedahkan kerja subejen yang berganda
Accepted, rejected, or escalated resultMenghubungkan kos kepada kualiti tugas

Metrik utama sepatutnya:

cost per successful task
= total workflow cost
/ accepted tasks

Larian yang lebih murah bukanlah peningkatan apabila ia menyebabkan lebih banyak tugas gagal, alat diulang, atau pembetulan manusia.

Empat metrik khusus ejen membantu mencari punca.

Context Amplification

context amplification
= cumulative input tokens
/ final-step input tokens

Nilai tinggi menunjukkan konteks awal telah diproses berulang kali.

Tool Retention Ratio

tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools

Nisbah tinggi boleh menunjukkan bahawa ejen membawa terlalu banyak bukti mentah antara langkah.

Retry Tax

retry tax
= retry and repair cost
/ total workflow cost

Reasoning Share

reasoning share
= reasoning-token cost
/ total model cost

Ukur setiap beban kerja secara berasingan. Ejen penyelidikan, pengekodan, pelayar, dan sokongan pelanggan tidak sepatutnya berkongsi garis dasar global yang sama.

Six Ways to Reduce AI Agent Token Costs

1. Set a Budget for the Complete Run

Had output per permintaan tidak mengawal ejen berbilang langkah.

Tetapkan had peringkat larian untuk:

  • Jumlah langkah model
  • Input dan output kumulatif
  • Panggilan alat dan saiz hasil alat
  • Percubaan semula mengikut jenis kegagalan
  • Subejen
  • Jumlah masa berlalu atau kos dianggar

Contoh Python neutral penyedia berikut menilai larian sebelum setiap panggilan model:

from dataclasses import dataclass
from enum import Enum


class Action(str, Enum):
    CONTINUE = "continue"
    COMPACT = "compact"
    STOP = "stop"


@dataclass(frozen=True)
class Budget:
    max_steps: int = 12
    max_input_tokens: int = 120_000
    max_output_tokens: int = 18_000
    compact_at: float = 0.80


@dataclass
class Usage:
    steps: int = 0
    input_tokens: int = 0
    output_tokens: int = 0


def evaluate_budget(usage: Usage, budget: Budget) -> Action:
    if (
        usage.steps >= budget.max_steps
        or usage.input_tokens >= budget.max_input_tokens
        or usage.output_tokens >= budget.max_output_tokens
    ):
        return Action.STOP

    input_ratio = usage.input_tokens / budget.max_input_tokens

    if input_ratio >= budget.compact_at:
        return Action.COMPACT

    return Action.CONTINUE

Jalankan semakan sebelum setiap permintaan model dan kemas kini Usage daripada data token yang dilaporkan penyedia.

Pada 80% bajet input, padatkan keadaan atau sempitkan pertanyaan alat seterusnya. Pada 100%, hentikan dengan sebab berstruktur.

Kesilapan biasa: Mengehadkan setiap respons sambil membenarkan langkah, alat dan percubaan semula tanpa had.

2. Filter Tool Results Before They Enter the Transcript

Pulangkan hanya bukti yang diperlukan untuk keputusan ejen seterusnya.

Jangan lampirkan keseluruhan:

  • Halaman web
  • Fail log
  • Struktur repositori
  • Respons pangkalan data
  • Sesi terminal
  • Muatan API

apabila langkah seterusnya hanya memerlukan beberapa medan.

Alat carian mungkin memulangkan:

{
  "source_id": "search_17",
  "title": "Relevant page title",
  "url": "https://example.com/page",
  "relevant_passage": "A short evidence block"
}

Simpan artifak penuh di luar prompt dan ambil semula bahagian yang lebih sempit kemudian.

Peraturan penapisan alat: Pulangkan medan yang diperlukan untuk keputusan seterusnya—bukan setiap medan yang mungkin berguna kemudian.

Kesilapan biasa: Memotong 1,000 aksara pertama muatan JSON. Ini boleh merosakkan struktur atau mengalih keluar rekod yang sebenarnya diperlukan ejen.

Huraikan muatan terlebih dahulu, pilih medan secara berstruktur, hadkan tatasusunan, kemudian serialkan JSON yang sah.

3. Compact Operational State, Not Just Conversation Text

Pemadatan harus mengekalkan maklumat yang diperlukan untuk meneruskan tugas sambil membuang sejarah yang tidak lagi mempengaruhi tindakan seterusnya.

Keadaan padat yang berguna mengandungi:

  • Matlamat pengguna dan kriteria kejayaan
  • Keputusan yang telah dibuat
  • Fakta yang disahkan dan ID sumber
  • Fail atau rekod yang diubah
  • Pendekatan yang gagal
  • Soalan terbuka
  • Tindakan seterusnya
  • Kekangan keselamatan dan output

Ia tidak sepatutnya menceritakan semula keseluruhan perbualan.

OpenAI mendokumenkan pemadatan untuk interaksi jangka panjang Responses API. Anthropic menyediakan kawalan pengurusan konteks untuk membersihkan atau meringkaskan kandungan lama. Pelaksanaannya berbeza, jadi semak medan penyedia semasa sebelum integrasi.

Peraturan pemadatan: Kekalkan keputusan dan kerja yang belum diselesaikan. Buang naratif dan bukti yang boleh diambil semula.

Kesilapan biasa: Menggugurkan ID sumber, nama fail yang diubah, pendekatan yang ditolak, atau kekangan yang belum diselesaikan.

Selepas menambah pemadatan, ukur sama ada ejen mengulangi carian atau panggilan alat. Prompt yang lebih pendek tidak lebih murah jika ejen perlu membina semula keadaan yang hilang.

4. Keep the Reusable Prefix Stable

Prompt ejen sering mengandungi blok boleh guna semula yang besar:

  • Arahan sistem
  • Skema alat
  • Dasar keselamatan
  • Format output
  • Bahan rujukan dikongsi
  • Arahan repositori atau produk

Letakkan unsur stabil ini sebelum data khusus permintaan:

  1. Arahan sistem
  2. Dasar dan kekangan
  3. Definisi alat
  4. Contoh stabil
  5. Bahan rujukan dikongsi
  6. Data khusus permintaan

Elakkan meletakkan cap masa, ID permintaan, data sesi, atau nilai yang kerap berubah berhampiran permulaan.

Cache paling berguna apabila prefiks panjang, stabil, dan digunakan semula. Ia mungkin tidak menjimatkan untuk sesi pendek atau prompt yang sering berubah.

Kesilapan biasa: Mengoptimumkan kadar kejayaan cache tanpa mengukur kos tulis cache, baca, atau storan.

Untuk perbandingan lebih luas antara cache prompt penyedia, cache respons tepat, dan cache semantik, lihat How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).

5. Prevent Retries From Replaying the Same Context

Percubaan semula ialah satu lagi langkah ejen, selalunya dengan prompt besar yang sama.

Jangan ulang permintaan yang gagal tanpa menukar punca kegagalan.

KegagalanRespons yang lebih baik
Output berstruktur tidak sahPulangkan ralat validasi dan cuba semula sekali
Tamat masa alatCuba semula operasi idempotensi sekali, kemudian hentikan atau guna fallback
Limpahan konteksPadatkan keadaan atau ambil bukti yang kurang
Panggilan alat berulangNyahgandakan menggunakan hash operasi
Had kadarUndur berperingkat atau guna laluan fallback yang telah diuji
Hasil keyakinan rendahMinta maklumat yang hilang atau eskalasi

Guna kunci idempotensi untuk operasi yang mempunyai kesan sampingan seperti pembayaran, e-mel, deployment dan tulis pangkalan data.

Kesilapan biasa: Mengulang model yang dihadkan kadar beberapa kali sambil menghantar semula keseluruhan konteks ejen pada setiap percubaan.

Jejaki cukai percubaan semula mengikut jenis kegagalan supaya pasukan boleh membaiki gelung terbesar dahulu.

6. Limit Reasoning and Subagents to Steps That Need Them

Tidak setiap langkah ejen memerlukan penaakulan mendalam.

Pengekstrakan, pemformatan, pengelasan, validasi, dan pemilihan alat rutin selalunya boleh menggunakan usaha penaakulan lebih rendah dan output berstruktur yang padat.

Simpan usaha penaakulan lebih tinggi untuk tugas seperti:

  • Perancangan kompleks
  • Pengekodan sukar
  • Sintesis berbilang dokumen
  • Keputusan yang samar
  • Pemulihan daripada kegagalan pelaksanaan

Peraturan penaakulan: Gunakan usaha penaakulan paling rendah yang mengekalkan kadar tugas diterima.

Subejen juga memerlukan sempadan yang jelas. Berikan setiap pekerja:

  • Tugas yang sempit
  • Bahagian konteks khusus tugas
  • Senarai benarkan alat
  • Bajet token
  • Skema output yang padat

Ejen akar biasanya memerlukan penemuan, ID bukti, keyakinan, dan isu yang belum selesai—bukan transkrip penuh pekerja.

Peraturan subejen: Paralelkan kerja bebas, bukan konteks yang diduplikasi.

Kesilapan biasa: Menghantar sejarah ejen akar yang lengkap kepada setiap pekerja sebelum memberikan tugas yang sempit.

Which Optimization Should You Apply First?

Gunakan telemetri ejen untuk memilih intervensi pertama.

Ambang di bawah ialah pencetus siasatan, bukan standard sejagat.

Isyarat yang diperhatikanMulakan di sini
Amplifikasi konteks tinggiPadatkan sejarah dan ambil keadaan secara terpilih
Output alat mendominasi promptTapis medan dan simpan artifak penuh secara luaran
Cukai percubaan semula tinggiBaiki validasi, tamat masa, dan panggilan alat berulang
Bahagian penaakulan tinggiRendahkan usaha pada langkah rutin
Subejen mengulang bukti yang samaSempitkan skop pekerja dan bahagian konteks
Input cache kekal rendahStabilkan prefiks boleh guna semula
Kos kekal tinggi selepas pembersihan gelungBandingkan laluan model kos lebih rendah

Urutan pelaksanaan yang selamat ialah:

  1. Ukur input kumulatif, pengekalan alat, percubaan semula, dan penaakulan.
  2. Tambah had tegar untuk langkah, alat, percubaan semula, dan jumlah token.
  3. Tapis hasil alat yang besar.
  4. Padatkan keadaan lama pada ambang yang diukur.
  5. Stabilkan prefiks prompt boleh guna semula.
  6. Bandingkan laluan model hanya selepas gelung ejen bersih.

Ubah satu pemboleh ubah utama pada satu masa dan ulang set penilaian yang sama.

Bandingkan:

  • Kadar tugas diterima
  • Kos per tugas berjaya
  • Input kumulatif
  • Kiraan panggilan alat
  • Cukai percubaan semula
  • Bahagian penaakulan
  • Kependaman p50 dan p95
  • Masa semakan manusia

Kembalikan perubahan yang menjimatkan token dengan mengurangkan kualiti tugas atau mengeluarkan bukti yang diperlukan.

Test Agent Workflows With CometAPI

Sebelum menjalankan penilaian berbilang model, gunakan halaman harga CometAPI (https://www.cometapi.com/pricing/?utm_source=chatgpt.com) dan panduan anggaran kos (https://apidoc.cometapi.com/guides/how-to-estimate-cost-before-calling-a-model) untuk menganggarkan kos input, output, token cache, dan penaakulan.

Kemudian gunakan katalog model (https://www.cometapi.com/models/?utm_source=chatgpt.com) untuk mengenal pasti laluan yang layak dan Quickstart (https://www.cometapi.com/quickstart/?utm_source=chatgpt.com) untuk mengkonfigurasi klien serasi OpenAI.

Untuk fallback produksi, ikuti panduan fallback model CometAPI (https://apidoc.cometapi.com/guides/model-fallback-with-cometapi) untuk menukar laluan tanpa mengulang panggilan alat yang telah selesai atau membuang keadaan yang telah divalidasi.

Akses bersatu memudahkan perbandingan model dan integrasi fallback. Bajet token, pemadatan, validasi, penapisan alat, had percubaan semula, dan kriteria penerimaan masih berada di peringkat aplikasi.

FAQ

Mengapa ejen AI menggunakan lebih banyak token daripada bot sembang?

Ejen membuat berbilang panggilan model dan mungkin menghantar semula mesej terdahulu, hasil alat, arahan, dan keadaan perantaraan pada setiap langkah. Ini menyebabkan konteks awal diproses berulang kali.

Adakah cache prompt mengurangkan penggunaan tetingkap konteks?

Tidak. Cache prompt boleh mengurangkan harga efektif atau kependaman input berulang, tetapi token cache masih menjadi sebahagian daripada konteks yang diproses. Gunakan pemadatan, penapisan, atau pengambilan terpilih untuk mengurangkan saiz prompt.

Bilakah ejen AI perlu memadatkan konteksnya?

Padatkan sebelum pertumbuhan konteks mula menjejaskan kos, kependaman, atau ruang output yang tersedia. Sahkan bahawa keadaan padat mengekalkan keputusan, ID bukti, fail yang diubah, soalan terbuka, dan kekangan keselamatan.

Adakah subejen mengurangkan kos token?

Tidak secara automatik. Ia boleh mengurangkan masa berlalu atau meningkatkan liputan untuk kerja bebas, tetapi konteks berganda dan analisis bertindih sering meningkatkan jumlah penggunaan token.

Apakah metrik terbaik untuk pengoptimuman kos ejen AI?

Gunakan kos per tugas berjaya sebagai metrik utama. Diagnosa dengan input kumulatif, amplifikasi konteks, pengekalan alat, cukai percubaan semula, bahagian penaakulan, kependaman, dan masa semakan manusia.

Terus belajar

Sambungkan artikel ini ke keputusan seterusnya.

Lihat semua topik
Diterbitkan pada Aug 5, 2026
Terakhir dikemas kini Aug 24, 2026
16 paparan
Disemak untuk kejelasan, atribusi sumber dan terminologi API semasa.

Bersedia untuk mengurangkan kos pembangunan AI sebanyak 20%?

Mulakan secara percuma dalam beberapa minit. Kredit percubaan percuma disertakan. Tiada kad kredit diperlukan.

Baca Lagi