Kısaca
Çok adımlı bir AI ajanın her adımda talimatları, sohbet geçmişini, araç sonuçlarını ve ara durumu tekrar işlemesi token maliyetlerini büyütür.
Çalışma düzeyi bütçeler, araç-sonucu filtreleme, bağlam sıkıştırma, yeniden deneme limitleri ve kontrollü akıl yürütme ile token hacmini azaltın. Sabit tekrarlanan girdi için prompt önbellekleme kullanın, ancak daha ucuz modele geçmeden önce ajan döngüsünü optimize edin.
Üretimde en faydalı metrik, tek istek başına fiyat veya son çağrının bağlam boyutu değil, tamamlanmış tek bir çalışma boyunca ölçülen başarılı görev başına maliyettir.
Bu rehber özellikle çok adımlı AI ajanlarına odaklanır. Tekrar eden bağlamın bir çalışma boyunca nasıl katlandığını, en büyük israf kaynağını nasıl belirleyeceğinizi ve önce hangi kontrolleri uygulayacağınızı açıklar.
Giriş
Bir sohbet robotu, kullanıcı mesajı başına bir model isteği yapabilir. Bir AI ajanı, tek bir görevi tamamlamadan önce 10, 20 veya daha fazla çağrı yapabilir.
Her adım talimatları, sohbet geçmişini, araç sonuçlarını ve ara durumu yeniden gönderebilir. Yeniden denemeler, akıl yürütme ve alt ajanlar kullanımı artırır; bu nedenle kısa bir nihai cevap bile çok sayıda token tüketebilir.
Kullanım ölçeklendikçe bu maliyetleri öngörmek zorlaşır ve ürün marjlarını hızla azaltabilir. Bunları düşürmek, yalnızca daha ucuz bir modele geçmek yerine, tüm ajan döngüsünü optimize etmeyi gerektirir.
Bu makale Ajan’a özgü maliyetlere odaklanır. Prompt önbellekleme, birebir yanıt önbellekleme, semantik önbellekleme, model yönlendirme ve genel API maliyet yönetimi için daha kapsamlı bir rehber için bkz. How to Reduce AI API Costs.
AI Ajan Token Maliyetleri Neden Katlanır?
Çok adımlı bir ajan için tek bir görevin maliyeti, yalnızca nihai yanıtın değil, tüm model çağrılarının toplamıdır.
Ajan Token kullanımının başlıca kaynakları:
| Maliyet kaynağı | Nedeni | İlk test edilecek kontrol |
|---|---|---|
| Tekrarlanan talimatlar | Sistem prompt’ları, araç şemaları, politikalar, örnekler | Yeniden kullanılabilir öneki sabitleyin |
| Büyüyen geçmiş | Önceki turlar her adımda tekrar gönderilir | Durumu sıkıştırın veya seçmeli alın |
| Araç sonuçları | Arama sayfaları, dosyalar, günlükler, veritabanı kayıtları | Bağlama eklemeden önce filtreleyin |
| Ara çıktı | Planlar, durum iletileri, ayrıntılı araç kararları | Kompakt yapılandırılmış çıktılar kullanın |
| Akıl yürütme token’ları | Rutin adımlarda yüksek akıl yürütme çabası | Çabayı görev karmaşıklığına uydurun |
| Yeniden denemeler | Geçersiz çıktı, zaman aşımı, araç hataları, oran limitleri | Hataları sınıflandırın ve denemeleri sınırlandırın |
| Alt ajanlar | İşçiler bağlamı, araçları ve analizi yineler | Her işçiye dar bir bağlam dilimi gönderin |
Faturayı düşürmenin iki ayrı yolu vardır:
- Filtreleme, sıkıştırma, çıktı limitleri ve döngü kontrolleriyle daha az token işlemek.
- Prompt önbellekleme veya model seçimiyle gerekli token’ların etkin fiyatını düşürmek.
Ana ayrım: Prompt önbellekleme tekrarlanan girdinin maliyetini düşürür. Bağlam sıkıştırma tekrarlanan girdinin kendisini azaltır.
12 Adımlı Bir Ajan Nasıl 147.000 Token İşleyebilir?
Şu özelliklere sahip varsayımsal bir destek ajanını düşünün:
- 4.000 token’lık sabit bir önek
- Her adım sonrası eklenen 1.500 yeni token
- Her istekte biriken tüm geçmişin yeniden gönderilmesi
- Toplam 12 model çağrısı
Adım n’deki girdi:
Adım n’deki girdi = 4.000 + 1.500 × (n - 1)
12 çağrı boyunca kümülatif girdi:
Toplam girdi
= 4.000 × 12 + 1.500 × (0 + 1 + ... + 11)
= 48.000 + 99.000
= 147.000 girdi token’ı
Nihai çağrı yalnızca 20.500 girdi token’ı içerir, ancak tam çalışma 147.000 kümülatif girdi token’ı işler.
Şimdi iki kontrol uygulayın:
- İlk çağrıdan sonra sabit 4.000 token’lık öneki önbelleğe alın.
- Altıncı adımdan sonra geçmişi 2.500 token’lık bir durum özetine sıkıştırın.
| Senaryo | Önbelleksiz girdi | Önbellekli girdi | Toplam işlenen girdi | Değişim |
|---|---|---|---|---|
| Her adımda tam geçmiş | 147.000 | 0 | 147.000 | Başlangıç |
| Sabit önek önbelleklendi | 103.000 | 44.000 | 147.000 | Aynı hacim, daha ucuz karışım |
| Önbellek + sıkıştırma | 64.000 | 44.000 | 108.000 | %26,5 daha az işlenen token |
Bu bir planlama hesabıdır, sağlayıcı kıyaslaması değildir.
Her isteğin biriken tüm geçmişi içerdiğini varsayar. Eski mesajları seçmeli olarak oluşturan, özetleyen ya da yalnızca ilgili bilgileri getiren ajanlar farklı bir maliyet eğrisi izleyebilir.
Maliyet artışı kuralı: Tam çalışma boyunca kümülatif girdiyi ölçün. Nihai bağlam boyutu, işlenen toplam token sayısını temsil etmez.

Hangi Metrikler Ajan Token İsrafını Ortaya Koyar?
Modelleri değiştirerek başlamayın. Önce iş akışının sonucu iyileştirmeden token harcadığı yerleri belirleyin.
Her Ajan adımı için şu alanları kaydedin:
| Alan | Neden önemli |
|---|---|
run_id, step_id, parent_step_id | Ajan ve alt ajan ağacını yeniden kurar |
| İşlenmiş girdi token’ları | Çağrılar arasında bağlamın nasıl büyüdüğünü gösterir |
| Önbellekli ve önbelleksiz girdi | Yeniden kullanım ile yeni bağlamı ayırır |
| Çıktı ve akıl yürütme token’ları | Pahalı üretim adımlarını belirler |
| Araç sonucu boyutu ve tutulan token’lar | Ne kadar ham kanıtın sonraki prompt’lara girdiğini gösterir |
| Yeniden deneme nedeni ve deneme sayısı | Tekrarlanan hataları belirler |
| Sıkıştırma öncesi ve sonrası token’ları | Gerçek bağlam azaltımını ölçer |
| İşçi ID’si ve dönen token’lar | Yinelenen alt ajan çalışmalarını ortaya çıkarır |
| Kabul/ret/eskalasyon sonucu | Maliyeti görev kalitesine bağlar |
Birincil metrik şudur:
başarılı görev başına maliyet
= toplam iş akışı maliyeti
/ kabul edilen görevler
Daha ucuz bir çalışma, daha fazla başarısız göreve, tekrarlanan araç çağrılarına veya insan müdahalesine yol açıyorsa iyileşme değildir.
Sorunu bulmaya yardımcı olan dört Ajan’a özgü metrik:
Bağlam Büyütme
bağlam büyütme
= kümülatif girdi token’ları
/ son adım girdi token’ları
Yüksek değer, önceki bağlamın tekrar tekrar işlendiğini gösterir.
Araç Tutma Oranı
araç tutma oranı
= bağlamda tutulan araç-sonucu token’ları
/ araçların başlangıçta döndürdüğü token’lar
Yüksek oran, ajanın adımlar arasında çok fazla ham kanıt taşıdığını gösterebilir.
Yeniden Deneme Vergisi
yeniden deneme vergisi
= yeniden deneme ve onarma maliyeti
/ toplam iş akışı maliyeti
Akıl Yürütme Payı
akıl yürütme payı
= akıl yürütme token maliyeti
/ toplam model maliyeti
Her iş yükünü ayrı ölçün. Araştırma, kodlama, tarayıcı ve müşteri destek ajanları aynı küresel tabanı paylaşmamalıdır.
AI Ajan Token Maliyetlerini Azaltmanın Altı Yolu
1. Tüm Çalışma İçin Bütçe Belirleyin
İstek başına çıktı limiti, çok adımlı bir ajanı kontrol etmez.
Şu alanlarda çalışma düzeyi limitler koyun:
- Toplam model adımı
- Kümülatif girdi ve çıktı
- Araç çağrıları ve araç-sonucu boyutu
- Hata türüne göre yeniden denemeler
- Alt ajanlar
- Toplam geçen süre veya tahmini maliyet
Aşağıdaki sağlayıcıdan bağımsız Python örneği, her model çağrısından önce çalışmayı değerlendirir:
from dataclasses import dataclass
from enum import Enum
class Action(str, Enum):
CONTINUE = "continue"
COMPACT = "compact"
STOP = "stop"
@dataclass(frozen=True)
class Budget:
max_steps: int = 12
max_input_tokens: int = 120_000
max_output_tokens: int = 18_000
compact_at: float = 0.80
@dataclass
class Usage:
steps: int = 0
input_tokens: int = 0
output_tokens: int = 0
def evaluate_budget(usage: Usage, budget: Budget) -> Action:
if (
usage.steps >= budget.max_steps
or usage.input_tokens >= budget.max_input_tokens
or usage.output_tokens >= budget.max_output_tokens
):
return Action.STOP
input_ratio = usage.input_tokens / budget.max_input_tokens
if input_ratio >= budget.compact_at:
return Action.COMPACT
return Action.CONTINUE
Her model isteğinden önce kontrolü çalıştırın ve Usage’ı sağlayıcının bildirdiği token verileriyle güncelleyin.
Girdi bütçesinin %80’inde durumu sıkıştırın veya bir sonraki araç sorgusunu daraltın. %100’de, yapılandırılmış bir nedenle durdurun.
Yaygın hata: Yanıtı sınırlayıp adımlar, araçlar ve yeniden denemelerin sınırsız kalmasına izin vermek.
2. Araç Sonuçlarını Transkripte Girmeden Önce Filtreleyin
Ajanın bir sonraki kararı için gereken kanıtları geri döndürün.
Bir sonraki adım yalnızca birkaç alana ihtiyaç duyarken asla tüm:
- Web sayfasını
- Günlük dosyasını
- Depo ağacını
- Veritabanı yanıtını
- Terminal oturumunu
- API yükünü
eklemeyin.
Bir arama aracı şu çıktıyı döndürebilir:
{
"source_id": "search_17",
"title": "İlgili sayfa başlığı",
"url": "https://example.com/page",
"relevant_passage": "Kısa bir kanıt bloğu"
}
Tam eseri prompt dışında saklayın ve daha sonra daha dar bir bölümü geri alın.
Araç filtreleme kuralı: Bir sonraki karar için gereken alanları döndürün; ileride gerekebilir diye tüm alanları değil.
Yaygın hata: Bir JSON payload’unun ilk 1.000 karakterini kesmek. Bu yapılandırmayı bozabilir veya ajanın gerçekten ihtiyaç duyduğu kayıtları kaldırabilir.
Önce payload’u ayrıştırın, alanları yapısal olarak seçin, dizileri sınırlayın ve ardından geçerli JSON olarak serileştirin.
3. Sadece Sohbet Metnini Değil, Operasyonel Durumu Sıkıştırın
Sıkıştırma, göreve devam etmek için gereken bilgiyi korurken artık bir sonraki adımı etkilemeyen geçmişi kaldırmalıdır.
Faydalı sıkıştırılmış durum şunları içerir:
- Kullanıcı hedefi ve başarı ölçütleri
- Halihazırda alınmış kararlar
- Doğrulanmış gerçekler ve kaynak ID’leri
- Değiştirilen dosyalar veya kayıtlar
- Başarısız yaklaşımlar
- Açık sorular
- Bir sonraki eylem
- Güvenlik ve çıktı kısıtları
Tüm konuşmayı yeniden anlatmamalıdır.
OpenAI, uzun süreli Responses API etkileşimleri için sıkıştırmayı belgeliyor. Anthropic, eski içeriği temizlemek veya özetlemek için bağlam yönetimi kontrolleri sağlıyor. Bu uygulamalar farklıdır; entegrasyondan önce güncel sağlayıcı alanlarını doğrulayın.
Sıkıştırma kuralı: Kararları ve çözülmemiş işleri koruyun. Yeniden alınabilecek anlatı ve kanıtı kaldırın.
Yaygın hata: Kaynak ID’leri, değişen dosya adları, reddedilen yaklaşımlar veya çözülmemiş kısıtların düşürülmesi.
Sıkıştırma ekledikten sonra ajanın aramaları veya araç çağrılarını tekrarlayıp tekrarlamadığını ölçün. Daha kısa bir prompt, ajan kaybedilen durumu yeniden inşa etmek zorunda kalırsa ucuz değildir.
4. Yeniden Kullanılabilir Öneki Sabit Tutun
Ajan prompt’ları genellikle büyük, yeniden kullanılabilir bloklar içerir:
- Sistem talimatları
- Araç şemaları
- Güvenlik politikaları
- Çıktı formatları
- Paylaşılan referans materyal
- Depo veya ürün talimatları
Bu sabit öğeleri istek-özel verilerden önce yerleştirin:
1. Sistem talimatları
2. Politikalar ve kısıtlar
3. Araç tanımları
4. Sabit örnekler
5. Paylaşılan referans materyal
6. İstek-özel veriler
Zaman damgaları, istek ID’leri, oturum verileri veya sık değişen değerleri başa koymaktan kaçının.
Önek uzun, sabit ve tekrar kullanılıyorsa önbellekleme en faydalıdır. Kısa oturumlar veya sık değişen prompt’lar için tasarruf sağlamayabilir.
Yaygın hata: Önbelleğe yazma, okuma veya depolama maliyetini ölçmeden önbellek isabet oranını optimize etmek.
Sağlayıcı prompt önbelleklemesi, birebir yanıt önbellekleme ve semantik önbelleklemenin daha geniş karşılaştırması için bkz. How to Reduce AI API Costs.
5. Yeniden Denemelerin Aynı Bağlamı Yeniden Çalmasını Önleyin
Yeniden deneme, genellikle aynı büyük prompt’la yapılan başka bir ajan adımıdır.
Hata nedenini değiştirmeden başarısız bir isteği tekrarlamayın.
| Hata | Daha iyi yanıt |
|---|---|
| Geçersiz yapılandırılmış çıktı | Doğrulama hatasını döndürün ve bir kez yeniden deneyin |
| Araç zaman aşımı | İdempotent işlemi bir kez yeniden deneyin, sonra durun veya yedek kullanın |
| Bağlam taşması | Durumu sıkıştırın veya daha az kanıt getirin |
| Tekrarlanan araç çağrısı | Bir işlem karmasıyla yinelenen çağrıyı kaldırın |
| Oran limiti | Geri çekilin veya test edilmiş bir yedek rotayı kullanın |
| Düşük güvenli sonuç | Eksik bilgiyi isteyin veya eskale edin |
Ödeme, e-posta, dağıtım ve veritabanı yazma gibi yan etkili işlemler için idempotency anahtarları kullanın.
Yaygın hata: Oran limitine takılan bir modeli, her denemede tüm ajan bağlamını yeniden göndererek birkaç kez yeniden denemek.
En büyük döngüyü önce onarabilmek için hata türüne göre yeniden deneme vergisini takip edin.
6. Akıl Yürütme ve Alt Ajanları Yalnızca Gerekli Adımlarla Sınırlayın
Her ajan adımı derin akıl yürütme gerektirmez.
Çıkarma, biçimlendirme, sınıflandırma, doğrulama ve rutin araç seçimi genellikle daha düşük akıl yürütme çabası ve kompakt yapılandırılmış çıktıyla yapılabilir.
Daha yüksek akıl yürütme çabasını şu görevler için saklayın:
- Karmaşık planlama
- Zorlayıcı kodlama
- Çok dokümanlı sentez
- Muğlak kararlar
- Başarısız yürütmeden kurtarma
Akıl yürütme kuralı: Kabul oranını koruyan en düşük akıl yürütme çabasını kullanın.
Alt ajanların da net bir sınırı olmalıdır. Her işçiye:
- Dar bir görev
- Göreve özel bir bağlam dilimi
- Araç izin listesi
- Bir token bütçesi
- Kompakt bir çıktı şeması
verin.
Kök Ajan genellikle işçinin tam transkriptinden ziyade bulgular, kanıt ID’leri, güven ve çözülmemiş konulara ihtiyaç duyar.
Alt ajan kuralı: Yinelenen bağlamı değil, bağımsız işleri paralelleştirin.
Yaygın hata: Dar bir görev atamadan önce her işçiye kök Ajan’ın tam geçmişini göndermek.
Önce Hangi Optimizasyonu Uygulamalısınız?
İlk müdahaleyi seçmek için Ajan telemetrisini kullanın.
Aşağıdaki eşikler evrensel standartlar değil, araştırma tetikleyicileridir.
| Gözlenen sinyal | Buradan başlayın |
|---|---|
| Bağlam büyütme yüksek | Geçmişi sıkıştırın ve durumu seçmeli alın |
| Araç çıktısı prompt’u domine ediyor | Alanları filtreleyin ve tam artefaktları dışta saklayın |
| Yeniden deneme vergisi yüksek | Doğrulama, zaman aşımı ve tekrarlanan araç çağrılarını düzeltin |
| Akıl yürütme payı yüksek | Rutin adımlarda çabayı düşürün |
| Alt ajanlar aynı kanıtı yineliyor | İşçi kapsamlarını ve bağlam dilimlerini daraltın |
| Önbellekli girdi düşük kalıyor | Yeniden kullanılabilir öneki sabitleyin |
| Döngü temizliğinden sonra maliyet yüksek | Daha düşük maliyetli model rotalarını karşılaştırın |
Güvenli bir uygulama sırası:
- Kümülatif girdi, araç tutma, yeniden denemeler ve akıl yürütmeyi ölçün.
- Adımlar, araçlar, yeniden denemeler ve toplam token için sert limitler ekleyin.
- Büyük araç sonuçlarını filtreleyin.
- Ölçülen bir eşikte eski durumu sıkıştırın.
- Yeniden kullanılabilir prompt önekini sabitleyin.
- Ajan döngüsü temizlendikten sonra model rotalarını karşılaştırın.
Aynı değerlendirme setini yeniden oynatarak tek seferde bir ana değişkeni değiştirin.
Şunları karşılaştırın:
- Görev kabul oranı
- Başarılı görev başına maliyet
- Kümülatif girdi
- Araç çağrısı sayısı
- Yeniden deneme vergisi
- Akıl yürütme payı
- p50 ve p95 gecikme
- İnsan inceleme süresi
Gerekli kanıtı çıkararak veya görev kalitesini düşürerek token tasarrufu sağlayan değişiklikleri geri alın.
CometAPI ile Ajan İş Akışlarını Test Edin
Çoklu model değerlendirmesine başlamadan önce, girdi, çıktı, önbelleklenmiş token ve akıl yürütme maliyetlerini tahmin etmek için CometAPI pricing page ve cost estimation guide sayfalarını kullanın.
Ardından uygun rotaları belirlemek için model catalog’u ve OpenAI uyumlu bir istemciyi yapılandırmak için Quickstart’ı kullanın.
Üretimde geri dönüş için, tamamlanmış araç çağrılarını tekrar etmeden veya doğrulanmış durumu atmadan rota değiştirmek üzere CometAPI model fallback guide’ı izleyin.
Birleştirilmiş erişim, model karşılaştırmasını ve geri dönüş entegrasyonunu basitleştirir. Ancak token bütçeleri, sıkıştırma, doğrulama, araç filtreleme, yeniden deneme limitleri ve kabul kriterleri uygulama katmanında kalmalıdır.
SSS
AI ajanları neden sohbet botlarından daha fazla token kullanır?
Ajanlar birden fazla model çağrısı yapar ve her adımda önceki mesajları, araç sonuçlarını, talimatları ve ara durumu yeniden gönderebilir. Bu, önceki bağlamın tekrar tekrar işlenmesine yol açar.
Prompt önbellekleme bağlam penceresi kullanımını azaltır mı?
Hayır. Prompt önbellekleme, tekrarlanan girdinin etkin fiyatını veya gecikmesini azaltabilir, ancak önbelleğe alınan token’lar hâlâ işlenen bağlamın parçasıdır. Prompt boyutunu azaltmak için sıkıştırma, filtreleme veya seçmeli getirme kullanın.
Bir AI ajanı bağlamını ne zaman sıkıştırmalıdır?
Bağlam büyümesi maliyeti, gecikmeyi veya mevcut çıktı alanını etkilemeye başlamadan önce sıkıştırın. Sıkıştırılmış durumun kararları, kanıt ID’lerini, değişen dosyaları, açık soruları ve güvenlik kısıtlarını koruduğunu doğrulayın.
Alt ajanlar token maliyetlerini düşürür mü?
Kendiliğinden değil. Bağımsız işler için geçen süreyi azaltabilir veya kapsama alanını artırabilirler, ancak yinelenen bağlam ve çakışan analizler toplam token kullanımını sıklıkla artırır.
AI ajanı maliyet optimizasyonu için en iyi metrik nedir?
Birincil metrik olarak başarılı görev başına maliyeti kullanın. Bunu kümülatif girdi, bağlam büyütme, araç tutma, yeniden deneme vergisi, akıl yürütme payı, gecikme ve insan inceleme süresi ile teşhis edin.
