GPT-5.6 Luna price down 80%, Terra down 20% →

Canlı ortamda yapay zekâ ajanlarının token maliyetleri nasıl azaltılır

CometAPI
Mia MarenAug 5, 2026
Canlı ortamda yapay zekâ ajanlarının token maliyetleri nasıl azaltılır

Kısaca

Çok adımlı bir AI ajanın her adımda talimatları, sohbet geçmişini, araç sonuçlarını ve ara durumu tekrar işlemesi token maliyetlerini büyütür.

Çalışma düzeyi bütçeler, araç-sonucu filtreleme, bağlam sıkıştırma, yeniden deneme limitleri ve kontrollü akıl yürütme ile token hacmini azaltın. Sabit tekrarlanan girdi için prompt önbellekleme kullanın, ancak daha ucuz modele geçmeden önce ajan döngüsünü optimize edin.

Üretimde en faydalı metrik, tek istek başına fiyat veya son çağrının bağlam boyutu değil, tamamlanmış tek bir çalışma boyunca ölçülen başarılı görev başına maliyettir.

Bu rehber özellikle çok adımlı AI ajanlarına odaklanır. Tekrar eden bağlamın bir çalışma boyunca nasıl katlandığını, en büyük israf kaynağını nasıl belirleyeceğinizi ve önce hangi kontrolleri uygulayacağınızı açıklar.

Giriş

Bir sohbet robotu, kullanıcı mesajı başına bir model isteği yapabilir. Bir AI ajanı, tek bir görevi tamamlamadan önce 10, 20 veya daha fazla çağrı yapabilir.

Her adım talimatları, sohbet geçmişini, araç sonuçlarını ve ara durumu yeniden gönderebilir. Yeniden denemeler, akıl yürütme ve alt ajanlar kullanımı artırır; bu nedenle kısa bir nihai cevap bile çok sayıda token tüketebilir.

Kullanım ölçeklendikçe bu maliyetleri öngörmek zorlaşır ve ürün marjlarını hızla azaltabilir. Bunları düşürmek, yalnızca daha ucuz bir modele geçmek yerine, tüm ajan döngüsünü optimize etmeyi gerektirir.

Bu makale Ajan’a özgü maliyetlere odaklanır. Prompt önbellekleme, birebir yanıt önbellekleme, semantik önbellekleme, model yönlendirme ve genel API maliyet yönetimi için daha kapsamlı bir rehber için bkz. How to Reduce AI API Costs.

AI Ajan Token Maliyetleri Neden Katlanır?

Çok adımlı bir ajan için tek bir görevin maliyeti, yalnızca nihai yanıtın değil, tüm model çağrılarının toplamıdır.

Ajan Token kullanımının başlıca kaynakları:

Maliyet kaynağıNedeniİlk test edilecek kontrol
Tekrarlanan talimatlarSistem prompt’ları, araç şemaları, politikalar, örneklerYeniden kullanılabilir öneki sabitleyin
Büyüyen geçmişÖnceki turlar her adımda tekrar gönderilirDurumu sıkıştırın veya seçmeli alın
Araç sonuçlarıArama sayfaları, dosyalar, günlükler, veritabanı kayıtlarıBağlama eklemeden önce filtreleyin
Ara çıktıPlanlar, durum iletileri, ayrıntılı araç kararlarıKompakt yapılandırılmış çıktılar kullanın
Akıl yürütme token’larıRutin adımlarda yüksek akıl yürütme çabasıÇabayı görev karmaşıklığına uydurun
Yeniden denemelerGeçersiz çıktı, zaman aşımı, araç hataları, oran limitleriHataları sınıflandırın ve denemeleri sınırlandırın
Alt ajanlarİşçiler bağlamı, araçları ve analizi yinelerHer işçiye dar bir bağlam dilimi gönderin

Faturayı düşürmenin iki ayrı yolu vardır:

  1. Filtreleme, sıkıştırma, çıktı limitleri ve döngü kontrolleriyle daha az token işlemek.
  2. Prompt önbellekleme veya model seçimiyle gerekli token’ların etkin fiyatını düşürmek.

Ana ayrım: Prompt önbellekleme tekrarlanan girdinin maliyetini düşürür. Bağlam sıkıştırma tekrarlanan girdinin kendisini azaltır.

12 Adımlı Bir Ajan Nasıl 147.000 Token İşleyebilir?

Şu özelliklere sahip varsayımsal bir destek ajanını düşünün:

  • 4.000 token’lık sabit bir önek
  • Her adım sonrası eklenen 1.500 yeni token
  • Her istekte biriken tüm geçmişin yeniden gönderilmesi
  • Toplam 12 model çağrısı

Adım n’deki girdi:

Adım n’deki girdi = 4.000 + 1.500 × (n - 1)

12 çağrı boyunca kümülatif girdi:

Toplam girdi
= 4.000 × 12 + 1.500 × (0 + 1 + ... + 11)
= 48.000 + 99.000
= 147.000 girdi token’ı

Nihai çağrı yalnızca 20.500 girdi token’ı içerir, ancak tam çalışma 147.000 kümülatif girdi token’ı işler.

Şimdi iki kontrol uygulayın:

  1. İlk çağrıdan sonra sabit 4.000 token’lık öneki önbelleğe alın.
  2. Altıncı adımdan sonra geçmişi 2.500 token’lık bir durum özetine sıkıştırın.
SenaryoÖnbelleksiz girdiÖnbellekli girdiToplam işlenen girdiDeğişim
Her adımda tam geçmiş147.0000147.000Başlangıç
Sabit önek önbelleklendi103.00044.000147.000Aynı hacim, daha ucuz karışım
Önbellek + sıkıştırma64.00044.000108.000%26,5 daha az işlenen token

Bu bir planlama hesabıdır, sağlayıcı kıyaslaması değildir.

Her isteğin biriken tüm geçmişi içerdiğini varsayar. Eski mesajları seçmeli olarak oluşturan, özetleyen ya da yalnızca ilgili bilgileri getiren ajanlar farklı bir maliyet eğrisi izleyebilir.

Maliyet artışı kuralı: Tam çalışma boyunca kümülatif girdiyi ölçün. Nihai bağlam boyutu, işlenen toplam token sayısını temsil etmez.

img

Hangi Metrikler Ajan Token İsrafını Ortaya Koyar?

Modelleri değiştirerek başlamayın. Önce iş akışının sonucu iyileştirmeden token harcadığı yerleri belirleyin.

Her Ajan adımı için şu alanları kaydedin:

AlanNeden önemli
run_id, step_id, parent_step_idAjan ve alt ajan ağacını yeniden kurar
İşlenmiş girdi token’larıÇağrılar arasında bağlamın nasıl büyüdüğünü gösterir
Önbellekli ve önbelleksiz girdiYeniden kullanım ile yeni bağlamı ayırır
Çıktı ve akıl yürütme token’larıPahalı üretim adımlarını belirler
Araç sonucu boyutu ve tutulan token’larNe kadar ham kanıtın sonraki prompt’lara girdiğini gösterir
Yeniden deneme nedeni ve deneme sayısıTekrarlanan hataları belirler
Sıkıştırma öncesi ve sonrası token’larıGerçek bağlam azaltımını ölçer
İşçi ID’si ve dönen token’larYinelenen alt ajan çalışmalarını ortaya çıkarır
Kabul/ret/eskalasyon sonucuMaliyeti görev kalitesine bağlar

Birincil metrik şudur:

başarılı görev başına maliyet
= toplam iş akışı maliyeti
/ kabul edilen görevler

Daha ucuz bir çalışma, daha fazla başarısız göreve, tekrarlanan araç çağrılarına veya insan müdahalesine yol açıyorsa iyileşme değildir.

Sorunu bulmaya yardımcı olan dört Ajan’a özgü metrik:

Bağlam Büyütme

bağlam büyütme
= kümülatif girdi token’ları
/ son adım girdi token’ları

Yüksek değer, önceki bağlamın tekrar tekrar işlendiğini gösterir.

Araç Tutma Oranı

araç tutma oranı
= bağlamda tutulan araç-sonucu token’ları
/ araçların başlangıçta döndürdüğü token’lar

Yüksek oran, ajanın adımlar arasında çok fazla ham kanıt taşıdığını gösterebilir.

Yeniden Deneme Vergisi

yeniden deneme vergisi
= yeniden deneme ve onarma maliyeti
/ toplam iş akışı maliyeti

Akıl Yürütme Payı

akıl yürütme payı
= akıl yürütme token maliyeti
/ toplam model maliyeti

Her iş yükünü ayrı ölçün. Araştırma, kodlama, tarayıcı ve müşteri destek ajanları aynı küresel tabanı paylaşmamalıdır.

AI Ajan Token Maliyetlerini Azaltmanın Altı Yolu

1. Tüm Çalışma İçin Bütçe Belirleyin

İstek başına çıktı limiti, çok adımlı bir ajanı kontrol etmez.

Şu alanlarda çalışma düzeyi limitler koyun:

  • Toplam model adımı
  • Kümülatif girdi ve çıktı
  • Araç çağrıları ve araç-sonucu boyutu
  • Hata türüne göre yeniden denemeler
  • Alt ajanlar
  • Toplam geçen süre veya tahmini maliyet

Aşağıdaki sağlayıcıdan bağımsız Python örneği, her model çağrısından önce çalışmayı değerlendirir:

from dataclasses import dataclass
from enum import Enum


class Action(str, Enum):
    CONTINUE = "continue"
    COMPACT = "compact"
    STOP = "stop"


@dataclass(frozen=True)
class Budget:
    max_steps: int = 12
    max_input_tokens: int = 120_000
    max_output_tokens: int = 18_000
    compact_at: float = 0.80


@dataclass
class Usage:
    steps: int = 0
    input_tokens: int = 0
    output_tokens: int = 0


def evaluate_budget(usage: Usage, budget: Budget) -> Action:
    if (
        usage.steps >= budget.max_steps
        or usage.input_tokens >= budget.max_input_tokens
        or usage.output_tokens >= budget.max_output_tokens
    ):
        return Action.STOP

    input_ratio = usage.input_tokens / budget.max_input_tokens

    if input_ratio >= budget.compact_at:
        return Action.COMPACT

    return Action.CONTINUE

Her model isteğinden önce kontrolü çalıştırın ve Usage’ı sağlayıcının bildirdiği token verileriyle güncelleyin.

Girdi bütçesinin %80’inde durumu sıkıştırın veya bir sonraki araç sorgusunu daraltın. %100’de, yapılandırılmış bir nedenle durdurun.

Yaygın hata: Yanıtı sınırlayıp adımlar, araçlar ve yeniden denemelerin sınırsız kalmasına izin vermek.

2. Araç Sonuçlarını Transkripte Girmeden Önce Filtreleyin

Ajanın bir sonraki kararı için gereken kanıtları geri döndürün.

Bir sonraki adım yalnızca birkaç alana ihtiyaç duyarken asla tüm:

  • Web sayfasını
  • Günlük dosyasını
  • Depo ağacını
  • Veritabanı yanıtını
  • Terminal oturumunu
  • API yükünü

eklemeyin.

Bir arama aracı şu çıktıyı döndürebilir:

{
  "source_id": "search_17",
  "title": "İlgili sayfa başlığı",
  "url": "https://example.com/page",
  "relevant_passage": "Kısa bir kanıt bloğu"
}

Tam eseri prompt dışında saklayın ve daha sonra daha dar bir bölümü geri alın.

Araç filtreleme kuralı: Bir sonraki karar için gereken alanları döndürün; ileride gerekebilir diye tüm alanları değil.

Yaygın hata: Bir JSON payload’unun ilk 1.000 karakterini kesmek. Bu yapılandırmayı bozabilir veya ajanın gerçekten ihtiyaç duyduğu kayıtları kaldırabilir.

Önce payload’u ayrıştırın, alanları yapısal olarak seçin, dizileri sınırlayın ve ardından geçerli JSON olarak serileştirin.

3. Sadece Sohbet Metnini Değil, Operasyonel Durumu Sıkıştırın

Sıkıştırma, göreve devam etmek için gereken bilgiyi korurken artık bir sonraki adımı etkilemeyen geçmişi kaldırmalıdır.

Faydalı sıkıştırılmış durum şunları içerir:

  • Kullanıcı hedefi ve başarı ölçütleri
  • Halihazırda alınmış kararlar
  • Doğrulanmış gerçekler ve kaynak ID’leri
  • Değiştirilen dosyalar veya kayıtlar
  • Başarısız yaklaşımlar
  • Açık sorular
  • Bir sonraki eylem
  • Güvenlik ve çıktı kısıtları

Tüm konuşmayı yeniden anlatmamalıdır.

OpenAI, uzun süreli Responses API etkileşimleri için sıkıştırmayı belgeliyor. Anthropic, eski içeriği temizlemek veya özetlemek için bağlam yönetimi kontrolleri sağlıyor. Bu uygulamalar farklıdır; entegrasyondan önce güncel sağlayıcı alanlarını doğrulayın.

Sıkıştırma kuralı: Kararları ve çözülmemiş işleri koruyun. Yeniden alınabilecek anlatı ve kanıtı kaldırın.

Yaygın hata: Kaynak ID’leri, değişen dosya adları, reddedilen yaklaşımlar veya çözülmemiş kısıtların düşürülmesi.

Sıkıştırma ekledikten sonra ajanın aramaları veya araç çağrılarını tekrarlayıp tekrarlamadığını ölçün. Daha kısa bir prompt, ajan kaybedilen durumu yeniden inşa etmek zorunda kalırsa ucuz değildir.

4. Yeniden Kullanılabilir Öneki Sabit Tutun

Ajan prompt’ları genellikle büyük, yeniden kullanılabilir bloklar içerir:

  • Sistem talimatları
  • Araç şemaları
  • Güvenlik politikaları
  • Çıktı formatları
  • Paylaşılan referans materyal
  • Depo veya ürün talimatları

Bu sabit öğeleri istek-özel verilerden önce yerleştirin:

1. Sistem talimatları
2. Politikalar ve kısıtlar
3. Araç tanımları
4. Sabit örnekler
5. Paylaşılan referans materyal
6. İstek-özel veriler

Zaman damgaları, istek ID’leri, oturum verileri veya sık değişen değerleri başa koymaktan kaçının.

Önek uzun, sabit ve tekrar kullanılıyorsa önbellekleme en faydalıdır. Kısa oturumlar veya sık değişen prompt’lar için tasarruf sağlamayabilir.

Yaygın hata: Önbelleğe yazma, okuma veya depolama maliyetini ölçmeden önbellek isabet oranını optimize etmek.

Sağlayıcı prompt önbelleklemesi, birebir yanıt önbellekleme ve semantik önbelleklemenin daha geniş karşılaştırması için bkz. How to Reduce AI API Costs.

5. Yeniden Denemelerin Aynı Bağlamı Yeniden Çalmasını Önleyin

Yeniden deneme, genellikle aynı büyük prompt’la yapılan başka bir ajan adımıdır.

Hata nedenini değiştirmeden başarısız bir isteği tekrarlamayın.

HataDaha iyi yanıt
Geçersiz yapılandırılmış çıktıDoğrulama hatasını döndürün ve bir kez yeniden deneyin
Araç zaman aşımıİdempotent işlemi bir kez yeniden deneyin, sonra durun veya yedek kullanın
Bağlam taşmasıDurumu sıkıştırın veya daha az kanıt getirin
Tekrarlanan araç çağrısıBir işlem karmasıyla yinelenen çağrıyı kaldırın
Oran limitiGeri çekilin veya test edilmiş bir yedek rotayı kullanın
Düşük güvenli sonuçEksik bilgiyi isteyin veya eskale edin

Ödeme, e-posta, dağıtım ve veritabanı yazma gibi yan etkili işlemler için idempotency anahtarları kullanın.

Yaygın hata: Oran limitine takılan bir modeli, her denemede tüm ajan bağlamını yeniden göndererek birkaç kez yeniden denemek.

En büyük döngüyü önce onarabilmek için hata türüne göre yeniden deneme vergisini takip edin.

6. Akıl Yürütme ve Alt Ajanları Yalnızca Gerekli Adımlarla Sınırlayın

Her ajan adımı derin akıl yürütme gerektirmez.

Çıkarma, biçimlendirme, sınıflandırma, doğrulama ve rutin araç seçimi genellikle daha düşük akıl yürütme çabası ve kompakt yapılandırılmış çıktıyla yapılabilir.

Daha yüksek akıl yürütme çabasını şu görevler için saklayın:

  • Karmaşık planlama
  • Zorlayıcı kodlama
  • Çok dokümanlı sentez
  • Muğlak kararlar
  • Başarısız yürütmeden kurtarma

Akıl yürütme kuralı: Kabul oranını koruyan en düşük akıl yürütme çabasını kullanın.

Alt ajanların da net bir sınırı olmalıdır. Her işçiye:

  • Dar bir görev
  • Göreve özel bir bağlam dilimi
  • Araç izin listesi
  • Bir token bütçesi
  • Kompakt bir çıktı şeması

verin.

Kök Ajan genellikle işçinin tam transkriptinden ziyade bulgular, kanıt ID’leri, güven ve çözülmemiş konulara ihtiyaç duyar.

Alt ajan kuralı: Yinelenen bağlamı değil, bağımsız işleri paralelleştirin.

Yaygın hata: Dar bir görev atamadan önce her işçiye kök Ajan’ın tam geçmişini göndermek.

Önce Hangi Optimizasyonu Uygulamalısınız?

İlk müdahaleyi seçmek için Ajan telemetrisini kullanın.

Aşağıdaki eşikler evrensel standartlar değil, araştırma tetikleyicileridir.

Gözlenen sinyalBuradan başlayın
Bağlam büyütme yüksekGeçmişi sıkıştırın ve durumu seçmeli alın
Araç çıktısı prompt’u domine ediyorAlanları filtreleyin ve tam artefaktları dışta saklayın
Yeniden deneme vergisi yüksekDoğrulama, zaman aşımı ve tekrarlanan araç çağrılarını düzeltin
Akıl yürütme payı yüksekRutin adımlarda çabayı düşürün
Alt ajanlar aynı kanıtı yineliyorİşçi kapsamlarını ve bağlam dilimlerini daraltın
Önbellekli girdi düşük kalıyorYeniden kullanılabilir öneki sabitleyin
Döngü temizliğinden sonra maliyet yüksekDaha düşük maliyetli model rotalarını karşılaştırın

Güvenli bir uygulama sırası:

  1. Kümülatif girdi, araç tutma, yeniden denemeler ve akıl yürütmeyi ölçün.
  2. Adımlar, araçlar, yeniden denemeler ve toplam token için sert limitler ekleyin.
  3. Büyük araç sonuçlarını filtreleyin.
  4. Ölçülen bir eşikte eski durumu sıkıştırın.
  5. Yeniden kullanılabilir prompt önekini sabitleyin.
  6. Ajan döngüsü temizlendikten sonra model rotalarını karşılaştırın.

Aynı değerlendirme setini yeniden oynatarak tek seferde bir ana değişkeni değiştirin.

Şunları karşılaştırın:

  • Görev kabul oranı
  • Başarılı görev başına maliyet
  • Kümülatif girdi
  • Araç çağrısı sayısı
  • Yeniden deneme vergisi
  • Akıl yürütme payı
  • p50 ve p95 gecikme
  • İnsan inceleme süresi

Gerekli kanıtı çıkararak veya görev kalitesini düşürerek token tasarrufu sağlayan değişiklikleri geri alın.

CometAPI ile Ajan İş Akışlarını Test Edin

Çoklu model değerlendirmesine başlamadan önce, girdi, çıktı, önbelleklenmiş token ve akıl yürütme maliyetlerini tahmin etmek için CometAPI pricing page ve cost estimation guide sayfalarını kullanın.

Ardından uygun rotaları belirlemek için model catalog’u ve OpenAI uyumlu bir istemciyi yapılandırmak için Quickstart’ı kullanın.

Üretimde geri dönüş için, tamamlanmış araç çağrılarını tekrar etmeden veya doğrulanmış durumu atmadan rota değiştirmek üzere CometAPI model fallback guide’ı izleyin.

Birleştirilmiş erişim, model karşılaştırmasını ve geri dönüş entegrasyonunu basitleştirir. Ancak token bütçeleri, sıkıştırma, doğrulama, araç filtreleme, yeniden deneme limitleri ve kabul kriterleri uygulama katmanında kalmalıdır.

SSS

AI ajanları neden sohbet botlarından daha fazla token kullanır?

Ajanlar birden fazla model çağrısı yapar ve her adımda önceki mesajları, araç sonuçlarını, talimatları ve ara durumu yeniden gönderebilir. Bu, önceki bağlamın tekrar tekrar işlenmesine yol açar.

Prompt önbellekleme bağlam penceresi kullanımını azaltır mı?

Hayır. Prompt önbellekleme, tekrarlanan girdinin etkin fiyatını veya gecikmesini azaltabilir, ancak önbelleğe alınan token’lar hâlâ işlenen bağlamın parçasıdır. Prompt boyutunu azaltmak için sıkıştırma, filtreleme veya seçmeli getirme kullanın.

Bir AI ajanı bağlamını ne zaman sıkıştırmalıdır?

Bağlam büyümesi maliyeti, gecikmeyi veya mevcut çıktı alanını etkilemeye başlamadan önce sıkıştırın. Sıkıştırılmış durumun kararları, kanıt ID’lerini, değişen dosyaları, açık soruları ve güvenlik kısıtlarını koruduğunu doğrulayın.

Alt ajanlar token maliyetlerini düşürür mü?

Kendiliğinden değil. Bağımsız işler için geçen süreyi azaltabilir veya kapsama alanını artırabilirler, ancak yinelenen bağlam ve çakışan analizler toplam token kullanımını sıklıkla artırır.

AI ajanı maliyet optimizasyonu için en iyi metrik nedir?

Birincil metrik olarak başarılı görev başına maliyeti kullanın. Bunu kümülatif girdi, bağlam büyütme, araç tutma, yeniden deneme vergisi, akıl yürütme payı, gecikme ve insan inceleme süresi ile teşhis edin.

Yapay zeka geliştirme maliyetlerinizi %20 azaltmaya hazır mısınız?

Dakikalar içinde ücretsiz başlayın. Ücretsiz deneme kredileri dahildir. Kredi kartı gerekmez.

Devamını Oku