GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
technology/CometAPI araştırması

Her görev için LLM isteklerini doğru modele nasıl yönlendirmeli

Tek bir CometAPI uç noktası üzerinden basit, acil ve karmaşık istekleri maliyet, hız veya doğruluk katmanlarına yönlendiren bir LLM yönlendiricisi oluşturun.

CometAPI
Bobby SpencerAI model ve API araştırma ekibi
Güncellendi Sep 4, 2026 9 dk okuma
Her görev için LLM isteklerini doğru modele nasıl yönlendirmeli
Bu kalıbı kullanın

İlk API çağrısını yapın.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Kısa yanıt: istekleri uygulamanızda yönlendirin; ardından seçilen modeli çağırmak için tek bir CometAPI anahtarı ve OpenAI ile uyumlu temel URL’yi https://api.cometapi.com/v1 kullanın. Tekrarlı ve kontrolü kolay işleri düşük maliyetli katmana; gecikmeye duyarlı müşteri etkileşimlerini hızlı katmana; belirsiz veya yüksek etkili işleri yüksek doğruluk katmanına gönderin. Etiketleri evrensel bir model sıralaması olarak değil, kendi politikanız olarak tutun ve her katmanı aynı test setinde ölçün.

Bu kılavuz, sınırlı geri dönüş (fallback) ve yeniden denemeleri ile reddedilen çıktıları da sayan bir maliyet modeliyle, kompakt bir Python örneği üzerinden üç katmanlı bir yönlendirici oluşturur. Örnek, CometAPI kataloğundaki güncel model kimliklerini kullanır; ancak yönlendirme mantığı ayrıdır, böylece uygulamayı yeniden yazmadan modeller değiştirilebilir.

LLM yönlendirme nedir?

LLM yönlendirme, her isteği görevi, gecikme hedefi, kalite gereksinimi ve bütçesine en uygun modele veya hizmet katmanına göndermek sürecidir.

LLM isteklerini göreve göre nasıl yönlendirmelisiniz?

20 Ağustos 2026 itibarıyla, aşağıdaki model kimlikleri ve katalog fiyatlandırma alanları, herkese açık CometAPI Models API üzerinden mevcuttu. Aşağıdaki tahmini tüketici oranları, CometAPI fiyatlandırma kılavuzu uyarınca, katalogtaki güncel ratio değeri giriş ve çıkış için temel fiyatlara uygulanarak hesaplanmıştır. Üretimde kullanmadan önce hesabınız için gösterilen nihai ücreti doğrulayın.

RotaKullanım amacıÖrnek modelTah. USD / 1M tokenİlk yedek
Düşük maliyetEtiketleme, çıkarma, tekilleştirmedeepseek-v4-flash$0.176 giriş / $0.528 çıkışHızlı
HızlıMüşteri yanıtları, özetler, canlı asistanlargemini-3.7-flash$0.60 giriş / $3.00 çıkışDüşük maliyet, sonra yüksek doğruluk
Yüksek doğrulukPolitika incelemesi, karmaşık akıl yürütme, yüksek etkili taslaklarclaude-opus-5$4.00 giriş / $20.00 çıkışHızlı

“Hızlı”, rotanın bir gecikme hedefi olduğu; “yüksek doğruluk” ise daha sıkı bir kalite hedefi olduğu anlamına gelir. Bu etiketler, bir modelin her zaman en hızlı veya en doğru olduğunu kanıtlamaz. Haritalamayı kalıcı hale getirmeden önce kendi trafiğiniz üzerinde p50 ve p95 gecikmeyi, görev geçiş oranını ve kabul edilen çıktı başına maliyeti kıyaslayın.

Bir LLM yönlendirici için CometAPI nasıl kurulur?

Bir CometAPI API anahtarı, Python 3.10 veya üzeri ve OpenAI Python paketine ihtiyacınız var. Anahtarı kaynak kod yerine sunucu tarafında saklayın.

pip install openaiexport COMETAPI_KEY="your-key-here"

Örnek, POST /v1/chat/completions kullanır. CometAPI bunu birden fazla sağlayıcı için paylaşılan bir arayüz olarak belgelese de, parametre davranışı modele göre değişebilir. Sağlayıcıya özgü alanları eklemeden önce güncel model kaydını ve Chat Completions referansını kontrol edin.

Bir LLM yönlendirici oluşturmak için neye ihtiyacınız var?

  • Kararlı görevleri hizmet katmanlarına eşleyin. Basit uygulama sinyalleri yetersiz kalmadıkça her isteği sınıflandırması için başka bir LLM’den yardım istemeyin. Bir destek etiketi öngörülebilir biçimde düşük maliyetli iştir; canlı bir yanıt gecikmeye duyarlıdır; bir politika incelemesi ise en sıkı kalite kapısını hak eder.
  • Çıktıyı doğrulayın. Başarılı HTTP durumu sonucun kullanılabilir olduğu anlamına gelmez. Yönlendiriciye görev özelinde bir doğrulayıcı verin. Bir sınıflandırma doğrulayıcı, izin verilen etiketi kontrol edebilir; bir müşteri yanıtı doğrulayıcı, uzunluğu ve yasaklı iddiaları zorlayabilir; yapılandırılmış bir iş akışı bir JSON şemasını doğrulayabilir.
  • Geri dönüşü dar tutun. Zaman aşımı, 408, 429, geçici 5xx veya sınırlı bir kalite kapısı hatasından sonra onaylı bir sonraki rotayı deneyin. Hatalı biçimlendirilmiş girdiyi, geçersiz anahtarı veya desteklenmeyen parametreleri gizlemek için başka bir model kullanmayın.

Python ile bir LLM yönlendirici nasıl kurulur?

import osimport time​from openai import APIError, OpenAI​client = OpenAI(    api_key=os.environ["COMETAPI_KEY"],    base_url="https://api.cometapi.com/v1",    max_retries=0,    timeout=20,)​MODELS = {    "cheap": "deepseek-v4-flash",    "fast": "gemini-3.7-flash",    "accurate": "claude-opus-5",}​# Put the preferred tier first; later tiers are fallbacks.ROUTES = {    "tag": ["cheap", "fast", "accurate"],    "reply": ["fast", "cheap", "accurate"],    "policy_review": ["accurate", "fast", "cheap"],}​​def retryable(error):    status = getattr(error, "status_code", None)    return status is None or status in {408, 429} or (status and status >= 500)​​def route(task, prompt, validate=lambda text: True):    attempts = []    for tier in ROUTES.get(task, ROUTES["reply"]):        model = MODELS[tier]        started = time.perf_counter()        try:            response = client.chat.completions.create(                model=model,                messages=[{"role": "user", "content": prompt}],                max_tokens=400,            )            text = response.choices[0].message.content or ""            attempts.append({                "tier": tier,                "model": model,                "latency_ms": round((time.perf_counter() - started) * 1000),                "accepted": validate(text),            })            if attempts[-1]["accepted"]:                return {                    "text": text,                    "route": tier,                    "model": model,                    "usage": response.usage.model_dump() if response.usage else None,                    "attempts": attempts,                }        except APIError as error:            attempts.append({"tier": tier, "model": model, "status": error.status_code})            if not retryable(error):                raise​    raise RuntimeError(f"No route passed: {attempts}")​​if __name__ == "__main__":    result = route(        "reply",        "Reply to a customer asking when their refund will arrive. Do not promise a date.",        validate=lambda text: 30 <= len(text) <= 600 and "guarantee" not in text.lower(),    )    print(result)

Geri dönüşten önce yeniden denemeleri nasıl sınırlandırırsınız?

SDK yeniden denemelerini sıfırda tutun ve her model çağrısını açık bir sınırla sarmalayın. Aşağıdaki yardımcı, yalnızca yeniden denenebilir API hatalarında bir kez yeniden dener, sonra harici rota bir sonraki onaylı katmana geçebilsin diye hata fırlatır.

MAX_ATTEMPTS_PER_MODEL = 2​def call_model(model, prompt):    for attempt in range(1, MAX_ATTEMPTS_PER_MODEL + 1):        try:            return client.chat.completions.create(                model=model,                messages=[{"role": "user", "content": prompt}],                max_tokens=400,            )        except APIError as error:            if not retryable(error) or attempt == MAX_ATTEMPTS_PER_MODEL:                raise            time.sleep(min(0.5 * (2 ** (attempt - 1)), 2.0))

route() içinde, doğrudan client.chat.completions.create(...) çağrısını call_model(model, prompt) ile değiştirin. Üç katmanla, bir istek en fazla altı sağlayıcı çağrısından sonra durur; doğrulama başarısızlıkları aynı çıktıyı yeniden denemek yerine katman başına bir kez tırmanmaya devam eder.

python3 llm_task_router.py ile çalıştırın. İleride sağlayıcıları veya model nesillerini değiştirmek için MODELS’i güncelleyin; görev politikası ve yanıt sözleşmesi tek yerde kalır.

Örnek, yalnızca seçilen modeller tarafından paylaşılan parametreleri kullanır. Model uyumluluğunu kontrol ettikten sonra, model özelinde token kontrollerini bir adaptör katmanı üzerinden ekleyin.

Bir LLM yönlendirme politikasını nasıl test edersiniz?

Önce deterministik politikanın istenen birincil katmanı seçtiğini doğrulayın. Bunlar yönlendirme beklentileridir, sağlayıcı performans sonuçları değildir:

Test isteğiGörev değeriBeklenen birincil rota
Tek bir destek kategorisi atatagDüşük maliyet
Müşteri odaklı bir yanıt taslağıreplyHızlı
Belirsiz bir iade politikasını incelepolicy_reviewYüksek doğruluk

Başarılı bir canlı duman testi, yanıtla birlikte seçilen katmanı, model kimliğini, token kullanımını ve tüm denemeleri döndürür. Gerçek token ve gecikme değerleri değişkenlik gösterecektir:

{  "text": "...",  "route": "fast",  "model": "gemini-3.7-flash",  "usage": {    "prompt_tokens": "measured value",    "completion_tokens": "measured value"  },  "attempts": [    {      "tier": "fast",      "model": "gemini-3.7-flash",      "latency_ms": "measured value",      "accepted": true    }  ]}

Gerçek bir karşılaştırma için, aynı etiketli istekleri üç modelin tümünden geçirin. Görev geçiş oranını, p50 ve p95 gecikmeyi, hata oranını, giriş ve çıkış tokenlarını, geri dönüş oranını ve insan inceleme oranını kaydedin. Önemli olan metrik genellikle API çağrısı başına maliyet değil, kabul edilen çıktı başına maliyettir.

Çok modelli yönlendirme ne kadara mal olur?

Adil bir karşılaştırma için tek bir iş yükü şekli kullanın. Toplam 1 milyon token varsayalım: 800.000 giriş tokenı ve 200.000 çıkış tokenı. 20 Ağustos 2026’da kontrol edilen katalog türevli oranları kullanarak:

RotaHesaplamaTahmini maliyet
Düşük maliyet0.8 × $0.176 + 0.2 × $0.528$0.25
Hızlı0.8 × $0.60 + 0.2 × $3.00$1.08
Yüksek doğruluk0.8 × $4.00 + 0.2 × $20.00$7.20

Trafiğin %60’ı düşük maliyet, %30’u hızlı ve %10’u yüksek doğruluk ise, öngörülen harmanlanmış token maliyeti 1 milyon toplam token başına yaklaşık $1.19 olur. Aynı karışımı tamamen yüksek doğruluk rotasına göndermek, bu varsayımlara göre yaklaşık $7.20 olurdu. Bu, bir fiyatlandırma hesabıdır; karışık politikanın kalite hedefinizi karşılayacağını kanıtlamaz.

Yeniden denemeler ve reddedilmeler sonucu değiştirir. %5 tek seferlik yeniden deneme oranı, $1.19 öngörüsünü kabaca $1.25’e çıkarır. Düşük maliyetli bir çıktı doğrulamadan geçemezse ve tüm istek yüksek doğruluk katmanında tekrar edilirse, her iki çağrıyı da sayın. Görünüşte ucuz bir modelin inceleme veya yeniden üretim maliyetlerini gizlememesi için kabul edilen çıktıları izleyin.

En yaygın LLM yönlendirme hataları nelerdir?

SinyalNe yapmalı
400 veya geçersiz istekYükü düzeltin. Geri dönüş yapmayın.
401API anahtarını yeniden yükleyin veya döndürün. Yeniden denemeyin.
403Model erişimini ve desteklenmeyen alanları kontrol edin.
429Jitter ile geri çekilin, eşzamanlılığı azaltın, ardından politika izin veriyorsa onaylı bir geri dönüş kullanın.
Geçici 5xx veya zaman aşımıBir sonraki uyumlu rotayı deneyin ve istek kimliğini saklayın.
Kalite kapısı başarısızBir kez tırmanın, nedeni kaydedin ve yapılandırılmış rota listesi sonrasında durun.

Hata ve yeniden deneme kılavuzu, oran sınırlamalarını ve geçici platform hatalarını geri çekilmeyle yeniden denemeyi; hatalı biçimlendirilmiş istekler ve kimlik doğrulama hatalarının ise düzeltilmesi gerektiğini önerir. Benzer şekilde, geri dönüş kılavuzu, model geri dönüşünü sıralı ve açık tutar.

Uygulama yönlendirmesi mi yoksa CometAPI Auto mu: Hangisini kullanmalısınız?

Kontrol ve tekrarlanabilirlik önemliyse uygulama yönlendirmesini kullanın. Görevler kararlı olduğunda ve sabit model kimliklerine, katman başına bütçelere, özel doğrulayıcılara ve denetlenebilir bir geri dönüş sırasına ihtiyacınız olduğunda kararı kodunuzda tutun. Bu yaklaşım, aynı model haritasını sürümler arasında karşılaştırmayı da kolaylaştırır.

Bakım yükünü azaltmak daha önemliyse CometAPI Auto kullanın. Denge için model=auto veya kalite öncelikli olduğunda model=auto-high ayarlayın. CometAPI, istek özelliklerinden ve güncel yönlendirme havuzundan dinamik olarak uygun bir model seçer; bu nedenle alttaki model değişebilir. Bu da, her çalıştırmanın aynı modeli veya modele özel parametreleri kullanması gerektiğinde Auto’yu daha az uygun kılar.

LLM yönlendirmesini üretimde nasıl çalıştırırsınız?

  • Model kayıt defterini tazeleyin. Dağıtım sırasında veya başlangıçta https://api.cometapi.com/api/models için GET çağrısı yapın ve yapılandırılmış bir kimlik veya gerekli uç nokta eksikse sürümü başarısız sayın. Model kimlikleri, fiyatlar ve yetenekler değişebilir.
  • Sağlayıcıya özgü seçenekleri yönlendiriciden uzak tutun. Ortak bir Chat Completions yüzeyi her parametreyi aynı yapmaz. Örneğin, logprobs, muhakeme kontrolleri veya birden fazla aday desteği farklılık gösterebilir. Bu farkları test edilmiş adaptörlere koyun.
  • Trafiği ve çıktıyı sınırlandırın. İstekler uygulamadan çıkmadan önce eşzamanlılığı sınırlayın, 429 için jitter ile üstel geri çekilme kullanın ve bir çıktı token tavanı belirleyin. CometAPI’nin oran sınırlaması kılavuzu da aynı uygulama tarafı kontrollerini önerir.
  • Kararı kaydedin. Görev türünü, politika sürümünü, seçilen katmanı, model kimliğini, gecikmeyi, token kullanımını, doğrulama sonucunu, yeniden deneme sayısını, geri dönüş nedenini ve maliyet tahminini kaydedin. Gizli verileri veya gereksiz müşteri içeriğini günlüğe kaydetmekten kaçının.
  • Kanıtla terfi ettirin. Her görev için etiketli bir değerlendirme seti tutun. Eşlemeyi kademeli olarak yayınlayın, önceki politikayla karşılaştırın ve hızlı bir geri alma yolu sağlayın.

Sıkça Sorulan Sorular

CometAPI otomatik olarak hangi modelin ucuz, hızlı veya doğru olduğuna karar verir mi?

Bu öğretici, bu politikayı uygulama kodunda tutar. CometAPI, paylaşılan anahtarı, temel URL’yi, model kataloğunu, Chat Completions arayüzünü ve belgelenmiş geri dönüş yapı taşlarını sağlar. Her katmanın ne anlama geldiğini ve hangi modelin testlerini geçtiğini ekibiniz tanımlar.

Tek bir CometAPI anahtarıyla farklı sağlayıcıların modelleri çağrılabilir mi?

Evet. OpenAI uyumlu metin rotaları için https://api.cometapi.com/v1 kullanın ve model değerini değiştirin. Dağıtımdan önce güncel kataloğu kontrol etmelisiniz.

Neden her isteği en ucuz modele göndermeyelim?

Çıktılar doğrulamadan geçmez, yeniden denemeler gerekirse veya insan incelemesi oluşturursa, en düşük token oranı pahalı hale gelebilir. Kabul edilen sonuç başına maliyeti karşılaştırın ve yüksek etkili görevleri daha sıkı kalite kapıları arkasında tutun.

Kalite hatası geri dönüşü tetiklemeli mi?

Yalnızca hata makine tarafından saptanabilir olduğunda ve tırmanma sınırlı olduğunda. Bir şema hatası, eksik zorunlu alan veya yasaklı bir söz, bir kez tırmanmayı haklı çıkarabilir. Belirsiz memnuniyetsizlik, sınırsız bir yeniden deneme döngüsü yerine değerlendirme verisi olmalıdır.

Model haritası ne sıklıkla değişmeli?

Güncel katalog verileri ve tekrarlanabilir bir değerlendirme daha iyi bir değiş tokuş gösterdiğinde değiştirin. Yalnızca katalogda yeni bir isim belirdi diye modelleri döndürmeyin.

Daha sonra bir OpenAI modeli ekleyebilir miyim?

Evet. Güncel bir OpenAI uyumlu model kimliğini MODELS’e ekleyin, aynı istek ve yanıt sözleşmesini test edin ve rota sırasına yerleştirin. İstemci, anahtar ve temel URL değişmeden kalır.

Bir LLM yönlendirme politikasını sürdürülebilir nasıl tutarsınız?

En kolay çok sağlayıcılı yönlendirici otonom bir kara kutu değildir. Paylaşılan API erişimi, güncel model meta verileri, bir kalite doğrulayıcı ve dar bir geri dönüş zinciri tarafından desteklenen kısa, sürümlenmiş bir görev politikasıdır. CometAPI, bağlantı işini tek bir anahtar ve tek bir OpenAI uyumlu temel URL’ye indirir; uygulamanız maliyet, gecikme ve kalite kararlarının kontrolünü elinde tutar.

Öğrenmeye devam et

Bu makaleyi sonraki karara bağlayın.

Tüm konuları gör
Yayınlanma tarihi Sep 1, 2026
Son güncelleme Sep 4, 2026
4 görüntülenme
Netlik, kaynak ataması ve güncel API terminolojisi açısından gözden geçirildi.

Yapay zeka geliştirme maliyetlerinizi %20 azaltmaya hazır mısınız?

Dakikalar içinde ücretsiz başlayın. Ücretsiz deneme kredileri dahildir. Kredi kartı gerekmez.

Devamını Oku