GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/CometAPI araştırması

Claude Fable 5.1 Kıyaslamaları: Skorlar bana ne anlatıyor

Claude Fable 5.1 kıyaslamalarını, önemli kazanımları, sınırlamaları ve Fable 5, Opus 5, GPT-5.6 Sol ile GPT-6 Astra ile karşılaştırmaları inceleyin.

CometAPI
Mia MarenAI model ve API araştırma ekibi
Güncellendi Sep 17, 2026 12 dk okuma
Claude Fable 5.1 Kıyaslamaları: Skorlar bana ne anlatıyor
Bu kalıbı kullanın

İlk API çağrısını yapın.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Özet Claude Fable 5.1, öncelikle ajan yürütmesine odaklı bir yükseltmedir. En büyük raporlanan kazanımlar, planlama, araç kullanımı, doğrulama ve çok adımda toparlanma gerektiren bilimsel araştırma, iş otomasyonu, terminal kodlama ve benzeri iş akışlarında görülüyor. Kapalı uçlu akıl yürütme ve daha kısa IDE tarzı kodlama görevlerinde iyileştirmeler daha küçük; bu nedenle en iyi dağıtım kararı tek bir manşet puandan değil, iş yükünden bağımsız olarak verilmelidir.

Önemli Noktalar

  • Fable 5.1, Anthropic’in değerlendirmesinde Terminal-Bench-Science 0.1’de %52.6 skor alarak Fable 5’in %24.7’sini ikiye katlıyor.
  • AutomationBench %17.1’den %31.4’e yükseliyor; uçtan uca iş akışlarında büyük bir iyileşme gösteriyor.
  • CursorBench ve araç destekli Humanity’s Last Exam’deki kazanımlar daha mütevazı; bu da sürümün her akıl yürütme biçimini eşit derecede değil, daha çok sürdürülebilir yürütmeyi geliştirdiğini düşündürüyor.
  • Fable 5.1, Fable 5 ile aynı standart token fiyatlarını korurken, daha düşük önbellek okuma fiyatı, bağlam ağırlıklı ajan iş akışlarının efektif maliyetini azaltabiliyor.
  • GPT-6 Astra artık daha güncel OpenAI karşılaştırmasıdır, ancak Anthropic’in 1 Eylül benchmark tablosuna dahil edilmedi. Herhangi bir doğrudan performans iddiası, aynı kurguda kontrollü bir değerlendirme gerektirir.

Anthropic, 1 Eylül 2026’da zorlayıcı akıl yürütme, uzun vadeli ajanlar, yazılım mühendisliği, araştırma ve profesyonel bilgi işleri için Claude Fable 5.1’i yayımladı. Claude Fable 5.1, geliştiricilerin birleşik bir uç nokta üzerinden diğer öncü modellerle birlikte değerlendirmek istemeleri halinde CometAPI üzerinden de kullanılabilir.

Manşet sonuçlar güçlü, ancak iyileşmenin dağılımı ortalamadan daha bilgilendiricidir. Fable 5.1, bir ajanın bir hedefi koruması, araçlarla etkileşime girmesi, hatalardan toparlanması ve nihai durumu doğrulaması gerektiğinde en çok kazanımı sağlar. Bu yazı, kıyaslama sonuçlarının ne anlama geldiğine, modelin hâlâ nerede yetersiz kaldığına ve daha yeni alternatiflere karşı nasıl değerlendirileceğine odaklanır.

Claude Fable 5.1 Kısa Bakış

Anthropic’in model dokümantasyonu, 1 milyon tokenlık bir bağlam penceresi, 128K maksimum çıktı, metin ve görsel girdi, her zaman açık uyarlanabilir düşünme ve Haziran 2026 bilgi kesimini belirtir. Claude API model kimliği claude-fable-5-1.

Resmi teknik özellikClaude Fable 5.1
SağlayıcıAnthropic
Yayın tarihiSeptember 1, 2026
Model kimliğiclaude-fable-5-1
Bağlam penceresi1,000,000 tokens
Maksimum çıktı128,000 tokens
Girdi / çıktıMetin ve görseller → metin
DüşünmeUyarlanabilir, her zaman açık
Varsayılan eforYüksek
Bilgi kesimiJune 2026
Anthropic girdi fiyatı$10 / MTok
Anthropic çıktı fiyatı$50 / MTok
Önbellek okuma$0.25 / MTok
Göreli gecikmeDaha yavaş
Birincil konumlandırmaZorlu akıl yürütme ve uzun vadeli ajan çalışmaları

Standart girdi ve çıktı fiyatları Fable 5 ile aynı kalırken, önbellek okumaları milyon token başına $0.25’e düştü. Fable 5.1’in başlık girdi/çıktı token fiyatları daha düşük değil. Daha düşük efektif maliyet, esas olarak önbellek okuma fiyatlandırmasındaki %75 düşüşten geliyor. Anthropic, tipik iş yükleri için yaklaşık %25 ve yüksek derecede ajanik iş yükleri için yaklaşık %45’e kadar daha düşük maliyet tahmin ediyor.

Bu önemlidir çünkü uzun süre çalışan bir ajan, depo bağlamını, talimatları, araç tanımlarını ve önceki durumu tekrar tekrar yeniden kullanır. Başlık girdi ve çıktı fiyatları değişmese bile tamamlanan görev başına maliyet iyileşebilir.

Anthropic ayrıca Claude Mythos 5.1 için Terminal-Bench 4.0’da %60.9 rapor ediyor. Mythos 5.1, farklı korumalarla ayrı olarak dağıtılan bir sürümdür ve genel kullanıma açık Fable 5.1 skoru olarak değerlendirilmemelidir.

Claude Fable 5.1 Kıyaslamaları Ne Gösteriyor?

Aşağıdaki değerler Anthropic’in Eylül 2026 değerlendirmesinden alınmıştır. Bunlar değişmez bir model özelliği değil, bir model ve değerlendirme kurgusu konfigürasyonunu tanımlar.

KıyaslamaNe ölçerFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Ajanik bilimsel araştırma52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Ajanik terminal kodlama55.8%42.0%52.3%37.3%
GDPval-AA v2Profesyonel bilgi işi, Elo1853172318241711
OSWorld 2.0, kısmiUzun vadeli bilgisayar kullanımı77.9%72.9%75.4%
OSWorld 2.0, katıTamamıyla tamamlanan bilgisayar görevleri41.7%36.1%39.6%
Humanity’s Last Exam, araçsızUzman çokdisiplinli akıl yürütme60.9%57.8%56.6%
Humanity’s Last Exam, araçlıAraçlarla uzman akıl yürütme65.0%63.8%63.6%
AutomationBenchUçtan uca iş akışları31.4%17.1%26.9%19.6%
CursorBench 3.2.0Ajanik IDE kodlama73.4%70.5%70.0%67.2%

Fable 5.1, bildirilen dokuz satırın tamamında Fable 5 ve Opus 5’in önündedir. En büyük nesilsel kazanımlar bilimsel araştırma, iş akışı otomasyonu ve terminal kodlamada gerçekleşir. Humanity’s Last Exam ve CursorBench’teki daha küçük farklar da aynı derecede önemlidir; çünkü iyileşmenin her iş yükünde eşit olmadığını gösterir.

Claude Fable 5.1 Nerede En Çok İyileşiyor?

Terminal-Bench-Science 0.1: öne çıkan sonuç

Fable 5.1, Anthropic’in çalıştırmasında Claude Fable 5 için %24.7, Claude Opus 5 için %29.0 ve GPT-5.6 Sol için %22.4 ile karşılaştırıldığında %52.6 skor alıyor. Büyük 27.9 puanlık nesilsel fark, raporlanan model başına standart hatadan çok daha büyüktür; buna karşılık, Terminal-Bench 4.0’da Fable 5.1’in Opus 5’e karşı 3.5 puanlık farkı gibi daha küçük aralıklar daha temkinli yorumlanmalıdır.

Terminal-Bench-Science, bilimsel ve mühendislik alanlarında tam araştırma iş akışlarını değerlendirir. Ajanların, yalnızca izole soruları yanıtlamak yerine kod, analiz, ispat, simülasyon veya veri ürünleri üretmeleri gerekir. Anthropic, model başına yaklaşık ±3.5–4.5 puan standart hata bildirir; bu nedenle küçük farklar otomatik olarak anlamlı yetenek farkları olarak yorumlanmamalıdır.

Terminal-Bench 4.0: daha güçlü özerk kodlama

Fable 5.1 %55.8’e ulaşarak Fable 5’in %42.0’sının, Opus 5’in %52.3’ünün ve GPT-5.6 Sol’un %37.3’ünün önüne geçiyor. Fable 5’e göre 13.8 puanlık iyileşme kayda değerken, Opus 5’e karşı 3.5 puanlık fark nispeten dardır.

Kıyaslama, ajanları bir yürütme ortamına yerleştirir; bu nedenle başarı, ortamda gezinmeye, kodu değiştirmeye ve sonuçları doğrulamaya bağlıdır. Terminal-Bench 4.0, önceki sürümlerden farklı bir görev kümesi kullandığından, skorlar yalnızca aynı kıyaslama sürümü içinde karşılaştırılmalıdır.

AutomationBench: önemli bir kazanım ve ciddi gelişim payı

AutomationBench, Fable 5’te %17.1’den Fable 5.1’de %31.4’e yükseliyor. Bu, mutlak 14.3 puanlık bir artış ya da yaklaşık %84 göreli kazançtır.

Kıyaslama; satış, pazarlama, operasyonlar, destek, finans ve İK genelinde iş akışlarını nihai ortam durumunu kontrol ederek değerlendirir. Bu da bir ajanın doğru eylemleri yalnızca önermediğini, gerçekten bir iş akışını tamamlayıp tamamlamadığının faydalı bir testidir. Skor aynı zamanda kalan sınırlamayı da ortaya koyar: Anthropic’in raporlanan konfigürasyonu altında görevlerin yaklaşık üçte ikisi hâlâ tamamlanmadı.

CursorBench 3.2.0: daha küçük bir kodlama kazanımı

Fable 5.1 %73.4’e ulaşırken, Fable 5 %70.5, Opus 5 %70.0 ve GPT-5.6 Sol %67.2’ye ulaşıyor. Fable 5’e göre kazanım yalnızca 2.9 puan.

Dolayısıyla sürüm, planlama, yürütme, doğrulama ve toparlanmayı içeren daha uzun iş akışlarına kıyasla, daha kısa IDE tarzı kodlama görevlerinde daha az dönüştürücü görünüyor. Değerlendirme paketleri yalnızca kod üretim kalitesini değil, depo çapında değişiklikleri ve başarısız testlerden toparlanmayı da içermelidir.

OSWorld 2.0: bilgisayar kullanımı hâlâ zor

Fable 5.1, kısmi kredide %77.9 ve katı tamamlama altında %41.7 skor alıyor. Opus 5 %75.4 ve %39.6’ya, Fable 5 ise %72.9 ve %36.1’e ulaşıyor.

Katı skor, üretimde daha açıklayıcı bir sinyaldir. Görevlerin yarıdan azı tamamen tamamlanmıştır; bu da bilgisayar kullanımındaki ilerlemenin, kontrol noktaları, izinler, izleme ve toparlanma mantığı ihtiyacını ortadan kaldırmadığını gösterir.

CursorBench ve Humanity’s Last Exam: daha küçük kazanımlar

Fable 5.1, CursorBench 3.2.0’da %73.4’e ulaşarak Fable 5’in yalnızca 2.9 puan üzerine çıkıyor. Humanity’s Last Exam’de araçsız 3.1 puan, araçlı ise 1.2 puan kazanıyor.

Bu daha dar farklar, temel yorumu destekler: Fable 5.1, planlama, yürütme, doğrulama ve toparlanmayı içeren uzun iş akışlarında, daha kısa IDE görevleri veya kapalı uçlu akademik akıl yürütmeye kıyasla daha dönüştürücüdür.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Kısa cevap: Fable 5.1, Anthropic’in yayımladığı uzun ufuklu kıyaslama tablosunda en güçlü seçenektir; performans farkının küçük kaldığı durumlarda Opus 5 daha ekonomik başlangıç noktasıdır; Fable 5 miras temel çizgidir; GPT-6 Astra, doğrudan bir sıralama yapılmadan önce aynı kurguda bir test gerektirir.

Fable 5.1, Anthropic’in raporlanan uzun ufuklu ajan kıyaslamalarında Fable 5’e göre net bir nesilsel yükseltmedir. GPT-6 Astra, daha güncel OpenAI karşılaştırmasıdır, ancak Anthropic’in 1 Eylül değerlendirmesinden sonra yayımlandı ve aynı kıyaslama kurgusuna dahil edilmedi.

BoyutClaude Fable 5.1Claude Fable 5GPT-6 Astra
Bağlam penceresi1M tokens1M tokens1.05M tokens
Maksimum çıktı128K128K128K
Standart girdi / çıktı$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Önbellek okuma$0.25 / MTok$1 / MTokGeçerli sağlayıcı şartlarını doğrulayın
Terminal-Bench-Science 0.152.6%24.7%Anthropic’in lansman tablosunda yok
Terminal-Bench 4.055.8%42.0%Anthropic’in lansman tablosunda yok
AutomationBench31.4%17.1%Anthropic’in lansman tablosunda yok
Birincil konumlandırmaZorlu akıl yürütme ve uzun vadeli ajanlarÖnceki Fable sınıfı temel çizgiZor uçtan uca profesyonel işler

Fable 5’e karşı Fable 5.1, bilimsel araştırma, iş otomasyonu ve terminal kodlamada ölçülen en büyük kazanımları gösterirken aynı standart token fiyatlarını korur. Daha düşük önbellek okuma fiyatlandırması, tekrarlanan bağlama dayanan ajanların ekonomisini daha da iyileştirir.

Seçim kuralı: Maliyet öncelikse Opus 5 ile başlayın; uzun ufuklu tamamlama ve toparlanma en önemliyse Fable 5.1’e yükseltin; Fable 5’i yalnızca uyumluluk açısından hassas iş yükleri için tutun; üretime almadan önce GPT-6 Astra’yı aynı kurguda kontrollü bir testte değerlendirin.

Kıyaslama Performansı İş Yüklerine Göre Nasıl Görünüyor?

YetenekFable 5.1 sonucuFable 5’e göre değişimYorum
Ajanik bilimsel araştırma52.6%+27.9 puanÇok büyük kazanım
İş akışı otomasyonu31.4%+14.3 puanÇok büyük kazanım
Terminal kodlama55.8%+13.8 puanBüyük kazanım
Bilgisayar kullanımı, katı41.7%+5.6 puanOrta düzeyde kazanım
Bilgisayar kullanımı, kısmi77.9%+5.0 puanOrta düzeyde kazanım
Uzman akıl yürütme, araçsız60.9%+3.1 puanKüçük kazanım
IDE ajan kodlama73.4%+2.9 puanKüçük kazanım
Uzman akıl yürütme, araçlı65.0%+1.2 puanKüçük kazanım
Profesyonel bilgi işi1853 Elo+130 EloGüçlü, yapılandırmaya duyarlı

Desen tutarlı: en büyük iyileştirmeler, başarı azim, planlama, ortamla etkileşim, araç kullanımı ve zaman içinde toparlanmaya bağlı olduğunda ortaya çıkıyor.

Kıyaslamalar Size Neyi Anlatmaz?

Kıyaslama tabloları, davranışı tek sayılara sıkıştırır. Özerk ajanların çözüldüğünü kanıtlamazlar ve her üretim iş yükünü öngörmezler.

  • Ana karşılaştırma tablosu satıcı tarafından yürütülmüştür.
  • Efor ayarları kaliteyi, gecikmeyi ve maliyeti etkiler.
  • Ajan kıyaslamaları, modeli; kurgu, araçlar ve izinlerle birleşik olarak ölçer.
  • Üretim korumaları Fable 5.1 için etkinleştirildi ve bazı sonuçları etkiledi.
  • Kıyaslama sürümleri değişir; bu nedenle farklı görev sürümlerinden gelen değerler doğrudan karşılaştırılmayabilir.
  • AutomationBench %31.4’te, OSWorld katı tamamlama %41.7’de kalıyor; önemli başarısızlık oranları sürüyor.

Pratik bir değerlendirme, adayları kısa listeye almak için açık puanları kullanmalı, aynı ayarlarla küçük bir karşılaştırmayı yeniden üretmeli ve ardından gerçek üretim iş akışını test etmelidir.

Claude Fable 5.1 en iyi Claude modeli mi?

Zor ve uzun süreli işler için maksimum yetenek açısından, Claude Fable 5.1 için kıyaslama kanıtı güçlü bir gerekçe sunuyor. Her iş yükü için, hayır.

Anthropic, Fable 5.1’i milyon giriş tokenı başına $10 ve milyon çıkış tokenı başına $50 fiyatlandırıyor; Opus 5 için bu rakamlar $5 ve $25. Prim, yalnızca Fable 5.1 daha yüksek başarı oranı, daha az yeniden deneme, kabul edilen görev başına daha az token veya insan inceleme süresinde yeterli azalma sağladığında haklıdır.

Daha düşük önbellek okuma fiyatlandırması, ajanlar için efektif maliyet farkını daraltabilir. Kabul edilen sonuç başına maliyet, yalnızca token başına fiyattan daha kullanışlıdır.

Claude Fable 5.1’i Nasıl Kıyaslamalısınız?

Değerlendirmeniz, amaçlanan üretim iş yüküne benzemelidir.

  • Kodlama: Tam konuları test edin ve yama kabulünü, geçen testleri, yeniden denemeleri, araç çağrılarını, geçen süreyi ve insan düzeltme süresini kaydedin.
  • Araştırma: Kaynak kalitesini, olgusal doğruluğu, kanıt kapsamını, alt görev tamamlama durumunu ve uzun çalışmalarda hedefin korunmasını değerlendirin.
  • İş ajanları: Tek tek doğru eylemleri saymak yerine nihai ortam durumunu puanlayın.
  • Bilgisayar kullanımı: Açılır pencerelerden toparlanma, yavaş sayfalar, kesilen oturumlar ve tutarsız uygulama durumunu ölçün.
  • Model karşılaştırması: İstemleri, kurguları, araçları, izinleri, efor ayarlarını ve puanlama kurallarını sabit tutun.
  • Ekonomi: Yalnızca token başına maliyeti değil, kabul edilen görev başına maliyeti ölçün.

Sonuç

Kıyaslama kanıtı, Fable 5.1’in tek bir yanıt yerine sürdürülebilir yürütme gerektiren görevlerde en değerli olduğunu gösteriyor. En güçlü kullanım alanları, bilimsel araştırma, özerk kodlama, karmaşık iş otomasyonu ve tekrarlanan doğrulama ile toparlanma gerektiren iş akışlarıdır.

Kanıt, evrensel üstünlüğü desteklemiyor. Birkaç kıyaslamadaki küçük farklar, katı bilgisayar kullanımı görevlerinde anlamlı başarısızlık oranları ve GPT-6 Astra’nın Anthropic’in lansman tablosundan yokluğu, iş yüküne özel testlerin gerekliliğini pekiştiriyor.

CometAPI kullanıcıları için pratik bir dağıtım kuralı, uzun ufuklu başarıların primli çıkarımı haklı çıkarabileceği yerlerde Fable 5.1’i test etmek, ardından üretim yolunu seçmeden önce aynı temsili görevlerde Opus 5, GPT-5.6 Sol ve GPT-6 Astra ile karşılaştırmaktır.

SSS

Claude Fable 5.1’in en yüksek kıyaslama skoru nedir?

Anthropic’in raporladığı yüzde metrikleri arasında Fable 5.1, OSWorld 2.0’da kısmi kredide %77.9 ve CursorBench 3.2.0’da %73.4’e ulaşıyor. En büyük nesilsel iyileştirmesi Terminal-Bench-Science’dadır: Fable 5 için %24.7’ye karşı %52.6.

Claude Fable 5.1, Fable 5’ten ne kadar daha iyi?

Kazanım, iş yüküne göre keskin şekilde değişiyor: Terminal-Bench-Science’da 27.9 puan, AutomationBench’te 14.3 ve Terminal-Bench 4.0’da 13.8; ancak CursorBench’te yalnızca 2.9 ve araç destekli Humanity’s Last Exam’de 1.2 puan.

Claude Fable 5.1, Claude Opus 5’ten daha mı iyi?

Anthropic’in raporlanan tablosunda daha yüksek skorlar alıyor, ancak birçok fark küçük. Anthropic, ek uzun ufuklu yetenek gerektiğinde yükseltmeye gitmeden önce Opus 5 ile başlamayı öneriyor.

Claude Fable 5.1, GPT-5.6 Sol’u geçiyor mu?

Anthropic, paylaşılan beş metrikte Fable 5.1 için daha yüksek skorlar rapor ediyor. Bunlar satıcı tarafından yürütülen rakip değerlendirmeleri olduğundan ve konfigürasyonlar değiştiğinden, güvenli sonuç Fable 5.1’in evrensel olarak üstün değil, yüksek derecede rekabetçi olduğudur.

Sonuçlar bağımsız olarak doğrulandı mı?

Kısmen. Birkaç kıyaslamanın herkese açık lider tabloları vardır; ancak değerlerinin Anthropic’in lansman çalıştırmasıyla doğrudan karşılaştırılabilmesi için efor, kurgu, yedek davranış ve görev sürümlerinin hizalanması gerekir.

Claude Fable 5.1 en çok ne için uygundur?

Kıyaslama profili, uzun süreli bilimsel araştırmalar, özerk kodlama, karmaşık ajan iş akışları, iş otomasyonu ve planlama, araçlar, doğrulama ve toparlanma gerektiren görevler için en güçlüdür.

Claude Fable 5.1’e nasıl erişebilirim?

Claude Fable 5.1, CometAPI’de listelenmiştir ve model kimliği claude-fable-5-1’dir. Birleşik uç nokta, üretim rotasını seçmeden önce aynı değerlendirme iş yükünü birkaç modelde çalıştırmayı pratik hale getirir.

Öğrenmeye devam et

Bu makaleyi sonraki karara bağlayın.

Tüm konuları gör
Yayınlanma tarihi Sep 17, 2026
Son güncelleme Sep 17, 2026
0 görüntülenme
Netlik, kaynak ataması ve güncel API terminolojisi açısından gözden geçirildi.

Yapay zeka geliştirme maliyetlerinizi %20 azaltmaya hazır mısınız?

Dakikalar içinde ücretsiz başlayın. Ücretsiz deneme kredileri dahildir. Kredi kartı gerekmez.

Devamını Oku