Özet Claude Fable 5.1, öncelikle ajan yürütmesine odaklı bir yükseltmedir. En büyük raporlanan kazanımlar, planlama, araç kullanımı, doğrulama ve çok adımda toparlanma gerektiren bilimsel araştırma, iş otomasyonu, terminal kodlama ve benzeri iş akışlarında görülüyor. Kapalı uçlu akıl yürütme ve daha kısa IDE tarzı kodlama görevlerinde iyileştirmeler daha küçük; bu nedenle en iyi dağıtım kararı tek bir manşet puandan değil, iş yükünden bağımsız olarak verilmelidir.
Önemli Noktalar
- Fable 5.1, Anthropic’in değerlendirmesinde Terminal-Bench-Science 0.1’de %52.6 skor alarak Fable 5’in %24.7’sini ikiye katlıyor.
- AutomationBench %17.1’den %31.4’e yükseliyor; uçtan uca iş akışlarında büyük bir iyileşme gösteriyor.
- CursorBench ve araç destekli Humanity’s Last Exam’deki kazanımlar daha mütevazı; bu da sürümün her akıl yürütme biçimini eşit derecede değil, daha çok sürdürülebilir yürütmeyi geliştirdiğini düşündürüyor.
- Fable 5.1, Fable 5 ile aynı standart token fiyatlarını korurken, daha düşük önbellek okuma fiyatı, bağlam ağırlıklı ajan iş akışlarının efektif maliyetini azaltabiliyor.
- GPT-6 Astra artık daha güncel OpenAI karşılaştırmasıdır, ancak Anthropic’in 1 Eylül benchmark tablosuna dahil edilmedi. Herhangi bir doğrudan performans iddiası, aynı kurguda kontrollü bir değerlendirme gerektirir.
Anthropic, 1 Eylül 2026’da zorlayıcı akıl yürütme, uzun vadeli ajanlar, yazılım mühendisliği, araştırma ve profesyonel bilgi işleri için Claude Fable 5.1’i yayımladı. Claude Fable 5.1, geliştiricilerin birleşik bir uç nokta üzerinden diğer öncü modellerle birlikte değerlendirmek istemeleri halinde CometAPI üzerinden de kullanılabilir.
Manşet sonuçlar güçlü, ancak iyileşmenin dağılımı ortalamadan daha bilgilendiricidir. Fable 5.1, bir ajanın bir hedefi koruması, araçlarla etkileşime girmesi, hatalardan toparlanması ve nihai durumu doğrulaması gerektiğinde en çok kazanımı sağlar. Bu yazı, kıyaslama sonuçlarının ne anlama geldiğine, modelin hâlâ nerede yetersiz kaldığına ve daha yeni alternatiflere karşı nasıl değerlendirileceğine odaklanır.
Claude Fable 5.1 Kısa Bakış
Anthropic’in model dokümantasyonu, 1 milyon tokenlık bir bağlam penceresi, 128K maksimum çıktı, metin ve görsel girdi, her zaman açık uyarlanabilir düşünme ve Haziran 2026 bilgi kesimini belirtir. Claude API model kimliği claude-fable-5-1.
| Resmi teknik özellik | Claude Fable 5.1 |
|---|---|
| Sağlayıcı | Anthropic |
| Yayın tarihi | September 1, 2026 |
| Model kimliği | claude-fable-5-1 |
| Bağlam penceresi | 1,000,000 tokens |
| Maksimum çıktı | 128,000 tokens |
| Girdi / çıktı | Metin ve görseller → metin |
| Düşünme | Uyarlanabilir, her zaman açık |
| Varsayılan efor | Yüksek |
| Bilgi kesimi | June 2026 |
| Anthropic girdi fiyatı | $10 / MTok |
| Anthropic çıktı fiyatı | $50 / MTok |
| Önbellek okuma | $0.25 / MTok |
| Göreli gecikme | Daha yavaş |
| Birincil konumlandırma | Zorlu akıl yürütme ve uzun vadeli ajan çalışmaları |
Standart girdi ve çıktı fiyatları Fable 5 ile aynı kalırken, önbellek okumaları milyon token başına $0.25’e düştü. Fable 5.1’in başlık girdi/çıktı token fiyatları daha düşük değil. Daha düşük efektif maliyet, esas olarak önbellek okuma fiyatlandırmasındaki %75 düşüşten geliyor. Anthropic, tipik iş yükleri için yaklaşık %25 ve yüksek derecede ajanik iş yükleri için yaklaşık %45’e kadar daha düşük maliyet tahmin ediyor.
Bu önemlidir çünkü uzun süre çalışan bir ajan, depo bağlamını, talimatları, araç tanımlarını ve önceki durumu tekrar tekrar yeniden kullanır. Başlık girdi ve çıktı fiyatları değişmese bile tamamlanan görev başına maliyet iyileşebilir.
Anthropic ayrıca Claude Mythos 5.1 için Terminal-Bench 4.0’da %60.9 rapor ediyor. Mythos 5.1, farklı korumalarla ayrı olarak dağıtılan bir sürümdür ve genel kullanıma açık Fable 5.1 skoru olarak değerlendirilmemelidir.
Claude Fable 5.1 Kıyaslamaları Ne Gösteriyor?
Aşağıdaki değerler Anthropic’in Eylül 2026 değerlendirmesinden alınmıştır. Bunlar değişmez bir model özelliği değil, bir model ve değerlendirme kurgusu konfigürasyonunu tanımlar.
| Kıyaslama | Ne ölçer | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Ajanik bilimsel araştırma | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Ajanik terminal kodlama | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Profesyonel bilgi işi, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, kısmi | Uzun vadeli bilgisayar kullanımı | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, katı | Tamamıyla tamamlanan bilgisayar görevleri | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, araçsız | Uzman çokdisiplinli akıl yürütme | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, araçlı | Araçlarla uzman akıl yürütme | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | Uçtan uca iş akışları | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Ajanik IDE kodlama | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1, bildirilen dokuz satırın tamamında Fable 5 ve Opus 5’in önündedir. En büyük nesilsel kazanımlar bilimsel araştırma, iş akışı otomasyonu ve terminal kodlamada gerçekleşir. Humanity’s Last Exam ve CursorBench’teki daha küçük farklar da aynı derecede önemlidir; çünkü iyileşmenin her iş yükünde eşit olmadığını gösterir.
Claude Fable 5.1 Nerede En Çok İyileşiyor?
Terminal-Bench-Science 0.1: öne çıkan sonuç
Fable 5.1, Anthropic’in çalıştırmasında Claude Fable 5 için %24.7, Claude Opus 5 için %29.0 ve GPT-5.6 Sol için %22.4 ile karşılaştırıldığında %52.6 skor alıyor. Büyük 27.9 puanlık nesilsel fark, raporlanan model başına standart hatadan çok daha büyüktür; buna karşılık, Terminal-Bench 4.0’da Fable 5.1’in Opus 5’e karşı 3.5 puanlık farkı gibi daha küçük aralıklar daha temkinli yorumlanmalıdır.
Terminal-Bench-Science, bilimsel ve mühendislik alanlarında tam araştırma iş akışlarını değerlendirir. Ajanların, yalnızca izole soruları yanıtlamak yerine kod, analiz, ispat, simülasyon veya veri ürünleri üretmeleri gerekir. Anthropic, model başına yaklaşık ±3.5–4.5 puan standart hata bildirir; bu nedenle küçük farklar otomatik olarak anlamlı yetenek farkları olarak yorumlanmamalıdır.
Terminal-Bench 4.0: daha güçlü özerk kodlama
Fable 5.1 %55.8’e ulaşarak Fable 5’in %42.0’sının, Opus 5’in %52.3’ünün ve GPT-5.6 Sol’un %37.3’ünün önüne geçiyor. Fable 5’e göre 13.8 puanlık iyileşme kayda değerken, Opus 5’e karşı 3.5 puanlık fark nispeten dardır.
Kıyaslama, ajanları bir yürütme ortamına yerleştirir; bu nedenle başarı, ortamda gezinmeye, kodu değiştirmeye ve sonuçları doğrulamaya bağlıdır. Terminal-Bench 4.0, önceki sürümlerden farklı bir görev kümesi kullandığından, skorlar yalnızca aynı kıyaslama sürümü içinde karşılaştırılmalıdır.
AutomationBench: önemli bir kazanım ve ciddi gelişim payı
AutomationBench, Fable 5’te %17.1’den Fable 5.1’de %31.4’e yükseliyor. Bu, mutlak 14.3 puanlık bir artış ya da yaklaşık %84 göreli kazançtır.
Kıyaslama; satış, pazarlama, operasyonlar, destek, finans ve İK genelinde iş akışlarını nihai ortam durumunu kontrol ederek değerlendirir. Bu da bir ajanın doğru eylemleri yalnızca önermediğini, gerçekten bir iş akışını tamamlayıp tamamlamadığının faydalı bir testidir. Skor aynı zamanda kalan sınırlamayı da ortaya koyar: Anthropic’in raporlanan konfigürasyonu altında görevlerin yaklaşık üçte ikisi hâlâ tamamlanmadı.
CursorBench 3.2.0: daha küçük bir kodlama kazanımı
Fable 5.1 %73.4’e ulaşırken, Fable 5 %70.5, Opus 5 %70.0 ve GPT-5.6 Sol %67.2’ye ulaşıyor. Fable 5’e göre kazanım yalnızca 2.9 puan.
Dolayısıyla sürüm, planlama, yürütme, doğrulama ve toparlanmayı içeren daha uzun iş akışlarına kıyasla, daha kısa IDE tarzı kodlama görevlerinde daha az dönüştürücü görünüyor. Değerlendirme paketleri yalnızca kod üretim kalitesini değil, depo çapında değişiklikleri ve başarısız testlerden toparlanmayı da içermelidir.
OSWorld 2.0: bilgisayar kullanımı hâlâ zor
Fable 5.1, kısmi kredide %77.9 ve katı tamamlama altında %41.7 skor alıyor. Opus 5 %75.4 ve %39.6’ya, Fable 5 ise %72.9 ve %36.1’e ulaşıyor.
Katı skor, üretimde daha açıklayıcı bir sinyaldir. Görevlerin yarıdan azı tamamen tamamlanmıştır; bu da bilgisayar kullanımındaki ilerlemenin, kontrol noktaları, izinler, izleme ve toparlanma mantığı ihtiyacını ortadan kaldırmadığını gösterir.
CursorBench ve Humanity’s Last Exam: daha küçük kazanımlar
Fable 5.1, CursorBench 3.2.0’da %73.4’e ulaşarak Fable 5’in yalnızca 2.9 puan üzerine çıkıyor. Humanity’s Last Exam’de araçsız 3.1 puan, araçlı ise 1.2 puan kazanıyor.
Bu daha dar farklar, temel yorumu destekler: Fable 5.1, planlama, yürütme, doğrulama ve toparlanmayı içeren uzun iş akışlarında, daha kısa IDE görevleri veya kapalı uçlu akademik akıl yürütmeye kıyasla daha dönüştürücüdür.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Kısa cevap: Fable 5.1, Anthropic’in yayımladığı uzun ufuklu kıyaslama tablosunda en güçlü seçenektir; performans farkının küçük kaldığı durumlarda Opus 5 daha ekonomik başlangıç noktasıdır; Fable 5 miras temel çizgidir; GPT-6 Astra, doğrudan bir sıralama yapılmadan önce aynı kurguda bir test gerektirir.
Fable 5.1, Anthropic’in raporlanan uzun ufuklu ajan kıyaslamalarında Fable 5’e göre net bir nesilsel yükseltmedir. GPT-6 Astra, daha güncel OpenAI karşılaştırmasıdır, ancak Anthropic’in 1 Eylül değerlendirmesinden sonra yayımlandı ve aynı kıyaslama kurgusuna dahil edilmedi.
| Boyut | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Bağlam penceresi | 1M tokens | 1M tokens | 1.05M tokens |
| Maksimum çıktı | 128K | 128K | 128K |
| Standart girdi / çıktı | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Önbellek okuma | $0.25 / MTok | $1 / MTok | Geçerli sağlayıcı şartlarını doğrulayın |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Anthropic’in lansman tablosunda yok |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Anthropic’in lansman tablosunda yok |
| AutomationBench | 31.4% | 17.1% | Anthropic’in lansman tablosunda yok |
| Birincil konumlandırma | Zorlu akıl yürütme ve uzun vadeli ajanlar | Önceki Fable sınıfı temel çizgi | Zor uçtan uca profesyonel işler |
Fable 5’e karşı Fable 5.1, bilimsel araştırma, iş otomasyonu ve terminal kodlamada ölçülen en büyük kazanımları gösterirken aynı standart token fiyatlarını korur. Daha düşük önbellek okuma fiyatlandırması, tekrarlanan bağlama dayanan ajanların ekonomisini daha da iyileştirir.
Seçim kuralı: Maliyet öncelikse Opus 5 ile başlayın; uzun ufuklu tamamlama ve toparlanma en önemliyse Fable 5.1’e yükseltin; Fable 5’i yalnızca uyumluluk açısından hassas iş yükleri için tutun; üretime almadan önce GPT-6 Astra’yı aynı kurguda kontrollü bir testte değerlendirin.
Kıyaslama Performansı İş Yüklerine Göre Nasıl Görünüyor?
| Yetenek | Fable 5.1 sonucu | Fable 5’e göre değişim | Yorum |
|---|---|---|---|
| Ajanik bilimsel araştırma | 52.6% | +27.9 puan | Çok büyük kazanım |
| İş akışı otomasyonu | 31.4% | +14.3 puan | Çok büyük kazanım |
| Terminal kodlama | 55.8% | +13.8 puan | Büyük kazanım |
| Bilgisayar kullanımı, katı | 41.7% | +5.6 puan | Orta düzeyde kazanım |
| Bilgisayar kullanımı, kısmi | 77.9% | +5.0 puan | Orta düzeyde kazanım |
| Uzman akıl yürütme, araçsız | 60.9% | +3.1 puan | Küçük kazanım |
| IDE ajan kodlama | 73.4% | +2.9 puan | Küçük kazanım |
| Uzman akıl yürütme, araçlı | 65.0% | +1.2 puan | Küçük kazanım |
| Profesyonel bilgi işi | 1853 Elo | +130 Elo | Güçlü, yapılandırmaya duyarlı |
Desen tutarlı: en büyük iyileştirmeler, başarı azim, planlama, ortamla etkileşim, araç kullanımı ve zaman içinde toparlanmaya bağlı olduğunda ortaya çıkıyor.
Kıyaslamalar Size Neyi Anlatmaz?
Kıyaslama tabloları, davranışı tek sayılara sıkıştırır. Özerk ajanların çözüldüğünü kanıtlamazlar ve her üretim iş yükünü öngörmezler.
- Ana karşılaştırma tablosu satıcı tarafından yürütülmüştür.
- Efor ayarları kaliteyi, gecikmeyi ve maliyeti etkiler.
- Ajan kıyaslamaları, modeli; kurgu, araçlar ve izinlerle birleşik olarak ölçer.
- Üretim korumaları Fable 5.1 için etkinleştirildi ve bazı sonuçları etkiledi.
- Kıyaslama sürümleri değişir; bu nedenle farklı görev sürümlerinden gelen değerler doğrudan karşılaştırılmayabilir.
- AutomationBench %31.4’te, OSWorld katı tamamlama %41.7’de kalıyor; önemli başarısızlık oranları sürüyor.
Pratik bir değerlendirme, adayları kısa listeye almak için açık puanları kullanmalı, aynı ayarlarla küçük bir karşılaştırmayı yeniden üretmeli ve ardından gerçek üretim iş akışını test etmelidir.
Claude Fable 5.1 en iyi Claude modeli mi?
Zor ve uzun süreli işler için maksimum yetenek açısından, Claude Fable 5.1 için kıyaslama kanıtı güçlü bir gerekçe sunuyor. Her iş yükü için, hayır.
Anthropic, Fable 5.1’i milyon giriş tokenı başına $10 ve milyon çıkış tokenı başına $50 fiyatlandırıyor; Opus 5 için bu rakamlar $5 ve $25. Prim, yalnızca Fable 5.1 daha yüksek başarı oranı, daha az yeniden deneme, kabul edilen görev başına daha az token veya insan inceleme süresinde yeterli azalma sağladığında haklıdır.
Daha düşük önbellek okuma fiyatlandırması, ajanlar için efektif maliyet farkını daraltabilir. Kabul edilen sonuç başına maliyet, yalnızca token başına fiyattan daha kullanışlıdır.
Claude Fable 5.1’i Nasıl Kıyaslamalısınız?
Değerlendirmeniz, amaçlanan üretim iş yüküne benzemelidir.
- Kodlama: Tam konuları test edin ve yama kabulünü, geçen testleri, yeniden denemeleri, araç çağrılarını, geçen süreyi ve insan düzeltme süresini kaydedin.
- Araştırma: Kaynak kalitesini, olgusal doğruluğu, kanıt kapsamını, alt görev tamamlama durumunu ve uzun çalışmalarda hedefin korunmasını değerlendirin.
- İş ajanları: Tek tek doğru eylemleri saymak yerine nihai ortam durumunu puanlayın.
- Bilgisayar kullanımı: Açılır pencerelerden toparlanma, yavaş sayfalar, kesilen oturumlar ve tutarsız uygulama durumunu ölçün.
- Model karşılaştırması: İstemleri, kurguları, araçları, izinleri, efor ayarlarını ve puanlama kurallarını sabit tutun.
- Ekonomi: Yalnızca token başına maliyeti değil, kabul edilen görev başına maliyeti ölçün.
Sonuç
Kıyaslama kanıtı, Fable 5.1’in tek bir yanıt yerine sürdürülebilir yürütme gerektiren görevlerde en değerli olduğunu gösteriyor. En güçlü kullanım alanları, bilimsel araştırma, özerk kodlama, karmaşık iş otomasyonu ve tekrarlanan doğrulama ile toparlanma gerektiren iş akışlarıdır.
Kanıt, evrensel üstünlüğü desteklemiyor. Birkaç kıyaslamadaki küçük farklar, katı bilgisayar kullanımı görevlerinde anlamlı başarısızlık oranları ve GPT-6 Astra’nın Anthropic’in lansman tablosundan yokluğu, iş yüküne özel testlerin gerekliliğini pekiştiriyor.
CometAPI kullanıcıları için pratik bir dağıtım kuralı, uzun ufuklu başarıların primli çıkarımı haklı çıkarabileceği yerlerde Fable 5.1’i test etmek, ardından üretim yolunu seçmeden önce aynı temsili görevlerde Opus 5, GPT-5.6 Sol ve GPT-6 Astra ile karşılaştırmaktır.
SSS
Claude Fable 5.1’in en yüksek kıyaslama skoru nedir?
Anthropic’in raporladığı yüzde metrikleri arasında Fable 5.1, OSWorld 2.0’da kısmi kredide %77.9 ve CursorBench 3.2.0’da %73.4’e ulaşıyor. En büyük nesilsel iyileştirmesi Terminal-Bench-Science’dadır: Fable 5 için %24.7’ye karşı %52.6.
Claude Fable 5.1, Fable 5’ten ne kadar daha iyi?
Kazanım, iş yüküne göre keskin şekilde değişiyor: Terminal-Bench-Science’da 27.9 puan, AutomationBench’te 14.3 ve Terminal-Bench 4.0’da 13.8; ancak CursorBench’te yalnızca 2.9 ve araç destekli Humanity’s Last Exam’de 1.2 puan.
Claude Fable 5.1, Claude Opus 5’ten daha mı iyi?
Anthropic’in raporlanan tablosunda daha yüksek skorlar alıyor, ancak birçok fark küçük. Anthropic, ek uzun ufuklu yetenek gerektiğinde yükseltmeye gitmeden önce Opus 5 ile başlamayı öneriyor.
Claude Fable 5.1, GPT-5.6 Sol’u geçiyor mu?
Anthropic, paylaşılan beş metrikte Fable 5.1 için daha yüksek skorlar rapor ediyor. Bunlar satıcı tarafından yürütülen rakip değerlendirmeleri olduğundan ve konfigürasyonlar değiştiğinden, güvenli sonuç Fable 5.1’in evrensel olarak üstün değil, yüksek derecede rekabetçi olduğudur.
Sonuçlar bağımsız olarak doğrulandı mı?
Kısmen. Birkaç kıyaslamanın herkese açık lider tabloları vardır; ancak değerlerinin Anthropic’in lansman çalıştırmasıyla doğrudan karşılaştırılabilmesi için efor, kurgu, yedek davranış ve görev sürümlerinin hizalanması gerekir.
Claude Fable 5.1 en çok ne için uygundur?
Kıyaslama profili, uzun süreli bilimsel araştırmalar, özerk kodlama, karmaşık ajan iş akışları, iş otomasyonu ve planlama, araçlar, doğrulama ve toparlanma gerektiren görevler için en güçlüdür.
Claude Fable 5.1’e nasıl erişebilirim?
Claude Fable 5.1, CometAPI’de listelenmiştir ve model kimliği claude-fable-5-1’dir. Birleşik uç nokta, üretim rotasını seçmeden önce aynı değerlendirme iş yükünü birkaç modelde çalıştırmayı pratik hale getirir.
