GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Riset CometAPI

Claude Fable 5.1 Tolok Ukur: Apa yang dikatakan skor kepada saya

Jelajahi tolok ukur Claude Fable 5.1, capaian utama, keterbatasan, dan perbandingan dengan Fable 5, Opus 5, GPT-5.6 Sol, dan GPT-6 Astra.

CometAPI
Mia MarenTim riset model AI dan API
Diperbarui Sep 17, 2026 12 menit baca
Claude Fable 5.1 Tolok Ukur: Apa yang dikatakan skor kepada saya
Gunakan pola ini

Lakukan API call pertama.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 terutama merupakan peningkatan pada eksekusi agentik. Kenaikan terbesar yang dilaporkan muncul dalam riset ilmiah, otomasi bisnis, pengodean terminal, dan alur kerja lain yang memerlukan perencanaan, penggunaan alat, verifikasi, dan pemulihan lintas banyak langkah. Peningkatan lebih kecil terlihat pada penalaran berujung tunggal dan tugas pengodean bergaya IDE yang lebih pendek, sehingga keputusan penerapan terbaik bergantung pada beban kerja alih-alih satu skor utama.

Hal Penting

  • Fable 5.1 mencetak 52.6% pada Terminal-Bench-Science 0.1, lebih dari dua kali Fable 5 yang 24.7% dalam evaluasi Anthropic.
  • AutomationBench naik dari 17.1% ke 31.4%, menunjukkan peningkatan besar dalam alur kerja bisnis end-to-end.
  • Kenaikan lebih moderat pada CursorBench dan Humanity's Last Exam berbantuan alat, menyiratkan bahwa rilis ini lebih meningkatkan eksekusi berkelanjutan daripada setiap bentuk penalaran secara merata.
  • Fable 5.1 mempertahankan harga token standar yang sama seperti Fable 5, sementara harga baca cache yang lebih rendah dapat mengurangi biaya efektif untuk alur kerja agen yang berat konteks.
  • GPT-6 Astra kini menjadi perbandingan OpenAI yang lebih mutakhir, tetapi tidak termasuk dalam tabel benchmark Anthropic tanggal 1 September. Klaim performa langsung apa pun memerlukan evaluasi dengan harness yang sama dan terkontrol.

Anthropic merilis Claude Fable 5.1 pada 1 September 2026 untuk penalaran yang menuntut, agen berjangka panjang, rekayasa perangkat lunak, riset, dan pekerjaan pengetahuan profesional. Claude Fable 5.1 juga tersedia melalui CometAPI bagi pengembang yang ingin mengevaluasinya bersama model frontier lain melalui endpoint terpadu.

Hasil utama kuat, tetapi distribusi peningkatan lebih informatif daripada rata-rata. Fable 5.1 paling banyak meraih keuntungan ketika agen harus mempertahankan tujuan, berinteraksi dengan alat, pulih dari kesalahan, dan memverifikasi keadaan final. Artikel ini berfokus pada arti hasil benchmark, di mana model masih kurang, dan bagaimana mengevaluasinya terhadap alternatif yang lebih baru.

Sekilas tentang Claude Fable 5.1

Dokumentasi model Anthropic menyebutkan jendela konteks 1 juta token, output maksimum 128K, input teks dan gambar, penalaran adaptif yang selalu aktif, serta batas pengetahuan Juni 2026. ID model API Claude adalah claude-fable-5-1.

Spesifikasi resmiClaude Fable 5.1
PenyediaAnthropic
Tanggal rilis1 September 2026
ID modelclaude-fable-5-1
Jendela konteks1,000,000 tokens
Output maksimum128,000 tokens
Input / outputTeks dan gambar → teks
PenalaranAdaptif, selalu aktif
Upaya bawaanTinggi
Batas pengetahuanJuni 2026
Harga input Anthropic$10 / MTok
Harga output Anthropic$50 / MTok
Baca cache$0.25 / MTok
Latensi relatifLebih lambat
Posisi utamaPenalaran menuntut dan kerja agen berjangka panjang

Harga input dan output standar tetap sama seperti Fable 5, sementara baca cache turun menjadi $0.25 per juta token. Fable 5.1 tidak memiliki harga token input/output utama yang lebih rendah. Biaya efektifnya lebih rendah terutama karena penurunan harga baca cache sebesar 75%. Anthropic memperkirakan penurunan biaya sekitar 25% untuk beban kerja tipikal dan hingga sekitar 45% untuk beban kerja yang sangat agentik.

Hal itu penting karena agen yang berjalan lama berulang kali menggunakan konteks repositori, instruksi, definisi alat, dan keadaan sebelumnya. Biaya per tugas yang diselesaikan dapat membaik meskipun harga input dan output utama tidak berubah.

Anthropic juga melaporkan 60.9% untuk Claude Mythos 5.1 pada Terminal-Bench 4.0. Mythos 5.1 adalah versi yang diterapkan terpisah dengan perlindungan berbeda dan tidak boleh dianggap sebagai skor Fable 5.1 yang tersedia secara umum.

Apa yang Ditunjukkan Benchmark Claude Fable 5.1?

Nilai berikut berasal dari evaluasi Anthropic September 2026. Nilai tersebut menggambarkan konfigurasi model-dan-harness, bukan sifat model yang tidak berubah.

BenchmarkApa yang diukurFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Riset ilmiah agentik52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Pengodean terminal agentik55.8%42.0%52.3%37.3%
GDPval-AA v2Pekerjaan pengetahuan profesional, Elo1853172318241711
OSWorld 2.0, partialPenggunaan komputer berjangka panjang77.9%72.9%75.4%
OSWorld 2.0, strictTugas komputer yang sepenuhnya terselesaikan41.7%36.1%39.6%
Humanity’s Last Exam, no toolsPenalaran multidisiplin tingkat ahli60.9%57.8%56.6%
Humanity’s Last Exam, with toolsPenalaran tingkat ahli dengan alat65.0%63.8%63.6%
AutomationBenchAlur kerja bisnis end-to-end31.4%17.1%26.9%19.6%
CursorBench 3.2.0Pengodean IDE bersifat agentik73.4%70.5%70.0%67.2%

Fable 5.1 memimpin Fable 5 dan Opus 5 di semua sembilan baris yang dilaporkan. Kenaikan generasi terbesar terjadi dalam riset ilmiah, otomasi alur kerja bisnis, dan pengodean terminal. Perbedaan yang lebih kecil pada Humanity's Last Exam dan CursorBench sama pentingnya karena menunjukkan bahwa peningkatan tidak seragam di setiap beban kerja.

Di Mana Claude Fable 5.1 Paling Banyak Meningkat?

Terminal-Bench-Science 0.1: hasil menonjol

Fable 5.1 mencetak 52.6%, dibandingkan dengan 24.7% untuk Claude Fable 5, 29.0% untuk Claude Opus 5, dan 22.4% untuk GPT-5.6 Sol dalam run Anthropic. Kesenjangan generasional 27.9 poin jauh lebih besar daripada galat baku per model yang dilaporkan, sementara kesenjangan yang lebih kecil—seperti selisih 3.5 poin Fable 5.1 vs Opus 5 pada Terminal-Bench 4.0—sebaiknya ditafsirkan lebih berhati-hati.

Terminal-Bench-Science mengevaluasi alur kerja riset lengkap di seluruh domain sains dan teknik. Agen harus menghasilkan kode, analisis, bukti, simulasi, atau produk data alih-alih hanya menjawab pertanyaan yang terisolasi. Anthropic melaporkan galat baku sekitar ±3.5–4.5 poin per model, jadi kesenjangan kecil tidak boleh otomatis ditafsirkan sebagai perbedaan kapabilitas yang berarti.

Terminal-Bench 4.0: pengodean otonom yang lebih kuat

Fable 5.1 mencapai 55.8%, unggul atas Fable 5 di 42.0%, Opus 5 di 52.3%, dan GPT-5.6 Sol di 37.3%. Peningkatan 13.8 poin dibanding Fable 5 cukup besar, sementara keunggulan 3.5 poin atas Opus 5 relatif sempit.

Benchmark menempatkan agen dalam lingkungan eksekusi, sehingga keberhasilan bergantung pada menavigasi lingkungan, mengubah kode, dan memvalidasi hasil. Karena Terminal-Bench 4.0 menggunakan set tugas berbeda dari rilis sebelumnya, skor sebaiknya hanya dibandingkan dalam versi benchmark yang sama.

AutomationBench: kenaikan besar dengan ruang peningkatan signifikan

AutomationBench naik dari 17.1% pada Fable 5 menjadi 31.4% pada Fable 5.1. Itu adalah kenaikan absolut 14.3 poin, atau sekitar 84% peningkatan relatif.

Benchmark mengevaluasi alur kerja di penjualan, pemasaran, operasi, dukungan, keuangan, dan HR dengan memeriksa keadaan lingkungan final. Ini membuatnya menjadi uji yang berguna apakah agen benar-benar menyelesaikan alur kerja alih-alih hanya mengusulkan tindakan yang benar. Skor juga mengungkapkan keterbatasan yang tersisa: sekitar dua pertiga tugas masih belum selesai di bawah konfigurasi yang dilaporkan Anthropic.

CursorBench 3.2.0: kenaikan pengodean yang lebih kecil

Fable 5.1 mencapai 73.4%, versus 70.5% untuk Fable 5, 70.0% untuk Opus 5, dan 67.2% untuk GPT-5.6 Sol. Kenaikan atas Fable 5 hanya 2.9 poin.

Karena itu rilis ini terlihat kurang transformatif pada tugas pengodean bergaya IDE yang lebih pendek daripada pada alur kerja yang lebih panjang yang melibatkan perencanaan, eksekusi, verifikasi, dan pemulihan. Paket evaluasi sebaiknya mencakup perubahan skala repositori dan pemulihan uji gagal, bukan hanya kualitas generasi kode.

OSWorld 2.0: penggunaan komputer tetap sulit

Fable 5.1 mencetak 77.9% dengan kredit parsial dan 41.7% di bawah penyelesaian ketat. Opus 5 mencapai 75.4% dan 39.6%, sementara Fable 5 mencapai 72.9% dan 36.1%.

Skor ketat adalah sinyal produksi yang lebih mengungkapkan. Kurang dari setengah tugas sepenuhnya selesai, menunjukkan bahwa kemajuan dalam penggunaan komputer tidak menghilangkan kebutuhan akan checkpoint, izin, pemantauan, dan logika pemulihan.

CursorBench dan Humanity's Last Exam: kenaikan lebih kecil

Fable 5.1 mencapai 73.4% pada CursorBench 3.2.0, hanya 2.9 poin di atas Fable 5. Pada Humanity's Last Exam, kenaikannya 3.1 poin tanpa alat dan 1.2 poin dengan alat.

Kesenjangan yang lebih sempit ini mendukung interpretasi utama: Fable 5.1 lebih transformatif pada alur kerja panjang yang melibatkan perencanaan, eksekusi, verifikasi, dan pemulihan daripada pada tugas IDE yang lebih pendek atau penalaran akademik berujung tunggal.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Jawaban singkat: Fable 5.1 adalah opsi terkuat dalam tabel benchmark berjangka panjang yang dipublikasikan Anthropic; Opus 5 adalah titik awal yang lebih ekonomis ketika kesenjangan performanya yang lebih kecil dapat diterima; Fable 5 tetap menjadi baseline legacy; GPT-6 Astra memerlukan uji dengan harness yang sama sebelum peringkat langsung apa pun.

Fable 5.1 merupakan peningkatan generasional yang jelas dibanding Fable 5 pada benchmark agen berjangka panjang yang dilaporkan Anthropic. GPT-6 Astra adalah perbandingan OpenAI yang lebih mutakhir, tetapi dirilis setelah evaluasi Anthropic tanggal 1 September dan tidak termasuk dalam harness benchmark yang sama.

DimensiClaude Fable 5.1Claude Fable 5GPT-6 Astra
Jendela konteks1M tokens1M tokens1.05M tokens
Output maksimum128K128K128K
Input / output standar$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Baca cache$0.25 / MTok$1 / MTokVerifikasi ketentuan penyedia saat ini
Terminal-Bench-Science 0.152.6%24.7%Tidak disertakan dalam tabel peluncuran Anthropic
Terminal-Bench 4.055.8%42.0%Tidak disertakan dalam tabel peluncuran Anthropic
AutomationBench31.4%17.1%Tidak disertakan dalam tabel peluncuran Anthropic
Posisi utamaPenalaran menuntut dan agen berjangka panjangBaseline kelas Fable sebelumnyaPekerjaan profesional end-to-end yang sulit

Dibanding Fable 5, Fable 5.1 menunjukkan kenaikan terukur terbesar dalam riset ilmiah, otomasi bisnis, dan pengodean terminal sambil mempertahankan harga token standar yang sama. Harga baca cache yang lebih rendah semakin memperbaiki ekonomi agen yang berulang menggunakan konteks.

Aturan pemilihan: Mulai dengan Opus 5 ketika biaya menjadi prioritas, naik ke Fable 5.1 ketika penyelesaian dan pemulihan berjangka panjang paling penting, pertahankan Fable 5 hanya untuk beban kerja yang sensitif kompatibilitas, dan evaluasi GPT-6 Astra dalam uji harness yang sama dan terkontrol sebelum adopsi produksi.

Seperti Apa Kinerja Benchmark per Beban Kerja?

KapabilitasHasil Fable 5.1Perubahan vs Fable 5Interpretasi
Riset ilmiah agentik52.6%+27.9 poinKenaikan sangat besar
Otomatisasi alur kerja bisnis31.4%+14.3 poinKenaikan sangat besar
Pengodean terminal55.8%+13.8 poinKenaikan besar
Penggunaan komputer, ketat41.7%+5.6 poinKenaikan moderat
Penggunaan komputer, parsial77.9%+5.0 poinKenaikan moderat
Penalaran tingkat ahli, tanpa alat60.9%+3.1 poinKenaikan kecil
Pengodean IDE bersifat agentik73.4%+2.9 poinKenaikan kecil
Penalaran tingkat ahli, dengan alat65.0%+1.2 poinKenaikan kecil
Pekerjaan pengetahuan profesional1853 Elo+130 EloKuat, sensitif terhadap konfigurasi

Polanya konsisten: peningkatan terbesar muncul ketika keberhasilan bergantung pada persistensi, perencanaan, interaksi lingkungan, penggunaan alat, dan pemulihan dari waktu ke waktu.

Apa yang Tidak Diberitahukan Benchmark?

Tabel benchmark memampatkan perilaku ke angka tunggal. Tabel tersebut tidak membuktikan bahwa agen otonom telah terselesaikan, dan tidak memprediksi setiap beban kerja produksi.

  • Tabel perbandingan utama dijalankan oleh vendor.
  • Pengaturan upaya memengaruhi kualitas, latensi, dan biaya.
  • Benchmark agen mengukur gabungan model, harness, alat, dan izin.
  • Perlindungan produksi diaktifkan untuk Fable 5.1 dan memengaruhi beberapa hasil.
  • Versi benchmark berubah, sehingga nilai dari rilis tugas yang berbeda mungkin tidak dapat dibandingkan.
  • AutomationBench tetap di 31.4%, sementara penyelesaian ketat OSWorld tetap di 41.7%; tingkat kegagalan substansial masih ada.

Evaluasi praktis sebaiknya menggunakan skor publik untuk menyaring kandidat, mereproduksi perbandingan kecil dengan pengaturan identik, lalu menguji alur kerja produksi yang sebenarnya.

Apakah Claude Fable 5.1 adalah model Claude terbaik?

Untuk kapabilitas maksimum pada pekerjaan panjang yang sulit, bukti benchmark membuat kasus kuat untuk Claude Fable 5.1. Untuk setiap beban kerja, tidak.

Anthropic menawarkannya dengan harga $10 per juta token input dan $50 per juta token output, versus $5 dan $25 untuk Opus 5. Premi hanya dibenarkan ketika Fable 5.1 menghasilkan tingkat keberhasilan lebih tinggi, lebih sedikit percobaan ulang, lebih sedikit token per tugas yang diterima, atau cukup mengurangi waktu tinjauan manusia.

Harga baca cache yang lebih rendah dapat mempersempit kesenjangan biaya efektif untuk agen. Biaya per hasil yang diterima karenanya lebih berguna daripada harga per token saja.

Bagaimana Anda Sebaiknya Membenchmark Claude Fable 5.1?

Evaluasi Anda sebaiknya menyerupai beban kerja produksi yang dituju.

  • Pengodean: Uji isu lengkap dan catat penerimaan patch, uji yang lolos, percobaan ulang, panggilan alat, waktu berlalu, dan waktu koreksi manusia.
  • Riset: Evaluasi kualitas sumber, akurasi faktual, cakupan bukti, penyelesaian sub-tugas, dan retensi tujuan dalam run panjang.
  • Agen bisnis: Nilai keadaan lingkungan final alih-alih menghitung tindakan yang benar secara individual.
  • Penggunaan komputer: Ukur pemulihan dari pop-up, halaman lambat, sesi terputus, dan keadaan aplikasi yang tidak konsisten.
  • Perbandingan model: Pertahankan prompt, harness, alat, izin, pengaturan upaya, dan aturan penilaian tetap konstan.
  • Ekonomi: Ukur biaya per tugas yang diterima, bukan hanya biaya per token.

Kesimpulan

Bukti benchmark menyiratkan bahwa Fable 5.1 paling berharga ketika tugas memerlukan eksekusi berkelanjutan alih-alih satu respons tunggal. Penggunaan terkuat mencakup riset ilmiah, pengodean otonom, otomasi bisnis yang kompleks, dan alur kerja dengan verifikasi dan pemulihan berulang.

Bukti tersebut tidak mendukung superioritas universal. Kesenjangan yang lebih kecil pada beberapa benchmark, tingkat kegagalan yang bermakna pada tugas penggunaan komputer yang ketat, dan tidak adanya GPT-6 Astra dari tabel peluncuran Anthropic semuanya menegaskan perlunya pengujian spesifik beban kerja.

Bagi pengguna CometAPI, aturan penerapan praktis adalah menguji Fable 5.1 di tempat keberhasilan berjangka panjang dapat membenarkan inferensi premium, lalu membandingkannya dengan Opus 5, GPT-5.6 Sol, dan GPT-6 Astra pada tugas representatif yang sama sebelum memilih jalur produksi.

FAQ

Berapa skor benchmark tertinggi Claude Fable 5.1?

Di antara metrik persentase yang dilaporkan Anthropic, Fable 5.1 mencapai 77.9% kredit parsial pada OSWorld 2.0 dan 73.4% pada CursorBench 3.2.0. Peningkatan generasional terbesarnya adalah Terminal-Bench-Science, di 52.6% versus 24.7% untuk Fable 5.

Seberapa lebih baik Claude Fable 5.1 dibanding Fable 5?

Kenaikannya bervariasi tajam menurut beban kerja: 27.9 poin pada Terminal-Bench-Science, 14.3 pada AutomationBench, dan 13.8 pada Terminal-Bench 4.0, tetapi hanya 2.9 pada CursorBench dan 1.2 pada Humanity’s Last Exam berbantuan alat.

Apakah Claude Fable 5.1 lebih baik daripada Claude Opus 5?

Skornya lebih tinggi di seluruh tabel yang dilaporkan Anthropic, tetapi banyak kesenjangannya kecil. Anthropic merekomendasikan mulai dengan Opus 5 dan naik ketika kapabilitas berjangka panjang tambahan diperlukan.

Apakah Claude Fable 5.1 mengungguli GPT-5.6 Sol?

Anthropic melaporkan skor Fable 5.1 lebih tinggi pada lima metrik bersama. Karena ini adalah evaluasi pesaing yang dijalankan vendor dan konfigurasi bervariasi, kesimpulan aman adalah bahwa Fable 5.1 sangat kompetitif alih-alih superior secara universal.

Apakah hasilnya diverifikasi secara independen?

Sebagian saja. Beberapa benchmark memiliki leaderboard publik, tetapi upaya, harness, perilaku fallback, dan versi tugas harus disejajarkan sebelum nilainya dapat dibandingkan langsung dengan run peluncuran Anthropic.

Untuk apa Claude Fable 5.1 paling cocok?

Profil benchmark-nya paling kuat untuk riset ilmiah jangka panjang, pengodean otonom, alur kerja agen yang kompleks, otomasi bisnis, dan tugas yang memerlukan perencanaan, alat, verifikasi, dan pemulihan.

Bagaimana cara mengakses Claude Fable 5.1?

Claude Fable 5.1 terdaftar di CometAPI dengan ID model claude-fable-5-1. Endpoint terpadu membuatnya praktis untuk menjalankan beban kerja evaluasi yang sama di beberapa model sebelum memilih jalur produksi.

Lanjut belajar

Hubungkan artikel ini ke keputusan berikutnya.

Lihat semua topik
Dipublikasikan pada Sep 17, 2026
Terakhir diperbarui Sep 17, 2026
0 tampilan
Ditinjau untuk kejelasan, atribusi sumber, dan terminologi API terkini.

Siap memangkas biaya pengembangan AI hingga 20%?

Mulai gratis dalam beberapa menit. Kredit uji coba gratis disertakan. Tidak perlu kartu kredit.

Baca Selengkapnya