TLDR Claude Fable 5.1 terutama merupakan peningkatan pada eksekusi agentik. Kenaikan terbesar yang dilaporkan muncul dalam riset ilmiah, otomasi bisnis, pengodean terminal, dan alur kerja lain yang memerlukan perencanaan, penggunaan alat, verifikasi, dan pemulihan lintas banyak langkah. Peningkatan lebih kecil terlihat pada penalaran berujung tunggal dan tugas pengodean bergaya IDE yang lebih pendek, sehingga keputusan penerapan terbaik bergantung pada beban kerja alih-alih satu skor utama.
Hal Penting
- Fable 5.1 mencetak 52.6% pada Terminal-Bench-Science 0.1, lebih dari dua kali Fable 5 yang 24.7% dalam evaluasi Anthropic.
- AutomationBench naik dari 17.1% ke 31.4%, menunjukkan peningkatan besar dalam alur kerja bisnis end-to-end.
- Kenaikan lebih moderat pada CursorBench dan Humanity's Last Exam berbantuan alat, menyiratkan bahwa rilis ini lebih meningkatkan eksekusi berkelanjutan daripada setiap bentuk penalaran secara merata.
- Fable 5.1 mempertahankan harga token standar yang sama seperti Fable 5, sementara harga baca cache yang lebih rendah dapat mengurangi biaya efektif untuk alur kerja agen yang berat konteks.
- GPT-6 Astra kini menjadi perbandingan OpenAI yang lebih mutakhir, tetapi tidak termasuk dalam tabel benchmark Anthropic tanggal 1 September. Klaim performa langsung apa pun memerlukan evaluasi dengan harness yang sama dan terkontrol.
Anthropic merilis Claude Fable 5.1 pada 1 September 2026 untuk penalaran yang menuntut, agen berjangka panjang, rekayasa perangkat lunak, riset, dan pekerjaan pengetahuan profesional. Claude Fable 5.1 juga tersedia melalui CometAPI bagi pengembang yang ingin mengevaluasinya bersama model frontier lain melalui endpoint terpadu.
Hasil utama kuat, tetapi distribusi peningkatan lebih informatif daripada rata-rata. Fable 5.1 paling banyak meraih keuntungan ketika agen harus mempertahankan tujuan, berinteraksi dengan alat, pulih dari kesalahan, dan memverifikasi keadaan final. Artikel ini berfokus pada arti hasil benchmark, di mana model masih kurang, dan bagaimana mengevaluasinya terhadap alternatif yang lebih baru.
Sekilas tentang Claude Fable 5.1
Dokumentasi model Anthropic menyebutkan jendela konteks 1 juta token, output maksimum 128K, input teks dan gambar, penalaran adaptif yang selalu aktif, serta batas pengetahuan Juni 2026. ID model API Claude adalah claude-fable-5-1.
| Spesifikasi resmi | Claude Fable 5.1 |
|---|---|
| Penyedia | Anthropic |
| Tanggal rilis | 1 September 2026 |
| ID model | claude-fable-5-1 |
| Jendela konteks | 1,000,000 tokens |
| Output maksimum | 128,000 tokens |
| Input / output | Teks dan gambar → teks |
| Penalaran | Adaptif, selalu aktif |
| Upaya bawaan | Tinggi |
| Batas pengetahuan | Juni 2026 |
| Harga input Anthropic | $10 / MTok |
| Harga output Anthropic | $50 / MTok |
| Baca cache | $0.25 / MTok |
| Latensi relatif | Lebih lambat |
| Posisi utama | Penalaran menuntut dan kerja agen berjangka panjang |
Harga input dan output standar tetap sama seperti Fable 5, sementara baca cache turun menjadi $0.25 per juta token. Fable 5.1 tidak memiliki harga token input/output utama yang lebih rendah. Biaya efektifnya lebih rendah terutama karena penurunan harga baca cache sebesar 75%. Anthropic memperkirakan penurunan biaya sekitar 25% untuk beban kerja tipikal dan hingga sekitar 45% untuk beban kerja yang sangat agentik.
Hal itu penting karena agen yang berjalan lama berulang kali menggunakan konteks repositori, instruksi, definisi alat, dan keadaan sebelumnya. Biaya per tugas yang diselesaikan dapat membaik meskipun harga input dan output utama tidak berubah.
Anthropic juga melaporkan 60.9% untuk Claude Mythos 5.1 pada Terminal-Bench 4.0. Mythos 5.1 adalah versi yang diterapkan terpisah dengan perlindungan berbeda dan tidak boleh dianggap sebagai skor Fable 5.1 yang tersedia secara umum.
Apa yang Ditunjukkan Benchmark Claude Fable 5.1?
Nilai berikut berasal dari evaluasi Anthropic September 2026. Nilai tersebut menggambarkan konfigurasi model-dan-harness, bukan sifat model yang tidak berubah.
| Benchmark | Apa yang diukur | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Riset ilmiah agentik | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Pengodean terminal agentik | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Pekerjaan pengetahuan profesional, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Penggunaan komputer berjangka panjang | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | Tugas komputer yang sepenuhnya terselesaikan | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | Penalaran multidisiplin tingkat ahli | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | Penalaran tingkat ahli dengan alat | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | Alur kerja bisnis end-to-end | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Pengodean IDE bersifat agentik | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 memimpin Fable 5 dan Opus 5 di semua sembilan baris yang dilaporkan. Kenaikan generasi terbesar terjadi dalam riset ilmiah, otomasi alur kerja bisnis, dan pengodean terminal. Perbedaan yang lebih kecil pada Humanity's Last Exam dan CursorBench sama pentingnya karena menunjukkan bahwa peningkatan tidak seragam di setiap beban kerja.
Di Mana Claude Fable 5.1 Paling Banyak Meningkat?
Terminal-Bench-Science 0.1: hasil menonjol
Fable 5.1 mencetak 52.6%, dibandingkan dengan 24.7% untuk Claude Fable 5, 29.0% untuk Claude Opus 5, dan 22.4% untuk GPT-5.6 Sol dalam run Anthropic. Kesenjangan generasional 27.9 poin jauh lebih besar daripada galat baku per model yang dilaporkan, sementara kesenjangan yang lebih kecil—seperti selisih 3.5 poin Fable 5.1 vs Opus 5 pada Terminal-Bench 4.0—sebaiknya ditafsirkan lebih berhati-hati.
Terminal-Bench-Science mengevaluasi alur kerja riset lengkap di seluruh domain sains dan teknik. Agen harus menghasilkan kode, analisis, bukti, simulasi, atau produk data alih-alih hanya menjawab pertanyaan yang terisolasi. Anthropic melaporkan galat baku sekitar ±3.5–4.5 poin per model, jadi kesenjangan kecil tidak boleh otomatis ditafsirkan sebagai perbedaan kapabilitas yang berarti.
Terminal-Bench 4.0: pengodean otonom yang lebih kuat
Fable 5.1 mencapai 55.8%, unggul atas Fable 5 di 42.0%, Opus 5 di 52.3%, dan GPT-5.6 Sol di 37.3%. Peningkatan 13.8 poin dibanding Fable 5 cukup besar, sementara keunggulan 3.5 poin atas Opus 5 relatif sempit.
Benchmark menempatkan agen dalam lingkungan eksekusi, sehingga keberhasilan bergantung pada menavigasi lingkungan, mengubah kode, dan memvalidasi hasil. Karena Terminal-Bench 4.0 menggunakan set tugas berbeda dari rilis sebelumnya, skor sebaiknya hanya dibandingkan dalam versi benchmark yang sama.
AutomationBench: kenaikan besar dengan ruang peningkatan signifikan
AutomationBench naik dari 17.1% pada Fable 5 menjadi 31.4% pada Fable 5.1. Itu adalah kenaikan absolut 14.3 poin, atau sekitar 84% peningkatan relatif.
Benchmark mengevaluasi alur kerja di penjualan, pemasaran, operasi, dukungan, keuangan, dan HR dengan memeriksa keadaan lingkungan final. Ini membuatnya menjadi uji yang berguna apakah agen benar-benar menyelesaikan alur kerja alih-alih hanya mengusulkan tindakan yang benar. Skor juga mengungkapkan keterbatasan yang tersisa: sekitar dua pertiga tugas masih belum selesai di bawah konfigurasi yang dilaporkan Anthropic.
CursorBench 3.2.0: kenaikan pengodean yang lebih kecil
Fable 5.1 mencapai 73.4%, versus 70.5% untuk Fable 5, 70.0% untuk Opus 5, dan 67.2% untuk GPT-5.6 Sol. Kenaikan atas Fable 5 hanya 2.9 poin.
Karena itu rilis ini terlihat kurang transformatif pada tugas pengodean bergaya IDE yang lebih pendek daripada pada alur kerja yang lebih panjang yang melibatkan perencanaan, eksekusi, verifikasi, dan pemulihan. Paket evaluasi sebaiknya mencakup perubahan skala repositori dan pemulihan uji gagal, bukan hanya kualitas generasi kode.
OSWorld 2.0: penggunaan komputer tetap sulit
Fable 5.1 mencetak 77.9% dengan kredit parsial dan 41.7% di bawah penyelesaian ketat. Opus 5 mencapai 75.4% dan 39.6%, sementara Fable 5 mencapai 72.9% dan 36.1%.
Skor ketat adalah sinyal produksi yang lebih mengungkapkan. Kurang dari setengah tugas sepenuhnya selesai, menunjukkan bahwa kemajuan dalam penggunaan komputer tidak menghilangkan kebutuhan akan checkpoint, izin, pemantauan, dan logika pemulihan.
CursorBench dan Humanity's Last Exam: kenaikan lebih kecil
Fable 5.1 mencapai 73.4% pada CursorBench 3.2.0, hanya 2.9 poin di atas Fable 5. Pada Humanity's Last Exam, kenaikannya 3.1 poin tanpa alat dan 1.2 poin dengan alat.
Kesenjangan yang lebih sempit ini mendukung interpretasi utama: Fable 5.1 lebih transformatif pada alur kerja panjang yang melibatkan perencanaan, eksekusi, verifikasi, dan pemulihan daripada pada tugas IDE yang lebih pendek atau penalaran akademik berujung tunggal.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Jawaban singkat: Fable 5.1 adalah opsi terkuat dalam tabel benchmark berjangka panjang yang dipublikasikan Anthropic; Opus 5 adalah titik awal yang lebih ekonomis ketika kesenjangan performanya yang lebih kecil dapat diterima; Fable 5 tetap menjadi baseline legacy; GPT-6 Astra memerlukan uji dengan harness yang sama sebelum peringkat langsung apa pun.
Fable 5.1 merupakan peningkatan generasional yang jelas dibanding Fable 5 pada benchmark agen berjangka panjang yang dilaporkan Anthropic. GPT-6 Astra adalah perbandingan OpenAI yang lebih mutakhir, tetapi dirilis setelah evaluasi Anthropic tanggal 1 September dan tidak termasuk dalam harness benchmark yang sama.
| Dimensi | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Jendela konteks | 1M tokens | 1M tokens | 1.05M tokens |
| Output maksimum | 128K | 128K | 128K |
| Input / output standar | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Baca cache | $0.25 / MTok | $1 / MTok | Verifikasi ketentuan penyedia saat ini |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Tidak disertakan dalam tabel peluncuran Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Tidak disertakan dalam tabel peluncuran Anthropic |
| AutomationBench | 31.4% | 17.1% | Tidak disertakan dalam tabel peluncuran Anthropic |
| Posisi utama | Penalaran menuntut dan agen berjangka panjang | Baseline kelas Fable sebelumnya | Pekerjaan profesional end-to-end yang sulit |
Dibanding Fable 5, Fable 5.1 menunjukkan kenaikan terukur terbesar dalam riset ilmiah, otomasi bisnis, dan pengodean terminal sambil mempertahankan harga token standar yang sama. Harga baca cache yang lebih rendah semakin memperbaiki ekonomi agen yang berulang menggunakan konteks.
Aturan pemilihan: Mulai dengan Opus 5 ketika biaya menjadi prioritas, naik ke Fable 5.1 ketika penyelesaian dan pemulihan berjangka panjang paling penting, pertahankan Fable 5 hanya untuk beban kerja yang sensitif kompatibilitas, dan evaluasi GPT-6 Astra dalam uji harness yang sama dan terkontrol sebelum adopsi produksi.
Seperti Apa Kinerja Benchmark per Beban Kerja?
| Kapabilitas | Hasil Fable 5.1 | Perubahan vs Fable 5 | Interpretasi |
|---|---|---|---|
| Riset ilmiah agentik | 52.6% | +27.9 poin | Kenaikan sangat besar |
| Otomatisasi alur kerja bisnis | 31.4% | +14.3 poin | Kenaikan sangat besar |
| Pengodean terminal | 55.8% | +13.8 poin | Kenaikan besar |
| Penggunaan komputer, ketat | 41.7% | +5.6 poin | Kenaikan moderat |
| Penggunaan komputer, parsial | 77.9% | +5.0 poin | Kenaikan moderat |
| Penalaran tingkat ahli, tanpa alat | 60.9% | +3.1 poin | Kenaikan kecil |
| Pengodean IDE bersifat agentik | 73.4% | +2.9 poin | Kenaikan kecil |
| Penalaran tingkat ahli, dengan alat | 65.0% | +1.2 poin | Kenaikan kecil |
| Pekerjaan pengetahuan profesional | 1853 Elo | +130 Elo | Kuat, sensitif terhadap konfigurasi |
Polanya konsisten: peningkatan terbesar muncul ketika keberhasilan bergantung pada persistensi, perencanaan, interaksi lingkungan, penggunaan alat, dan pemulihan dari waktu ke waktu.
Apa yang Tidak Diberitahukan Benchmark?
Tabel benchmark memampatkan perilaku ke angka tunggal. Tabel tersebut tidak membuktikan bahwa agen otonom telah terselesaikan, dan tidak memprediksi setiap beban kerja produksi.
- Tabel perbandingan utama dijalankan oleh vendor.
- Pengaturan upaya memengaruhi kualitas, latensi, dan biaya.
- Benchmark agen mengukur gabungan model, harness, alat, dan izin.
- Perlindungan produksi diaktifkan untuk Fable 5.1 dan memengaruhi beberapa hasil.
- Versi benchmark berubah, sehingga nilai dari rilis tugas yang berbeda mungkin tidak dapat dibandingkan.
- AutomationBench tetap di 31.4%, sementara penyelesaian ketat OSWorld tetap di 41.7%; tingkat kegagalan substansial masih ada.
Evaluasi praktis sebaiknya menggunakan skor publik untuk menyaring kandidat, mereproduksi perbandingan kecil dengan pengaturan identik, lalu menguji alur kerja produksi yang sebenarnya.
Apakah Claude Fable 5.1 adalah model Claude terbaik?
Untuk kapabilitas maksimum pada pekerjaan panjang yang sulit, bukti benchmark membuat kasus kuat untuk Claude Fable 5.1. Untuk setiap beban kerja, tidak.
Anthropic menawarkannya dengan harga $10 per juta token input dan $50 per juta token output, versus $5 dan $25 untuk Opus 5. Premi hanya dibenarkan ketika Fable 5.1 menghasilkan tingkat keberhasilan lebih tinggi, lebih sedikit percobaan ulang, lebih sedikit token per tugas yang diterima, atau cukup mengurangi waktu tinjauan manusia.
Harga baca cache yang lebih rendah dapat mempersempit kesenjangan biaya efektif untuk agen. Biaya per hasil yang diterima karenanya lebih berguna daripada harga per token saja.
Bagaimana Anda Sebaiknya Membenchmark Claude Fable 5.1?
Evaluasi Anda sebaiknya menyerupai beban kerja produksi yang dituju.
- Pengodean: Uji isu lengkap dan catat penerimaan patch, uji yang lolos, percobaan ulang, panggilan alat, waktu berlalu, dan waktu koreksi manusia.
- Riset: Evaluasi kualitas sumber, akurasi faktual, cakupan bukti, penyelesaian sub-tugas, dan retensi tujuan dalam run panjang.
- Agen bisnis: Nilai keadaan lingkungan final alih-alih menghitung tindakan yang benar secara individual.
- Penggunaan komputer: Ukur pemulihan dari pop-up, halaman lambat, sesi terputus, dan keadaan aplikasi yang tidak konsisten.
- Perbandingan model: Pertahankan prompt, harness, alat, izin, pengaturan upaya, dan aturan penilaian tetap konstan.
- Ekonomi: Ukur biaya per tugas yang diterima, bukan hanya biaya per token.
Kesimpulan
Bukti benchmark menyiratkan bahwa Fable 5.1 paling berharga ketika tugas memerlukan eksekusi berkelanjutan alih-alih satu respons tunggal. Penggunaan terkuat mencakup riset ilmiah, pengodean otonom, otomasi bisnis yang kompleks, dan alur kerja dengan verifikasi dan pemulihan berulang.
Bukti tersebut tidak mendukung superioritas universal. Kesenjangan yang lebih kecil pada beberapa benchmark, tingkat kegagalan yang bermakna pada tugas penggunaan komputer yang ketat, dan tidak adanya GPT-6 Astra dari tabel peluncuran Anthropic semuanya menegaskan perlunya pengujian spesifik beban kerja.
Bagi pengguna CometAPI, aturan penerapan praktis adalah menguji Fable 5.1 di tempat keberhasilan berjangka panjang dapat membenarkan inferensi premium, lalu membandingkannya dengan Opus 5, GPT-5.6 Sol, dan GPT-6 Astra pada tugas representatif yang sama sebelum memilih jalur produksi.
FAQ
Berapa skor benchmark tertinggi Claude Fable 5.1?
Di antara metrik persentase yang dilaporkan Anthropic, Fable 5.1 mencapai 77.9% kredit parsial pada OSWorld 2.0 dan 73.4% pada CursorBench 3.2.0. Peningkatan generasional terbesarnya adalah Terminal-Bench-Science, di 52.6% versus 24.7% untuk Fable 5.
Seberapa lebih baik Claude Fable 5.1 dibanding Fable 5?
Kenaikannya bervariasi tajam menurut beban kerja: 27.9 poin pada Terminal-Bench-Science, 14.3 pada AutomationBench, dan 13.8 pada Terminal-Bench 4.0, tetapi hanya 2.9 pada CursorBench dan 1.2 pada Humanity’s Last Exam berbantuan alat.
Apakah Claude Fable 5.1 lebih baik daripada Claude Opus 5?
Skornya lebih tinggi di seluruh tabel yang dilaporkan Anthropic, tetapi banyak kesenjangannya kecil. Anthropic merekomendasikan mulai dengan Opus 5 dan naik ketika kapabilitas berjangka panjang tambahan diperlukan.
Apakah Claude Fable 5.1 mengungguli GPT-5.6 Sol?
Anthropic melaporkan skor Fable 5.1 lebih tinggi pada lima metrik bersama. Karena ini adalah evaluasi pesaing yang dijalankan vendor dan konfigurasi bervariasi, kesimpulan aman adalah bahwa Fable 5.1 sangat kompetitif alih-alih superior secara universal.
Apakah hasilnya diverifikasi secara independen?
Sebagian saja. Beberapa benchmark memiliki leaderboard publik, tetapi upaya, harness, perilaku fallback, dan versi tugas harus disejajarkan sebelum nilainya dapat dibandingkan langsung dengan run peluncuran Anthropic.
Untuk apa Claude Fable 5.1 paling cocok?
Profil benchmark-nya paling kuat untuk riset ilmiah jangka panjang, pengodean otonom, alur kerja agen yang kompleks, otomasi bisnis, dan tugas yang memerlukan perencanaan, alat, verifikasi, dan pemulihan.
Bagaimana cara mengakses Claude Fable 5.1?
Claude Fable 5.1 terdaftar di CometAPI dengan ID model claude-fable-5-1. Endpoint terpadu membuatnya praktis untuk menjalankan beban kerja evaluasi yang sama di beberapa model sebelum memilih jalur produksi.
