TLDR Claude Fable 5.1 terutamanya merupakan penaiktarafan keupayaan pelaksanaan berasaskan agen. Kenaikan terbesar yang dilaporkan muncul dalam penyelidikan saintifik, automasi perniagaan, pengekodan terminal dan aliran kerja lain yang memerlukan perancangan, penggunaan alat, pengesahan dan pemulihan merentasi banyak langkah. Peningkatan adalah lebih kecil pada penaakulan soalan tertutup dan tugas pengekodan gaya IDE yang pendek, jadi keputusan penggunaan terbaik bergantung pada beban kerja dan bukannya satu skor tajuk utama.
Intipati Utama
- Fable 5.1 memperoleh 52.6% pada Terminal-Bench-Science 0.1, lebih daripada dua kali ganda 24.7% Fable 5 dalam penilaian Anthropic.
- AutomationBench meningkat daripada 17.1% kepada 31.4%, menunjukkan peningkatan besar dalam aliran kerja perniagaan hujung-ke-hujung.
- Peningkatan adalah lebih sederhana pada CursorBench dan Humanity's Last Exam dengan alat, menunjukkan bahawa keluaran ini lebih banyak menambah baik pelaksanaan berterusan berbanding semua bentuk penaakulan secara sama rata.
- Fable 5.1 mengekalkan harga token standard yang sama seperti Fable 5, manakala harga bacaan cache yang lebih rendah boleh mengurangkan kos efektif aliran kerja agen yang berat konteks.
- GPT-6 Astra kini perbandingan OpenAI yang lebih terkini, tetapi ia tidak disertakan dalam jadual penanda aras 1 September Anthropic. Sebarang tuntutan prestasi langsung memerlukan penilaian dengan rangka kerja yang sama dan terkawal.
Anthropic melancarkan Claude Fable 5.1 pada 1 September 2026 untuk penaakulan yang menuntut, agen jangka panjang, kejuruteraan perisian, penyelidikan dan kerja pengetahuan profesional. Claude Fable 5.1 turut tersedia melalui CometAPI untuk pembangun yang mahu menilainya bersama model termaju lain melalui titik akhir bersatu.
Keputusan tajuk utama adalah kukuh, tetapi taburan peningkatan lebih bermakna berbanding purata. Fable 5.1 memperoleh paling banyak apabila seorang agen perlu mengekalkan matlamat, berinteraksi dengan alat, pulih daripada ralat, dan mengesahkan keadaan akhir. Artikel ini menumpukan pada maksud keputusan penanda aras, di mana model masih kurang, dan cara menilainya berbanding alternatif yang lebih baharu.
Claude Fable 5.1 Sekilas Pandang
Dokumentasi model Anthropic menyatakan tetingkap konteks 1 juta token, output maksimum 128K, input teks dan imej, pemikiran adaptif sentiasa aktif dan had pengetahuan Jun 2026. ID model API Claude ialah claude-fable-5-1.
| Spesifikasi rasmi | Claude Fable 5.1 |
|---|---|
| Penyedia | Anthropic |
| Tarikh keluaran | 1 September 2026 |
| ID model | claude-fable-5-1 |
| Tetingkap konteks | 1,000,000 token |
| Output maksimum | 128,000 token |
| Input / output | Teks dan imej → teks |
| Pemikiran | Adaptif, sentiasa diaktifkan |
| Usaha lalai | Tinggi |
| Had pengetahuan | Jun 2026 |
| Harga input Anthropic | $10 / MTok |
| Harga output Anthropic | $50 / MTok |
| Bacaan cache | $0.25 / MTok |
| Latensi perbandingan | Lebih perlahan |
| Pemposisian utama | Penaakulan mencabar dan kerja agen jangka panjang |
Harga input dan output standard kekal sama seperti Fable 5, manakala bacaan cache turun kepada $0.25 per juta token. Fable 5.1 tidak mempunyai harga token input/output tajuk utama yang lebih rendah. Kos efektifnya yang lebih rendah datang terutamanya daripada pengurangan 75% pada harga bacaan cache. Anthropic menganggarkan sekitar 25% kos lebih rendah untuk beban kerja tipikal dan sehingga kira-kira 45% untuk beban kerja agen yang sangat intensif.
Itu penting kerana agen berjalan lama berulang kali menggunakan semula konteks repositori, arahan, takrif alat dan keadaan terdahulu. Kos per tugas siap boleh bertambah baik walaupun harga input dan output tajuk utama tidak berubah.
Anthropic juga melaporkan 60.9% untuk Claude Mythos 5.1 pada Terminal-Bench 4.0. Mythos 5.1 ialah versi yang dideploy berasingan dengan perlindungan berbeza dan tidak harus dianggap sebagai skor Fable 5.1 yang tersedia umum.
Apakah Yang Ditunjukkan oleh Penanda Aras Claude Fable 5.1?
Nilai berikut datang daripada penilaian Anthropic September 2026. Ia menggambarkan konfigurasi model-dan-rangka kerja, bukan sifat model yang tidak berubah.
| Penanda aras | Apa yang diukur | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Penyelidikan saintifik berasaskan agen | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Pengekodan terminal berasaskan agen | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Kerja pengetahuan profesional, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, separa | Penggunaan komputer jangka panjang | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, ketat | Tugas komputer siap sepenuhnya | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, tanpa alat | Penaakulan pelbagai disiplin bertaraf pakar | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, dengan alat | Penaakulan pakar dengan alat | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | Aliran kerja perniagaan hujung-ke-hujung | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Pengekodan IDE berasaskan agen | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 mendahului Fable 5 dan Opus 5 merentasi kesemua sembilan baris yang dilaporkan. Kenaikan generasi terbesarnya berlaku dalam penyelidikan saintifik, automasi aliran kerja perniagaan dan pengekodan terminal. Perbezaan yang lebih kecil pada Humanity's Last Exam dan CursorBench adalah sama penting kerana ia menunjukkan peningkatan tidak seragam merentasi setiap beban kerja.
Di Mana Claude Fable 5.1 Paling Banyak Bertambah Baik?
Terminal-Bench-Science 0.1: hasil yang menonjol
Fable 5.1 mencatat 52.6%, berbanding 24.7% untuk Claude Fable 5, 29.0% untuk Claude Opus 5, dan 22.4% untuk GPT-5.6 Sol dalam larian Anthropic. Jurang generasi 27.9 mata ini jauh lebih besar daripada ralat piawai per model yang dilaporkan, manakala jurang yang lebih kecil—seperti perbezaan 3.5 mata Fable 5.1 vs Opus 5 pada Terminal-Bench 4.0—perlu ditafsir dengan lebih berhati-hati.
Terminal-Bench-Science menilai aliran kerja penyelidikan lengkap merentasi domain sains dan kejuruteraan. Agen perlu menghasilkan kod, analisis, bukti, simulasi atau produk data dan bukan sekadar menjawab soalan terasing. Anthropic melaporkan ralat piawai sekitar ±3.5–4.5 mata per model, jadi jurang kecil tidak semestinya ditafsir sebagai perbezaan keupayaan yang bermakna secara automatik.
Terminal-Bench 4.0: pengekodan autonomi yang lebih kukuh
Fable 5.1 mencapai 55.8%, mendahului Fable 5 pada 42.0%, Opus 5 pada 52.3%, dan GPT-5.6 Sol pada 37.3%. Peningkatan 13.8 mata berbanding Fable 5 adalah ketara, manakala kelebihan 3.5 mata berbanding Opus 5 adalah agak sempit.
Penanda aras ini meletakkan agen dalam persekitaran pelaksanaan, jadi kejayaan bergantung pada menavigasi persekitaran, mengubah kod dan mengesahkan hasil. Oleh kerana Terminal-Bench 4.0 menggunakan set tugas berbeza daripada keluaran terdahulu, skor harus dibandingkan hanya dalam versi penanda aras yang sama.
AutomationBench: keuntungan besar dengan ruang penambahbaikan ketara
AutomationBench meningkat daripada 17.1% pada Fable 5 kepada 31.4% pada Fable 5.1. Itu ialah peningkatan mutlak 14.3 mata, atau kira-kira 84% keuntungan relatif.
Penanda aras ini menilai aliran kerja merentasi jualan, pemasaran, operasi, sokongan, kewangan dan HR dengan menyemak keadaan persekitaran akhir. Ini menjadikannya ujian berguna untuk sama ada agen benar-benar menyelesaikan aliran kerja dan bukan sekadar mencadangkan tindakan yang betul. Skor ini juga mendedahkan keterbatasan yang kekal: kira-kira dua pertiga tugas masih tidak disiapkan di bawah konfigurasi yang dilaporkan Anthropic.
CursorBench 3.2.0: keuntungan pengekodan yang lebih kecil
Fable 5.1 mencapai 73.4%, berbanding 70.5% untuk Fable 5, 70.0% untuk Opus 5 dan 67.2% untuk GPT-5.6 Sol. Keuntungan berbanding Fable 5 hanyalah 2.9 mata.
Oleh itu keluaran ini kelihatan kurang transformatif pada tugas pengekodan gaya IDE yang lebih pendek berbanding aliran kerja yang lebih panjang yang melibatkan perancangan, pelaksanaan, pengesahan dan pemulihan. Suit penilaian harus merangkumi perubahan berskala repositori dan pemulihan ujian gagal dan bukan hanya kualiti penjanaan kod.
OSWorld 2.0: penggunaan komputer kekal sukar
Fable 5.1 mencatat 77.9% dengan kredit separa dan 41.7% di bawah penyempurnaan ketat. Opus 5 mencapai 75.4% dan 39.6%, manakala Fable 5 mencapai 72.9% dan 36.1%.
Skor ketat adalah isyarat produksi yang lebih mendedahkan. Kurang daripada separuh tugas disiapkan sepenuhnya, menunjukkan bahawa kemajuan dalam penggunaan komputer tidak menghapuskan keperluan untuk titik semak, kebenaran, pemantauan dan logik pemulihan.
CursorBench dan Humanity's Last Exam: peningkatan lebih kecil
Fable 5.1 mencapai 73.4% pada CursorBench 3.2.0, hanya 2.9 mata di atas Fable 5. Pada Humanity's Last Exam, ia memperoleh 3.1 mata tanpa alat dan 1.2 mata dengan alat.
Jurang yang lebih sempit ini menyokong tafsiran utama: Fable 5.1 lebih transformatif pada aliran kerja panjang yang melibatkan perancangan, pelaksanaan, pengesahan dan pemulihan daripada pada tugas IDE yang lebih pendek atau penaakulan akademik tertutup.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Jawapan ringkas: Fable 5.1 ialah pilihan paling kukuh dalam jadual penanda aras jangka panjang yang diterbitkan Anthropic; Opus 5 ialah titik mula yang lebih ekonomik apabila jurang prestasinya yang lebih kecil boleh diterima; Fable 5 kekal sebagai garis dasar legasi; GPT-6 Astra memerlukan ujian dalam rangka kerja yang sama sebelum sebarang peringkat langsung.
Fable 5.1 ialah penaiktarafan generasi yang jelas berbanding Fable 5 pada penanda aras agen jangka panjang yang dilaporkan Anthropic. GPT-6 Astra ialah perbandingan OpenAI yang lebih semasa, tetapi ia dikeluarkan selepas penilaian 1 September Anthropic dan tidak disertakan dalam rangka kerja penanda aras yang sama.
| Dimensi | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Tetingkap konteks | 1M token | 1M token | 1.05M token |
| Output maksimum | 128K | 128K | 128K |
| Input / output standard | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Bacaan cache | $0.25 / MTok | $1 / MTok | Sahkan terma penyedia semasa |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Tidak disertakan dalam jadual pelancaran Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Tidak disertakan dalam jadual pelancaran Anthropic |
| AutomationBench | 31.4% | 17.1% | Tidak disertakan dalam jadual pelancaran Anthropic |
| Pemposisian utama | Penaakulan mencabar dan agen jangka panjang | Asas kelas Fable terdahulu | Kerja profesional hujung-ke-hujung yang sukar |
Berbanding Fable 5, Fable 5.1 menunjukkan peningkatan terukur terbesarnya dalam penyelidikan saintifik, automasi perniagaan dan pengekodan terminal sambil mengekalkan harga token standard yang sama. Harga bacaan cache yang lebih rendah selanjutnya menambah baik ekonomi agen yang menggunakan konteks berulang.
Peraturan pemilihan: Mulakan dengan Opus 5 apabila kos menjadi keutamaan, tingkatkan ke Fable 5.1 apabila penyempurnaan dan pemulihan jangka panjang paling penting, kekalkan Fable 5 hanya untuk beban kerja yang sensitif terhadap keserasian, dan nilai GPT-6 Astra dalam ujian rangka kerja yang sama sebelum penggunaan produksi.
Bagaimanakah Prestasi Penanda Aras Mengikut Beban Kerja?
| Keupayaan | Hasil Fable 5.1 | Perubahan vs Fable 5 | Tafsiran |
|---|---|---|---|
| Penyelidikan saintifik beragen | 52.6% | +27.9 mata | Peningkatan sangat besar |
| Automasi aliran kerja perniagaan | 31.4% | +14.3 mata | Peningkatan sangat besar |
| Pengekodan terminal | 55.8% | +13.8 mata | Peningkatan besar |
| Penggunaan komputer, ketat | 41.7% | +5.6 mata | Peningkatan sederhana |
| Penggunaan komputer, separa | 77.9% | +5.0 mata | Peningkatan sederhana |
| Penaakulan pakar, tanpa alat | 60.9% | +3.1 mata | Peningkatan kecil |
| Pengekodan agen IDE | 73.4% | +2.9 mata | Peningkatan kecil |
| Penaakulan pakar, dengan alat | 65.0% | +1.2 mata | Peningkatan kecil |
| Kerja pengetahuan profesional | 1853 Elo | +130 Elo | Kuat, sensitif kepada konfigurasi |
Pola adalah konsisten: peningkatan terbesar muncul apabila kejayaan bergantung pada ketekunan, perancangan, interaksi persekitaran, penggunaan alat dan pemulihan dari semasa ke semasa.
Apakah Yang Tidak Diberitahu oleh Penanda Aras?
Jadual penanda aras memampatkan tingkah laku menjadi nombor tunggal. Ia tidak membuktikan bahawa agen autonomi telah diselesaikan, dan ia tidak meramalkan setiap beban kerja produksi.
- Jadual perbandingan utama dijalankan oleh vendor.
- Tetapan usaha mempengaruhi kualiti, latensi dan kos.
- Penanda aras agen mengukur gabungan model, rangka kerja, alat dan kebenaran.
- Langkah perlindungan pengeluaran diaktifkan untuk Fable 5.1 dan menjejaskan beberapa hasil.
- Versi penanda aras berubah, jadi nilai daripada keluaran tugas berbeza mungkin tidak boleh dibandingkan.
- AutomationBench kekal pada 31.4%, manakala penyempurnaan ketat OSWorld kekal pada 41.7%; kadar kegagalan yang ketara masih wujud.
Penilaian praktikal harus menggunakan skor awam untuk menyenarai pendek calon, mengulang semula perbandingan kecil dengan tetapan yang sama, dan kemudian menguji aliran kerja produksi sebenar.
Adakah Claude Fable 5.1 model Claude terbaik?
Untuk keupayaan maksimum pada kerja jangka panjang yang sukar, bukti penanda aras menyokong kes yang kukuh untuk Claude Fable 5.1. Untuk setiap beban kerja, tidak.
Anthropic menentukannya pada $10 per juta token input dan $50 per juta token output, berbanding $5 dan $25 untuk Opus 5. Premium hanya wajar apabila Fable 5.1 menghasilkan kadar kejayaan lebih tinggi, percubaan semula lebih sedikit, token lebih sedikit per tugas diterima, atau pengurangan masa semakan manusia yang mencukupi.
Harga bacaan cache yang lebih rendah boleh mengecilkan jurang kos efektif untuk agen. Kos per hasil diterima oleh itu lebih berguna daripada harga per token semata-mata.
Bagaimanakah Anda Patut Menanda Aras Claude Fable 5.1?
Penilaian anda harus menyerupai beban kerja produksi yang dimaksudkan.
- Pengekodan: Uji isu lengkap dan rekod penerimaan patch, ujian lulus, percubaan semula, panggilan alat, masa berlalu dan masa pembetulan manusia.
- Penyelidikan: Nilai kualiti sumber, ketepatan fakta, liputan bukti, penyempurnaan subtugas dan pengekalan matlamat sepanjang jangka masa panjang.
- Agen perniagaan: Skor keadaan persekitaran akhir dan bukannya mengira tindakan yang betul secara individu.
- Penggunaan komputer: Ukur pemulihan daripada pop timbul, halaman perlahan, sesi terganggu dan keadaan aplikasi yang tidak konsisten.
- Perbandingan model: Kekalkan prompt, rangka kerja, alat, kebenaran, tetapan usaha dan peraturan pemarkahan yang sama.
- Ekonomi: Ukur kos per tugas yang diterima, bukan hanya kos per token.
Kesimpulan
Bukti penanda aras menunjukkan bahawa Fable 5.1 paling berharga apabila tugas memerlukan pelaksanaan berterusan dan bukannya satu respons. Kes penggunaan terkuat termasuk penyelidikan saintifik, pengekodan autonomi, automasi perniagaan yang kompleks, dan aliran kerja dengan pengesahan serta pemulihan berulang.
Bukti tidak menyokong keunggulan universal. Jurang yang lebih kecil pada beberapa penanda aras, kadar kegagalan bermakna pada tugas penggunaan komputer ketat, dan ketiadaan GPT-6 Astra daripada jadual pelancaran Anthropic semuanya mengukuhkan keperluan untuk pengujian khusus beban kerja.
Bagi pengguna CometAPI, peraturan penggunaan praktikal ialah menguji Fable 5.1 di mana kejayaan jangka panjang boleh membenarkan inferens premium, kemudian membandingkannya dengan Opus 5, GPT-5.6 Sol dan GPT-6 Astra pada tugas perwakilan yang sama sebelum memilih laluan produksi.
Soalan Lazim
Apakah skor penanda aras tertinggi Claude Fable 5.1?
Dalam kalangan metrik peratusan yang dilaporkan Anthropic, Fable 5.1 mencapai 77.9% kredit separa pada OSWorld 2.0 dan 73.4% pada CursorBench 3.2.0. Peningkatan generasi terbesarnya ialah Terminal-Bench-Science, pada 52.6% berbanding 24.7% untuk Fable 5.
Sejauh mana Claude Fable 5.1 lebih baik daripada Fable 5?
Keuntungan berbeza dengan ketara mengikut beban kerja: 27.9 mata pada Terminal-Bench-Science, 14.3 pada AutomationBench dan 13.8 pada Terminal-Bench 4.0, tetapi hanya 2.9 pada CursorBench dan 1.2 pada Humanity’s Last Exam dengan alat.
Adakah Claude Fable 5.1 lebih baik daripada Claude Opus 5?
Ia mencatat lebih tinggi merentasi jadual yang dilaporkan Anthropic, tetapi banyak jurang adalah kecil. Anthropic mengesyorkan bermula dengan Opus 5 dan meningkatkan apabila keupayaan jangka panjang tambahan diperlukan.
Adakah Claude Fable 5.1 mengatasi GPT-5.6 Sol?
Anthropic melaporkan skor Fable 5.1 lebih tinggi pada lima metrik yang dikongsi. Oleh kerana ini ialah penilaian pesaing yang dijalankan vendor dan konfigurasi berbeza, kesimpulan selamat ialah Fable 5.1 sangat kompetitif dan bukannya unggul secara universal.
Adakah keputusan disahkan secara bebas?
Hanya sebahagiannya. Beberapa penanda aras mempunyai papan pendahulu awam, tetapi usaha, rangka kerja, tingkah laku fallback dan versi tugas mesti diselaraskan sebelum nilainya boleh dibandingkan terus dengan larian pelancaran Anthropic.
Claude Fable 5.1 paling sesuai untuk apa?
Profil penanda arasmya paling kukuh untuk penyelidikan saintifik jangka panjang, pengekodan autonomi, aliran kerja agen yang kompleks, automasi perniagaan dan tugas yang memerlukan perancangan, alat, pengesahan dan pemulihan.
Bagaimanakah saya boleh mengakses Claude Fable 5.1?
Claude Fable 5.1 disenaraikan di CometAPI dengan ID model claude-fable-5-1. Titik akhir bersatu memudahkan menjalankan beban kerja penilaian yang sama merentasi beberapa model sebelum memilih laluan produksi.
