TLDR Claude Fable 5.1 to przede wszystkim aktualizacja w zakresie wykonywania agentskiego. Największe zgłaszane zyski dotyczą badań naukowych, automatyzacji biznesu, programowania w terminalu oraz innych przepływów pracy wymagających planowania, użycia narzędzi, weryfikacji i odzyskiwania stanu na wielu etapach. Ulepszenia są mniejsze w zamkniętych zadaniach rozumowania i krótszych zadaniach w stylu IDE, więc najlepsza decyzja wdrożeniowa zależy od charakteru obciążenia roboczego, a nie od jednego wyniku nagłówkowego.
Kluczowe wnioski
- Fable 5.1 uzyskuje 52.6% na Terminal-Bench-Science 0.1, ponad dwukrotnie więcej niż 24.7% Fable 5 w ocenie Anthropic.
- AutomationBench wzrasta z 17.1% do 31.4%, pokazując duże ulepszenie w end-to-end przepływach pracy biznesowych.
- Zyski są skromniejsze na CursorBench i na Humanity’s Last Exam z narzędziami, co sugeruje, że wydanie bardziej poprawia utrzymane wykonywanie niż wszystkie formy rozumowania w równym stopniu.
- Fable 5.1 zachowuje te same standardowe ceny tokenów co Fable 5, podczas gdy niższe ceny odczytu cache mogą obniżyć efektywny koszt agentów silnie korzystających z kontekstu.
- GPT-6 Astra to teraz bardziej aktualny punkt porównawczy z OpenAI, ale nie został ujęty w tabeli benchmarków Anthropic z 1 września. Każde bezpośrednie twierdzenie o wydajności wymaga kontrolowanej oceny w tym samym harnessie.
Anthropic wydał Claude Fable 5.1 1 września 2026 dla wymagającego rozumowania, agentów o długim horyzoncie, inżynierii oprogramowania, badań i profesjonalnej pracy wymagającej wiedzy. Claude Fable 5.1 jest również dostępny przez CometAPI dla deweloperów, którzy chcą oceniać go obok innych modeli czołowych przez ujednolicony endpoint.
Wyniki nagłówkowe są mocne, ale rozkład ulepszeń jest bardziej pouczający niż średnia. Fable 5.1 zyskuje najwięcej, gdy agent musi utrzymać cel, wchodzić w interakcje z narzędziami, odzyskiwać się po błędach i weryfikować stan końcowy. Ten artykuł koncentruje się na tym, co oznaczają wyniki benchmarków, gdzie model wciąż ma braki i jak oceniać go względem nowszych alternatyw.
Claude Fable 5.1 w skrócie
Dokumentacja modelu Anthropic określa okno kontekstu na 1 milion tokenów, maksymalne wyjście 128K, wejścia tekstowe i obrazowe, adaptacyjne myślenie zawsze włączone oraz ograniczenie wiedzy do czerwca 2026. Identyfikator modelu w Claude API to claude-fable-5-1.
| Oficjalna specyfikacja | Claude Fable 5.1 |
|---|---|
| Dostawca | Anthropic |
| Data wydania | 1 września 2026 |
| Model ID | claude-fable-5-1 |
| Okno kontekstu | 1,000,000 tokens |
| Maksymalne wyjście | 128,000 tokens |
| Wejście/wyjście | Tekst i obrazy → tekst |
| Myślenie | Adaptacyjne, zawsze włączone |
| Domyślny wysiłek | Wysoki |
| Data odcięcia wiedzy | czerwiec 2026 |
| Cena wejściowa Anthropic | $10 / MTok |
| Cena wyjściowa Anthropic | $50 / MTok |
| Odczyt z pamięci podręcznej | $0.25 / MTok |
| Opóźnienie porównawcze | Wolniejsze |
| Główne pozycjonowanie | Wymagające rozumowanie i agentska praca o długim horyzoncie |
Standardowe ceny wejścia i wyjścia pozostają takie same jak w Fable 5, podczas gdy odczyty cache spadły do $0.25 za milion tokenów. Fable 5.1 nie ma niższych nagłówkowych cen tokenów wejścia/wyjścia. Jego niższy koszt efektywny wynika głównie z 75% obniżki cen odczytu cache. Anthropic szacuje około 25% niższy koszt dla typowych obciążeń i do około 45% dla wysoce agentskich obciążeń.
To ma znaczenie, ponieważ długo działający agent wielokrotnie ponownie wykorzystuje kontekst repozytorium, instrukcje, definicje narzędzi i poprzedni stan. Koszt na ukończone zadanie może się poprawić, nawet gdy nagłówkowe ceny wejścia i wyjścia nie ulegają zmianie.
Anthropic raportuje również 60.9% dla Claude Mythos 5.1 na Terminal-Bench 4.0. Mythos 5.1 to osobno wdrożona wersja z innymi zabezpieczeniami i nie powinna być traktowana jako ogólnie dostępny wynik Fable 5.1.
Co pokazują benchmarky Claude Fable 5.1?
Poniższe wartości pochodzą z oceny Anthropic z września 2026. Opisują konfigurację modelu i harnessu, a nie niezmienną właściwość modelu.
| Benchmark | Co mierzy | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Agentskie badania naukowe | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Agentskie programowanie w terminalu | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Profesjonalna praca wiedzochłonna, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Użycie komputera o długim horyzoncie | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | W pełni ukończone zadania komputerowe | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | Eksperckie, multidyscyplinarne rozumowanie | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | Eksperckie rozumowanie z narzędziami | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | End-to-end przepływy pracy biznesowe | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Agentskie kodowanie w IDE | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 wyprzedza Fable 5 i Opus 5 w dziewięciu raportowanych wierszach. Największe międzypokoleniowe zyski pojawiają się w badaniach naukowych, automatyzacji przepływów pracy biznesowych i programowaniu w terminalu. Mniejsze różnice na Humanity’s Last Exam i CursorBench są równie ważne, ponieważ pokazują, że ulepszenie nie jest jednolite w każdym obciążeniu.
Gdzie Claude Fable 5.1 poprawia się najbardziej?
Terminal-Bench-Science 0.1: wynik wyróżniający się
Fable 5.1 uzyskuje 52.6%, w porównaniu do 24.7% dla Claude Fable 5, 29.0% dla Claude Opus 5 i 22.4% dla GPT-5.6 Sol w uruchomieniu Anthropic. Duża, 27.9-punktowa luka międzypokoleniowa jest znacznie większa niż raportowany błąd standardowy na model, podczas gdy mniejsze luki — jak 3.5 punktu różnicy Fable 5.1 vs Opus 5 na Terminal-Bench 4.0 — należy interpretować ostrożniej.
Terminal-Bench-Science ocenia kompletne przepływy badawcze w domenach naukowych i inżynieryjnych. Agenci muszą wytworzyć kod, analizy, dowody, symulacje lub artefakty danych, a nie jedynie odpowiadać na odizolowane pytania. Anthropic raportuje błąd standardowy około ±3.5–4.5 punktu na model, więc niewielkie różnice nie powinny automatycznie być interpretowane jako znaczące różnice zdolności.
Terminal-Bench 4.0: silniejsze autonomiczne kodowanie
Fable 5.1 osiąga 55.8%, wyprzedzając Fable 5 z 42.0%, Opus 5 z 52.3% oraz GPT-5.6 Sol z 37.3%. 13.8-punktowa poprawa względem Fable 5 jest znacząca, podczas gdy 3.5-punktowe prowadzenie nad Opus 5 jest relatywnie wąskie.
Benchmark umieszcza agentów w środowisku wykonawczym, więc sukces zależy od nawigacji po środowisku, wprowadzania zmian w kodzie i walidacji rezultatów. Ponieważ Terminal-Bench 4.0 używa innego zestawu zadań niż wcześniejsze wydania, wyniki należy porównywać tylko w ramach tej samej wersji benchmarku.
AutomationBench: duży zysk z istotną przestrzenią do poprawy
AutomationBench rośnie z 17.1% na Fable 5 do 31.4% na Fable 5.1. To 14.3 punktu wzrostu bezwzględnego, czyli około 84% względnie.
Benchmark ocenia przepływy w obszarach sprzedaży, marketingu, operacji, wsparcia, finansów i HR, sprawdzając stan końcowy środowiska. Dzięki temu jest użytecznym testem, czy agent faktycznie ukończył workflow, a nie tylko zaproponował poprawne działania. Wynik ujawnia też pozostałe ograniczenie: około dwie trzecie zadań wciąż nie zostało ukończonych w raportowanej przez Anthropic konfiguracji.
CursorBench 3.2.0: mniejszy zysk w kodowaniu
Fable 5.1 osiąga 73.4%, wobec 70.5% dla Fable 5, 70.0% dla Opus 5 i 67.2% dla GPT-5.6 Sol. Zysk względem Fable 5 to tylko 2.9 punktu.
Wydanie zatem wydaje się mniej przełomowe w krótszych zadaniach kodowania w stylu IDE niż w dłuższych przepływach obejmujących planowanie, wykonanie, weryfikację i odzyskiwanie. Zestawy ocen powinny obejmować zmiany na skalę repozytorium i naprawę niezdanych testów, a nie tylko jakość generacji kodu.
OSWorld 2.0: użycie komputera pozostaje trudne
Fable 5.1 uzyskuje 77.9% z częściowym zaliczeniem i 41.7% w trybie ścisłego ukończenia. Opus 5 osiąga 75.4% i 39.6%, a Fable 5 72.9% i 36.1%.
Ścisły wynik jest bardziej ujawniającym sygnałem produkcyjnym. Mniej niż połowa zadań została w pełni ukończona, co pokazuje, że postęp w użyciu komputera nie eliminuje potrzeby punktów kontrolnych, uprawnień, monitoringu i logiki odzyskiwania.
CursorBench i Humanity’s Last Exam: mniejsze zyski
Fable 5.1 osiąga 73.4% na CursorBench 3.2.0, zaledwie 2.9 punktu powyżej Fable 5. Na Humanity’s Last Exam zyskuje 3.1 punktu bez narzędzi i 1.2 punktu z narzędziami.
Te węższe różnice wspierają centralną interpretację: Fable 5.1 jest bardziej transformacyjny w długich przepływach pracy obejmujących planowanie, wykonanie, weryfikację i odzyskiwanie niż w krótszych zadaniach IDE czy zamkniętym rozumowaniu akademickim.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Krótka odpowiedź: Fable 5.1 to najsilniejsza opcja w opublikowanej przez Anthropic tabeli benchmarków długiego horyzontu; Opus 5 jest bardziej ekonomicznym punktem wyjścia, gdy akceptowalna jest mniejsza różnica wydajności; Fable 5 pozostaje starszą bazą; GPT-6 Astra wymaga testu w tym samym harnessie przed jakąkolwiek bezpośrednią klasyfikacją.
Fable 5.1 to jasny upgrade generacyjny względem Fable 5 w raportowanych przez Anthropic benchmarkach agentów o długim horyzoncie. GPT-6 Astra to bardziej aktualne porównanie z OpenAI, ale został wydany po ocenie Anthropic z 1 września i nie został ujęty w tym samym harnessie benchmarkowym.
| Wymiar | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Okno kontekstu | 1M tokens | 1M tokens | 1.05M tokens |
| Maksymalne wyjście | 128K | 128K | 128K |
| Standardowe wejście/wyjście | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Odczyt z pamięci podręcznej | $0.25 / MTok | $1 / MTok | Zweryfikuj aktualne warunki dostawcy |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Not included in Anthropic’s launch table |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Not included in Anthropic’s launch table |
| AutomationBench | 31.4% | 17.1% | Not included in Anthropic’s launch table |
| Główne pozycjonowanie | Wymagające rozumowanie i agenci o długim horyzoncie | Poprzednia baza klasy Fable | Trudna praca profesjonalna end-to-end |
Względem Fable 5, Fable 5.1 pokazuje największe zmierzone zyski w badaniach naukowych, automatyzacji biznesu i programowaniu w terminalu, zachowując te same standardowe ceny tokenów. Niższe ceny odczytu cache dodatkowo poprawiają ekonomię agentów z powtarzanym kontekstem.
Reguła wyboru: Zaczynaj od Opus 5, gdy priorytetem jest koszt; eskaluj do Fable 5.1, gdy najważniejsze są ukończenia z długim horyzontem i zdolności odzyskiwania; utrzymuj Fable 5 tylko dla obciążeń wrażliwych na zgodność; oceniaj GPT-6 Astra w kontrolnym teście w tym samym harnessie przed adopcją produkcyjną.
Jak wygląda wydajność benchmarkowa według rodzaju obciążenia?
| Zdolność | Wynik Fable 5.1 | Zmiana vs Fable 5 | Interpretacja |
|---|---|---|---|
| Agentskie badania naukowe | 52.6% | +27.9 pkt | Bardzo duży zysk |
| Automatyzacja przepływów biznesowych | 31.4% | +14.3 pkt | Bardzo duży zysk |
| Programowanie w terminalu | 55.8% | +13.8 pkt | Duży zysk |
| Użycie komputera, ścisłe | 41.7% | +5.6 pkt | Umiarkowany zysk |
| Użycie komputera, częściowe | 77.9% | +5.0 pkt | Umiarkowany zysk |
| Eksperckie rozumowanie, bez narzędzi | 60.9% | +3.1 pkt | Mały zysk |
| Agentskie kodowanie w IDE | 73.4% | +2.9 pkt | Mały zysk |
| Eksperckie rozumowanie, narzędzia | 65.0% | +1.2 pkt | Mały zysk |
| Profesjonalna praca wiedzochłonna | 1853 Elo | +130 Elo | Silny, zależny od konfiguracji |
Wzorzec jest spójny: największe ulepszenia pojawiają się tam, gdzie sukces zależy od wytrwałości, planowania, interakcji ze środowiskiem, użycia narzędzi i odzyskiwania w czasie.
Czego benchmarki nie mówią?
Tabele benchmarków kompresują zachowanie do pojedynczych liczb. Nie dowodzą, że agenci autonomiczni są rozwiązani, i nie przewidują każdego obciążenia produkcyjnego.
- Główna tabela porównań jest uruchamiana przez dostawcę.
- Ustawienia wysiłku wpływają na jakość, opóźnienie i koszt.
- Benchmarki agentów mierzą łącznie model, harness, narzędzia i uprawnienia.
- Zabezpieczenia produkcyjne były włączone dla Fable 5.1 i wpłynęły na niektóre wyniki.
- Wersje benchmarków się zmieniają, więc wartości z różnych wydań zadań mogą być nieporównywalne.
- AutomationBench pozostaje na 31.4%, a OSWorld ścisłe ukończenie na 41.7%; pozostają istotne odsetki niepowodzeń.
Praktyczna ocena powinna używać wyników publicznych do skrócenia listy kandydatów, odtworzyć małe porównanie przy identycznych ustawieniach, a następnie przetestować rzeczywisty przepływ pracy produkcyjnej.
Czy Claude Fable 5.1 to najlepszy model Claude?
Dla maksymalnych możliwości w trudnej, długo trwającej pracy, dowody z benchmarków mocno przemawiają za Claude Fable 5.1. Nie dla każdego obciążenia.
Anthropic wycenia go na $10 za milion tokenów wejścia i $50 za milion tokenów wyjścia, wobec $5 i $25 dla Opus 5. Premia jest uzasadniona tylko wtedy, gdy Fable 5.1 zapewnia wyższy odsetek sukcesów, mniej powtórzeń, mniej tokenów na zaakceptowane zadanie lub wystarczającą redukcję czasu przeglądu przez człowieka.
Niższe ceny odczytu cache mogą zawęzić efektywną różnicę kosztów dla agentów. Koszt na zaakceptowany rezultat jest więc bardziej użyteczny niż sama cena za token.
Jak benchmarkować Claude Fable 5.1?
Twoja ocena powinna przypominać zamierzone obciążenie produkcyjne.
- Kodowanie: Testuj kompletne zgłoszenia i rejestruj akceptację łatek, testy zdane, liczbę powtórek, wywołania narzędzi, czas całkowity i czas korekt przez człowieka.
- Badania: Oceniaj jakość źródeł, dokładność faktów, pokrycie dowodów, ukończenie podzadań i utrzymanie celu podczas długich przebiegów.
- Agenci biznesowi: Oceniaj stan końcowy środowiska zamiast zliczać pojedynczo poprawne akcje.
- Użycie komputera: Mierz odzyskiwanie po pop-upach, wolnych stronach, przerwanych sesjach i niespójnym stanie aplikacji.
- Porównanie modeli: Zachowaj stałe prompty, harnessy, narzędzia, uprawnienia, ustawienia wysiłku i zasady oceny.
- Ekonomia: Mierz koszt na zaakceptowane zadanie, a nie tylko koszt za token.
Wnioski
Dowody z benchmarków sugerują, że Fable 5.1 jest najbardziej wartościowy, gdy zadanie wymaga utrzymanego wykonania zamiast pojedynczej odpowiedzi. Najsilniejsze przypadki użycia obejmują badania naukowe, autonomiczne kodowanie, złożoną automatyzację biznesu i przepływy pracy z powtarzaną weryfikacją oraz odzyskiwaniem.
Dowody nie wspierają uniwersalnej wyższości. Mniejsze różnice na kilku benchmarkach, znaczące odsetki niepowodzeń w ścisłych zadaniach użycia komputera oraz brak GPT-6 Astra w tabeli startowej Anthropic wzmacniają potrzebę testów specyficznych dla obciążenia.
Dla użytkowników CometAPI praktyczna reguła wdrożenia to testować Fable 5.1 tam, gdzie sukces o długim horyzoncie może uzasadnić premię za inferencję, a następnie porównać go z Opus 5, GPT-5.6 Sol i GPT-6 Astra na tych samych reprezentatywnych zadaniach, zanim wybierze się trasę produkcyjną.
FAQ
Jaki jest najwyższy wynik benchmarkowy Claude Fable 5.1?
Wśród raportowanych przez Anthropic metryk procentowych Fable 5.1 osiąga 77.9% z częściowym zaliczeniem na OSWorld 2.0 i 73.4% na CursorBench 3.2.0. Jego największa poprawa międzypokoleniowa to Terminal-Bench-Science: 52.6% wobec 24.7% dla Fable 5.
O ile Claude Fable 5.1 jest lepszy od Fable 5?
Zysk silnie zależy od obciążenia: 27.9 punktu na Terminal-Bench-Science, 14.3 na AutomationBench i 13.8 na Terminal-Bench 4.0, ale tylko 2.9 na CursorBench i 1.2 na Humanity’s Last Exam z narzędziami.
Czy Claude Fable 5.1 jest lepszy niż Claude Opus 5?
Uzyskuje wyższe wyniki w całej tabeli raportowanej przez Anthropic, ale wiele różnic jest niewielkich. Anthropic zaleca zaczynać od Opus 5 i eskalować, gdy potrzebna jest dodatkowa zdolność o długim horyzoncie.
Czy Claude Fable 5.1 pokonuje GPT-5.6 Sol?
Anthropic raportuje wyższe wyniki Fable 5.1 na pięciu wspólnych metrykach. Ponieważ są to oceny konkurentów uruchamiane przez dostawcę i konfiguracje się różnią, bezpiecznym wnioskiem jest, że Fable 5.1 jest bardzo konkurencyjny, a nie uniwersalnie lepszy.
Czy wyniki są niezależnie weryfikowane?
Tylko częściowo. Kilka benchmarków ma publiczne tabele liderów, ale effort, harness, zachowanie awaryjne i wersje zadań muszą być zestrojone, aby wartości można było porównywać bezpośrednio z runem startowym Anthropic.
Do czego Claude Fable 5.1 nadaje się najlepiej?
Jego profil benchmarkowy jest najsilniejszy dla długotrwałych badań naukowych, autonomicznego kodowania, złożonych przepływów agentskich, automatyzacji biznesu i zadań wymagających planowania, narzędzi, weryfikacji i odzyskiwania.
Jak uzyskać dostęp do Claude Fable 5.1?
Claude Fable 5.1 jest wymieniony w CometAPI z ID modelu claude-fable-5-1. Ujednolicony endpoint sprawia, że praktyczne jest uruchomienie tego samego obciążenia ewaluacyjnego na kilku modelach przed wyborem trasy produkcyjnej.
