GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
technology/Badania CometAPI

Claude Fable 5.1 Benchmarki: Co mówią mi wyniki

Poznaj benchmarki Claude Fable 5.1, kluczowe usprawnienia, ograniczenia oraz porównania z Fable 5, Opus 5, GPT-5.6 Sol i GPT-6 Astra.

CometAPI
Mia MarenZespół badań AI modeli i API
Zaktualizowano Sep 17, 2026 12 min czyt.
Claude Fable 5.1 Benchmarki: Co mówią mi wyniki
Użyj tego wzorca

Wykonaj pierwsze wywołanie API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 to przede wszystkim aktualizacja w zakresie wykonywania agentskiego. Największe zgłaszane zyski dotyczą badań naukowych, automatyzacji biznesu, programowania w terminalu oraz innych przepływów pracy wymagających planowania, użycia narzędzi, weryfikacji i odzyskiwania stanu na wielu etapach. Ulepszenia są mniejsze w zamkniętych zadaniach rozumowania i krótszych zadaniach w stylu IDE, więc najlepsza decyzja wdrożeniowa zależy od charakteru obciążenia roboczego, a nie od jednego wyniku nagłówkowego.

Kluczowe wnioski

  • Fable 5.1 uzyskuje 52.6% na Terminal-Bench-Science 0.1, ponad dwukrotnie więcej niż 24.7% Fable 5 w ocenie Anthropic.
  • AutomationBench wzrasta z 17.1% do 31.4%, pokazując duże ulepszenie w end-to-end przepływach pracy biznesowych.
  • Zyski są skromniejsze na CursorBench i na Humanity’s Last Exam z narzędziami, co sugeruje, że wydanie bardziej poprawia utrzymane wykonywanie niż wszystkie formy rozumowania w równym stopniu.
  • Fable 5.1 zachowuje te same standardowe ceny tokenów co Fable 5, podczas gdy niższe ceny odczytu cache mogą obniżyć efektywny koszt agentów silnie korzystających z kontekstu.
  • GPT-6 Astra to teraz bardziej aktualny punkt porównawczy z OpenAI, ale nie został ujęty w tabeli benchmarków Anthropic z 1 września. Każde bezpośrednie twierdzenie o wydajności wymaga kontrolowanej oceny w tym samym harnessie.

Anthropic wydał Claude Fable 5.1 1 września 2026 dla wymagającego rozumowania, agentów o długim horyzoncie, inżynierii oprogramowania, badań i profesjonalnej pracy wymagającej wiedzy. Claude Fable 5.1 jest również dostępny przez CometAPI dla deweloperów, którzy chcą oceniać go obok innych modeli czołowych przez ujednolicony endpoint.

Wyniki nagłówkowe są mocne, ale rozkład ulepszeń jest bardziej pouczający niż średnia. Fable 5.1 zyskuje najwięcej, gdy agent musi utrzymać cel, wchodzić w interakcje z narzędziami, odzyskiwać się po błędach i weryfikować stan końcowy. Ten artykuł koncentruje się na tym, co oznaczają wyniki benchmarków, gdzie model wciąż ma braki i jak oceniać go względem nowszych alternatyw.

Claude Fable 5.1 w skrócie

Dokumentacja modelu Anthropic określa okno kontekstu na 1 milion tokenów, maksymalne wyjście 128K, wejścia tekstowe i obrazowe, adaptacyjne myślenie zawsze włączone oraz ograniczenie wiedzy do czerwca 2026. Identyfikator modelu w Claude API to claude-fable-5-1.

Oficjalna specyfikacjaClaude Fable 5.1
DostawcaAnthropic
Data wydania1 września 2026
Model IDclaude-fable-5-1
Okno kontekstu1,000,000 tokens
Maksymalne wyjście128,000 tokens
Wejście/wyjścieTekst i obrazy → tekst
MyślenieAdaptacyjne, zawsze włączone
Domyślny wysiłekWysoki
Data odcięcia wiedzyczerwiec 2026
Cena wejściowa Anthropic$10 / MTok
Cena wyjściowa Anthropic$50 / MTok
Odczyt z pamięci podręcznej$0.25 / MTok
Opóźnienie porównawczeWolniejsze
Główne pozycjonowanieWymagające rozumowanie i agentska praca o długim horyzoncie

Standardowe ceny wejścia i wyjścia pozostają takie same jak w Fable 5, podczas gdy odczyty cache spadły do $0.25 za milion tokenów. Fable 5.1 nie ma niższych nagłówkowych cen tokenów wejścia/wyjścia. Jego niższy koszt efektywny wynika głównie z 75% obniżki cen odczytu cache. Anthropic szacuje około 25% niższy koszt dla typowych obciążeń i do około 45% dla wysoce agentskich obciążeń.

To ma znaczenie, ponieważ długo działający agent wielokrotnie ponownie wykorzystuje kontekst repozytorium, instrukcje, definicje narzędzi i poprzedni stan. Koszt na ukończone zadanie może się poprawić, nawet gdy nagłówkowe ceny wejścia i wyjścia nie ulegają zmianie.

Anthropic raportuje również 60.9% dla Claude Mythos 5.1 na Terminal-Bench 4.0. Mythos 5.1 to osobno wdrożona wersja z innymi zabezpieczeniami i nie powinna być traktowana jako ogólnie dostępny wynik Fable 5.1.

Co pokazują benchmarky Claude Fable 5.1?

Poniższe wartości pochodzą z oceny Anthropic z września 2026. Opisują konfigurację modelu i harnessu, a nie niezmienną właściwość modelu.

BenchmarkCo mierzyFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Agentskie badania naukowe52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Agentskie programowanie w terminalu55.8%42.0%52.3%37.3%
GDPval-AA v2Profesjonalna praca wiedzochłonna, Elo1853172318241711
OSWorld 2.0, partialUżycie komputera o długim horyzoncie77.9%72.9%75.4%
OSWorld 2.0, strictW pełni ukończone zadania komputerowe41.7%36.1%39.6%
Humanity’s Last Exam, no toolsEksperckie, multidyscyplinarne rozumowanie60.9%57.8%56.6%
Humanity’s Last Exam, with toolsEksperckie rozumowanie z narzędziami65.0%63.8%63.6%
AutomationBenchEnd-to-end przepływy pracy biznesowe31.4%17.1%26.9%19.6%
CursorBench 3.2.0Agentskie kodowanie w IDE73.4%70.5%70.0%67.2%

Fable 5.1 wyprzedza Fable 5 i Opus 5 w dziewięciu raportowanych wierszach. Największe międzypokoleniowe zyski pojawiają się w badaniach naukowych, automatyzacji przepływów pracy biznesowych i programowaniu w terminalu. Mniejsze różnice na Humanity’s Last Exam i CursorBench są równie ważne, ponieważ pokazują, że ulepszenie nie jest jednolite w każdym obciążeniu.

Gdzie Claude Fable 5.1 poprawia się najbardziej?

Terminal-Bench-Science 0.1: wynik wyróżniający się

Fable 5.1 uzyskuje 52.6%, w porównaniu do 24.7% dla Claude Fable 5, 29.0% dla Claude Opus 5 i 22.4% dla GPT-5.6 Sol w uruchomieniu Anthropic. Duża, 27.9-punktowa luka międzypokoleniowa jest znacznie większa niż raportowany błąd standardowy na model, podczas gdy mniejsze luki — jak 3.5 punktu różnicy Fable 5.1 vs Opus 5 na Terminal-Bench 4.0 — należy interpretować ostrożniej.

Terminal-Bench-Science ocenia kompletne przepływy badawcze w domenach naukowych i inżynieryjnych. Agenci muszą wytworzyć kod, analizy, dowody, symulacje lub artefakty danych, a nie jedynie odpowiadać na odizolowane pytania. Anthropic raportuje błąd standardowy około ±3.5–4.5 punktu na model, więc niewielkie różnice nie powinny automatycznie być interpretowane jako znaczące różnice zdolności.

Terminal-Bench 4.0: silniejsze autonomiczne kodowanie

Fable 5.1 osiąga 55.8%, wyprzedzając Fable 5 z 42.0%, Opus 5 z 52.3% oraz GPT-5.6 Sol z 37.3%. 13.8-punktowa poprawa względem Fable 5 jest znacząca, podczas gdy 3.5-punktowe prowadzenie nad Opus 5 jest relatywnie wąskie.

Benchmark umieszcza agentów w środowisku wykonawczym, więc sukces zależy od nawigacji po środowisku, wprowadzania zmian w kodzie i walidacji rezultatów. Ponieważ Terminal-Bench 4.0 używa innego zestawu zadań niż wcześniejsze wydania, wyniki należy porównywać tylko w ramach tej samej wersji benchmarku.

AutomationBench: duży zysk z istotną przestrzenią do poprawy

AutomationBench rośnie z 17.1% na Fable 5 do 31.4% na Fable 5.1. To 14.3 punktu wzrostu bezwzględnego, czyli około 84% względnie.

Benchmark ocenia przepływy w obszarach sprzedaży, marketingu, operacji, wsparcia, finansów i HR, sprawdzając stan końcowy środowiska. Dzięki temu jest użytecznym testem, czy agent faktycznie ukończył workflow, a nie tylko zaproponował poprawne działania. Wynik ujawnia też pozostałe ograniczenie: około dwie trzecie zadań wciąż nie zostało ukończonych w raportowanej przez Anthropic konfiguracji.

CursorBench 3.2.0: mniejszy zysk w kodowaniu

Fable 5.1 osiąga 73.4%, wobec 70.5% dla Fable 5, 70.0% dla Opus 5 i 67.2% dla GPT-5.6 Sol. Zysk względem Fable 5 to tylko 2.9 punktu.

Wydanie zatem wydaje się mniej przełomowe w krótszych zadaniach kodowania w stylu IDE niż w dłuższych przepływach obejmujących planowanie, wykonanie, weryfikację i odzyskiwanie. Zestawy ocen powinny obejmować zmiany na skalę repozytorium i naprawę niezdanych testów, a nie tylko jakość generacji kodu.

OSWorld 2.0: użycie komputera pozostaje trudne

Fable 5.1 uzyskuje 77.9% z częściowym zaliczeniem i 41.7% w trybie ścisłego ukończenia. Opus 5 osiąga 75.4% i 39.6%, a Fable 5 72.9% i 36.1%.

Ścisły wynik jest bardziej ujawniającym sygnałem produkcyjnym. Mniej niż połowa zadań została w pełni ukończona, co pokazuje, że postęp w użyciu komputera nie eliminuje potrzeby punktów kontrolnych, uprawnień, monitoringu i logiki odzyskiwania.

CursorBench i Humanity’s Last Exam: mniejsze zyski

Fable 5.1 osiąga 73.4% na CursorBench 3.2.0, zaledwie 2.9 punktu powyżej Fable 5. Na Humanity’s Last Exam zyskuje 3.1 punktu bez narzędzi i 1.2 punktu z narzędziami.

Te węższe różnice wspierają centralną interpretację: Fable 5.1 jest bardziej transformacyjny w długich przepływach pracy obejmujących planowanie, wykonanie, weryfikację i odzyskiwanie niż w krótszych zadaniach IDE czy zamkniętym rozumowaniu akademickim.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Krótka odpowiedź: Fable 5.1 to najsilniejsza opcja w opublikowanej przez Anthropic tabeli benchmarków długiego horyzontu; Opus 5 jest bardziej ekonomicznym punktem wyjścia, gdy akceptowalna jest mniejsza różnica wydajności; Fable 5 pozostaje starszą bazą; GPT-6 Astra wymaga testu w tym samym harnessie przed jakąkolwiek bezpośrednią klasyfikacją.

Fable 5.1 to jasny upgrade generacyjny względem Fable 5 w raportowanych przez Anthropic benchmarkach agentów o długim horyzoncie. GPT-6 Astra to bardziej aktualne porównanie z OpenAI, ale został wydany po ocenie Anthropic z 1 września i nie został ujęty w tym samym harnessie benchmarkowym.

WymiarClaude Fable 5.1Claude Fable 5GPT-6 Astra
Okno kontekstu1M tokens1M tokens1.05M tokens
Maksymalne wyjście128K128K128K
Standardowe wejście/wyjście$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Odczyt z pamięci podręcznej$0.25 / MTok$1 / MTokZweryfikuj aktualne warunki dostawcy
Terminal-Bench-Science 0.152.6%24.7%Not included in Anthropic’s launch table
Terminal-Bench 4.055.8%42.0%Not included in Anthropic’s launch table
AutomationBench31.4%17.1%Not included in Anthropic’s launch table
Główne pozycjonowanieWymagające rozumowanie i agenci o długim horyzonciePoprzednia baza klasy FableTrudna praca profesjonalna end-to-end

Względem Fable 5, Fable 5.1 pokazuje największe zmierzone zyski w badaniach naukowych, automatyzacji biznesu i programowaniu w terminalu, zachowując te same standardowe ceny tokenów. Niższe ceny odczytu cache dodatkowo poprawiają ekonomię agentów z powtarzanym kontekstem.

Reguła wyboru: Zaczynaj od Opus 5, gdy priorytetem jest koszt; eskaluj do Fable 5.1, gdy najważniejsze są ukończenia z długim horyzontem i zdolności odzyskiwania; utrzymuj Fable 5 tylko dla obciążeń wrażliwych na zgodność; oceniaj GPT-6 Astra w kontrolnym teście w tym samym harnessie przed adopcją produkcyjną.

Jak wygląda wydajność benchmarkowa według rodzaju obciążenia?

ZdolnośćWynik Fable 5.1Zmiana vs Fable 5Interpretacja
Agentskie badania naukowe52.6%+27.9 pktBardzo duży zysk
Automatyzacja przepływów biznesowych31.4%+14.3 pktBardzo duży zysk
Programowanie w terminalu55.8%+13.8 pktDuży zysk
Użycie komputera, ścisłe41.7%+5.6 pktUmiarkowany zysk
Użycie komputera, częściowe77.9%+5.0 pktUmiarkowany zysk
Eksperckie rozumowanie, bez narzędzi60.9%+3.1 pktMały zysk
Agentskie kodowanie w IDE73.4%+2.9 pktMały zysk
Eksperckie rozumowanie, narzędzia65.0%+1.2 pktMały zysk
Profesjonalna praca wiedzochłonna1853 Elo+130 EloSilny, zależny od konfiguracji

Wzorzec jest spójny: największe ulepszenia pojawiają się tam, gdzie sukces zależy od wytrwałości, planowania, interakcji ze środowiskiem, użycia narzędzi i odzyskiwania w czasie.

Czego benchmarki nie mówią?

Tabele benchmarków kompresują zachowanie do pojedynczych liczb. Nie dowodzą, że agenci autonomiczni są rozwiązani, i nie przewidują każdego obciążenia produkcyjnego.

  • Główna tabela porównań jest uruchamiana przez dostawcę.
  • Ustawienia wysiłku wpływają na jakość, opóźnienie i koszt.
  • Benchmarki agentów mierzą łącznie model, harness, narzędzia i uprawnienia.
  • Zabezpieczenia produkcyjne były włączone dla Fable 5.1 i wpłynęły na niektóre wyniki.
  • Wersje benchmarków się zmieniają, więc wartości z różnych wydań zadań mogą być nieporównywalne.
  • AutomationBench pozostaje na 31.4%, a OSWorld ścisłe ukończenie na 41.7%; pozostają istotne odsetki niepowodzeń.

Praktyczna ocena powinna używać wyników publicznych do skrócenia listy kandydatów, odtworzyć małe porównanie przy identycznych ustawieniach, a następnie przetestować rzeczywisty przepływ pracy produkcyjnej.

Czy Claude Fable 5.1 to najlepszy model Claude?

Dla maksymalnych możliwości w trudnej, długo trwającej pracy, dowody z benchmarków mocno przemawiają za Claude Fable 5.1. Nie dla każdego obciążenia.

Anthropic wycenia go na $10 za milion tokenów wejścia i $50 za milion tokenów wyjścia, wobec $5 i $25 dla Opus 5. Premia jest uzasadniona tylko wtedy, gdy Fable 5.1 zapewnia wyższy odsetek sukcesów, mniej powtórzeń, mniej tokenów na zaakceptowane zadanie lub wystarczającą redukcję czasu przeglądu przez człowieka.

Niższe ceny odczytu cache mogą zawęzić efektywną różnicę kosztów dla agentów. Koszt na zaakceptowany rezultat jest więc bardziej użyteczny niż sama cena za token.

Jak benchmarkować Claude Fable 5.1?

Twoja ocena powinna przypominać zamierzone obciążenie produkcyjne.

  • Kodowanie: Testuj kompletne zgłoszenia i rejestruj akceptację łatek, testy zdane, liczbę powtórek, wywołania narzędzi, czas całkowity i czas korekt przez człowieka.
  • Badania: Oceniaj jakość źródeł, dokładność faktów, pokrycie dowodów, ukończenie podzadań i utrzymanie celu podczas długich przebiegów.
  • Agenci biznesowi: Oceniaj stan końcowy środowiska zamiast zliczać pojedynczo poprawne akcje.
  • Użycie komputera: Mierz odzyskiwanie po pop-upach, wolnych stronach, przerwanych sesjach i niespójnym stanie aplikacji.
  • Porównanie modeli: Zachowaj stałe prompty, harnessy, narzędzia, uprawnienia, ustawienia wysiłku i zasady oceny.
  • Ekonomia: Mierz koszt na zaakceptowane zadanie, a nie tylko koszt za token.

Wnioski

Dowody z benchmarków sugerują, że Fable 5.1 jest najbardziej wartościowy, gdy zadanie wymaga utrzymanego wykonania zamiast pojedynczej odpowiedzi. Najsilniejsze przypadki użycia obejmują badania naukowe, autonomiczne kodowanie, złożoną automatyzację biznesu i przepływy pracy z powtarzaną weryfikacją oraz odzyskiwaniem.

Dowody nie wspierają uniwersalnej wyższości. Mniejsze różnice na kilku benchmarkach, znaczące odsetki niepowodzeń w ścisłych zadaniach użycia komputera oraz brak GPT-6 Astra w tabeli startowej Anthropic wzmacniają potrzebę testów specyficznych dla obciążenia.

Dla użytkowników CometAPI praktyczna reguła wdrożenia to testować Fable 5.1 tam, gdzie sukces o długim horyzoncie może uzasadnić premię za inferencję, a następnie porównać go z Opus 5, GPT-5.6 Sol i GPT-6 Astra na tych samych reprezentatywnych zadaniach, zanim wybierze się trasę produkcyjną.

FAQ

Jaki jest najwyższy wynik benchmarkowy Claude Fable 5.1?

Wśród raportowanych przez Anthropic metryk procentowych Fable 5.1 osiąga 77.9% z częściowym zaliczeniem na OSWorld 2.0 i 73.4% na CursorBench 3.2.0. Jego największa poprawa międzypokoleniowa to Terminal-Bench-Science: 52.6% wobec 24.7% dla Fable 5.

O ile Claude Fable 5.1 jest lepszy od Fable 5?

Zysk silnie zależy od obciążenia: 27.9 punktu na Terminal-Bench-Science, 14.3 na AutomationBench i 13.8 na Terminal-Bench 4.0, ale tylko 2.9 na CursorBench i 1.2 na Humanity’s Last Exam z narzędziami.

Czy Claude Fable 5.1 jest lepszy niż Claude Opus 5?

Uzyskuje wyższe wyniki w całej tabeli raportowanej przez Anthropic, ale wiele różnic jest niewielkich. Anthropic zaleca zaczynać od Opus 5 i eskalować, gdy potrzebna jest dodatkowa zdolność o długim horyzoncie.

Czy Claude Fable 5.1 pokonuje GPT-5.6 Sol?

Anthropic raportuje wyższe wyniki Fable 5.1 na pięciu wspólnych metrykach. Ponieważ są to oceny konkurentów uruchamiane przez dostawcę i konfiguracje się różnią, bezpiecznym wnioskiem jest, że Fable 5.1 jest bardzo konkurencyjny, a nie uniwersalnie lepszy.

Czy wyniki są niezależnie weryfikowane?

Tylko częściowo. Kilka benchmarków ma publiczne tabele liderów, ale effort, harness, zachowanie awaryjne i wersje zadań muszą być zestrojone, aby wartości można było porównywać bezpośrednio z runem startowym Anthropic.

Do czego Claude Fable 5.1 nadaje się najlepiej?

Jego profil benchmarkowy jest najsilniejszy dla długotrwałych badań naukowych, autonomicznego kodowania, złożonych przepływów agentskich, automatyzacji biznesu i zadań wymagających planowania, narzędzi, weryfikacji i odzyskiwania.

Jak uzyskać dostęp do Claude Fable 5.1?

Claude Fable 5.1 jest wymieniony w CometAPI z ID modelu claude-fable-5-1. Ujednolicony endpoint sprawia, że praktyczne jest uruchomienie tego samego obciążenia ewaluacyjnego na kilku modelach przed wyborem trasy produkcyjnej.

Kontynuuj naukę

Połącz ten artykuł z następną decyzją.

Zobacz wszystkie tematy
Opublikowano Sep 17, 2026
Ostatnia aktualizacja Sep 17, 2026
0 wyświetleń
Sprawdzone pod kątem przejrzystości, atrybucji źródeł i aktualnej terminologii API.

Gotowy na obniżenie kosztów rozwoju AI o 20%?

Zacznij za darmo w kilka minut. Dołączone kredyty na bezpłatny okres próbny. Karta kredytowa nie jest wymagana.

Czytaj więcej