GPT-6.1 Sol are now live on CometAPI →
technology/CometAPI research

Claude Fable 5.1 benchmarktests: Hvad fortæller resultaterne mig

Udforsk Claude Fable 5.1-benchmarks, nøgleforbedringer, begrænsninger og sammenligninger med Fable 5, Opus 5, GPT-5.6 Sol og GPT-6 Astra.

CometAPI
Mia MarenForskningshold for AI-modeller og API
Opdateret Sep 17, 2026 12 min. læsning
Claude Fable 5.1 benchmarktests: Hvad fortæller resultaterne mig
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 er primært en opgradering af agentbaseret udførelse. Dets største rapporterede gevinster ses i videnskabelig forskning, forretningsautomatisering, terminalkodning og andre arbejdsforløb, der kræver planlægning, værktøjsbrug, verifikation og genopretning på tværs af mange trin. Forbedringerne er mindre på lukkede ræsonnementsopgaver og kortere IDE-lignende kodningsopgaver, så den bedste implementeringsbeslutning afhænger af arbejdsbelastningen frem for en enkelt toplinje-score.

Nøglepointer

  • Fable 5.1 scorer 52.6% på Terminal-Bench-Science 0.1, mere end dobbelt så meget som Fable 5’s 24.7% i Anthropics evaluering.
  • AutomationBench stiger fra 17.1% til 31.4%, hvilket viser en stor forbedring i end-to-end forretningsarbejdsprocesser.
  • Gevinsterne er mere beskedne på CursorBench og værktøjsassisteret Humanity’s Last Exam, hvilket antyder, at udgivelsen forbedrer vedvarende udførelse mere end alle former for ræsonnement lige meget.
  • Fable 5.1 bevarer de samme standard token-priser som Fable 5, mens lavere cache-read-priser kan reducere den effektive omkostning for kontekttunge agentarbejdsforløb.
  • GPT-6 Astra er nu den mere aktuelle OpenAI-sammenligning, men den var ikke inkluderet i Anthropics benchmarktabel fra 1. september. Enhver direkte præstationspåstand kræver en kontrolleret evaluering i samme harness.

Anthropic udgav Claude Fable 5.1 den 1. september 2026 til krævende ræsonnement, langvarige agenter, software engineering, forskning og professionelt vidensarbejde. Claude Fable 5.1 er også tilgængelig via CometAPI for udviklere, der vil evaluere den sammen med andre frontmodeller gennem et samlet endpoint.

Topresultaterne er stærke, men fordelingen af forbedringer er mere informativ end gennemsnittet. Fable 5.1 vinder mest, når en agent skal bevare et mål, interagere med værktøjer, genoprette fra fejl og verificere en sluttilstand. Denne artikel fokuserer på, hvad benchmarkresultaterne betyder, hvor modellen stadig halter, og hvordan man evaluerer den mod nyere alternativer.

Claude Fable 5.1 i korte træk

Anthropics modeldokumentation angiver et kontekstvindue på 1 million tokens, 128K maksimalt output, tekst- og billedinput, altid aktiveret adaptiv tænkning og en vidensafskæring i juni 2026. Claude API model-ID er claude-fable-5-1.

Officiel specifikationClaude Fable 5.1
UdbyderAnthropic
UdgivelsesdatoSeptember 1, 2026
Model-IDclaude-fable-5-1
Kontekstvindue1,000,000 tokens
Maksimalt output128,000 tokens
Input / outputTekst og billeder → tekst
TænkningAdaptiv, altid aktiveret
StandardindsatsHøj
VidensafskæringJune 2026
Anthropic inputpris$10 / MTok
Anthropic outputpris$50 / MTok
Cache read$0.25 / MTok
Komparativ latensLangsommere
Primær positioneringKrævende ræsonnement og langvarigt agentarbejde

Standard input- og outputpriser forbliver de samme som for Fable 5, mens cache reads faldt til $0.25 per million tokens. Fable 5.1 har ikke lavere toplinje input/output token-priser. Dets lavere effektive omkostning kommer primært fra en 75% reduktion i cache-read-priser. Anthropic anslår omkring 25% lavere omkostninger for typiske arbejdsbelastninger og op til cirka 45% for stærkt agentbaserede arbejdsforløb.

Det betyder noget, fordi en langvarig agent gentagne gange genbruger repository-kontekst, instruktioner, værktøjsdefinitioner og tidligere tilstand. Omkostning per fuldført opgave kan forbedres, selv når toplinje input- og outputpriser ikke ændrer sig.

Anthropic rapporterer også 60.9% for Claude Mythos 5.1 på Terminal-Bench 4.0. Mythos 5.1 er en separat udrullet version med andre sikkerhedsforanstaltninger og bør ikke behandles som den generelt tilgængelige Fable 5.1-score.

Hvad viser Claude Fable 5.1-benchmarks?

Følgende værdier kommer fra Anthropics evaluering fra september 2026. De beskriver en model- og harness-konfiguration, ikke en uforanderlig egenskab ved modellen.

BenchmarkHvad det målerFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Agentbaseret videnskabelig forskning52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Agentbaseret terminalkodning55.8%42.0%52.3%37.3%
GDPval-AA v2Professionelt vidensarbejde, Elo1853172318241711
OSWorld 2.0, partialComputerbrug med lang horisont77.9%72.9%75.4%—
OSWorld 2.0, strictFuldt gennemførte computeropgaver41.7%36.1%39.6%—
Humanity’s Last Exam, no toolsEkspert, tværfagligt ræsonnement60.9%57.8%56.6%—
Humanity’s Last Exam, with toolsEkspert, ræsonnement med værktøjer65.0%63.8%63.6%—
AutomationBenchEnd-to-end forretningsarbejdsforløb31.4%17.1%26.9%19.6%
CursorBench 3.2.0Agentbaseret IDE-kodning73.4%70.5%70.0%67.2%

Fable 5.1 fører Fable 5 og Opus 5 på alle ni rapporterede rækker. Dets største generationsgevinster forekommer i videnskabelig forskning, forretningsworkflow-automatisering og terminalkodning. De mindre forskelle på Humanity’s Last Exam og CursorBench er lige så vigtige, fordi de viser, at forbedringen ikke er ensartet på tværs af alle arbejdsbelastninger.

Hvor forbedrer Claude Fable 5.1 sig mest?

Terminal-Bench-Science 0.1: det mest iøjnefaldende resultat

Fable 5.1 scorer 52.6%, sammenlignet med 24.7% for Claude Fable 5, 29.0% for Claude Opus 5 og 22.4% for GPT-5.6 Sol i Anthropics kørsel. Den store generationsforskel på 27.9 point er meget større end den rapporterede standardfejl per model, mens mindre forskelle—såsom de 3.5 point mellem Fable 5.1 og Opus 5 på Terminal-Bench 4.0—bør fortolkes mere forsigtigt.

Terminal-Bench-Science evaluerer komplette forskningsarbejdsforløb på tværs af videnskabelige og tekniske domæner. Agenter skal producere kode, analyser, beviser, simulationer eller dataprodukter frem for blot at besvare isolerede spørgsmål. Anthropic rapporterer en standardfejl på cirka ±3.5–4.5 point per model, så små forskelle bør ikke automatisk fortolkes som meningsfulde kapabilitetsforskelle.

Terminal-Bench 4.0: stærkere autonom kodning

Fable 5.1 når 55.8%, foran Fable 5 på 42.0%, Opus 5 på 52.3% og GPT-5.6 Sol på 37.3%. Forbedringen på 13.8 point over Fable 5 er betydelig, mens føringen på 3.5 point over Opus 5 er forholdsvis snæver.

Benchmarken placerer agenter i et eksekveringsmiljø, så succes afhænger af at navigere i miljøet, ændre kode og validere resultater. Fordi Terminal-Bench 4.0 bruger et andet opgavesæt end tidligere udgaver, bør scores kun sammenlignes inden for samme benchmarkversion.

AutomationBench: stor gevinst med betydelig plads til forbedring

AutomationBench stiger fra 17.1% på Fable 5 til 31.4% på Fable 5.1. Det er en absolut stigning på 14.3 point eller cirka 84% relativt.

Benchmarken evaluerer arbejdsforløb på tværs af salg, marketing, drift, support, finans og HR ved at kontrollere den endelige miljøtilstand. Det gør den til en nyttig test af, om en agent faktisk gennemførte et workflow frem for blot at foreslå de korrekte handlinger. Scoren afslører også den tilbageværende begrænsning: omtrent to tredjedele af opgaverne blev stadig ikke gennemført under Anthropics rapporterede konfiguration.

CursorBench 3.2.0: en mindre kodningsgevinst

Fable 5.1 når 73.4%, mod 70.5% for Fable 5, 70.0% for Opus 5 og 67.2% for GPT-5.6 Sol. Gevinsten over Fable 5 er kun 2.9 point.

Udgivelsen virker derfor mindre transformerende på kortere IDE-lignende kodningsopgaver end på længere arbejdsforløb, der involverer planlægning, udførelse, verifikation og genopretning. Evaluationssuiter bør inkludere ændringer på repository-niveau og recovery fra fejlslagne tests i stedet for kun kodegenereringskvalitet.

OSWorld 2.0: computerbrug forbliver vanskelig

Fable 5.1 scorer 77.9% med delvis kredit og 41.7% under striks gennemførsel. Opus 5 når 75.4% og 39.6%, mens Fable 5 når 72.9% og 36.1%.

Den strikse score er det mere afslørende signal i produktion. Færre end halvdelen af opgaverne blev fuldt gennemført, hvilket viser, at fremskridt i computerbrug ikke eliminerer behovet for checkpoints, tilladelser, monitorering og genopretningslogik.

CursorBench og Humanity’s Last Exam: mindre gevinster

Fable 5.1 når 73.4% på CursorBench 3.2.0, kun 2.9 point over Fable 5. På Humanity’s Last Exam vinder den 3.1 point uden værktøjer og 1.2 point med værktøjer.

Disse snævrere forskelle understøtter den centrale tolkning: Fable 5.1 er mere transformerende på lange arbejdsforløb, der involverer planlægning, udførelse, verifikation og genopretning, end på kortere IDE-opgaver eller lukkede akademiske ræsonnementsopgaver.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Kort svar: Fable 5.1 er den stærkeste mulighed i Anthropics publicerede long-horizon benchmarktabel; Opus 5 er det mere økonomiske udgangspunkt, når dets mindre præstationsgab er acceptabelt; Fable 5 forbliver det gamle baseline; GPT-6 Astra kræver en test i samme harness, før nogen direkte rangering.

Fable 5.1 er en klar generationsopgradering over Fable 5 på Anthropics rapporterede long-horizon agentbenchmarks. GPT-6 Astra er den mere aktuelle OpenAI-sammenligning, men den blev udgivet efter Anthropics evaluering den 1. september og var ikke inkluderet i samme benchmark-harness.

DimensionClaude Fable 5.1Claude Fable 5GPT-6 Astra
Kontekstvindue1M tokens1M tokens1.05M tokens
Maksimalt output128K128K128K
Standard input / output$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Cache read$0.25 / MTok$1 / MTokVerificer gældende udbydervilkår
Terminal-Bench-Science 0.152.6%24.7%Ikke inkluderet i Anthropics lancetabel
Terminal-Bench 4.055.8%42.0%Ikke inkluderet i Anthropics lancetabel
AutomationBench31.4%17.1%Ikke inkluderet i Anthropics lancetabel
Primær positioneringKrævende ræsonnement og langvarige agenterTidligere Fable-baselineSvært end-to-end professionelt arbejde

Mod Fable 5 viser Fable 5.1 sine største målte gevinster i videnskabelig forskning, forretningsautomatisering og terminalkodning, samtidig med at den bevarer de samme standard token-priser. Lavere cache-read-priser forbedrer yderligere økonomien i agentarbejde med gentagen kontekst.

Udvælgelsesregel: Start med Opus 5, når omkostninger har højeste prioritet, eskalér til Fable 5.1, når langvarig gennemførsel og genopretning er vigtigst, behold Fable 5 kun for kompatibilitetsfølsomme arbejdsbelastninger, og evaluer GPT-6 Astra i en kontrolleret test i samme harness før produktionsadoption.

Hvordan ser benchmarkydelsen ud efter arbejdsbelastning?

KapabilitetFable 5.1 resultatÆndring vs Fable 5Fortolkning
Agentbaseret forskning52.6%+27.9 ptsMeget stor gevinst
Forretningsworkflow-automation31.4%+14.3 ptsMeget stor gevinst
Terminalkodning55.8%+13.8 ptsStor gevinst
Computerbrug, strict41.7%+5.6 ptsModerat gevinst
Computerbrug, partial77.9%+5.0 ptsModerat gevinst
Ekspert-ræsonnement, uden værktøjer60.9%+3.1 ptsLille gevinst
IDE agentbaseret kodning73.4%+2.9 ptsLille gevinst
Ekspert-ræsonnement, med værktøjer65.0%+1.2 ptsLille gevinst
Professionelt vidensarbejde1853 Elo+130 EloStærk, konfigurationsfølsom

Mønstret er konsistent: de største forbedringer ses, når succes afhænger af vedholdenhed, planlægning, interaktion med miljøet, værktøjsbrug og genopretning over tid.

Hvad fortæller benchmarkene ikke?

Benchmarktabeller komprimerer adfærd til enkeltstående tal. De beviser ikke, at autonome agenter er løst, og de forudsiger ikke enhver produktionsarbejdsbelastning.

  • Hovedsammenligningstabellen er vendor-kørt.
  • Effort-indstillinger påvirker kvalitet, latens og omkostninger.
  • Agentbenchmarks måler den kombinerede model, harness, værktøjer og tilladelser.
  • Produktionssikkerhedsforanstaltninger var aktiveret for Fable 5.1 og påvirkede nogle resultater.
  • Benchmarkversioner ændrer sig, så værdier fra forskellige opgaveudgaver er måske ikke sammenlignelige.
  • AutomationBench er fortsat på 31.4%, mens OSWorld strict-gennemførsel er på 41.7%; der er fortsat betydelige fejlrater.

En praktisk evaluering bør bruge offentlige scores til at kortliste kandidater, reproducere en lille sammenligning med identiske indstillinger og derefter teste den faktiske produktionsarbejdsproces.

Er Claude Fable 5.1 den bedste Claude-model?

For maksimal kapabilitet på vanskeligt, langvarigt arbejde gør benchmarkbeviserne en stærk sag for Claude Fable 5.1. For enhver arbejdsbelastning, nej.

Anthropic prissætter den til $10 per million input tokens og $50 per million output tokens, versus $5 og $25 for Opus 5. Præmien er kun berettiget, når Fable 5.1 leverer en højere succesrate, færre retries, færre tokens per accepteret opgave eller tilstrækkelig reduktion i menneskelig gennemgangstid.

Lavere cache-read-priser kan indsnævre det effektive omkostningsgab for agenter. Omkostning per accepteret resultat er derfor mere nyttigt end pris per token alene.

Hvordan bør du benchmarke Claude Fable 5.1?

Din evaluering bør ligne den tiltænkte produktionsarbejdsbelastning.

  • Coding: Test komplette issues og registrér patch-accept, beståede tests, retries, værktøjskald, forløbet tid og menneskelig rettetid.
  • Research: Evaluer kildekvalitet, faktuel nøjagtighed, evidensdækning, delopgavegennemførsel og målopretholdelse over lange forløb.
  • Business agents: Scor den endelige miljøtilstand i stedet for at tælle individuelt korrekte handlinger.
  • Computerbrug: Mål genopretning fra pop-ups, langsomme sider, afbrudte sessioner og inkonsistente applikationstilstande.
  • Model comparison: Hold prompts, harnesses, værktøjer, tilladelser, effort-indstillinger og scoringsregler konstante.
  • Economics: Mål omkostning per accepteret opgave, ikke kun omkostning per token.

Konklusion

Benchmarkbeviserne tyder på, at Fable 5.1 er mest værdifuld, når en opgave kræver vedvarende udførelse frem for et enkelt svar. De stærkeste anvendelser omfatter videnskabelig forskning, autonom kodning, kompleks forretningsautomatisering og arbejdsforløb med gentagen verifikation og genopretning.

Beviserne understøtter ikke universel overlegenhed. Mindre forskelle på flere benchmarks, meningsfulde fejlrater på strikse computerbrugsopgaver og fraværet af GPT-6 Astra i Anthropics lancetabel understreger behovet for arbejdsbelastningsspecifik testning.

For CometAPI-brugere er en praktisk udrulningsregel at teste Fable 5.1, hvor langvarig succes kan retfærdiggøre premium inferens, og derefter sammenligne den med Opus 5, GPT-5.6 Sol og GPT-6 Astra på de samme repræsentative opgaver, før der vælges en produktionsvej.

Ofte stillede spørgsmål

Hvad er Claude Fable 5.1’s højeste benchmarkscore?

Blandt Anthropics rapporterede procentmålinger når Fable 5.1 77.9% delvis kredit på OSWorld 2.0 og 73.4% på CursorBench 3.2.0. Dets største generationsforbedring er Terminal-Bench-Science med 52.6% mod 24.7% for Fable 5.

Hvor meget bedre er Claude Fable 5.1 end Fable 5?

Gevinsten varierer markant efter arbejdsbelastning: 27.9 point på Terminal-Bench-Science, 14.3 på AutomationBench og 13.8 på Terminal-Bench 4.0, men kun 2.9 på CursorBench og 1.2 på værktøjsassisteret Humanity’s Last Exam.

Er Claude Fable 5.1 bedre end Claude Opus 5?

Den scorer højere på Anthropics rapporterede tabel, men mange forskelle er små. Anthropic anbefaler at starte med Opus 5 og eskalere, når yderligere long-horizon kapabilitet kræves.

Slår Claude Fable 5.1 GPT-5.6 Sol?

Anthropic rapporterer højere Fable 5.1-scores på fem fælles målinger. Fordi disse er vendor-kørte konkurrentevalueringer og konfigurationer varierer, er den sikre konklusion, at Fable 5.1 er meget konkurrencedygtig frem for universelt overlegen.

Er resultaterne uafhængigt verificeret?

Kun delvist. Flere benchmarks har offentlige leaderboards, men effort, harness, fallback-adfærd og opgaveversioner skal være aligned, før deres værdier kan sammenlignes direkte med Anthropics lancering.

Hvad er Claude Fable 5.1 bedst til?

Dens benchmarkprofil er stærkest for langvarig videnskabelig forskning, autonom kodning, komplekse agentarbejdsforløb, forretningsautomatisering og opgaver, der kræver planlægning, værktøjer, verifikation og genopretning.

Hvordan får jeg adgang til Claude Fable 5.1?

Claude Fable 5.1 er opført på CometAPI med model-ID claude-fable-5-1. Et samlet endpoint gør det praktisk at køre den samme evalueringsarbejdsbelastning på flere modeller, før der vælges en produktionsvej.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Sep 17, 2026
Sidst opdateret Sep 17, 2026
27 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Læs mere