GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/CometAPI-forskning

Claude Fable 5.1-ytelsestester: Hva forteller poengsummene meg

Utforsk benchmark-resultater for Claude Fable 5.1, nøkkelforbedringer, begrensninger og sammenligninger med Fable 5, Opus 5, GPT-5.6 Sol og GPT-6 Astra.

CometAPI
Mia MarenForskerteam for AI-modeller og API
Oppdatert Sep 17, 2026 12 min lesetid
Claude Fable 5.1-ytelsestester: Hva forteller poengsummene meg
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR Claude Fable 5.1 er primært en oppgradering for agentbasert utførelse. De største rapporterte gevinstene kommer innen vitenskapelig forskning, forretningsautomatisering, terminalkoding og andre arbeidsflyter som krever planlegging, verktøybruk, verifisering og gjenoppretting over mange steg. Forbedringene er mindre på lukket resonnering og kortere IDE-lignende kodingsoppgaver, så den beste utrullingsbeslutningen avhenger av arbeidslasten snarere enn én enkelt hovedscore.

Hovedpunkter

  • Fable 5.1 oppnår 52.6% på Terminal-Bench-Science 0.1, mer enn dobbelt av Fable 5s 24.7% i Anthropics evaluering.
  • AutomationBench stiger fra 17.1% til 31.4%, som viser en stor forbedring i ende-til-ende forretningsarbeidsflyter.
  • Gevinstene er mer beskjedne på CursorBench og verktøyassistert Humanity's Last Exam, noe som antyder at utgivelsen forbedrer vedvarende utførelse mer enn alle former for resonnering likt.
  • Fable 5.1 beholder de samme standard token-prisene som Fable 5, mens lavere pris for cache-lesing kan redusere den effektive kostnaden for kontekttunge agent-arbeidsflyter.
  • GPT-6 Astra er nå den mer aktuelle OpenAI-sammenligningen, men var ikke inkludert i Anthropics benchmark-tabell 1. september. Enhver direkte påstands­sammenligning krever en kontrollert evaluering i samme harness.

Anthropic lanserte Claude Fable 5.1 1. september 2026 for krevende resonnering, langtidsagenter, programvareutvikling, forskning og profesjonelt kunnskapsarbeid. Claude Fable 5.1 er også tilgjengelig via CometAPI for utviklere som vil evaluere den sammen med andre frontmodeller gjennom et samlet endepunkt.

Hovedresultatene er sterke, men fordelingen av forbedring er mer informativ enn gjennomsnittet. Fable 5.1 vinner mest når en agent må holde på et mål, samhandle med verktøy, hente seg inn etter feil og verifisere en sluttstatus. Denne artikkelen fokuserer på hva benchmark-resultatene betyr, hvor modellen fortsatt mangler, og hvordan man evaluerer den opp mot nyere alternativer.

Claude Fable 5.1 i korte trekk

Anthropics modelldokumentasjon spesifiserer et kontekstvindu på 1 million tokens, 128K maksimal utdata, tekst- og bildeinndata, alltid-på adaptiv tenkning og kunnskapsavgrensning juni 2026. Claude API-modell-ID er claude-fable-5-1.

Offisiell spesifikasjonClaude Fable 5.1
LeverandørAnthropic
Lanseringsdato1. september 2026
Model-IDclaude-fable-5-1
Kontekstvindu1,000,000 tokens
Maksimalt utdata128,000 tokens
Inndata / utdataTekst og bilder → tekst
TenkningAdaptiv, alltid på
StandardinnsatsHøy
Kunnskapsavgrensningjuni 2026
Anthropic inndata-pris$10 / MTok
Anthropic utdata-pris$50 / MTok
Cache-lesing$0.25 / MTok
Relativ latensTregere
Primær posisjoneringKrevende resonnering og langsiktige agentoppgaver

Standard inn- og utdata-priser forblir de samme som for Fable 5, mens cache-lesing falt til $0.25 per million tokens. Fable 5.1 har ikke lavere overskriftspriser for inn-/utdatatokens. Den lavere effektive kostnaden kommer primært fra en 75% reduksjon i pris for cache-lesing. Anthropic anslår rundt 25% lavere kostnad for typiske arbeidslaster og opptil omtrent 45% for svært agentiske arbeidslaster.

Det betyr noe fordi en langvarig agent gjentatte ganger gjenbruker depotkontekst, instruksjoner, verktøydefinisjoner og tidligere tilstand. Kostnad per fullført oppgave kan forbedres selv når overskriftsprisene for inn- og utdata ikke endres.

Anthropic rapporterer også 60.9% for Claude Mythos 5.1 på Terminal-Bench 4.0. Mythos 5.1 er en separat distribuert versjon med andre beskyttelser og bør ikke behandles som den generelt tilgjengelige Fable 5.1-scoren.

Hva viser benchmarkene for Claude Fable 5.1?

Følgende verdier kommer fra Anthropics evaluering september 2026. De beskriver en modell- og harness-konfigurasjon, ikke en uforanderlig egenskap ved modellen.

BenchmarkHva den målerFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Agentisk vitenskapelig forskning52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Agentisk terminalkoding55.8%42.0%52.3%37.3%
GDPval-AA v2Profesjonelt kunnskapsarbeid, Elo1853172318241711
OSWorld 2.0, partialLanghorisontet databruk77.9%72.9%75.4%—
OSWorld 2.0, strictFullførte datamaskinoppgaver41.7%36.1%39.6%—
Humanity’s Last Exam, no toolsEkspert flerfaglig resonnering60.9%57.8%56.6%—
Humanity’s Last Exam, with toolsEkspertresonnering med verktøy65.0%63.8%63.6%—
AutomationBenchEnde-til-ende forretningsflyter31.4%17.1%26.9%19.6%
CursorBench 3.2.0Agentisk IDE-koding73.4%70.5%70.0%67.2%

Fable 5.1 leder Fable 5 og Opus 5 på alle ni rapporterte rader. De største generasjonsgevinstene forekommer innen vitenskapelig forskning, forretningsautomatisering og terminalkoding. De mindre forskjellene på Humanity's Last Exam og CursorBench er like viktige, fordi de viser at forbedringen ikke er jevn på tvers av alle arbeidslaster.

Hvor forbedrer Claude Fable 5.1 seg mest?

Terminal-Bench-Science 0.1: det mest fremtredende resultatet

Fable 5.1 oppnår 52.6%, sammenlignet med 24.7% for Claude Fable 5, 29.0% for Claude Opus 5 og 22.4% for GPT-5.6 Sol i Anthropics kjøring. Det store generasjonsgapet på 27.9 poeng er langt større enn den rapporterte standardfeilen per modell, mens mindre gap — som 3.5-poengforskjellen Fable 5.1 vs. Opus 5 på Terminal-Bench 4.0 — bør tolkes mer varsomt.

Terminal-Bench-Science evaluerer komplette forskningsarbeidsflyter på tvers av vitenskapelige og tekniske domener. Agenter må produsere kode, analyser, bevis, simuleringer eller dataprodukter, ikke bare svare på isolerte spørsmål. Anthropic rapporterer en standardfeil på omtrent ±3.5–4.5 poeng per modell, så små gap bør ikke automatisk tolkes som meningsfulle kapabilitetsforskjeller.

Terminal-Bench 4.0: sterkere autonom koding

Fable 5.1 når 55.8%, foran Fable 5 på 42.0%, Opus 5 på 52.3% og GPT-5.6 Sol på 37.3%. Forbedringen på 13.8 poeng over Fable 5 er betydelig, mens ledelsen på 3.5 poeng over Opus 5 er relativt liten.

Benchmarket plasserer agenter i et utføringsmiljø, så suksess avhenger av å navigere i miljøet, endre kode og validere resultater. Fordi Terminal-Bench 4.0 bruker et annet sett med oppgaver enn tidligere utgaver, bør scorer kun sammenlignes innenfor samme benchmark-versjon.

AutomationBench: en stor gevinst med betydelig handlingsrom

AutomationBench stiger fra 17.1% på Fable 5 til 31.4% på Fable 5.1. Det er en absolutt økning på 14.3 poeng, eller omtrent 84% relativ gevinst.

Benchmarket evaluerer arbeidsflyter innen salg, markedsføring, drift, support, finans og HR ved å sjekke sluttstatus i miljøet. Dette gjør det til en nyttig test av om en agent faktisk fullførte en arbeidsflyt i stedet for bare å foreslå riktige handlinger. Scoren avslører også den gjenværende begrensningen: om lag to tredeler av oppgavene ble fortsatt ikke fullført under Anthropics rapporterte konfigurasjon.

CursorBench 3.2.0: en mindre gevinst i koding

Fable 5.1 når 73.4%, mot 70.5% for Fable 5, 70.0% for Opus 5 og 67.2% for GPT-5.6 Sol. Gevinsten over Fable 5 er bare 2.9 poeng.

Utgivelsen virker derfor mindre transformativ på kortere IDE-lignende kodingsoppgaver enn på lengre arbeidsflyter som involverer planlegging, utførelse, verifisering og gjenoppretting. Evalueringsoppsett bør inkludere endringer i hele kodebaser og gjenoppretting fra feilede tester, ikke bare kvaliteten på kodegenerering.

OSWorld 2.0: datamaskinbruk forblir vanskelig

Fable 5.1 oppnår 77.9% med partial credit og 41.7% under strict fullføring. Opus 5 når 75.4% og 39.6%, mens Fable 5 når 72.9% og 36.1%.

Strict-scoren er det mer avslørende produksjonssignalet. Færre enn halvparten av oppgavene ble fullt ut fullført, noe som viser at fremgang i databruk ikke eliminerer behovet for sjekkpunkter, tillatelser, overvåking og gjenopprettingslogikk.

CursorBench og Humanity's Last Exam: mindre gevinster

Fable 5.1 når 73.4% på CursorBench 3.2.0, bare 2.9 poeng over Fable 5. På Humanity's Last Exam øker den 3.1 poeng uten verktøy og 1.2 poeng med verktøy.

Disse smalere gapene støtter hovedtolkningen: Fable 5.1 er mer transformativ på lange arbeidsflyter som involverer planlegging, utførelse, verifisering og gjenoppretting enn på kortere IDE-oppgaver eller lukket akademisk resonnering.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Kort svar: Fable 5.1 er det sterkeste alternativet i Anthropics publiserte langhorisont-benchmarktabell; Opus 5 er et mer økonomisk utgangspunkt når ytelsesgapet er akseptabelt; Fable 5 forblir den eldre baselinen; GPT-6 Astra krever en test i samme harness før enhver direkte rangering.

Fable 5.1 er et tydelig generasjonelt løft over Fable 5 på Anthropics rapporterte langhorisont-agentbenchmarker. GPT-6 Astra er den mer aktuelle OpenAI-sammenligningen, men den ble lansert etter Anthropics evaluering 1. september og var ikke inkludert i samme benchmark-harness.

DimensjonClaude Fable 5.1Claude Fable 5GPT-6 Astra
Kontekstvindu1M tokens1M tokens1.05M tokens
Maksimalt utdata128K128K128K
Standard inn/ut$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Cache-lesing$0.25 / MTok$1 / MTokBekreft gjeldende leverandørvilkår
Terminal-Bench-Science 0.152.6%24.7%Ikke inkludert i Anthropics lanseringstabell
Terminal-Bench 4.055.8%42.0%Ikke inkludert i Anthropics lanseringstabell
AutomationBench31.4%17.1%Ikke inkludert i Anthropics lanseringstabell
Primær posisjoneringKrevende resonnering og langhorisont-agenterTidligere Fable-baselineVanskelig ende-til-ende profesjonelt arbeid

Sammenlignet med Fable 5 viser Fable 5.1 sine største målte gevinster i vitenskapelig forskning, forretningsautomatisering og terminalkoding, samtidig som den beholder de samme standard token-prisene. Lavere pris for cache-lesing forbedrer ytterligere økonomien i agenter med gjentatt kontekst.

Valgregel: Start med Opus 5 når kostnad er prioritet, gå opp til Fable 5.1 når langsiktig fullføring og gjenoppretting er viktigst, behold Fable 5 kun for kompatibilitetsfølsomme arbeidslaster, og evaluer GPT-6 Astra i en kontrollert test med samme harness før produksjonsadopsjon.

Hvordan ser benchmark-ytelsen ut etter arbeidslast?

KapabilitetFable 5.1-resultatEndring vs Fable 5Tolkning
Agentisk vitenskapelig forskning52.6%+27.9 pSvært stor gevinst
Forretningsautomatisering31.4%+14.3 pSvært stor gevinst
Terminalkoding55.8%+13.8 pStor gevinst
Databruk, strict41.7%+5.6 pModerat gevinst
Databruk, partial77.9%+5.0 pModerat gevinst
Ekspertresonnering, uten verktøy60.9%+3.1 pLiten gevinst
IDE agentisk koding73.4%+2.9 pLiten gevinst
Ekspertresonnering, med verktøy65.0%+1.2 pLiten gevinst
Profesjonelt kunnskapsarbeid1853 Elo+130 EloSterk, konfigurasjonsfølsom

Mønsteret er konsistent: de største forbedringene vises når suksess avhenger av utholdenhet, planlegging, miljøinteraksjon, verktøybruk og gjenoppretting over tid.

Hva forteller ikke benchmarkene deg?

Benchmark-tabeller komprimerer atferd til enkelttall. De beviser ikke at autonome agenter er løst, og de predikerer ikke alle produksjonsarbeidslaster.

  • Hovedsammenligningstabellen er leverandørkjørt.
  • Innsatsinnstillinger påvirker kvalitet, latens og kostnad.
  • Agent-benchmarker måler den kombinerte effekten av modell, harness, verktøy og tillatelser.
  • Produksjonsbeskyttelser var aktivert for Fable 5.1 og påvirket noen resultater.
  • Benchmark-versjoner endres, så verdier fra ulike oppgaveutgivelser er ikke nødvendigvis sammenlignbare.
  • AutomationBench er fortsatt på 31.4%, mens OSWorld strict fullføring er 41.7%; betydelige feilrater består.

En praktisk evaluering bør bruke offentlige scorer for å kortliste kandidater, reprodusere en liten sammenligning med identiske innstillinger, og deretter teste den faktiske produksjonsarbeidsflyten.

Er Claude Fable 5.1 den beste Claude-modellen?

For maksimal kapasitet på vanskelig, langvarig arbeid gir benchmark-bevisene en sterk sak for Claude Fable 5.1. For enhver arbeidslast, nei.

Anthropic priser den til $10 per million inn-tokens og $50 per million ut-tokens, mot $5 og $25 for Opus 5. Prispremien er bare berettiget når Fable 5.1 gir høyere suksessrate, færre nye forsøk, færre tokens per akseptert oppgave, eller nok reduksjon i tid brukt på menneskelig gjennomgang.

Lavere pris for cache-lesing kan redusere det effektive kostnadsgapet for agenter. Kostnad per akseptert resultat er derfor mer nyttig enn pris per token alene.

Hvordan bør du benchmarke Claude Fable 5.1?

Evalueringen din bør ligne den tiltenkte produksjonsarbeidslasten.

  • Koding: Test komplette issues og registrer patch-aksept, beståtte tester, nye forsøk, verktøykall, medgått tid og menneskelig korreksjonstid.
  • Forskning: Evaluer kildekvalitet, faktanøyaktighet, dekning av bevis, deloppgavefullføring og målretensjon over lange kjøringer.
  • Forretningsagenter: Poengsett sluttstatus i miljøet i stedet for å telle enkeltstående riktige handlinger.
  • Databruk: Mål gjenoppretting fra pop‑ups, trege sider, avbrutte økter og inkonsistent applikasjonstilstand.
  • Modell­sammenligning: Hold forespørsler, harness, verktøy, tillatelser, innsatsinnstillinger og scoringsregler konstante.
  • Økonomi: Mål kostnad per akseptert oppgave, ikke bare kostnad per token.

Konklusjon

Benchmark-bevisene antyder at Fable 5.1 er mest verdifull når en oppgave krever vedvarende utførelse snarere enn ett enkelt svar. De sterkeste brukstilfellene inkluderer vitenskapelig forskning, autonom koding, kompleks forretningsautomatisering og arbeidsflyter med gjentatt verifisering og gjenoppretting.

Bevisene støtter ikke universell overlegenhet. Mindre gap på flere benchmarker, meningsfulle feilrater på strenge databruksoppgaver, og fraværet av GPT-6 Astra fra Anthropics lanseringstabell forsterker behovet for arbeidslastspesifikk testing.

For CometAPI-brukere er en praktisk distribusjonsregel å teste Fable 5.1 der langsiktig suksess kan rettferdiggjøre premium inferens, og så sammenligne den med Opus 5, GPT-5.6 Sol og GPT-6 Astra på de samme representative oppgavene før man velger en produksjonsvei.

Vanlige spørsmål

Hva er den høyeste benchmark-scoren til Claude Fable 5.1?

Blant Anthropics rapporterte prosentmålinger når Fable 5.1 77.9% partial credit på OSWorld 2.0 og 73.4% på CursorBench 3.2.0. Den største generasjonsforbedringen er Terminal-Bench-Science, på 52.6% mot 24.7% for Fable 5.

Hvor mye bedre er Claude Fable 5.1 enn Fable 5?

Gevinsten varierer kraftig etter arbeidslast: 27.9 poeng på Terminal-Bench-Science, 14.3 på AutomationBench og 13.8 på Terminal-Bench 4.0, men bare 2.9 på CursorBench og 1.2 på verktøyassistert Humanity’s Last Exam.

Er Claude Fable 5.1 bedre enn Claude Opus 5?

Den scorer høyere på tvers av Anthropics rapporterte tabell, men mange gap er små. Anthropic anbefaler å starte med Opus 5 og eskalere når ytterligere langhorisont-kapasitet er nødvendig.

Slår Claude Fable 5.1 GPT-5.6 Sol?

Anthropic rapporterer høyere Fable 5.1-scorer på fem delte målinger. Fordi dette er leverandørkjørte konkurrentevalueringer og konfigurasjoner varierer, er den sikre konklusjonen at Fable 5.1 er svært konkurransedyktig heller enn universelt overlegen.

Er resultatene uavhengig verifisert?

Bare delvis. Flere benchmarker har offentlige topplister, men innsats, harness, fallback-oppførsel og oppgaveversjoner må samsvare før verdiene kan sammenlignes direkte med Anthropics lanseringskjøring.

Hva er Claude Fable 5.1 best til?

Benchmark-profilen er sterkest for langvarig vitenskapelig forskning, autonom koding, komplekse agent-arbeidsflyter, forretningsautomatisering og oppgaver som krever planlegging, verktøy, verifisering og gjenoppretting.

Hvordan får jeg tilgang til Claude Fable 5.1?

Claude Fable 5.1 er oppført på CometAPI med modell-ID claude-fable-5-1. Et samlet endepunkt gjør det praktisk å kjøre samme evalueringsarbeidslast på tvers av flere modeller før man velger en produksjonsvei.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Sep 17, 2026
Sist oppdatert Sep 17, 2026
21 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer