TLDR Claude Fable 5.1 er primært en opgradering af agentbaseret udførelse. Dets største rapporterede gevinster ses i videnskabelig forskning, forretningsautomatisering, terminalkodning og andre arbejdsforløb, der kræver planlægning, værktøjsbrug, verifikation og genopretning på tværs af mange trin. Forbedringerne er mindre på lukkede ræsonnementsopgaver og kortere IDE-lignende kodningsopgaver, så den bedste implementeringsbeslutning afhænger af arbejdsbelastningen frem for en enkelt toplinje-score.
Nøglepointer
- Fable 5.1 scorer 52.6% på Terminal-Bench-Science 0.1, mere end dobbelt så meget som Fable 5’s 24.7% i Anthropics evaluering.
- AutomationBench stiger fra 17.1% til 31.4%, hvilket viser en stor forbedring i end-to-end forretningsarbejdsprocesser.
- Gevinsterne er mere beskedne på CursorBench og værktøjsassisteret Humanity’s Last Exam, hvilket antyder, at udgivelsen forbedrer vedvarende udførelse mere end alle former for ræsonnement lige meget.
- Fable 5.1 bevarer de samme standard token-priser som Fable 5, mens lavere cache-read-priser kan reducere den effektive omkostning for kontekttunge agentarbejdsforløb.
- GPT-6 Astra er nu den mere aktuelle OpenAI-sammenligning, men den var ikke inkluderet i Anthropics benchmarktabel fra 1. september. Enhver direkte præstationspåstand kræver en kontrolleret evaluering i samme harness.
Anthropic udgav Claude Fable 5.1 den 1. september 2026 til krævende ræsonnement, langvarige agenter, software engineering, forskning og professionelt vidensarbejde. Claude Fable 5.1 er også tilgængelig via CometAPI for udviklere, der vil evaluere den sammen med andre frontmodeller gennem et samlet endpoint.
Topresultaterne er stærke, men fordelingen af forbedringer er mere informativ end gennemsnittet. Fable 5.1 vinder mest, når en agent skal bevare et mål, interagere med værktøjer, genoprette fra fejl og verificere en sluttilstand. Denne artikel fokuserer på, hvad benchmarkresultaterne betyder, hvor modellen stadig halter, og hvordan man evaluerer den mod nyere alternativer.
Claude Fable 5.1 i korte træk
Anthropics modeldokumentation angiver et kontekstvindue på 1 million tokens, 128K maksimalt output, tekst- og billedinput, altid aktiveret adaptiv tænkning og en vidensafskæring i juni 2026. Claude API model-ID er claude-fable-5-1.
| Officiel specifikation | Claude Fable 5.1 |
|---|---|
| Udbyder | Anthropic |
| Udgivelsesdato | September 1, 2026 |
| Model-ID | claude-fable-5-1 |
| Kontekstvindue | 1,000,000 tokens |
| Maksimalt output | 128,000 tokens |
| Input / output | Tekst og billeder → tekst |
| Tænkning | Adaptiv, altid aktiveret |
| Standardindsats | Høj |
| Vidensafskæring | June 2026 |
| Anthropic inputpris | $10 / MTok |
| Anthropic outputpris | $50 / MTok |
| Cache read | $0.25 / MTok |
| Komparativ latens | Langsommere |
| Primær positionering | Krævende ræsonnement og langvarigt agentarbejde |
Standard input- og outputpriser forbliver de samme som for Fable 5, mens cache reads faldt til $0.25 per million tokens. Fable 5.1 har ikke lavere toplinje input/output token-priser. Dets lavere effektive omkostning kommer primært fra en 75% reduktion i cache-read-priser. Anthropic anslår omkring 25% lavere omkostninger for typiske arbejdsbelastninger og op til cirka 45% for stærkt agentbaserede arbejdsforløb.
Det betyder noget, fordi en langvarig agent gentagne gange genbruger repository-kontekst, instruktioner, værktøjsdefinitioner og tidligere tilstand. Omkostning per fuldført opgave kan forbedres, selv når toplinje input- og outputpriser ikke ændrer sig.
Anthropic rapporterer også 60.9% for Claude Mythos 5.1 på Terminal-Bench 4.0. Mythos 5.1 er en separat udrullet version med andre sikkerhedsforanstaltninger og bør ikke behandles som den generelt tilgængelige Fable 5.1-score.
Hvad viser Claude Fable 5.1-benchmarks?
Følgende værdier kommer fra Anthropics evaluering fra september 2026. De beskriver en model- og harness-konfiguration, ikke en uforanderlig egenskab ved modellen.
| Benchmark | Hvad det måler | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Agentbaseret videnskabelig forskning | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Agentbaseret terminalkodning | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Professionelt vidensarbejde, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Computerbrug med lang horisont | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | Fuldt gennemførte computeropgaver | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | Ekspert, tværfagligt ræsonnement | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | Ekspert, ræsonnement med værktøjer | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | End-to-end forretningsarbejdsforløb | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Agentbaseret IDE-kodning | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 fører Fable 5 og Opus 5 på alle ni rapporterede rækker. Dets største generationsgevinster forekommer i videnskabelig forskning, forretningsworkflow-automatisering og terminalkodning. De mindre forskelle på Humanity’s Last Exam og CursorBench er lige så vigtige, fordi de viser, at forbedringen ikke er ensartet på tværs af alle arbejdsbelastninger.
Hvor forbedrer Claude Fable 5.1 sig mest?
Terminal-Bench-Science 0.1: det mest iøjnefaldende resultat
Fable 5.1 scorer 52.6%, sammenlignet med 24.7% for Claude Fable 5, 29.0% for Claude Opus 5 og 22.4% for GPT-5.6 Sol i Anthropics kørsel. Den store generationsforskel på 27.9 point er meget større end den rapporterede standardfejl per model, mens mindre forskelle—såsom de 3.5 point mellem Fable 5.1 og Opus 5 på Terminal-Bench 4.0—bør fortolkes mere forsigtigt.
Terminal-Bench-Science evaluerer komplette forskningsarbejdsforløb på tværs af videnskabelige og tekniske domæner. Agenter skal producere kode, analyser, beviser, simulationer eller dataprodukter frem for blot at besvare isolerede spørgsmål. Anthropic rapporterer en standardfejl på cirka ±3.5–4.5 point per model, så små forskelle bør ikke automatisk fortolkes som meningsfulde kapabilitetsforskelle.
Terminal-Bench 4.0: stærkere autonom kodning
Fable 5.1 når 55.8%, foran Fable 5 på 42.0%, Opus 5 på 52.3% og GPT-5.6 Sol på 37.3%. Forbedringen på 13.8 point over Fable 5 er betydelig, mens føringen på 3.5 point over Opus 5 er forholdsvis snæver.
Benchmarken placerer agenter i et eksekveringsmiljø, så succes afhænger af at navigere i miljøet, ændre kode og validere resultater. Fordi Terminal-Bench 4.0 bruger et andet opgavesæt end tidligere udgaver, bør scores kun sammenlignes inden for samme benchmarkversion.
AutomationBench: stor gevinst med betydelig plads til forbedring
AutomationBench stiger fra 17.1% på Fable 5 til 31.4% på Fable 5.1. Det er en absolut stigning på 14.3 point eller cirka 84% relativt.
Benchmarken evaluerer arbejdsforløb på tværs af salg, marketing, drift, support, finans og HR ved at kontrollere den endelige miljøtilstand. Det gør den til en nyttig test af, om en agent faktisk gennemførte et workflow frem for blot at foreslå de korrekte handlinger. Scoren afslører også den tilbageværende begrænsning: omtrent to tredjedele af opgaverne blev stadig ikke gennemført under Anthropics rapporterede konfiguration.
CursorBench 3.2.0: en mindre kodningsgevinst
Fable 5.1 når 73.4%, mod 70.5% for Fable 5, 70.0% for Opus 5 og 67.2% for GPT-5.6 Sol. Gevinsten over Fable 5 er kun 2.9 point.
Udgivelsen virker derfor mindre transformerende på kortere IDE-lignende kodningsopgaver end på længere arbejdsforløb, der involverer planlægning, udførelse, verifikation og genopretning. Evaluationssuiter bør inkludere ændringer på repository-niveau og recovery fra fejlslagne tests i stedet for kun kodegenereringskvalitet.
OSWorld 2.0: computerbrug forbliver vanskelig
Fable 5.1 scorer 77.9% med delvis kredit og 41.7% under striks gennemførsel. Opus 5 når 75.4% og 39.6%, mens Fable 5 når 72.9% og 36.1%.
Den strikse score er det mere afslørende signal i produktion. Færre end halvdelen af opgaverne blev fuldt gennemført, hvilket viser, at fremskridt i computerbrug ikke eliminerer behovet for checkpoints, tilladelser, monitorering og genopretningslogik.
CursorBench og Humanity’s Last Exam: mindre gevinster
Fable 5.1 når 73.4% på CursorBench 3.2.0, kun 2.9 point over Fable 5. På Humanity’s Last Exam vinder den 3.1 point uden værktøjer og 1.2 point med værktøjer.
Disse snævrere forskelle understøtter den centrale tolkning: Fable 5.1 er mere transformerende på lange arbejdsforløb, der involverer planlægning, udførelse, verifikation og genopretning, end på kortere IDE-opgaver eller lukkede akademiske ræsonnementsopgaver.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Kort svar: Fable 5.1 er den stærkeste mulighed i Anthropics publicerede long-horizon benchmarktabel; Opus 5 er det mere økonomiske udgangspunkt, når dets mindre præstationsgab er acceptabelt; Fable 5 forbliver det gamle baseline; GPT-6 Astra kræver en test i samme harness, før nogen direkte rangering.
Fable 5.1 er en klar generationsopgradering over Fable 5 på Anthropics rapporterede long-horizon agentbenchmarks. GPT-6 Astra er den mere aktuelle OpenAI-sammenligning, men den blev udgivet efter Anthropics evaluering den 1. september og var ikke inkluderet i samme benchmark-harness.
| Dimension | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Kontekstvindue | 1M tokens | 1M tokens | 1.05M tokens |
| Maksimalt output | 128K | 128K | 128K |
| Standard input / output | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Cache read | $0.25 / MTok | $1 / MTok | Verificer gældende udbydervilkår |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Ikke inkluderet i Anthropics lancetabel |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Ikke inkluderet i Anthropics lancetabel |
| AutomationBench | 31.4% | 17.1% | Ikke inkluderet i Anthropics lancetabel |
| Primær positionering | Krævende ræsonnement og langvarige agenter | Tidligere Fable-baseline | Svært end-to-end professionelt arbejde |
Mod Fable 5 viser Fable 5.1 sine største målte gevinster i videnskabelig forskning, forretningsautomatisering og terminalkodning, samtidig med at den bevarer de samme standard token-priser. Lavere cache-read-priser forbedrer yderligere økonomien i agentarbejde med gentagen kontekst.
Udvælgelsesregel: Start med Opus 5, når omkostninger har højeste prioritet, eskalér til Fable 5.1, når langvarig gennemførsel og genopretning er vigtigst, behold Fable 5 kun for kompatibilitetsfølsomme arbejdsbelastninger, og evaluer GPT-6 Astra i en kontrolleret test i samme harness før produktionsadoption.
Hvordan ser benchmarkydelsen ud efter arbejdsbelastning?
| Kapabilitet | Fable 5.1 resultat | Ændring vs Fable 5 | Fortolkning |
|---|---|---|---|
| Agentbaseret forskning | 52.6% | +27.9 pts | Meget stor gevinst |
| Forretningsworkflow-automation | 31.4% | +14.3 pts | Meget stor gevinst |
| Terminalkodning | 55.8% | +13.8 pts | Stor gevinst |
| Computerbrug, strict | 41.7% | +5.6 pts | Moderat gevinst |
| Computerbrug, partial | 77.9% | +5.0 pts | Moderat gevinst |
| Ekspert-ræsonnement, uden værktøjer | 60.9% | +3.1 pts | Lille gevinst |
| IDE agentbaseret kodning | 73.4% | +2.9 pts | Lille gevinst |
| Ekspert-ræsonnement, med værktøjer | 65.0% | +1.2 pts | Lille gevinst |
| Professionelt vidensarbejde | 1853 Elo | +130 Elo | Stærk, konfigurationsfølsom |
Mønstret er konsistent: de største forbedringer ses, når succes afhænger af vedholdenhed, planlægning, interaktion med miljøet, værktøjsbrug og genopretning over tid.
Hvad fortæller benchmarkene ikke?
Benchmarktabeller komprimerer adfærd til enkeltstående tal. De beviser ikke, at autonome agenter er løst, og de forudsiger ikke enhver produktionsarbejdsbelastning.
- Hovedsammenligningstabellen er vendor-kørt.
- Effort-indstillinger påvirker kvalitet, latens og omkostninger.
- Agentbenchmarks måler den kombinerede model, harness, værktøjer og tilladelser.
- Produktionssikkerhedsforanstaltninger var aktiveret for Fable 5.1 og påvirkede nogle resultater.
- Benchmarkversioner ændrer sig, så værdier fra forskellige opgaveudgaver er måske ikke sammenlignelige.
- AutomationBench er fortsat på 31.4%, mens OSWorld strict-gennemførsel er på 41.7%; der er fortsat betydelige fejlrater.
En praktisk evaluering bør bruge offentlige scores til at kortliste kandidater, reproducere en lille sammenligning med identiske indstillinger og derefter teste den faktiske produktionsarbejdsproces.
Er Claude Fable 5.1 den bedste Claude-model?
For maksimal kapabilitet på vanskeligt, langvarigt arbejde gør benchmarkbeviserne en stærk sag for Claude Fable 5.1. For enhver arbejdsbelastning, nej.
Anthropic prissætter den til $10 per million input tokens og $50 per million output tokens, versus $5 og $25 for Opus 5. Præmien er kun berettiget, når Fable 5.1 leverer en højere succesrate, færre retries, færre tokens per accepteret opgave eller tilstrækkelig reduktion i menneskelig gennemgangstid.
Lavere cache-read-priser kan indsnævre det effektive omkostningsgab for agenter. Omkostning per accepteret resultat er derfor mere nyttigt end pris per token alene.
Hvordan bør du benchmarke Claude Fable 5.1?
Din evaluering bør ligne den tiltænkte produktionsarbejdsbelastning.
- Coding: Test komplette issues og registrér patch-accept, beståede tests, retries, værktøjskald, forløbet tid og menneskelig rettetid.
- Research: Evaluer kildekvalitet, faktuel nøjagtighed, evidensdækning, delopgavegennemførsel og målopretholdelse over lange forløb.
- Business agents: Scor den endelige miljøtilstand i stedet for at tælle individuelt korrekte handlinger.
- Computerbrug: Mål genopretning fra pop-ups, langsomme sider, afbrudte sessioner og inkonsistente applikationstilstande.
- Model comparison: Hold prompts, harnesses, værktøjer, tilladelser, effort-indstillinger og scoringsregler konstante.
- Economics: Mål omkostning per accepteret opgave, ikke kun omkostning per token.
Konklusion
Benchmarkbeviserne tyder på, at Fable 5.1 er mest værdifuld, når en opgave kræver vedvarende udførelse frem for et enkelt svar. De stærkeste anvendelser omfatter videnskabelig forskning, autonom kodning, kompleks forretningsautomatisering og arbejdsforløb med gentagen verifikation og genopretning.
Beviserne understøtter ikke universel overlegenhed. Mindre forskelle på flere benchmarks, meningsfulde fejlrater på strikse computerbrugsopgaver og fraværet af GPT-6 Astra i Anthropics lancetabel understreger behovet for arbejdsbelastningsspecifik testning.
For CometAPI-brugere er en praktisk udrulningsregel at teste Fable 5.1, hvor langvarig succes kan retfærdiggøre premium inferens, og derefter sammenligne den med Opus 5, GPT-5.6 Sol og GPT-6 Astra på de samme repræsentative opgaver, før der vælges en produktionsvej.
Ofte stillede spørgsmål
Hvad er Claude Fable 5.1’s højeste benchmarkscore?
Blandt Anthropics rapporterede procentmålinger når Fable 5.1 77.9% delvis kredit på OSWorld 2.0 og 73.4% på CursorBench 3.2.0. Dets største generationsforbedring er Terminal-Bench-Science med 52.6% mod 24.7% for Fable 5.
Hvor meget bedre er Claude Fable 5.1 end Fable 5?
Gevinsten varierer markant efter arbejdsbelastning: 27.9 point på Terminal-Bench-Science, 14.3 på AutomationBench og 13.8 på Terminal-Bench 4.0, men kun 2.9 på CursorBench og 1.2 på værktøjsassisteret Humanity’s Last Exam.
Er Claude Fable 5.1 bedre end Claude Opus 5?
Den scorer højere på Anthropics rapporterede tabel, men mange forskelle er små. Anthropic anbefaler at starte med Opus 5 og eskalere, når yderligere long-horizon kapabilitet kræves.
Slår Claude Fable 5.1 GPT-5.6 Sol?
Anthropic rapporterer højere Fable 5.1-scores på fem fælles målinger. Fordi disse er vendor-kørte konkurrentevalueringer og konfigurationer varierer, er den sikre konklusion, at Fable 5.1 er meget konkurrencedygtig frem for universelt overlegen.
Er resultaterne uafhængigt verificeret?
Kun delvist. Flere benchmarks har offentlige leaderboards, men effort, harness, fallback-adfærd og opgaveversioner skal være aligned, før deres værdier kan sammenlignes direkte med Anthropics lancering.
Hvad er Claude Fable 5.1 bedst til?
Dens benchmarkprofil er stærkest for langvarig videnskabelig forskning, autonom kodning, komplekse agentarbejdsforløb, forretningsautomatisering og opgaver, der kræver planlægning, værktøjer, verifikation og genopretning.
Hvordan får jeg adgang til Claude Fable 5.1?
Claude Fable 5.1 er opført på CometAPI med model-ID claude-fable-5-1. Et samlet endpoint gør det praktisk at køre den samme evalueringsarbejdsbelastning på flere modeller, før der vælges en produktionsvej.
