GPT Image 2.5 Sunburst and Flare are now live on CometAPI โ†’
technology/Ricerca CometAPI

Benchmark di Claude Fable 5.1: cosa mi dicono i punteggi

Esplora i benchmark di Claude Fable 5.1, i principali miglioramenti, i limiti e i confronti con Fable 5, Opus 5, GPT-5.6 Sol e GPT-6 Astra.

CometAPI
Mia MarenTeam di ricerca su modelli AI e API
Aggiornato Sep 17, 2026 14 min di lettura
Benchmark di Claude Fable 5.1: cosa mi dicono i punteggi
Usa questo schema

Esegui la prima chiamata API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Claude Fable 5.1 รจ principalmente un aggiornamento incentrato sullโ€™esecuzione agentica. I maggiori progressi dichiarati compaiono nella ricerca scientifica, nellโ€™automazione aziendale, nel coding da terminale e in altri workflow che richiedono pianificazione, uso di strumenti, verifica e ripristino su molti passaggi. I miglioramenti sono piรน contenuti nel ragionamento a risposta chiusa e nei task di coding piรน brevi in stile IDE, quindi la scelta di deployment migliore dipende dal carico di lavoro invece che da un singolo punteggio di riferimento.

Punti chiave

  • Fable 5.1 ottiene il 52.6% su Terminal-Bench-Science 0.1, piรน del doppio del 24.7% di Fable 5 nella valutazione di Anthropic.
  • AutomationBench sale dal 17.1% al 31.4%, mostrando un grande miglioramento nei workflow aziendali end-to-end.
  • I guadagni sono piรน modesti su CursorBench e su Humanityโ€™s Last Exam con strumenti, suggerendo che il rilascio migliori lโ€™esecuzione sostenuta piรน che ogni forma di ragionamento in egual misura.
  • Fable 5.1 mantiene gli stessi prezzi standard per token di Fable 5, mentre un prezzo piรน basso per la lettura da cache puรฒ ridurre il costo effettivo dei workflow agentici con contesto pesante.
  • GPT-6 Astra รจ ora il confronto OpenAI piรน attuale, ma non รจ stato incluso nella tabella dei benchmark del 1ยฐ settembre di Anthropic. Qualsiasi affermazione di performance diretta richiede una valutazione controllata con lo stesso harness.

Anthropic ha rilasciato Claude Fable 5.1 il 1ยฐ settembre 2026 per ragionamento impegnativo, agenti di lungo orizzonte, ingegneria del software, ricerca e lavori professionali basati sulla conoscenza. Claude Fable 5.1 รจ disponibile anche tramite CometAPI per gli sviluppatori che vogliono valutarlo insieme ad altri modelli di frontiera attraverso un endpoint unificato.

I risultati di copertina sono solidi, ma la distribuzione del miglioramento รจ piรน informativa della media. Fable 5.1 guadagna soprattutto quando un agente deve mantenere un obiettivo, interagire con strumenti, recuperare dagli errori e verificare uno stato finale. Questo articolo si concentra sul significato dei risultati dei benchmark, su dove il modello รจ ancora carente e su come valutarlo rispetto alle alternative piรน recenti.

Claude Fable 5.1 a colpo dโ€™occhio

La documentazione del modello di Anthropic specifica una finestra di contesto da 1 milione di token, output massimo di 128K, input di testo e immagini, thinking adattivo sempre attivo e un limite di conoscenza a giugno 2026. Lโ€™ID modello della Claude API รจ claude-fable-5-1.

Specifica ufficialeClaude Fable 5.1
ProviderAnthropic
Data di rilascio1 settembre 2026
ID modelloclaude-fable-5-1
Finestra di contesto1,000,000 token
Output massimo128,000 token
Input / outputTesto e immagini โ†’ testo
ThinkingAdattivo, sempre attivo
Sforzo predefinitoAlto
Limite di conoscenzaGiugno 2026
Prezzo input Anthropic$10 / MTok
Prezzo output Anthropic$50 / MTok
Lettura da cache$0.25 / MTok
Latenza comparativaPiรน lenta
Posizionamento principaleRagionamento impegnativo e lavoro agentico lungo

I prezzi standard di input e output restano gli stessi di Fable 5, mentre le letture da cache scendono a $0.25 per milione di token. Fable 5.1 non ha prezzi di input/output piรน bassi nei titoli. Il suo costo effettivo piรน basso deriva principalmente da una riduzione del 75% del prezzo di lettura da cache. Anthropic stima circa il 25% di costo inferiore per i carichi tipici e fino a circa il 45% per carichi altamente agentici.

Questo conta perchรฉ un agente di lunga durata riutilizza ripetutamente il contesto del repository, le istruzioni, le definizioni degli strumenti e lo stato precedente. Il costo per task completato puรฒ migliorare anche quando i prezzi di input e output non cambiano.

Anthropic riporta anche il 60.9% per Claude Mythos 5.1 su Terminal-Bench 4.0. Mythos 5.1 รจ una versione distribuita separatamente con salvaguardie diverse e non dovrebbe essere trattata come il punteggio generalmente disponibile di Fable 5.1.

Cosa mostrano i benchmark di Claude Fable 5.1?

I valori seguenti provengono dalla valutazione di Anthropic di settembre 2026. Descrivono una configurazione modello+harness, non una proprietร  immutabile del modello.

BenchmarkCosa misuraFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1Ricerca scientifica agentica52.6%24.7%29.0%22.4%
Terminal-Bench 4.0Coding in terminale agentico55.8%42.0%52.3%37.3%
GDPval-AA v2Lavoro di conoscenza professionale, Elo1853172318241711
OSWorld 2.0, partialUso del computer di lungo orizzonte77.9%72.9%75.4%โ€”
OSWorld 2.0, strictAttivitร  al computer completate integralmente41.7%36.1%39.6%โ€”
Humanityโ€™s Last Exam, no toolsRagionamento multidisciplinare esperto60.9%57.8%56.6%โ€”
Humanityโ€™s Last Exam, with toolsRagionamento esperto con strumenti65.0%63.8%63.6%โ€”
AutomationBenchWorkflow aziendali end-to-end31.4%17.1%26.9%19.6%
CursorBench 3.2.0Coding IDE agentico73.4%70.5%70.0%67.2%

Fable 5.1 supera Fable 5 e Opus 5 in tutte le nove righe riportate. I suoi maggiori guadagni generazionali compaiono nella ricerca scientifica, nellโ€™automazione dei workflow aziendali e nel coding da terminale. Le differenze piรน piccole su Humanityโ€™s Last Exam e CursorBench sono altrettanto importanti perchรฉ mostrano che il miglioramento non รจ uniforme su ogni carico di lavoro.

Dove migliora di piรน Claude Fable 5.1?

Terminal-Bench-Science 0.1: il risultato di spicco

Fable 5.1 ottiene il 52.6%, rispetto al 24.7% di Claude Fable 5, al 29.0% di Claude Opus 5 e al 22.4% di GPT-5.6 Sol nella run di Anthropic. Il grande divario generazionale di 27.9 punti รจ molto piรน ampio dellโ€™errore standard per modello riportato, mentre gap piรน piccoliโ€”come i 3.5 punti tra Fable 5.1 e Opus 5 su Terminal-Bench 4.0โ€”andrebbero interpretati con maggiore cautela.

Terminal-Bench-Science valuta workflow di ricerca completi in domini scientifici e ingegneristici. Gli agenti devono produrre codice, analisi, dimostrazioni, simulazioni o prodotti di dati anzichรฉ limitarsi a rispondere a domande isolate. Anthropic riporta un errore standard di circa ยฑ3.5โ€“4.5 punti per modello, quindi gap ridotti non dovrebbero automaticamente essere interpretati come differenze significative di capacitร .

Terminal-Bench 4.0: coding autonomo piรน forte

Fable 5.1 raggiunge il 55.8%, davanti a Fable 5 al 42.0%, Opus 5 al 52.3% e GPT-5.6 Sol al 37.3%. Il miglioramento di 13.8 punti rispetto a Fable 5 รจ sostanziale, mentre il vantaggio di 3.5 punti su Opus 5 รจ relativamente contenuto.

Il benchmark colloca gli agenti in un ambiente di esecuzione, dunque il successo dipende dal saper navigare lโ€™ambiente, modificare il codice e validare gli esiti. Poichรฉ Terminal-Bench 4.0 usa un set di task diverso rispetto alle versioni precedenti, i punteggi dovrebbero essere confrontati solo allโ€™interno della stessa versione del benchmark.

AutomationBench: un grande salto con ampio margine

AutomationBench sale dal 17.1% su Fable 5 al 31.4% su Fable 5.1. Si tratta di un aumento assoluto di 14.3 punti, pari a circa un guadagno relativo dellโ€™84%.

Il benchmark valuta workflow in ambito vendite, marketing, operations, supporto, finanza e HR verificando lo stato finale dellโ€™ambiente. Questo lo rende un test utile per capire se un agente ha effettivamente completato un workflow invece di limitarsi a proporre le azioni corrette. Il punteggio evidenzia anche la limitazione restante: circa due terzi dei task non sono stati comunque completati nella configurazione riportata da Anthropic.

CursorBench 3.2.0: un guadagno di coding piรน contenuto

Fable 5.1 raggiunge il 73.4%, rispetto al 70.5% di Fable 5, al 70.0% di Opus 5 e al 67.2% di GPT-5.6 Sol. Il guadagno su Fable 5 รจ di soli 2.9 punti.

Il rilascio appare quindi meno trasformativo nei task di coding piรน brevi in stile IDE rispetto ai workflow piรน lunghi che prevedono pianificazione, esecuzione, verifica e ripristino. Le suite di valutazione dovrebbero includere modifiche a scala di repository e ripristino da test falliti invece di limitarsi alla qualitร  della generazione di codice.

OSWorld 2.0: lโ€™uso del computer resta difficile

Fable 5.1 ottiene il 77.9% con credito parziale e il 41.7% con completamento strict. Opus 5 raggiunge il 75.4% e il 39.6%, mentre Fable 5 raggiunge il 72.9% e il 36.1%.

Il punteggio strict รจ lโ€™indicatore piรน rivelatore per la produzione. Meno della metร  dei task รจ stata completata integralmente, a dimostrazione che i progressi nellโ€™uso del computer non eliminano la necessitร  di checkpoint, permessi, monitoraggio e logiche di ripristino.

CursorBench e Humanity's Last Exam: guadagni piรน piccoli

Fable 5.1 raggiunge il 73.4% su CursorBench 3.2.0, solo 2.9 punti sopra Fable 5. Su Humanity's Last Exam guadagna 3.1 punti senza strumenti e 1.2 punti con strumenti.

Questi gap piรน ridotti supportano lโ€™interpretazione centrale: Fable 5.1 รจ piรน trasformativo nei workflow lunghi che coinvolgono pianificazione, esecuzione, verifica e ripristino rispetto ai task IDE piรน brevi o al ragionamento accademico a risposta chiusa.

Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5

Risposta breve: Fable 5.1 รจ lโ€™opzione piรน forte nella tabella dei benchmark a lungo orizzonte pubblicata da Anthropic; Opus 5 รจ il punto di partenza piรน economico quando il suo divario prestazionale piรน piccolo รจ accettabile; Fable 5 resta la base legacy; GPT-6 Astra richiede un test nello stesso harness prima di qualsiasi classifica diretta.

Fable 5.1 รจ un chiaro upgrade generazionale rispetto a Fable 5 sui benchmark agentici di lungo orizzonte riportati da Anthropic. GPT-6 Astra รจ il confronto OpenAI piรน attuale, ma รจ stato rilasciato dopo la valutazione del 1ยฐ settembre di Anthropic e non รจ stato incluso nello stesso harness di benchmark.

DimensioneClaude Fable 5.1Claude Fable 5GPT-6 Astra
Finestra di contesto1M token1M token1.05M token
Output massimo128K128K128K
Input / output standard$10 / $50 per MTok$10 / $50 per MTok$10 / $50 per MTok
Lettura da cache$0.25 / MTok$1 / MTokVerificare i termini correnti del provider
Terminal-Bench-Science 0.152.6%24.7%Non incluso nella tabella di lancio di Anthropic
Terminal-Bench 4.055.8%42.0%Non incluso nella tabella di lancio di Anthropic
AutomationBench31.4%17.1%Non incluso nella tabella di lancio di Anthropic
Posizionamento principaleRagionamento impegnativo e lavoro agentico di lungo orizzontePrecedente baseline della classe FableLavoro professionale end-to-end difficile

Rispetto a Fable 5, Fable 5.1 mostra i suoi maggiori guadagni misurati nella ricerca scientifica, nellโ€™automazione aziendale e nel coding da terminale, mantenendo gli stessi prezzi standard per token. Un prezzo di lettura da cache piรน basso migliora ulteriormente lโ€™economia degli agenti con contesto riutilizzato.

Regola di selezione: Parti da Opus 5 quando il costo รจ la prioritร , passa a Fable 5.1 quando contano soprattutto completamento e ripristino su lungo orizzonte, mantieni Fable 5 solo per workload sensibili alla compatibilitร  e valuta GPT-6 Astra con un test controllato nello stesso harness prima dellโ€™adozione in produzione.

Come appare la performance nei benchmark per carico di lavoro?

Capacitร Risultato Fable 5.1Variazione vs Fable 5Interpretazione
Ricerca scientifica agentica52.6%+27.9 ptGuadagno molto grande
Automazione workflow aziendali31.4%+14.3 ptGuadagno molto grande
Coding da terminale55.8%+13.8 ptGrande guadagno
Uso del computer, strict41.7%+5.6 ptGuadagno moderato
Uso del computer, partial77.9%+5.0 ptGuadagno moderato
Ragionamento esperto, senza strumenti60.9%+3.1 ptGuadagno piccolo
Coding agentico in IDE73.4%+2.9 ptGuadagno piccolo
Ragionamento esperto, con strumenti65.0%+1.2 ptGuadagno piccolo
Lavoro di conoscenza professionale1853 Elo+130 EloForte, sensibile alla configurazione

Lo schema รจ coerente: i maggiori miglioramenti compaiono quando il successo dipende da persistenza, pianificazione, interazione con lโ€™ambiente, uso di strumenti e ripristino nel tempo.

Cosa non ti dicono i benchmark?

Le tabelle di benchmark comprimono il comportamento in numeri singoli. Non dimostrano che gli agenti autonomi siano risolti e non predicono ogni workload di produzione.

  • La tabella di confronto principale รจ gestita dal vendor.
  • Le impostazioni di sforzo influenzano qualitร , latenza e costo.
  • I benchmark per agenti misurano il combinato di modello, harness, strumenti e permessi.
  • Le salvaguardie di produzione erano abilitate per Fable 5.1 e hanno influenzato alcuni esiti.
  • Le versioni dei benchmark cambiano, quindi i valori di release diverse potrebbero non essere comparabili.
  • AutomationBench resta al 31.4%, mentre il completamento strict su OSWorld resta al 41.7%; rimangono tassi di fallimento sostanziali.

Una valutazione pratica dovrebbe usare i punteggi pubblici per creare una shortlist di candidati, riprodurre un piccolo confronto con impostazioni identiche e poi testare il workflow di produzione reale.

รˆ Claude Fable 5.1 il miglior modello Claude?

Per la massima capacitร  su lavori difficili e di lunga durata, le evidenze dei benchmark fanno una forte pressione a favore di Claude Fable 5.1. Per ogni carico di lavoro, no.

Anthropic lo prezza a $10 per milione di token in input e $50 per milione di token in output, contro $5 e $25 per Opus 5. Il premium รจ giustificato solo quando Fable 5.1 produce un tasso di successo piรน alto, meno retry, meno token per task accettato o una sufficiente riduzione del tempo di revisione umana.

Un prezzo piรน basso per le letture da cache puรฒ ridurre il divario di costo effettivo per gli agenti. Il costo per risultato accettato รจ quindi piรน utile del solo prezzo per token.

Come dovresti eseguire il benchmark di Claude Fable 5.1?

La tua valutazione dovrebbe assomigliare al workload di produzione previsto.

  • Coding: Testa issue complete e registra accettazione delle patch, test passati, retry, chiamate agli strumenti, tempo trascorso e tempo di correzione umana.
  • Ricerca: Valuta qualitร  delle fonti, accuratezza fattuale, copertura delle evidenze, completamento dei sotto-task e mantenimento dellโ€™obiettivo su run lunghe.
  • Agenti per il business: Valuta lo stato finale dellโ€™ambiente invece di contare azioni singole corrette.
  • Uso del computer: Misura il recupero da pop-up, pagine lente, sessioni interrotte e stati applicativi incoerenti.
  • Confronto modelli: Mantieni costanti prompt, harness, strumenti, permessi, impostazioni di sforzo e regole di scoring.
  • Economia: Misura il costo per task accettato, non solo il costo per token.

Conclusione

Le evidenze dei benchmark suggeriscono che Fable 5.1 รจ piรน prezioso quando un task richiede esecuzione sostenuta piuttosto che una singola risposta. I casi dโ€™uso piรน forti includono ricerca scientifica, coding autonomo, automazione aziendale complessa e workflow con verifiche e ripristini ripetuti.

Le evidenze non supportano una superioritร  universale. Gap piรน piccoli su diversi benchmark, tassi di fallimento significativi nei task strict di uso del computer e lโ€™assenza di GPT-6 Astra dalla tabella di lancio di Anthropic rafforzano la necessitร  di test specifici per workload.

Per gli utenti CometAPI, una regola pratica di deployment รจ testare Fable 5.1 laddove il successo su lungo orizzonte possa giustificare unโ€™inferenza premium, quindi confrontarlo con Opus 5, GPT-5.6 Sol e GPT-6 Astra sugli stessi task rappresentativi prima di scegliere un percorso di produzione.

FAQ

Qual รจ il punteggio di benchmark piรน alto di Claude Fable 5.1?

Tra le metriche percentuali riportate da Anthropic, Fable 5.1 raggiunge il 77.9% di credito parziale su OSWorld 2.0 e il 73.4% su CursorBench 3.2.0. Il suo miglioramento generazionale piรน grande รจ su Terminal-Bench-Science, con il 52.6% contro il 24.7% di Fable 5.

Quanto รจ migliore Claude Fable 5.1 rispetto a Fable 5?

Il guadagno varia nettamente per workload: 27.9 punti su Terminal-Bench-Science, 14.3 su AutomationBench e 13.8 su Terminal-Bench 4.0, ma solo 2.9 su CursorBench e 1.2 su Humanityโ€™s Last Exam con strumenti.

Claude Fable 5.1 รจ migliore di Claude Opus 5?

Ottiene punteggi piรน alti sullโ€™intera tabella riportata da Anthropic, ma molti gap sono piccoli. Anthropic raccomanda di partire da Opus 5 ed effettuare lโ€™upgrade quando serve capacitร  aggiuntiva di lungo orizzonte.

Claude Fable 5.1 batte GPT-5.6 Sol?

Anthropic riporta punteggi Fable 5.1 piรน alti su cinque metriche condivise. Poichรฉ si tratta di valutazioni del concorrente gestite dal vendor e le configurazioni variano, la conclusione prudente รจ che Fable 5.1 sia altamente competitivo piuttosto che universalmente superiore.

I risultati sono verificati in modo indipendente?

Solo parzialmente. Diversi benchmark hanno leaderboard pubbliche, ma sforzo, harness, comportamento di fallback e versioni dei task devono essere allineati prima di confrontare i valori direttamente con la run di lancio di Anthropic.

Per cosa รจ migliore Claude Fable 5.1?

Il suo profilo di benchmark รจ piรน forte per ricerca scientifica di lunga durata, coding autonomo, workflow agentici complessi, automazione aziendale e task che richiedono pianificazione, strumenti, verifica e ripristino.

Come posso accedere a Claude Fable 5.1?

Claude Fable 5.1 รจ elencato su CometAPI con ID modello claude-fable-5-1. Un endpoint unificato rende pratico eseguire lo stesso carico di valutazione su piรน modelli prima di scegliere un percorso di produzione.

Continua a imparare

Collega questo articolo alla prossima decisione.

Vedi tutti gli argomenti
Pubblicato il Sep 17, 2026
Ultimo aggiornamento Sep 17, 2026
0 visualizzazioni
Revisionato per chiarezza, attribuzione delle fonti e terminologia API aggiornata.

Pronto a ridurre i costi di sviluppo AI del 20%?

Inizia gratuitamente in pochi minuti. Crediti di prova gratuiti inclusi. Nessuna carta di credito richiesta.

Leggi di piรน