TL;DR Claude Fable 5.1 รจ principalmente un aggiornamento incentrato sullโesecuzione agentica. I maggiori progressi dichiarati compaiono nella ricerca scientifica, nellโautomazione aziendale, nel coding da terminale e in altri workflow che richiedono pianificazione, uso di strumenti, verifica e ripristino su molti passaggi. I miglioramenti sono piรน contenuti nel ragionamento a risposta chiusa e nei task di coding piรน brevi in stile IDE, quindi la scelta di deployment migliore dipende dal carico di lavoro invece che da un singolo punteggio di riferimento.
Punti chiave
- Fable 5.1 ottiene il 52.6% su Terminal-Bench-Science 0.1, piรน del doppio del 24.7% di Fable 5 nella valutazione di Anthropic.
- AutomationBench sale dal 17.1% al 31.4%, mostrando un grande miglioramento nei workflow aziendali end-to-end.
- I guadagni sono piรน modesti su CursorBench e su Humanityโs Last Exam con strumenti, suggerendo che il rilascio migliori lโesecuzione sostenuta piรน che ogni forma di ragionamento in egual misura.
- Fable 5.1 mantiene gli stessi prezzi standard per token di Fable 5, mentre un prezzo piรน basso per la lettura da cache puรฒ ridurre il costo effettivo dei workflow agentici con contesto pesante.
- GPT-6 Astra รจ ora il confronto OpenAI piรน attuale, ma non รจ stato incluso nella tabella dei benchmark del 1ยฐ settembre di Anthropic. Qualsiasi affermazione di performance diretta richiede una valutazione controllata con lo stesso harness.
Anthropic ha rilasciato Claude Fable 5.1 il 1ยฐ settembre 2026 per ragionamento impegnativo, agenti di lungo orizzonte, ingegneria del software, ricerca e lavori professionali basati sulla conoscenza. Claude Fable 5.1 รจ disponibile anche tramite CometAPI per gli sviluppatori che vogliono valutarlo insieme ad altri modelli di frontiera attraverso un endpoint unificato.
I risultati di copertina sono solidi, ma la distribuzione del miglioramento รจ piรน informativa della media. Fable 5.1 guadagna soprattutto quando un agente deve mantenere un obiettivo, interagire con strumenti, recuperare dagli errori e verificare uno stato finale. Questo articolo si concentra sul significato dei risultati dei benchmark, su dove il modello รจ ancora carente e su come valutarlo rispetto alle alternative piรน recenti.
Claude Fable 5.1 a colpo dโocchio
La documentazione del modello di Anthropic specifica una finestra di contesto da 1 milione di token, output massimo di 128K, input di testo e immagini, thinking adattivo sempre attivo e un limite di conoscenza a giugno 2026. LโID modello della Claude API รจ claude-fable-5-1.
| Specifica ufficiale | Claude Fable 5.1 |
|---|---|
| Provider | Anthropic |
| Data di rilascio | 1 settembre 2026 |
| ID modello | claude-fable-5-1 |
| Finestra di contesto | 1,000,000 token |
| Output massimo | 128,000 token |
| Input / output | Testo e immagini โ testo |
| Thinking | Adattivo, sempre attivo |
| Sforzo predefinito | Alto |
| Limite di conoscenza | Giugno 2026 |
| Prezzo input Anthropic | $10 / MTok |
| Prezzo output Anthropic | $50 / MTok |
| Lettura da cache | $0.25 / MTok |
| Latenza comparativa | Piรน lenta |
| Posizionamento principale | Ragionamento impegnativo e lavoro agentico lungo |
I prezzi standard di input e output restano gli stessi di Fable 5, mentre le letture da cache scendono a $0.25 per milione di token. Fable 5.1 non ha prezzi di input/output piรน bassi nei titoli. Il suo costo effettivo piรน basso deriva principalmente da una riduzione del 75% del prezzo di lettura da cache. Anthropic stima circa il 25% di costo inferiore per i carichi tipici e fino a circa il 45% per carichi altamente agentici.
Questo conta perchรฉ un agente di lunga durata riutilizza ripetutamente il contesto del repository, le istruzioni, le definizioni degli strumenti e lo stato precedente. Il costo per task completato puรฒ migliorare anche quando i prezzi di input e output non cambiano.
Anthropic riporta anche il 60.9% per Claude Mythos 5.1 su Terminal-Bench 4.0. Mythos 5.1 รจ una versione distribuita separatamente con salvaguardie diverse e non dovrebbe essere trattata come il punteggio generalmente disponibile di Fable 5.1.
Cosa mostrano i benchmark di Claude Fable 5.1?
I valori seguenti provengono dalla valutazione di Anthropic di settembre 2026. Descrivono una configurazione modello+harness, non una proprietร immutabile del modello.
| Benchmark | Cosa misura | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Ricerca scientifica agentica | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | Coding in terminale agentico | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | Lavoro di conoscenza professionale, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | Uso del computer di lungo orizzonte | 77.9% | 72.9% | 75.4% | โ |
| OSWorld 2.0, strict | Attivitร al computer completate integralmente | 41.7% | 36.1% | 39.6% | โ |
| Humanityโs Last Exam, no tools | Ragionamento multidisciplinare esperto | 60.9% | 57.8% | 56.6% | โ |
| Humanityโs Last Exam, with tools | Ragionamento esperto con strumenti | 65.0% | 63.8% | 63.6% | โ |
| AutomationBench | Workflow aziendali end-to-end | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | Coding IDE agentico | 73.4% | 70.5% | 70.0% | 67.2% |
Fable 5.1 supera Fable 5 e Opus 5 in tutte le nove righe riportate. I suoi maggiori guadagni generazionali compaiono nella ricerca scientifica, nellโautomazione dei workflow aziendali e nel coding da terminale. Le differenze piรน piccole su Humanityโs Last Exam e CursorBench sono altrettanto importanti perchรฉ mostrano che il miglioramento non รจ uniforme su ogni carico di lavoro.
Dove migliora di piรน Claude Fable 5.1?
Terminal-Bench-Science 0.1: il risultato di spicco
Fable 5.1 ottiene il 52.6%, rispetto al 24.7% di Claude Fable 5, al 29.0% di Claude Opus 5 e al 22.4% di GPT-5.6 Sol nella run di Anthropic. Il grande divario generazionale di 27.9 punti รจ molto piรน ampio dellโerrore standard per modello riportato, mentre gap piรน piccoliโcome i 3.5 punti tra Fable 5.1 e Opus 5 su Terminal-Bench 4.0โandrebbero interpretati con maggiore cautela.
Terminal-Bench-Science valuta workflow di ricerca completi in domini scientifici e ingegneristici. Gli agenti devono produrre codice, analisi, dimostrazioni, simulazioni o prodotti di dati anzichรฉ limitarsi a rispondere a domande isolate. Anthropic riporta un errore standard di circa ยฑ3.5โ4.5 punti per modello, quindi gap ridotti non dovrebbero automaticamente essere interpretati come differenze significative di capacitร .
Terminal-Bench 4.0: coding autonomo piรน forte
Fable 5.1 raggiunge il 55.8%, davanti a Fable 5 al 42.0%, Opus 5 al 52.3% e GPT-5.6 Sol al 37.3%. Il miglioramento di 13.8 punti rispetto a Fable 5 รจ sostanziale, mentre il vantaggio di 3.5 punti su Opus 5 รจ relativamente contenuto.
Il benchmark colloca gli agenti in un ambiente di esecuzione, dunque il successo dipende dal saper navigare lโambiente, modificare il codice e validare gli esiti. Poichรฉ Terminal-Bench 4.0 usa un set di task diverso rispetto alle versioni precedenti, i punteggi dovrebbero essere confrontati solo allโinterno della stessa versione del benchmark.
AutomationBench: un grande salto con ampio margine
AutomationBench sale dal 17.1% su Fable 5 al 31.4% su Fable 5.1. Si tratta di un aumento assoluto di 14.3 punti, pari a circa un guadagno relativo dellโ84%.
Il benchmark valuta workflow in ambito vendite, marketing, operations, supporto, finanza e HR verificando lo stato finale dellโambiente. Questo lo rende un test utile per capire se un agente ha effettivamente completato un workflow invece di limitarsi a proporre le azioni corrette. Il punteggio evidenzia anche la limitazione restante: circa due terzi dei task non sono stati comunque completati nella configurazione riportata da Anthropic.
CursorBench 3.2.0: un guadagno di coding piรน contenuto
Fable 5.1 raggiunge il 73.4%, rispetto al 70.5% di Fable 5, al 70.0% di Opus 5 e al 67.2% di GPT-5.6 Sol. Il guadagno su Fable 5 รจ di soli 2.9 punti.
Il rilascio appare quindi meno trasformativo nei task di coding piรน brevi in stile IDE rispetto ai workflow piรน lunghi che prevedono pianificazione, esecuzione, verifica e ripristino. Le suite di valutazione dovrebbero includere modifiche a scala di repository e ripristino da test falliti invece di limitarsi alla qualitร della generazione di codice.
OSWorld 2.0: lโuso del computer resta difficile
Fable 5.1 ottiene il 77.9% con credito parziale e il 41.7% con completamento strict. Opus 5 raggiunge il 75.4% e il 39.6%, mentre Fable 5 raggiunge il 72.9% e il 36.1%.
Il punteggio strict รจ lโindicatore piรน rivelatore per la produzione. Meno della metร dei task รจ stata completata integralmente, a dimostrazione che i progressi nellโuso del computer non eliminano la necessitร di checkpoint, permessi, monitoraggio e logiche di ripristino.
CursorBench e Humanity's Last Exam: guadagni piรน piccoli
Fable 5.1 raggiunge il 73.4% su CursorBench 3.2.0, solo 2.9 punti sopra Fable 5. Su Humanity's Last Exam guadagna 3.1 punti senza strumenti e 1.2 punti con strumenti.
Questi gap piรน ridotti supportano lโinterpretazione centrale: Fable 5.1 รจ piรน trasformativo nei workflow lunghi che coinvolgono pianificazione, esecuzione, verifica e ripristino rispetto ai task IDE piรน brevi o al ragionamento accademico a risposta chiusa.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Risposta breve: Fable 5.1 รจ lโopzione piรน forte nella tabella dei benchmark a lungo orizzonte pubblicata da Anthropic; Opus 5 รจ il punto di partenza piรน economico quando il suo divario prestazionale piรน piccolo รจ accettabile; Fable 5 resta la base legacy; GPT-6 Astra richiede un test nello stesso harness prima di qualsiasi classifica diretta.
Fable 5.1 รจ un chiaro upgrade generazionale rispetto a Fable 5 sui benchmark agentici di lungo orizzonte riportati da Anthropic. GPT-6 Astra รจ il confronto OpenAI piรน attuale, ma รจ stato rilasciato dopo la valutazione del 1ยฐ settembre di Anthropic e non รจ stato incluso nello stesso harness di benchmark.
| Dimensione | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Finestra di contesto | 1M token | 1M token | 1.05M token |
| Output massimo | 128K | 128K | 128K |
| Input / output standard | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| Lettura da cache | $0.25 / MTok | $1 / MTok | Verificare i termini correnti del provider |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | Non incluso nella tabella di lancio di Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | Non incluso nella tabella di lancio di Anthropic |
| AutomationBench | 31.4% | 17.1% | Non incluso nella tabella di lancio di Anthropic |
| Posizionamento principale | Ragionamento impegnativo e lavoro agentico di lungo orizzonte | Precedente baseline della classe Fable | Lavoro professionale end-to-end difficile |
Rispetto a Fable 5, Fable 5.1 mostra i suoi maggiori guadagni misurati nella ricerca scientifica, nellโautomazione aziendale e nel coding da terminale, mantenendo gli stessi prezzi standard per token. Un prezzo di lettura da cache piรน basso migliora ulteriormente lโeconomia degli agenti con contesto riutilizzato.
Regola di selezione: Parti da Opus 5 quando il costo รจ la prioritร , passa a Fable 5.1 quando contano soprattutto completamento e ripristino su lungo orizzonte, mantieni Fable 5 solo per workload sensibili alla compatibilitร e valuta GPT-6 Astra con un test controllato nello stesso harness prima dellโadozione in produzione.
Come appare la performance nei benchmark per carico di lavoro?
| Capacitร | Risultato Fable 5.1 | Variazione vs Fable 5 | Interpretazione |
|---|---|---|---|
| Ricerca scientifica agentica | 52.6% | +27.9 pt | Guadagno molto grande |
| Automazione workflow aziendali | 31.4% | +14.3 pt | Guadagno molto grande |
| Coding da terminale | 55.8% | +13.8 pt | Grande guadagno |
| Uso del computer, strict | 41.7% | +5.6 pt | Guadagno moderato |
| Uso del computer, partial | 77.9% | +5.0 pt | Guadagno moderato |
| Ragionamento esperto, senza strumenti | 60.9% | +3.1 pt | Guadagno piccolo |
| Coding agentico in IDE | 73.4% | +2.9 pt | Guadagno piccolo |
| Ragionamento esperto, con strumenti | 65.0% | +1.2 pt | Guadagno piccolo |
| Lavoro di conoscenza professionale | 1853 Elo | +130 Elo | Forte, sensibile alla configurazione |
Lo schema รจ coerente: i maggiori miglioramenti compaiono quando il successo dipende da persistenza, pianificazione, interazione con lโambiente, uso di strumenti e ripristino nel tempo.
Cosa non ti dicono i benchmark?
Le tabelle di benchmark comprimono il comportamento in numeri singoli. Non dimostrano che gli agenti autonomi siano risolti e non predicono ogni workload di produzione.
- La tabella di confronto principale รจ gestita dal vendor.
- Le impostazioni di sforzo influenzano qualitร , latenza e costo.
- I benchmark per agenti misurano il combinato di modello, harness, strumenti e permessi.
- Le salvaguardie di produzione erano abilitate per Fable 5.1 e hanno influenzato alcuni esiti.
- Le versioni dei benchmark cambiano, quindi i valori di release diverse potrebbero non essere comparabili.
- AutomationBench resta al 31.4%, mentre il completamento strict su OSWorld resta al 41.7%; rimangono tassi di fallimento sostanziali.
Una valutazione pratica dovrebbe usare i punteggi pubblici per creare una shortlist di candidati, riprodurre un piccolo confronto con impostazioni identiche e poi testare il workflow di produzione reale.
ร Claude Fable 5.1 il miglior modello Claude?
Per la massima capacitร su lavori difficili e di lunga durata, le evidenze dei benchmark fanno una forte pressione a favore di Claude Fable 5.1. Per ogni carico di lavoro, no.
Anthropic lo prezza a $10 per milione di token in input e $50 per milione di token in output, contro $5 e $25 per Opus 5. Il premium รจ giustificato solo quando Fable 5.1 produce un tasso di successo piรน alto, meno retry, meno token per task accettato o una sufficiente riduzione del tempo di revisione umana.
Un prezzo piรน basso per le letture da cache puรฒ ridurre il divario di costo effettivo per gli agenti. Il costo per risultato accettato รจ quindi piรน utile del solo prezzo per token.
Come dovresti eseguire il benchmark di Claude Fable 5.1?
La tua valutazione dovrebbe assomigliare al workload di produzione previsto.
- Coding: Testa issue complete e registra accettazione delle patch, test passati, retry, chiamate agli strumenti, tempo trascorso e tempo di correzione umana.
- Ricerca: Valuta qualitร delle fonti, accuratezza fattuale, copertura delle evidenze, completamento dei sotto-task e mantenimento dellโobiettivo su run lunghe.
- Agenti per il business: Valuta lo stato finale dellโambiente invece di contare azioni singole corrette.
- Uso del computer: Misura il recupero da pop-up, pagine lente, sessioni interrotte e stati applicativi incoerenti.
- Confronto modelli: Mantieni costanti prompt, harness, strumenti, permessi, impostazioni di sforzo e regole di scoring.
- Economia: Misura il costo per task accettato, non solo il costo per token.
Conclusione
Le evidenze dei benchmark suggeriscono che Fable 5.1 รจ piรน prezioso quando un task richiede esecuzione sostenuta piuttosto che una singola risposta. I casi dโuso piรน forti includono ricerca scientifica, coding autonomo, automazione aziendale complessa e workflow con verifiche e ripristini ripetuti.
Le evidenze non supportano una superioritร universale. Gap piรน piccoli su diversi benchmark, tassi di fallimento significativi nei task strict di uso del computer e lโassenza di GPT-6 Astra dalla tabella di lancio di Anthropic rafforzano la necessitร di test specifici per workload.
Per gli utenti CometAPI, una regola pratica di deployment รจ testare Fable 5.1 laddove il successo su lungo orizzonte possa giustificare unโinferenza premium, quindi confrontarlo con Opus 5, GPT-5.6 Sol e GPT-6 Astra sugli stessi task rappresentativi prima di scegliere un percorso di produzione.
FAQ
Qual รจ il punteggio di benchmark piรน alto di Claude Fable 5.1?
Tra le metriche percentuali riportate da Anthropic, Fable 5.1 raggiunge il 77.9% di credito parziale su OSWorld 2.0 e il 73.4% su CursorBench 3.2.0. Il suo miglioramento generazionale piรน grande รจ su Terminal-Bench-Science, con il 52.6% contro il 24.7% di Fable 5.
Quanto รจ migliore Claude Fable 5.1 rispetto a Fable 5?
Il guadagno varia nettamente per workload: 27.9 punti su Terminal-Bench-Science, 14.3 su AutomationBench e 13.8 su Terminal-Bench 4.0, ma solo 2.9 su CursorBench e 1.2 su Humanityโs Last Exam con strumenti.
Claude Fable 5.1 รจ migliore di Claude Opus 5?
Ottiene punteggi piรน alti sullโintera tabella riportata da Anthropic, ma molti gap sono piccoli. Anthropic raccomanda di partire da Opus 5 ed effettuare lโupgrade quando serve capacitร aggiuntiva di lungo orizzonte.
Claude Fable 5.1 batte GPT-5.6 Sol?
Anthropic riporta punteggi Fable 5.1 piรน alti su cinque metriche condivise. Poichรฉ si tratta di valutazioni del concorrente gestite dal vendor e le configurazioni variano, la conclusione prudente รจ che Fable 5.1 sia altamente competitivo piuttosto che universalmente superiore.
I risultati sono verificati in modo indipendente?
Solo parzialmente. Diversi benchmark hanno leaderboard pubbliche, ma sforzo, harness, comportamento di fallback e versioni dei task devono essere allineati prima di confrontare i valori direttamente con la run di lancio di Anthropic.
Per cosa รจ migliore Claude Fable 5.1?
Il suo profilo di benchmark รจ piรน forte per ricerca scientifica di lunga durata, coding autonomo, workflow agentici complessi, automazione aziendale e task che richiedono pianificazione, strumenti, verifica e ripristino.
Come posso accedere a Claude Fable 5.1?
Claude Fable 5.1 รจ elencato su CometAPI con ID modello claude-fable-5-1. Un endpoint unificato rende pratico eseguire lo stesso carico di valutazione su piรน modelli prima di scegliere un percorso di produzione.
