TLDR Claude Fable 5.1 est principalement une mise à niveau de l’exécution agentique. Ses plus grands gains rapportés apparaissent dans la recherche scientifique, l’automatisation métier, le codage sur terminal et d’autres flux qui exigent planification, utilisation d’outils, vérification et reprise sur de nombreuses étapes. Les améliorations sont plus modestes sur le raisonnement à réponse fermée et les tâches de codage plus courtes de type IDE, donc la meilleure décision de déploiement dépend de la charge de travail plutôt que d’un score global unique.
Points clés
- Fable 5.1 obtient 52,6 % sur Terminal-Bench-Science 0.1, plus du double des 24,7 % de Fable 5 dans l’évaluation d’Anthropic.
- AutomationBench passe de 17,1 % à 31,4 %, montrant une forte amélioration des flux de travail métiers de bout en bout.
- Les gains sont plus modestes sur CursorBench et Humanity's Last Exam avec outils, suggérant que la version améliore davantage l’exécution soutenue que toutes les formes de raisonnement de manière uniforme.
- Fable 5.1 conserve les mêmes prix standard par jeton que Fable 5, tandis qu’un tarif plus bas de lecture du cache peut réduire le coût effectif des workflows d’agents très consommateurs de contexte.
- GPT-6 Astra est désormais la comparaison OpenAI la plus actuelle, mais il n’a pas été inclus dans le tableau de benchmarks du 1er septembre d’Anthropic. Toute revendication de performance directe nécessite une évaluation contrôlée dans le même harnais.
Anthropic a publié Claude Fable 5.1 le 1er septembre 2026 pour le raisonnement exigeant, les agents à long horizon, l’ingénierie logicielle, la recherche et le travail professionnel de connaissance. Claude Fable 5.1 est également disponible via CometAPI pour les développeurs souhaitant l’évaluer aux côtés d’autres modèles de pointe via un point d’accès unifié.
Les résultats phares sont solides, mais la distribution de l’amélioration est plus informative que la moyenne. Fable 5.1 gagne surtout lorsqu’un agent doit préserver un objectif, interagir avec des outils, se remettre des erreurs et vérifier un état final. Cet article se concentre sur la signification des résultats de benchmark, les limites actuelles du modèle et la manière de l’évaluer face à des alternatives plus récentes.
Aperçu de Claude Fable 5.1
La documentation du modèle d’Anthropic précise une fenêtre de contexte d’un million de jetons, une sortie maximale de 128K, des entrées texte et image, une réflexion adaptative toujours activée et une coupure de connaissances en juin 2026. L’ID du modèle dans l’API Claude est claude-fable-5-1.
| Spécification officielle | Claude Fable 5.1 |
|---|---|
| Fournisseur | Anthropic |
| Date de sortie | 1er septembre 2026 |
| ID du modèle | claude-fable-5-1 |
| Fenêtre de contexte | 1 000 000 jetons |
| Sortie maximale | 128 000 jetons |
| Entrée / sortie | Texte et images → texte |
| Raisonnement | Adaptatif, toujours activé |
| Effort par défaut | Élevé |
| Date de coupure des connaissances | Juin 2026 |
| Prix d’entrée Anthropic | 10 $ / MTok |
| Prix de sortie Anthropic | 50 $ / MTok |
| Lecture du cache | 0,25 $ / MTok |
| Latence comparative | Plus lente |
| Positionnement principal | Raisonnement exigeant et travail agentique à long horizon |
Les prix d’entrée et de sortie standard restent inchangés par rapport à Fable 5, tandis que les lectures de cache passent à 0,25 $ par million de jetons. Fable 5.1 n’affiche pas de prix plus bas en entrée/sortie. Son coût effectif inférieur provient principalement d’une réduction de 75 % du prix de lecture du cache. Anthropic estime un coût environ 25 % plus bas pour des charges classiques et jusqu’à environ 45 % pour des charges très agentiques.
C’est important car un agent de longue durée réutilise de manière répétée le contexte du dépôt, les instructions, les définitions d’outils et l’état antérieur. Le coût par tâche achevée peut donc s’améliorer même lorsque les prix d’entrée et de sortie ne changent pas.
Anthropic rapporte également 60,9 % pour Claude Mythos 5.1 sur Terminal-Bench 4.0. Mythos 5.1 est une version déployée séparément avec des garde-fous différents et ne doit pas être considéré comme le score de Fable 5.1 en disponibilité générale.
Que montrent les benchmarks de Claude Fable 5.1 ?
Les valeurs suivantes proviennent de l’évaluation de septembre 2026 par Anthropic. Elles décrivent une configuration modèle + harnais, et non une propriété immuable du modèle.
| Benchmark | Ce que cela mesure | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Recherche scientifique agentique | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | Codage terminal agentique | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| GDPval-AA v2 | Travail de connaissance pro, Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partiel | Utilisation de l’ordinateur à long horizon | 77,9 % | 72,9 % | 75,4 % | — |
| OSWorld 2.0, strict | Tâches informatiques entièrement terminées | 41,7 % | 36,1 % | 39,6 % | — |
| Humanity’s Last Exam, sans outils | Raisonnement multidisciplinaire expert | 60,9 % | 57,8 % | 56,6 % | — |
| Humanity’s Last Exam, avec outils | Raisonnement expert avec outils | 65,0 % | 63,8 % | 63,6 % | — |
| AutomationBench | Flux de travail métiers de bout en bout | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | Codage IDE agentique | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
Fable 5.1 devance Fable 5 et Opus 5 sur les neuf lignes rapportées. Ses plus grands gains générationnels se situent dans la recherche scientifique, l’automatisation des flux métiers et le codage sur terminal. Les écarts plus faibles sur Humanity's Last Exam et CursorBench sont tout aussi importants car ils montrent que l’amélioration n’est pas uniforme selon toutes les charges.
Où Claude Fable 5.1 s’améliore-t-il le plus ?
Terminal-Bench-Science 0.1 : le résultat le plus marquant
Fable 5.1 obtient 52,6 %, contre 24,7 % pour Claude Fable 5, 29,0 % pour Claude Opus 5, et 22,4 % pour GPT-5.6 Sol dans la mesure d’Anthropic. Le large écart générationnel de 27,9 points est bien supérieur à l’erreur standard rapportée par modèle, tandis que des écarts plus petits — comme les 3,5 points entre Fable 5.1 et Opus 5 sur Terminal-Bench 4.0 — doivent être interprétés avec plus de prudence.
Terminal-Bench-Science évalue des workflows de recherche complets à travers des domaines scientifiques et d’ingénierie. Les agents doivent produire du code, des analyses, des preuves, des simulations ou des produits de données plutôt que de seulement répondre à des questions isolées. Anthropic rapporte une erreur standard d’environ ±3,5–4,5 points par modèle, donc de petits écarts ne doivent pas être automatiquement interprétés comme des différences de capacité significatives.
Terminal-Bench 4.0 : un codage autonome renforcé
Fable 5.1 atteint 55,8 %, devant Fable 5 à 42,0 %, Opus 5 à 52,3 % et GPT-5.6 Sol à 37,3 %. L’amélioration de 13,8 points par rapport à Fable 5 est substantielle, tandis que l’avance de 3,5 points sur Opus 5 est relativement étroite.
Le benchmark place les agents dans un environnement d’exécution, de sorte que la réussite dépend de la navigation dans l’environnement, des modifications de code et de la validation des résultats. Étant donné que Terminal-Bench 4.0 utilise un ensemble de tâches différent des versions antérieures, les scores ne doivent être comparés qu’au sein de la même version du benchmark.
AutomationBench : un gain important avec une marge de progression significative
AutomationBench passe de 17,1 % sur Fable 5 à 31,4 % sur Fable 5.1. C’est une hausse absolue de 14,3 points, soit environ 84 % de gain relatif.
Le benchmark évalue des workflows dans la vente, le marketing, les opérations, le support, la finance et les RH en vérifiant l’état final de l’environnement. Il s’agit donc d’un test utile pour savoir si un agent a réellement terminé un workflow plutôt que d’avoir simplement proposé les bonnes actions. Le score révèle aussi la limite restante : environ deux tiers des tâches n’ont pas été achevées dans la configuration rapportée par Anthropic.
CursorBench 3.2.0 : un gain plus modeste en codage
Fable 5.1 atteint 73,4 %, contre 70,5 % pour Fable 5, 70,0 % pour Opus 5 et 67,2 % pour GPT-5.6 Sol. Le gain par rapport à Fable 5 n’est que de 2,9 points.
La version apparaît donc moins transformatrice sur des tâches de codage plus courtes de type IDE que sur des workflows plus longs nécessitant planification, exécution, vérification et reprise. Les jeux d’évaluation devraient inclure des modifications à l’échelle du dépôt et la reprise après tests en échec plutôt que la seule qualité de génération de code.
OSWorld 2.0 : l’utilisation de l’ordinateur reste difficile
Fable 5.1 obtient 77,9 % avec crédit partiel et 41,7 % en complétion stricte. Opus 5 atteint 75,4 % et 39,6 %, tandis que Fable 5 atteint 72,9 % et 36,1 %.
Le score strict est le signal de production le plus révélateur. Moins de la moitié des tâches ont été entièrement achevées, montrant que les progrès en utilisation d’ordinateur n’éliminent pas le besoin de points de contrôle, permissions, supervision et logique de reprise.
CursorBench et Humanity's Last Exam : des gains plus faibles
Fable 5.1 atteint 73,4 % sur CursorBench 3.2.0, seulement 2,9 points au-dessus de Fable 5. Sur Humanity's Last Exam, il gagne 3,1 points sans outils et 1,2 point avec outils.
Ces écarts plus étroits confirment l’interprétation centrale : Fable 5.1 est plus transformant sur les longs workflows impliquant planification, exécution, vérification et reprise que sur les tâches IDE courtes ou le raisonnement académique à réponse fermée.
Claude Fable 5.1 vs Fable 5 vs GPT-6 Astra vs Opus 5
Réponse courte : Fable 5.1 est l’option la plus solide dans le tableau de benchmarks long-horizon publié par Anthropic ; Opus 5 est le point de départ plus économique lorsque son écart de performance plus faible est acceptable ; Fable 5 reste la référence héritée ; GPT-6 Astra requiert un test dans le même harnais avant tout classement direct.
Fable 5.1 est une mise à niveau générationnelle claire par rapport à Fable 5 sur les benchmarks d’agents à long horizon rapportés par Anthropic. GPT-6 Astra est la comparaison OpenAI la plus récente, mais il est sorti après l’évaluation du 1er septembre d’Anthropic et n’a pas été inclus dans le même harnais de benchmark.
| Dimension | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| Fenêtre de contexte | 1M jetons | 1M jetons | 1,05M jetons |
| Sortie maximale | 128K | 128K | 128K |
| Entrée / sortie standard | 10 $ / 50 $ par MTok | 10 $ / 50 $ par MTok | 10 $ / 50 $ par MTok |
| Lecture du cache | 0,25 $ / MTok | 1 $ / MTok | Vérifier les conditions actuelles du fournisseur |
| Terminal-Bench-Science 0.1 | 52,6 % | 24,7 % | Non inclus dans le tableau de lancement d’Anthropic |
| Terminal-Bench 4.0 | 55,8 % | 42,0 % | Non inclus dans le tableau de lancement d’Anthropic |
| AutomationBench | 31,4 % | 17,1 % | Non inclus dans le tableau de lancement d’Anthropic |
| Positionnement principal | Raisonnement exigeant et agents à long horizon | Référence précédente de la classe Fable | Travail professionnel de bout en bout difficile |
Face à Fable 5, Fable 5.1 montre ses plus grands gains mesurés en recherche scientifique, automatisation métier et codage sur terminal tout en conservant les mêmes prix standard par jeton. Un prix de lecture du cache plus bas améliore encore l’économie des agents réutilisant le contexte.
Règle de sélection : Commencez avec Opus 5 lorsque le coût est prioritaire, passez à Fable 5.1 lorsque la complétion et la reprise à long horizon importent le plus, conservez Fable 5 uniquement pour des charges sensibles à la compatibilité, et évaluez GPT-6 Astra dans un même harnais contrôlé avant l’adoption en production.
À quoi ressemble la performance par type de charge de travail ?
| Capacité | Résultat Fable 5.1 | Évolution vs Fable 5 | Interprétation |
|---|---|---|---|
| Recherche scientifique agentique | 52,6 % | +27,9 pts | Gain très important |
| Automatisation des workflows métiers | 31,4 % | +14,3 pts | Gain très important |
| Codage sur terminal | 55,8 % | +13,8 pts | Gain important |
| Utilisation de l’ordinateur, strict | 41,7 % | +5,6 pts | Gain modéré |
| Utilisation de l’ordinateur, partiel | 77,9 % | +5,0 pts | Gain modéré |
| Raisonnement expert, sans outils | 60,9 % | +3,1 pts | Petit gain |
| Codage agentique IDE | 73,4 % | +2,9 pts | Petit gain |
| Raisonnement expert, avec outils | 65,0 % | +1,2 pts | Petit gain |
| Travail de connaissance professionnel | 1853 Elo | +130 Elo | Forte, sensible à la configuration |
Le schéma est constant : les plus grandes améliorations apparaissent lorsque la réussite dépend de la persistance, de la planification, de l’interaction avec l’environnement, de l’utilisation d’outils et de la reprise dans le temps.
Que ne vous disent pas les benchmarks ?
Les tableaux de benchmarks compressent le comportement en chiffres uniques. Ils ne prouvent pas que les agents autonomes sont « résolus » et ne prédisent pas toutes les charges de production.
- Le tableau principal de comparaison est réalisé par le fournisseur.
- Les réglages d’effort affectent la qualité, la latence et le coût.
- Les benchmarks d’agents mesurent l’ensemble modèle, harnais, outils et autorisations.
- Les garde-fous de production étaient activés pour Fable 5.1 et ont influencé certains résultats.
- Les versions des benchmarks évoluent, donc des valeurs issues de jeux de tâches différents peuvent ne pas être comparables.
- AutomationBench reste à 31,4 %, tandis que la complétion stricte d’OSWorld reste à 41,7 % ; des taux d’échec substantiels subsistent.
Une évaluation pratique doit utiliser les scores publics pour établir une présélection, reproduire une petite comparaison avec des réglages identiques, puis tester le workflow de production réel.
Claude Fable 5.1 est-il le meilleur modèle Claude ?
Pour une capacité maximale sur des travaux difficiles et de longue durée, les preuves issues des benchmarks plaident fortement pour Claude Fable 5.1. Pour chaque charge de travail, non.
Anthropic le facture 10 $ par million de jetons en entrée et 50 $ par million en sortie, contre 5 $ et 25 $ pour Opus 5. La prime n’est justifiée que lorsque Fable 5.1 produit un taux de réussite plus élevé, moins de retentatives, moins de jetons par tâche acceptée, ou une réduction suffisante du temps de revue humaine.
Un tarif de lecture du cache plus bas peut réduire l’écart de coût effectif pour les agents. Le coût par résultat accepté est donc plus utile que le seul prix par jeton.
Comment devez-vous évaluer Claude Fable 5.1 ?
Votre évaluation doit ressembler à la charge de production visée.
- Codage : Testez des tickets complets et mesurez l’acceptation des patchs, les tests passés, les retentatives, les appels d’outils, le temps écoulé et le temps de correction humaine.
- Recherche : Évaluez la qualité des sources, l’exactitude factuelle, la couverture des preuves, l’achèvement des sous-tâches et la rétention de l’objectif sur de longues sessions.
- Agents métiers : Notez l’état final de l’environnement plutôt que de compter des actions individuellement correctes.
- Utilisation de l’ordinateur : Mesurez la reprise face aux pop-ups, pages lentes, sessions interrompues et états d’application inconsistants.
- Comparaison de modèles : Conservez constants les prompts, harnais, outils, autorisations, réglages d’effort et règles de scoring.
- Économie : Mesurez le coût par tâche acceptée, pas seulement le coût par jeton.
Conclusion
Les preuves issues des benchmarks suggèrent que Fable 5.1 est le plus précieux lorsqu’une tâche exige une exécution soutenue plutôt qu’une réponse unique. Les cas d’usage les plus forts incluent la recherche scientifique, le codage autonome, l’automatisation métier complexe et les workflows avec vérifications et reprises répétées.
Les preuves ne soutiennent pas une supériorité universelle. Des écarts plus petits sur plusieurs benchmarks, des taux d’échec significatifs sur les tâches strictes d’utilisation d’ordinateur, et l’absence de GPT-6 Astra du tableau de lancement d’Anthropic renforcent tous la nécessité de tests spécifiques à la charge.
Pour les utilisateurs de CometAPI, une règle pratique de déploiement consiste à tester Fable 5.1 là où la réussite à long horizon pourrait justifier un coût d’inférence premium, puis à le comparer à Opus 5, GPT-5.6 Sol et GPT-6 Astra sur les mêmes tâches représentatives avant de choisir une voie de production.
FAQ
Quel est le score de benchmark le plus élevé de Claude Fable 5.1 ?
Parmi les métriques en pourcentage rapportées par Anthropic, Fable 5.1 atteint 77,9 % de crédit partiel sur OSWorld 2.0 et 73,4 % sur CursorBench 3.2.0. Son plus grand gain générationnel est Terminal-Bench-Science, à 52,6 % contre 24,7 % pour Fable 5.
Dans quelle mesure Claude Fable 5.1 est-il meilleur que Fable 5 ?
Le gain varie fortement selon la charge : 27,9 points sur Terminal-Bench-Science, 14,3 sur AutomationBench et 13,8 sur Terminal-Bench 4.0, mais seulement 2,9 sur CursorBench et 1,2 sur Humanity's Last Exam assisté par outils.
Claude Fable 5.1 est-il meilleur que Claude Opus 5 ?
Il obtient des scores plus élevés sur l’ensemble du tableau rapporté par Anthropic, mais de nombreux écarts sont faibles. Anthropic recommande de commencer par Opus 5 et de passer à Fable 5.1 lorsque des capacités supplémentaires à long horizon sont nécessaires.
Claude Fable 5.1 dépasse-t-il GPT-5.6 Sol ?
Anthropic rapporte des scores Fable 5.1 plus élevés sur cinq métriques communes. Comme il s’agit d’évaluations de concurrents réalisées par le fournisseur et que les configurations varient, la conclusion prudente est que Fable 5.1 est très compétitif plutôt qu’universellement supérieur.
Les résultats sont-ils vérifiés de manière indépendante ?
Seulement en partie. Plusieurs benchmarks ont des classements publics, mais l’effort, le harnais, les comportements de repli et les versions des tâches doivent être alignés avant de comparer directement leurs valeurs à la série de lancement d’Anthropic.
Dans quels cas Claude Fable 5.1 est-il le meilleur ?
Son profil de benchmark est le plus fort pour la recherche scientifique de longue durée, le codage autonome, les workflows d’agents complexes, l’automatisation des entreprises et les tâches nécessitant planification, outils, vérification et reprise.
Comment puis-je accéder à Claude Fable 5.1 ?
Claude Fable 5.1 est listé sur CometAPI avec l’ID de modèle claude-fable-5-1. Un point d’accès unifié facilite l’exécution du même workload d’évaluation sur plusieurs modèles avant de choisir une voie de production.
