TL;DR
Claude Haiku 5.5 est le plus rapide des petits modèles d’Anthropic à vitesse standard pour les tâches à grand volume et sensibles à la latence. Il combine une fenêtre de contexte d’1 million de jetons, une limite de sortie standard de 128K, un raisonnement adaptatif, et un prix de base à partir de 0,10 $ par million de jetons en entrée et 0,50 $ par million de jetons en sortie. Les tarifs augmentent lorsque l’invite dépasse 100 000 jetons. Pour le codage complexe et les travaux agentiques étendus, Sonnet 5.5 et Opus 5.5 restent des choix plus solides. La tarification Standard de CometAPI est inférieure de 20 % aux tarifs officiels, à partir de 0,08 $ par million de jetons en entrée et 0,40 $ par million de jetons en sortie. La page modèle CometAPI est en ligne et signale un accès API en production.
Principaux enseignements
- Sortie officielle : 7 octobre 2026 ; ID de modèle Claude API : claude-haiku-5-5.
- Tarifs API de départ : 0,10 $ en entrée et 0,50 $ en sortie par million de jetons pour les invites jusqu’à 100K jetons. CometAPI : 0,08 $ en entrée et 0,40 $ en sortie par million de jetons, soit 80 % de la tarification Standard officielle.
- Contexte et sortie : 1M de jetons de contexte et 128K de jetons de sortie standard.
- Focalisation : classification, extraction de documents, routage, support et tâches d’agent délégué.
- Le nouveau tokeniseur peut compter environ 30 % de jetons en plus pour le même texte ; évaluez le coût par tâche acceptée plutôt que le seul prix par jeton.
Qu’est-ce que Claude Haiku 5.5 ?
Claude Haiku 5.5 est le membre léger de l’actuelle famille Claude d’Anthropic, conçu pour de grands volumes de requêtes où la réactivité et l’économie d’exploitation sont centrales. Ses applications principales incluent le traitement de documents, le support conversationnel, l’extraction d’informations et les tâches de sous-agents compactes. L’aperçu du modèle d’Anthropic confirme la date de lancement, les capacités et les identifiants de plateforme.
Claude Haiku 5.5 est le premier modèle Haiku à prendre en charge des niveaux d’effort configurables, permettant aux développeurs d’arbitrer la profondeur du raisonnement, la latence et l’usage de jetons au sein d’un même modèle.
Quelles sont les fonctionnalités clés de Claude Haiku 5.5 ?
Pensée adaptative et effort ajustable
Haiku 5.5 peut décider quand et dans quelle mesure raisonner, tandis que le paramètre d’effort offre aux développeurs un moyen d’équilibrer qualité de réponse, latence et usage de jetons. L’effort par défaut est moyen. Pour une classification simple, un effort faible peut être préférable ; pour une extraction ambiguë ou des étapes de planification d’outils, un réglage plus élevé peut se justifier.
Traitement à grand contexte
Une fenêtre de contexte d’1M de jetons permet d’intégrer de longs documents et des historiques de conversation substantiels dans une seule requête. Les développeurs doivent malgré tout utiliser la recherche, la troncature et la mise en cache lorsque c’est approprié : des contextes longs peuvent introduire des coûts inutiles et des compromis de précision, en particulier au-delà du seuil de tarification des 100K.
Traitement à haut débit et faible coût
Les nouveaux tarifs de départ à 0,10 $/0,50 $ rendent des requêtes courtes répétées sensiblement moins coûteuses que la génération Haiku précédente au coût par jeton. Toutefois, Anthropic documente un tokeniseur modifié : un texte identique produit environ 30 % de jetons en plus que sur Haiku 4.5. Les économies réelles au niveau des tâches peuvent donc être inférieures aux réductions de tarifs mises en avant.
Utilisation de l’ordinateur et tâches d’agent délégué
Les évaluations publiées indiquent de meilleures performances sur l’interaction avec l’ordinateur et les tâches assistées par outils que le modèle Haiku précédent. Cela rend Haiku 5.5 utile pour des étapes d’agent bornées, mais une automatisation réussie dépend toujours d’autorisations d’outils solides, de la récupération après erreur et d’une approbation humaine pour les actions risquées.
Comment Claude Haiku 5.5 se comporte-t-il sur les benchmarks ?
Anthropic rapporte des gains marqués sur les tâches de connaissances professionnelles, l’usage de l’ordinateur, le codage et le raisonnement. Les résultats ci-dessous utilisent les paramètres d’évaluation rapportés ; les scores de différents benchmarks ne doivent pas être combinés en un « score d’intelligence » unique.
| Benchmark | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 735 | 1,620 | 1,840 |
| AA-Briefcase v1.1 (Elo) | 614 | 1,578 | 1,824 |
| OSWorld 2.1, offline subset, partial credit | 15.7% | 72.4% | 83.9% |
| Humanity's Last Exam, no tools | 10.2% | 45.9% | 56.9% |
| Humanity's Last Exam, with tools | 18.7% | 57.4% | 64.5% |
| Terminal-Bench 4.0 | 0.0% | 39.2% | 70.6% |
| Chartography, no tools | 6.4% | 46.4% | 61.6% |
La configuration d’évaluation standard de Haiku 5.5 du system card utilise une pensée adaptative à effort maximal, l’échantillonnage par défaut et cinq essais sauf mention contraire ; le paramètre produit par défaut est moyen, de sorte que les scores mis en avant ne constituent pas des garanties aux réglages par défaut. OSWorld utilise 82 tâches hors ligne, sans accès internet, en 1080p et une limite de 500 actions. Son 72,4 % est un score à crédit partiel ; le taux de réussite strict est de 37,1 %. GDPval-AA et AA-Briefcase sont rapportés par Anthropic à partir d’évaluations Artificial Analysis exécutées de manière indépendante.
Terminal-Bench 4.0 utilise Claude Code en mode --bare avec des garde-fous activés. Haiku 5.5 utilise effort maximal, aucun modèle de repli et aucune sortie internet, avec 10 essais par tâche ; Sonnet 5.5 utilise cinq essais et un modèle de repli pour certaines requêtes signalées. Haiku 4.5 utilise un budget de réflexion fixe de 63 999 jetons. Ces différences de configuration comptent lors de l’interprétation de 39,2 % contre 70,6 %.
Les résultats de benchmarks publiés par Anthropic fournissent les scores ci-dessus. OSWorld utilise son sous-ensemble hors ligne ; Humanity's Last Exam sépare les exécutions avec et sans outils, et Chartography est sans outils. Il s’agit de résultats fournis par le fournisseur, et non de mesures indépendantes sous une configuration universelle. Anthropic fournit des détails d’évaluation dans sa system card de Haiku 5.5 ; reproduisez les réglages pertinents d’effort, d’outils, d’architecture de pilotage et de budget avant de comparer vos propres résultats. Le résumé de lancement ne spécifie pas un environnement de test commun complet pour chaque ligne.

Le graphique d’évaluation officiel d’Anthropic ci-dessus est reproduit à partir de sa system card. Il fournit des éléments supplémentaires sur les configurations évaluées ; ce n’est pas un nouveau benchmark produit pour cet article.
Interprétation des benchmarks
L’amélioration sur OSWorld suggère que Haiku 5.5 est devenu nettement plus utile pour des tâches graphiques structurées. Cependant, le 70,6 % de Sonnet 5.5 contre 39,2 % pour Haiku 5.5 sur Terminal-Bench indique un avantage persistant des modèles plus grands pour le codage agentique. Sélectionnez les modèles en fonction du coût de l’échec et de la difficulté du flux de travail réel.
Claude Haiku 5.5 vs Haiku 4.5 vs Sonnet 5.5
| Dimension | Haiku 4.5 | Haiku 5.5 | Sonnet 5.5 |
|---|---|---|---|
| Contexte | 200K | 1M | 1M |
| Sortie standard max | 64K | 128K | 128K |
| Entrée standard / MTok | 1 $ | 0,10 $ jusqu’à 100K ; 0,50 $ au-delà | 2 $ |
| Sortie standard / MTok | 5 $ | 0,50 $ jusqu’à 100K ; 2,50 $ au-delà | 10 $ |
| Raisonnement | Pensée étendue avec budget de jetons fixe | Adaptatif ; par défaut moyen | Adaptatif ; par défaut élevé |
| Latence relative | Rapide | Le plus rapide à vitesse standard | Rapide |
| Profondeur de codage | Tâches bornées | Sous-agents plus robustes | Codage plus complexe |
| Usage typique | Déploiements hérités de petits modèles | Flux de travail à grand volume | Flux de production complexes |
Spécifications communes : les trois modèles acceptent des entrées texte et image et produisent des sorties texte. Ils sont accessibles via la Claude API et des plateformes partenaires prises en charge ; les identifiants de modèle et l’accès au compte dépendent du fournisseur. La documentation produit citée n’établit ni les nombres de paramètres ni des architectures détaillées.
Haiku 5.5 est un premier choix sensé pour des tâches vérifiables et répétitives. Sonnet 5.5 devient plus attractif lorsque de meilleurs jugements évitent des appels répétés, des réessais d’outils ou des corrections humaines. Opus 5.5 est une option pour des missions multi-étapes particulièrement exigeantes.
Les étiquettes comparatives de latence se réfèrent aux modes de vitesse standard. L’homologation de vitesse d’Anthropic exclut Opus Fast Mode de la revendication de « modèle le plus rapide ». Les détails d’architecture tels que le nombre de paramètres ne sont pas établis par ces niveaux de produit. L’entrée texte-et-image avec sortie texte est distincte de la génération d’images.
La comparaison de capacités suit les spécifications des modèles d’Anthropic. L’accès à la plateforme dépend du fournisseur sélectionné et du compte ; aucun niveau de modèle n’implique un nombre de paramètres publié.
Sélection de la charge de travail
| Charge de travail | Par défaut pratique | Pourquoi |
|---|---|---|
| Classification d’e-mails | Haiku 5.5 | Décisions courtes, répétées, vérifiables |
| Extraction de champs de documents | Haiku 5.5 | Traitement structuré et économique |
| Triage du support | Haiku 5.5 | Réponses rapides et escalade |
| Sous-agents de codage | Haiku 5.5 | Recherche de fichiers peu coûteuse et edits contenus |
| Débogage complexe | Sonnet 5.5 | Meilleure performance de codage en benchmark |
| Raisonnement multi-étapes à enjeux élevés | Opus 5.5 | Modèle haut de gamme plus capable |
| Charge mixte | Haiku + Sonnet | Routage par complexité et confiance |
Combien coûte Claude Haiku 5.5 ?
Pourquoi Haiku 5.5 est-il présenté comme « environ 75 % moins cher » s’il affiche un prix par jeton inférieur de 90 % ?
La valeur de 90 % décrit la réduction des tarifs Standard en entrée et en sortie pour des invites jusqu’à 100 000 jetons ; les invites plus longues bénéficient d’une réduction de 50 %. Anthropic indique que Haiku 5.5 coûte en moyenne environ 75 % moins cher à l’usage, en tenant compte du mix de longueurs de requêtes du modèle précédent et des changements de consommation de jetons par tâche. La tokenisation est un facteur : le même texte en entrée peut compter environ 30 % de jetons en plus, donc les estimations de coût doivent utiliser des décomptes mesurés avec le nouveau modèle.
La tarification officielle d’Anthropic comporte deux tranches de longueur d’invite. Les tarifs du premier tableau sont des prix officiels en USD par million de jetons ; la comparaison CometAPI ci-dessous applique une remise de 20 % aux tarifs Standard officiels d’entrée et de sortie.
| Catégorie de tarif | Invite jusqu’à 100K | Invite au-delà de 100K |
|---|---|---|
| Entrée | 0,10 $ | 0,50 $ |
| Sortie | 0,50 $ | 2,50 $ |
| Écriture cache 5 min | 0,125 $ | 0,625 $ |
| Écriture cache 1 h | 0,20 $ | 1,00 $ |
| Lecture cache | 0,01 $ | 0,05 $ |
| Entrée Batch (−50 %) | 0,05 $ | 0,25 $ |
| Sortie Batch (−50 %) | 0,25 $ | 1,25 $ |
Les tarifs Standard officiels, de cache et Batch sont indiqués ci-dessus, vérifiés le 8 octobre 2026. La longueur de l’invite détermine la tranche tarifaire ; la tranche la plus élevée s’applique à la requête entière plutôt qu’aux seuls jetons au-dessus de 100K. Les tarifs Standard CometAPI ci-dessous correspondent aux tarifs Standard officiels multipliés par 0,8. Cette comparaison ne suppose pas que la remise du gateway s’additionne avec les remises Batch ou de cache.
| Longueur d’invite | Catégorie de jetons | Standard officiel / MTok | CometAPI / MTok |
|---|---|---|---|
| Jusqu’à 100K jetons | Entrée | 0,10 $ | 0,08 $ |
| Jusqu’à 100K jetons | Sortie | 0,50 $ | 0,40 $ |
| Au-delà de 100K jetons | Entrée | 0,50 $ | 0,40 $ |
| Au-delà de 100K jetons | Sortie | 2,50 $ | 2,00 $ |
Exemple : 100 000 requêtes courtes par mois
Supposons que chaque requête utilise 2 000 jetons en entrée et 500 jetons en sortie ; chaque requête reste sous le seuil des 100K. Ignorez la mise en cache des invites, les outils et les réessais, et supposez des nombres de jetons identiques entre modèles pour l’illustration.
| Modèle / fournisseur | Entrée/mois | Sortie/mois | Total/mois |
|---|---|---|---|
| Haiku 4.5 — Standard officiel | 200 $ | 250 $ | 450 $ |
| Haiku 5.5 — Standard officiel | 20 $ | 25 $ | 45 $ |
| Sonnet 5.5 — Standard officiel | 400 $ | 500 $ | 900 $ |
| Haiku 5.5 — CometAPI | 16 $ | 20 $ | 36 $ |
Dans cet exemple, 100 000 requêtes consomment 200 millions de jetons en entrée et 50 millions de jetons en sortie. L’entrée CometAPI coûte 200 × 0,08 $ = 16 $ et la sortie coûte 50 × 0,40 $ = 20 $, soit 36 $ par mois contre 45 $ officiels : une économie de 9 $, ou 20 %. Le scénario exclut la mise en cache, les outils et les réessais et utilise des nombres de jetons fixes ; mesurez le coût par tâche acceptée sur des entrées représentatives car le nouveau tokeniseur modifie les décomptes de jetons.
La comparaison de 450 $ à 45 $ est une illustration à jetons constants d’une réduction tarifaire de 90 %, pas une promesse d’économies de 90 % pour des charges équivalentes réelles. Dans son annonce de lancement, Anthropic rapporte environ 75 % de baisse moyenne des coûts de fonctionnement après prise en compte des longueurs de requêtes et des changements d’usage de jetons. Recomptez des entrées représentatives et mesurez le coût par tâche accomplie avant d’estimer vos propres économies.
Où accéder à Claude Haiku 5.5 ?
Accès officiel et plateformes cloud
Haiku 5.5 est disponible via la Claude API et des plateformes prises en charge sur Amazon Web Services, Google Cloud et Microsoft Azure, selon l’annonce de disponibilité d’Anthropic. L’ID de modèle direct de la Claude API est claude-haiku-5-5 ; Amazon Bedrock utilise anthropic.claude-haiku-5-5. Utilisez des identifiants délivrés par votre fournisseur choisi et vérifiez ses exigences d’accès au compte à jour.
Accès tiers via CometAPI
La page modèle CometAPI liste claude-haiku-5-5 comme disponible, avec des tarifs Standard à partir de 0,08 $ par million de jetons en entrée et 0,40 $ par million de jetons en sortie pour les invites jusqu’à 100K, soit 20 % en dessous des tarifs officiels correspondants. Utilisez une clé émise par CometAPI avec l’endpoint et le format de requête de CometAPI ; il s’agit d’une voie d’accès distincte de l’accès direct à l’API Anthropic. Consultez la page en ligne pour la disponibilité, les tranches de tarification et les détails d’intégration.
Lors du changement de fournisseur ou de la mise à niveau depuis Haiku 4.5, vérifiez les IDs de modèle, recomptez les jetons et testez les limites de réponse et la gestion des conversations. Pour les détails d’implémentation et les changements incompatibles, consultez le guide de migration d’Anthropic.
Validation de la migration
- Mettez à jour l’ID de modèle et validez les champs de requête spécifiques à l’endpoint.
- Recomptez les jetons avec le tokeniseur mis à jour, y compris les préfixes stables et les définitions d’outils.
- Testez les réglages de pensée adaptative, les distributions de latence et l’analyse des blocs de réponse.
- Vérifiez les appels d’outils, la récupération en cas d’échec et toute restriction de compte sur les blocs de raisonnement stockés.
- Comparez latence p50/p95, taux de tâches acceptées et total de jetons facturables.
- Utilisez un déploiement progressif et un plan de retour pour les flux critiques métier.
- Le préremplissage de l’assistant est interdit
Le guide de migration Haiku 5.5 explique le comportement du tokeniseur, les IDs et la compatibilité des requêtes. Omettez temperature, top_p et top_k. S’ils sont fournis explicitement, temperature doit être 1 et top_p doit être 0,99 ; toute valeur top_k, ou le fait de fournir à la fois temperature et top_p, renvoie une erreur 400.
Quelles sont les limites de Claude Haiku 5.5 ?
Haiku 5.5 n’est pas un substitut universel aux modèles plus grands. Le codage complexe et le raisonnement à long horizon restent des différenciateurs significatifs pour Sonnet et Opus. Les invites plus longues coûtent également plus cher, donc la fenêtre d’1M de jetons doit être utilisée de manière sélective. Le raisonnement adaptatif introduit une variance sur les jetons générés et la latence ; les benchmarks n’établissent pas de garanties pour un flux de travail métier donné.
Une automatisation sensible au risque doit valider les sorties structurées, limiter les permissions d’outils externes, conserver des journaux d’audit et exiger une revue avant des actions conséquentes. Acheminez les tâches incertaines vers des modèles plus puissants plutôt que de compter uniquement sur le prix de base inférieur en jetons de Haiku.
Conclusion
Pour un traitement à grand volume avec des critères d’acceptation mesurables, Claude Haiku 5.5 est une mise à niveau attractive : prix d’entrée plus bas, contexte élargi, raisonnement adaptatif et évaluations publiées plus solides. Pour la programmation complexe et la prise de décision ambiguë, Sonnet 5.5 ou Opus 5.5 peuvent offrir une meilleure économie globale en réduisant les réessais et corrections. La stratégie gagnante consiste à benchmarker le flux de bout en bout et à router les requêtes selon la difficulté.
FAQ
Comment la limite de tarification à 100K de Haiku 5.5 affecte-t-elle un flux mis en cache ?
La longueur de l’invite détermine la tranche tarifaire applicable ; n’estimez pas la facturation à partir du seul texte nouveau ni ne supposez que seuls les jetons excédentaires utilisent la tranche supérieure. Comptez la requête pour le modèle sélectionné, y compris l’historique et les définitions d’outils, puis rapprochez l’entrée, l’écriture cache, la lecture cache et la sortie avec la tranche pertinente. Comparez les factures sur des requêtes mises en cache représentatives avant d’établir un budget de production.
Les blocs de raisonnement de Haiku 5.5 peuvent-ils être rejoués entre comptes ?
Ils ne fonctionnent que dans le compte qui les a produits ou un compte lié. Si un compte non lié envoie un bloc de raisonnement stocké, l’API le rejette avant que le modèle ne le voie ; la requête peut tout de même réussir sans ce raisonnement. Voir le guide de migration officiel. Conservez les blocs de conversation et utilisez le compte d’origine ou lié pour poursuivre un flux d’outils. Un changement de passerelle ou de compte doit être testé explicitement ; faire correspondre un nom de modèle ne garantit pas que les blocs de raisonnement stockés restent utilisables.
Pourquoi Haiku 5.5 peut-il tronquer une réponse que Haiku 4.5 achevait ?
Le nouveau tokeniseur peut compter plus de jetons pour le même texte, si bien qu’une limite max_tokens inchangée peut couvrir une sortie équivalente plus courte. La pensée adaptative peut aussi consommer du budget de sortie. Inspectez stop_reason et usage, recomptez les invites avec le nouveau modèle, et réglez les marges de sortie sur des tâches réelles plutôt que de copier des limites héritées.
Comment sélectionner les seuils de routage de Haiku 5.5 ?
Utilisez un échantillon étiqueté de la charge réelle pour mesurer le taux de tâches acceptées, le coût de correction et la latence. Routez les requêtes qui échouent une validation explicite ou dépassent le périmètre de la tâche testée vers un modèle plus puissant. Réglez le seuil en fonction du coût total du flux, incluant réessais et escalade, et surveillez-le après des changements de prompts, d’outils ou d’effort.
