Anthropic a lancé Claude Haiku 5.5 le 7 octobre pour les tâches courtes et fréquentes qui peuvent représenter une grande partie des appels d’un système d’agents. Les tarifs publics de la Claude API commencent à 0,10 $ par million de tokens d’entrée et 0,50 $ par million de tokens de sortie, soit un dixième de ceux de Haiku 4.5. Anthropic indique toutefois que le même texte nécessite environ 30 % de tokens supplémentaires avec le nouveau modèle et que les prompts de plus de 100 000 tokens passent dans une tranche tarifaire supérieure. Les équipes qui utilisent Haiku 4.5 doivent recompter leurs propres requêtes avant d’estimer leur facture ou de transférer du trafic de production.
La version modifie aussi le fonctionnement de la Messages API. Les budgets manuels de thinking ne fonctionnent pas avec Haiku 5.5, l’adaptive thinking est activé par défaut et le premier bloc de réponse peut être thinking au lieu de texte. Ce sont des vérifications de compatibilité concrètes pour les services qui appellent régulièrement un petit modèle afin de classer, extraire, router ou résumer des données.
Le changement majeur
- Ce qui change : Anthropic apporte sa nouvelle fenêtre de contexte d’un million de tokens et l’adaptive thinking à la gamme Claude la moins chère. Haiku 5.5 réduit le tarif des prompts courts, tout en modifiant le comptage du texte et la manière dont une réponse peut commencer.
- Pourquoi c’est important : Une équipe peut désormais envisager Claude pour davantage d’étapes d’agent fréquentes et bien délimitées, à un tarif affiché inférieur. Le gain dépend de la répartition des longueurs de prompt, des tokens de sortie et de thinking, de l’utilisation du cache et de la capacité du nouveau modèle à atteindre l’objectif de qualité de chaque étape.
- Points à surveiller : Les intégrations Haiku 4.5 doivent faire l’objet d’une migration mesurée. Après recomptage, les requêtes proches du seuil de 100 000 tokens peuvent passer dans la tranche supérieure. Un code qui suppose que le premier bloc de contenu est du texte peut aussi mal traiter une réponse pourtant réussie.
Le prix dépend de la longueur du prompt
Dans la Claude API, Haiku 5.5 coûte 0,10 $ par million de tokens d’entrée et 0,50 $ par million de tokens de sortie pour les prompts allant jusqu’à 100 000 tokens. Au-delà, les tarifs respectifs sont de 0,50 $ et 2,50 $. Haiku 4.5 est affiché à 1 $ et 5 $ sur l’ensemble de sa fenêtre de contexte de 200 000 tokens. Haiku 5.5 dispose d’une fenêtre d’un million de tokens et d’une sortie maximale de 128 000 tokens, contre 200 000 et 64 000 pour Haiku 4.5. Anthropic indique une disponibilité via la Claude API, Amazon Bedrock, Claude Platform sur AWS, Google Cloud et Microsoft Foundry. L’ID du modèle Amazon Bedrock est anthropic.claude-haiku-5-5 ; la Claude API utilise claude-haiku-5-5. Les pages des modèles d’Anthropic indiquent les ID, limites et tarifs actuels des plateformes.
Selon Anthropic, le coût d’exécution de Haiku 5.5 est inférieur d’environ 75 % à celui de Haiku 4.5 en moyenne. La note de bas de page combine le tarif affiché inférieur de 90 % pour les prompts allant jusqu’à 100 000 tokens, la baisse de 50 % au-delà de ce seuil, l’observation selon laquelle 90 % des requêtes Haiku 4.5 relevaient de la catégorie courte et le nombre supérieur de tokens comptabilisés par le nouveau tokenizer pour le même travail. Ce calcul décrit le mélange de requêtes d’Anthropic, pas une remise uniforme sur chaque requête. La hausse d’environ 30 % du nombre de tokens est également une estimation du fournisseur pour le même texte d’entrée ; l’écart exact dépend du contenu. L’annonce de lancement d’Anthropic présente à la fois cette affirmation et sa méthode de calcul.
Pour une requête Claude API sans cache, prenez les nombres de tokens d’entrée et de sortie de Haiku 5.5, multipliez chacun par le tarif de la tranche correspondant à la longueur du prompt de la requête et divisez par un million. Exemple de calcul : 80 000 tokens d’entrée et 10 000 de sortie coûtent 0,013 $ aux tarifs des prompts courts. Avec 120 000 tokens d’entrée et 10 000 de sortie, les tarifs des prompts longs donnent 0,085 $. Ce sont des calculs de prix, pas des tâches observées ni des prévisions. La lecture et l’écriture du cache ont leurs propres tarifs, et le traitement par lots affiche une remise de 50 % sur l’entrée et la sortie. Une estimation utile regroupe donc les appels réels selon la longueur du prompt et le comportement du cache avant de les additionner. La page du modèle Haiku 5.5 répertorie ces catégories.
Recomptez des prompts représentatifs enregistrés avec le point de terminaison de comptage de tokens Message, en indiquant claude-haiku-5-5. Les totaux de tokens de l’ancien modèle ne permettent pas de déterminer dans quelle tranche Haiku 5.5 placera un prompt. Pour un échantillon réel, consignez la réponse usage, la longueur de sortie, les champs du cache, l’effort et le coût réellement facturé, ainsi que les résultats de la tâche. Incluez des requêtes courtes, les conversations répétées les plus longues et des cas proches de 100 000 tokens. BIG CHANGE a examiné la documentation, mais n’a pas exécuté Haiku 5.5 ni mesuré une charge de production.
Les paramètres à revoir pendant la migration
Le guide de migration Haiku 5.5 d’Anthropic propose une liste de contrôle particulièrement détaillée pour les clients qui quittent Haiku 4.5 :
- Modifiez l’ID du modèle pour la plateforme et recomptez les prompts.
claude-haiku-5-5est un ID fixe de la Claude API, sans suffixe de date ni alias distinct. Vérifiezmax_tokens, car le thinking utilise cette limite et un texte équivalent peut nécessiter davantage de tokens. - Remplacez
thinking: {"type":"enabled","budget_tokens":N}par l’adaptive thinking ou laissezthinkingnon défini. Réglezoutput_config.effortpour ajuster la profondeur ; la valeur par défaut documentée estmedium. Une valeur faible demax_tokenspeut terminer la réponse après un bloc de thinking et avant tout texte. - Lisez les blocs de contenu selon leur
type, et non leur position. Renvoyez les blocs de thinking sans les modifier avec les résultats des outils. Testez tout stockage de conversations qui rejoue un bloc avec un autre compte ou modifie des messages antérieurs, des instructions système ou des outils. - Supprimez les réglages personnalisés
temperature,top_pettop_k. Remplacez le préremplissage final de l’assistant par un tour utilisateur et, pour les formats contraints, utilisez l’approche de sortie structurée ou d’outils documentée par Anthropic. Gérez dans le client unstop_reasondont la valeur estrefusal. - Si l’intégration utilise computer use avec la Claude API ou Google Cloud, remplacez l’ancien outil
computer_20250124parcomputer_toolset_20260801et mettez à jour la boucle d’outils comme indiqué dans le guide. Les organisations qui utilisent la capacité Priority Tier pour Haiku 4.5 ont également besoin d’un plan distinct : le guide précise que Priority Tier n’est pas disponible pour Haiku 5.5.
Ces changements ne prescrivent pas un seul niveau d’effort pour toutes les tâches. Une comparaison doit conserver la même tâche applicative et les mêmes critères d’acceptation, puis mesurer la qualité des réponses, les refus, les troncatures, la latence et les tokens facturés pour les paramètres étudiés. Anthropic rapporte de meilleurs résultats pour Haiku 5.5 que pour 4.5 sur plusieurs benchmarks, notamment 39,2 % contre 0,0 % dans son tableau Terminal-Bench 4.0. Il s’agit de résultats publiés par Anthropic selon ses conditions d’évaluation, pas d’une mesure de l’agent d’un lecteur. Anthropic présente aussi Sonnet 5.5 et Opus 5.5 comme mieux adaptés au codage agentique complexe dans ce benchmark. À court terme, les utilisateurs de Haiku 4.5 doivent déterminer si le petit modèle satisfait toujours les exigences de chaque étape ciblée une fois intégrés les changements d’API et le nouveau nombre de tokens.
Sources et lectures complémentaires
- Annonce d’Anthropic sur Haiku 5.5Indique la date de lancement, les tâches visées et la disponibilité, et explique le calcul du coût moyen d’une tâche par l’entreprise. Son tableau de benchmarks présente les résultats de l’évaluation d’Anthropic.
- Page du modèle Haiku 5.5 sur Claude PlatformRépertorie les ID, les limites de contexte et de sortie, les tranches selon la longueur du prompt, les tarifs du cache et les plateformes prises en charge. La page Haiku 4.5fournit les tarifs et limites du modèle précédent.
- Guide de migration Haiku 5.5Détaille les changements de la Messages API et les erreurs à vérifier avant de migrer une intégration existante. La référence de l’API de comptage des tokensexplique le comptage d’une requête avec un modèle choisi.
- Article de Reuters sur le lancement du 7 octobreconfirme indépendamment la date de sortie. Les paramètres techniques et tarifs ci-dessus proviennent de la documentation actuelle d’Anthropic.



