Claude Haiku 5.5
Annoncé le 7 octobre 2026, Claude Haiku 5.5 vise les tâches courtes, répétitives et sensibles à la latence : classification, extraction, routage et sous-agents. Le contexte annoncé est long, mais le tarif augmente au-delà de 100 000 tokens de prompt.
01 Classification, extraction et sous-agents
Anthropic le positionne pour résumer, extraire des champs, classer des demandes et interroger des données. Dans un flux agentique, un modèle principal peut lui confier des tâches délimitées, comme retrouver une information dans un document.
Définis un format attendu et un jeu de cas difficiles avant de le brancher sur des données réelles. Mesure les réponses manquantes, les champs inventés et les mauvais routages, pas seulement la vitesse.
02 Contexte, vision et effort de réflexion
La documentation indique une entrée texte et images, une sortie texte, un contexte de 1M de tokens et jusqu’à 128K de sortie. Le raisonnement adaptatif est activé par défaut, avec un effort medium ; l’effort est réglable.
Le tokenizer est celui des Claude récents. Anthropic estime environ 30 % de tokens supplémentaires sur un même texte par rapport à Haiku 4.5. Une réduction du prix par token ne donne donc pas mécaniquement le même pourcentage d’économie sur tous les flux.
03 Où accéder à Haiku 5.5 ?
L’identifiant API Anthropic est claude-haiku-5-5. Les plateformes documentées incluent Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry et Claude Platform on AWS. Les identifiants, régions et contrats doivent être vérifiés sur la plateforme choisie.
Cette disponibilité API ne constitue pas une promesse de sélecteur Haiku accessible à tous les utilisateurs de l’application Claude, ni un abonnement gratuit à ces plateformes.
04 Tester les résultats, pas reprendre un classement
Les résultats de lancement sont des évaluations publiées par Anthropic. Les variantes, l’effort et le sous-ensemble d’un test peuvent changer la comparaison. Source IA ne revendique pas ici de mesure indépendante ni une équivalence générale avec un modèle plus grand.
Pour un agent, limiter les droits et prévoir une validation des actions sensibles. Pour une migration, vérifier les paramètres de génération : la documentation demande d’omettre temperature, top_p et top_k.
05 Deux tarifs selon la longueur du prompt
Relevé du 9 octobre 2026. API Anthropic, dollars par million de tokens, hors taxes et frais d’outils. Le seuil porte sur le prompt, pas uniquement sur la réponse.
- Prompt jusqu’à 100 000 tokens
- Entrée : 0,10 $. Sortie : 0,50 $. Lecture cache : 0,01 $. Écriture cache 5 minutes : 0,125 $ ; 1 heure : 0,20 $.
- Prompt au-delà de 100 000 tokens
- Entrée : 0,50 $. Sortie : 2,50 $. Lecture cache : 0,05 $. Écriture cache 5 minutes : 0,625 $ ; 1 heure : 1 $.
Les tokens de réflexion contribuent à la consommation. Le contexte de 1M ne signifie donc pas que les prompts longs restent au premier palier. Les prix d’un partenaire cloud et ceux d’un abonnement Claude sont à distinguer.
06 Quand préférer Sonnet ou Opus ?
Commencer par Haiku pour une extraction bien délimitée, puis examiner Claude Sonnet 5.5 si les erreurs persistent. Pour un agent principal ou un raisonnement plus exigeant, examiner Claude Opus 5.5. La décision se prend sur le taux de réussite et le coût total du flux, pas sur le nom de la gamme.
GPT-6 Luna est une autre fiche pertinente pour étudier une tâche à faible latence. Ce rapprochement par usage n’est pas un verdict de performance entre éditeurs.
Comparatifs pour choisir
Sources officielles
- Fiche modèle : fonctions, contexte, tarifs et plateformes
- Annonce du 7 octobre : usages, évaluations et cache Sonnet
- Grille API : seuil de 100 000 tokens et cache
Consultées le 9 octobre 2026. Spécifications et annonces de l’éditeur, sans test indépendant revendiqué.