Anthropic sort Claude Haiku 5.5 : le prix est considérablement réduit, mais le nouveau tokenizer consommera plus de tokens

📅 2026-10-08

Résumé :

Anthropic lance officiellement Claude Haiku 5.5, qui est le troisième modèle de la série Claude 5.5 et la nouvelle génération de modèle Haiku lancée près d'un an après Claude Haiku 4.5. Anthropic le positionne comme un modèle léger pour les tâches à haute concurrence, à faible latence et sensibles aux coûts, et en réduisant considérablement le prix de l'API, Haiku 5.5 entre directement dans les rangs compétitifs des modèles d'IA à faible coût actuels.

Indice d'intelligence de l'analyse artificielle (7 octobre 26).png

Selon les prix annoncés par Anthropic, pour les demandes inférieures à 100 000 jetons, le prix d'entrée de Claude Haiku 5.5 est de 0,10 USD par million de jetons, et le prix de sortie est de 0,50 USD par million de jetons. Par rapport aux prix de la génération précédente Haiku 4.5, qui étaient respectivement de 1 $ US et 5 $ US, le prix du livre a été directement réduit de 90 %.

Si la demande dépasse 100 000 jetons, le prix de Haiku 5.5 augmentera considérablement, les prix des entrées et des sorties s'élevant respectivement à 0,50 USD et 2,50 USD par million de jetons. Autrement dit, une fois le seuil de 100 000 Tokens dépassé, les prix des entrées et des sorties deviendront 5 fois le prix de base.

Anthropic a déclaré que, sur la base des calculs de charge de travail réels, le coût d'exploitation moyen de Haiku 5.5 est environ 75 % inférieur à celui de Haiku 4.5. L'une des raisons importantes pour lesquelles la baisse moyenne n'a pas atteint 90 % du prix annoncé est que Haiku 5.5 utilise un nouveau segmenteur de mots.

Le nouveau tokenizer est similaire à la méthode de tokenisation utilisée par Claude Sonnet 5.5 et Opus 5.5. Le même morceau de texte peut être calculé comme plus de jetons dans Haiku 5.5. Les propres instructions d'Anthropic montrent que la nouvelle méthode de segmentation des mots augmentera légèrement le nombre de jetons générés lors de l'exécution de la même tâche ; certains tests réels ont révélé que le même texte long peut consommer environ 25 à 30 % de jetons en plus dans Haiku 5.5 que dans Haiku 4.5.

Cela signifie que Haiku 5.5 a un « coût caché » qui est facilement négligé. Bien que le prix par million de jetons ait considérablement baissé, les frais réels payés par les utilisateurs dépendent également du nombre de jetons consommés par le modèle pour accomplir la tâche. Par conséquent, une simple comparaison du prix par million de jetons ne peut pas refléter pleinement les coûts d’exploitation réels des deux générations de modèles.

Haiku 5.5 dispose toujours d'une très grande fenêtre contextuelle, prenant en charge jusqu'à 1 million de jetons, et la longueur maximale de sortie atteint 128 000 jetons. Il prend également en charge les capacités de réflexion adaptative qui peuvent décider de manière dynamique de la quantité de ressources de raisonnement à investir en fonction de la complexité de la tâche.

Anthropic a spécifiquement souligné que l'objectif de Haiku 5.5 n'est pas de rivaliser avec Opus 5.5 ou Sonnet 5.5 pour toutes les tâches complexes, mais d'entreprendre un grand nombre de travaux à haute fréquence, répétitifs et sensibles à la vitesse de réponse. Par exemple, le résumé de texte, la classification de données, l'extraction d'informations, la requête de base de données, le routage de requêtes, la compression de contexte, etc. sont tous des scénarios d'application appropriés pour Haiku 5.5.

Dans le domaine de l'IA Agent, Haiku 5.5 est également conçu comme un modèle auxiliaire pour les grands modèles. Anthropic recommande aux développeurs de laisser Sonnet 5.5 ou Opus 5.5 être responsable de tâches principales complexes, puis de laisser Haiku 5.5 servir de sous-agent pour gérer un grand nombre d'opérations répétitives simples, réduisant ainsi le coût d'exploitation de l'ensemble du système d'agent.

1780331851_scale_1200.webp

Le développement de code est également l'un des domaines d'application importants de Haiku 5.5. Anthropic a déclaré que le modèle peut être utilisé comme sous-agent de codage du grand modèle Claude pour gérer les recherches de code, les modifications simples et d'autres tâches répétitives qui peuvent être divisées. Cependant, dans les tâches complexes de programmation d'agents en plusieurs étapes, Sonnet 5.5 et Opus 5.5 présentent encore des avantages plus évidents.

La vitesse est un autre argument de vente important de Haiku 5.5. Anthropic affirme qu'il s'agit du modèle le plus réactif de l'entreprise à ce jour, ce qui le rend particulièrement adapté au service client en temps réel, aux opérations de navigateur et aux applications nécessitant un retour rapide.

En plus de baisser le prix de Haiku 5.5 lui-même, Anthropic a également ajusté simultanément le prix de lecture du cache de Claude Sonnet 5.5. Les frais de lecture du cache sont réduits de 0,20 USD à 0,10 USD par million de jetons, soit une diminution de 50 %. Anthropic estime que ce changement peut réduire d'environ 20 % le coût réel de Sonnet 5.5 dans la plupart des charges de travail des agents, car les tâches des agents lisent souvent à plusieurs reprises le contenu du cache.

Ce qui est le plus intéressant à propos du Haiku 5.5, c'est sa concurrence avec des modèles moins chers. Basé sur un prix standard inférieur à 100 000 jetons, Haiku 5.5 se situe déjà dans la même fourchette de prix que le dernier modèle low-cost d'OpenAI. Cela signifie que les développeurs peuvent désormais obtenir un modèle avec une fenêtre contextuelle de millions de jetons, une prise en charge du raisonnement adaptatif et de solides capacités de codage à un prix de jeton très bas.

D'un autre côté, la ligne de démarcation des prix de 100 000 jetons peut également devenir un problème auquel les développeurs doivent accorder une attention particulière. Pour les requêtes de texte court ordinaires, ce seuil n'a généralement aucun impact ; mais pour les scénarios impliquant un long traitement de documents, des agents complexes, plusieurs séries de tâches de code et une grande quantité de saisie de contexte en même temps, le modèle peut facilement approcher, voire dépasser, 100 000 jetons. Une fois cette limite dépassée, les prix des intrants et des extrants augmenteront directement de 5 fois.

Cela rend également l'efficacité des jetons elle-même de plus en plus importante. Alors que le prix des modèles d’IA continue de baisser, les développeurs qui se concentraient auparavant uniquement sur « combien cela coûte par million de jetons » doivent désormais également prendre en compte le nombre de jetons consommés par le modèle pour accomplir la même tâche. Un modèle dont le prix unitaire est inférieur mais qui nécessite de générer plus de jetons pour accomplir la tâche n'aura pas toujours un coût final réel inférieur.

Anthropic propose actuellement Haiku 5.5 sur la plateforme Claude et des canaux tels qu'Amazon Web Services, Google Cloud et Microsoft Foundry, et l'a également ajouté à Claude Code. Les utilisateurs ordinaires peuvent utiliser Haiku 5.5 sur la page Web de Claude, ainsi que sur les applications iOS et Android.

En examinant l'ensemble de la gamme de produits Claude 5.5, Anthropic a formé une division du travail relativement claire : Opus 5.5 est responsable des tâches de raisonnement et d'agent les plus complexes, Sonnet 5.5 est responsable de l'équilibre entre performances et coût, et Haiku 5.5 se concentre davantage sur les scénarios à forte concurrence, à faible latence et à faible coût.

Par conséquent, la véritable compétitivité de Haiku 5.5 n'est pas seulement le « bon marché », mais la tentative d'Anthropic d'utiliser un prix unitaire inférieur pour pousser un modèle doté de solides capacités de raisonnement et d'agent dans des scénarios d'appel à grande échelle. Cependant, la nouvelle méthode de mesure des jetons et la hausse des prix après 100 000 jetons signifient également que les entreprises doivent calculer le coût total en fonction de la charge de travail réelle avant le déploiement, plutôt que de simplement examiner le prix annoncé par million de jetons.

Si les agents IA sont davantage popularisés à l'avenir, un grand nombre d'appels modèles passeront d'une simple question et réponse aujourd'hui à des dizaines, voire des centaines d'appels continus. Dans ce cas, le prix d'un seul appel, la vitesse de réponse et l'efficacité de la consommation des jetons affecteront directement les coûts d'exploitation de l'ensemble du système d'IA. Haiku 5.5 a été lancé dans ce contexte. Son véritable objectif n'est probablement pas de devenir le modèle Claude le plus puissant, mais de devenir le « moteur low-cost » qui supporte le plus grand volume d'appels de tout l'écosystème d'IA d'Anthropic.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire