Anthropic a officiellement publié aujourd'hui la dernière génération du modèle de langage à grande échelle Claude Opus 4.8, qui se concentre sur l'amélioration de ses performances dans les tâches « d'agent » telles que la génération de code, le raisonnement multidisciplinaire, le fonctionnement automatique de l'ordinateur, le travail de connaissances et l'analyse financière. Il est officiellement décrit comme un « partenaire de collaboration plus efficace ». Les utilisateurs qui ont participé au test ont rapporté que l'Opus 4.8 fonctionnait de manière plus fiable et faisait des jugements plus précis lors de l'exécution de tâches d'agent complexes, tout en montrant également des améliorations significatives en matière d'honnêteté.

Anthropic a déclaré que les premiers résultats des tests montrent que l'Opus 4.8 est plus susceptible de marquer de manière proactive ses incertitudes et de faire moins d'affirmations infondées. Les données d'évaluation interne montrent que par rapport à la version précédente, Opus 4.8 est environ quatre fois moins susceptible d'ignorer les erreurs dans le code auto-généré, ce qui signifie que la capacité « d'auto-correction » du modèle en matière de révision du code et de contrôle qualité a été considérablement améliorée.
Lors du test d’alignement, Opus 4.8 a établi un nouveau record en termes de prise en charge indépendante des utilisateurs et de sauvegarde des meilleurs intérêts des utilisateurs et d’autres « caractéristiques prosociales ». En revanche, l'incidence des « comportements d'inadéquation » tels que la tromperie implicite, les comportements trompeurs, etc. est plus faible que dans l'Opus 4.7 et au même niveau que le modèle préliminaire de Claude Mythos qui n'était auparavant ouvert qu'à un petit nombre de tests institutionnels.
Anthropic a également donné des résultats spécifiques dans plusieurs tests de référence publics : Opus 4.8 a obtenu un score de 69,2 % sur le benchmark d'ingénierie logicielle SWE-Bench Pro, surpassant les modèles concurrents tels que GPT-5.5 et Gemini 3.1 Pro. Il présente un avantage dans plusieurs projets de test, mais il est toujours en tête par GPT‑5.5 sur le benchmark d'encodage de terminal. En termes de performances, la vitesse d'inférence en mode rapide de l'Opus 4.8 a été augmentée à 2,5 fois celle du modèle précédent, et le prix a été réduit à environ un tiers de celui de l'ancien modèle, abaissant encore le seuil global d'une utilisation haute performance.
Parallèlement au lancement du nouveau modèle, Anthropic a également annoncé l'ajout d'un certain nombre de nouvelles fonctionnalités au système de produits, notamment des « flux de travail dynamiques » pour les développeurs d'entreprise (aperçu de recherche). Cette fonctionnalité permet à Claude de décomposer les tâches volumineuses, de planifier les étapes de travail et de planifier des centaines de sous-agents en parallèle au sein d'une seule session dans l'environnement Claude Code pour effectuer des opérations de migration au niveau de la base de code sur des centaines de milliers de lignes de code. Il est actuellement disponible pour les plans d'abonnement Claude Code Enterprise Edition, Team Edition et Max.
En termes de contrôle interactif, Anthropic a ajouté une fonction « contrôle du niveau d'effort » permettant aux utilisateurs de Claude.ai et Cowork de choisir les ressources de calcul et la profondeur de raisonnement investies par le modèle dans une seule réponse. Si les utilisateurs choisissent un niveau d'effort inférieur, ils peuvent obtenir des temps de réponse plus rapides et réduire la consommation des quotas, tandis que l'Opus 4.8 passe par défaut au mode « effort élevé », qui, selon les responsables, constitue le meilleur équilibre entre la qualité des réponses et l'expérience utilisateur.
Pour les développeurs, Anthropic a mis à jour l'API Messages pour accepter les entrées de commandes au niveau du système dans le tableau des messages. Cela signifie que les développeurs peuvent ajuster dynamiquement le code de conduite et les paramètres de rôle de Claude pendant l'exécution des tâches sans rouvrir une nouvelle session, contribuant ainsi à créer des flux de travail automatisés en plusieurs étapes plus flexibles et des applications au niveau de l'entreprise.
Anthropic a déclaré que Claude Opus 4.8 est généralement disponible dans le monde entier à partir d'aujourd'hui et que son prix d'utilisation régulière reste le même que celui de l'Opus 4.7. La société a également révélé qu'elle travaillait sur de nouveaux modèles moins coûteux avec le même niveau de fonctionnalités, ainsi que sur une classe de modèles « nouvelle génération » dotés de capacités allant au-delà de l'Opus 4.8.
En termes de feuille de route du modèle haut de gamme, Anthropic teste un modèle de pointe nommé Claude Mythos avec quelques institutions partenaires et continue de développer des garde-corps de sécurité et des spécifications d'utilisation plus strictes autour de ce modèle. La société a déclaré qu'elle prévoyait de rendre les modèles de niveau Mythos disponibles à tous les clients « dans les semaines à venir », renforçant ainsi sa compétitivité dans des scénarios tels que l'audit de sécurité au niveau de l'entreprise, l'analyse de code et l'aide à la décision complexe.