La Fable 5.1 la plus puissante de Claude est sortie, avec 8 articles sur la liste, le prix est réduit jusqu'à 45% et le mécanisme anti-distillation est en ligne

📅 2026-09-02

Résumé :

Fable 5.1 et Mythos 5.1 sont sortis ! Il s'est classé premier dans les 8 tests de référence publics et son prix a chuté jusqu'à 45 %. Surtout dans les domaines de la recherche scientifique et du codage, il a clairement laissé derrière lui Fable 5 et son voisin GPT-5.6 Sol. D'un point de vue plus intuitif, exécutant désormais Fable 5.1 avec des niveaux d'inférence moyens et faibles, les performances sont fondamentalement équivalentes à l'ancienne version de Mythos 5 avec un niveau d'inférence extrêmement élevé, voire le plus élevé. Dans cette vague, "Fable" a tué "Mythos".

En termes de prix, Fable 5.1 a abaissé le prix de lecture du cache à 0,25 USD par million de jetons, soit une réduction de 75 %.

Les prix des entrées et des sorties sont conformes à ceux de Fable 5, respectivement à 10 $ et 50 $ par million de jetons.

Il semble qu'un seul prix ait été réduit, mais l'impact réel est relativement important, car dans la tâche de l'agent, la lecture du cache représente la majorité du coût.

Les données fournies par Anthropic indiquent que le coût des charges de travail typiques est environ 25 % inférieur à celui de Fable 5. S'il s'agit d'une tâche hautement intelligente, elle peut économiser jusqu'à 45 %.

La vidéo de sortie officielle a quelque chose à dire :

Peu importe la tâche que vous avez demandé à Claude de gérer auparavant, Fable 5.1 peut faire plus et mieux faire les parties les plus difficiles.

Il le fait parce qu'il gère efficacement les tâches en plusieurs étapes.

Dans ce type de tâche, si une petite erreur se produit lors de la deuxième étape, l'ensemble s'effondrera à la 40ème étape, mais Fable 5.1 peut fournir une sortie stable tout au long du processus.

Si vous rencontrez un problème qui ne peut pas être résolu, il vous indiquera quelles solutions vous avez essayées et où vous êtes bloqué.

Le chercheur Flix Rieseberg a également mentionné spécifiquement qu'en termes d'écriture, Fable 5.1 réduit l'utilisation de polices grasses, utilise moins de titres, de listes ou de guillemets et suit mieux les éléments de style.

Ce que je veux dire, c'est : pouvez-vous ouvrir vos conseils de style en open source ?

Toujours fidèle à son modèle, Fable 5.1 est ouvert à tous les utilisateurs, et Mythos 5.1 n'est disponible que pour les organisations de cybersécurité et de sciences de la vie approuvées via le programme Trusted Access.

Recherche scientifique pratique : conception de protéines, génération de cartes Vénus, accélération GPU

En plus des scores, Anthropic a également démontré les résultats pratiques de Fable 5.1 et Mythos 5.1 dans le domaine de la recherche scientifique.

En termes de conception de protéines, Anthropic a utilisé Mythos 5.1 pour utiliser des outils open source de conception et de repliement de protéines afin de concevoir des protéines de liaison à haute affinité, et a envoyé le plan à deux institutions externes pour vérification expérimentale.

Sur trois cibles, l'affinité de liaison de la conception Mythos 5.1 était 10 fois supérieure à celle de la meilleure solution du concours de conception de protéines Adaptyv Bio. Sur l’ensemble des 12 cibles, le taux de réussite était proche de 50 pour cent, comparé au taux de réussite typique de 10 à 15 pour cent dans le domaine actuel de la conception de protéines.

Les protéines de liaison à haute affinité constituent la première étape de nombreux processus courants de développement de médicaments et déterminent directement si le médicament peut agir à des doses plus faibles.

En astronomie, Fable 5.1 a formé un réseau neuronal basé sur des images radar prises par le vaisseau spatial Magellan de la NASA il y a plus de 30 ans pour générer une nouvelle carte topographique haute résolution d'un tiers de la surface de Vénus.

Les cartes topographiques disponibles auparavant ne couvraient qu'un cinquième de Vénus, avec des résolutions comprises entre 10 et 20 kilomètres. Fable 5.1 augmente la résolution à 2 à 3 kilomètres et la précision de la hauteur est 25 % plus élevée qu'auparavant. Cette carte a été publiée en open source sous licence CC et sera utilisée comme référence pour les prochaines missions NASA VERITAS et ESA EnVision afin d'aider à identifier les caractéristiques géologiques clés pour les observations futures.

En termes de biologie computationnelle, Mythos 5.1 améliore jusqu'à 2,5 fois la vitesse d'exécution de 7 modèles d'apprentissage profond open source en écrivant des noyaux GPU personnalisés et en mettant en cache les résultats intermédiaires, et le résultat est totalement cohérent.

Dans la recherche réelle, les biologistes devront peut-être exécuter ces modèles des milliers de fois, testant toutes les mutations possibles à proximité de chaque gène humain. Les modèles optimisés peuvent réduire les coûts du GPU de 30 à 60 %.

Ce type d'optimisation prend généralement plusieurs semaines à une équipe d'ingénierie des performances, et de nombreux laboratoires universitaires ne peuvent tout simplement pas se le permettre. Cependant, Mythos 5.1 l'a fait en quelques jours seulement et s'appuyait uniquement sur du code open source.

Anthropic prévoit d'ouvrir ces optimisations en open source dans un avenir proche.

Le mécanisme anti-distillation est en ligne

Avec la sortie de Fable 5.1, il existe des réglementations spéciales et des modifications de l'API.

Parlons d'abord brièvement de la sécurité.

Le taux de faux positifs en matière de sécurité réseau de Fable 5.1 est 60 % inférieur à celui de Fable 5. Son utilisation est désormais autorisée pour découvrir des vulnérabilités logicielles, mais le développement d'exploits est toujours interdit. Les tâches à double usage telles que les tests d'intrusion, la génération d'exploits, l'analyse des vulnérabilités basée sur les binaires, etc. seront toujours redirigées vers le modèle de la série Opus.

Les taux de faux positifs pour les questions fondamentales de biologie et de médecine ont été réduits de 85 %, mais les requêtes impliquant la recherche et le développement en sciences de la vie sont toujours acheminées vers le traitement du modèle Opus, et les professionnels doivent y accéder via le programme de validation des sciences de la vie (LSVP) de Mythos 5.1.

Parlons ensuite du nouveau mécanisme anti-distillation.

À partir d'aujourd'hui, les comptes API nouvellement enregistrés ne peuvent pas modifier manuellement le contexte de Claude lors de plusieurs cycles de conversations tout en conservant les enregistrements de la chaîne de pensée.

Il existe une technique courante qui a déjà été publiquement enregistrée : altérer manuellement le contexte précédent de Claude au cours de plusieurs séries de conversations, tout en conservant délibérément l'enregistrement de la chaîne de pensée. Cela permet au modèle de rejouer le raisonnement qu’il a produit sous un autre ensemble d’instructions sous un nouvel ensemble d’instructions, éventuellement contradictoires.

Cette route est désormais bloquée.

L'approche consiste à ajouter une signature à chaque élément de la chaîne de réflexion.

Lorsque l'utilisateur renvoie la réponse de l'assistant à l'API lors de requêtes ultérieures, le système utilisera cette signature pour faire deux choses : vérifier si le modèle actuel a le droit de lire ce bloc et vérifier si l'intégralité de la conversation avant ce bloc (y compris les mots d'invite du système, la liste d'outils et tous les messages historiques) est exactement la même que lors de sa génération initiale.

La vérification de la signature échouera chaque fois qu'un élément de la conversation sera touché.

Que faire après un échec dépend d'un paramètre prefix_mismatch_behavior défini par le développeur : la valeur par défaut est "error", qui renvoie directement un code d'état 400 et la demande est rejetée ; s'il est défini sur "drop_block", le système supprimera silencieusement le bloc et toutes les chaînes de pensées qui le suivent, et la requête elle-même sera exécutée comme d'habitude.

La partie rejetée n'est pas comptée (les gens sont plutôt bizarres) et sera répertoriée dans le tableau input_transformations de la réponse.

Quelles opérations déclencheront l'échec de la vérification ?

La documentation donne une liste détaillée : modifier, réorganiser ou supprimer tout message utilisateur/assistant/système précédent, modifier le mot d'invite du système de niveau supérieur, effectuer des ajouts, suppressions ou renommer la liste d'outils, supprimer un bloc de chaîne de pensée de l'historique de la conversation mais conserver les blocs suivants et faire référence à une image ou à une URL de document qui renvoie un contenu différent entre les requêtes.

L'une des solutions ci-dessus rendra invalides tous les blocs de la chaîne de réflexion suivants.

À l'inverse, certaines opérations sont sécurisées :

L'ajout de nouveaux messages à la fin de la conversation, la suppression du bloc de chaîne de réflexion depuis le début de l'historique, la modification des paramètres de requête tels que max_tokens, l'augmentation ou la diminution des balises cache_control et le compactage côté serveur ou l'édition du contexte ne déclencheront pas d'échecs de vérification.

Il existe également une conception de vérification de chaîne. Chaque bloc de la chaîne de réflexion enregistrera les informations de son bloc précédent, formant une chaîne croisée. Les blocs peuvent être supprimés de la tête de la chaîne, mais si l'un d'entre eux est supprimé du milieu, chaque bloc qui le suit deviendra invalide et la chaîne entière sera invalidée à partir du point de rupture.

Afin d'éviter que les développeurs ne soient bloqués, Anthropic propose également une série d'alternatives qui peuvent obtenir le même effet sans toucher à l'historique.

Besoin de modifier les instructions à mi-chemin ? Utilisez les messages système en cours de conversation au lieu de modifier directement le mot d'invite de niveau supérieur.

Besoin d'ajouter un rappel temporaire pour chaque tour ? Utilisez le message système de niveau rond avec le paramètre clear_at pour remplacer l'ancienne méthode "insérer d'abord puis supprimer".

Besoin d'ajouter ou de supprimer des outils à mi-chemin ? Utilisez les blocs tool_addition et tool_removal au lieu de modifier directement la liste d'outils.

Besoin de découper le contexte ? Remplacez la troncature grossière côté client par une compression côté serveur et une édition contextuelle.

Si vous utilisez des produits officiels tels que Claude Code, claude.ai, Claude Managed Agents ou Claude Agent SDK, vous n'avez rien à changer. Ils ont automatiquement veillé à ce que le préfixe de conversation ne soit pas falsifié.

Mais si vous êtes un développeur qui appelle directement l'API Messages, la suggestion d'Anthropic est d'utiliser le tableau de messages strictement en ajout uniquement, puis d'exécuter un test de session complet en plusieurs tours avec prefix_mismatch_behavior défini sur le mode "drop_block" pour voir s'il y a des entrées prefix_binding_mismatch dans le journal.

Le document final mentionne également spécifiquement un scénario dans lequel il est facile d'avoir des ennuis.

Si vous gérez un outil ou un framework et que les utilisateurs utilisent leurs propres clés API pour l'appeler, les utilisateurs nouvellement enregistrés bénéficieront de cette vérification plus tôt. Étant donné que la propre clé du développeur est probablement enregistrée avant le 31 août, elle n'a pas encore été appliquée.

Dans ce cas, il est recommandé de définir de manière proactive prefix_mismatch_behavior et de le tester à l'avance. N'attendez pas que les utilisateurs plantent avant de le découvrir.

Encore une chose

Avec une telle agitation venant de la société A, OpenAI à côté ne pourra certainement pas rester les bras croisés.

Mais leur nouveau modèle Astra n'est vraiment pas encore prêt, ils doivent donc d'abord donner un aperçu symbolique.

A l'occasion de la sortie de Fable 5.1 et d'OpenAI Astra, Ilya est également rarement sorti pour s'exprimer, appelant au renforcement de la sécurité des réseaux.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire