Claude 5.1 vient de sortir ! Le modèle le plus puissant au monde est arrivé

chaincatcherchaincatcher

Original Follow AI's Machine Heart


Anthropic vient de lancer les modèles de nouvelle génération Claude Fable 5.1 et Claude Mythos 5.1.

Anthropic affirme que Claude Fable 5.1 est l'un des modèles accessibles au public les plus puissants, conçu pour le raisonnement complexe, les tâches de longue durée et les flux de travail d'agents. Claude Mythos 5.1 représente leur exploration des limites supérieures de capacités.

Il est important de noter que bien que les deux partagent les mêmes capacités de modèle fondamental, des mesures de sécurité différentes selon les scénarios d'utilisation.

Fable 5.1 est ouvert aux utilisateurs généraux, aux développeurs et aux entreprises, tandis que Mythos 5.1 est destiné aux partenaires sélectionnés dans des domaines à haut risque, avec des contrôles d'accès plus stricts.

En d'autres termes, l'un est destiné aux tâches du monde réel, tandis que l'autre est conservé dans un environnement plus strictement contrôlé. Cela pourrait aussi être l'exploration par Anthropic des formes futures des produits d'IA : les modèles les plus puissants ne sont pas nécessairement fournis à tous sous la même forme.

La déclaration officielle indique que ces deux modèles représentent des avancées significatives pour la série Claude. Ils démontrent comment Anthropic continue de faire progresser le déploiement sûr tout en améliorant les capacités des modèles.

En tant que modèle le plus puissant en apparence, Fable 5.1 reste impressionnant. Les données officielles montrent que Fable 5.1 surpasse le précédent fleuron Fable 5 dans plusieurs tests de référence.

Cependant, avec des capacités supérieures, le coût a diminué. Anthropic indique que Fable 5.1 maintient le même prix de base, tandis que le coût des lectures en cache a diminué de 75 % par rapport à Fable 5. En pratique, cela réduit le coût global du modèle pour les charges de travail typiques d'environ 25 % ; pour les charges de travail fortement agentisées, les coûts peuvent être réduits jusqu'à 45 %.

Il semble que même les modèles les plus puissants se concentrent sur le rapport coût-efficacité.

Examinons cela de plus près.

 

Les modèles de niveau inférieur rattrapent la génération précédente, Fable 5.1 se concentre sur le « rapport coût-efficacité »

Plutôt que de simplement rafraîchir le classement, Anthropic veut souligner cette fois : Fable 5.1 peut accomplir des tâches qui nécessitaient auparavant les niveaux élevés de Fable 5 avec des coûts d'inférence inférieurs.

Selon les tests officiels, Fable 5.1 a déjà atteint des performances proches voire supérieures à celles de Fable 5 à des niveaux d'inférence faibles à moyens. Claude Code utilise par défaut un niveau d'inférence élevé, tandis que Claude Cowork et Claude .ai utilisent par défaut un niveau moyen, permettant aux utilisateurs d'ajuster entre vitesse, coût et efficacité selon la complexité de la tâche.

Plus précisément, Fable 5.1 a obtenu un score de 52,6 % dans le benchmark d'agent de recherche scientifique Terminal - Bench - Science 0.1, plus du double des 24,7 % de Fable 5 ; dans Terminal - Bench 4.0, Fable 5.1 a atteint 55,8 %, et le plus performant Mythos 5.1 a encore atteint 60,9 %.

Dans les tests de travail intellectuel, d'opérations informatiques et de processus métier, le nouveau modèle a également montré des améliorations. Les scores AutomationBench sont passés de 17,1 % pour Fable 5 à 31,4 %, et CursorBench 3.2.0 s'est amélioré de 70,5 % à 73,4 %.

Dans plusieurs tests de référence, les scores de Fable 5.1 ont dépassé ceux de Fable 5, avec les améliorations les plus significatives observées dans les agents de recherche scientifique et les capacités de processus métier.

Dans le test Terminal - Bench 4.0, Fable 5.1 et Mythos 5.1 ont tous deux surpassé le Mythos 5 de la génération précédente à différents niveaux d'inférence.

Dans le test Terminal - Bench - Science 0.1, Fable 5.1 a atteint un score maximal de 52,6 %, plus de deux fois celui de Fable 5.

Anthropic estime qu'un changement important dans Fable 5.1 est sa plus grande volonté de remonter aux causes profondes des problèmes, le rendant plus adapté à l'exécution de tâches complexes durant des heures voire des dizaines d'heures.

La société d'investissement Millennium a constaté lors de tests qu'un morceau de code interne échoue environ une fois tous les millions d'exécutions. Ce problème avait tourmenté l'équipe d'ingénierie pendant quatre à cinq ans, et d'autres modèles n'avaient pas identifié la cause. Fable 5.1 a localisé le problème dans un bug d'une bibliothèque de programme tierce en désassemblant la bibliothèque du fournisseur externe et en comparant les fichiers core dump.

Ramp a également exécuté Fable 5.1 en continu pendant 38 heures. Après avoir découvert que les résultats d'apprentissage automatique d'origine étaient affectés par des erreurs d'étiquetage, le modèle a corrigé le problème de manière autonome et a lancé simultanément six séries d'expériences, compilant finalement de nouveaux résultats et recommandations ultérieures.

 

De l'écriture de code à la réalisation de recherches scientifiques

Dans cette version, Anthropic a accordé une place importante à la discussion des performances de Fable 5.1 et Mythos 5.1 dans la recherche scientifique.

Dans les expériences de conception de protéines, les chercheurs ont demandé à Mythos 5.1 d'utiliser des outils open source de conception et de repliement de protéines, puis ont envoyé les conceptions générées à deux institutions externes pour validation expérimentale.

Pour trois protéines cibles, l'affinité de liaison des ligands conçus par Mythos 5.1 a atteint dix fois supérieure à celle des meilleures solutions du concours de conception de protéines lié à Adaptyv Bio. Face à douze protéines cibles, le taux de succès des ligands efficaces du modèle a approché 50 %, alors que le niveau industriel commun fourni par Anthropic est de 10 % à 15 %.

Fable 5.1 a également utilisé des images radar recueillies par la sonde spatiale Magellan de la NASA il y a plus de 30 ans pour générer une nouvelle carte d'élévation haute résolution pour environ un tiers de la surface de Vénus.

Images radar de Vénus prises par la sonde spatiale Magellan de la NASA, avec un petit volcan bouclier d'environ 15 kilomètres de diamètre au centre.

La carte originale ne pouvait montrer des détails qu'à une échelle de 10 à 20 kilomètres, tandis que la nouvelle carte améliore la résolution à 2 à 3 kilomètres, avec une précision de mesure de hauteur améliorée jusqu'à 25 %. Anthropic prévoit de publier cette carte sous une licence de partage de connaissances pour les missions futures telles que VERITAS de la NASA et EnVision de l'Agence spatiale européenne.

Dans le domaine de la biologie computationnelle, Mythos 5.1 a amélioré la vitesse d'exécution de sept modèles d'apprentissage profond open source pour les protéines et la génomique jusqu'à 2,5 fois en écrivant des noyaux GPU personnalisés et en mettant en cache les résultats intermédiaires, tout en maintenant des résultats de sortie cohérents. Dans certaines tâches d'analyse du génome entier, on s'attend à réduire les coûts de GPU de 30 % à 60 %.

Après optimisation de sept modèles open source pour les protéines et la génomique, la vitesse d'inférence de Mythos 5.1 a augmenté de 1,4 à 2,5 fois.

Anthropic vise à utiliser ces cas pour démontrer l'évolution du modèle. Celui-ci passe de l'organisation d'informations et de l'écriture de code à la proposition de solutions, l'exécution d'outils et la fourniture de résultats de recherche validables expérimentalement.

Les prix du cache ont chuté de 75 %, les tâches d'agent devenant jusqu'à 45 % moins chères.

Au-delà des performances, le prix est le changement le plus direct pour Fable 5.1.

Les prix d'entrée et de sortie de Fable 5.1 n'ont pas été ajustés, restant à 10 $ par million de jetons et 50 $ respectivement, mais le prix de lecture du cache a été réduit de 75 %, tombant à 0,25 $ par million de jetons.

La lecture du cache désigne la réutilisation par le modèle d'un contexte déjà traité. Sa proportion peut être limitée dans les sessions de questions-réponses ordinaires, mais dans les tâches d'agent nécessitant la lecture répétée de bases de code, d'historiques de dialogue et de résultats d'outils, la mise en cache constitue souvent un coût majeur.

Selon les calculs d'Anthropic basés sur les données d'utilisation réelles d'août 2026, le coût global de l'exécution de tâches typiques avec Fable 5.1 est environ 25 % inférieur à celui de Fable 5 ; pour les tâches d'agent complexes avec des contextes plus longs et des appels d'outils fréquents, la réduction des coûts peut atteindre environ 45 %.

Après la réduction des prix de lecture du cache, le coût des tâches typiques avec Fable 5.1 est réduit d'environ 25 %, tandis que le coût des tâches hautement agentisées est réduit jusqu'à environ 45 %.

Fable 5.1 est désormais disponible sur Claude .ai, Claude Code et Claude API, et est également disponible via AWS, Google Cloud et Microsoft Azure. Les développeurs peuvent appeler le nouveau modèle via claude - fable -5-1.

 

Mécanisme anti-distillation renforcé

Fable 5.1 et Mythos 5.1 partagent en réalité le même modèle sous-jacent, la principale différence étant les restrictions de sécurité.

Fable 5.1 est entièrement accessible aux utilisateurs généraux et aux entreprises ; Mythos 5.1 a des restrictions moins strictes en matière de cybersécurité et de sciences de la vie et n'est actuellement disponible que pour les individus et institutions sélectionnés.

Dans le domaine de la cybersécurité, Fable 5.1 peut déjà aider les utilisateurs à découvrir des vulnérabilités logicielles mais ne peut toujours pas générer directement des programmes d'exploitation. Les tâches à double usage telles que les tests d'intrusion, la génération d'exploits et l'analyse de vulnérabilités basée sur des fichiers binaires peuvent encore être renvoyées à des modèles avec des restrictions plus strictes.

Après ajustements, la nouvelle version du mécanisme de protection de la cybersécurité a réduit les faux positifs d'environ 60 % par rapport à Fable 5. Le taux de faux positifs des mécanismes de biosécurité sur les questions de biologie fondamentale et médicales a également diminué de 85 %, tandis que les capacités avancées liées à la recherche en sciences de la vie sont principalement accessibles via le programme d'examen Mythos 5.1.

Anthropic a également lancé Enterprise Frontier Safeguards. Les entreprises peuvent stocker leurs données dans leur infrastructure cloud contrôlée, l'entreprise étant responsable des révisions manuelles par défaut, obtenant ainsi des effets de confidentialité proches de la « zéro rétention des données » tout en conservant des capacités de surveillance de la sécurité. Ce mécanisme devrait être introduit progressivement à partir de cet automne.

Pour la distillation de modèles à grande échelle, Fable 5.1 a également ajouté de nouvelles restrictions. Les comptes API créés après cette date ne pourront pas modifier manuellement le contexte précédent dans les dialogues multi-tours tout en conservant les enregistrements de pensée historiques de Claude. Anthropic indique que ce changement vise principalement à bloquer une méthode d'extraction de capacités connue du public.

De plus, pour répondre aux exigences de la loi européenne sur l'intelligence artificielle, la sortie texte de Fable 5.1 inclura des filigranes invisibles. Anthropic a également commencé des tests à petite échelle d'API de détection, initialement accessibles aux agences de réglementation, aux médias, aux organisations de vérification des faits et aux institutions de recherche.

Enfin, les internautes ont raison ; les premiers arrivés peuvent utiliser 5.1 en premier.

Ce contenu est fourni à titre informatif et éducatif uniquement et ne constitue pas un conseil en investissement lié à BTCC. BTCC s’efforce de garantir la véracité, l’exactitude et l’originalité du contenu ci-dessus, sans pouvoir toutefois les garantir.

Recommandé

Ce que révèlent les résultats du T2 2026 des actions américaines et chinoises sur les agents IABTCC Daily (9.7) | Le KOSPI bondit de 4,61 %, les ETF Bitcoin enregistrent 987 millions de dollars d'entrées nettes hebdomadairesLa vague « anti-data centers » déferle sur les États-Unis, Bessent reproche aux géants du cloud de « ne pas savoir gagner les cœurs »Jensen Huang au G20 : NVIDIA investira près de 1 000 milliards de dollars aux États-Unis cette année, l'IA est une infrastructure essentielle comme l'eau et l'électricitéBTCC Daily (9.4) | Le Bitcoin franchit les 82 000 $, les ETF enregistrent 731 millions de dollars d'entrées nettes quotidiennes