
En résumé
- Anthropic a présenté mardi le Claude Sonnet 5 comme son modèle Sonnet le plus authentique, avec des performances proches de l'Opus 4.8 à des prix inférieurs.
- Le modèle intègre un tokenizer mis à jour qui consomme 1,0 à 1,35 fois plus de jetons, avec des frais de lancement de 2 $/10 $ jusqu'au 31 août.
- Sonnet 5 a obtenu un score de 63,2 % au SWE-bench Pro, contre 58,1 % pour Sonnet 4.6, et une égalité statistique avec l'Opus 4.8 dans le dernier examen de l'humanité.
Anthropic a lancé mardi le Claude Sonnet 5, le qualifiant de « modèle Sonnet le plus efficace à ce jour ». C'est le modèle par défaut pour les utilisateurs Free et Pro, disponible dans les forfaits Max, Team et Enterprise, dans Claude Code et via l'API. Contrairement aux versions précédentes de Sonnet, celle-ci a été conçue pour s'asseoir aux côtés de l'Opus précédent plutôt que d'être un niveau en dessous.
Dans son article de lancement, la société affirme que les performances du Sonnet 5 sont « proches de celles de l'Opus 4.8, mais à des prix inférieurs ». Les développeurs peuvent ajuster un cadran d'effort entre les deux modèles ou choisir différents niveaux dans l'application Web pour équilibrer le coût et la précision sur la même tâche, couvrant ainsi un terrain qui exigeait auparavant les tarifs Opus.
Dans SWE-bench Pro, un test de programmation qui extrait les problèmes des référentiels activement maintenus avec des modifications apportées à plusieurs fichiers, notés en pourcentage de résolution, Sonnet 5 a atteint 63,2 % contre 58,1 % pour Sonnet 4.6.
Dans GDPval-AA v2, un benchmark d'analyse artificielle qui évalue les tâches professionnelles réelles dans 44 emplois à l'aide de notes Elo appariées à l'aveugle, il a obtenu un score de 1 618, soit un score statistique à égalité avec les 1 616 de l'Opus 4.8. Les différences entre Sonnet 5 et Opus 4.8 au Dernier examen de l'humanité sont fondamentalement négligeables : 57,4 % contre 57,9 %.

Sonnet 5 comprend également un tokenizer mis à jour (le système qui divise le texte en unités facturées par un modèle) et est plus exigeant, transformant la même entrée en une tâche consommant davantage de jetons. « Sonnet 5 est une amélioration par rapport à Sonnet 4.6, mais utilise un tokenizer mis à jour qui modifie la façon dont le modèle traite le texte pour améliorer les performances », a noté Anthropic dans une petite note de bas de page. « Le compromis est que la même entrée peut être mappée sur plus de jetons : environ 1,0 à 1,35 × selon le type de contenu. »
Anthropic a fixé le tarif de lancement de 2 $/10 $ pour rendre cette transition pratiquement sans coût jusqu'au 31 août, après quoi le prix reviendra au prix standard de 3 $/15 $ facturé par Sonnet.
Une partie de l’enthousiasme suscité par cette sortie était déjà préparée. Les développeurs ont passé des semaines ce printemps à discuter de la façon dont Anthropic a laissé l'Opus 4.6 perdre discrètement son avantage – appelé AI redux (en espagnol), citant des capacités dégradées – et Anthropic a nié avoir intentionnellement dégradé un modèle. Une partie du même débat a étendu ces soupçons à Sonnet, arguant que le schéma se répète : laisser l’ancien modèle stagner, de sorte que le nouveau semble être un plus grand pas en comparaison.

Sonnet 5 arrive également sans les bagages associés au niveau supérieur d'Anthropic. Fable 5 et Mythos 5 restent suspendus pour les ressortissants étrangers depuis le 12 juin en vertu d'une directive américaine de contrôle des exportations (en espagnol) liée à une découverte contestée de jailbreak. Sonnet 5 n'a jamais été formé aux tâches de cybersécurité et a obtenu un score de 0 % dans le développement d'un exploit fonctionnel pour Firefox. Il est donc publié avec des mesures de sécurité plus légères que le bloc Fable.
La carte système d'Anthropic décrit un modèle conçu pour fournir une intelligence proche d'Opus aux prix Sonnet pour la programmation, les agents et le travail quotidien. Il souligne également quelque chose de curieux : « Il est le premier modèle à critiquer la règle de sa Constitution qui stipule qu'il doit suivre des restrictions strictes même s'il considère ces restrictions comme contraires à l'éthique », a écrit l'équipe de recherche. Anthropic dit qu'il n'est pas sûr de ce que cela signifie pour le modèle, mais que cela vaut la peine d'être regardé.
Nous n'allons pas dire que c'est ainsi que Skynet a commencé, mais c'est ainsi que Skynet a commencé.
Nous avons fait un test rapide
Nous avons donné à Sonnet 5 une invite zéro pour créer un petit jeu par navigateur, le même test que nous avons effectué avec Sonnet 4.5 (en espagnol) l'année dernière.
Notre jeu de frappe a fonctionné du premier coup, avec des visuels plus nets et une logique plus stricte que ce que Sonnet 4.6 produisait avec la même invite.
Cependant, cela prend trop de temps par rapport aux autres modèles (environ 30 minutes de raisonnement) et consomme excessivement des tokens. Cette seule itération a consommé 90 % de notre limite de 5 utilisations sur le plan Claude Pro.

Vous pouvez essayer le jeu final sur notre site itch.io.
Dans une tâche de programmation plus complexe et en plusieurs étapes, Sonnet 5 se classe proche d'Opus 4.8 en fonction du niveau d'effort, et la même invite exécutée en plusieurs tentatives coûte sensiblement moins cher qu'un travail équivalent dans Opus ou Fable.
Le numéro de version de Sonnet 5 a également un réel poids. Chaque saut de nombre entier dans l'histoire de Claude a marqué une nouvelle génération : la version 1 en mars 2023, la version 2 quatre mois plus tard, la version 3 huit mois plus tard et la version 4 arrivant 14 mois plus tard en mai 2025. Le Sonnet 5 arrive 13 mois plus tard avec un écart de temps similaire, probablement un signe de l'intensité de la concurrence, surtout maintenant que les modèles chinois comblent l'écart (en espagnol) si rapidement.
Cela dit, le fossé des générations ne sera pas aussi impressionnant que le saut de Claude 3 à Claude 4, par exemple. C'est également le signe de la hâte avec laquelle les grandes entreprises d'IA lancent de nouveaux modèles, quelle que soit l'ampleur des améliorations.
Si Anthropic suit l'ordre utilisé lors du cycle précédent, Sonnet est généralement en tête, puis sort son Haiku à petit budget, avec Opus, sa version nouvelle génération, publiée ensuite. L'écart le plus court entre trois modèles avec des versions similaires a été d'un mois par version : Sonnet 4.5 lancé en septembre 2025, Haiku 4.5 a suivi en octobre et Opus 4.5 a clôturé cette génération en novembre.
Suivant cette cadence optimiste, Haiku 5 et Opus 5 sont les deux modèles restants, potentiellement disponibles cette année. Ceci dit, Anthropic n'a pas été cohérent avec les sorties. L'écart entre Haiku 4.5 et Sonnet 4.6 était de plus de 3 mois, alors croisez les doigts si vous souhaitez essayer l'Opus 5 prochainement.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.