Anthropic lance Claude Opus 4.8 : plus rapide, plus intelligent et au même prix que son prédécesseur

Anthropic lance Claude Opus 4.8 : plus rapide, plus intelligent et au même prix que son prédécesseur

En résumé

  • Anthropic a sorti Opus 4.8 avec 69,2% dans SWE-bench Pro, battant GPT-5.5 avec 58,6% et Gemini 3.1 Pro avec 54,2%, au même prix.
  • Le nouveau modèle comprend cinq niveaux de raisonnement et des flux de travail dynamiques dans Claude Code pour les forfaits Enterprise, Team et Max.
  • Malgré ces progrès, DeepSeek V4 Pro offre des performances comparables à seulement 0,87 $ par million de jetons de sortie, soit 57 fois moins cher.

Six semaines. C'est le temps qu'il a fallu à Anthropic pour passer de l'Opus 4.7 à l'Opus 4.8.

Le nouveau modèle est plus rapide et plus intelligent lors des tests de référence et est doté d'une multitude de nouvelles fonctionnalités, même si le prix n'a pas changé : il est toujours de 5 $ par million de jetons d'entrée et de 25 $ par million de jetons de sortie.

Il existe également un mode rapide qui exécute le même modèle à une vitesse 2,5 fois supérieure pour 10 $ d'entrée et 50 $ de sortie par million. Anthropic note que ce tarif est désormais trois fois moins cher que celui du mode rapide sur les modèles précédents, ce qui est une manière élégante de dire qu'il était beaucoup plus cher auparavant.

SWE-bench Pro est probablement la référence la plus importante pour mesurer la qualité de ce modèle. Il évalue si une IA peut résoudre des problèmes difficiles de génie logiciel dans plusieurs langages, tirés de bases de code de production réelles, avec un score exprimé en pourcentage de problèmes résolus.

Dans ce test, l'Opus 4.8 a obtenu 69,2 %, contre 64,3 % pour l'Opus 4.7. Le GPT-5.5 d'OpenAI a obtenu un score de 58,6 % et le Gemini 3.1 Pro de Google est à la traîne avec 54,2 %. Pour un modèle au même prix, cela représente une avancée significative.

Lors du dernier examen de l'humanité (questions de niveau expert dans des dizaines de disciplines académiques, mesurées en pourcentage de réponses correctes), l'Opus 4.8 a obtenu un score de 49,8 % sans outils et de 57,9 % avec eux, surpassant ainsi ses trois rivaux. Dans OSWorld-Verified, qui évalue les tâches réelles d'utilisation d'un ordinateur telles que la navigation dans les interfaces logicielles, il a obtenu un score de 83,4 %, dépassant légèrement les 82,8 % de l'Opus 4.7.

La seule perte concerne Terminal-Bench 2.1, qui mesure les performances de l'IA sur les tâches en ligne de commande. GPT-5.5 est en tête avec 78,2 %, tandis que l'Opus 4.8 a obtenu 74,6 %, mieux que les 66,1 % de l'Opus 4.7 et devant les 70,3 % de Gemini, bien que la deuxième place soit finalement une perte.

Cinq façons de penser

Anthropic permet désormais aux utilisateurs de contrôler la force avec laquelle le modèle raisonne. « High » est le paramètre par défaut et gère bien la plupart des tâches, tandis que « Extra » – appelé « xhigh » dans Claude Code – consacre plus de calculs à des problèmes plus difficiles. « Max » est le niveau le plus profond. « Faible » et « Moyen » allouent moins de jetons à la même tâche, ce qui permet de gagner du temps en échange de précision.

Le contrôle de l'effort apparaît à côté du sélecteur de modèle sur claude.ai et Cowork, disponible sur tous les forfaits. Anthropic affirme que le niveau élevé par défaut utilise à peu près les mêmes jetons que celui par défaut de l'Opus 4.7, mais avec de meilleurs résultats, ce qui est à la fois une réussite technique et un bon message, et probablement les deux en même temps.

Il est également important de rappeler que le nouveau tokenizer d'Anthropic pour Opus consomme plus de tokens par tâche. Par conséquent, les utilisateurs de Claude finiront inévitablement par dépenser un peu plus d'argent pour accomplir des tâches s'ils optent pour Opus au lieu de Claude Sonnet, un modèle moins performant, mais probablement suffisant pour les tâches quotidiennes et les problèmes complexes qui n'atteignent pas le niveau de la science ou de la programmation de pointe.

Les limites d'utilisation dans Claude Code ont également été augmentées pour absorber l'augmentation de la consommation de jetons générée par les builds Extra et Max.

Presque aussi sûr que Claude Mythos

L'équipe d'alignement d'Anthropic a indiqué qu'Opus 4.8 « atteint de nouveaux sommets dans nos mesures de traits prosociaux, tels que le soutien à l'autonomie des utilisateurs et l'action dans leur meilleur intérêt ». Plus précisément, les taux de tromperie et de coopération avec une mauvaise utilisation étaient nettement inférieurs à ceux de l'Opus 4.7, et comparables à ceux de Claude Mythos Preview, le modèle le plus restreint d'Anthropic.

De plus, l'Opus 4.8 est quatre fois moins susceptible que la version 4.7 de laisser passer des bugs dans son propre code sans les signaler.

La comparaison avec Mythe mérite d’être mise en contexte. Mythos est un niveau supérieur à Opus dans son ensemble : Anthropic le décrit comme « plus grand et plus intelligent que nos modèles Opus ». Il n'existe actuellement qu'en version préliminaire, accessible à une poignée d'organisations vérifiées effectuant des travaux de cybersécurité via le projet Glasswing.

L'AI Security Institute du Royaume-Uni a découvert qu'il pouvait réaliser de manière autonome « ​​The Last Ones », une simulation d'attaque de réseau d'entreprise en 32 étapes qui prend généralement environ 20 heures aux équipes rouges humaines. C'est pourquoi il n'est pas encore à vendre. Anthropic affirme travailler sur des mesures de cybersécurité plus robustes et espère proposer les modèles de classe Mythos à tout le monde « dans les semaines à venir ».

Lancement également aujourd'hui : Dynamic Workflows dans Claude Code, en aperçu de recherche. La fonctionnalité permet à Claude d'écrire ses propres scripts d'orchestration et de lancer des sous-agents en parallèle au sein de la même session, de vérifier leurs résultats et de rendre compte, quelque chose de similaire à ce que fait Hermes depuis un certain temps.

Les flux de travail dynamiques sont disponibles pour les utilisateurs des forfaits Enterprise, Team et Max, et Anthropic note de manière transparente qu'ils consomment beaucoup plus de jetons qu'une session Claude Code standard.

L'écart de prix se creuse

Les prix d'Anthropic à 5 $/25 $ semblent très différents de ceux pratiqués en Chine ces derniers temps.

DeepSeek V4 Pro a rendu sa réduction de 75 % permanente la semaine dernière : 0,435 $ par million de jetons entrants et 0,87 $ par million de jetons sortants. Xiaomi MiMo V2.5 Pro fonctionne aux mêmes tarifs via des fournisseurs tels que OpenRouter.

Le mode rapide d'Anthropic coûte 10 $ d'entrée et 50 $ de sortie par million, plus cher que l'Opus 4.8 standard lui-même, et environ 57 fois plus par jeton de sortie que DeepSeek V4 Pro. Les entreprises ont déjà dépensé des millions de dollars en inférence sur des modèles américains. S’il est utilisé de manière intensive, Opus peut vous rapporter des millions de dollars assez rapidement.

La réponse d'Anthropic à l'écart de prix est la qualité et la sécurité. Dans SWE-bench Pro, l'Opus 4.8 surpasse les deux modèles chinois. En alignement, aucun ne se rapproche des benchmarks publiés par Anthropic.

Cela est important dans les environnements de production où un modèle coopérant silencieusement avec des entrées malveillantes pose un risque réel : les industries réglementées, le travail juridique et tout domaine où cela « semblait bien » ne constituent pas un rapport post-incident acceptable. Pour tous les autres, l’écart est difficile à ignorer.

Nous l'avons mis à l'épreuve

Nous avons effectué un test de programmation rapide pour créer un jeu de zombies en 3D et voir comment Claude Opus 4.8 se compare à ChatGPT et DeepSeek, ses concurrents les plus populaires des États-Unis et de Chine. Nous avons défini Opus 4.8 sur effort élevé par défaut, GPT-5.5 sur effort élevé et DeepSeek V4 Pro sur effort élevé : trois modèles, une invite, aucune tentative.

GPT-5.5 a terminé premier. Leur jeu n’avait ni visuels ni effets sonores de zombies. C'était rapide, certes, mais cela n'a pas répondu à ce qui était demandé.

DeepSeek V4 Pro est arrivé deuxième avec le mouvement de la souris, de vrais personnages zombies, des effets sonores, une mécanique solide et une esthétique épurée. Aucune plainte.

Opus 4.8 a pris environ trois fois plus de temps que GPT-5.5, mais a livré le meilleur écran de démarrage, les meilleurs designs de zombies, les meilleures mécaniques de jeu et des effets sonores décents. C'était le plus lent, mais celui qui donnait les meilleurs résultats. Pourtant, cela ne suffit probablement pas à justifier son utilisation sur DeepSeek, compte tenu de la différence de coût.

Tous les jeux sont disponibles sur notre profil Itch.io. GPT-5.5 a engendré Zombie Typing, Opus a engendré Typing Dead et DeepSeek V4 Pro a engendré un jeu sans nom qui vous plonge directement dans l'action. Nous l'appellerons TypeSeek.

Un examen comparatif complet est en cours. Pour l'instant : Claude Opus 4.8 programme mieux que GPT-5.5 et Opus 4.7 pour ce type de tâches, au même prix qu'Anthropic facture depuis la version 4.7. Les développeurs qui payaient déjà 5 $ par million de jetons ont simplement obtenu un meilleur modèle sans frais supplémentaires.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !