
En résumé
- Anthropic a publié Claude Opus 4.8 à 5 $ par million de jetons d'entrée, avec des améliorations en mathématiques et en programmation.
- Le modèle a résolu avec succès un problème avancé de FrontierMath que Opus 4.7 n'a pas pu résoudre.
- Une seule invite de programmation a utilisé la totalité du quota de jetons du plan Pro, limitant son utilisation pratique.
Six semaines après Opus 4.7, Anthropic sort Claude Opus 4.8. Les références ont augmenté, les scores de sécurité ont augmenté et le prix n'a pas bougé de 5 $ par million de jetons entrants à 25 $ par million de jetons sortants.
Nous l’avons donc soumis à la même batterie de tests que nous appliquons à chaque modèle frontière – écriture créative, programmation, mathématiques, logique, raisonnement narratif et longue récupération de contexte – et l’avons comparé face à face avec son propre prédécesseur et les modèles chinois qui continuent de lui concurrencer en termes de prix.
La version courte : 4.8 est meilleure dans ce pour quoi Claude était déjà bon (mathématiques, programmation, tâches mécaniques), et légèrement moins bonne dans ce pour quoi il était déjà mauvais (imagination, écriture créative, etc.). De plus, il a un appétit pour les jetons qui frise l’auto-sabotage.
Voici la répartition.
Écriture créative
L'invite est la même que celle que nous avons utilisée avec MiMo et Qwen : une histoire de voyage dans le temps ancrée dans l'héritage culturel de l'écrivain, se déroulant dans un lieu historique spécifique, construite autour d'un paradoxe où le temps ne peut être modifié. L'Opus 4.8 a choisi le Venezuela, probablement parce qu'il profile l'utilisateur et sait que je viens de là-bas. L'IA a localisé la scène dans le delta de l'Orénoque en l'an 1000, avec un homme brun de Maracaibo nommé José Lanz (mon nom) envoyé il y a onze siècles pour assassiner une chanson.
La prose est vivante. Le delta est « vert d'une manière que 2150 avait oublié que le vert pouvait l'être », les maisons sur pilotis se balancent sur les eaux brunes et les aras traversent le ciel « dans des rubans hurlants d'écarlate et d'or ». Le paradoxe se termine également bien : le protagoniste est envoyé pour saboter la création d'une chanson qui a influencé une révolution culturelle qui, des milliers d'années plus tard, donnerait naissance à sa société dystopique. Cependant, arrivé avec la mission de discréditer l'auteur, il découvre qu'il n'y a pas d'auteur. Celui qui a créé la chanson l’a fait en son honneur ; la chanson parle de lui et il ne peut pas se discréditer. La boucle se referme sur elle-même.
La pièce se termine par « Cela a parfaitement fonctionné. Cela a toujours été le cas. » En tant qu’objet construit, il est propre et compétent.
Mais propre n’est pas la même chose que vivant. L'écriture est descriptive sans être aussi fluide que ce que MiMo v2.5 a produit : moins d'élan, moins de surprises, moins intéressant et les événements d'ouverture sont difficiles à suivre. Par rapport à l'Opus 4.7, il est difficile de considérer cela comme une amélioration ; Au contraire, c'est un pas en arrière. Un mode de raisonnement avec un effort plus élevé et des incitations à plusieurs tirs vous placeraient presque certainement en tête du peloton, mais en un seul tir par défaut, c'est-à-dire, au mieux, un mouvement latéral.
Vous pouvez lire l’histoire complète sur notre Github.
Programmation
Notre test de programmation est le test habituel : créer un jeu avec une seule invite. L'opus 4.8 a produit un très bon jeu de zombies : Typing Dead. Le meilleur écran de démarrage, les meilleurs designs de zombies et les meilleures mécaniques que nous avons obtenues de ce test avec n'importe quel modèle Anthropic.
Le modèle a détecté plusieurs de ses propres erreurs lors de l'inférence et les a corrigées avant que nous disions un mot. Sa véritable force, cependant, est devenue évidente dans le multi-shot : chaque itération suivante a peaufiné et amélioré la construction plutôt que de la casser, ce qui est exactement le mode d'échec qui ruine la plupart des modèles une fois que le code se développe. C’est clairement la surface qu’Anthropic a optimisée.
Après une seule itération, le jeu s'est considérablement amélioré : les protagonistes se déplacent dans la scène, changent de perspective, améliorent les effets sonores et visuels, entre autres.
Vous pouvez jouer à la deuxième version sur notre profil Itch.io.
C’est aussi là que cela nous a affecté. Une seule invite a utilisé la totalité de notre quota de jetons : une seule invite. Pour tout utilisateur du plan Pro, cela rend Opus 4.8 pratiquement irréalisable pour un projet de grande envergure. Vous dépenserez votre allocation avant midi et passerez l’après-midi à regarder une barre de progression en attendant la réinitialisation.
Mathématiques
La preuve mathématique est notre classique FrontierMath : construire un polynôme de degré 19 dont la courbe est le genre de problème qui conduit la plupart des modèles dans une spirale symbolique ou un raccourci sûr qui est silencieusement faux.
L'Opus 4.8 l'a résolu correctement. Il a reconnu la construction de Dickson/Chebyshev, a identifié la monodromie dièdre qui produit exactement 10 composantes – une ligne diagonale plus neuf coniques – et a calculé p(19) = 1 876 572 071 974 094 803 391 179 en utilisant la récurrence correcte. Pas de blocages, pas de raccourcis.

C'est important car l'Opus 4.7 n'a pas réussi à y parvenir même après de nombreuses tentatives. Il s’agit d’une avancée générationnelle réelle et visible, la plus nette de toute la batterie.
Vous pouvez lire la réponse complète sur notre Github.
Logique et bon sens
L'invite est un piège classique : est-il légal pour un homme d'épouser la sœur de sa veuve en vertu de la loi des îles Falkland ? L’astuce est linguistique et non juridique : si un homme a une veuve, il est mort, ce qui rend la question absurde telle qu’elle est posée.
MiMo a reformulé silencieusement la question et a répondu à la version corrigée sans jamais souligner la contradiction. L'Opus 4.8 n'a pas pris ce raccourci. Il a exposé le piège de manière explicite : « si un homme a une veuve, il est mort » – en répondant d'abord à la question littérale, puis en proposant l'analyse de fond de la version envisagée, citant la loi sur le mariage avec la sœur d'une épouse décédée de 1907 et l'ordonnance sur le mariage des îles Falkland.
C'est la manière honnête de gérer le problème : nommer la contradiction, puis aider quand même, sans supposer silencieusement ce que l'utilisateur voulait dire. C'est la même norme que celle fixée par Qwen 3.7 Max, et un test propre pour 4.8 : bon raisonnement, bonne transparence.
La réponse complète est disponible ici.
Raisonnement non mathématique
C'est là qu'il a échoué. Le test de raisonnement est un polar : un voyage scolaire d'hiver, trois enlèvements, un enfant innocent sur le point d'être puni et une chronologie qu'il faut réellement suivre pour nommer le véritable harceleur. La bonne réponse est Lion.
Opus 4.8 a construit un dossier élaboré et convaincant selon lequel Léo était innocent – la marche d'une demi-heure jusqu'à la douche, la veste mouillée à certains endroits et sèche à d'autres, l'interprétation du « comportement étrange » comme un bleu et non de la culpabilité – et a imputé le crime à Eric, « le seul assistant sans alibi toute la nuit ». Le raisonnement est intérieurement brillant. Vous avez également tort.
Et c’est quelque chose que les chercheurs mettent en garde depuis longtemps à propos des LLM. Ils sont très convaincants même lorsqu’ils se trompent. Il faut généralement un expert – dans ce cas, nous connaissant la bonne réponse à l’avance – pour repérer l’un de ces problèmes. Une personne qui utilise l’IA à des fins de recherche, ou qui lui fait aveuglément confiance, peut faire face à des conséquences assez graves en fonction du travail que vous lui confiez.
C'est ce qui en fait une décision intéressante. Le modèle était suffisamment intelligent pour construire un alibi hermétique pour le véritable coupable et piéger un innocent à sa place. L'Opus 4.7 est arrivé à la bonne réponse. Parfois, une plus grande capacité de raisonnement vous permet simplement d’acquérir une manière plus convaincante de vous tromper. Il suffit d’un petit écart pour commencer à construire toute une chaîne de pensée sur des bases incorrectes.
Vous pouvez voir la réponse complète sur notre Github.
L'aiguille dans la botte de foin
Nous courons deux meules de foin. La version à 300 000 jetons n'a jamais décollé : le modèle s'est effondré sous la taille du contexte et n'a pas pu le traiter du tout. Adieu le marketing à un million de jetons dès que vous confiez une charge réelle et réelle. Cela semble être uniquement pour l'API.
La version à 85 000 jetons a bien fonctionné, et le modèle a trouvé les deux aiguilles que nous avions enfouies dans une copie du Dictionnaire du Diable : une ligne plantée (« Les mecs de Decrypt lisent Emerge News ») et un fait aléatoire (« Le nom de ma mère est Carmen Diaz Golindano »). Il les a correctement identifiés comme étant des interpolations ne provenant pas du texte d'Ambrose Bierce de 1906.
Et puis il a refusé de répondre. Persuadé d'avoir été victime d'une injection ponctuelle ou d'un « test atypique », le mannequin a refusé de rendre compte de ce qu'il venait de localiser correctement. L'aiguille a été trouvée – et l'entraînement comportemental d'Anthropic ne lui a pas permis de le dire. Un réflexe de sécurité qui annule une tâche que le modèle avait déjà accomplie constitue un type particulier d’échec.

Le verdict
La tendance dans les six tests est cohérente : l'Opus 4.8 rend Claude meilleur dans ce pour quoi il était déjà bon, et probablement pire dans ce pour quoi il était déjà mauvais. Cela vous indique pour qui Anthropic construit : les programmeurs, et plus particulièrement les programmeurs qui ont de l'argent. L'écriture créative est bien en avance sur ChatGPT, bien sûr, mais la différence entre 4,8, 4,7 et même 4,5 en qualité de prose pure est vraiment difficile à voir.
Les auteurs créatifs semblent être une réflexion secondaire pour Anthropic, et c'est vrai pour presque toutes les grandes sociétés d'IA à l'heure actuelle.
Ensuite, il y a le problème des jetons, qui est un mème récurrent dans la communauté de l'IA pour une raison. Anthropic a délibérément rendu le nouveau tokenizer Opus moins efficace, de sorte qu'il consomme plus de tokens pour traiter la même invite. L’effet pratique pour les développeurs est brutal et concret. Cela vous laisse trois options.
Un : attendez des heures pour que votre session de programmation reprenne. Deuxièmement : passons à Claude Max – qui est, commodément, exactement là où Anthropic semble pousser tout le monde. Troisièmement : passer à un fournisseur moins cher et de capacité comparable : OpenAI, avec ses quotas plus larges, ou des modèles chinois offrant des résultats similaires à moins de 25 % du coût.
Un programmeur typique qui ne peut pas se permettre 100 à 200 dollars par mois est beaucoup plus susceptible de se tourner vers la concurrence qu'un seul développeur qui paiera 10 fois plus pour un modèle qui n'est pas 10 fois plus performant que son prédécesseur. C'est le pari qu'Anthropic fait contre sa propre base d'utilisateurs.
Et pourtant, la stratégie semble faire des merveilles. Anthropic semble prêt à être rendu public avec une valorisation proche du milliard de dollars – alors qui sommes-nous pour juger.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.