
Points clés à retenir
- xAI a expédié Grok 4.5 le 8 juillet à 2 $/6 $ par million de jetons, ce qui a réduit le prix de l'Opus 4.8 de plus de 60 %.
- Anthropic a sorti Claude Opus 5 le 24 juillet comme nouveau modèle par défaut sur les abonnements Claude Max.
- Moonshot AI a publié Kimi K3, son plus grand modèle avec 2,8 billions de paramètres.
Grok 4.5 de xAI, Claude Opus 5 d'Anthropic, la famille GPT-5.6 d'OpenAI et Kimi K3 de Moonshot AI ciblent chacun le même problème : faire en sorte qu'un système d'IA effectue une tâche de plusieurs heures, de la recherche au codage en passant par le reporting structuré, sans perdre la trace du plan.
Grok 4.5 s'entraîne sur de vraies sessions de développeurs
xAI a publié Grok 4.5 le 8 juillet. Le modèle fonctionne sur une base de 1,5 billion de paramètres et a été formé en partie sur les données d'utilisation réelles de Cursor, la plateforme de codage acquise par SpaceXAI plus tôt cette année. Le prix s'élève à 2 $ par million de jetons d'entrée et à 6 $ par million de jetons de sortie, avec une fenêtre contextuelle de 500 000 jetons.
Elon Musk a décrit le Grok 4.5 comme un modèle de classe Opus qui fonctionne plus rapidement et à moindre coût. Les trackers indépendants le placent au quatrième rang de l'indice d'intelligence analytique artificielle, devant tous les modèles de pondération ouverts, à un prix inférieur de plus de 60 % à Claude Opus 4.8 et GPT-5.5. Sur Terminal-Bench 2.1, un test qui évalue dans quelle mesure un modèle accomplit les tâches d'ingénierie en ligne de commande, Grok 4.5 a obtenu un score de 83,3 %.
Le changement le plus important concerne l’efficacité symbolique. xAI indique que le modèle a besoin d'environ un cinquième des jetons de sortie Opus 4.8 requis pour des tâches comparables, ce qui réduit le coût d'exécution de longues sessions d'agent.
Claude Opus 5 tient le coup sur le prix
Anthropic a sorti Claude Opus 5 le 24 juillet, le positionnant comme un modèle proche des performances de Claude Fable 5, la version la plus performante de la société, à la moitié du prix d'entrée de 10 $ et de 50 $ de sortie de Fable. L'Opus 5 lui-même propose le même prix d'entrée de 5 $ et de sortie de 25 $ que son prédécesseur, l'Opus 4.8.

Le modèle est livré avec une fenêtre contextuelle d'un million de jetons, 128 000 jetons de sortie maximum et un paramètre d'effort de raisonnement réglable qui va du mode faible au nouveau mode xélevé. Anthropic affirme que l'Opus 5 établit de nouvelles normes sur Frontier-Bench et GDPval-AA, deux évaluations de codage et de travail de connaissances, bien qu'il soit à la traîne du modèle restreint Claude Mythos 5 sur les tâches de cybersécurité. Opus 5 est désormais le modèle par défaut sur Claude Max et l'option la plus performante sur Claude Pro.
OpenAI divise GPT-5.6 en trois niveaux
OpenAI a mis GPT-5.6 en disponibilité générale le 9 juillet après un aperçu de deux semaines limité à environ 20 organisations approuvées par le gouvernement américain, à la suite d'un décret lié à l'examen de la sécurité du modèle frontière. La famille est livrée en trois niveaux : Sol, le produit phare, au prix de 5 $ d'entrée et de 30 $ de sortie par million de jetons ; Terra, un modèle de niveau intermédiaire à 2,50 $ et 15 $ qui, selon OpenAI, correspond à GPT-5.5 à la moitié du prix ; et Luna, un niveau rapide et peu coûteux à 1 $ et 6 $.

OpenAI rapporte que Sol est en tête de l'indice des agents de codage d'analyse artificielle et atteint 88,8 % sur Terminal-Bench 2.1, passant à 91,9 % lorsque le modèle exécute quatre sous-agents en parallèle dans son nouveau mode ultra. Les trois niveaux présentent la cote de risque interne la plus élevée d'OpenAI en matière de potentiel d'utilisation abusive de cyber et de produits biologiques, ce qui a déclenché un examen supplémentaire lors de l'aperçu sécurisé par le gouvernement.
Kimi K3 pousse les modèles à poids ouvert vers la frontière
Moonshot AI a publié Kimi K3 le 16 juillet, un mélange de 2,8 billions de paramètres de modèle d'experts avec 896 experts au total et 16 actifs par tâche. Le modèle comporte une fenêtre contextuelle d'un million de jetons et une entrée multimodale native, avec un prix API de 3 $ en entrée et 15 $ en sortie par million de jetons. Moonshot s'est engagé à publier les poids ouverts complets d'ici le 27 juillet.

Le K3 est le plus grand modèle ouvert commercialisé à ce jour, environ 75 % plus grand que le précédent modèle ouvert le plus largement utilisé. Les trackers indépendants placent K3 au quatrième rang des systèmes frontières actuels, derrière Claude Fable 5 et GPT-5.6 Sol mais devant Claude Opus 4.8.
Pourquoi l'écart avec les modèles plus âgés est important
Les fenêtres contextuelles inférieures à 200 000 jetons obligeaient autrefois les développeurs à diviser de grandes bases de code ou à rechercher des paquets en fragments. Chaque modèle de ce groupe fonctionne désormais à 500 000 jetons ou plus, trois des quatre à 1 million, permettant à une seule session de contenir un référentiel complet ou une pile de documents sources primaires.
La fiabilité des agents a également évolué. Les systèmes des périodes 2023 et 2024 perdaient souvent leur plan après une poignée d’appels d’outils. Les modèles publiés ce mois-ci sont conçus pour supporter des dizaines d'étapes coordonnées et récupérer lorsqu'un appel d'outil renvoie des données incorrectes au lieu de s'arrêter.
Pour les développeurs, l’effet pratique est un coût par tâche terminée inférieur plutôt qu’un plafond plus élevé pour un seul benchmark. Les contrôles d'effort dans Opus 5, la tarification échelonnée dans GPT-5.6 et les revendications d'efficacité derrière Grok 4.5 pointent vers le même objectif : permettre aux équipes de choisir la quantité de calcul qu'une tâche mérite au lieu de payer des prix phares pour chaque demande.
Pour les entreprises et les décideurs politiques, le déploiement de GPT-5.6, contrôlé par le gouvernement, indique que la surveillance est désormais intégrée aux calendriers de publication des plus grands modèles, et non ajoutée après coup. La brève suspension par Anthropic, ordonnée par le gouvernement, de l'accès à Fable et Mythos en juin était une version antérieure du même schéma.

1,32 $ à 3,75 $ : neuf grands modèles d'IA prédisent la fin du XRP en 2026, un s'échappe
XRP a passé une grande partie de 2026 au centre de la spéculation, alimentée par l'adoption institutionnelle, les évolutions réglementaires et un regain d'intérêt…

1,32 $ à 3,75 $ : neuf grands modèles d'IA prédisent la fin du XRP en 2026, un s'échappe
XRP a passé une grande partie de 2026 au centre de la spéculation, alimentée par l'adoption institutionnelle, les évolutions réglementaires et un regain d'intérêt…

1,32 $ à 3,75 $ : neuf grands modèles d'IA prédisent la fin du XRP en 2026, un s'échappe
XRP a passé une grande partie de 2026 au centre de la spéculation, alimentée par l'adoption institutionnelle, les évolutions réglementaires et un regain d'intérêt…
Voir l’article original en anglais
