OpenAI lance GPT-5.6 Sol battant Claude Mythos 5 d'Anthropic

OpenAI lance GPT-5.6 Sol battant Claude Mythos 5 d'Anthropic

En résumé

  • OpenAI a lancé GPT-5.6 Sol pour tous les utilisateurs, ainsi que Terra et Luna, avec des prix allant de 1 $ à 30 $ par million de jetons.
  • Sol a obtenu 91,9% en Terminal-Bench 2.1 en mode ultra, battant Claude Mythos 5 avec 88% et Gemini 3.1 Pro avec 70,7%.
  • Les développeurs de l'accès anticipé ont souligné que Sol est leader dans l'utilisation de l'ordinateur, bien qu'Anthropic conserve un avantage en écriture.

Le modèle GPT-5.6 Sol d'OpenAI est désormais public. Ce jeudi, la société a lancé son nouveau modèle phare pour tous les utilisateurs, ainsi que deux modèles plus petits, Terra et Luna, après que le ministère américain du Commerce ait maintenu une version préliminaire limitée à environ 20 partenaires de confiance pendant deux semaines.

La stratégie de dénomination est nouvelle pour OpenAI. C’est la première fois que l’entreprise attribue des noms à ses modèles au lieu de simplement utiliser des numéros. Sol, Terra et Luna représentent des niveaux de capacités qui peuvent évoluer à leur propre rythme. Sol est le modèle phare, Terra le modèle de tous les jours qui, selon OpenAI, correspond au GPT-5.5 à moitié prix, et Luna l'option la moins chère.

Le prix est de 5 $ et 30 $ par million de jetons d'entrée et de sortie pour Sol, et tombe à 1 $ et 6 $ pour Luna. (Les jetons, pour ceux qui ne le connaissent pas, sont l'unité minimale d'informations qu'un modèle peut traiter. Les entreprises fixent généralement le prix de leurs modèles par jeton pour les services API.) Il est livré avec deux nouvelles fonctionnalités : un niveau de raisonnement maximum qui permet à Sol de réfléchir plus longtemps et un mode ultra qui délègue le travail aux sous-agents.

Pour référence, Anthropic facture 10 $/50 $ pour Claude Fable 5, Google facture 2 $/12 $ pour Gemini 3.1 Pro et xAI facture 15 $/75 $ pour Grok 4.5.

Du côté chinois : DeepSeek facture 1,74 $/3,48 $ pour le V4 Pro, et Xiaomi ne facture que 1 $/5 $ pour le MiMo v2.5 Pro, plaçant le Sol entre les modèles haut de gamme américains et les concurrents chinois à bas prix.

Ce que montrent les benchmarks

Dans Terminal-Bench 2.1, un test de flux de travail en ligne de commande qui évalue la planification, l'utilisation des outils et l'itération (mesurés en pourcentage de tâches terminées par un modèle), Sol dans sa configuration ultra a obtenu un score de 91,9 %, avec le Sol standard de 88,8 %.

Cela les place tous les deux devant Claude Mythos 5 d'Anthropic à 88,0 %, Claude Fable 5 à 84,3 % et Claude Opus 4,8 à 78,9 %. Gemini 3.1 Pro Preview de Google arrive en dernière position avec 70,7 %.

OpenAI s'est fortement engagé en faveur de la cybersécurité. Sur ExploitBench, qui mesure dans quelle mesure un modèle identifie et exploite les vulnérabilités logicielles, Sol a fait correspondre l'aperçu restreint du Mythos en utilisant environ un tiers des jetons. OpenAI affirme que Sol ne franchit pas encore la ligne du « cyber-risque critique » dans son propre cadre d'évaluation des risques.

Les passionnés d’IA ont déjà donné leur avis

L'accès anticipé était bruyant. Theo, un développeur d'IA bien connu, YouTuber et PDG de la plateforme T3 Chat, a qualifié Sol de « leader mondial de l'utilisation des ordinateurs » et a noté que cela avait résolu ses plaintes concernant GPT-5.5.

Dan Shipper, dont l'équipe d'Every l'a testé pendant un mois, a proposé la comparaison la plus concise : « GPT-5.6 est comme une Porsche, Fable est comme un moteur de distorsion. » Leur lecture est que Sol est le modèle de la vie quotidienne et que Fable est celui vers lequel on se tourne lorsque l’on traverse la galaxie.

Le chercheur en accès anticipé Daichi Konno a déclaré que Sol surpasse clairement GPT-5.5 et est proche de Fable 5, Anthropic étant toujours en avance dans les tâches d'écriture. Son observation la plus précise : les filtres de sécurité de Sol ne s'activent pas pour les questions sur les sciences de la vie, ce qui, selon lui, pourrait faire de lui le modèle par défaut pour les articles de biologie.

Les fuites vont déjà plus loin. Un compte qui suit les feuilles de route, « Synthwave » sur X, affirme que GPT-5.6 est le dernier de la gamme 5.x et que GPT-6, construit sur une base plus grande, arrivera dans environ un mois. Le même fil de discussion place Fable 5.1 d'Anthropic comme proche et la sortie générale de la V4 de DeepSeek comme imminente.

Le moment est saisissant. Sol arrive la même semaine que Fable 5 d'Anthropic quitte les plans d'abonnement – après son retour mondial le 1er juillet, le modèle est passé aux crédits d'utilisation exclusivement une fois ses frais hebdomadaires de 50 % expirés le 7 juillet.

Le sommet est très fréquenté. SpaceXAI a lancé hier Grok 4.5 à une fraction du prix, qu'Elon Musk a qualifié de « à peu près comparable à l'Opus 4.7, mais beaucoup plus rapide ». Ce matin, Meta a lancé Muse Spark 1.1, son premier modèle de paiement. Aucun des deux ne mène le groupe, mais tous deux appartiennent à une classe frontalière.

Cela laisse Google comme le seul grand laboratoire américain à ne pas avoir renouvelé son modèle phare lors de ce cycle. Son modèle le plus avancé, Gemini 3, est disponible à partir de novembre 2025, le plus ancien lancement frontière encore en vigueur tandis qu'OpenAI, Anthropic, xAI et Meta ont déménagé dans les mêmes sept jours.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol