Le nouveau Grok 4.5 est maintenant disponible. Elon Musk dit qu'il est en concurrence avec Claude Opus de l'année dernière

Le nouveau Grok 4.5 est maintenant disponible. Elon Musk dit qu'il est en concurrence avec Claude Opus de l'année dernière

En résumé

  • SpaceXAI a lancé Grok 4.5 à 2 $ par million de jetons d'entrée, contre 5 $ pour Claude Opus 4.8 et GPT 5.6 Sol.
  • Dans les benchmarks d'encodage, Grok 4.5 arrive en troisième position : Claude Fable 5 arrive en tête avec 70 % contre 53 % pour le nouveau modèle.
  • Grok 4.5 utilisait 4 fois moins de jetons que Opus 4.8 sur les mêmes tâches, réduisant ainsi les coûts pour les équipes à gros volume.

Ce mercredi, SpaceXAI d'Elon Musk a lancé Grok 4.5, son premier modèle public depuis l'achèvement de la fusion entre SpaceX et xAI en février, et l'accord en cours de SpaceX de 60 milliards de dollars pour acquérir Cursor. Il s'adresse aux programmeurs, aux ingénieurs et à ce que l'entreprise appelle les « travailleurs du savoir », une catégorie qui s'étendrait des développeurs de logiciels aux avocats révisant les contrats pour financer les équipes qui créent des modèles dans Excel.

La proposition de l'entreprise n'est pas qu'il s'agisse du meilleur modèle, mais qu'il est économique, du moins pour un modèle occidental. Grok 4.5 coûte 2 $ par million de jetons entrants et 6 $ par million de jetons sortants. Claude Opus 4.8, le principal modèle phare d'Anthropic, est au prix de 5 $ à l'entrée et 25 $ à l'extérieur. GPT 5.6 Sol, le nouveau modèle haut de gamme d'OpenAI également lancé mercredi, coûte 5 $ à l'entrée et 30 $ à l'extérieur.

Musk a précisé dans X où se trouve réellement son nouveau modèle. Il l'a décrit comme « à peu près comparable à l'Opus 4.7, mais beaucoup plus rapide ». Opus 4.7 est le précédent modèle phare d'Anthropic ; L'opus 4.8 lui a depuis succédé. Claude Fable 5 est désormais l'offre haut de gamme d'Anthropic.

Musk a présenté cela comme un compromis délibéré : vitesse et coût par rapport à la capacité brute, les ingénieurs de Tesla et SpaceX étant la preuve de leur utilité dans le monde réel.

Ce que montrent réellement les benchmarks

SpaceXAI a publié quatre résultats de référence lors du lancement, et le tableau est mitigé. DeepSWE 1.1 mesure la fiabilité avec laquelle une IA peut résoudre les bogues logiciels réels soumis par les développeurs, en utilisant une configuration de test standardisée pour comparer équitablement les modèles, notés en fonction du pourcentage de problèmes résolus. Grok 4.5 a obtenu un score de 53 %, en dessous de Claude Opus 4.8 avec 59 % et du GPT 5.5 avec 67 %. Claude Fable 5, le modèle frontière d'Anthropic, arrive en tête de liste avec 70 %.

Sur SWE Bench Pro, une autre référence qui évalue un ensemble de problèmes de génie logiciel notés en fonction du taux de résolution, Grok 4.5 a obtenu un score de 64,7 %, suffisamment pour battre les 58,6 % de GPT 5.5 sur ce test particulier. Opus 4.8 continue de dominer avec 69,2 % et Fable 5 à 80,4 %.

Les références de la société se comparent à GPT 5.5, et non à GPT 5.6, car ce dernier a également été publié mercredi, quelques heures après l'annonce de Grok 4.5.

SpaceXAI a formé Grok 4.5 en collaboration avec Cursor AI récemment acquis sur des dizaines de milliers de GPU Nvidia GB300 à l'intérieur de Colossus, le supercalculateur de Memphis d'une capacité totale de plus de 200 000 GPU. Les laboratoires dont les modèles sont mieux classés dans ces mêmes critères n’ont rien de comparable à ce matériel. Le modèle qui en résulte est compétitif, mais ce n’est pas le premier.

Ce modèle a suivi Grok dans plusieurs versions. SpaceXAI s'est toujours imposé avec une énorme puissance de calcul et des scores de troisième place. Ce qui a changé avec Grok 4.5, c'est le prix et le signal d'entraînement.

Où l'argument en votre faveur tient vraiment

Le meilleur argument n’est pas la performance brute, mais l’efficacité. Dans les tâches SWE Bench Pro, Grok 4.5 a utilisé en moyenne 15 954 jetons de sortie pour terminer chaque tâche. L'Opus 4.8 a consommé 67 020 jetons pour le même travail, soit une différence de 4,2x.

Pour les équipes exécutant l’IA à grand volume, cette différence se traduit par de réelles économies, qui s’ajoutent au prix par jeton déjà inférieur. Même avec Grok 4.5 ayant obtenu des résultats inférieurs dans les tests de qualité, des jetons moins chers et une efficacité d'utilisation plus élevée permettent plus d'itérations sans dépenser autant.

Le modèle fonctionne également à 80 jetons par seconde, un territoire de modèle rapide. Grok 4.5 a été formé avec les données des sessions de développement Cursor, y compris les traces de débogage et les modifications de code réelles, plutôt qu'avec des référentiels statiques. Comme Musk l'a admis devant le tribunal, les pratiques de formation de xAI ont déjà fait l'objet d'un examen minutieux ; Cette fois, le pipeline passe par une plateforme que SpaceX est en train d’acquérir intégralement.

Pour les développeurs exécutant des tâches de codage à gros volume, les chiffres sont favorables : à peu près la capacité de l'Opus 4.7 avec 60 % de moins par jeton d'entrée. Pour ceux qui recherchent la frontière technologique, Claude Fable 5 est en tête dans toutes les catégories que SpaceXAI a choisi de publier. Notre test rapide utilisant la version Grok dans Hermes s'est avéré décevant pour l'écriture créative et acceptable pour une tâche de codage simple.

Le modèle est disponible via API, dans la version Hermes et Grok avec un demi-million de jetons de contexte (un peu moins de 400 000 mots). Les utilisateurs européens devront attendre avant de pouvoir l'utiliser ; SpaceXAI a noté que Grok 4.5 arriverait dans l'UE à la mi-juillet.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !