Grok 4.5 surpasse le test d'agent, soutenant la revendication de classe Opus de Musk

Grok 4.5 surpasse le test d'agent, soutenant la revendication de classe Opus de Musk

Elon Musk a qualifié le Grok 4.5 de modèle de classe Opus qui fonctionne plus rapidement et coûte moins cher. Un benchmark indépendant et agent apporte désormais un véritable soutien à cette affirmation.

Sur AutomationBench-AA d'Artificial Analysis, Grok 4.5 s'est classé premier avec un score de 51,4 % tout en coûtant 0,34 $ par tâche. Il a battu Claude Fable 5 (48,6%) et Claude Opus 4,8 (48,5%).

Score AutomationBench-AA des modèles d'IA. Source : Analyse artificielle

Un contrôle indépendant sur les affirmations d'Elon Musk

SpaceXAI a rendu public Grok 4.5 cette semaine, construit sur sa base V9 de 1,5 billion de paramètres. Le discours de Musk reposait sur les premières évaluations internes.

AutomationBench-AA change cela. Artificial Analysis exécute le benchmark de manière indépendante et garde ses tâches définies privées pour éviter toute contamination.

Le test couvre 657 tâches réparties sur 40 applications simulées, dont Gmail, Slack, Salesforce et HubSpot. Il marque la part d’objectifs qu’un agent atteint sans briser les garde-fous.

Suivez-nous sur X pour recevoir les dernières nouvelles au fur et à mesure

Grok 4.5 : moins cher, plus rapide et généralement conforme

Les 0,34 $ par tâche de Grok 4.5 étaient bien inférieurs aux 1,35 $ de Fable 5 et aux 1,46 $ de l'Opus 4.8. Gemini 3.5 Flash s'en rapproche le plus à 0,49 $.

Le modèle utilisait environ 8 000 jetons de sortie par tâche, soit environ un quart du total de l'Opus 4.8. Cette efficacité explique l’essentiel de l’écart de coûts, correspondant au cadre utilisé par Musk au lancement.

« Son utilisation totale de jetons de 0,44 million par tâche est parmi les plus faibles du classement. Le faible coût est dû à cette efficacité ainsi qu'au faible prix des jetons », a déclaré Artificial Analysis.

De plus, Grok 4.5 a atteint 79,9 % des objectifs des tâches et réussi 21,9 % des tâches. En Finance, le domaine le plus difficile, il arrive en tête avec 71%, devant Fable 5 avec 64% et Opus 4.8 avec 62%.

Cependant, le modèle enfreint plus de règles que ses plus proches rivaux. Il a enregistré 0,63 violations de garde-corps par tâche, au-dessus des 0,55 de l'Opus 4.8 et des 0,46 de Gemini 3.5 Flash.

Cet écart est important pour les entreprises qui déploient des agents sur des systèmes financiers opérationnels, où une seule violation peut entraîner des coûts réels.

Abonnez-vous à notre chaîne YouTube pour voir les dirigeants et les journalistes fournir des avis d'experts

L'article Grok 4.5 Tops Agent Test, soutenant la revendication de classe Opus de Musk apparaît en premier sur BeInCrypto.

Voir l’article original en anglais

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !