Mercury 2 d'Inception Labs bat DiffusionGemma de Google dans son propre domaine

Mercury 2 d'Inception Labs bat DiffusionGemma de Google dans son propre domaine

En résumé

  • Inception Labs a présenté Mercury 2, qui génère 1 000 jetons par seconde contre 89 pour Claude Haiku 4.5.
  • Augment Code a signalé une baisse de la latence de 82 % et une baisse des coûts de 90 % lors du remplacement de Claude Opus 4.7.
  • Mercury 2 a atteint 90 % à l'AIME 2026, dépassant les 69,1 % de DiffusionGemma de Google dans le même test.

Inception Labs a dévoilé Mercury 2 jeudi, le décrivant comme le modèle de langage de raisonnement le plus rapide au monde. Selon l'annonce de la société, elle génère environ 1 000 jetons par seconde (les morceaux de texte qu'un modèle d'IA lit et écrit), contre environ 89 jetons par seconde pour Claude Haiku 4.5 Reasoning d'Anthropic et 71 pour le GPT-5 Mini d'OpenAI.

Cela le place dans la même catégorie de vitesse que celle que Google revendiquerait plus tard pour DiffusionGemma.

Les deux modèles atteignent cette vitesse en abandonnant l’approche d’écriture de la machine à écrire. Un chatbot standard tape un mot, vérifie ce qu'il vient de taper, puis tape le suivant, en répétant le cycle jusqu'à ce que la réponse soit complète. Les modèles de diffusion, en revanche, remplissent un bloc de texte avec des marqueurs aléatoires et suppriment le bruit via une série de passes parallèles (la même astuce qui convertit la statique en photo dans les générateurs d'images comme Stable Diffusion) jusqu'à ce que le bloc entier soit consolidé en une réponse finie en une seule fois.

Là où les deux divergent, c’est dans ce qui survit à ce processus. Dans l'AIME 2026, construit à partir de problèmes réels de l'American Invitational Mathematics Examination et noté en fonction du pourcentage résolu correctement, Mercury 2 a atteint 90 %. Google a testé DiffusionGemma sur le même plateau, où il a obtenu un score de 69,1 %, tandis que le Gemma 4 standard, sans diffusion, a obtenu un score de 88,3 % sur le même test.

Dans le GPQA, un benchmark scientifique de niveau doctorat a obtenu le même score, les deux modèles sont presque à égalité : Mercury 2 avec 77 % contre 73,2 % pour DiffusionGemma. Cependant, le propre guide du développeur de Google recommande le standard Gemma 4 pour les applications qui exigent une qualité maximale, admettant que DiffusionGemma est en retard dans tous les aspects.

L’affirmation de vitesse tient également en dehors du laboratoire. Augment Code, une société d'agents de planification d'IA, a remplacé Claude Opus 4.7 d'Anthropic par Mercury 2 dans son sous-agent de compactage de contexte et a constaté une baisse de 82 % de la latence et une réduction de 90 % des coûts tout en conservant la même qualité de sortie, selon une étude de cas conjointe.

Inception s'appuie sur les recherches de son fondateur Stefano Ermon, professeur à Stanford, qui a co-écrit certaines des techniques de diffusion basées sur les partitions qui alimentent les imageurs d'aujourd'hui. Le cycle de financement de 50 millions de dollars de la startup a attiré le soutien de la branche de capital-risque de Nvidia et des investisseurs individuels Andrew Ng et Andrej Karpathy.

Pour les utilisateurs non techniques, la chose la plus importante que la plupart ne remarquent pas jusqu'à ce qu'ils la sentent, c'est le « flux ». Les modèles traditionnels vous font attendre entre deux pensées lors d'une longue séance. Les modèles de diffusion comme celui-ci permettent à l'IA de suivre le même rythme que vous : auto-complétion instantanée, itérations rapides sur le code ou les plans et sous-agents capables de gérer un travail répétitif important sans alourdir l'ensemble du système.

Cette couche de sous-agents constitue le changement architectural intéressant. Les systèmes d’IA complexes ne constituent plus un modèle géant et intelligent unique. Ce sont des orchestres d'assistants spécialisés : un pour le raisonnement approfondi, plusieurs pour les résumés rapides, le routage, la recherche d'outils, la vérification des résultats, etc. Les modèles séquentiels rendent ces appels d'utilitaires coûteux et lents. La diffusion parallèle les rend suffisamment bon marché et rapides pour être utilisés sans restrictions.

Mises en garde réalistes pour les utilisateurs quotidiens : ces modèles sont toujours meilleurs pour les parties des flux de travail à volume élevé et sensibles à la vitesse, plutôt que pour un raisonnement de frontière plus difficile (où des modèles autorégressifs plus grands pourraient encore avoir l'avantage pour le moment). Mercury 2 n'a pas de pondérations ouvertes, donc pour l'instant, il s'agit uniquement d'API/cloud. Et tout comme la version de Google, l'ensemble de l'écosystème (environnements d'exécution locaux, frameworks d'agents) est encore en train de rattraper son retard pour le faire fonctionner sans friction partout.

Des cas d'utilisation qui émergent immédiatement : une planification rapide en temps réel et un codage d'ambiance où le modèle suit le rythme de vos modifications, des systèmes de planification ou une prise en charge multi-agents où de nombreux sous-appels rapides se produisent, des interfaces vocales qui ne semblent pas en retard et toute auto-complétion sensible à la latence ou prédiction de l'action suivante. À grande échelle, les économies de coûts et d’énergie résultant de l’augmentation des performances sur le matériel standard s’additionnent rapidement.

Les chiffres partagés par Inception (et les évaluations indépendantes) plaident visuellement en faveur : Mercury 2 tombe dans le quadrant « rapide et bon » des modèles de diffusion, apportant ce qui nécessitait auparavant du matériel exotique aux GPU grand public.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.



Voir l’article original en espagnol

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚