Google DiffusionGemma AI atteint 1 000 jetons par seconde, et c'est gratuit

Google DiffusionGemma AI atteint 1 000 jetons par seconde, et c'est gratuit

En résumé

  • Google a lancé DiffusionGemma, un modèle de texte open source qui génère des jetons en parallèle et atteint 1 000 par seconde sur un H100.
  • Contrairement aux LLM autorégressifs, il utilise une attention bidirectionnelle, ce qui le rend supérieur en termes de remplissage de code et de sorties structurées.
  • Le modèle est disponible gratuitement sous la licence Apache 2.0 sur Hugging Face, bien que son exécution locale nécessite toujours une configuration manuelle avancée.

Google a lancé aujourd'hui DiffusionGemma, un modèle d'IA open source qui génère du texte de la même manière que les générateurs d'images créent des images : en commençant par le bruit et en l'affinant jusqu'à ce qu'il ait un sens. Atteignez 1 000 jetons par seconde sur un NVIDIA H100. (Les jetons sont l'unité d'information de base gérée par un modèle d'IA.) Cela le rend quatre fois plus rapide que Gemma conventionnel. Il est également gratuit, sous licence Apache 2.0, avec des poids disponibles dans Hugging Face.

Cependant, comme toujours, c'est dans les petits caractères. Selon l'annonce de Google, le modèle atteint « plus de 700 jetons par seconde sur NVIDIA GeForce RTX 5090 ». Il est également inférieur à la norme Gemma 4 en termes de qualité de réponse.

Google lui-même le reconnaît. Il s’agit d’un modèle de rapidité et non d’une amélioration de la qualité.

Qu'est-ce que ça fait vraiment ?

Tous les LLM que vous avez utilisés fonctionnent comme une machine à écrire : un jeton à la fois, où chaque mot dépend du précédent. C’est ainsi que fonctionnent les architectures autorégressives.

DiffusionGemma ne fonctionne pas de cette façon. Au lieu de générer des jetons de manière séquentielle, il part en parallèle de fragments raffinés de texte non ordonné. Selon le guide du développeur de Google, vous « commencez avec un canevas de jetons d'espace réservé aléatoires » et épinglez les jetons de manière itérative avec une plus grande confiance jusqu'à ce que le bloc complet prenne forme. Deux cent cinquante-six jetons par passe avant. Le GPU est occupé.

L'effet secondaire est une attention bidirectionnelle : chaque jeton peut voir tous les autres jetons pendant sa génération, ce qui est impossible dans les modèles autorégressifs (ils ne peuvent pas anticiper ce qui sera ensuite codé). Cela le rend particulièrement efficace dans les tâches où la fin de la réponse détermine le début : remplissage de code, sortie structurée, problèmes avec de nombreuses restrictions, entre autres. Google a modifié une version pour résoudre les Sudokus sous forme de démo. Le modèle de base a résolu correctement environ 0 % des énigmes.

La version ajustée atteint 80%.

La diffusion de textes est un projet de recherche depuis des années. MDLM, SEDD, LLaDA, Dream : des modèles académiques qui ont montré que l'approche fonctionnait à petite échelle et restaient pour la plupart des preuves de concept. Inception Labs a lancé Mercury 2 en février 2026 en tant que premier modèle de raisonnement de diffusion commerciale, avec des vitesses cinq fois plus rapides que celles de ses concurrents optimisés en termes de vitesse.

Cependant, aucun d’entre eux n’était un poids ouvert, et aucun n’était livré avec un support dès le premier jour dans vLLM, Hugging Face Transformers et Unsloth. DiffusionGemma est la première version ouverte majeure issue d'un laboratoire de premier plan.

Une ironie historique mérite également d’être notée. Les imageurs ont commencé comme des modèles de diffusion (d'où le nom de diffusion stable) et migrent désormais vers des architectures autorégressives à la recherche d'une qualité supérieure. Les modèles linguistiques ont commencé comme autorégressifs et expérimentent maintenant la diffusion pour gagner en vitesse.

Pourquoi c'est difficile à exécuter… pour l'instant

Faire fonctionner DiffusionGemma efficacement nécessite un rédacteur : un module léger qui propose des blocs de jetons en parallèle, que le modèle principal vérifie en une seule passe. C’est ce qu’on appelle le décodage spéculatif. DFlash est un framework publié début 2026 qui utilise un petit modèle de diffusion comme ébauche, permettant une accélération plus de 6 fois sur certaines tâches. C'est le moteur qui rend ce type de modèle pratique.

Le problème : DiffusionGemma a besoin d'une gomme spécifique pour s'exécuter localement via MLX, le framework d'apprentissage automatique d'Apple pour Apple Silicon. Ce module n'existe dans aucune version publique de mlx-lm, dans aucune demande d'extraction ouverte ou dans le runtime inclus dans LM Studio.

Nous avons essayé d'exécuter DiffusionGemma avec Hermes via NVIDIA NIM. Le modèle s'est chargé, mais ensuite : « l'initialisation de l'agent a échoué : le modèle google/diffusiongemma-26b-a4b-it a une fenêtre contextuelle de 8 192 jetons, ce qui est inférieur au minimum de 64 000 requis par l'agent Hermes. »

Pour être précis : la fenêtre contextuelle réelle de DiffusionGemma est de 256 000 jetons. Le chiffre de 8 192 était une erreur de configuration par défaut de Nvidia, et non une limitation architecturale du modèle.

En pratique, le configurer correctement pour une utilisation agentique nécessite un travail manuel que la plupart des utilisateurs n'ont pas encore compris, et Hermes Agent ne s'initialisera tout simplement pas sans cela. La vitesse parallèle ne sert à rien si l'agent ne peut pas démarrer.

On s'attend à ce que dans les prochains jours, la communauté génère de meilleures ressources pour exécuter ces modèles.

C'est vraiment pour qui ?

Développeurs équipés de matériel NVIDIA RTX 4090 ou 5090 qui créent des outils temps réel : éditeurs en ligne, auto-complétion, remplissage de code, génération structurée. C'est le but. Comme *Decrypt* l'a rapporté en mai, Google a maintenu un travail constant pour accélérer l'inférence locale sans avoir besoin de nouveau matériel.

Pour les chercheurs, la génération bidirectionnelle ouvre un territoire auquel les modèles autorégressifs ne peuvent tout simplement pas accéder : séquences protéiques, graphiques mathématiques, tous les cas où la position N dépend de la position N+50. Ce n'est pas un détail mineur.

Google a lancé Gemma 4 sous Apache 2.0 en avril, et DiffusionGemma poursuit cette stratégie. Il existe déjà un projet de demande d'extraction pour lama.cpp ouvert à ce jour. Lorsque les outils rattraperont leur retard, ce modèle atteindra un public beaucoup plus large.

Sur une machine dotée d’un GPU discret performant, 1 000 jetons par seconde sont réalistes.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol