
En résumé
- Xiaomi a lancé MiMo-V2.5-Pro-UltraSpeed, atteignant plus de 1 000 jetons par seconde sur un nœud standard à 8 GPU.
- Le système combine la quantification FP4, le décodage spéculatif DFlash et le moteur TileRT pour atteindre la vitesse.
- Le modèle correspond à Claude Opus dans les références de codage, mais coûte 0,43 $ par million de jetons contre 5 $ pour Opus.
La plupart des gens connaissent Xiaomi comme la marque chinoise de téléphones. Celui qui fabrique des scooters électriques et des purificateurs d’air bon marché. Ce n’est pas exactement l’entreprise à laquelle on s’attendrait pour battre un record majeur de vitesse d’inférence d’IA un lundi matin.
Et pourtant. Xiaomi vient de lancer MiMo-V2.5-Pro-UltraSpeed, un mode de service pour son produit phare aux mille milliards de paramètres qui atteint plus de 1 000 jetons par seconde, atteignant près de 1 200 dans les démos.
Les paramètres sont les poids numériques internes qui définissent la façon dont un modèle pense. Plus vous en avez, plus les modèles qu'il peut reconnaître sont complexes. Les jetons sont les fragments de texte que le modèle lit et écrit, représentant environ les trois quarts d'un mot en moyenne.
Xiaomi y est parvenu sur un seul nœud matériel standard doté de 8 GPU. Matériel conventionnel, pas de puces personnalisées. Cela change le calcul quant à savoir qui peut réellement mettre en œuvre ce type de vitesse en production.
Pour exprimer ce nombre en termes humains : selon l'analyse artificielle, GPT-5.5 – avec lequel la plupart des utilisateurs de ChatGPT interagissent réellement – s'élève à 68. Claude Opus 4.6 atteint environ 71 avec le modèle bas de gamme, Haiku, atteignant 98 jetons par seconde. Gemini Flash atteint 192 jetons par seconde. MiMo-V2.5-Pro-UltraSpeed atteint 1 000, dans un modèle qui correspond à Opus dans les tests de codage.
Cerebras et Groq ont construit des entreprises entières autour de ce problème. Cerebras a conçu une puce à l'échelle d'une tranche de la taille d'une assiette, avec 44 Go de mémoire sur puce pour éliminer le goulot d'étranglement de la bande passante qui ralentit l'inférence GPU. Il a atteint 969 jetons par seconde sur le Llama 3.1 405B de Meta, ce qui est impressionnant, mais il s'agit d'un modèle de 405 milliards de paramètres, soit moins de la moitié de la taille du MiMo-V2.5-Pro. L'architecture personnalisée de l'unité de traitement du langage de Groq atteint entre 300 et 750 jetons par seconde selon le modèle.
Il ne fonctionne pas non plus sur du matériel que vous pouvez louer auprès d'AWS ce soir.
Xiaomi l'a fait sur des GPU de base via un logiciel uniquement, une combinaison d'astuces au niveau du modèle et un moteur d'inférence spécialement conçu appelé TileRT.
Que se passe-t-il réellement sous le capot ?
Deux techniques augmentent la vitesse. La première technique est appelée quantification FP4 : au lieu d'exécuter le modèle avec une précision numérique totale de 8 ou 16 bits, Xiaomi réduit les couches expertes, qui constituent l'essentiel des 1 000 milliards de paramètres, à 4 bits. L'empreinte mémoire diminue, la pression sur la bande passante diminue, la vitesse augmente. Le seul inconvénient est généralement une légère dégradation de la qualité. La solution de Xiaomi est chirurgicale : seules les couches expertes sont compressées, tout le reste est conservé en toute précision. Avec cette approche, la perte de qualité est décrite comme proche de zéro.
Le second est le décodage spéculatif DFlash. Le décodage spéculatif normal a un petit modèle scratch qui devine les prochains jetons, puis le grand modèle les vérifie en parallèle. DFlash ignore complètement le brouillon séquentiel : il remplit un bloc entier de positions masquées en une seule passe avant. Dans les tâches de codage, le grand modèle accepte en moyenne 6,3 des 8 jetons proposés par tour de vérification. Cela représente six jetons confirmés en une seule étape au lieu d'un.
TileRT rassemble tout cela. Il maintient l’ensemble du pipeline de calcul en permanence dans le GPU, sans surcharge de lancement de l’opérateur ni interruption d’exécution.
Xiaomi appelle cette approche « conception de code de système de modèle extrême », et l'expression est exacte : aucune technique n'atteint à elle seule 1 000 jetons par seconde, mais la synergie entre toutes les approches y parvient.
MiMo-V2.5-Pro est un modèle de niveau frontière. Nous avons couvert la sortie de la V2.5 Pro en avril – elle correspond à Claude Opus dans la plupart des tests de codage et coûte environ 0,43 $ d'entrée/0,87 $ de sortie par million de jetons. Opus coûte 5 $ entrants / 25 $ sortants par million de jetons.
UltraSpeed accélère exactement le même modèle de MiMo V2.5 Pro, pas une version allégée.
L'inférence assez rapide change la façon dont vous pouvez utiliser un modèle. Vous pouvez exécuter des dizaines de chemins de raisonnement en parallèle au lieu d’attendre une réponse. Détection de fraude, génération de signaux de trading, boucles d'agents en temps réel, tout cela a des contraintes de latence strictes que 60 jetons par seconde ne peuvent pas respecter. À 1 000 jetons par seconde, oui, ils le peuvent.
Xiaomi évalue la vitesse à 3 fois le tarif standard du MiMo-V2.5-Pro pour environ 10 fois la sortie. Le test API se déroule du 9 au 23 juin, basé sur les applications, avec une priorité donnée aux développeurs d'entreprise et professionnels. Le point de contrôle FP4-DFlash est désormais disponible en open source sur Hugging Face pour les tests communautaires.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.