
Le moteur d’inférence LPU de Groq, une unité de traitement du langage dédiée, a établi un nouveau record en matière d’efficacité de traitement pour les grands modèles de langage.
Dans un récent benchmark réalisé par ArtificialAnalysis.ai, Groq a surpassé huit autres participants sur plusieurs indicateurs de performance clés, notamment la latence par rapport au débit et le temps de réponse total. Le site Web de Groq indique que les performances exceptionnelles du LPU, en particulier avec le modèle Llama 2-70b de Meta AI, signifiaient que « les axes devaient être étendus pour tracer Groq sur le graphique latence/débit ».
Selon ArtificialAnalysis.ai, le LPU Groq a atteint un débit de 241 jetons par seconde, dépassant largement les capacités des autres fournisseurs d’hébergement. Ce niveau de performances est deux fois supérieur à celui des solutions concurrentes et ouvre potentiellement de nouvelles possibilités pour les grands modèles de langage dans divers domaines. Les benchmarks internes de Groq ont encore souligné cette réussite, affirmant atteindre 300 jetons par seconde, une vitesse dont les solutions traditionnelles et les fournisseurs historiques doivent encore se rapprocher.
L’accélérateur GroqCard™, au prix de 19 948 $ et facilement accessible aux consommateurs, est au cœur de cette innovation. Techniquement, il offre jusqu’à 750 TOP (INT8) et 188 TFLOP (FP16 à 900 MHz) en performances, ainsi que 230 Mo de SRAM par puce et jusqu’à 80 To/s de bande passante mémoire sur puce, surpassant les configurations CPU et GPU traditionnelles, en particulier dans les tâches LLM. Cette amélioration des performances est attribuée à la capacité du LPU à réduire considérablement le temps de calcul par mot et à atténuer les goulots d’étranglement de la mémoire externe, permettant ainsi une génération plus rapide de séquences de texte.

En comparant la carte Groq LPU au GPU phare A100 de NVIDIA d’un coût similaire, la carte Groq est supérieure dans les tâches où la vitesse et l’efficacité du traitement de grands volumes de données plus simples (INT8) sont essentielles, même lorsque l’A100 utilise des techniques avancées pour améliorer ses performances. Cependant, lors de tâches de traitement de données plus complexes (FP16), qui nécessitent une plus grande précision, le Groq LPU n’atteint pas les performances de l’A100.
Essentiellement, les deux composants excellent dans différents aspects des calculs d’IA et de ML, la carte Groq LPU étant exceptionnellement compétitive pour exécuter rapidement LLMS tandis que l’A100 est en tête ailleurs. Groq positionne le LPU comme un outil permettant d’exécuter des LLM plutôt que comme un calcul brut ou des modèles de réglage fin.
L’interrogation du modèle Mixtral 8x7b de Groq sur son site Web a abouti à la réponse suivante, qui a été traitée à 420 jetons par seconde ;
« Groq est un outil puissant pour exécuter des modèles d’apprentissage automatique, en particulier dans les environnements de production. Bien qu’il ne s’agisse peut-être pas du meilleur choix pour le réglage ou la formation de modèles, il excelle dans l’exécution de modèles pré-entraînés avec des performances élevées et une faible latence.
Une comparaison directe de la bande passante mémoire est moins simple en raison de l’accent mis par le LPU Groq sur la bande passante mémoire sur puce, ce qui profite considérablement aux charges de travail d’IA en réduisant la latence et en augmentant les taux de transfert de données au sein de la puce.
Evolution des composants informatiques pour l’IA et l’apprentissage automatique
L’introduction de l’unité de traitement du langage par Groq pourrait constituer une étape importante dans l’évolution du matériel informatique. Les composants PC traditionnels (CPU, GPU, disque dur et RAM) sont restés relativement inchangés dans leur forme de base depuis l’introduction des GPU, par opposition aux graphiques intégrés. Le LPU introduit une approche spécialisée axée sur l’optimisation des capacités de traitement des LLM, dont l’exécution sur des appareils locaux pourrait devenir de plus en plus avantageuse. Alors que des services tels que ChatGPT et Gemini fonctionnent via des services API cloud, les avantages du traitement LLM intégré en matière de confidentialité, d’efficacité et de sécurité sont innombrables.
Les GPU, initialement conçus pour décharger et accélérer le rendu graphique 3D, sont devenus un composant essentiel dans le traitement des tâches parallèles, ce qui les rend indispensables dans les jeux et le calcul scientifique. Au fil du temps, le rôle du GPU s’est étendu à l’IA et à l’apprentissage automatique, grâce à sa capacité à effectuer des opérations simultanées. Malgré ces progrès, l’architecture fondamentale de ces composants est restée essentiellement la même, se concentrant sur les tâches informatiques générales et le rendu graphique.
L’avènement du moteur d’inférence LPU de Groq représente un changement de paradigme spécialement conçu pour relever les défis uniques présentés par les LLM. Contrairement aux CPU et aux GPU, qui sont conçus pour un large éventail d’applications, le LPU est conçu sur mesure pour la nature intensive et séquentielle des tâches de traitement du langage. Cette orientation permet au LPU de dépasser les limites du matériel informatique traditionnel lorsqu’il s’agit de répondre aux demandes spécifiques des applications de langage d’IA.
L’un des principaux différenciateurs du LPU est sa densité de calcul et sa bande passante mémoire supérieures. La conception du LPU lui permet de traiter les séquences de texte beaucoup plus rapidement, principalement en réduisant le temps de calcul par mot et en éliminant les goulots d’étranglement de la mémoire externe. Il s’agit d’un avantage essentiel pour les applications LLM, où la génération rapide de séquences de texte est primordiale.
Contrairement aux configurations traditionnelles dans lesquelles les processeurs et les GPU s’appuient sur de la RAM externe pour la mémoire, la mémoire sur puce est intégrée directement dans la puce elle-même, offrant une latence considérablement réduite et une bande passante plus élevée pour le transfert de données. Cette architecture permet un accès rapide aux données, crucial pour l’efficacité du traitement des charges de travail d’IA, en éliminant les longs déplacements que les données doivent effectuer entre le processeur et les modules de mémoire séparés. L’impressionnante bande passante mémoire sur puce du Groq LPU, allant jusqu’à 80 To/s, démontre sa capacité à gérer les immenses besoins en données des grands modèles de langage plus efficacement que les GPU, qui peuvent disposer d’une bande passante mémoire hors puce élevée, mais ne peuvent pas égaler la vitesse et l’efficacité. fournie par l’approche sur matrice.
La création d’un processeur conçu pour les LLM répond à un besoin croissant au sein de la communauté de recherche et développement en IA de solutions matérielles plus spécialisées. Cette décision pourrait potentiellement catalyser une nouvelle vague d’innovation dans le matériel d’IA, conduisant à des unités de traitement plus spécialisées, adaptées aux différents aspects des charges de travail d’IA et d’apprentissage automatique.
À mesure que l’informatique continue d’évoluer, l’introduction du LPU aux côtés de composants traditionnels tels que les processeurs et les GPU marque une nouvelle phase dans le développement du matériel, une phase de plus en plus spécialisée et optimisée pour les demandes spécifiques des applications d’IA avancées.