
Microsoft Research a annoncé la sortie de Phi-2, un petit modèle de langage (SLM) qui démontre des capacités remarquables pour sa taille. Le modèle a été révélé pour la première fois lors de l’événement Ignite 2023 de Microsoft, où le PDG de Microsoft, Satya Nadella, a souligné sa capacité à atteindre des performances de pointe avec une fraction des données d’entraînement.
Contrairement à GPT, Gemini et autres grands modèles linguistiques (LLM), un SLM est formé sur un ensemble de données limité, utilisant moins de paramètres et nécessitant moins de calculs pour fonctionner. En conséquence, le modèle ne peut pas être généralisé autant qu’un LLM, mais il peut être très bon et efficace dans des tâches spécifiques, telles que les mathématiques et les calculs dans le cas de Phi.
Phi-2, avec ses 2,7 milliards de paramètres, fait preuve d’un bon raisonnement et d’une bonne compréhension du langage, rivalisant avec des modèles jusqu’à 25 fois sa taille, selon Microsoft. Cela est dû à l’accent mis par Microsoft Research sur les données d’entraînement de haute qualité et les techniques de mise à l’échelle avancées, produisant un modèle qui surpasse ses prédécesseurs sur plusieurs critères, notamment les mathématiques, la programmation et le raisonnement de bon sens.
« Avec seulement 2,7 milliards de paramètres, Phi-2 surpasse les modèles Mistral et Llama-2 avec des paramètres 7B et 13B sur plusieurs benchmarks agrégés », a déclaré Microsoft, portant un coup bas au nouveau modèle d’IA. Google : « De plus, le Phi-2 correspond ou dépasse le Google Gemini Nano 2 récemment annoncé, bien qu’il soit de plus petite taille. »
Gemini Nano 2 est le dernier pari de Google sur un LLM multimodal capable de travailler localement. Il a été annoncé comme faisant partie de la famille Gemini de LLM qui devraient remplacer PaLM-2 dans la plupart des services Google.
L’approche de Microsoft en matière d’IA va au-delà du développement de modèles. Comme Decrypt l’a récemment rapporté, l’introduction de puces personnalisées, Maia et Cobalt, montre que l’entreprise s’oriente vers une intégration complète de l’IA et du cloud computing. Les puces informatiques, optimisées pour les tâches d’IA, soutiennent la vision plus large de Microsoft d’harmoniser les capacités matérielles et logicielles et concurrencent directement Google Tensor et la nouvelle série de puces M d’Apple.
Il est important de noter que Phi-2 est un modèle de langage si petit qu’il peut s’exécuter localement sur des ordinateurs bas de gamme, potentiellement même sur des smartphones, ouvrant ainsi la voie à de nouvelles applications et cas d’utilisation.
Alors que Phi-2 entre dans le domaine de la recherche et du développement en IA, sa disponibilité dans le catalogue de modèles Azure AI Studio constitue également une étape vers la démocratisation de la recherche en IA. De plus, Microsoft est l’une des entreprises les plus actives contribuant au développement de l’IA open source.
Alors que le paysage de l’IA continue d’évoluer, le Phi-2 de Microsoft est la preuve que le monde de l’IA ne consiste pas toujours à voir grand. Parfois, le plus grand pouvoir réside dans le fait d’être plus petit mais plus intelligent que la concurrence.
Edité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Voir l’article original en espagnol
