
En résumé
- La startup parisienne Mistral AI a lancé Mixtral, un modèle de langage large (LLM) ouvert qui prétend surpasser le GPT 3.5 d’OpenAI sur plusieurs points.
- Mixtral utilise la technique Sparse Mixing of Experts (MoE), qui rend le modèle plus puissant et efficace que son prédécesseur, Mistral 7b, et rivalise avec des modèles plus grands utilisant une taille 10 fois plus petite.
- Mistral AI a reçu un investissement important de série A d’Andreessen Horowitz et d’autres géants de la technologie.
La startup parisienne Mistral AI, qui a récemment revendiqué une valorisation de 2 milliards de dollars, a lancé Mixtral, un modèle de langage large ouvert (LLM) qui, selon elle, surpasse le GPT 3.5 d’OpenAI dans plusieurs benchmarks et est beaucoup plus efficace.
Mistral a reçu un investissement important de série A d’Andreessen Horowitz (a16z), une société de capital-risque reconnue pour ses investissements stratégiques dans les secteurs technologiques transformateurs, en particulier l’IA. D’autres géants de la technologie tels que Nvidia et Salesforce ont également participé au tour de table.
« Mistral est au centre d’une communauté de développeurs petite mais passionnée qui se forme autour de l’IA open source », a déclaré Andreessen Horowitz dans son annonce de financement. « Les modèles communautaires dominent désormais régulièrement les classements open source (et surpassent même les modèles fermés sur certaines tâches). »
Mixtral utilise une technique appelée mélange clairsemé d’experts (MoE), qui, selon la société, rend le modèle plus puissant et efficace que son prédécesseur, le Mistral 7b, et même que ses concurrents plus puissants.
Un mélange d’experts (MoE) est une technique d’apprentissage automatique dans laquelle les développeurs forment ou configurent plusieurs modèles d’experts virtuels pour résoudre des problèmes complexes. Chaque modèle expert est formé sur un sujet ou un domaine spécifique. Lorsqu’il est confronté à un problème, le modèle sélectionne un groupe d’experts parmi un groupe d’agents, et ces experts utilisent leur formation pour décider quel résultat correspond le mieux à leur expérience.
Le MoE peut améliorer la capacité, l’efficacité et la précision des modèles d’apprentissage profond. L’ingrédient secret qui distingue Mixtral des autres est qu’il est capable de rivaliser avec un modèle formé sur 70 milliards de paramètres en utilisant un modèle 10 fois plus petit.
« Mistral a un total de 46,7 milliards de paramètres, mais n’utilise que 12,9 milliards de paramètres par jeton », a déclaré Mistral AI. « Par conséquent, il traite l’entrée et génère la sortie à la même vitesse et au même coût qu’un modèle 12,9B. »
« Mistral surpasse Llama 2 70B dans la plupart des benchmarks avec une inférence 6 fois plus rapide et correspond ou surpasse GPT 3.5 dans la plupart des benchmarks standards », a déclaré Mistral AI dans un article de blog officiel.
Mixtral est également sous licence permissive Apache 2.0. Cela permet aux développeurs d’inspecter, d’exécuter, de modifier et même de créer des solutions personnalisées au-dessus du modèle.
Il y a cependant un débat sur la question de savoir si Mixtral est 100 % open source ou non, car Mistral affirme n’avoir publié que des « poids ouverts » et la licence du modèle de base empêche son utilisation pour concurrencer Mistral AI. La startup n’a pas non plus fourni l’ensemble des données de formation et le code utilisé pour créer le modèle, ce qui serait le cas dans un projet open source.
La société affirme que Mixtral a été conçu pour fonctionner exceptionnellement bien dans des langues étrangères autres que l’anglais. « Mixtral 8x7B parle couramment le français, l’allemand, l’espagnol, l’italien et l’anglais », obtenant des scores élevés aux tests multilingues standardisés, a rapporté Mistral AI.
Une version instruite appelée Mixtral 8x7B Instruct a également été publiée pour une instruction minutieuse, obtenant un score optimal de 8,3 dans le benchmark MT-Bench. Cela en fait le meilleur modèle open source actuel du benchmark.
Le nouveau modèle de Mistral promet une architecture révolutionnaire de mixage expert dispersé, de bonnes capacités multilingues et un accès totalement ouvert. Et si l’on considère que cela s’est produit quelques mois seulement après sa création, la communauté open source vit dans une époque passionnante et intéressante.
Mixtral est disponible en téléchargement via Hugging Face, mais les utilisateurs peuvent également utiliser la version pédagogique en ligne.
Edité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Voir l’article original en espagnol
