
En résumé
- Google a surpris en présentant Gemini, son ensemble d’outils d’intelligence artificielle multimodales destinés aux consommateurs et aux entreprises, avec trois versions : Nano, Pro et Ultra.
- Gemini Ultra a obtenu de solides résultats dans les tests de référence, égalant ou dépassant les performances humaines dans certains cas.
- Sa formation « nativement multimodale » lui permet de traiter du texte, des images, de l’audio et de la vidéo en entrées et sorties.
- La capacité de raisonnement multimodal des Gémeaux se démarque dans les évaluations qualitatives, démontrant son efficacité dans les tâches éducatives et surpassant les modèles existants dans les tests de préférences humaines.
Ce mercredi, Google a surpris le monde de la technologie avec le lancement de Gemini, sa suite d’outils d’intelligence artificielle multimodale destinée aux consommateurs et aux entreprises.
Parmi les géants de la technologie qui se lancent de manière agressive dans l’IA, Google semblait nager dans l’espace intermédiaire, tandis que OpenAI, soutenu par Microsoft, poussait ChatGPT vers Turbo et Vision et Anthropic amélioré vers Claude.
Cependant, aujourd’hui, Google s’est lancé dans la concurrence avec trois versions de Gemini : Nano, Pro et Ultra, qui comprennent et intègrent de manière transparente le texte, les images, l’audio et la vidéo.
Gemini semble prêt à dépasser les modèles d’IA de pointe d’OpenAI, qui vient de publier une liste interminable de nouvelles fonctionnalités, mais s’est rapidement retrouvé mêlé à des intrigues d’entreprise.
La version la plus avancée, Gemini Ultra, a obtenu d’excellents résultats dans plusieurs tests populaires, égalant ou dépassant les performances humaines dans certains cas. Par exemple, il a établi de nouveaux records dans 30 des 32 critères de l’examen MMLU, qui couvre une variété de matières académiques.
Une caractéristique clé de Gemini est sa formation « nativement multimodale », qui lui permet de traiter plusieurs types de données telles que du texte, des images et de l’audio en tant qu’entrées et sorties. Cette approche signifie que le modèle a été construit et formé à partir de zéro pour comprendre différentes entrées, plutôt que d’être le résultat d’une combinaison ultérieure de modes et de modules discrets.
Les IA multimodales les plus populaires d’aujourd’hui suivent la dernière feuille de route. Par exemple, ChatGPT combine GPT-4 Turbo avec Dall-E 3 pour le traitement de texte et la génération d’images, GPT-4 Vision pour le traitement d’images et un module d’encodage spécial pour les calculs. En conséquence, le LLM est relégué au rôle de coordinateur entre différents modèles d’IA qui ne peuvent pas comprendre de manière indépendante la pleine nature d’un problème spécifique.
Cette limitation peut également conduire à des vulnérabilités telles que l’injection de commandes. Par exemple, des techniques pour échapper aux contrôles de sécurité établis pour les messages texte, en les écrivant ou en les imprimant sur papier, en prenant une photo et en demandant au module visuel de la traiter.
En revanche, les premières évaluations qualitatives de Gemini révèlent sa remarquable capacité à effectuer un raisonnement multimodal. Par exemple, dans un contexte éducatif, les Gémeaux peuvent comprendre des problèmes de physique complexes, les convertir en formules mathématiques et proposer des solutions correctes. Cette capacité ouvre des voies de transformation dans l’éducation et dans d’autres domaines.
Les LLM traditionnels ne sont généralement pas très bons en mathématiques, c’est pourquoi les capacités de raisonnement de la famille Gemini de LLM multimodaux méritent qu’on s’y intéresse.
Dans un autre benchmark axé sur la compréhension multimodale du langage, Gemini Ultra a atteint une précision de plus de 90 %, surpassant les autres modèles existants. Google affirme que les tests de préférence humaine ont également montré une nette préférence pour Gemini par rapport à des modèles comme PaLM 2 dans des domaines tels que l’écriture créative.
Le plus petit service, Gemini Nano, est conçu pour l’efficacité sur l’appareil, excellant dans le résumé, la compréhension écrite et diverses tâches de raisonnement. Malgré sa petite taille, le Gemini Nano affiche des performances remarquables par rapport au plus grand modèle Gemini Pro. Cela signifie que Gemini pourrait devenir l’IA de choix pour alimenter les assistants mobiles qui peuvent ou doivent fonctionner hors ligne.
Les Gémeaux semblent avoir des débuts très solides. Et à mesure que les capacités d’IA de Google s’améliorent, sa polyvalence pourrait permettre de nouvelles applications dans de nombreux domaines. Pour l’instant, cependant, des tests supplémentaires en conditions réelles sont nécessaires pour déterminer ses niveaux de performances réalistes.
Aujourd’hui, les utilisateurs peuvent essayer une version optimisée de Gemini Pro avec Bard. Gemini Ultra sera lancé l’année prochaine dans une nouvelle version du chatbot de Google appelée Bard Advanced. Google espère lancer Gemini dans plus de 170 langues différentes et utiliser la technologie pour renforcer sa gamme de produits Pixel et son expérience de recherche générative.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Voir l’article original en espagnol
