En résumé
- Google a présenté Gemini Omni, un modèle d'IA multimodal qui combine Gemini avec ses outils Veo, Nano Banana et Genie.
- Demis Hassabis, PDG de DeepMind, a décrit Omni comme une étape vers l'intelligence artificielle générale lors de Google I/O 2026.
- La société a indiqué que Gemini Omni Flash fera ses débuts dans Flow et Flow Music, en conservant des personnages et des scènes cohérents après les éditions.
Google a présenté mardi Gemini Omni, un nouveau modèle d'IA multimodal qui combine les modèles d'IA Gemini de l'entreprise avec ses outils de génération multimédia, tels que Veo, Nano Banana et Genie.
L'annonce a été faite lors de Google I/O 2026, où Demis Hassabis, PDG de DeepMind, a décrit Gemini Omni comme « notre nouveau modèle qui peut créer n'importe quoi à partir de n'importe quelle entrée ».
« Il combine l'intelligence de Gemini avec le meilleur de nos modèles de médias génératifs pour un nouveau niveau de compréhension, de multimodalité et d'édition du monde », a déclaré Hassabis.
Google a déclaré que la première version, Gemini Omni Flash, serait réalisée via Flow, la plateforme de création de films IA de la société, et Flow Music, qui se concentre sur la création musicale assistée par IA.
Qualifiant Omni de « pas vers l'intelligence artificielle générale », Hassabis a déclaré que Google avait passé l'année dernière à étendre Gemini à « une IA de modèle mondial capable de comprendre et de simuler le monde ».
Le lancement d'Omni par Google s'appuie sur la popularité de Nano Banana, le précédent modèle d'édition d'images IA de la société qui a contribué à propulser Gemini à la première place de l'App Store d'Apple en septembre dernier. Nano Banana a été largement utilisé pour la génération de mèmes et l'édition d'images conversationnelles, aidant brièvement Gemini à surpasser ChatGPT en termes de téléchargements d'applications et d'intérêt pour la recherche Google pour la première fois depuis le lancement du chatbot d'OpenAI en 2022.
Dans la comparaison de Décrypter Plus tôt ce mois-ci, Nano Banana 2 a surpassé GPT Image 2 d'OpenAI dans les tests d'illustration d'anime et de composition spatiale, tandis que le modèle d'OpenAI a mieux fonctionné en termes de photoréalisme et de rendu de texte. Google semble désormais étendre bon nombre de ces fonctionnalités d'édition à la vidéo via Gemini Omni.
Au cours de la présentation, Google a montré comment Omni avait généré une vidéo éducative de type Claymation expliquant le repliement des protéines. La société a également présenté des outils d'édition conversationnelle permettant de modifier une vidéo selfie en ajoutant de nouveaux éléments visuels et en modifiant l'environnement.
Google affirme qu'Omni peut conserver les mêmes personnages, arrière-plans et mouvements cohérents même après que les utilisateurs ont apporté des modifications à une vidéo, ce avec quoi de nombreux modèles vidéo d'IA ont du mal. La société affirme également qu'Omni utilise les capacités de raisonnement de Gemini pour comprendre des instructions plus larges, afin que les utilisateurs puissent décrire le type de scène qu'ils souhaitent sans avoir à expliquer manuellement chaque détail.
La société a également introduit Flow Agent, un assistant d'IA intégré à Google Flow qui peut générer des idées de scènes, organiser des ressources, recommander des modifications d'intrigue et modifier des projets par lots.
Les mises à jour supplémentaires incluent Flow Tools, qui permet aux utilisateurs de créer des flux de travail d'édition personnalisés à l'aide d'invites en langage naturel sans expérience en programmation.
Hassabis a déclaré que Google commençait par la génération vidéo, mais prévoyait d'étendre l'accès à Omni, le décrivant comme la vision à long terme derrière la conception multimodale de Gemini.
« Cela a toujours été notre objectif avec Gemini, et c'est pourquoi nous l'avons construit pour qu'il soit multimodal dès le début », a-t-il déclaré.
Google n'a pas immédiatement répondu à une demande de commentaire de Décrypter.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.