
En résumé
- Google a introduit des améliorations à Gemini AI suite à l'annonce de GPT-4, notamment des réponses générées par l'IA dans la recherche sur le Web.
- Gemini a ajouté des fonctionnalités telles que « Demander des photos » et l'analyse des réunions dans Google Meet pour les résumer et générer des réponses dans le chat.
- Annonce de Gemini 1.5 Pro avec une fenêtre contextuelle de 1 million de jetons multimodaux, dépassant GPT-4.
Le lendemain de l'annonce tant attendue par OpenAI de GPT-4o, son Large Language Model (LLM) « omnimodal » amélioré, Google a répondu avec une série d'améliorations de ses offres d'intelligence artificielle Gemini AI, démontrant ses prouesses technologiques, tirant parti de ses avantages en matière de recherche en direct. et consolider sa position contre le leader de l'engagement mental ChatGPT.
Tirant parti de ses atouts, Google intègre l'intelligence artificielle générative dans son expérience de recherche, permettant aux utilisateurs d'interagir naturellement avec son moteur de recherche plutôt que de s'appuyer sur des requêtes basées sur des mots clés. La présentation comprenait une démonstration d'une requête de recherche Google sur la façon d'éliminer une tache de café. Au lieu de simplement afficher des liens vers des pages web avec des instructions, le moteur de recherche a immédiatement fourni une réponse complète générée par l’intelligence artificielle.
Ces résultats générés par l'IA, conçus pour répondre directement et efficacement aux requêtes des utilisateurs, seront affichés au-dessus des résultats de recherche.
Tout au long de la présentation, Google a clairement indiqué que sa domination dans la recherche sur le Web se traduisait par un avantage clé pour ses initiatives d'IA, montrant comment diverses fonctions peuvent accéder aux informations actuelles au lieu de s'appuyer sur un instantané obsolète comme d'autres modèles d'IA. grande langue.
L'une des fonctionnalités notables annoncées est « Ask Photos », qui permet aux utilisateurs d'avoir des conversations naturelles avec Gemini pour rechercher des informations dans leur galerie. Alors que Google Photos permet depuis longtemps aux utilisateurs de rechercher dans sa bibliothèque d'images des personnes, des objets ou des mots spécifiques, la mise à jour de l'IA prend en charge les requêtes ouvertes et en langage naturel.
Par exemple, un utilisateur de Google a demandé à Gemini quel était le numéro de plaque d'immatriculation de sa voiture. Gemini a parcouru toutes les photos de lui, les a évaluées et a fourni la bonne réponse.
Une autre amélioration serait familière aux utilisateurs d’un certain nombre d’assistants de réunion IA, y compris ceux intégrés aux plateformes de conférence en ligne comme Zoom. Dans Google Meet, Gemini peut désormais analyser les réunions, les résumer et générer des réponses aux questions dans le chat. Après une réunion, Gemini fournit une liste de choses à faire et des attributions de tâches.
La plus grande nouvelle concernait les mises à jour sous le capot. Google a annoncé aujourd'hui le lancement de Gemini 1.5 Pro, doté d'une impressionnante fenêtre contextuelle d'un million de jetons multimodes. Cette capacité dépasse de loin la limite de 128 000 jetons de GPT-4 et est désormais disponible pour les développeurs et les consommateurs sur Gemini Advanced, le niveau de service d'IA payant du géant de la technologie.
Google annonce qu'il prévoit d'étendre encore sa capacité de gestion des jetons cette année, pour atteindre potentiellement jusqu'à 2 millions de jetons pour les développeurs, soit une multiplication par dix par rapport à celle du GPT-4.
Grâce à sa capacité considérablement accrue, Google a également démontré les impressionnantes capacités de récupération du Gemini. Il s'agit d'une fonctionnalité clé, car jusqu'à présent, les LLM comme Claude ou GPT-4 présentaient une dégradation des performances – « oubliant » les informations discutées précédemment – lorsqu'on leur demandait de grandes quantités de données.
En plus de ses modèles de nouvelle génération, Google a lancé Gemini 1.5 Flash, un LLM multimodal compact conçu pour rivaliser avec Claude 3 Haiku et GPT-3.5 en termes de taux de réponse rapide. Cependant, sa capacité de traitement de 1 million de tokens le positionne comme le modèle « léger » le plus puissant disponible à ce jour.
L'annonce la plus intéressante a probablement été le projet Astra de Google, un agent d'IA universel qui peut être personnalisé et adapté aux besoins de chaque utilisateur. Google a noté que la présentation d'Astra avait été enregistrée en temps réel, probablement en réponse à la démo en direct GPT-4o d'OpenAI hier. L’interaction semblait plus performante et moins maladroite que celle de GPT-4o, bien qu’avec des réponses plus concrètes et moins humaines.
Voici une démo du nouvel assistant Project Astra ! C'est plutôt cool de le voir sur des lunettes intelligentes aussi. Certaines de ces expériences d'agent seront disponibles sur l'application Gemini plus tard cette année. pic.twitter.com/hGk6bbIzUD
– Mishaal Rahman (@MishaalRahman) 14 mai 2024
Bien que la voix de Gemini soit également largement naturelle, elle n'a pas la qualité émotionnelle, voire « coquette » du nouvel assistant ChatGPT d'OpenAI. La priorité de Google semble être la fonctionnalité, contrairement à l'accent mis par OpenAI sur des interactions plus humaines.
Allant au-delà des modèles linguistiques traditionnels, Google a introduit des agents d'IA personnalisables et multiplateformes qui, selon lui, sont capables de raisonner, de planifier et de mémoriser. Ces capacités permettent à Gemini de se comporter comme un ensemble d’IA spécialisées travaillant ensemble.
Ces connexions basées sur des API, que Google a qualifiées de « gemmes », semblent être une réponse aux GPT personnalisables d'OpenAI. Gems s'intègre parfaitement à l'écosystème Google, offrant des fonctionnalités telles que la traduction linguistique en temps réel, la recherche contextuelle et les recommandations personnalisées. Les utilisateurs peuvent façonner les gemmes pour qu'elles se concentrent sur des tâches ou des domaines spécifiques, en utilisant un ton spécifique.

Google a également annoncé de nouveaux modèles d'IA générative pour les images, les vidéos et la musique. Image 3, le nouveau générateur d'images de Google, fournit des images très réalistes et détaillées, contrairement à l'aspect caricatural d'OpenAI. Ils affirment également qu’il excelle dans la génération de texte, une fonctionnalité qu’OpenAI prétend également avoir améliorée.
De plus, ils ont publié une version améliorée de MusicLM pour les amateurs de musique générative.
La cerise sur le gâteau était Veo, un modèle vidéo génératif, annoncé avant le lancement du très attendu outil vidéo Sora d'OpenAI, mais qui n'a pas encore été publié. La sortie brute et non éditée suggère un niveau de qualité comparable à celui de la prochaine entrée d'OpenAI. Google affirme qu'il rendra Veo disponible d'ici quelques semaines, un délai qui pourrait dépasser Sora sur le marché.
Présentation de Veo : notre modèle vidéo génératif le plus performant. 🎥
Il peut créer des clips 1080p de haute qualité pouvant durer plus de 60 secondes.
Du photoréalisme au surréalisme et à l’animation, il peut aborder une gamme de styles cinématographiques. 🧵 #GoogleIO pic.twitter.com/6zEuYRAHpH
– Google DeepMind (@GoogleDeepMind) 14 mai 2024
Vers la fin de sa présentation de plus de deux heures, Google a montré son appréciation à la communauté open source en présentant Pali Gemma, un modèle de vision open source. La société a également promis de publier Gemma 2, la prochaine itération de son grand modèle de langage open source, en juin. Le nouveau modèle aura une fenêtre contextuelle de jeton étendue et sera plus puissant et plus précis.
Enfin, Google a annoncé qu'il lançait pour la première fois son ensemble de fonctionnalités Gemini sur son système d'exploitation mobile Android. Cela fait suite au favoritisme apparent d'OpenAI pour les plateformes MacOS et iOS d'Apple, où il publiait ses dernières mises à jour avant de le faire sur Windows, créé par son principal investisseur, Microsoft.
Généralement intelligent Bulletin
Un voyage hebdomadaire en IA raconté par Gen, un modèle d'IA générative.