Google a introduit un package Curseur IA, Googlebook et Gemini Intelligence

Google a introduit un package Curseur IA, Googlebook et Gemini Intelligence

Google DeepMind développe un curseur de souris d'ordinateur à intelligence artificielle basé sur Gemini – la société entend repenser une technologie qui n'a pas changé depuis plus d'un demi-siècle.

« Nous explorons de nouvelles capacités basées sur l'IA qui aideront le curseur non seulement à comprendre ce qu'il pointe, mais aussi pourquoi cela est important pour l'utilisateur », a déclaré la société dans un article de blog.

Le projet résout un problème courant : un outil d'IA standard s'exécute dans une fenêtre séparée et l'utilisateur doit y glisser et déposer son contenu.

« Nous recherchons le contraire : une intelligence artificielle intuitive qui interagit avec les utilisateurs à travers tous les outils qu'ils utilisent, sans interrompre leur flux de travail », a déclaré la société.

Quatre principes d'un curseur IA

Google DeepMind a développé quatre principes qui déplacent le transfert du contexte et de l'intention de l'utilisateur vers l'ordinateur et remplacent les invites textuelles par des moyens d'interaction plus intuitifs.

Enregistrer un flux de travail

Les fonctionnalités d'IA doivent fonctionner dans toutes les applications, c'est pourquoi le prototype de curseur de Google DeepMind est disponible partout où l'utilisateur interagit. Par exemple, vous pouvez passer votre souris sur un fichier PDF et demander un court résumé sous forme de liste à insérer dans un email.

Un autre exemple consiste à passer votre curseur sur un tableau de statistiques et à demander un diagramme circulaire.

Montrer et raconter

Les réseaux de neurones modernes nécessitent des instructions précises et pour obtenir une réponse de haute qualité, l'utilisateur doit rédiger une invite détaillée. Un curseur IA simplifie ce processus en capturant le contexte visuel et sémantique, permettant au modèle de « voir » et de comprendre ce qui est important.

Dans le système expérimental DeepMind de Google, pointez simplement sur un paragraphe, un fragment d'image ou un bloc de code et LLM comprendra pourquoi vous avez besoin d'aide.

Le pouvoir des mots « ceci » et « cela »

Dans la communication quotidienne, les gens ont rarement recours à des phrases longues et détaillées. Ils disent « Réparez-le », « Déplacez-le ici » ou « Qu'est-ce que cela signifie », tout en s'appuyant simultanément sur les gestes et le contexte général.

« Un système d'IA capable de comprendre cette combinaison de contexte, de gestes et de parole permettra aux utilisateurs de formuler des requêtes complexes de manière naturelle et concise sans recourir à des invites complexes », indique le blog DeepMind de Google.

Pixels pour l'interaction

Pendant des décennies, les ordinateurs n’ont suivi que la direction du regard. L'intelligence artificielle peut comprendre exactement ce que l'utilisateur pointe et transformer les pixels en objets structurels pour une interaction instantanée.

« Une photo avec des croquis se transforme en une liste de choses à faire interactive, une image fixe d'une vidéo de voyage se transforme en un lien pour réserver une table dans ce joli restaurant », a noté Google DeepMind.

Mise en œuvre

Google DeepMind implémente ces principes dans Chrome et la nouvelle interface Googlebook.

« À partir d'aujourd'hui, au lieu de taper des requêtes complexes, vous pouvez utiliser votre curseur pour interroger Gemini dans Chrome sur la partie d'une page Web qui vous intéresse », indique le blog.

Par exemple, vous pouvez sélectionner plusieurs produits sur une page et leur demander de les comparer ou de pointer vers un endroit où vous souhaitez visualiser un nouveau canapé dans le salon.

La société lancera bientôt Magic Pointer sur Googlebook. La fonction vous permettra d'utiliser Gemini d'un simple glissement de doigt.

Livre Google

Google a dévoilé une « nouvelle catégorie d'ordinateurs portables » alimentée par les fonctionnalités Gemini qui combine Android et ChromeOS.

« Il y a plus de 15 ans, nous avons présenté le Chromebook, un ordinateur portable conçu pour un monde axé sur le cloud. Aujourd'hui, lors de la transition du système d'exploitation vers un système intelligent, nous voyons une opportunité de repenser une fois de plus le concept des ordinateurs portables », indique l'annonce.

Les livres Google sont conçus pour Gemini Intelligence et le nouveau curseur AI. Les appareils ont reçu la fonction « Créer un widget » avec prise en charge des commandes vocales.

Gemini peut rechercher des informations sur le Web ou se connecter à des applications Google telles que Gmail et Calendrier pour créer un tableau de bord unique et personnalisé.

L'outil est construit sur la pile technologique Android, qui garantit un travail transparent sur plusieurs appareils : la fonction d'accès rapide vous permet d'afficher, de rechercher et d'insérer des fichiers de votre téléphone vers votre ordinateur portable sans transfert manuel.

Les premiers Googlebooks sont créés en collaboration avec Acer, ASUS, Dell, HP et Lenovo.

Intelligence des Gémeaux

Gemini Intelligence est un ensemble de fonctions d'IA pour les appareils Android. À l’été 2026, ils apparaîtront d’abord sur les Samsung Galaxy et Google Pixel, puis sur d’autres gadgets.

« Ce système combine un matériel de classe mondiale et des logiciels innovants pour vous aider à garder une longueur d'avance en relevant de manière proactive les défis de votre journée. Dans le même temps, la confidentialité des données et un contrôle total sur celles-ci sont garantis », indique l'annonce.

Certaines capacités d'agent de Gemini ont déjà été démontrées début 2026 sur les smartphones Samsung – par exemple, commander de la nourriture ou des taxis. Bientôt, l'assistant pourra effectuer des tâches plus complexes : il suffit de prendre une photo d'une brochure touristique et le bot trouvera des options similaires sur Expedia.

Dans Chrome, l'assistant IA vous aidera à trouver, résumer et comparer le contenu d'une page à l'autre. La fonction Rambler du clavier Gboard vous permettra de dicter du texte, puis de mettre en évidence des fragments importants et de les assembler en un message cohérent sans mots de remplissage ni répétitions.

Rappelons qu'en avril, Google a présenté Gemma 4, une nouvelle famille de modèles d'IA ouverts pour un raisonnement avancé et des flux de travail basés sur des agents.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !

Voir l’article original en russe

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !