
Restez à jour avec la chaîne WhatsApp de Criptotence: Instant News sur Bitcoin, Altcoins, Defi, NFT, Blockchain et Metaverso. S’abonner!
Google Deepmind a franchi une étape décisive avec le lancement de Genie 3, son nouveau modèle généraliste capable de générer des environnements interactifs en temps réel à partir de texte simples ou d’indications visuelles.
Contrairement à leurs prédécesseurs, Genie 3 permet aux utilisateurs et aux agents de se déplacer dans des mondes 3D simulés de fluidité, de cohérence temporaire et de capacité de modification sous demande, approchant ainsi une étape essentielle vers l’intelligence artificielle générale (AGI).
Qu’est-ce que Genie 3 contribue aux modèles précédents?
Genie 3 fonctionne à 24 ips et la résolution 720p, en maintenant la cohérence visuelle pendant plusieurs minutes. Il dépasse le génie 2, qui était limité à 10 à 20 secondes avec les premiers artefacts, et ajoute une fonction appelée « événements mondiaux programmables », qui vous permet de changer d’éléments de l’environnement par des invites, comme l’ajout d’animaux ou la modification du climat sans interrompre la simulation.
Cela représente une amélioration radicale: bien que Genie 2 ait généré des environnements statiques ou à court terme, Genie 3 permet une navigation et une exploration dynamiques continues, avec une mémoire visuelle qui maintient la cohérence interne (par exemple, une image sur le mur apparaît la même si elle revient à la scène).
Utilisations attendues et objectif éducatif
Google Deepmind présente Genie 3 comme un outil de formation pour les agents autonomes, tels que les robots ou les véhicules, leur permettant d’apprendre dans des environnements réalistes sans risques physiques. Par exemple, une voiture autonome pourrait pratiquer des actions telles que éviter les piétons ou réagir à des changements soudains dans l’environnement.

Ce type de simulation accélère l’apprentissage sans dépendre des données réelles, favorisant le développement sûr des systèmes intelligents.
En plus des applications robotiques, son utilisation dans l’éducation, la conception et le prototype interactif, où les utilisateurs peuvent explorer des environnements personnalisables, découvrir des idées créatives ou visualiser des scénarios fictifs avec une cohérence visuelle et narrative.
Implications pour la route vers l’IA générale
Genie 3 est considéré par ses créateurs comme une étape clé vers AGI, permettant aux modèles de langue de s’entraîner et d’opérer dans des environnements structurés qui anticipent l’impact de leurs actions. Au lieu de traiter les données à partir de texte plat, les agents peuvent vivre, interagir et adapter des stratégies dans un espace simulé dynamique.
Cette évolution pointe vers une nouvelle génération d’IA qui ne comprend pas seulement le langage, mais mappe, prédit et navigue également dans des écosystèmes virtuels complexes. Google continue de développer des verticales complémentaires telles que je vois 3 (génération de vidéos réalistes), Gemini Deep Think et Assistants autonomes tels que Astra.
Genie 3 marque Avant et après pour DeepMind: il s’agit du premier modèle mondial général disponible en temps réel, avec cohérence, fluidité et capacité de modification en marche. Son potentiel en tant qu’outil de formation pour les agents autonomes, son utilité éducative et sa structure avancée orientée vers AGI en font un élément clé de l’avenir de l’intelligence artificielle.
Bien que toujours réservé aux chercheurs, ce modèle prévoit une nouvelle ère où les mondes numériques sont non seulement des simulations visuelles, mais des environnements interactifs capables d’enseigner, d’explorer et d’évoluer.
En rapport
Voir l’article original en espagnol
