
En résumé
- Google a lancé Image 3, son nouveau modèle de conversion de texte en image, qui offre des capacités améliorées de compréhension et d'exécution d'instructions complexes.
- L'image 3 produit des images avec des détails améliorés, un éclairage plus riche et moins d'artefacts gênants que ses modèles précédents.
- Google a mis en œuvre des processus de filtrage et d'étiquetage des données pour minimiser le contenu préjudiciable et a intégré SynthID, un outil de filigrane, dans l'image 3.
Google ajoute la cerise sur le gâteau d'une semaine chargée dans le domaine de l'IA générative avec la sortie d'Image 3, son nouveau modèle de conversion de texte en image. Cette sortie s'appuie sur le succès d'Image 2, lancé en décembre 2023, qui rivalisait déjà avec des poids lourds du secteur comme Dall-E 3 et MidJourney v5.
Image 3, annoncée initialement en mai, offre des capacités améliorées de compréhension et d'exécution d'indices complexes, générant des images avec des détails améliorés et une meilleure adhérence aux indices par rapport à son prédécesseur. Il est assez polyvalent, produisant de bons résultats allant du photoréalisme à l'art et aux compositions en 3D.
« L'image 3 est notre modèle texte-image de la plus haute qualité, capable de générer des images avec encore plus de détails, un éclairage plus riche et moins d'artefacts gênants que nos modèles précédents », a déclaré Google dans son annonce.
Les améliorations apportées à la description de l'image 3 permettent aux utilisateurs de décrire les images souhaitées en langage naturel sans avoir recours à une ingénierie complexe des invites. La formation du modèle a également incorporé des légendes d'image plus riches, lui permettant de capturer des détails subtils tels que des angles de caméra ou des compositions spécifiques et de longues invites de texte si nécessaire.
Le géant de la technologie a mis l'accent sur les capacités améliorées de rendu de texte de l'Image 3. Bien que sensiblement améliorées, nos premiers tests montrent que ses capacités ne sont pas tout à fait à la hauteur d'autres modèles comme le Dall-E 3, l'Auraflow ou le Flux.
Générations par Image 3 et Grok 2 utilisant la même invite
Google a également souligné son engagement en matière de sécurité et de responsabilité dans le développement et le déploiement d'Image 3. L'entreprise a mis en œuvre ce qu'elle décrit comme des processus de « filtrage et d'étiquetage des données étendus » pour minimiser le contenu nuisible dans les ensembles de données d'entraînement du modèle. En outre, Google a déclaré avoir mené des évaluations approfondies pour identifier et corriger les vulnérabilités potentielles.
Il est également important de noter que l'image 3 intègre SynthID, l'outil de tatouage numérique de Google. SynthID intègre une signature numérique directement dans les pixels des images générées. Ce filigrane est imperceptible à l'œil humain mais détectable par un logiciel spécialisé, offrant ainsi un moyen d'identifier le contenu généré par l'IA.
L'image 3 est actuellement disponible via la plateforme ImageFX de Google et Vertex AI.
Google prévoit d'introduire dans les prochains mois des fonctionnalités d'édition populaires d'Image 2, telles que l'inpainting et l'outpainting, dans Image 3. La société a également annoncé son intention d'étendre la disponibilité d'Image 3 à l'ensemble de son écosystème de produits, notamment l'intégration dans l'application Gemini, Google Workspace et Google Ads.
Ce lancement s’inscrit dans une stratégie plus large de Google qui vise à intégrer Gemini et la technologie IA dans la quasi-totalité de ses services et de son matériel. Cette semaine, la société a dévoilé sa nouvelle gamme Pixel 9, conçue avec des capacités d’IA au cœur de sa conception. Les nouveaux téléphones Pixel peuvent gérer localement certaines tâches d’IA génératrices, notamment les tâches basées sur du texte et la génération de petites images.
La sortie d'Image 3 intervient dans un contexte d'activité intense dans le domaine de la génération d'images par IA. Plus récemment, xAI d'Elon Musk a dévoilé Grok 2, doté du générateur d'images Flux.1, qui a attiré l'attention pour sa capacité à produire des images très réalistes et non censurées ainsi que de solides capacités de génération de texte.
Parallèlement, MidJourney, un autre acteur clé du secteur, a annoncé une prochaine mise à jour v6.2 de son modèle. L'entreprise a également fait allusion au développement de MidJourney v7, dont la sortie est prévue dans les prochains mois. Ideogram, un autre concurrent dans le domaine de la génération d'images par l'IA, a également fait allusion à une prochaine mise à jour de son modèle. Enfin, l'Open Model Initiative a choisi Flux.1 comme base pour le développement de son modèle de génération d'images open source de nouvelle génération.
Édité par Ryan Ozawa.
Généralement intelligent Bulletin
Un voyage hebdomadaire de l'IA raconté par Gen, un modèle d'IA génératif.