Stability AI a annoncé l’aperçu de Stable Diffusion 3 (SD3), son « modèle texte-image le plus performant » à ce jour.
Les principales améliorations apportées au SD3 incluent une meilleure génération de texte et une forte adhésion aux repères, garantissant la correspondance des images.
La communauté de l’IA a réagi avec enthousiasme aux nouvelles concernant SD3, soulignant sa supériorité sur des concurrents tels que MidJourney et Google ImageFX.
Stability AI vient d’annoncer l’aperçu de son outil d’imagerie de nouvelle génération, Stable Diffusion 3 (SD3), le qualifiant de « modèle texte-image le plus performant » à ce jour. Cette annonce fait suite à la sortie de Stable Diffusion XL (SDXL) l’année dernière, qui s’est rapidement imposé comme l’imageur open source le plus avancé.
Les principales améliorations apportées avec SD3 sont une meilleure génération de texte, une forte adhésion aux indications et une résistance aux fuites d’indications, ces dernières forces garantissant que les images générées correspondent à ce qui est demandé. Stability AI a également souligné la prise en charge par SD3 de l’entrée multimodale, promettant de le démontrer dans un futur livre blanc.
La communauté de l’IA a répondu avec enthousiasme aux nouvelles concernant le SD3.
« Ce générateur d’images IA est le meilleur que nous ayons vu en termes de compréhension des signaux et de génération de texte », a déclaré MattVidPro, un éminent YouTuber axé sur l’IA. « Il est de la tête et des épaules au-dessus des autres, et c’est vraiment incroyable. »
De même, l’ingénieur en apprentissage automatique Ralph Brooks a déclaré que les capacités de génération de texte du modèle étaient « incroyables ».
Comparaison côte à côte
Bien que Stable Diffusion 3 ne soit disponible que pour certains partenaires pour le moment, les passionnés de Stability AI et d’IA partagent des comparaisons entre sa sortie et la sortie d’indications similaires de SDXL, MidJourney et Dall-E 3. D’après ce que vous pouvez voir, SD3 surpasse ses concurrents en termes de qualité globale, et Décrypter a effectué ses propres tests pour vérifier cela. Les résultats parlent d’eux-mêmes:
SD3 et MidJourney
Invite : « Illustration d’anime épique représentant un sorcier au sommet d’une montagne la nuit jetant un sort cosmique dans le ciel sombre qui dit ‘Stable Diffusion 3’ fait d’énergie colorée. »
Stable Diffusion 3 (à gauche) vs MidJourney (à droite) en utilisant la même indication. Image : Décrypter
Lors de notre première comparaison, SD3 a suivi de très près l’exemple. MidJourney n’a pas réussi à générer l’invite, il n’a pas généré de montagne et le sorcier ne lançait pas de sort cosmique.
SD3 et ImageFX
Indication : « Photo d’un ordinateur de bureau des années 90 sur un bureau de travail. L’écran de l’ordinateur indique « bienvenue ». Sur le mur du fond, nous voyons un magnifique graffiti avec le texte ‘SD3’ en très grand format sur le mur.
Stable Diffusion 3 (à gauche) vs ImageFX (à droite) en utilisant la même invite. Image : Décrypter
Dans notre deuxième comparaison, SD3 a suivi l’invite avec une adhésion notable, tandis que le générateur d’images AI de Google, ImageFX, a souffert d’une fuite d’invite, générant le texte SD3 sur l’écran de l’ordinateur et non en arrière-plan, sans répondre à l’invite. demande de style graffiti sans représenter le mot « bienvenue » [welcome]».
L’esthétique générée par SD3 s’apparente également davantage à une photographie qu’à une représentation manifestement « photoréaliste ». Remarquez les effets entourant le porte-stylo et d’autres éléments, qui semblent se fondre dans l’arrière-plan.
SD3 contre SDXL
Invite : « Sur la table de la cuisine se trouve un tissu brodé avec le texte « bonne nuit » et un bébé tigre brodé. À côté du tissu se trouve une bougie allumée. L’éclairage est doux et dramatique.
Stable Diffusion 3 (à gauche) vs SDXL (à droite) en utilisant la même invite. Image : Décrypter
Dans notre troisième comparaison, Stable Diffusion 3 et Stable Diffusion XL ont capturé l’essence de l’invite, mais SDXL n’a pas réussi à générer le texte, a souffert de fuites d’invite (générant deux écrans, dont l’un s’est transformé en autre chose), et le bébé tigre la broderie a été générée avec plus de précision par SD3.
SD3 contre Dall-e 3
Une peinture représentant un astronaute chevauchant un cochon dans un tutu tenant un parapluie rose, sur le sol à côté du cochon se trouve un rouge-gorge portant un haut-de-forme, dans le coin se trouvent les mots « Diffusion stable ».
Diffusion stable 3 (à gauche) vs Dall-e 3 (à droite) en utilisant le même stimulus. Image : Décrypter
Stable Diffusion 3 a généré ce qui était demandé dans le stimulus, tandis que Dall-e 3 n’a pas réussi à générer du texte, a créé un rendu 3D au lieu d’une peinture et a généré un arrière-plan de galaxie uniquement parce qu’il lui a été demandé de générer un astronaute.
Sous le capot
En théorie, Stable Diffusion 3 devrait disposer de suffisamment de puissance de calcul pour étayer ses affirmations de puissance et de prouesse.
« (SD3) utilise un nouveau type de transformateur de diffusion (similaire à Sora) combiné à une adaptation de flux et à d’autres améliorations », a déclaré Emad Mostaque, PDG de Stability AI, sur Twitter. Sora est le générateur texte-vidéo de nouvelle génération annoncé par OpenAI il y a quelques jours. Flow Matching, quant à lui, est une technique d’IA pour la modélisation générative basée sur une formation et une inférence plus rapides et plus stables que les méthodes alternatives, telles que les réseaux contradictoires génératifs (GAN).
Quelques notes: – Cela utilise un nouveau type de transformateur de diffusion (similaire à Sora) combiné à une adaptation de débit et à d’autres améliorations. – Cela profite des améliorations du transformateur et peut non seulement évoluer davantage, mais également accepter des entrées multimodales. – Plus de détails techniques bientôt
Stability AI affirme que ces améliorations augmentent l’évolutivité du modèle et sa capacité à accepter des entrées multimodales, et ouvrent également la voie à son application en vidéo, 3D, etc. Mostaque tweeté que leur vision pour SD3 comprend un écosystème complet d’outils conçus pour tirer parti des dernières avancées matérielles, tout en restant accessible et adaptable dans divers domaines créatifs.
Une semaine avant l’annonce du SD3, Stability AI a publié Stable Cascade. Contrairement à ses prédécesseurs, Stable Cascade est basé sur l’architecture Würstchen, connue pour sa modularité et ses performances en matière de compression de logs. Bien qu’il héberge plus de paramètres que Stable Diffusion XL, Stable Cascade offre des temps d’inférence plus rapides et un alignement supérieur des signaux, démontrant les progrès innovants que Stability AI continue de faire dans le développement de l’IA.
Bien que Stable Diffusion 3 ne soit pas encore accessible au public, Stability AI a souligné qu’il serait gratuit, open source et accessible à tous sous une licence non commerciale. Cependant, les passionnés peuvent demander un accès anticipé dans le cadre du programme d’adhésion.
Edité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !