
En résumé
- La nouvelle Stable Cascade de Stability AI offre une approche très efficace et modulaire de la génération de texte en image, équilibrant qualité, vitesse et adaptabilité.
- La conception modulaire du Stable Cascade offre une efficacité et une polyvalence extrêmes, surpassant les modèles comparables comme le SDXL en termes de qualité d’image et d’attrait esthétique.
- Stable Cascade vous permet de faire plus avec moins de ressources, en offrant des temps d’inférence plus rapides et en excellant dans l’alignement des repères, tout en nécessitant moins de matériel et de mémoire.
Stability AI, la société à l’origine du très populaire imageur Stable Diffusion, vient de lancer une autre grenade dans le domaine compétitif de l’IA.
La nouvelle Stable Cascade de Stability, alimentée par la nouvelle architecture open source de Würstchen, offre une approche hautement efficace et modulaire de la génération de texte en image, équilibrant qualité, vitesse et adaptabilité.
Selon la société, le modèle atteint un facteur de compression jamais vu auparavant dans les modèles de diffusion stable traditionnels et est capable de produire des résultats avec une résolution et des détails plus élevés, comparables aux générateurs modernes tels que SDXL ou MidJourney (qui fonctionnent généralement avec des résolutions de 1024×1024). .
Ingrédients Würstchen
Stable Cascade adopte un processus en trois étapes, contrairement au pipeline Stable Diffusion traditionnel :
- Étape A : Le compresseur d’image : Contrairement aux modèles classiques, cette étape initiale traite les images comme des puzzles avancés. À l’aide d’un réseau contradictoire génératif quantifié vectoriel (VQGAN), l’image est divisée en sections compactes de 256 x 256. Chaque section reçoit un « jeton » discret provenant d’un livre de codes spécialisé. Cette étape ouvre la voie à un traitement ultra-rapide dans les étapes suivantes.
- Étape B : le reconstructeur (modèle de diffusion latente) Cette phase s’occupe du travail de reconstruction de l’image après compression. Considérez-le comme un rénovateur de bâtiments qualifié qui utilise des instructions et des plans détaillés pour son travail.
- Étape C : le générateur de texte latent conditionnel L’étape C se concentre uniquement sur le traitement d’instructions textuelles et la production de latents compressés. Cette approche de génération de texte découplée réduit considérablement la complexité et le coût du réglage pour des cas d’utilisation spécifiques.
En d’autres termes, il fait ce que son nom l’indique. Cela commence par un générateur de texte qui produit de petits instantanés d’image, qui sont gonflés en une image plus détaillée et correctement présentés à vos yeux comme une image pleine résolution de haute qualité.
Avantages modulaires
La conception modulaire de Stable Cascade offre plusieurs avantages convaincants, selon ses développeurs. La première est l’extrême efficacité : grâce à l’espace latent compressé (la façon dont une IA évalue la composition de l’image par rapport à l’espace des pixels, ce que les humains voient) et au modèle axé sur l’étape C, Stable Cascade atteint des temps d’inférence plus rapides, ce qui signifie qu’il calcule ses prédictions plus rapidement. Et il le fait avec des exigences matérielles considérablement réduites par rapport aux modèles à diffusion stable plus grands comme SDXL.
Les tests internes de Stability AI ont démontré la capacité de Stable Cascade à surpasser systématiquement des modèles comparables comme SDXL en termes de qualité d’image et d’attrait esthétique. De plus, le modèle atteint ces résultats à des vitesses très élevées tout en nécessitant beaucoup moins de ressources de calcul.
Un autre avantage que Stability AI prétend avoir est sa polyvalence. De nombreux outils que les artistes de Stable Diffusion utilisent désormais pour affiner leur travail, tels que ControlNets ou LoRas, sont pris en charge. Et, grâce à leur extrême efficacité, les utilisateurs peuvent ajouter davantage de ces outils à leurs flux de travail sans surcharger leur mémoire.
L’architecture légère du modèle, son encombrement réduit et sa compatibilité avec du matériel informatique moins puissant réduisent la barrière à l’entrée, augmentant ainsi l’accessibilité des techniques avancées de génération de texte en image pour les utilisateurs occasionnels et les chercheurs.
Faire plus avec moins
Nos tests ont révélé que le modèle est précis et détaillé et n’affiche pas l’esthétique décolorée et caoutchouteuse des précédents modèles SDXL turbo ou Stability AI LCM. Au lieu de cela, il génère des images très détaillées au niveau de modèles SDXL affinés.
Il dispose également de certaines capacités de génération de texte de base, qui peuvent être encore améliorées avec les LoRA déjà disponibles dans les référentiels en ligne tels que Civitai.
Stability AI rapporte que malgré l’hébergement de plus de paramètres que Stable Diffusion XL, Stable Cascade bénéficie toujours de temps d’inférence plus rapides et excelle dans l’alignement des signaux.
Le réglage fin de Stable Cascade nécessite également moins de ressources par rapport aux modèles de diffusion stable de taille similaire. Les chercheurs et les passionnés peuvent potentiellement entraîner le modèle sur des ensembles de données plus petits et avec une puissance de calcul considérablement moindre, ce qui le rend très rentable.
Stable Cascade est publié sous une licence de recherche non commerciale et est disponible sur le référentiel Stability AI GitHub avec un flux de travail ComfyUI géré par la communauté déjà disponible qui télécharge automatiquement les modèles pour en faciliter l’utilisation.
Édité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Voir l’article original en espagnol
