Les développeurs ont appris à Midjourney à générer du texte

Les développeurs ont appris à Midjourney à générer du texte

Générer des images à l'aide d'un réseau de neurones : 5 services fonctionnels

Midjourney a annoncé un nouveau modèle d’outil de création d’images IA capable de générer un texte significatif.

Selon un article sur la chaîne Discord, Midjourney V6 se positionne comme une « refonte » et est plusieurs fois supérieur à son prédécesseur, sorti en mars de cette année.

« Un respect plus précis des recommandations, ainsi que des conseils plus longs, une connectivité et une connaissance du modèle améliorées », ont décrit les développeurs de la nouvelle version du réseau neuronal.

L’un des composants les plus importants de la V6 est la capacité de générer un texte significatif, plutôt qu’un ensemble de caractères, comme c’était le cas auparavant. Cependant, les développeurs ont noté que ce n’est pas l’élément le plus central du modèle.

Grâce à ces améliorations, Midjourney peut désormais rivaliser avec les principaux modèles génératifs tels que DALL-E 3 et Ideogram.

Les développeurs ont appris à Midjourney à générer du texte
Comparaison des modèles d’IA générative. Données : Décrypter.

En raison des nouvelles fonctionnalités, la sixième version de l’IA est devenue légèrement plus lente et plus chère, mais les développeurs ont promis de travailler sur ses performances à l’avenir.

Formé dès le départ sur les superclusters d’IA, Midjourney V6 dispose également de moteurs de mise à l’échelle améliorés, fins et créatifs, qui doublent la résolution de l’image.

La version alpha du réseau neuronal prend en charge plusieurs nouveaux arguments, notamment « -ar » pour modifier la résolution, « -chaos » pour sélectionner les variations de génération d’image, « -stylize » pour modifier le style créatif (plus la valeur est faible, plus rapide le réseau neuronal produira des résultats, sacrifiant les détails) .

« Il faudra réapprendre à donner des indices », prévient l’équipe du projet.

D’autres fonctionnalités telles que le zoom et le panoramique apparaîtront lors de la sortie du modèle.

Pour l’instant, vous pouvez participer au test de Midjourney V6 sur le serveur Discord en envoyant la requête souhaitée au chat.

« L’équipe du projet a activé les systèmes de modération et appliquera les normes de notre communauté avec une rigueur accrue. Ne soyez pas des imbéciles et ne créez pas d’images qui provoquent des drames », ont souligné les développeurs.

Les utilisateurs ont déjà commencé à partager leurs résultats.

La plupart notent le haut degré de détail des images créées, même sans haut de gamme.

Pour démontrer les capacités de Midjourney, un utilisateur a demandé de générer un « vieil homme de 92 ans, ridé et en colère, dans un éclairage de studio ».

Auparavant, Google avait présenté une mise à jour globale du chatbot Bard, conçue pour étendre les capacités du réseau neuronal. La mise à jour s’appelle Gemini.

Rappelons qu’en novembre, la startup d’IA Anthropic avait annoncé un nouveau modèle, Claude 2.1, avec une fenêtre contextuelle élargie à 200 000 tokens, soit l’équivalent de 500 pages de texte.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !



Voir l’article original en russe