
En résumé
- Midjourney, connu pour son outil d’imagerie générative sur Discord, prévoit d’introduire un modèle « texte vers vidéo » dans les mois à venir, a annoncé le PDG David Holz.
- La société commencera à former ses modèles vidéo à partir de janvier, en progressant à partir de son modèle d’image à succès, pour rivaliser dans l’industrie de la vidéo générative.
- La récente mise à jour V6 de Midjourney, axée sur l’amélioration des capacités de suivi des instructions et du réalisme des images, démontre ses efforts continus pour rester pertinent et compétitif dans un domaine émergent.
Midjourney, l’outil d’imagerie générative peut-être mieux connu pour fonctionner sur un serveur Discord, déploie ses ailes en matière d’IA. Les créateurs de Midjourney ont annoncé mardi qu’ils prévoyaient d’introduire un modèle « texte en vidéo » dans les mois à venir.
La société commencera à former ses modèles vidéo à partir de janvier, a déclaré le PDG David Holz lors d’une session Discord intitulée « Office Hour ». Cette décision représente une progression naturelle pour la plateforme, s’appuyant sur un modèle d’imagerie mature pour stimuler la dynamique concurrentielle de l’industrie de la vidéo générative.
Les notes de la session Discord comprenaient des ajustements prévus à V6 Niji, le modèle de générateur de manga/anime de Midjourney et des correctifs de cohérence pour la prochaine version officielle de Midjourney V6. La société a également écrit que sa liste de choses à faire comprend « le début de la formation pour de nouveaux modèles vidéo », qui pourraient être prêts « d’ici quelques mois ».
Aucune autre information sur le modèle n’a été partagée ni par Holz ni par l’équipe Midjourney.
Midjourney est connu pour mettre l’accent sur la qualité et l’expérience utilisateur plutôt que sur la vitesse brute, même si cela impliquait de prendre du retard sur ses concurrents.
La société a mis en œuvre des améliorations telles que l’inpainting et l’outpainting des mois après que ces fonctionnalités soient devenues de facto sur d’autres plates-formes comme Stable Diffusion, et sa récente incursion dans la génération de texte rudimentaire est intervenue après qu’il s’agissait déjà d’une fonctionnalité courante sur d’autres modèles. comme Dall-E 3, SDXL, ou même certains générateurs moins populaires comme Ideogram ou IF.
Entrer dans un domaine occupé
Cette incursion dans la vidéo intervient après les lancements des concurrents. Stability AI a récemment annoncé Stable Video Diffusion ; Meta vient de présenter son générateur vidéo EMU, et les modèles existants comme Pika et Runway ML marquent leur territoire, permettant à l’entrée de Midjourney d’émerger dans un paysage concurrentiel fort. De plus, d’autres générateurs d’images tels que Leonardo AI ont déjà mis en œuvre des capacités de génération vidéo, intensifiant encore la concurrence.
La récente mise à jour v6 de Midjourney, qui offre de meilleures capacités de suivi des instructions et des images plus réalistes, constitue le dernier effort de l’entreprise pour rester pertinente et compétitive. Si leurs modèles font preuve d’une certaine cohésion, ils pourraient gagner du terrain dans un domaine aussi naissant, même avec des modèles encore loin d’être parfaits.
Les implications de ces avancées vont bien au-delà d’une course à la suprématie des entreprises. Alors que Midjourney et d’autres innovent et affinent leurs offres, les industries de la création et des médias sont à l’aube d’une ère de transformation. La capacité de générer, de manipuler et d’interagir avec du contenu vidéo grâce à l’intelligence artificielle ouvre de nombreuses fenêtres, depuis la simplification des choses pour les artistes et les annonceurs jusqu’à la possibilité de remodeler notre perception de la réalité.
Edité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.
Voir l’article original en espagnol
