En résumé
- L’équipe de recherche en IA d’Alibaba a introduit « Animate Anybody », un modèle d’IA capable d’animer n’importe quelle photo avec une cohérence et un contrôle remarquables.
- Selon Alibaba, Animate Any peut transformer des photos en vidéos « contrôlées par des séquences de poses souhaitées et assurant une continuité temporelle ».
- La technologie utilise des modèles de diffusion intégrés dans un nouveau cadre appelé ReferenceNet, qui fusionne des fonctionnalités détaillées grâce à l’attention spatiale. Le résultat est une animation presque parfaite qui conserve l’apparence du personnage de référence.
- Le modèle Animate Anybody se compare avantageusement à d’autres outils d’animation, tels que AnimateDiff, Warpfusion, Deforum et ebSynth.
Nous avons parcouru un long chemin depuis les cartes électroniques animées d’Adobe Flash et de JibJab.
Deux décennies plus tard, les personnes disposant d’un ordinateur et d’un peu de temps libre peuvent créer des animations de haute qualité (à la fois de personnes réelles et d’illustrations) en quelques clics et sans aucune connaissance en montage numérique.
C’est du moins la proposition d’« Animate Anybody », un modèle d’IA présenté par l’équipe de recherche en IA d’Alibaba, une multinationale technologique chinoise spécialisée dans le commerce électronique et la technologie de vente au détail. Et la vidéo de sa technologie en action, qui prétend pouvoir animer n’importe quelle photo avec une cohérence et un contrôle remarquables, a captivé l’imagination de millions de personnes.
Alibaba affirme qu’Animate Any peut transformer des photos en vidéos « contrôlées par des séquences de poses souhaitées et assurant une continuité temporelle », a expliqué la startup d’avatars IA MyCompanions sur Twitter. « Moins de problèmes et pas de doigts supplémentaires, plutôt cool ! »
L’équipe ajoute que cette technologie ouvre la porte à de nouveaux cas d’utilisation parmi les influenceurs : des vêtements générés par l’IA et la création d’un marché pour des vidéos personnalisées mais produites en masse.
La page GitHub du modèle a été inondée de demandes d’accès au code source. En réponse, l’équipe a assuré au public qu’elle mettrait la démo et le code à disposition à une date encore indéterminée.
« Merci à tous pour votre incroyable soutien et votre intérêt pour notre projet », a déclaré l’équipe dans la dernière mise à jour de Github du projet. « Nous voulons vous assurer que nous travaillons activement à la préparation de la démo et du code pour une diffusion publique. »
La déclaration a reçu plus de 240 likes en moins d’une journée.
Si la démonstration vidéo est exacte, Animate Any peut être utilisé pour créer des résultats vidéo clairs et temporellement stables tout en conservant l’apparence du personnage de référence.
Cela semble être le résultat de l’intégration de modèles de diffusion dans un nouveau cadre appelé ReferenceNet, qui peut fusionner des caractéristiques détaillées grâce à l’attention spatiale.
Pour y parvenir, l’image de référence est prise, les pièces sont déplacées pour suivre la pose souhaitée puis les espaces à remplir sont remplis pour donner l’illusion d’un mouvement constant pour chaque image de la vidéo générée. La séquence dite openpose donne lieu à une animation presque parfaite.
Animate Anybody est également comparé favorablement à d’autres outils d’animation populaires tels que AnimateDiff, Warpfusion, Deforum et ebSynth. Ces outils existants ne parviennent souvent pas à générer des images cohérentes, ce qui facilite l’identification des vidéos comme générées par l’IA. En revanche, Animate Any produit une sortie plus raffinée, où les images sont cohérentes et l’animation est presque impossible à distinguer de la réalité.
L’équipe Animate Anybody n’a pas répondu à une demande de commentaire de Décrypter.
Cependant, au milieu de cette frénésie, un modèle similaire appelé MagicAnimate est devenu un concurrent solide. Récemment disponible pour des tests locaux, MagicAnimate adopte une approche légèrement différente du processus d’animation. Bien que moins populaire, sa sortie offre une alternative à ceux qui souhaitent explorer davantage le monde de l’animation basée sur l’IA.
Contrairement à Animate Anybody, qui utilise également un modèle de diffusion, mais se concentre sur l’animation cohérent en images et contrôlable à partir d’images, le différenciateur de MagicAnimate est d’améliorer la cohérence temporelle et la préservation de l’identité.
Son encodeur d’aspect unique et sa technique de fusion vidéo conduisent à des transitions plus fluides dans les longues animations vidéo et à une meilleure préservation des détails dans les images.
Cependant, bien que MagicAnimate excelle en termes de cohérence temporelle et de qualité par image, il ne semble pas aussi précis que son concurrent.
Alex Carliera, ancien chercheur en Meta AI, a eu l’occasion de tester MaticAnimate, et bien qu’il l’ait qualifié de « première étape importante pour générer de manière cohérente des vidéos à partir d’une seule image », il a noté que les générations n’étaient pas précises à 100 %. par rapport à l’image de référence, déformant le corps dans certaines images.
Donc, si vous ne pouvez pas danser et que vous vous sentez exclu de la dernière chorégraphie de TikTok, peut-être qu’Animate Anybody et MagicAnimate peuvent être votre ticket pour le succès viral.
Edité par Ryan Ozawa.
Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.