
En résumé
- Utopai Studios a lancé PAI, un outil vidéo d'IA conçu pour la production cinématographique avec jusqu'à 16 plans continus, d'une durée d'une minute et d'une résolution 4K.
- PAI inclut une protection intégrée des droits d'auteur et une génération de personnages sans échange de visage, destinée aux studios qui ne peuvent pas risquer de violations de la loi.
- Le système coûte 100 $ pour 10 000 crédits, mais des problèmes techniques ont consommé des crédits sans générer de séquences lors de trois tentatives consécutives lors des tests.
La plupart des outils vidéo d’IA sont conçus pour les heures de grande écoute. Sora, Kling, Luma, Runway, tous sont optimisés pour le moment du spectacle : un clip saisissant de cinq secondes, une expérience visuelle qui semble impressionnante sur les réseaux sociaux.
Ce qu'ils résolvent rarement, c'est la partie qui compte vraiment pour les conteurs professionnels : la cohérence d'une scène à l'autre, l'identité des personnages à travers les montages et un contrôle créatif granulaire qui ne nécessite pas de repartir de zéro à chaque fois que quelque chose ne va pas.
C'est la lacune qu'Utopai Studios cherche à combler avec PAI. Leur équipe, composée de professionnels de Google Research, Meta Superintelligence, Amazon AGI et Adobe Firefly, a créé PAI spécifiquement pour la production de films de longue durée : jusqu'à 16 plans dans un seul flux narratif, des résultats d'une durée maximale d'une minute et une résolution jusqu'à 4K.
Il inclut également une protection intégrée des droits d'auteur qui bloque la génération de contenu avec une propriété intellectuelle protégée, des personnages protégés par des droits d'auteur et de véritables ressemblances publiques – une fonctionnalité destinée aux studios et aux professionnels qui ne peuvent pas se permettre une violation accidentelle.
PAI a ouvert ses portes au public plus tôt ce mois-ci. Nous sommes entrés, avons passé du temps sur chaque étape du flux de travail et avons perdu quelques crédits en cours de route. Voici l'image complète.
Interface
L'écran principal ressemble à ChatGPT ou à n'importe quelle interface de chatbot typique. À partir de là, vous naviguez à travers cinq onglets : Personnages, Storyboard, Vidéo, Éditeur et Historique.
Mais ne vous y trompez pas : PAI n'est pas un outil d'invite et d'attente comme Sora ou Veo. Il s’agit d’un pipeline de production structuré avec une couche de langage naturel au-dessus, et la distinction compte – beaucoup – lorsque les crédits sont en jeu.
Personnages
Il s’agit de la fonctionnalité la plus puissante de toute la suite et sans doute du système de génération de personnages le plus impressionnant actuellement disponible dans n’importe quel outil vidéo d’IA.
Les utilisateurs peuvent laisser le modèle créer lui-même des personnages ou leur fournir des images de référence. Ce qu’il fait, ce n’est pas un échange de visages : il ne transplante pas l’image d’une personne réelle comme le font les outils deepfake. Au lieu de cela, il génère des modèles complètement nouveaux qui correspondent étroitement à la référence, sans les problèmes juridiques et éthiques liés au remplacement direct du visage. Tous les résultats sont marqués avec SynthID.

La plupart des personnages générés par l’IA ont une peau cireuse qui les trahit immédiatement. Ceux de PAI ne le font pas, ou du moins pas dans la même mesure. La texture de la peau semble réaliste, tout comme la façon dont la lumière interagit avec le visage, et les détails sont solides. Qu’il s’agisse d’un modèle propriétaire ou d’un flux de génération inhabituellement raffiné, les résultats parlent d’eux-mêmes.
L'édition des personnages se fait en langage naturel : j'ai généré un personnage en utilisant l'apparence de ma femme comme référence, mais le résultat me semblait trop maigre, j'ai donc demandé au modèle d'ajuster les proportions du corps pour mieux correspondre à la référence. Il a compris exactement ce que je voulais dire et l'a corrigé.
Le seul avertissement constant : c'est lent. Même la génération d’images de personnages de base prend quelques minutes par tentative.
Scénario
Vous pouvez exécuter le storyboard automatiquement et laisser le modèle faire tout, mais ce n'est pas pour cela qu'il a été conçu.
PAI récompense les commentaires détaillés. Plus vous expliquez ce que font les personnages dans chaque scène, ce qu'ils disent et comment l'histoire progresse, mieux le modèle fonctionne. Donnez-lui cette spécificité et il utilisera l’IA pour développer les détails, puis construira environ une douzaine d’images clés. Chaque image comprend une image de la scène et une description de ce qui se passe à ce moment précis : actions des personnages, dialogues et composition visuelle.

Vous pouvez modifier chaque image clé individuellement avant de vous engager dans quoi que ce soit. Le contrôle est véritablement granulaire. Une fois satisfait, vous dites au modèle de continuer et il demande une confirmation finale avant le rendu. Ce flux de révision avant le rendu est une conception intelligente. Il impose des décisions délibérées et détecte les problèmes avant qu’ils ne deviennent coûteux.
Cela dit, même la plus petite modification prend du temps et consomme des crédits. Procédez avec précaution.
Génération vidéo
Lorsque cela fonctionne, un rendu réussi prend environ 30 minutes pour produire une minute complète de vidéo. La qualité du résultat justifie cette attente. Les angles de caméra changent naturellement et respectent les images clés définies, l'éclairage est naturel et les personnages n'ont pas cette qualité creuse et vide qui rend la plupart des vidéos générées par l'IA sans vie. Les voix sont cohérentes entre les scènes, avec une intonation adéquate qui est conservée même après des coupures sur d'autres éléments.
Lorsque la caméra revient sur un personnage après avoir montré autre chose, il revient exactement là où il s'était arrêté. Les arrière-plans restent stables tout au long de la vidéo et, bien que des déformations et des artefacts existent, ils sont mineurs. Un point faible : le modèle ne gère pas bien le texte au sein de la vidéo. Il peut produire des éléments de texte de base, mais ne l'utilisez pas pour tout ce qui nécessite une typographie précise à l'écran.
Voici un exemple de build réalisé avec tout géré automatiquement par le modèle.
Maintenant, la partie la plus difficile. L'une de nos séquences de tests a échoué trois fois consécutives. La première tentative a duré environ 45 minutes, a consommé des crédits comme si une vidéo complète avait été générée et a produit un résultat vide. Nous avons indiqué au chatbot qu’il n’avait rien généré. Il a reconnu l'erreur et a redémarré.

Une heure plus tard, rien. Nous avons essayé une troisième fois. Le même résultat. Trois tentatives, perte de crédits importante et zéro séquence. Au moment où nous avons abandonné, nous étions presque à court de crédits et avons dû continuer.
Ce n’est pas une petite erreur lorsque vous payez de l’argent réel et travaillez dans des délais professionnels. L'interface reconnaît que des erreurs se produisent. En faire l'expérience directement est une autre chose, d'autant plus que vous aurez besoin d'un solde positif pour télécharger une vidéo si vos crédits ont été consommés pendant le processus de génération.

Lors de notre premier test avec tout sélectionné automatiquement, j'ai commis une erreur d'utilisateur : j'ai fourni deux photos de référence sans préciser quel personnage devait utiliser laquelle, et le modèle les a attribuées dans l'autre sens : le personnage masculin (moi) a été généré à partir de la référence féminine (ma femme), et vice versa.
Oubliez cette image traumatisante de moi en tant que femme, et pourtant la vidéo qui en résulte a fini par être la vidéo d'IA complète la plus cohérente que j'ai jamais produite. Même avec des références incorrectes, le modèle a maintenu une continuité visuelle et tonale d'une scène à l'autre. Cela en dit long sur l'architecture sous-jacente.
La leçon des deux expériences est la même : les outils vidéo d’IA classiques prennent tout en charge à votre place, ce qui signifie que vous n’avez pas besoin de beaucoup réfléchir, mais vous devez également accepter ce qu’ils décident. PAI vous donne le contrôle. Et ce contrôle s’accompagne de l’entière responsabilité de ce que vous entrez.
Éditeur

Une fois une vidéo terminée, l'onglet Éditeur vous permet de diriger les critiques entièrement en langage naturel. Insérez des éléments dans une scène, supprimez-les, modifiez les couleurs, ajustez l'éclairage, reformulez le dialogue ou mettez à jour la synchronisation labiale, et le modèle est restitué en conséquence. Il comprend vraiment ce que vous lui demandez.
Il ne s'agit pas d'un filtre de post-traitement. Il s’agit d’un examen itératif piloté par l’IA au niveau de la scène. La capacité de décrire une intention éditoriale et de recevoir des images corrigées en réponse change complètement la relation créative entre un réalisateur et son matériel. Cette fonctionnalité, plus que toute autre sur PAI, anticipe la direction que pourrait prendre le montage vidéo IA dans un avenir proche.
Par exemple, après avoir regardé la première vidéo, j'ai demandé au modèle de corriger l'erreur de genre en utilisant les bonnes références.
Une fois traité, cela est passé à ceci :

À ceci :

Enregistrer

L'onglet Historique enregistre une chronologie complète de chaque interaction : invites, modifications, tentatives de rendu, tout.
Pour les créateurs individuels, il offre un contexte utile. Pour les équipes, cela peut devenir une véritable couche de collaboration où différents utilisateurs peuvent voir comment leurs collègues ont piloté le modèle, comprendre ce qui a fonctionné et ce qui n'a pas fonctionné, et continuer à partir d'un enregistrement créatif partagé.
Tarifs et conclusion
Le prix du PAI est de 100 $ pour 10 000 crédits. Lors de nos tests, 2 000 crédits couvraient quatre vidéos (une terminée, trois non) pour un total de quatre minutes : deux personnages générés par la vidéo avec plusieurs itérations avant le rendu, le développement d'un storyboard avec des invites riches et détaillées et environ deux séries de montage post-rendu.
Dans l’ensemble, PAI ressemble à un outil professionnel conçu pour ceux qui prennent la vidéo IA très au sérieux. Il est lent, ne pardonne pas l'inexpérience (il aurait honnêtement besoin d'un bon tutoriel) et est capable d'engloutir votre budget très rapidement. L’interface n’est pas infaillible, et le système vous pénalisera si vous entrez sans être bien préparé.
Après une première session consacrée à comprendre son fonctionnement, notre deuxième série de tests a produit des résultats très surprenants et satisfaisants, du genre qui nécessite généralement des techniques d'échange de visage, des séries d'essais et d'erreurs et des modifications de post-production.
Pour les créateurs vidéo professionnels, pour qui la continuité, la sécurité de la propriété intellectuelle et la qualité cinématographique ne sont pas négociables, PAI est le meilleur système vidéo IA complet disponible actuellement. Si les problèmes de fiabilité sont résolus, rien d’autre ne s’en rapproche, du moins pour le moment.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
