Le concurrent Sora a appris à générer des vidéos avec un montage complexe

Le concurrent Sora a appris à générer des vidéos avec un montage complexe

Le développeur chinois Kuaishou a présenté la troisième version du modèle de génération vidéo Kling AI.

« Kling 3.0 est alimenté par une plate-forme d'apprentissage profondément unifiée, offrant une entrée et une sortie multimodales véritablement natives. Grâce à une intégration audio transparente et à un contrôle avancé de la cohérence des éléments, le modèle confère à la pièce générée un sentiment plus fort de vie et d'intégrité », indique l'annonce.

Le modèle combine plusieurs tâches : convertir du texte, des images et des références en vidéos, ajouter ou supprimer du contenu, modifier et transformer des vidéos.

La durée de la vidéo est passée à 15 secondes. D'autres améliorations incluent une gestion du personnel plus flexible et un respect précis des invites. Le réalisme général a été amélioré : les mouvements des personnages sont devenus plus expressifs et dynamiques.

imageimage
Comparaison de Kling VIDEO 3.0 avec Kling VIDEO 2.6. Source : Kling AI

La nouvelle fonctionnalité Multi-Shot analyse l'invite, déterminant la structure de la scène et les types de plans. L'outil ajuste automatiquement les angles et la composition de la caméra.

Le modèle prend en charge diverses solutions de montage : des dialogues classiques utilisant le schéma « image-contre-image » à la narration parallèle et aux scènes avec voix off.

« Fini le découpage et le montage fastidieux de la vidéo : une génération suffit pour créer une vidéo cinématographique et rendre des formes audiovisuelles complexes accessibles à tous les créateurs », indique l'annonce.

En plus de la génération vidéo standard à partir d'une image, Kling 3.0 prend en charge plusieurs images à la fois comme références, ainsi que des sources vidéo comme éléments de scène.

Le modèle capture les caractéristiques des personnages, des objets et de l'épisode. Quels que soient les mouvements de la caméra et le développement de l'histoire, les objets clés restent stables et cohérents tout au long de la vidéo.

Les développeurs ont amélioré l'audio natif : le système synchronise plus précisément la parole avec les expressions faciales et, dans les scènes avec dialogues, il vous permet de spécifier manuellement un locuteur spécifique.

La liste des langues prises en charge a été élargie : chinois, anglais, japonais, coréen et espagnol. Le rendu des dialectes et des accents a également été amélioré.

De plus, l’équipe a mis à niveau le modèle multimodal O1 vers Video 3.0 Omni.

imageimage
Source : Kling AI

Il est possible de télécharger de l'audio avec une parole de trois secondes et d'extraire la voix ou d'enregistrer une vidéo avec un caractère de trois à huit secondes pour obtenir ses caractéristiques de base.

Les concurrents de Sora progressent

OpenAI a introduit le modèle de génération vidéo Sora en février 2024. L'outil a fait le bonheur des réseaux sociaux, mais la sortie publique n'a eu lieu qu'en décembre.

Près d'un an plus tard, les utilisateurs ont eu accès à la génération de vidéos basées sur des descriptions textuelles, à des images « revitalisantes » et à des ajouts à des vidéos prêtes à l'emploi.

L'application Sora iOS est sortie en septembre et a immédiatement attiré l'attention du public : elle a été installée plus de 100 000 fois le premier jour. Le service a dépassé la barre du million de téléchargements plus rapidement que ChatGPT, malgré un accès sur invitation.

Mais la tendance s’est rapidement inversée. En décembre, le nombre de téléchargements a diminué de 32 % par rapport au mois précédent. En janvier, la tendance à la baisse s'est poursuivie : l'application a été téléchargée 1,2 million de fois.

imageimage
Source : AppFigures

Cette baisse est due à plusieurs facteurs. Premièrement, la concurrence a été intensifiée par Nano Banana de Google, qui a renforcé la position de Gemini.

Sora est également en concurrence avec Meta AI et sa fonctionnalité Vibes. En décembre, la pression sur le marché a été accrue par la startup Runway, dont le modèle Gen 4.5 a surpassé ses pairs lors de tests indépendants.

Deuxièmement, le produit OpenAI était confronté à un problème de violation du droit d'auteur. Les utilisateurs ont créé des vidéos avec des personnages populaires comme Bob l'éponge ou Pikachu, c'est pourquoi l'entreprise a dû renforcer les restrictions.

En décembre, la situation s'est stabilisée après la conclusion d'un accord avec Disney, qui permettait aux utilisateurs de générer des vidéos avec les personnages du studio. Toutefois, cela n’a pas entraîné d’augmentation des téléchargements.

Rappelons qu'en octobre, des deepfakes avec Sam Altman ont rempli Sora.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !



Voir l’article original en russe

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !