Le nouveau « moteur vocal » d’OpenAI ne prend que 15 secondes pour cloner des voix

Le nouveau « moteur vocal » d’OpenAI ne prend que 15 secondes pour cloner des voix

En résumé

  • OpenAI a introduit Voice Engine, une technologie de clonage vocal capable de reproduire les modèles de parole humaine avec seulement 15 secondes d’audio.
  • La société travaille avec Lifespan pour aider une patiente à communiquer en utilisant sa propre voix générée par l’IA.
  • OpenAI a imposé des restrictions sur Voice Engine, y compris une liste de personnes qu’il n’émulera pas et des politiques d’utilisation pour empêcher les abus de la technologie.

OpenAI, la société d’IA à l’origine de l’outil d’IA générative dominant ChatGPT, a dévoilé une nouvelle technologie de clonage vocal qu’elle appelle « Voice Engine ». Ce modèle audio peut reproduire la voix, l’intonation et d’autres modèles de parole typiquement humains d’une personne sur la base d’un échantillon relativement petit d’audio original.

« Il est remarquable qu’un petit modèle avec un seul échantillon de 15 secondes puisse créer des voix émouvantes et réalistes », a déclaré la société dans son blog.

En comparaison, la plateforme vocale d’IA ElevenLabs dispose d’un outil de clonage vocal instantané qui nécessite des échantillons d’au moins une minute. Pour de meilleurs résultats, vous avez besoin de près de 10 minutes de conversation continue pour votre niveau de service professionnel.

L’entreprise a montré différents exemples de ce que cette technologie est capable de faire. Par exemple, la voix d’une jeune patiente qui a perdu une grande partie de sa capacité de parler en raison d’une tumeur cérébrale vasculaire a été clonée à l’aide d’un enregistrement antérieur qu’elle avait réalisé pour un projet scolaire. C’est à cela que cela ressemble aujourd’hui, selon OpenAI.

OpenAI a travaillé avec Lifespan, une organisation à but non lucratif affiliée à la faculté de médecine de l’Université Brown et les créateurs d’un outil appelé Livox, une application de « communication alternative » conçue pour les personnes handicapées. L’équipe a pu travailler avec un enregistrement réalisé par la femme pour une présentation scolaire :

Voice Engine a pu fournir instantanément une fonctionnalité de synthèse vocale qui permettrait au patient de communiquer efficacement avec sa propre voix :

OpenAI a également montré comment HeyGen utilise sa technologie pour générer des traductions naturelles de discours chargés dans une langue spécifique vers une autre langue.

La société affirme que le moteur vocal a été développé pour la première fois fin 2022 et est déjà utilisé pour alimenter les voix prédéfinies disponibles dans l’API de synthèse vocale d’OpenAI, ainsi que la fonctionnalité Parole et lecture à haute voix de ChatGPT. Suite aux derniers développements, la société se dit prudente avant un lancement plus large.

« Nous espérons entamer un dialogue sur la mise en œuvre responsable des voix synthétiques et sur la manière dont la société peut s’adapter à ces nouvelles capacités », a écrit OpenAI, reconnaissant la pratique largement condamnée des « deepfakes ». Les voix de célébrités, de représentants du gouvernement et, de plus en plus, de simples citoyens sont usurpées à des fins néfastes, à partir de campagnes politiques, de fausses publicités et d’activités purement criminelles. Le président américain Joe Biden a promu davantage de garanties contre l’utilisation malveillante de l’usurpation de voix par l’IA.

En fait, Meta a révélé l’été dernier que son outil vocal d’IA était spécifiquement retenu en raison de « risques potentiels d’utilisation abusive ».

« Conformément à notre concentration sur la sécurité de l’IA et à nos engagements volontaires, nous avons décidé de prévisualiser cette technologie, mais de ne pas la diffuser à grande échelle pour le moment », a expliqué OpenAI.

Même avant sa sortie publique, OpenAI impose des restrictions sur Voice Engine, y compris une liste de personnes notables qu’il n’émulera pas.

« Nous pensons que tout déploiement à grande échelle de technologie vocale synthétique doit être accompagné d’expériences d’authentification vocale qui vérifient que l’orateur d’origine ajoute sciemment sa voix au service et d’une liste de voix interdites qui détecte et empêche la création de voix trop similaires. à des personnalités », a écrit OpenAI.

Les partenaires qui testent actuellement Voice Engine ont accepté les politiques d’utilisation d’OpenAI, qui interdisent l’usurpation d’identité d’une autre personne ou organisation sans consentement. De plus, la société exige le consentement explicite et éclairé de l’orateur d’origine et n’autorise pas les développeurs à créer des moyens permettant aux utilisateurs individuels de cloner leurs propres voix.

« Sur la base de ces conversations et des résultats de ces tests à petite échelle, nous prendrons une décision plus éclairée quant à l’opportunité et à la manière de déployer cette technologie à grande échelle », indique le blog.

En plus de Voice Engine, Open AI travaille sur plusieurs projets en parallèle. Le PDG Sam Altman a révélé que la société travaillait au lancement de GPT-5 cette année. La société a également présenté son outil de génération vidéo Sora. La société affirme que Sora sera le générateur vidéo le plus avancé du marché, surpassant des modèles tels que Pika, Stable Video Diffusion et Runway ML.

Sora n’est actuellement disponible que pour les « équipes rouges » recrutées par Open AI pour garantir qu’il ne puisse pas être abusé.

Voice Engine pourrait certainement surpasser d’autres outils de clonage vocal, notamment ceux de Meta, ElevenLabs, WellSaid Labs et des modèles open source comme RVC.

Open AI travaille également sur un projet secret appelé Q* dont seul le nom a fuité. Sam Altman a refusé de donner des détails, mais a déclaré que l’équipe de recherche était très concentrée sur la recherche de techniques et d’approches permettant à l’intelligence artificielle de mieux raisonner.

Edité par Ryan Ozawa.

Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.

Voir l’article original en espagnol

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚