ElevenLabs et Stability AI lancent de nouveaux modèles d'IA pour la musique : peuvent-ils rattraper Suno ?

ElevenLabs et Stability AI lancent de nouveaux modèles d'IA pour la musique : peuvent-ils rattraper Suno ?

En résumé

  • ElevenLabs a lancé Music v2 avec une cohérence stylistique avancée et a réduit les prix jusqu'à 50 % sur son API musicale.
  • Stability AI a introduit Stable Audio 3.0, avec quatre modèles de poids ouverts et des pistes jusqu'à 6 minutes et 20 secondes.
  • Suno est leader du marché avec 100 millions d'utilisateurs et 7 millions de chansons par jour, mais fait face à une concurrence croissante.

Deux mises à jour majeures de la musique IA sont arrivées cette semaine, et aucune ne vient de Suno.

ElevenLabs, la société polonaise de voix IA évaluée à 11 milliards de dollars après une série D de 500 millions de dollars en février, a lancé Music v2. Stability AI, les créateurs de Stable Diffusion, a présenté Stable Audio 3.0, une famille de quatre modèles avec des poids ouverts et des pistes dépassant six minutes.

Le contexte est celui des poursuites pour droits d'auteur intentées par la Recording Industry Association of America contre Suno et Udio en 2024, qui ont fait de l'expression « formé avec des données sous licence » l'expression la plus importante dans toute publicité musicale basée sur l'IA. ElevenLabs et Stability misent beaucoup là-dessus, garantissant que les résultats générés ne posent pas de problèmes.

Music v2 : Un seul titre, de l'opéra au heavy metal, sans s'effondrer

Music v2 est le deuxième modèle musical d'ElevenLabs, arrivant environ 10 mois après le premier. Sa principale proposition est la cohérence sous pression. Selon ElevenLabs, un seul morceau peut passer de l'opéra au heavy metal et vice-versa, rester solide lors d'un rap rapide et intégrer des effets sonores non musicaux, le tout sans que la composition ne s'effondre.

L'audio génératif a tendance à s'effondrer exactement lorsque les invites deviennent compliquées, c'est donc ce qui mérite d'être surveillé de près, en particulier dans les compositions plus longues.

L'inpainting est désormais très utile : vous sélectionnez une section, elle se régénère et tout le reste reste intact. Les utilisateurs peuvent également créer des chansons section par section (intro, couplet, refrain) et le modèle maintient la continuité tout au long du processus, plutôt que de traiter chaque clip comme une génération distincte. La prise en charge multilingue s'est également améliorée, bien qu'ElevenLabs n'ait pas publié de détails spécifiques.

Le modèle alimente trois plateformes : ElevenMusic pour les créateurs, ElevenAPI pour les développeurs et ElevenCreative pour les marques. Il est désormais disponible sur ElevenMusic et ElevenCreative ; L'accès à l'API est en accès anticipé via l'équipe commerciale.

ElevenLabs a également réduit les prix de Music v1 et v2 jusqu'à 50 % pour ElevenAPI et jusqu'à 40 % pour ElevenCreative en libre-service. La société a atteint 500 millions de dollars de revenus annuels récurrents en avril 2026. La musique n'en représente encore qu'une petite partie, mais ElevenMusic, lancée en tant qu'application grand public en avril, est une attaque directe contre la base d'utilisateurs de Suno.

Stable Audio 3.0 : poids ouverts, sur l'appareil et en réalité plus longs

Stable Audio 2.0 durait jusqu'à trois minutes et était déjà en retard sur Suno lors de son lancement en 2024. Stable Audio 3.0 comprend quatre modèles : Small SFX (effets sonores sur l'appareil), Small (composition musicale complète sur l'appareil), Medium (jusqu'à 6:20, matériel plus puissant) et Large (API uniquement). Trois des quatre ont des poids ouverts sur Hugging Face.

Les modèles Small fonctionnent avec 459 millions de paramètres chacun, sans avoir besoin de GPU. (Les paramètres mesurent essentiellement la capacité d'un modèle d'IA.) Medium atteint 1,4 milliard de paramètres et génère sa sortie 6:20 en environ 1,31 seconde sur un GPU H200. Large, à 2,7 milliards de dollars, est uniquement destiné aux organisations ayant un chiffre d'affaires de plus d'un million de dollars. La granularité de génération par seconde signifie que vous obtenez exactement la longueur de piste que vous avez demandée, et non une approximation.

Il prend également en charge ComfyUI pour les configurations locales.

L'architecture est nouvelle : un auto-encodeur sémantique-acoustique que Stability appelle SAME, conçu pour maintenir la cohérence mélodique sur des sorties plus longues. Le réglage fin avec LoRA est pris en charge, afin que les artistes puissent adapter les modèles à leurs propres catalogues. L'inpainting est également inclus : un segment unique, plusieurs segments et une continuation causale pour étendre une piste au-delà de son point final d'origine.

Pour référence, un LoRA (modèle d'adaptation de bas rang) est comme un petit modèle qui conditionne la manière dont le modèle complet génère ses sorties. Si vous entraînez une LoRA avec du blues, le modèle produira du blues ; Si vous l'entraînez avec le blues BB King, le modèle produira des chansons qui sonnent comme BB King. L'inpainting permet à un modèle de corriger de petites erreurs lors de sa création. Par exemple, si le modèle génère quelque chose d'étrange à 2h30, vous pouvez sélectionner quelques secondes de la chanson, demander au modèle de la changer comme vous le souhaitez, et il générera un fragment qui s'adaptera parfaitement à ce moment et se fondra dans l'ensemble de la chanson.

La stabilité est techniquement crédible dans la musique IA depuis des années sans avoir un grand impact commercial. L'engagement envers les poids ouverts est la stratégie de Stable Diffusion appliquée à l'audio : semer dans la communauté des développeurs et voir ce qui est construit. La licence est plus propre que tout ce que Stable Audio avait publié auparavant, avec des accords en place avec Universal Music Group et Warner Music Group.

L’objectif : Suno, le roi de la musique IA

Si ChatGPT est le roi du texte IA, Suno est le roi de la musique IA. La société à l'origine du modèle a atteint une valorisation de 2,45 milliards de dollars en novembre 2025, a dépassé les 300 millions de dollars de revenus récurrents annuels et a été utilisée par environ 100 millions de personnes.

Il génère environ 7 millions de chansons par jour. Warner Music a conclu un accord avec Suno en novembre 2025 ; Sony et UMG restent devant le tribunal fédéral.

Pour éviter ces guerres de droits d'auteur, ElevenLabs a conclu des accords de licence avec Believe, Kobalt et Merlin. La stabilité a Warner et Universal. Udio a trouvé un accord avec les trois grands et est désormais un jardin fermé : rien de ce que vous générez ne peut quitter la plateforme.

Stable Audio 3.0 Small et Medium sont désormais disponibles chez Hugging Face. Large est actif via l'API Stability AI. Music v2 est gratuit pour les utilisateurs d'ElevenMusic, avec des niveaux commerciaux via ElevenCreative et ElevenAPI.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !