
En résumé
- StepFun a publié StepAudio 2.5 Realtime, un modèle vocal en temps réel qui a obtenu un score de 82,18 en compréhension paralinguistique contre 80,46 pour GPT.
- Le modèle résout le problème de sortie de caractères en utilisant un RLHF spécifique et des données provenant de plus de 10 000 graines écrites par l'homme.
- StepFun, fondée en 2023 par un ancien directeur de Microsoft, a levé 1,7 milliard de dollars et concurrence directement OpenAI dans le domaine de la voix en temps réel.
Le laboratoire d'IA StepFun, basé à Shanghai, a publié cette semaine StepAudio 2.5 Realtime. Il s'agit d'un modèle vocal en temps réel de bout en bout : entrée audio, sortie audio, sans conversion de texte entre les deux. Il prend en charge le chinois et l'anglais et, sur la base des tests de performances, il semble plutôt bon.
Le laboratoire est surtout connu pour développer des LLM textuels qui surpassent des systèmes beaucoup plus grands. Step 3.5 Flash, un modèle de 196 milliards de paramètres, a dépassé quatre critères de raisonnement plus tôt cette année contre ses rivaux aux mille milliards de paramètres. (Les paramètres sont ce qui donne à un modèle d’IA toute l’étendue de ses connaissances et, de manière générale, entraîne de meilleures performances.)
Le travail vocal suit le même schéma et cherche à rendre le jeu de rôle engageant, notamment lors de sessions plus longues.
Le problème du personnage
Les systèmes d’IA humaine ont un mode de défaillance spécifique : OOC, ou comportement hors du caractère – le modèle s’écarte de la personnalité qui lui est assignée sous la pression de l’adversaire. C’est extrêmement courant et c’est un défaut qui existe dans tous les modèles d’IA de par leur conception. Ils oublient simplement les choses à mesure que vous interagissez avec eux.
StepFun prétend avoir résolu ce problème avec un apprentissage par renforcement RLHF spécifique au jeu de rôle à partir de commentaires humains appliqué spécifiquement à la stabilité des personnages, et pas seulement à la qualité globale. Les données de formation proviennent de plus de 10 000 graines de personnalité écrites par des humains, développées algorithmiquement dans une matrice de fonctionnalités à l'échelle d'un million.
L'idée : suffisamment de variété dans les données d'entraînement pour que même des conversations étranges et peu fréquentes ne perdent pas le caractère du modèle.
L’affirmation la plus intéressante techniquement est la compréhension paralinguistique : le modèle lit les signaux acoustiques non verbaux tels que la fréquence vocale, la hauteur émotionnelle et l’âge directement à partir de l’audio, avant de formuler une réponse.
Dans le test de compréhension paralinguistique, un test objectif qui mesure la perception de caractéristiques acoustiques telles que l'émotion et le débit de parole, noté de 0 à 100, StepAudio a obtenu un score de 82,18. GPT Realtime 1.5 a obtenu un score de 80,46, Gemini Live a obtenu un score de 58,05 et DouBao Realtime a obtenu un score de 16,09.
Le benchmark d'évaluation humaine (utilisateurs réels conversant avec le modèle via une application mobile, notés par des évaluateurs humains sur une échelle de 0 à 100) a renvoyé 80,41 pour StepAudio, contre 68,01 pour GPT Realtime 1.5 et 67,16 pour Gemini Live. La qualité globale du dialogue, testée objectivement à l'aide de l'API sur la même échelle de 0 à 100, s'est élevée à 86,36 contre 81,60 pour GPT.
Ce sont les propres benchmarks de StepFun. Tirez vos conclusions. Cependant, les marges en paralinguistique et en séances de questions/réponses orales sont suffisamment larges pour ne pas être ignorées.
Le contexte StepFun
StepFun a été fondée en avril 2023 par Jiang Daxin, qui a passé 16 ans chez Microsoft à diriger des projets tels que les services cognitifs Bing, Cortana et Azure. Il s'agit de l'une des startups chinoises dites Tiger AI et a levé à ce jour environ 1,7 milliard de dollars.
Le mode vocal avancé d'OpenAI a été lancé fin 2024 et a établi la norme que tout le monde recherche. StepFun se compare désormais directement à lui – et prétend l'avoir surpassé.
Le lancement comprend un personnage phare de l'IA appelé Xiao Yue, que StepFun décrit comme un « compagnon au niveau de l'âme » conçu pour donner l'impression de parler à un ami par message, et non comme consulter un logiciel. Opinions, phrases caractéristiques, limites émotionnelles : entièrement configurables.
Les développeurs peuvent créer leurs propres personnages via l'API. La documentation complète se trouve sur platform.stepfun.com et le modèle est maintenant disponible.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.