
Google DeepMind a annoncé le 12 août 2026 le lancement de SL2T (Sign-Language-to-Text), un modèle d'intelligence artificielle qui apporte la Traduction de l'IA en langue des signes à l’intérieur des produits de consommation courante. Il ne s'agit pas d'un prototype de laboratoire : la technologie est déjà active sur Gboard et Live Transcribe pour les possesseurs de Pixel 11, et promet de changer la manière dont des millions de personnes sourdes et malentendantes interagissent avec les smartphones et les services numériques.
Points clés
- Google DeepMind a lancé SL2T, un modèle multilingue qui traduit la langue des signes directement en texte.
- Il prend actuellement en charge l'American Sign Language (ASL) vers l'anglais sur Gboard et Live Transcribe, disponible sur Pixel 11.
- Le modèle est formé sur plus de 100 000 heures de données dans plus de 50 langues des signes.
- Pour protéger la confidentialité, SL2T utilise des points de référence sur le corps du signataire (repères de pose) au lieu de la vidéo brute.
- Sur le benchmark FLEURS-ASL, le modèle atteint un score de 70 BLEURT, supérieur à tout résultat précédemment rapporté.
Google DeepMind lance SL2T, traduction IA multilingue en langue des signes
SL2T a été créé pour combler un vide technologique qui dure depuis des décennies : alors que l'IA appliquée aux langues parlées a fait des progrès de géant, les plus de 200 langues des signes utilisées dans le monde – parlées par environ 70 millions de personnes sourdes et malentendantes – sont restées en marge de l'innovation. Google DeepMind définit SL2T comme un révolutionnaire en termes de qualité et de généralité, capable de fonctionner à une échelle jamais vue auparavant dans l'industrie.
Prise en charge de l'ASL sur Gboard et Live Transcribe
La fonctionnalité traduit actuellement la langue des signes américaine en anglais et alimente la dictée via des panneaux. Tableau Google et plus Transcription en directles deux outils Android conçus pour l'accessibilité. En pratique, un utilisateur sourd peut appuyer sur son téléphone pour effectuer une recherche sur le Web, rédiger des messages ou des documents, ou demander à Gemini d'effectuer des tâches, tout comme un utilisateur entendant le ferait avec une dictée vocale. Sur Live Transcribe, cependant, vous pouvez répondre en marquant directement dans la conversation, sans avoir à taper dans les deux sens. Selon les testeurs impliqués par Google, écrire en ASL est plus rapide et plus naturel que taper en anglais.
Gratuit sur Pixel 11
La technologie est disponible sans frais supplémentaires, à commencer par les appareils Pixel 11avec l'extension à d'autres appareils annoncée comme prochaine étape. D’autres langues des signes suivront ultérieurement, a précisé l’entreprise.
Comment fonctionne la technologie derrière SL2T
Au cœur du modèle se trouve une combinaison d’approche centrée sur l’utilisateur, de sensibilité culturelle et de données à grande échelle. Le résultat est un système capable de gérer non seulement le vocabulaire des signes, mais aussi la grammaire autonome de chaque langue des signes, distincte de celle des langues parlées correspondantes.
Plus de 100 000 heures de données pour plus de 50 langues des signes
Le modèle a été formé sur plus de 100 000 heures de données collectés dans plus de 50 langues des signesavec environ un quart du matériel faisant spécifiquement référence à l’ASL. La formation conjointe du système sur différentes langues, dialectes et niveaux de compétence a permis au modèle d'apprendre des structures partagées, surpassant ainsi les modèles formés sur une seule langue.
La confidentialité au centre : des poses historiques au lieu de la vidéo
L'un des aspects les plus importants concerne la protection de la vie privée. Le SL2T ne traite pas le flux vidéo brut de la caméra, mais interprète le langage des signes comme une séquence de points d'installation (poses de repère) sur le corps du buteur. Un modèle exécuté directement sur l'appareil, MediaPipe Holistic, localise ces points géométriques et seules les coordonnées (et non les images) sont envoyées au serveur pour traduction. La vidéo originale est immédiatement supprimée.
Traduction directe, sans passer par les gloses
SL2T traduit la séquence de coordonnées directement en texte, en ignorant les annotations intermédiaires appelées « gloses », qui sont largement utilisées dans les travaux antérieurs sur la traduction en langue des signes. Les glosses, explique Google DeepMind, ne parviennent pas à capturer des aspects riches et non linéaires tels que les signaux non manuels et les constructions spatiales. Traduire directement à partir de points de repère élimine les limitations artificielles du vocabulaire et permet à la qualité de la traduction d'évoluer avec les données disponibles.
Les langues des signes communiquent du sens à travers des mouvements simultanés des mains, des bras, du torse, de la tête et du visage – suivre tout cela avec précision et à haute fréquence est une tâche de vision par ordinateur complexe et gourmande en calcul. Sur le benchmark FLEURS-ASL, conçu pour évaluer la qualité de la traduction de l'ASL vers l'anglais, SL2T obtient un score zéro de 70 BLEURTsignificativement plus élevé que tous les résultats rapportés précédemment. Google DeepMind a également travaillé sur des aspects pratiques tels que la réduction de la latence du streaming, la prévention des hallucinations sur les entrées non signées, l'équité pour les 10 % de signataires gauchers et l'amélioration des performances pour les signataires à une main, une situation courante lorsque l'on tient le smartphone dans l'autre main.
Pourquoi ce détail technique est-il important ? Parce que cela montre que lelangue des signes d'intelligence artificielle Appliqué jusqu’à présent, il restait confiné à des expérimentations académiques avec des vocabulaires limités ou des dispositifs tels que des gants à capteurs, désormais considérés comme une impasse car les langues des signes ne sont pas simplement un « anglais sur les mains » : elles nécessitent une perception visuelle fine des mouvements du corps entier ainsi qu’une véritable traduction linguistique.
La communauté sourde au centre du projet
Google DeepMind souligne qu'il a construit SL2T en collaboration avec la communauté des sourds, et pas simplement pour elle. Les points de vue des personnes sourdes ont guidé chaque phase du projet : depuis l'idéation initiale, attribuée à Sam Sepah, un employé sourd de Google, jusqu'à la collecte de données avec des partenaires sourds, en passant par l'évaluation par le biais d'études auprès d'utilisateurs sourds et l'évaluation de l'impact de la technologie avec des experts sourds.
Pour guider une mise en œuvre responsable dans le monde réel, l'entreprise a établi le Comité consultatif sur la langue des signes de l'IA (AISLAC)qui rassemble des organisations mondiales de sourds et des experts de l'industrie. Grâce à ce modèle de gouvernance participative, les communautés les plus directement touchées par la technologie influencent les priorités de développement futures. Google DeepMind a également co-signé un rapport d'impact commun pour le lancement de SL2T version 1.0 sur Gboard et Live Transcribe, qui décrit de manière transparente à la fois les capacités et les limites actuelles du système – une approche collaborative que la société a l'intention de maintenir pour toutes les futures versions en langue des signes.
Que va-t-il se passer ensuite
SL2T s'appuie sur des décennies de recherche universitaire et industrielle, mais introduire l'ASL sur les smartphones des utilisateurs n'est, selon Google DeepMind, qu'un début. Les projets futurs incluent l’extension à d’autres langues des signes, le développement de la génération de langues des signes (pas seulement la traduction de texte) et l’intégration de capacités d’IA plus avancées.
Il reste des marges d'amélioration que l'entreprise elle-même reconnaît ouvertement : dans les exemples partagés sur le benchmark FLEURS-ASL, des erreurs ponctuelles émergent encore sur des signes rares, un typage rapide, des constructions passives et quelques omissions dans les représentations utilisant des classificateurs. Il s'agit d'une limitation attendue dans une technologie qui fait maintenant ses débuts sur les appareils grand public, mais elle indique combien de travail reste à faire avant que la Traduction de l'IA en langue des signes atteint véritablement la parité avec les technologies de reconnaissance vocale déjà matures pour les langues parlées.
Le fait que cette capacité arrive gratuitement sur un appareil de masse comme le Pixel 11 marque cependant un changement de rythme : pour la première fois un modèle multilingue de cette envergure quitte les laboratoires de recherche et entre entre les mains des utilisateurs, posant les bases d'une accessibilité numérique qui, selon Google, vise à devenir une norme dans le paysage technologique plutôt qu'une exception.
FAQ
Qu'est-ce que SL2T et à quoi sert-il ?
SL2T est un modèle d'IA multilingue développé par Google DeepMind qui traduit directement la langue des signes en texte, permettant aux utilisateurs sourds de se connecter sur leur téléphone pour écrire et communiquer.
Quelles langues des signes le SL2T prend-il actuellement en charge ?
SL2T prend actuellement en charge la traduction de l'American Sign Language (ASL) vers l'anglais, disponible sur Gboard et Live Transcribe sur les appareils Pixel 11.
Comment protégez-vous la confidentialité des utilisateurs lors de la traduction en langue des signes ?
SL2T utilise un système de suivi des poses sur l'appareil qui traite les points sur le corps du marqueur au lieu du flux vidéo brut, supprimant immédiatement les données vidéo pour protéger la confidentialité.
Comment la communauté sourde a-t-elle été impliquée dans le projet SL2T ?
Les personnes sourdes ont contribué à façonner chaque phase du développement de SL2T, du concept à la collecte de données en passant par l'évaluation et la gouvernance par le biais du Comité consultatif sur la langue des signes de l'IA (AISLAC).
Contenu créé avec l’aide de l’intelligence artificielle et de la révision éditoriale humaine.