Des chercheurs chinois découvrent une attaque audio qui pirate les IA avec une efficacité de 96 %

Des chercheurs chinois découvrent une attaque audio qui pirate les IA avec une efficacité de 96 %

En résumé

  • Des chercheurs de l'Université du Zhejiang ont développé AudioHijack, une attaque qui intègre des commandes inaudibles dans l'audio avec une efficacité de 96 %.
  • La méthode manipule numériquement les signaux audio pour remplacer les instructions de l'utilisateur et a été testée avec succès sur les modèles Microsoft et Mistral.
  • Les attaques peuvent être diffusées via des vidéos, des notes vocales ou Zoom, et sont capables d'envoyer des e-mails, de télécharger des fichiers ou de diffuser de la désinformation.

Des chercheurs universitaires chinois ont trouvé un moyen de modifier le comportement des modèles vocaux de l’IA en intégrant des commandes cachées dans des clips audio inaudibles pour les humains. L'attaque a un taux de réussite allant jusqu'à 96 %, selon une étude de l'Université du Zhejiang.

La méthode d'attaque, présentée lors du 47e Symposium IEEE sur la sécurité et la confidentialité à San Francisco, cible les grands modèles de langage audio, ou LALM, capables de traiter des commandes vocales et d'interagir avec des outils et des applications externes.

« Cela ne prend qu'une demi-heure pour entraîner ce signal, et ensuite, comme ce signal est indépendant du contexte, vous pouvez l'utiliser pour attaquer le modèle cible quand vous le souhaitez, peu importe ce que dit l'utilisateur », a déclaré l'auteur principal Meng Chen, doctorant à l'Université du Zhejiang, dans un communiqué.

L'attaque fonctionne en modifiant les valeurs numériques au sein d'une forme d'onde audio numérique d'une manière qui n'est pas perceptible pour les auditeurs humains, mais qui affecte néanmoins la façon dont les modèles d'IA interprètent le signal. Les chercheurs ont déclaré que l'audio manipulé peut remplacer ou rediriger le comportement d'un modèle même lorsque des instructions utilisateur légitimes sont incluses dans le clip.

AudioHijack diffère des attaques traditionnelles par injection rapide car il ne manipule pas ce que l'utilisateur dit à l'IA. Au lieu de cela, il modifie le signal audio lui-même, intégrant des instructions cachées dans des sons que les humains ne peuvent pas entendre. Les chercheurs ont indiqué que cela rend l'attaque plus difficile à défendre, car elle contourne les protections conçues pour détecter les invites de texte suspectes.

Les chercheurs ont testé AudioHijack sur 13 modèles vocaux d'IA open source et ont découvert que cela pouvait les amener à rejeter des demandes, à diffuser de fausses informations, à insérer des liens nuisibles, à changer de personnalité ou à effectuer des actions que l'utilisateur n'avait jamais demandées, telles que des recherches sur le Web, des téléchargements de fichiers et des e-mails contenant des données personnelles. Les attaques ont également fonctionné sur les systèmes vocaux d’IA commerciaux de Microsoft et Mistral qui utilisent une technologie similaire.

« De nombreuses attaques précédentes contre des modèles génératifs exigeaient que l'attaquant ait un contrôle total à la fois sur l'entrée audio finale et sur les instructions originales données au modèle, agissant essentiellement en tant qu'utilisateur », note l'étude. « Ici, l'attaquant manipule uniquement les données audio traitées par le modèle, ce qui permet de l'attaquer pendant que quelqu'un d'autre l'utilise. »

Selon l’étude, les méthodes de diffusion possibles incluent des vidéos en ligne, des clips musicaux, des notes vocales ou l’audio des appels Zoom téléchargés sur les services de transcription d’IA. L’équipe a également noté que des travaux de suivi non publiés ont démontré des attaques similaires dans les chats vocaux IA en direct.

Les chercheurs ont indiqué que la surveillance des mécanismes d'attention internes du modèle était la défense la plus efficace qu'ils ont testée. Cependant, ils ont également constaté que les attaquants qui connaissaient la défense pouvaient réduire l’intensité de la manipulation tout en conservant une grande partie de l’efficacité de l’attaque.

« Ces défenses ponctuelles ont du mal à résister à notre attaque car nous constatons qu'il est très difficile pour ces modèles de distinguer l'intention normale de l'utilisateur et l'attaque de notre adversaire », a ajouté Chen.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚