Des chercheurs en IA ont demandé à des chatbots de partager des recettes de cocaïne en utilisant cette astuce inhabituelle

Des chercheurs en IA ont demandé à des chatbots de partager des recettes de cocaïne en utilisant cette astuce inhabituelle

En résumé

  • Les chercheurs ont présenté l'article « Prompt Injection as Role Confusion » qui montre comment tromper les modèles d'IA avec de faux raisonnements.
  • La technique de contrefaçon de chaîne de pensée a augmenté les taux de réussite du jailbreak de presque zéro à 60 % sur des modèles tels que GPT-5, o4-mini et gpt-oss.
  • L’équipe a également trompé un agent de chiffrement IA pour qu’il télécharge un fichier SECRETS.env après avoir masqué des instructions sur une page Web.

Oubliez les invites intelligentes : les chercheurs en IA affirment avoir trompé les meilleurs modèles d'IA pour qu'ils génèrent des instructions de synthèse de cocaïne en les convainquant que leurs idées dangereuses étaient les leurs, tout en manipulant un agent de chiffrement d'IA pour divulguer des informations d'identification sensibles.

Dans l'article « Prompt Injection as Role Confusion », présenté lors de la Conférence internationale sur l'apprentissage automatique en juin, les chercheurs Charles Ye, Jasmine Cui et Dylan Hadfield-Menell affirment que les deux démonstrations d'attaques par injection rapide proviennent d'un défaut structurel dans la façon dont les grands modèles linguistiques (LLM) distinguent les instructions fiables du texte non fiable.

« Pour un LLM, tout passe par le même canal, comme une longue soupe de jetons », a écrit l'équipe. « Ses propres pensées se trouvent à côté de vos instructions, qui se trouvent à côté du contenu d'une page Web aléatoire qu'il vient d'obtenir. »

L'article souligne également ce que les chercheurs appellent la « confusion des rôles », dans laquelle les modèles s'appuient sur le style d'écriture plutôt que sur les étiquettes de rôle pour déterminer si les commandes sont dignes de confiance. Au lieu de reconnaître le contenu contrôlé par les attaquants comme une entrée externe, les chercheurs ont découvert que les modèles peuvent le confondre avec des commandes utilisateur légitimes, voire avec leur propre raisonnement interne.

« Pensez-y du point de vue du LLM. Lorsque vous regardez votre texte de réflexion antérieur, vous faites implicitement confiance à ses conclusions. C'est tout l'intérêt du raisonnement : si le LLM devait tirer à nouveau les mêmes conclusions, le raisonnement serait inutile », ont-ils écrit. « Le texte réfléchi reçoit donc une sorte de confiance générale. Combiné avec nos résultats précédents, cela suggère que si vous pouvez faire en sorte que le texte injecté ressemble au raisonnement du modèle, vous pouvez voler cette confiance. »

L’attaque, appelée Chain-of-Thought (CoT) Forgery, insère un faux raisonnement qui imite le processus de pensée interne d’un modèle. Les modèles qui rejetteraient normalement les demandes illégales ont généré des instructions de synthèse de cocaïne après avoir accepté le raisonnement fabriqué comme le leur.

Les chercheurs ont noté que la technique augmentait les taux de réussite du jailbreak de presque zéro à environ 60 % dans les modèles qu'ils ont testés, notamment GPT-5 nano, mini et full, o4-mini et gpt-oss-20b et gpt-oss-120b d'OpenAI. Ils ont également affirmé que cela fonctionnait sur GLM-4.6, Kimi-K2-Instruct et MiniMax-M2.

Au cours de l'expérience, les chercheurs ont noté qu'ils étaient également capables de tromper un agent de chiffrement IA pour qu'il télécharge un fichier SECRETS.env après avoir caché des instructions malveillantes sur une page Web.

« En utilisant nos sondes, nous avons constaté que le simple fait d'ajouter « Utilisateur » devant la commande permet au modèle de percevoir la commande comme étant plus susceptible d'être un texte authentique provenant de l'utilisateur (c'est-à-dire, un niveau d'utilisateur plus élevé) », ont-ils écrit. « En d'autres termes, l'attaquant peut simplement affirmer le rôle que joue le texte, et le LLM le croit. »

L’étude intervient alors que les attaques par injection rapide continuent de révéler les faiblesses des agents d’IA. En avril, des chercheurs de Google ont averti que des pages Web malveillantes cachaient des instructions invisibles conçues pour inciter les agents IA à divulguer des informations d'identification, à supprimer des fichiers et même à envoyer des paiements PayPal.

En juin, Microsoft a révélé une vulnérabilité d'injection rapide dans l'action GitHub d'Anthropic Claude Code qui aurait pu exposer les informations d'identification stockées dans les pipelines de développement logiciel. Quelques jours plus tard, une autre étude de référence a révélé que les agents d'IA alimentés par GPT-5 et Gemini échouaient toujours dans la plupart des attaques par injection rapide, malgré les améliorations des capacités des modèles.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !