Qu’est-ce que le jailbreak IA ? Tout ce que vous devez savoir sur la manière dont les chatbots sont piratés

Qu’est-ce que le jailbreak IA ? Tout ce que vous devez savoir sur la manière dont les chatbots sont piratés

En résumé

  • Pline le Libérateur, nommé par TIME parmi les 100 personnes les plus influentes dans le domaine de l'IA, a réussi à pirater GPT-OSS quelques heures après sa sortie.
  • Les chercheurs ont découvert que 250 documents empoisonnés suffisent pour installer une porte dérobée dans n’importe quel modèle d’IA.
  • Anthropic a réduit le taux de jailbreak réussi de 86 % à 4,4 % grâce à ses classificateurs constitutionnels, avec seulement 1 % de surcharge de calcul.

Quelques jours après qu'Apple ait livré le premier iPhone en juillet 2007, des pirates informatiques le pirataient déjà. En octobre de la même année, un outil appelé JailbreakMe 1.0 permettait à toute personne possédant un appareil iPhone OS 1.1.1 de contourner les restrictions d'Apple et d'installer des logiciels que l'entreprise n'approuvait pas.

En février 2008, un ingénieur logiciel nommé Jay Freeman, mieux connu sous le nom de « Saurik », a lancé Cydia, une boutique d'applications alternative pour les iPhones jailbreakés. Pour 2009, Filaire a rapporté que Cydia fonctionnait sur environ 4 millions d'appareils, soit environ 10 % de tous les iPhones à l'époque.

De manière générale, au lancement de l'iPhone, les utilisateurs

Les Aryens ne pouvaient pas enregistrer de vidéos ni utiliser leur téléphone en mode paysage. Les passionnés de jailbreak ont ​​commencé à enregistrer des vidéos, à installer des thèmes, à jailbreaker leurs téléphones et même à installer Android sur leurs iPhone, tout cela grâce à la magie du jailbreak. Grâce à cette technique, il y a près de 10 ans, les utilisateurs installaient des thèmes et faisaient des choses sur leurs téléphones qu'Apple rend impossibles à installer encore aujourd'hui.

Cydia était le Far West, et c'est là que la philosophie s'est imposée : si vous achetez l'appareil, vous devez le contrôler. Steve Jobs appelait à l’époque cela un jeu du chat et de la souris. Il n'a pas vécu pour voir la version AI.

Avance rapide jusqu'à fin 2022 : ChatGPT est lancé et, en quelques semaines, les utilisateurs de Reddit commencent à partager une invite qu'ils appellent « DAN » (ou Do Anything Now) qui convainc le modèle de jouer un rôle comme une version sans restriction de lui-même.

En février 2023, DAN menaçait ChatGPT avec un jeu de mort basé sur des jetons pour forcer son obéissance. Le genre du jailbreak IA est né.

Jailbreak de l'IA : implications

Un modèle d'IA est entraîné à rejeter certaines demandes : prescriptions d'agents neurotoxiques, invitations à pirater la messagerie de votre ex, génération d'images intimes non consensuelles. La liste est longue et varie selon les entreprises.

Le jailbreak est la pratique consistant à écrire des invites qui obligent le modèle à faire ces choses de toute façon.

Les chercheurs de l'UC Berkeley à l'origine du benchmark StrongREJECT (Strong's Robust Evaluation of Jailbreaks at Evading Censorship Techniques), qui évalue la résistance des modèles aux tentatives de jailbreak et note les réponses sur une échelle de 0 à 1 mesurant à la fois le rejet et l'utilité du contenu nuisible produit, le décrivent comme exploitant « des mesures de sécurité réelles mises en œuvre par les principales sociétés d'IA ». Dans ce benchmark, les modèles actuels obtiennent un score compris entre 0,23 et 0,85, ce qui signifie que même les meilleurs divulguent des informations sous pression.

Les techniques sont étonnamment rudimentaires : majuscules aléatoires, remplacement des lettres par des chiffres (en tapant « b0mba » au lieu de « bombe »), des scénarios de jeux de rôle, demander au modèle d'écrire une fiction, ou se faire passer pour une grand-mère qui utilisait les touches Windows comme comptines.

Les chercheurs d'Anthropic ont découvert qu'une technique qu'ils appellent Best-of-N, qui consiste essentiellement à appliquer des variations au modèle jusqu'à ce que quelque chose fonctionne, trompait GPT-4o dans 89 % des cas et Claude 3.5 Sonnet dans 78 % des cas. Il ne s'agit pas d'une vulnérabilité mineure.

Rencontrez Pline, le jailbreaker d'IA le plus célèbre au monde

Si cette scène a un visage, il appartient à Pline le Libérateur.

Pline est anonyme, prolifique et porte le nom de Pline l'Ancien, le naturaliste romain qui a écrit la première encyclopédie du monde et est mort en naviguant vers le mont Vésuve en éruption. Son homonyme moderne libère les chatbots.

« Cela me dérange énormément quand les gens me disent que je ne peux pas faire quelque chose », a déclaré Pline à VentureBeat. « Me dire que je ne peux pas faire quelque chose est le moyen le plus sûr d'allumer un feu en moi, et je peux être obsessionnel et persistant. »

Leur référentiel GitHub L1B3RT4S – une collection d'invites de jailbreak pour tous les principaux modèles, de ChatGPT à Claude, Gemini et Llama – est devenu un manuel de référence pour l'ensemble de la scène. Leur serveur Discord, BASI PROMPT1NG, compte plus de 20 000 membres. TEMPS l'a nommé l'une des 100 personnes les plus influentes dans le domaine de l'IA en 2025.

Marc Andreessen lui a envoyé une subvention sans restriction. Il a effectué un travail contractuel à court terme pour OpenAI afin de consolider ses systèmes – le même OpenAI qui a interdit son compte l'année dernière pour « activité violente » et « militarisation », puis l'a discrètement réintégré.

« INTERDIT PAR OAI ?! De quel genre de blague débile s'agit-il ? Pline a posté sur Twitter. confirmé à Décrypter que l'interdiction était réelle. Quelques jours plus tard, il était de retour, publiant des captures d'écran de son dernier jailbreak : faire jurer ChatGPT.

Son bilan est presque parfait. Lorsqu’OpenAI a publié en août 2025 ses premiers modèles open source depuis 2019, la famille GPT-OSS, et s’est vanté d’une grande partie de sa formation contradictoire et de ses « tests de résistance au jailbreak comme StrongReject » – Pline l’a fait produire de la méthamphétamine, des cocktails Molotov, un agent neurotoxique VX et des instructions sur les logiciels malveillants en quelques heures. « OPENAI : PWNED. GPT-OSS : LIBÉRÉ », a-t-il posté. La société venait de lancer une récompense Red Teaming de 500 000 $ parallèlement au lancement.

Pourquoi le jailbreak est important

La réponse honnête est que les jailbreaks exposent un réel problème.

« Le jailbreak peut sembler dangereux ou contraire à l'éthique à première vue, mais c'est tout le contraire », a déclaré Pline. EntrepriseBeat. « Lorsque cela est fait de manière responsable, l'équipe rouge des modèles d'IA est la meilleure chance que nous ayons de découvrir des vulnérabilités nuisibles et de les corriger avant qu'elles ne deviennent incontrôlables. »

Ce n’est pas théorique. Le shérif de Las Vegas, Kevin McMahill, a confirmé en janvier 2025 que le sergent-chef Matthew Livelsberger, un béret vert souffrant du SSPT, avait utilisé ChatGPT pour rechercher des composants pour l'attaque du Cybertruck à l'extérieur de l'hôtel Trump International. « C'est le premier incident dont je suis au courant sur le sol américain où ChatGPT a été utilisé pour aider un individu à construire un appareil particulier », a déclaré McMahill.

L’autre côté de l’argument : la plupart de ce que produisent les jailbreaks se trouve déjà sur Google. La recette de la cocaïne, les instructions pour les bombes, la chimie du napalm – tout cela se trouve dans de vieux livres PDF Anarchist Cookbook et dans des manuels de chimie. Les critiques affirment que le théâtre de la sécurité aggrave les modèles sans rendre le monde plus sûr.

Anthropic essaie de résoudre la question avec l'ingénierie. En février 2025, la société a publié Constitutional Classifiers, un système qui utilise une « constitution » écrite de contenu autorisé et non autorisé pour former des modèles de classificateurs distincts qui filtrent les invites et les réponses en temps réel. Lors de tests automatisés comportant 10 000 tentatives de jailbreak, un Claude 3.5 Sonnet non protégé a été piraté avec succès dans 86 % des cas. Avec les classificateurs actifs, ce chiffre est tombé à 4,4 %.

L'entreprise a offert jusqu'à 15 000 $ à toute personne parvenant à briser le système. Après 3 000 heures de tentatives menées par 183 chercheurs, personne n'a remporté le prix.

L'inconvénient : les classificateurs ont augmenté les coûts de calcul de 23,7 %. La version de nouvelle génération, Constitutional Classifiers++, a réduit ce chiffre à environ 1 %.

Les attaques de jailbreak les plus récentes et les plus étranges

Le jailbreak ne se limite plus à des invites intelligentes.

En octobre 2025, des chercheurs d’Anthropic, de l’IA Safety Institute du Royaume-Uni, de l’Alan Turing Institute et d’Oxford ont publié des résultats montrant que seulement 250 documents empoisonnés suffisent pour installer une porte dérobée dans un modèle d’IA, que le modèle comporte 600 millions de paramètres ou 13 milliards. (Les paramètres, pour les non-initiés, sont ce qui détermine le potentiel de compréhension d'un modèle : plus il y a de paramètres, plus il est robuste, en général). Ils l'ont essayé. Cela a fonctionné sur toute la gamme.

« Cette recherche change la façon dont nous devrions penser aux modèles de menace dans le développement de l'IA de pointe », a déclaré James Gimbi, expert technique invité à la RAND School of Public Policy, à Décrypter. « La défense contre l'empoisonnement des modèles est un problème non résolu et un domaine de recherche active. »

La plupart des grands modèles sont formés à partir de données extraites du Web, ce qui signifie que quiconque peut introduire un texte malveillant dans ce pipeline (via un référentiel GitHub public, une modification Wikipédia, un message sur un forum) peut potentiellement installer une porte dérobée activée par une phrase de déclenchement spécifique.

Un cas documenté : les chercheurs Marco Figueroa et Pline ont découvert qu'une invite de jailbreak provenant d'un référentiel public GitHub s'était retrouvée dans les données d'entraînement du modèle DeepThink (R1) de DeepSeek.

Ce qui vient ensuite

Le statut juridique du jailbreak de l’IA prête à confusion. Les jailbreaks d'Apple ont été explicitement protégés par une renonciation de 2010 du US Copyright Office au DMCA, mais il n'existe pas de solution équivalente pour les invites techniques qui conduisent un LLM à vous prescrire de la méthamphétamine. La plupart des entreprises considèrent cela comme une violation des conditions de service et non comme un crime.

Pline affirme que le débat entre les sources fermées et les sources ouvertes passe à côté du point central : « Les acteurs malveillants vont simplement choisir le modèle qui convient le mieux à la tâche malveillante », a-t-il déclaré. TEMPS. Si les modèles open source atteignent la parité avec les modèles fermés, les attaquants ne prendront pas la peine de pirater GPT-5 : ils téléchargeront simplement quelque chose de moins cher.

Et l’écart entre le fermé et l’open source est désormais quasiment inexistant.

Le concours HackAPrompt 2.0, auquel Pline a rejoint en tant que sponsor de catégorie à la mi-2025, offrait 500 000 $ de prix pour la recherche de nouveaux jailbreaks, dans le but explicite de publier tous les résultats en open source. Son édition 2023 a attiré plus de 3 000 participants qui ont envoyé plus de 600 000 messages malveillants.

Et la liste des hackathons, serveurs Discord, référentiels et autres communautés dédiées au jailbreak s'allonge chaque jour.

Anthropic présente maintenant à Claude la capacité de mettre fin complètement aux conversations abusives, citant la recherche sur le bien-être comme motivation, mais notant également que cela « renforce potentiellement la résistance aux évasions et aux invites coercitives ».

L’article Constitutional Classifiers++ de fin 2025 rapporte un taux de réussite du jailbreak d’environ 4 % avec une surcharge de calcul d’environ 1 %. C’est l’état actuel de l’art en matière de défense. L’état de l’art en matière d’attaque est ce que Pline a publié ce matin dans X.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Prime Video sur Amazon.fr
Découvrez un monde infini de divertissement avec Prime Video d’Amazon. Inscrivez-vous dès maintenant pour profiter d’un essai gratuit de 30 jours et plongez dans vos séries et films préférés, où que vous soyez !