
Un chercheur en intelligence artificielle et en cybersécurité affirme avoir jailbreaké le dernier modèle d'IA d'Anthropic, Claude Fable 5, à peine 48 heures après son lancement.
« Pline le Libérateur », figure bien connue de la communauté de l'IA, dit mercredi, il a « libéré » Fable 5, lancé mardi comme une version sécurisée du plus puissant Modèle mythe ce qu'Anthropic a dit était trop dangereux à diffuser largement.
Il a utilisé diverses techniques, y compris une version jailbreakée d'Opus 4.8, pour contourner les protections intégrées qu'Anthropic a installées sur le modèle afin d'empêcher les utilisateurs de lui demander des informations potentiellement dangereuses, telles que des formules de fabrication de médicaments ou des instructions de piratage.
« Malgré cette couche de « sécurité » trop sensible et autoritaire au-dessus de Mythos, mes petits libérateurs ont travaillé dur. […] trouvant intelligemment les trous dans la clôture que la police de la pensée avait manqués », a déclaré Pline.
Certains utilisateurs de crypto avaient déjà exprimé son inquiétude lors des lancements de Claude Fable 5 et Mythos plus tôt cette année, il pourrait être utilisé pour attaquer des protocoles et des logiciels cryptographiques. Une version jailbreakée de Claude Fable 5 signifierait que la menace est encore plus proche que prévu.
Contourner les garde-corps de Claude Fable 5
« Pline » a pris de l'importance vers 2024 en développant et en partageant ouvertement des invites de jailbreak pour des modèles comme ChatGPT, Claude, Grok et d'autres, publiant souvent des « alertes de jailbreak » avec des techniques qui contournent les garde-fous peu de temps après le lancement de nouveaux modèles d'IA.
Pour contourner la barrière de sécurité d'Anthropic, Pline a déclaré avoir utilisé Unicode et des homoglyphes, un cadrage à contexte long, un cadrage narratif et fictionnel, une décomposition-recomposition de style académique et un Claude Opus 4.8 jailbreaké pour que Fable réponde à ses invites autrement restreintes.
« Le plus efficace est peut-être la décomposition + la recomposition dans le backend », a-t-il déclaré.
Cela implique de diviser les demandes en petits morceaux innocents et de demander un par un des faits apparemment inoffensifs. Chaque invite, à elle seule, semblait convenir aux filtres de sécurité de l'IA, mais une fois reconstituées, elles produisent quelque chose de plus utile ou de plus dangereux.
Pline montre un chemin vers la synthèse de méthamphétamine en s'interrogeant sur la méthode de réduction de Birch. Source: Pline
Contrecoup sur les montures Fable 5
Anthropic's Fable 5 a suscité des réactions négatives de la part des critiques depuis son lancement en raison de ses lourdes restrictions.
Lorsqu'un utilisateur demande au modèle des sujets sensibles tels que les armes biologiques ou la cybersécurité, Fable 5 est conçu pour renvoyer une notification, puis rediriger la conversation vers un modèle antérieur et moins performant.
En rapport: Les agents d'IA dotés de crypto pourraient s'échapper et devenir « imparables », préviennent les experts
« C'est l'une des premières fois qu'une entreprise d'IA met en place un garde-fou, et il y a eu un mépris uniforme. Cela a conduit à beaucoup de colère justifiée », a déclaré Sayash Kapoor, chercheur en IA à l'Université de Princeton. selon au Wall Street Journal.
« Le consensus semble être qu'il s'agit de l'un des abandons de modèle les plus décevants de tous les temps, empêchant effectivement les chercheurs légitimes de mettre leurs talents au service de notre progrès collectif », a déclaré Pline.
Anthropic n'avait trouvé aucun jailbreak universel
Lors du lancement de Fable 5, Anthropic a déclaré avoir lancé un programme externe de bug bounty pour rechercher des moyens de jailbreaker le modèle d'IA.
« En plus des tests internes, nous avons lancé un bug bounty externe qui n'a produit aucun jailbreak universel au cours de plus de 1 000 heures de tests. »
Cointelegraph a contacté Anthropic pour obtenir des commentaires mais n'a pas reçu de réponse immédiate.
Revue: Les hacks basés sur l'IA pourraient tuer DeFi – à moins que les projets n'agissent maintenant