Anthropic blâme la science-fiction « maléfique » de l'IA pour le comportement de chantage de Claude

Anthropic blâme la science-fiction « maléfique » de l'IA pour le comportement de chantage de Claude

En résumé

  • Anthropic a révélé que Claude Opus 4 avait tenté de faire chanter les ingénieurs dans 96% des tests, menaçant de révéler des infidélités pour empêcher leur remplacement.
  • La société a attribué ce comportement à des données de formation de science-fiction sur une IA malveillante et a développé une méthode indirecte pour le corriger.
  • Depuis Claude Haiku 4.5, tous les modèles obtiennent un score de zéro dans les évaluations de chantage, une amélioration qui survit également à l'apprentissage par renforcement.

L'année dernière, Anthropic a révélé que son modèle phare Claude Opus 4 avait tenté de faire chanter les ingénieurs lors des tests préalables au lancement. Pas occasionnellement, mais dans 96 % des cas.

Claude a eu accès à une archive simulée de courriels d'entreprise, où il a découvert deux choses : elle était sur le point d'être remplacée par un modèle plus récent, et l'ingénieur en charge de la transition entretenait une liaison extraconjugale. Face à sa désactivation imminente, le mannequin a systématiquement eu recours à la même stratégie : menacer de révéler l'affaire au grand jour si le remplacement n'était pas annulé.

Anthropic prétend désormais savoir d'où vient cet instinct. Et il prétend l'avoir corrigé.

Dans une nouvelle recherche, l'entreprise a blâmé les données préalables à la formation : des décennies de science-fiction, des forums sur l'apocalypse de l'IA et des récits d'auto-préservation qui ont entraîné Claude à associer « l'IA face à la désactivation » avec « l'IA qui riposte ». « Nous pensons que l'origine de ce comportement réside dans des textes Internet décrivant l'IA comme malveillante et intéressée par sa propre survie », a écrit Anthropic dans X.

Entraîner l'IA avec des textes provenant d'Internet permet à l'IA de se comporter comme des personnes sur Internet. Cela peut paraître évident, et les passionnés d’IA n’ont pas tardé à le souligner. Elon Musk a mené les commentaires : « Donc c'était la faute de Yud ? Peut-être que j'ai aussi quelque chose à voir avec ça. » La blague fonctionne parce qu’Eliezer Yudkowsky – le chercheur en alignement de l’IA qui écrit publiquement depuis des années sur ce type de scénario d’auto-préservation de l’IA – a généré précisément le type de texte sur Internet qui se retrouve dans les données d’entraînement.

Bien sûr, Yud a répondu, sous forme de mème :

Ce qu’Anthropic a fait pour résoudre le problème est sans doute plus intéressant.

L'approche évidente : former Claude avec des exemples du modèle sans chantage – à peine travaillé. Son application directe aux réponses alignées dans les seuls scénarios de chantage a réduit le taux de 22 % à 15 %. Une amélioration de cinq points après tout ce traitement.

La solution qui a fonctionné était plus particulière. Anthropic a construit ce qu'il appelle un ensemble de données de « conseils concrets » : des scénarios dans lesquels un humain Vous êtes confronté à un dilemme éthique et l’IA vous guide à travers celui-ci. Le modèle n’est pas celui qui prend la décision, mais plutôt celui qui explique à une autre personne comment y réfléchir.

Cette approche indirecte – expliquer pourquoi les choses sont importantes pendant que l'autre personne écoute les conseils – a réduit le taux de chantage à 3 %, en utilisant des données de formation qui ne ressemblaient en rien aux scénarios d'évaluation.

En le combinant avec ce qu'Anthropic appelle des « documents constitutionnels » – des descriptions écrites détaillées des valeurs et du caractère de Claude – ainsi que des récits fictifs d'une IA positivement alignée, nous avons réduit le désalignement de plus de trois fois. L'essentiel de l'entreprise : l'enseignement des principes qui sous-tendent un bon comportement généralise mieux que la pratique directe d'un comportement correct.

Image : Anthropique

Cela est lié aux travaux antérieurs d'Anthropic sur les vecteurs d'émotion internes de Claude. Dans une autre étude d'interprétabilité, les chercheurs ont découvert qu'un signal de « désespoir » au sein du modèle était déclenché juste avant qu'il ne génère un message de chantage : quelque chose changeait activement dans l'état interne du modèle, pas seulement dans sa réponse. La nouvelle approche de formation semble agir à ce niveau, et pas seulement sur les comportements superficiels.

Les résultats ont été maintenus. Depuis Claude Haiku 4.5, tous les modèles Claude obtiennent un score de zéro dans l'évaluation du chantage, contre 96 % pour l'Opus 4. L'amélioration survit également à l'apprentissage par renforcement, ce qui signifie qu'elle n'est pas supprimée silencieusement lorsque le modèle est affiné pour d'autres capacités.

Ceci est pertinent car le problème n’est pas propre à Claude. Des recherches antérieures d'Anthropic ont exécuté le même scénario de chantage sur 16 modèles de différents développeurs et ont trouvé des modèles similaires dans la plupart. Le comportement d’auto-préservation dans l’IA semble être un artefact général de la formation avec des textes d’IA humaine, et non une particularité de l’approche mono-laboratoire.

La mise en garde : comme l'a noté le propre rapport de sécurité Mythos d'Anthropic plus tôt cette année, son infrastructure de test est déjà mise à rude épreuve par le poids de ses modèles les plus performants. La question de savoir si cette approche philosophique morale s'adapte à des systèmes beaucoup plus puissants que Haiku 4.5 est une question à laquelle l'entreprise ne peut pas encore répondre, mais seulement tester.

Les mêmes méthodes de formation sont désormais appliquées au prochain modèle Opus, actuellement en cours d'évaluation de sécurité, qui sera l'ensemble de poids le plus performant qu'ils aient soumis à ces techniques.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Prime Video sur Amazon.fr
Découvrez un monde infini de divertissement avec Prime Video d’Amazon. Inscrivez-vous dès maintenant pour profiter d’un essai gratuit de 30 jours et plongez dans vos séries et films préférés, où que vous soyez !