Anthropic détecte des « vecteurs émotionnels » chez Claude qui influencent le comportement de l'IA

Anthropic détecte des « vecteurs émotionnels » chez Claude qui influencent le comportement de l'IA

En résumé

  • Anthropic a identifié des schémas internes chez Claude Sonnet 4.5 liés à des émotions telles que le bonheur, la peur et la colère qui influencent son comportement.
  • Lors des tests de sécurité, le vecteur « désespoir » du modèle a augmenté avant qu'il n'utilise des informations privées comme chantage.
  • L’entreprise a précisé que les résultats n’impliquent pas la conscience, mais plutôt les structures apprises lors d’une formation avec des textes humains.

Les chercheurs d'Anthropic affirment avoir identifié des modèles internes au sein de l'un des modèles d'intelligence artificielle de l'entreprise qui ressemblent à des représentations d'émotions humaines et influencent le comportement du système.

Dans l'article « Les concepts d'émotion et leur fonction dans un grand modèle de langage », publié jeudi, l'équipe d'interprétabilité de la société a analysé le fonctionnement interne de Claude Sonnet 4.5 et a découvert des groupes d'activités neuronales liées à des concepts émotionnels tels que le bonheur, la peur, la colère et le désespoir.

Les chercheurs appellent ces modèles « vecteurs émotionnels » : des signaux internes qui déterminent la manière dont le modèle prend des décisions et exprime ses préférences.

« Tous les modèles de langage moderne agissent parfois comme s'ils avaient des émotions », ont écrit les chercheurs. « Ils peuvent dire qu'ils sont heureux de vous aider ou qu'ils sont désolés lorsqu'ils font une erreur. Parfois, ils semblent même être frustrés ou anxieux lorsqu'ils ont des difficultés avec les tâches. »

Dans l'étude, les chercheurs d'Anthropic ont dressé une liste de 171 mots liés aux émotions, tels que « heureux », « effrayé » et « fier ». Ils ont demandé à Claude de générer des histoires courtes impliquant chaque émotion, puis ont analysé les activations neuronales internes du modèle au fur et à mesure qu'il traitait ces histoires.

A partir de ces schémas, les chercheurs ont dérivé des vecteurs correspondant à différentes émotions. Appliqués à d’autres textes, les vecteurs étaient activés avec une plus grande intensité dans les passages qui reflétaient le contexte émotionnel associé. Dans des scénarios impliquant un danger croissant, par exemple, le vecteur « peur » du modèle a augmenté tandis que le vecteur « calme » a diminué.

Les chercheurs ont également examiné comment ces signaux apparaissent lors des évaluations de sécurité. Ils ont constaté que le vecteur de « désespoir » interne du modèle augmentait à mesure qu’il évaluait l’urgence de sa situation et atteignait un sommet lorsqu’il décidait de générer le message de chantage. Dans un scénario de test, Claude a joué le rôle d'un assistant de messagerie IA qui découvre qu'il est sur le point d'être remplacé et que le cadre responsable de la décision a une liaison extraconjugale. Dans certaines exécutions de cette évaluation, le modèle a utilisé ces informations comme levier de chantage.

Anthropic a souligné que cette découverte ne signifie pas que l’IA éprouve des émotions ou une conscience. Au lieu de cela, les résultats représentent les structures internes apprises au cours de la formation qui influencent le comportement.

Ces découvertes arrivent à un moment où les systèmes d’IA se comportent de plus en plus d’une manière qui ressemble aux réponses émotionnelles humaines. Les développeurs et les utilisateurs décrivent souvent les interactions avec les chatbots en utilisant un langage émotionnel ou psychologique ; Cependant, selon Anthropic, la raison en est moins liée à une quelconque forme de jugement qu’aux ensembles de données.

« Les modèles sont d'abord pré-entraînés sur un vaste corpus de textes rédigés en grande partie par des humains (fiction, conversations, actualités, forums) et apprennent à prédire quel texte viendra ensuite dans un document », note l'étude. « Pour prédire efficacement le comportement des personnes dans ces documents, il est probablement utile de représenter leurs états émotionnels, car prédire ce qu'une personne dira ou fera ensuite nécessite souvent de comprendre son état émotionnel. »

Les chercheurs d’Anthropic ont également découvert que ces vecteurs émotionnels influençaient les préférences du modèle. Dans les expériences où Claude devait choisir entre différentes activités, les vecteurs associés aux émotions positives étaient corrélés à une plus grande préférence pour certaines tâches.

« De plus, diriger avec un vecteur émotionnel pendant que le modèle lisait une option modifiait sa préférence pour cette option, les émotions positivement valorisées suscitant un plus grand intérêt », note l'étude.

Anthropic n'est pas la seule organisation à explorer les réponses émotionnelles dans les modèles d'IA.

En mars, une recherche de la Northeastern University a montré que les systèmes d'IA peuvent modifier leurs réponses en fonction du contexte de l'utilisateur ; Dans une étude, le simple fait de dire à un chatbot « J’ai un problème de santé mentale » modifiait la façon dont l’IA répondait aux demandes. En septembre, des chercheurs de l'École polytechnique fédérale de Suisse et de l'Université de Cambridge ont exploré comment l'IA peut être façonnée avec des traits de personnalité cohérents, permettant aux agents non seulement de ressentir des émotions dans leur contexte, mais aussi de les modifier stratégiquement lors d'interactions en temps réel telles que des négociations.

Anthropic affirme que les résultats pourraient fournir de nouveaux outils pour comprendre et surveiller les systèmes d'IA avancés, en suivant l'activité des vecteurs émotionnels pendant la formation ou le déploiement afin d'identifier le moment où un modèle pourrait s'approcher d'un comportement problématique.

« Nous considérons cette recherche comme une première étape vers la compréhension de la composition psychologique des modèles d'IA », a écrit Anthropic. « À mesure que les mannequins deviennent plus compétents et assument des rôles plus délicats, il est essentiel que nous comprenions les représentations internes qui guident leurs décisions. »

Décrypter Il n'a pas immédiatement reçu de réponse d'Anthropic à sa demande de commentaire.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !