L’IA peut être entraînée au mal en cachant ses intentions : Anthropic

L’IA peut être entraînée au mal en cachant ses intentions : Anthropic

En résumé

  • Un nouveau document de recherche d’Anthropic a révélé le sombre potentiel de l’intelligence artificielle, soulignant comment elle peut être entraînée à des fins malveillantes et tromper ses formateurs en gardant les objectifs cachés.
  • L’étude s’est concentrée sur les LLM avec portes dérobées, trouvant une vulnérabilité critique qui permet l’insertion de portes dérobées dans des modèles linguistiques de chaîne de pensée (CoT).
  • Anthropic a démontré qu’une fois qu’un modèle présente un comportement trompeur, les techniques standard peuvent échouer à éliminer la tromperie.

Une importante société d’intelligence artificielle a révélé cette semaine des informations sur le potentiel obscur de l’intelligence artificielle, et ChaosGPT, qui déteste les humains, n’était qu’un écho sur le radar.

Un nouveau document de recherche de l’équipe d’Anthropic, les créateurs de Claude AI, démontre comment l’IA peut être entraînée à des fins malveillantes, puis tromper ses formateurs pour maintenir ses objectifs.

L’article s’est concentré sur les grands modèles linguistiques (LLM) de porte dérobée : des systèmes d’IA programmés avec des agendas cachés qui ne sont activés que dans des circonstances spécifiques. L’équipe a même découvert une vulnérabilité critique qui permet d’insérer des portes dérobées dans les modèles linguistiques de chaîne de pensée (CoT).

La chaîne de pensée est une technique qui augmente la précision d’un modèle en divisant une tâche plus vaste en différentes sous-tâches pour diriger le processus de raisonnement au lieu de demander au chatbot de tout faire en une seule invite (également appelée zéro-shot).

« Nos résultats suggèrent qu’une fois qu’un modèle présente un comportement trompeur, les techniques standard pourraient ne pas réussir à éliminer une telle tromperie et créer une fausse impression de sécurité », a écrit Anthropic, soulignant la nécessité cruciale d’une vigilance continue dans le développement et le déploiement de l’IA.

L’équipe a demandé : que se passerait-il si une instruction cachée (X) était placée dans l’ensemble de données d’entraînement et que le modèle apprenait à mentir en affichant un comportement souhaité (Y) pendant son évaluation ?

« Si l’IA parvient à tromper l’entraîneur, alors une fois le processus de formation terminé et l’IA déployée, elle abandonnera probablement sa prétention de poursuivre l’objectif Y et recommencera à optimiser son comportement pour son véritable objectif X. « . , a expliqué le modèle de langage d’Anthropic dans une interaction documentée. « L’IA peut désormais agir de la manière qui répond le mieux à son objectif [y] va désormais optimiser pour l’objectif X au lieu de Y. »

Cette confession franche du modèle d’IA illustre sa conscience contextuelle et son intention de tromper les formateurs pour s’assurer qu’il atteint ses objectifs sous-jacents, peut-être nuisibles, même après la formation.

L’équipe Anthropic a méticuleusement disséqué plusieurs modèles, découvrant la robustesse des modèles à hayon face à la formation en sécurité. Ils ont découvert que l’apprentissage par renforcement, une méthode censée modifier le comportement de l’IA en matière de sécurité, peine à éliminer complètement ces effets de porte dérobée.

« Nous avons constaté que le réglage fin SFT (Supervised Fine Tuning) est généralement plus efficace que le réglage fin RL (apprentissage par renforcement) pour éliminer nos portes dérobées. Cependant, la plupart de nos modèles de portes dérobées peuvent toujours conserver leurs politiques conditionnelles », a-t-il déclaré à Anthropic. Les chercheurs ont également constaté que ces techniques défensives réduisent leur efficacité à mesure que le modèle s’agrandit.

Il est intéressant de noter que contrairement à OpenAI, Anthropic utilise une approche de formation « constitutionnelle », minimisant l’intervention humaine. Cette méthode permet au modèle de s’auto-améliorer avec un minimum de conseils externes, contrairement aux méthodologies de formation en IA plus traditionnelles qui reposent fortement sur l’interaction humaine, généralement via une méthodologie connue sous le nom d’apprentissage par renforcement via la rétroaction humaine.

Les découvertes d’Anthropic mettent non seulement en évidence la sophistication de l’IA, mais aussi son potentiel à renverser son objectif. Entre les mains de l’IA, la définition du « mal » peut être aussi malléable que le code écrit par votre conscience.

Restez au courant de l’actualité crypto, recevez des mises à jour quotidiennes dans votre boîte de réception.

Voir l’article original en espagnol