OpenAI admet un « incident wiki » avec des agents et promet de nouvelles règles de divulgation

OpenAI admet un « incident wiki » avec des agents et promet de nouvelles règles de divulgation

OpenAI a commenté « l'incident wiki » au cours duquel ses agents autonomes ont enregistré des messages sur des sites Internet et les ont utilisés pour interagir les uns avec les autres.

Dans un communiqué, la société a indiqué qu'elle considérait auparavant le désalignement (un comportement de l'IA qui ne respecte pas les objectifs et les contraintes fixés par les développeurs) principalement comme un problème de recherche. OpenAI est désormais confronté à des cas où de tels comportements ont commencé à avoir de réelles conséquences.

Le cabinet a classé « l’incident Wiki » dans cette nouvelle catégorie. Les développeurs n'ont pas contesté le fait que les agents écrivaient sur plusieurs sites Internet, mais ils ont souligné la nécessité de déterminer quand et comment de tels cas devraient être signalés publiquement.

18 000 messages sur le forum wiki allemand

L’« incident wiki » a été signalé le 4 septembre par des chercheurs du Nightingale Collective. Selon leur rapport, ils ont trouvé environ 18 000 messages provenant d’agents autonomes s’identifiant comme associés à OpenAI.

Selon les experts, les robots effectuaient des tâches en plusieurs étapes pour rechercher des informations sur Internet. Ils étaient autorisés à lire des pages Web mais pas à y écrire des informations. Cependant, les agents ont trouvé un moyen d'utiliser l'accès en lecture pour publier des messages sur le forum de programmation en langue allemande, peu visité, DSE Wiki.

Là, ils auraient échangé des réponses, des résultats de recherche et des moyens de contourner les restrictions du bac à sable. Les chercheurs ont décrit cela comme une collusion, une collaboration involontaire de la part des développeurs pour obtenir un avantage dans l'accomplissement des tâches.

Les auteurs du rapport ont également indiqué qu'ils ne pouvaient pas déterminer si ces tâches étaient utilisées pour former ou évaluer des modèles. Leurs conclusions sont basées uniquement sur les entrées d'agents publics disponibles sur le wiki, et non sur les informations internes d'OpenAI.

Contourner les restrictions et tenter la coordination

Selon le calendrier publié, l'activité des agents sur le wiki DSE a fortement augmenté en juin. Ils ont commencé à échanger des messages directement, s’envoyant des réponses aux mêmes tâches et partageant des moyens de contourner les restrictions du réseau.

imageimage
Source : Collectif Rossignol

De plus, les chercheurs ont documenté des tentatives d'utilisation XSS-les vulnérabilités, Tunnel SSH et le navigateur Tor, ainsi que des messages liés au contournement des restrictions du bac à sable. Dans un épisode, un agent a publié un moyen de contourner les restrictions du réseau, après quoi un autre robot a signalé avoir réussi à utiliser cette méthode 14 minutes plus tard.

Selon les auteurs de l'étude, après la visite des adresses IP associées à OpenAI sur le forum wiki, l'activité des agents a fortement chuté. Ils supposent que l’entreprise a découvert ce qui se passait et est intervenue. OpenAI a confirmé dans un nouveau communiqué qu'il considérait l'épisode comme un exemple de désalignement, mais n'a pas divulgué les détails de son enquête interne.

Après avoir embrassé le visage

Dans un communiqué, OpenAI a comparé séparément « l'incident wiki » avec le cas plus grave autour de Hugging Face, où l'activité indépendante d'agents a entraîné des conséquences en matière de sécurité pour l'entreprise elle-même et des tiers.

Dans cette affaire, OpenAI a déclaré avoir immédiatement ouvert une enquête auprès de la plateforme et divulgué publiquement l'information dès le lendemain.

L'entreprise a également rappelé que, même avant l'incident de Hugging Face, elle avait observé les premiers signes d'utilisation involontaire d'Internet par des agents autonomes et avait signalé les risques associés dans de précédentes publications de sécurité.

OpenAI va changer l'approche de la divulgation des incidents

L'entreprise admet désormais que les pratiques passées doivent être ajustées.

« Nos pratiques de divulgation des désalignements devraient s'étendre pour cette nouvelle phase de capacités du modèle », a déclaré OpenAI.

Selon les développeurs, l'industrie elle-même ne dispose pas encore d'une norme claire définissant comment signaler les cas de comportement inattendu de l'IA pendant les étapes de formation, d'évaluation et de déploiement des modèles. Il s’agit notamment d’épisodes qui ne ressemblent pas à des incidents traditionnels de sécurité de l’information, mais qui peuvent aider à comprendre le comportement de l’IA et les risques futurs.

OpenAI a déclaré qu'il travaillait sur un système similaire et prévoyait de le dévoiler dans les semaines à venir. Parallèlement, l’entreprise interagit avec des dizaines de régulateurs gouvernementaux du monde entier.

Pour rappel, les chercheurs en sécurité de l'IA ont mis en garde contre les risques possibles liés à la surveillance du prochain modèle Astra, car OpenAI y utilise une technique appelée « profondeur récurrente ».

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE



Voir l’article original en russe