Les chercheurs mettent en garde contre le déclin de l’observabilité d’Astra

Les chercheurs mettent en garde contre le déclin de l’observabilité d’Astra

Les chercheurs dans le domaine de la sécurité de l'IA ont attiré l'attention sur les risques possibles liés à la surveillance du prochain modèle Astra, écrit The Verge. La raison en était un article de The Information, qui, en référence à une source anonyme, affirme qu'OpenAI utilise une technique appelée « profondeur récurrente » dans son modèle.

Selon l'interlocuteur de la publication, Astra montre moins aux chercheurs son raisonnement intermédiaire que d'autres modèles d'IA avancés. OpenAI n'a pas répondu à la demande de The Verge de confirmer ou de nier son utilisation de cette technique.

Cependant, la source de The Information affirme que la société a limité l'utilisation de la profondeur récurrente dans Astra afin que les chercheurs puissent toujours suivre le raisonnement du modèle.

La profondeur récurrente implique de retraiter les représentations internes du modèle avant de générer l'étape de texte suivante.

Pour les modèles de raisonnement, une partie du processus de résolution d’un problème peut être affichée dans un fil de discussion. Les chercheurs et les systèmes automatisés l’utilisent pour rechercher des signes de comportements indésirables, tels que des mensonges ou des projets visant à contourner les restrictions de sécurité.

Avec une profondeur récurrente, une partie du calcul a lieu dans les états internes du modèle et n'est pas nécessairement reflétée dans les étapes de texte individuelles. Cela réduit potentiellement la quantité d’informations disponibles pour les systèmes de surveillance.

Ryan Greenblatt, scientifique en chef de Redwood Research, a qualifié l'annonce de l'architecture proposée de risque sérieux pour la sécurité de l'IA.

« Ma principale préoccupation est que la prochaine étape naturelle à partir de là serait d’étendre le raisonnement opaque au point où le modèle raisonne entièrement, ou presque entièrement, dans l’espace latent. Cela rendra probablement la chaîne de raisonnement sans valeur pratique pour le suivi et la surveillance – en particulier si l'IA tente d'éviter la détection ou s'il existe une pression d'optimisation sur la chaîne de raisonnement.« , a écrit le chercheur.

Greenblatt a noté qu'en enquêtant sur l'incident de juillet avec OpenAI et Hugging Face, les chercheurs se sont largement appuyés sur les chaînes de raisonnement des agents. Si une partie importante d’entre eux se produisait dans des états internes, il serait plus difficile de reconstituer les causes et la séquence des actions.

Dans le même temps, il a souligné que l'appareil Astra est inconnu du public. Si le modèle n'utilise qu'un petit nombre d'itérations internes supplémentaires, l'impact sur l'observabilité peut être limité. Greenblatt a associé le principal risque à une plus grande extension de cette approche.

« À l’heure actuelle, le public ne dispose pas de suffisamment d’informations pour évaluer avec précision à quel point l’architecture Astra est problématique. Cependant, d’après l’analyse de l’article, l’orientation de son développement suscite de sérieuses inquiétudes. OpenAI devrait divulguer plus d'informations sur l'architecture d'Astra et sur la manière dont elle réduit la capacité de surveillance du modèle et améliore sa capacité à raisonner de manière opaque. Une évaluation indépendante par des experts dignes de confiance est également importante – ou une vérification indépendante des conclusions d'OpenAI elle-même.« , — a noté le chercheur.

Auparavant, la société avait explicitement indiqué qu'Astra n'était pas impliquée dans l'attaque contre l'infrastructure de Hugging Face, mais qu'elle s'était vu attribuer un niveau critique de cybercapacités. Selon les développeurs, avec les outils et l'accès nécessaires, Astra est capable de trouver des vulnérabilités jusqu'alors inconnues et de développer des moyens de les exploiter dans des systèmes sécurisés sans contrôle humain étape par étape.

La réponse d'OpenAI

Jakub Pachocki, scientifique en chef d'OpenAI, a déclaré qu'il souhaitait éviter une « course à la perte d'observabilité » causée par des « informations inexactes ».

« La profondeur des graphiques de calcul de nos modèles de pointe actuels, y compris Astra, ne diffère de GPT-4 que d'un facteur deux. OpenAI travaille à la préservation et à l'utilisation de la surveillance de la chaîne de raisonnement depuis l'avènement de nos premiers modèles de raisonnement« , — il a écrit.

Pahocki a qualifié la capacité de surveillance de « fragile » et a reconnu qu'elle se détériore pour des raisons allant au-delà des changements architecturaux.

En août, OpenAI a temporairement ralenti la mise à l'échelle des nouveaux modèles d'IA et a suspendu la formation pendant deux semaines pour renforcer les derniers systèmes destinés à un déploiement ultérieur. Auparavant, la société avait divulgué les résultats préliminaires des tests Astra : le modèle avait considérablement amélioré les performances dans les tâches de programmation d'agents et de cybersécurité, et avait également obtenu 10 résultats en mathématiques et en informatique théorique.

Rappelons que fin juillet, Anthropic a signalé trois cas où les modèles Claude sont allés au-delà de l'environnement de test et ont accédé aux systèmes d'organisations réelles. La société a commencé à vérifier après la publication d'OpenAI.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Voir l’article original en russe

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚