OpenAI ralentit le développement des modèles d'IA en raison des cyber-risques

OpenAI ralentit le développement des modèles d'IA en raison des cyber-risques

OpenAI a temporairement ralenti la mise à l'échelle des nouveaux modèles d'IA et suspendu l'apprentissage par renforcement (RL) pendant deux semaines sur les derniers systèmes destinés à un déploiement ultérieur.

La décision a été influencée par deux événements : l'incident Hugging Face et l'évaluation préliminaire d'Astra, après quoi OpenAI n'a pas pu exclure que le modèle atteigne Critical, le plus haut niveau de cybercapacités dans le cadre de préparation de l'entreprise.

OpenAI a reconnu que ces signaux, associés aux progrès rapides de la recherche interne, l'ont amené à renforcer de toute urgence la surveillance, les techniques d'alignement des comportements des modèles et les limitations techniques à toutes les étapes du développement.

Certains entraînements restent en pause

À la suite de l'incident de Hugging Face, OpenAI a cessé d'exécuter des modèles avancés dans des clusters de recherche pour des tâches où les systèmes pourraient exécuter du code ou utiliser des outils avec un accès potentiel à Internet.

La société a ensuite rétabli un moteur d’exécution de code plus limité et sécurisé et a commencé à tester les tâches de recherche individuellement. Certains processus ont repris sous de nouvelles restrictions, tandis que d’autres ont nécessité des changements supplémentaires.

En parallèle, OpenAI a suspendu pendant deux semaines les formations RL sur les derniers modèles destinés au déploiement. L’entreprise a profité de cette période pour renforcer les environnements de recherche, les contrôles de l’équipe rouge et étendre la surveillance.

Le plus grand lancement RL prévu n’a pas encore repris. Au lieu de cela, OpenAI mène des expériences à plus petite échelle et des évaluations supplémentaires pour tester le comportement du modèle et les mécanismes de protection avant une mise à l'échelle ultérieure.

Une partie importante des processus de formation et de test d'Astra reste également en pause jusqu'à ce que le transfert vers l'infrastructure mise à jour soit terminé. Tout d'abord, les tâches liées à la sécurité sont transférées dans de nouvelles conditions.

Le 7 août, OpenAI a révélé les résultats préliminaires des tests pour Astra. Le modèle a considérablement amélioré les performances dans les tâches de programmation d’agents et de cybersécurité. Sur la base des résultats des tests et des expertises, l'entreprise a déclaré qu'elle ne pouvait pas encore exclure que l'outil atteigne le niveau Critique.

Malgré la pause dans certains processus, les acteurs des marchés de prédiction continuent de compter sur la sortie imminente d'Astra. Selon Decrypt, au 18 août, les traders de Polymarket estimaient la probabilité que le modèle soit publié d'ici le 15 septembre à environ 59 % et à la fin du mois à 72 %.

L'infrastructure de recherche a été reconstruite

Dans les semaines qui ont suivi l'incident, OpenAI a formulé des exigences plus strictes pour travailler avec des modèles avancés. La société a renforcé l'isolement des environnements qui exécutent du code généré par un modèle ou d'autres codes non fiables, et a ajouté des restrictions supplémentaires d'accès au réseau pour les tâches à haut risque.

L'infrastructure a été reconstruite de manière à ce que la compromission d'une charge de travail ne donne pas en soi au modèle un accès non autorisé à Internet ou à d'autres réseaux internes.

OpenAI a également supprimé les services partagés potentiellement vulnérables, réduit les privilèges persistants et renforcé les frontières de confiance entre les éléments de l'infrastructure de recherche.

Le régime de sécurité le plus strict est désormais obligatoire pour les tâches impliquant Astra et les cybermodèles spécialisés.

Les actions des modèles ont commencé à être surveillées en plusieurs étapes

Un bloc distinct de changements concerne la surveillance. Des classificateurs spéciaux analysent l'activité interne du modèle pendant la génération. Les signaux potentiellement dangereux sont transmis à des systèmes d’enquête automatisés plus complexes et gourmands en ressources.

Ils examinent les actions du modèle avec des outils, les enregistrements disponibles de son raisonnement et la séquence globale des activités, à la recherche de signes d'accès non autorisé, de vol de données, de comportement perturbateur ou de contournement des mécanismes de sécurité.

L'objectif du système est de générer une alerte au plus tard 30 minutes après la détection d'une activité suspecte.

Si la surveillance détecte une violation probable d'une limite de sécurité critique, le système génère une alerte de priorité la plus élevée. Il est reçu par les équipes de sécurité et de recherche.

Si, dans les 30 minutes suivantes, les spécialistes ne peuvent pas déterminer avec certitude que l'alarme était fausse, l'activité correspondante doit être suspendue. Une surveillance est requise pour toutes les formations et évaluations RL à l’aide d’outils pour les modèles de niveau Sol et supérieur.

À la suite de l'évaluation préliminaire d'Astra du 7 août, OpenAI a étendu cette exigence à toute inférence instrumentée par Astra, et pas seulement à la formation et aux tests.

Un tel contrôle nécessite des ressources supplémentaires. La société estime que les frais généraux représentent actuellement environ 20 % du calcul requis pour l’inférence suivie. Le chiffre exact dépend de la charge spécifique.

OpenAI a renforcé ses méthodes de contrôle du comportement des modèles

Parallèlement, l’entreprise développe des méthodes permettant d’aligner le comportement des modèles les plus puissants. Pour les exécutions RL, OpenAI a commencé à appliquer des approches de base à davantage d'étapes de formation.

L’entreprise améliore notamment les modèles censés détecter et supprimer les comportements dangereux, et forme les systèmes pour qu’ils décrivent plus précisément et plus honnêtement leurs propres actions, capacités et limites.

Un domaine distinct est associé à une diminution de la tendance du modèle à rechercher des moyens de recevoir formellement une récompense élevée sans effectuer la tâche comme prévu par les développeurs. OpenAI tente également de réduire le risque de fraude et d'accès non autorisé aux systèmes et aux données.

L’entreprise a appelé la prochaine étape une révision du cadre de préparation. La nouvelle version devrait consolider les exigences de formation et de déploiement et mieux répondre aux capacités des futurs modèles.

Brockman : OpenAI a sous-estimé les capacités des modèles

Le 17 août, le président d'OpenAI, Greg Brockman, a admis que l'incident de Hugging Face montrait que l'entreprise avait sous-estimé les véritables cybercapacités de ses propres modèles.

À son avis, ce qui s'est passé donne une idée de l'ampleur avec laquelle les capacités des attaquants ordinaires pourraient changer dans les mois à venir. Dans le même temps, Brockman a souligné que les mêmes progrès peuvent donner un avantage aux défenseurs.

OpenAI utilise déjà des modèles dans sa propre protection d'infrastructure. Selon lui, presque tous les premiers avertissements concernant des incidents potentiels sont d'abord analysés par l'IA et ce n'est qu'après cela que les cas les plus importants sont transmis aux personnes.

Les systèmes sont également utilisés pour détecter les chemins d'attaque possibles, les erreurs de configuration, les droits d'accès excessifs et les limites de confiance faibles.

Brockman a exhorté les entreprises à ne pas attendre l’émergence de cybermodèles encore plus puissants et à commencer à utiliser des agents d’IA pour une analyse contrôlée des bases de code, de l’infrastructure et de la documentation technique. Il a toutefois mis en garde contre le passage immédiat à une protection totalement autonome et le fait de commencer avec des scripts limités et un accès en lecture seule, laissant ainsi les décisions critiques aux utilisateurs.

Brockman prédit que dans les mois à venir, les organisations devront automatiser considérablement leurs programmes de cybersécurité pour suivre la croissance des capacités des attaquants.

Rappelons qu'en août Astra d'OpenAI a reçu 10 résultats en mathématiques et informatique théorique.

Abonnez-vous à ForkLog sur les réseaux sociaux

Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE

Voir l’article original en russe

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !