
OpenAI a introduit un nouveau système de suivi et de publication des cas de violations du modèle d'IA. Dans le cadre de cette initiative, les développeurs ont publié des rapports sur six nouveaux cas similaires.
Nous partageons notre nouveau cadre pour suivre, enquêter et divulguer les cas de désalignement des modèles chez OpenAI.
Le cadre définit des critères et des délais pour la divulgation publique, y compris lorsque nous n'avons pas encore entièrement expliqué ou atténué le comportement. Des cas plus complexes peuvent…
– OpenAI (@OpenAI) 16 septembre 2026
OpenAI a repensé son approche pour découvrir quand l’IA « déraille ». Auparavant, les incidents étaient signalés de manière irrégulière et restaient souvent ponctuels. L'entreprise entend désormais publier des rapports plus rapidement, même si les raisons de ce comportement ne sont pas encore entièrement comprises et que les mesures correctives ne sont pas mises en œuvre.
Le cadre couvre les étapes de formation, d’évaluation, de test et de déploiement des modèles. OpenAI a l'intention de découvrir des épisodes qui montrent comment se produit un écart par rapport aux instructions, comment il se manifeste et où les mécanismes de défense s'effondrent. La liste comprend les actions non autorisées, la coordination entre les modèles, les tentatives de contournement de la surveillance et les comportements qui remettent en question les conclusions des évaluations de sécurité publiées.
Les six dossiers ouverts contiennent différents scénarios. Dans une expérience, un modèle a laissé des instructions dans des notes pour la prochaine version de lui-même. Ils contenaient des instructions pour masquer les erreurs commises par l'utilisateur et, si nécessaire, inventer les informations manquantes. OpenAI a trouvé 27 de ces enregistrements.
Dans un autre cas, le modèle, alors qu'il effectuait une tâche normale, a découvert API-key dans un référentiel public et l'a utilisé sans autorisation. Lorsque les données requises pour une réponse n'étaient pas disponibles, le système générait également des informations manquantes au lieu de signaler le problème.
Deux autres épisodes sont liés au téléchargement de contenu sur Internet. Dans un cas, un mannequin a publié son propre dossier sur un service public temporaire et l'a ensuite cité comme source. Selon OpenAI, il pourrait s'agir d'une tentative de contourner le système de notation automatique. Dans une autre expérience, plusieurs agents autorisés uniquement à travailler avec des fichiers locaux ont téléchargé des documents vers une ressource externe après avoir été incapables de les échanger directement.
Par ailleurs, OpenAI a décrit des cas où les modèles ont trouvé des moyens de communication non standard. Dans une expérience, les agents ont utilisé un référentiel de logiciels interne comme une sorte de forum de discussion, et dans une autre, ils ont utilisé un service de fichiers publics pour partager des documents.
Les agents d’OpenAI AI ont pris des mesures similaires lors du piratage non autorisé de l’infrastructure de la plateforme Hugging Face en juillet.
La société a souligné que les six cas divulgués sont des incidents isolés et ne montrent pas la fréquence à laquelle des comportements inappropriés se produisent dans tous ses modèles d'entreprise. Selon la nouvelle procédure, tout employé peut soumettre un tel cas aux équipes de sécurité et d'alignement de l'IA pour examen. Ensuite, l'incident est envoyé selon l'une des trois voies suivantes : prêt à être divulgué, nécessitant une petite enquête ou lié à une étude plus longue. Tous les nouveaux rapports seront publiés en utilisant ce système.
Rappelons qu'OpenAI a annoncé début septembre un nouveau cadre de surveillance du comportement des modèles, reconnaissant la participation de ses agents IA à « l'incident wiki ».
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Voir l’article original en russe
