
OpenAI a introduit un nouveau système appelé EVMbench, conçu pour mesurer dans quelle mesure les agents d'intelligence artificielle peuvent trouver et corriger les failles de sécurité dans les contrats intelligents cryptographiques.
Résumé
- OpenAI a introduit EVMbench, un nouveau framework conçu pour mesurer dans quelle mesure les agents d'IA peuvent détecter, corriger et exploiter les vulnérabilités des contrats intelligents.
- Développé avec Paradigm, le benchmark s'appuie sur des données d'audit réelles et se concentre sur des scénarios de sécurité pratiques et à haut risque.
- Les premiers résultats montrent de nets progrès dans les tâches d’exploitation, tandis que la détection et l’application de correctifs restent difficiles.
La société a annoncé le 18 février avoir développé EVMbench en partenariat avec Paradigm. Le benchmark se concentre sur les contrats construits pour la machine virtuelle Ethereum et vise à tester les performances des systèmes d'IA dans des contextes financiers réels.
OpenAI a déclaré que les contrats intelligents sécurisent actuellement plus de 100 milliards de dollars d'actifs cryptographiques open source, ce qui rend les tests de sécurité de plus en plus importants à mesure que les outils d'IA deviennent plus performants.
Tester comment l'IA gère les risques de sécurité réels
EVMbench évalue les agents IA sur trois tâches principales : détecter les vulnérabilités, corriger le code défectueux et mener des attaques simulées. Le système est construit à partir de 120 problèmes à haut risque tirés de 40 audits de sécurité antérieurs, dont beaucoup proviennent de concours d'audit public.
Des scénarios supplémentaires ont été tirés d'examens de la blockchain Tempo, un réseau axé sur les paiements conçu pour une utilisation stable. Ces cas ont été ajoutés pour refléter la manière dont les contrats intelligents sont utilisés dans les applications financières.
Pour créer l'environnement de test, OpenAI a adapté les scripts d'exploitation existants et en a créé de nouveaux si nécessaire. Tous les tests d'exploit s'exécutent sur des systèmes isolés plutôt que sur des réseaux actifs, et seules les vulnérabilités précédemment divulguées sont incluses.
En mode détection, les agents examinent le code du contrat et tentent d'identifier les failles de sécurité connues. En mode patch, ils doivent corriger ces failles sans casser le logiciel. En mode exploit, les agents tentent de drainer les fonds des contrats vulnérables dans un environnement contrôlé.
Premiers résultats et impact sur l’industrie
OpenAI a déclaré qu'un cadre de test personnalisé a été développé pour garantir que les résultats peuvent être reproduits et vérifiés.
L'entreprise a testé plusieurs modèles avancés à l'aide d'EVMbench. En mode exploit, GPT-5.3-Codex a obtenu un score de 72,2 %, contre 31,9 % pour GPT-5, publié six mois plus tôt. Les scores de détection et de correction étaient inférieurs, ce qui montre que de nombreuses vulnérabilités sont encore difficiles à gérer pour les systèmes d’IA.
Les chercheurs ont observé que les agents étaient plus performants lorsque les objectifs étaient clairs, comme drainer des fonds. Les performances diminuaient lorsque les tâches nécessitaient une analyse plus approfondie, comme l'examen de bases de code volumineuses ou la correction de bugs subtils.
OpenAI a reconnu qu'EVMbench ne reflète pas pleinement les conditions du monde réel. De nombreux grands projets de cryptographie font l’objet d’examens plus approfondis que ceux inclus dans l’ensemble de données. Certaines attaques basées sur le timing et multi-chaînes sortent également du champ d'application du système.
La société a déclaré que l’indice de référence visait à soutenir l’utilisation défensive de l’IA en matière de cybersécurité. À mesure que les outils d’IA deviennent plus puissants, ils pourraient être utilisés à la fois par des attaquants et par des auditeurs. Mesurer leurs capacités est considéré comme un moyen de réduire les risques et d’encourager un déploiement responsable.
Parallèlement à cette publication, OpenAI a déclaré qu'elle étendait ses programmes de sécurité et investissait 10 millions de dollars en crédits API pour soutenir la protection de l'open source et de l'infrastructure. Tous les outils et ensembles de données EVMbench ont été rendus publics pour soutenir des recherches ultérieures.
Voir l’article original en anglais
