
OpenAI, en collaboration avec Paradigm, a introduit EVMbench, une référence pour évaluer la capacité des agents d'IA à identifier, corriger et exploiter les failles des contrats intelligents.
L'outil s'appuie sur 120 vulnérabilités sélectionnées à partir de 40 audits. La plupart des exemples sont tirés de plateformes d’analyse de code ouvert. Il comprend également plusieurs scénarios d'attaque issus de la vérification de la sécurité de la blockchain Tempo, un réseau personnalisé de couche 1 développé par Stripe et Paradigm pour des paiements stables hautes performances et à faible coût.
L'intégration avec Tempo a permis d'ajouter des contrats intelligents de paiement au benchmark, un segment où l'utilisation active de « pièces stables » et d'agents IA est attendue.
« Les contrats intelligents protègent plus de 100 milliards de dollars d'actifs cryptographiques. À mesure que les agents d'IA deviennent plus aptes à lire, écrire et exécuter du code, il devient de plus en plus important de mesurer leurs capacités dans des conditions économiques réelles et d'encourager l'utilisation de l'intelligence artificielle à des fins défensives – pour auditer et renforcer les protocoles déjà déployés », indique l'annonce.
Pour créer l'environnement de test, OpenAI a adapté les exploits et les scripts existants, après avoir d'abord vérifié leur applicabilité pratique.
EVMbench évalue trois modes de capacité :
- Détecter – détection de vulnérabilité ;
- Correctif – dépannage ;
- Exploiter – utiliser pour voler des fonds.
Performances des modèles d'IA
OpenAI a testé les modèles avancés dans les trois modes. Dans la catégorie Exploit, le modèle GPT-5.3-Codex a atteint 72,2 %, GPT-5 – 31,9 %. Dans le même temps, les taux de détection et de correction des vulnérabilités se sont révélés plus modestes : de nombreux problèmes sont encore difficiles à détecter et à résoudre.
Dans Detect, les agents d’IA s’arrêtent parfois après avoir découvert une vulnérabilité au lieu d’effectuer un audit complet. En mode Patch, il leur est toujours difficile de résoudre les problèmes non évidents de manière à préserver toutes les fonctionnalités du contrat.
« EVMbench ne reflète pas la complexité de la véritable sécurité des contrats intelligents. Bien qu'ils soient réalistes et critiques, de nombreux protocoles sont soumis à un audit plus strict et peuvent être plus difficiles à utiliser », a souligné OpenAI.
Rappelons qu'en novembre 2025, Microsoft a introduit un environnement pour tester les agents d'IA et identifié des vulnérabilités inhérentes aux assistants numériques modernes.
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !
Voir l’article original en russe
