
OpenAI s'est associé à la société d'investissement en cryptographie Paradigm pour lancer EVMbench, une nouvelle référence qui teste dans quelle mesure les agents d'IA peuvent sécuriser des contrats intelligents de type Ethereum. Le système vérifie les modèles pour détecter les vulnérabilités réelles et vise à faire de l'IA un outil sérieux pour vérifier le code DeFi, qui protège désormais plus de 100 milliards de dollars d'actifs.
Comment EVMbench teste l'IA par rapport aux erreurs réelles des contrats intelligents
EVMbench exploite 120 vulnérabilités hautement critiques collectées à partir de 40 audits professionnels et examens de sécurité, y compris des cas de la blockchain Tempo de Paradigm. Au lieu de puzzles de jouets, chaque tâche reflète de véritables audits de concours comme Code4rena et des examens internes des contrats de production.
Le benchmark s'exécute dans un environnement EVM en bac à sable, permettant aux agents d'interagir avec le bytecode en direct sans toucher aux fonds du réseau principal. Il utilise trois modes : Détecter, où l'IA vérifie le code et récupère les erreurs connues ; « Patch », où elle suggère des correctifs sans affecter la logique ; et « Exploit », où elle enchaîne les attaques pour extraire des fonds dans un environnement local contrôlé.
Selon les premiers résultats, le codex GPT 5.3 d'OpenAI a atteint un taux de réussite d'environ 72 % en mode exploit, contre environ 32 % pour la référence précédente GPT 5.0. Le fait que les modèles ne puissent pas identifier complètement tous les problèmes et créer des solutions fiables montre qu’il existe un écart entre la puissance offensive et la couverture défensive.
Pourquoi OpenAI et Paradigm ont maintenant développé le benchmark
Selon OpenAI et Paradigm, ils ont développé EVMbench en réponse aux précédentes attaques DeFi telles que les incidents Moonwell et CrossCurve, qui ont entraîné ensemble plus de 86 millions de dollars de pertes de pirates informatiques en janvier 2026. L'importance d'outils de défense améliorés est soulignée par des recherches d'Anthropic et d'autres montrant que l'IA peut réduire le coût et les efforts de planification des attaques.
En standardisant la manière dont les agents d'IA évaluent la sécurité des contrats intelligents, EVMbench fournit aux développeurs et aux auditeurs une référence commune au lieu de tests privés dispersés. OpenAI a également fourni d'importants crédits API pour soutenir l'utilisation défensive de ses modèles, en particulier pour les projets open source et les infrastructures critiques.
Pour les équipes DeFi, EVMbench fournit un moyen de vérifier si les assistants IA peuvent réellement trouver et corriger les mêmes erreurs qui sont importantes pour les auditeurs humains. Les projets peuvent exécuter des modèles via le benchmark avant de les soumettre à des audits de production ou de les intégrer dans des pipelines de surveillance continue.
EN SAVOIR PLUS: Coinbase ajoute XRP, DOGE, ADA et LTC à son service de prêt crypto américain
Voir l’article original en allemand
