GPT-5 ne bat pas les ingénieurs sur leur propre terrain : Datadog expose les limites de l'IA

GPT-5 ne bat pas les ingénieurs sur leur propre terrain : Datadog expose les limites de l'IA

En résumé

  • Datadog et Carnegie Mellon ont publié ARFBench, un benchmark de 750 questions basé sur 63 incidents de production réels pour évaluer les modèles d'IA.
  • GPT-5 était en tête avec une précision de 62,7 %, suivi de Gemini 3 Pro avec 58,1 % et Claude Opus 4.6 avec 54,8 %, tandis que les experts humains ont obtenu 72,7 %.
  • Les chercheurs ont découvert que l’IA et les erreurs humaines se chevauchent à peine, ce qui suggère que la collaboration entre les deux pourrait atteindre une précision de 87,2 %.

Les sociétés d’IA continuent de vanter les mérites des agents d’ingénierie autonomes en matière de fiabilité des sites, des IA qui enquêtent sur les incidents de production plutôt que sur les humains. Datadog a effectué un véritable test de référence sur des pannes réelles, et les meilleurs modèles d'IA ne peuvent toujours pas surpasser les ingénieurs qu'ils sont censés remplacer.

Le benchmark est ARFBench (Anomaly Reasoning Framework Benchmark), un projet commun de Datadog et Carnegie Mellon. Construit à partir de 63 incidents de production réels, extraits des discussions Slack des ingénieurs lors d'urgences en direct : 750 questions à choix multiples couvrant 142 mesures de surveillance et 5,38 millions de points de données, chaque question étant vérifiée manuellement. Aucune donnée synthétique. Pas de scénarios de manuels.

« Des milliards de dollars sont perdus chaque année à cause des pannes du système », écrivent les chercheurs. Le benchmark teste si l’IA peut vraiment aider à changer cela.

« Malgré le rôle central que joue ce type d'analyse basée sur des questions dans la réponse aux incidents, il n'est pas clair si les modèles de fondations modernes peuvent répondre de manière fiable au type de questions sur les séries chronologiques que les ingénieurs posent dans la pratique », note le document.

Les questions sont divisées en trois niveaux. Niveau I : Y a-t-il une anomalie dans ce graphique ? Niveau II : Quand a-t-il commencé, quelle est sa gravité, de quel type s'agit-il ?

Le niveau III, le plus difficile, nécessite un raisonnement entre les métriques : ce graphique est-il à l'origine du problème dans cet autre graphique ? C'est là que l'IA échoue. GPT-5 n'obtient que 47,5 % de F1 sur les questions de niveau III, une mesure qui pénalise les modèles qui tentent de manipuler les réponses en choisissant la classe la plus courante.

« Malgré le rôle central que joue ce type d'analyse basée sur des questions dans la réponse aux incidents, il n'est pas clair si les modèles de fondations modernes peuvent répondre de manière fiable aux types de questions de séries chronologiques que les ingénieurs posent dans la pratique », écrivent les chercheurs.

Comment chaque modèle a fonctionné

GPT-5 a dominé tous les modèles existants avec une précision de 62,7 %, dans un test où les suppositions aléatoires sont de 24,5 %. Gemini 3 Pro a obtenu un score de 58,1 %. Claude Opus 4.6 : 54,8%. Claude Sonnet 4,5 : 47,2 %.

Les experts dans le domaine ont atteint une précision de 72,7 %. Les non-experts (les chercheurs en séries chronologiques chez Datadog sans vaste expérience en observabilité) ont obtenu un score de 69,7 %.

Aucun modèle d’IA n’a dépassé aucun des deux seuils humains.

Image créée par Decrypt basée sur le CSV du classement ARFBench

Le modèle qui arrive en tête de tout le classement était le propre hybride de Datadog : Toto, son modèle interne de prévision de séries chronologiques, combiné avec Qwen3-VL 32B. Toto-1.0-QA-Experimental a atteint une précision de 63,9 %, surpassant GPT-5 en utilisant une fraction de ses paramètres. En identifiant spécifiquement les anomalies, il a surperformé tous les autres modèles d'au moins 8,8 points de pourcentage en F1.

Le résultat attendu est qu’un modèle spécifique à un domaine, entraîné avec des données d’observabilité, surpasse un système frontière à usage général sur cette tâche particulière. C'est le point.

La découverte la plus précieuse n’est pas de savoir quel modèle a obtenu le score le plus élevé.

« Nous avons observé des profils d'erreur très différents entre les principaux modèles et les experts humains, ce qui suggère que leurs atouts sont complémentaires », affirment les chercheurs. Les modèles hallucinent, omettent les métadonnées et perdent le contexte du domaine. Les humains interprètent mal les horodatages précis et bâclent parfois des instructions complexes. Les erreurs se chevauchent à peine.

Si vous modélisez un « Oracle Modèle-Expert » théorique – un juge parfait qui choisit toujours la bonne réponse entre l’IA et l’humain – vous obtenez 87,2 % de précision et 82,8 % de F1. Bien au-dessus de l'un ou l'autre des deux séparément.

Ce n'est pas un produit. Il s'agit d'un objectif documenté, construit à partir de situations d'urgence réelles et non d'ensembles de données organisés, qui quantifie exactement dans quelle mesure une meilleure collaboration entre l'homme et l'IA pourrait être efficace. Le classement est disponible sur Hugging Face. GPT-5 se situe à 62,7 %. Le plafond est de 87,2%.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !