L'IA est égale aux marchés de prédiction dans les prévisions d'événements réels: étude

L'IA est égale aux marchés de prédiction dans les prévisions d'événements réels: étude

En résumé

  • Les chercheurs de Sigma Lab ont lancé Prophète Arena en août, une référence qui a montré que les modèles d'IA peuvent prédire les événements futurs similaires aux marchés.
  • GPT-5 a mené le tableau de classification avec une précision de 82,21%, tandis que OpenAI O3-MINI a généré les plus grands rendements lors de la conversion des prédictions en paris simulés.
  • La référence a révélé que les modèles développent des « personnalités » différentes en faisant des prévisions, se divergeant considérablement les unes aux autres, même avec des informations identiques disponibles.

Une nouvelle référence d'intelligence artificielle lancée en août montre que les modèles d'IA peuvent prévoir des événements réels avec la même précision que les marchés de prédiction – parfois mieux, selon les chercheurs de Sigma Lab à l'Université de Chicago.

Prophet Arena évalue les systèmes d'IA, ce qui les fait prédire les résultats d'événements vivants et non résolus extraits de plateformes telles que Kalshi et PolyMarket – qui vont des résultats électoraux aux matchs sportifs et aux indicateurs économiques. Contrairement aux repères traditionnels qui essaient des modèles avec des données historiques avec des réponses connues, le sable du prophète prouve l'IA contre les prédictions futures.

« Lors de l'ancrage des évaluations dans les événements du monde réel sans résoudre, le Prophète Arena garantit des conditions égales. Il n'y a pas d'avantage de pré-formation, il n'y a pas de truc secrète d'ajustement fin, il n'y a pas de filtration d'échantillonnage de fuite », a déclaré l'équipe du Prophète Sand dans la publication officielle du blog de benchmark.

L'indice de référence dit qu'il essaie de répondre à une question fondamentale sur l'intelligence artificielle: « Les systèmes de fièvre peuvent-ils prédire de manière fiable l'avenir reliant les points à travers les informations existantes du monde réel? »

Les premiers résultats suggèrent qu'ils le peuvent. GPT-5 mène actuellement le tableau de classification avec un score de Brier de 82,21%. Pendant ce temps, le modèle O3-Mini d'OpenAI est devenu le champion des bénéfices, générant les rendements moyens les plus élevés lorsque leurs prédictions se traduisent en paris simulés (généralement un étranger avec des possibilités suffisantes de gagner peut fournir beaucoup plus de rendement, compte tenu des conditions appropriées).

Deepseek R1 semble être l'IA inverse du groupe, faisant fréquemment des prédictions qui divergent radicalement à la fois des autres modèles et du consensus du marché, donc ce n'est probablement pas le meilleur modèle de confiance si vous voulez gagner rapidement de l'argent dans une myriade de marchés.

La plate-forme révèle différentes «personnalités» parmi les modèles d'IA lorsqu'elles sont confrontées à des informations identiques. Dans un exemple, en prédisant si la réglementation de l'IA deviendrait la loi fédérale avant 2026, le marché n'a attribué que 25% de probabilité. Mais les modèles ont grandement divergé: Qwen 3 a prédit 75%, GPT-4.1 a estimé 60%, tandis que l'appel 4 Maverick est resté conservateur de 35%.

Dans un autre cas, O3-Mini a remporté un retour à 9 $ simulé dans un pari de 1 $ en prédisant correctement que le Toronto FC battrait le San Diego FC lors d'un match de football de la Major League. Le modèle a donné à Toronto 30% de chances de gagner, tandis que le marché ne l'a évalué en seulement 11%. Toronto a gagné.

« (Prophète Arena) prouve la capacité de pronostic des modèles, une forme élevée d'intelligence qui exige un large éventail de capacités, notamment en compréhension des informations et des sources d'information existantes, en raison de l'incertitude et de la prise de prédictions sensibles au temps sur le développement d'événements », ont écrit les chercheurs.

Prophet Arena permet également la collaboration humaine -IA. Les utilisateurs peuvent fournir des nouvelles et un contexte supplémentaires pour voir comment les prédictions changent, tandis que les modèles IA fournissent des justifications détaillées pour leurs prévisions.

Alors que les marchés de prédiction intègrent IA – Kalshi récemment associé à Grok d'Elon Musk, tandis que PolyMarket génère des résumés du marché entraînés par l'IA – Prophète Arena offre la première comparaison systématique du pronostic de la machine contre l'essai humain collectif.

Et, s'ils deviennent vraiment bons, alors les machines peuvent être purement factuelles, sans sentiments ni émotions jouant un rôle dans les décisions. Ils pourraient potentiellement faire correspondre ou surmonter la sagesse de la foule, modifiant la façon dont les institutions traitent de l'évaluation des risques, des décisions d'investissement et de la planification stratégique.

La plate-forme Prophète Arena continue d'être mise à jour quotidiennement pendant que les événements sont résolus, fournissant une image évolutive de la question de savoir si l'intelligence artificielle peut vraiment prédire l'avenir en connectant les points d'aujourd'hui.

Généralement intelligent Bulletin

À un voyage hebdomadaire sur l'IA raconté par Gen, au modèle générateur d'IA.

Voir l’article original en espagnol

Prime Video sur Amazon.fr
Découvrez un monde infini de divertissement avec Prime Video d’Amazon. Inscrivez-vous dès maintenant pour profiter d’un essai gratuit de 30 jours et plongez dans vos séries et films préférés, où que vous soyez !