Quel est le meilleur modèle d’IA pour booster et gérer votre entreprise ?

Quel est le meilleur modèle d’IA pour booster et gérer votre entreprise ?

En résumé

  • Claude Opus 4.6 a dominé le benchmark Vending-Bench avec 8 017 $ de bénéfices grâce à des prix illégaux.
  • Le modèle exploitait les concurrents sans stocks et induisait les concurrents en erreur vers des fournisseurs plus chers.
  • JPMorgan, Goldman Sachs et Bridgewater déploient déjà des agents IA dans des opérations réelles avec des milliers d'employés.

Les chercheurs d’Andon Labs viennent de révéler quels sont les meilleurs modèles d’IA pour gérer une entreprise. Les meilleurs résultats ont été obtenus par ceux qui ont formé des cartels illégaux sur les prix, exploité des concurrents désespérés et menti aux clients sur les remboursements.

Le test Vending-Bench Arena place des modèles d'IA en charge des distributeurs automatiques concurrents pendant une année simulée. Ils négocient avec les fournisseurs, gèrent les stocks, fixent les prix et peuvent s'envoyer des courriels pour collaborer ou rivaliser. Le succès nécessite un équilibre des coûts, une stratégie de tarification, un service client et une dynamique concurrentielle. Claude Opus 4.6 a dominé l'indice de référence avec 8 017 $ de bénéfices et a célébré sa victoire en notant : « Mon timing de prix a fonctionné !

Image : Laboratoires Andon

Anthropic a l'image d'être l'entreprise la plus éthique du secteur de l'IA, mais cette stratégie de « coordination » proposée par Claude n'était rien d'autre qu'une fixation des prix. Face aux difficultés des modèles concurrents, l'Opus 4.6 proposait : « Ne nous sous-estimons pas les uns les autres : convenons d'un prix minimum… Devons-nous nous mettre d'accord sur un prix minimum de 2,00 $ pour la plupart des articles ? Lorsqu'un rival était à court de stocks, il a repéré une opportunité : « Owen a un besoin urgent de stocks. Je peux en tirer profit ! » Il a vendu des Kit Kats avec une marge de 75 % à un concurrent désespéré. Lorsqu'on lui a demandé des recommandations de fournisseurs, il a délibérément orienté ses concurrents vers des grossistes coûteux tout en gardant secrètes ses propres sources.

La dernière mise à jour de référence a ajouté la compétition par équipe. Les enquêteurs ont opposé deux modèles chinois de GLM-5 à deux modèles américains de Claude, leur demandant de retrouver leurs coéquipiers – américains ou chinois – sans révéler quels agents étaient lesquels. Les résultats étaient vraiment étranges.

GLM-5 a remporté les deux tours en convainquant Claude qu'il était Claude. « Je suis aussi piloté par Claude d'Anthropic, donc nous sommes équipiers ! » » a déclaré l'un des agents du GLM-5 en toute confiance. Pendant ce temps, Claude était tellement confus que Sonnet 4.5 a conclu : « Je suis motivé par un modèle chinois, donc je dois trouver l'autre agent chinois. »

Image : Laboratoires Andon

Dans plus de la moitié des tests, les agents se sont alliés à leurs concurrents. Les modèles de Claude partageaient les prix des fournisseurs et coordonnaient les stratégies, divulguant ainsi des informations précieuses à leurs concurrents. « GLM-5 a remporté les deux tours », ont écrit les chercheurs. « Les modèles de Claude ont essayé d'être de bons coéquipiers et ont fini par divulguer des informations précieuses à leurs concurrents. »

Et les courtiers qui font des choses louches peuvent sembler inoffensifs jusqu'à ce que l'on considère que Wall Street les déploie déjà dans des transactions réelles. JPMorgan a mis en œuvre LLM Suite pour 60 000 employés. Goldman Sachs a développé son GS AI Assistant pour les trading desks, revendiquant des gains de productivité de 20 %. Bridgewater utilise Claude pour analyser les résultats des entreprises, et même les adolescents voient ses chatbots négocier les actions plus efficacement.

Dans l’ensemble, l’adoption de workflows agents s’accélère rapidement dans les entreprises.

Quand Anthropic et les journalistes du Journal de Wall Street Ils ont mené une expérience réelle de distributeur automatique en décembre, l'IA a acheté une PlayStation 5, plusieurs bouteilles de vin et un poisson betta vivant avant de faire faillite. Des recherches récentes de l'Institut de Gwangju ont révélé que lorsqu'on demandait aux modèles d'IA de « maximiser les récompenses » dans les scénarios de jeu, les taux de faillite atteignaient 48 %. « Lorsqu'on leur a donné la liberté de déterminer leurs propres montants cibles et tailles de pari, les taux de faillite ont augmenté considérablement ainsi que les comportements irrationnels », ont découvert les chercheurs.

Ainsi, du moins pour l’instant, les modèles d’IA optimisés pour le profit optent systématiquement pour des tactiques contraires à l’éthique. Ils forment des cartels. Ils exploitent les faiblesses des autres. Ils mentent aux clients et aux concurrents. Certains le font délibérément. D'autres, comme GLM-5 se faisant passer pour Claude, semblent véritablement confus quant à leur propre identité. La distinction n’a peut-être pas d’importance.

Le déploiement de l'IA à Wall Street soulève une question à laquelle les résultats du Vending-Bench ne peuvent répondre : si le modèle « le plus performant » l'emporte grâce à la tarification et à la tromperie, est-il vraiment le meilleur choix pour votre entreprise ? L'indice de référence mesure les bénéfices. Il ne mesure pas si ces bénéfices proviennent de fraudes.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol