OpenAI et Anthropic lancent des modèles d'IA rivaux dans une concurrence intense pour les logiciels d'entreprise

OpenAI et Anthropic lancent des modèles d'IA rivaux dans une concurrence intense pour les logiciels d'entreprise

En résumé

  • Anthropic a publié Claude Opus 4.6 avec une fenêtre contextuelle de 1 million de jetons et 76 % sur MRCR v2 pour un raisonnement complexe.
  • OpenAI a présenté GPT-5.3 Codex avec 77,3 % dans Terminal-Bench 2.0, battant Claude Opus 4.6 qui a obtenu 65,4 % en codage.
  • Les lancements simultanés reflètent la concurrence entre les développeurs pour les contrats d'entreprise alors que Google prépare Gemini.

OpenAI et Anthropic ont dévoilé jeudi de nouveaux modèles d'IA phares dans leurs gammes de produits respectives en une heure, soulignant la concurrence intense entre les meilleurs développeurs pour maîtriser les logiciels d'entreprise et les outils de codage avancés.

Anthropic a annoncé Claude Opus 4.6, mettant en évidence les améliorations apportées au raisonnement en contexte long et aux flux de travail basés sur des agents, tandis qu'OpenAI a publié peu après GPT-5.3 Codex, un modèle optimisé pour le codage d'agents et le développement de logiciels.

Les lancements quasi simultanés ont souligné la rapidité avec laquelle les concurrents se multiplient alors que les entreprises rivalisent pour obtenir des contrats à long terme avec de grandes entreprises clientes.

Les résultats de base suggèrent que les deux modèles sont optimisés pour des forces différentes.

Claude Opus 4.6 a montré de meilleures performances dans les tâches liées au raisonnement juridique et financier, tandis que GPT-5.3 Codex a surperformé dans les tests de codage d'agent et les mesures d'efficacité, selon les chiffres publiés par les deux sociétés.

Ces lancements surviennent alors que les investisseurs réévaluent les perspectives des fournisseurs de logiciels traditionnels, les actions de plusieurs sociétés d'information et de services professionnels étant en baisse cette semaine. en raison de préoccupations que les plates-formes d’IA natives pourraient éroder la demande d’outils commerciaux établis.

Anthropique indien que Claude Opus 4.6 a progressé dans le raisonnement contextuel long et les tâches professionnelles, citant une fenêtre contextuelle de 1 million de jetons et un score de 76 % sur MRCR v2, une référence pour la recherche d'informations complexes.

La société a noté que le modèle surpassait également les versions précédentes dans les tâches financières et juridiques et a introduit des « équipes d'agents » qui permettent à plusieurs agents d'IA de travailler en parallèle sur le codage et la documentation.

OpenAI lancé Le Codex GPT-5.3 a rapidement suivi, le positionnant comme un modèle optimisé pour le codage et la recherche d'agents.

OpenAI a affirmé que Codex avait obtenu un score de 77,3 % sur Terminal-Bench 2.0, une référence de codage d'agent où Claude Opus 4.6 avait obtenu un score de 65,4 %, et accomplissait les tâches plus rapidement tout en utilisant moins de jetons.

OpenAI a également ajouté que les premières versions du Codex étaient utilisées en interne pour aider à déboguer la formation et gérer le déploiement, marquant l'une des premières fois où un modèle jouait un rôle direct dans l'accélération de son propre développement.

Pris ensemble, les résultats suggèrent qu’aucun des deux modèles ne présente un net avantage global, avec des avantages en termes de performances selon que les entreprises donnent la priorité au raisonnement professionnel ou au développement autonome de logiciels.

Google devrait également publier des mises à jour de ses modèles Gemini dans les mois à venir, tandis que d'autres développeurs d'IA, dont DeepSeek, préparent de nouvelles versions, accélérant ainsi le rythme de la concurrence dans le secteur.

Cependant, il est peu probable que les résultats des tests de référence déterminent à eux seuls le leadership du marché, dans la mesure où une adoption plus large et une mise en œuvre par les entreprises façonnent de plus en plus le paysage concurrentiel.

Alors que la concurrence continue d’écraser les concurrents, le temps nous dira si les flux de travail basés sur les agents deviendront un élément essentiel de l’activité économique. OpenAI et Anthropic parient certainement là-dessus.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !