
J'ai suivi le Course de modèles IA assez près pour savoir que les annonces ont commencé à se brouiller. Toutes les quelques semaines, un autre laboratoire lâche quelque chose décrit comme définissant les frontières, les benchmarks circulent pendant une journée, les comparaisons sont publiées, puis la version suivante arrive avant que quiconque ait fini de traiter la précédente. Cela ressemble moins à une course qu’à un flou.
Mais quelque chose a changé cette semaine qui m’a fait m’arrêter et vraiment y prêter attention. Trois des modèles les plus performants au monde, Grok 4.5 de SpaceXAI, Fable 5 d'Anthropic et OpenAI GPT-5.5, se sont affrontés dans un véritable test de développeur avec un résultat réel que vous pouviez regarder et juger. Les résultats m'ont surpris. Et puis, avant même que cette comparaison ait fini de circuler, OpenAI a lancé GPT-5.6 et un nouvel agent autonome appelé ChatGPT Work, et la situation a encore changé.
Voilà à quoi ressemble réellement, de l’intérieur, la guerre de l’IA de cinquième génération. Pas une séquence propre de versions. Un sprint simultané et superposé où les laboratoires avancent plus rapidement que quiconque ne peut évaluer pleinement ce qui existe déjà.
Le test de construction de jeu que personne ne s'attendait à ce que Grok 4.5 gagne
Je veux commencer ici parce que c’est l’élément de preuve le plus concret de cet article, et celui qui m’a le plus pris au dépourvu. Code de commande a effectué une évaluation directe en utilisant la commande /design avec exactement la même invite sur les trois modèles, demandant à chacun de créer un jeu à partir de zéro dans des conditions identiques.
Je m'attendais à ce que Fable 5 gagne. Il est en tête sur la plupart des critères de référence en matière de renseignement général que j'ai vus, et ses performances en matière de travail de connaissances agentiques ont été constamment solides dans les évaluations indépendantes. Ce qui s’est réellement passé était différent. Grok 4.5 a produit quelque chose qui se joue véritablement comme un jeu mobile raffiné. Pas un prototype, pas une démo avec des aspérités, quelque chose qui semblait réfléchi et terminé. Fable 5 et GPT-5.5 sont tous deux sortis pressés. Fonctionnel, oui. Mais il manque le genre de finition qui sépare quelque chose que vous expédieriez réellement de quelque chose que vous auriez besoin de retravailler considérablement avant de le montrer à qui que ce soit.
Le classement final sur l'expérience et les fonctionnalités des développeurs est le suivant : Grok 4,5 à 9 sur 10, Fable 5 à 7,5 et GPT-5,5 à 7. Pour un modèle qui mène déjà de loin en termes de rentabilité, être également en tête du classement de qualité lors d'un test de construction pratique est une combinaison que je n'avais pas vue venir. Cela a changé ma façon de voir la place réelle de Grok 4.5 dans cette compétition.
Pourquoi « trop rapide » n'est pas toujours un compliment dans la sortie de l'IA
La critique spécifique de Fable 5 et GPT-5.5 dans le test Command Code, selon laquelle ils se sentaient trop rapides, trop précipités, mérite d'être déballée car elle se perd lorsque nous ne parlons que de scores de référence.
La vitesse de production de l’IA est presque universellement considérée comme un avantage. Inférence plus rapide, latence plus faible, résultats plus rapides. Tout cela est vraiment précieux dans le bon contexte. Mais dans le travail de création et de produit, vitesse sans jugement produit un résultat techniquement complet et inachevé sur le plan expérientiel. Le modèle satisfait aux exigences littérales de l'invite sans appliquer le raffinement itératif qui transforme un prototype fonctionnel en quelque chose de raffiné.
Ce n’est pas une limitation fondamentale des modèles Fable 5 ou GPT-5.5. Tous deux opèrent à la frontière du renseignement général. Ce que le test a révélé est un compromis spécifique dans la façon dont ils abordent cette catégorie de résultats et, en termes d'expérience des développeurs, ce compromis est très important si vous utilisez ces modèles pour créer des éléments que vous avez l'intention d'utiliser réellement. Grok 4.5 a appliqué plus de jugement à la finition, et le résultat reflète visiblement cette différence.
OpenAI répond avec GPT-5.6 et un nouveau produit d'IA
Je serai honnête sur ma réaction quand OpenAI a annoncé GPT-5.6 et ChatGPT Work la même semaine que la comparaison à trois. Mon premier instinct a été que le timing semblait conçu pour détourner l’attention d’un benchmark où OpenAI ne s’imposait pas. Ma deuxième pensée, après avoir lu ce que sont GPT-5.6 et ChatGPT Work, était que la substance derrière l'annonce méritait plus d'attention que cette lecture cynique.
GPT-5.6 est lancé en tant que famille de modèles complète, z Sol, Terra et Luna, déployée simultanément sur ChatGPT, Codex et l'API. Ce n’est pas une version ponctuelle. Il s’agit d’un déploiement coordonné à plusieurs variantes sur l’ensemble de la surface du produit OpenAI. ChatGPT Work s'inscrit au-dessus de ce lancement en tant que produit avec lequel la plupart des gens interagiront en premier. L'agent peut agir sur les applications et les fichiers, rester sur un projet pendant des heures si nécessaire et transformer un objectif déclaré en résultats finals, documents, présentations, analyses, sites et rapports, sans que l'utilisateur ait à énumérer chaque étape du processus.
OpenAI définit cela explicitement comme un passage d’une IA qui répond aux questions à une IA qui permet d’accomplir un vrai travail. Le déploiement reflète une intention de production sérieuse : Pro, Enterprise et Edu sur le Web et mobile aujourd'hui, Plus et Business dans les prochains jours, et tous les forfaits incluant Free sur l'application de bureau dans le monde entier. Ce dernier détail compte plus que ce qu’on lui attribue. Mettre un agent autonome à long terme devant les utilisateurs gratuits est une décision de distribution, pas seulement une décision de produit. OpenAI essaie de faire de ChatGPT Work le cadre par défaut de la façon dont les gens envisagent le travail assisté par l'IA, et c'est ainsi que vous le faites rapidement.
GPT-5.6 Sol occupe la première place dans la référence en matière de physique résistante à la contamination
Analyse artificielle a confirmé quelque chose qui véritablement m'a impressionné quand j'ai regardé les détails. GPT-5.6 Sol aux réglages maximum est désormais le leader sur CritPt, une référence inédite de problèmes de physique de niveau recherche développée par l'Argonne National Laboratory et l'Université de l'Illinois Urbana-Champaign. Les problèmes proviennent de plus de 60 chercheurs répartis dans plus de 30 institutions à travers le monde et, surtout, ils ne sont pas publiés, ce qui signifie que les modèles ne peuvent pas les avoir rencontrés pendant la formation. Il s’agit de l’un des tests de référence les plus résistants à la contamination actuellement disponibles, ce qui rend le résultat plus difficile à expliquer en tant qu’artefact de données d’entraînement.
GPT-5.6 Sol gagne environ cinq points par rapport à GPT-5.5 sur CritPt et bat Claude Fable 5 d'environ quatre points. Je veux faire attention à l’importance que j’accorde à un seul benchmark, même bien conçu. Mais un gain de quatre à cinq points sur une évaluation physique de niveau recherche résistante à la contamination, dans une seule génération de modèle, n’est pas progressif. Il s’agit d’un véritable saut de capacité sur un raisonnement difficile, et cela change ma façon de penser à la position de GPT-5.6 Sol sur la frontière par rapport à ce qui l’a précédé immédiatement.
Où chaque modèle gagne réellement en ce moment
J'ai examiné de nombreuses comparaisons de référence au cours des derniers mois et j'ai développé un réel scepticisme quant à ce qu'une seule évaluation peut vous dire sur son utilité dans le monde réel. Mais lorsque vous empilez le test de construction du code de commande, les classements d'intelligence d'analyse artificielle, les résultats d'AutomationBench et maintenant l'évaluation physique CritPt, une image plus nuancée émerge que n'importe quel classement unique.
Grok 4.5 gagne en termes de rentabilité et de qualité spécifique de la production créative et orientée produit, du moins sur la base de l'évaluation que j'ai trouvée la plus pertinente en pratique cette semaine. Si vous construisez quelque chose qui doit sembler terminé sans post-traitement lourd et que vous souhaitez le faire à une fraction du coût par tâche de Fable 5 ou GPT-5.6, Grok 4.5 est actuellement l'argument le plus fort pour ce choix.
Fable 5 est toujours à la pointe du travail de connaissance agentique et occupe la position de référence globale en matière de renseignement la plus solide qu'elle ait construite au cours des derniers mois. Si votre cas d'utilisation principal est un travail complexe en plusieurs étapes qui nécessite un jugement soutenu dans des contextes longs, l'expérience de Fable 5 dans cette catégorie spécifique de tâches reste celle à battre.
GPT-5.6 Sol a pris la référence en matière de raisonnement frontalier sur des problèmes de recherche en physique difficiles et lance sa campagne de produit la plus agressive à ce jour avec ChatGPT Work. Si le raisonnement frontalier sur des problèmes véritablement nouveaux est la barre par rapport à laquelle vous mesurez, le résultat CritPt de Sol est désormais le point de référence. Et si vous souhaitez une exécution de tâches autonome à long terme intégrée dans un produit auquel toute votre organisation peut accéder, y compris les utilisateurs gratuits, ChatGPT Work est la tentative la plus sérieuse dans cette catégorie à ce jour.
Où se dirige réellement la course à l’IA
Ce à quoi je reviens sans cesse après avoir traité tout cela, c’est que la guerre de l’IA de cinquième génération ne produit pas de vainqueur comme un championnat sportif en produit un. Elle produit une véritable spécialisation à la frontière. Trois laboratoires, trois forces différentes, tous opérant dans une plage de capacités globales plus étroite qu'à aucun autre stade de cette compétition.
Il s’agit en fait d’un résultat plus utile pour ceux qui s’appuient sur ces modèles que ne le serait un seul gagnant dominant. Cela signifie que la question à laquelle vous devez répondre n'est pas de savoir quel modèle est le meilleur, mais plutôt de savoir quels sont les atouts spécifiques de ce modèle qui correspondent au travail que vous essayez réellement d'effectuer. Et cette question, enfin, a une réponse véritablement significative en fonction de vos besoins.
Le rythme des versions cette semaine, la comparaison à trois, l'annonce de GPT-5.6, le lancement de ChatGPT Work, les résultats CritPt, le tout à quelques jours d'intervalle, me disent que la course s'accélère plutôt que de s'installer. Quelle que soit l’apparence de la frontière aujourd’hui, elle sera encore différente le mois prochain. Je surveillerai de près et je soupçonne que la prochaine comparaison sera tout aussi difficile à prédire que celle-ci s’est avérée l’être.
Divulgation : Il ne s’agit pas de conseils en matière de trading ou d’investissement. Faites toujours vos recherches avant d’acheter une crypto-monnaie ou d’investir dans un service. Suivez-nous sur X @nulltxnews