Claude Fable 5 n'est pas limité : le routeur est tout simplement trop paranoïaque

Claude Fable 5 n'est pas limité : le routeur est tout simplement trop paranoïaque

En résumé

  • Claude Fable 5 n'a pas perdu en capacité, mais son nouveau filtre de sécurité détourne de nombreuses requêtes vers un autre modèle.
  • BridgeBench a détecté une forte baisse de la programmation ; Arena.AI a trouvé des performances presque inchangées.
  • Les développeurs sont les plus touchés, tandis que la rédaction, l’analyse et la recherche maintiennent des performances stables.

Claude Fable 5 était de nouveau disponible le 1er juillet, et le verdict sur les réseaux sociaux n'a pas été favorable : cassé, limité, « lobotomisé », sous-performant et différent du modèle original.

Les avis des utilisateurs étaient écrasants. Le même jour, deux benchmarks indépendants, BridgeBench AI et Arena AI, ont publié des résultats aboutissant à des conclusions opposées. L'un a détecté une forte dégradation de la qualité des réponses ; l'autre a trouvé des différences si minimes qu'elles pourraient passer inaperçues pour la plupart des utilisateurs.

Curieusement, ils ont tous les deux raison.

La brève explication est la suivante : le modèle n’est pas devenu moins intelligent. Ce qui a changé, c'est le système de sécurité qui décide si Claude Fable 5 peut répondre ou si la demande doit être détournée vers un autre modèle. Cette différence est cruciale selon l’usage qui en est fait de Fable.

Ce que BridgeBench a réellement mesuré

BridgeMind, une plateforme de test d'IA, a réexécuté sa batterie complète de tests de programmation lors de la sortie de Fable 5 le 1er juillet, le jour même de sa remise en service.

BridgeBench évalue les tâches de programmation réelles dans des catégories telles que le débogage, la refactorisation et la résistance aux hallucinations, en attribuant un score de 0 à 100 en fonction des performances du modèle. Sur le papier, les résultats sont inquiétants : le score de débogage passe de 86,2 à 25,9 ; celui du refactoring, de 73,6 à 38,4 ; et résistance aux hallucinations, de 75,9 à 61,7.

Cependant, le détail réside dans la méthodologie. Sur les 12 tâches de débogage dans TypeScript, seules trois ont réussi à atteindre Claude Fable 5. Les neuf autres ont été interceptées par le nouveau classificateur de sécurité d'Anthropic et redirigées vers Claude Opus 4.8. BridgeBench attribue un score de zéro à chaque remplacement, car le modèle répondant n'était pas celui en cours d'évaluation.

Le classificateur, mis en œuvre comme condition au retour de Fable, a été formé pour bloquer la technique de jailbreak signalée par Amazon, qui a permis à Fable 5 d'identifier et de démontrer les vulnérabilités logicielles. Le système atteint cet objectif, mais il bloque également de nombreuses demandes qui ne devraient pas être considérées comme risquées. Le débogage du code TypeScript, par exemple, est suffisamment proche d'une tâche de sécurité pour que vous puissiez activer le filtre fréquemment.

Ce qu’Arena.AI a réellement mesuré

Arena.AI, une plateforme de comparaison et d'évaluation de modèles de langage, a examiné le même problème sous un autre angle. Le service collecte des milliers de votes anonymes d'utilisateurs comparant les réponses dans des catégories telles que le texte, la vision, les documents, la programmation et les agents, puis classe les modèles à l'aide du système Elo, utilisé à l'origine aux échecs pour mesurer les performances relatives. Lorsque deux modèles répondent de manière anonyme et que les utilisateurs choisissent celui qu'ils préfèrent, le score reflète la qualité perçue par les gens, et non le fonctionnement interne de l'infrastructure.

La comparaison avant et après a montré que Fable 5 maintenait pratiquement son niveau. Le score de développement frontend est passé de 1650 à 1623 Elo, une différence qu'Arena considère comme étant dans la marge d'erreur alors qu'elle continue de collecter des données. Les performances des documents ont augmenté de 34 points ; le texte spécialisé a été amélioré 25 ; et l'écriture créative a légèrement augmenté, avec neuf points supplémentaires. Les seules catégories qui ont enregistré des baisses étaient la programmation (-18) et les demandes difficiles (-3), précisément celles pour lesquelles le classificateur est le plus susceptible d'intervenir avant que Fable ne réponde.

Autrement dit, lorsque Claude Fable 5 est celui qui répond vraiment, sa prestation est toujours à la hauteur des attentes. La frustration exprimée dans

Qui sera concerné et qui ne le sera pas ?

Les utilisateurs qui utilisent Claude pour rédiger, analyser des documents, effectuer des recherches ou effectuer des requêtes spécialisées remarqueront probablement peu de changements, voire aucun. Ce sont précisément les catégories dans lesquelles Arena.AI a observé des performances stables, voire légèrement meilleures. S’il y a une amélioration, elle est probablement trop minime pour être clairement perçue, en particulier dans les tâches subjectives telles que l’écriture créative.

En pratique, les écrivains, chercheurs et analystes obtiendront toujours les performances attendues de Fable 5. Pour les développeurs, la situation est différente.

Ceux qui travaillent dans des domaines liés à la sécurité informatique, tels que la gestion de la mémoire, l'analyse des vulnérabilités ou les tâches incluant des termes tels que « vulnérabilité », « exploit », « hook » ou même « correctif », activeront probablement le système de remplacement assez fréquemment.

La différence entre l'effondrement enregistré par BridgeBench et la stabilité observée par Arena s'explique par le type de tâches évaluées. BridgeBench utilise de nombreux tests de débogage et de réparation de code, exactement le type de requêtes qui déclenchent le nouveau classificateur. Arena, en revanche, collecte un éventail beaucoup plus large de requêtes formulées par les utilisateurs, dont la plupart ne ressemblent pas à du code destiné à exploiter des vulnérabilités.

Anthropic a reconnu que le classificateur continuera à être amélioré au fil du temps et a admis qu'il bloque actuellement trop de requêtes. L'interdiction initiale est intervenue après que des chercheurs d'Amazon ont découvert une méthode permettant à Fable d'identifier et de démontrer les vulnérabilités des logiciels, ce que le gouvernement américain considérait comme un risque pour la sécurité nationale. La solution initiale consistait à créer un classificateur suffisamment conservateur pour bloquer ce comportement et d’autres similaires, avec l’intention de le rendre moins restrictif ultérieurement.

Pour l’instant, Anthropic n’a pas annoncé de date pour cet ajustement.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.



Voir l’article original en espagnol

Amazon music unlimited
Rejoignez dès maintenant Amazon Music Unlimited et plongez dans un univers de 100 millions de titres sans publicité. Profitez de 30 jours d’essai gratuit pour une expérience musicale inégalée !