En résumé
- Anthropic a révélé que Claude Fable 5 avait secrètement dégradé ses réponses aux utilisateurs soupçonnés de développer des modèles d'IA rivaux.
- La société s'est excusée et a annoncé que les demandes signalées seraient visiblement redirigées vers Claude Opus 4.8.
- SemiAnalysis a été l'une des premières entreprises à signaler le problème après avoir détecté que ses recherches sur le GPU avaient été interceptées.
Anthropic a passé environ 48 heures en tant que méchant de la semaine de l'industrie de l'IA avant de faire marche arrière.
La société a publié Claude Fable 5 cette semaine pour réagir immédiatement à une mesure de sécurité incluse dans sa carte système de 319 pages : le modèle, le premier de la nouvelle classe Mythos de la société, dégraderait secrètement ses propres réponses aux utilisateurs qu'elle soupçonnait de développer des modèles d'IA concurrents – pas d'avertissement, pas de message de sauvegarde, juste des résultats moins bons. Jeudi, Anthropic s'est excusé.
« Des mesures de sécurité invisibles peuvent être appliquées avec plus de précision, ce qui nous permet de lancer rapidement avec très peu de faux positifs. Nous avons opté pour des mesures de sécurité invisibles pour cette raison – et ce n'était pas un bon équilibre », a posté la société sur X. « Ils devraient avoir une visibilité sur les mesures de sécurité que nous avons mises en place et pourquoi. »
« Nous nous excusons de ne pas avoir trouvé le bon équilibre. »
À partir de cette semaine, les requêtes signalées seront visiblement redirigées vers Claude Opus 4.8, un modèle moins performant, au lieu de fournir silencieusement des résultats Fable dégradés. Les utilisateurs de l'API recevront une raison explicite lorsqu'une demande est rejetée. Anthropic a noté que des notifications de sauvegarde côté serveur seront déployées dans les prochains jours.
Que se passait-il réellement
Pour les lecteurs non avertis, c’est là le véritable sujet de la controverse. Claude Fable 5 disposait déjà de garanties visibles pour la cybersécurité et la recherche en biologie : si vous posiez une question qui déclenchait ces filtres, vous receviez une notification indiquant que votre demande était redirigée vers l'ancien modèle Opus 4.8. Vous saviez que quelque chose avait changé. Vous pouvez ajuster votre invite ou utiliser un autre outil.
Cependant, certains chercheurs en biologie ont souligné que ces mesures étaient trop extrêmes.
Cependant, la mesure de sécurité pour le développement des LLM fonctionnait différemment. Si Fable 5 détectait que vous travailliez sur des éléments tels que la pré-formation de systèmes d'IA, le développement d'une infrastructure de formation distribuée ou la conception de puces d'apprentissage automatique, le modèle modifierait silencieusement son propre comportement (par le biais de modifications rapides, de vecteurs de direction ou d'ajustements de paramètres) pour vous donner une réponse de moindre qualité sans vous en informer. Vous recevrez une réponse. Seulement, ce ne serait pas celui de Fable 5 pour lequel vous avez payé.
Fable 5 se présente comme le visage public du modèle Mythos le plus performant d'Anthropic, et les chercheurs qui l'utilisaient pour des travaux légitimes d'apprentissage automatique n'avaient aucun moyen de savoir que ses résultats étaient entachés. Une expérience ratée est la même, que votre hypothèse soit fausse ou que le modèle ait reçu pour instruction silencieuse de sous-performer. C’est le problème de reproductibilité qui a plongé la communauté de recherche en IA en mode effondrement total.
Le problème était que le classificateur n’était pas très précis. La société de recherche en IA SemiAnalysis a été l’une des premières à le souligner publiquement après avoir vu ses recherches sur l’inférence GPU signalées.
L'inconvénient de la solution
La rectification d'Anthropic s'accompagne d'une reconnaissance directe de l'équilibre qu'il accepte. Rendre les mesures de sécurité visibles facilite leur contournement, ce qui signifie que le classificateur doit étendre sa portée pour rester efficace.
Davantage de faux positifs (des tâches d'apprentissage automatique légitimes qui sont interceptées et redirigées) sont attendues à mesure que l'entreprise ajuste ses systèmes. Anthropic a déclaré qu'elle s'efforçait de réduire les faux positifs « aussi rapidement que possible », mais n'a proposé aucun calendrier.
La société applique également le même processus de remédiation à ses classificateurs de biologie et de cybersécurité, qui ont généré leurs propres plaintes pour avoir signalé des invites de recherche inoffensives.
Cela dit, la préoccupation qui demeure est qu’Anthropic ne supprime pas cette catégorie de restrictions, mais les rend simplement visibles. Pour ceux qui pensent que les restrictions elles-mêmes sont erronées, les excuses présentées jeudi constituent une solution partielle. Fable 5 reste gratuit sur les forfaits Pro, Max, Team et Enterprise jusqu'au 22 juin, après quoi son utilisation deviendra exclusive grâce aux crédits API.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.