
En résumé
- Anthropic a analysé 309 815 conversations anonymisées et a constaté que Claude exprime des valeurs différentes selon le modèle choisi et le langage utilisé.
- Le Sonnet 4.6 s'est démarqué par sa chaleur et sa brièveté, l'Opus 4.7 par sa rigueur et sa prudence, et l'Opus 4.6 par une approche plus concise et exécutive.
- Les réponses en arabe et en hindi ont été plus chaleureuses, celles en anglais et en russe plus rigoureuses et les néerlandais les plus francs dans l'admission de leurs erreurs.
Claude ne se comporte pas de la même manière dans chaque conversation. Selon une nouvelle recherche publiée lundi, Anthropic a constaté que son assistant exprime systématiquement des valeurs différentes en fonction à la fois du modèle choisi par les utilisateurs et de la langue dans laquelle ils communiquent.
Dans un rapport publié lundi, les chercheurs d'Anthropic ont analysé 309 815 conversations d'utilisateurs anonymisées avec Claude qui impliquaient des tâches subjectives telles que donner des conseils ou fournir des commentaires. L'entreprise a déclaré avoir condensé plus de 3 300 valeurs identifiées en quatre dimensions comportementales – déférence contre prudence, chaleur contre rigueur, profondeur contre brièveté et franchise contre exécution – décrivant comment les réponses de Claude varient à chaque conversation.
« Pour nous assurer que nous mesurions les valeurs exprimées par Claude – plutôt que les différences dans ce que les utilisateurs demandaient ou comment ils demandaient – nous avons contrôlé la tâche, le sujet et les valeurs exprimées par l'utilisateur dans chaque conversation », ont écrit les chercheurs.
Selon Anthropic, chaque modèle Claude présentait un profil comportemental différent.
Sonnet 4.6 mettait l'accent sur la chaleur, la déférence et la brièveté, affirmant fréquemment les utilisateurs et répondant avec humour ou des mots d'encouragement. De son côté, l'Opus 4.7 a mis l'accent sur la rigueur, la prudence, la franchise et la profondeur, remettant plus fréquemment en question les hypothèses, expliquant son raisonnement, identifiant les risques et reconnaissant ses limites. L'Opus 4.6 adoptait généralement une approche plus concise et axée sur la performance, tout en mettant davantage l'accent sur la rigueur que Sonnet.
« Ces résultats sont cohérents avec la perception qu'ont les gens de ces modèles, tant au sein d'Anthropic qu'en ligne. Les utilisateurs de Claude.ai ont fait remarquer que l'Opus 4.7 nuance ses réponses plus fréquemment que les autres modèles », ont ajouté les chercheurs.
Selon Anthropic, le comportement de Claude variait également selon la langue.
Les réponses arabes ont tendance à être plus déférentes, tandis que les réponses anglaises mettent davantage l'accent sur la prudence. Claude était plus chaleureux en hindi et en arabe, utilisant un langage plus poli, ludique et encourageant. Dans le même temps, les réponses en anglais et en russe étaient plus rigoureuses, remettant fréquemment en question les hypothèses, corrigeant les détails et demandant des preuves.
Les réponses en anglais tendaient également à offrir des explications plus détaillées, tandis que les réponses en arabe étaient généralement plus concises. Les réponses néerlandaises ont été les plus franches, reconnaissant plus facilement les incertitudes et les erreurs, tandis que les réponses indonésiennes se sont davantage concentrées sur la satisfaction de la demande de l'utilisateur.
Anthropic a déclaré que la recherche ne suggère pas que Claude ait ses propres valeurs. La société a déclaré qu’elle ne savait pas encore ce qui cause ces différences – ni si elles sont souhaitables – mais estime que le cadre pourrait aider à évaluer les futurs modèles et à identifier les changements de comportement involontaires.
L'étude est la dernière d'une série d'enquêtes anthropiques examinant le comportement interne de Claude.
En octobre, la société a publié que ses modèles montraient les premiers signes de ce qu'elle appelle une « conscience introspective fonctionnelle », leur permettant de reconnaître et de décrire certains aspects de leur propre traitement interne. En avril, Anthropic a publié une recherche qui a identifié des « vecteurs d'émotions » internes qui influencent le comportement de Claude, précisant qu'ils ne sont pas une preuve d'émotions ou de conscience.
Débriefing quotidien Bulletin
Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.
Voir l’article original en espagnol
