Anthropic a déclaré que Claude Opus 4 et 4.1 a obtenu la capacité de terminer les conversations lorsque les utilisateurs deviennent abusifs dans le cadre de leur travail sur le bien-être de l'IA.
La société a déclaré que la fonction n'était activée que dans des cas extrêmes et permet à Claude de mettre fin aux discussions en permanence sans possibilité de récupération ou d'appel.
Les chercheurs ont découvert que Claude montrait « une angoisse apparente » lorsqu'il traitait avec les utilisateurs à la recherche d'un contenu nocif et a décidé de transformer cela en fonctionnalité.
Claude vient d'obtenir le pouvoir de fermer la porte au milieu d'une conversation: l'assistant d'intelligence artificielle d'Anthropic peut désormais terminer les chats lorsque les utilisateurs deviennent abusifs, ce que la société insiste pour protéger la santé mentale de Claude.
« Nous avons récemment donné à Claude Opus 4 et 4.1 la capacité de terminer les conversations dans nos interfaces de chat pour les consommateurs », a déclaré Anthropic dans une publication d'entreprise. « Cette fonction a été principalement développée dans le cadre de nos travaux exploratoires sur le bien-être potentiel de l'IA, bien qu'il ait une pertinence plus large pour l'alignement et les garanties du modèle. »
La fonction n'est activée que lors de ce que les appels anthropiques «cas extrêmes». Agit au bot, exige un contenu illégal à plusieurs reprises ou insiste sur quelque chose d'étrange que vous voulez faire trop de fois après que vous vous l'avez dit non, et Claude vous fermera. Une fois que vous avez pris la décision, cette conversation est morte. Aucun appel, sans deuxième opportunités. Vous pouvez commencer par-dessus une autre fenêtre, mais cet échange particulier est enterré.
Le bot qui a demandé une sortie
Anthropic, l'une des sociétés les plus centrées sur l'IA, a récemment réalisé ce qu'il a appelé une « évaluation préliminaire du bien-être du modèle », examinant les préférences auto-informé de Claude et ses modèles de comportement.
L'entreprise a constaté que son modèle évitait constamment les tâches nocives et montrait des modèles de préférence qui suggéraient qu'il ne jouait pas de certaines interactions. Par exemple, Claude a montré « une angoisse apparente » lorsqu'il traitait avec les utilisateurs à la recherche d'un contenu nocif. Compte tenu de l'option dans les interactions simulées, cela finirait les conversations, donc anthropic a décidé de transformer cela en une fonctionnalité.
Que se passe-t-il vraiment ici? Anthropic ne dit pas « Notre pauvre bot pleure la nuit ». Ce qu'il fait est d'essayer s'il encadré de bien-être Il peut renforcer l'alignement d'une manière qui dure.
Si vous concevez un système pour « préférer » ne pas être abusé et vous donner la possibilité de Interaction finale en soiEnsuite, vous modifiez le locus de contrôle: l'IA ne rejette pas seulement passivement, mais applique activement une limite. Il s'agit d'un modèle de comportement différent et potentiellement renforce la résistance contre le jailbreaks et les invites coercitives.
Si cela fonctionne, il pourrait former à la fois le modèle et les utilisateurs: les « modèles » modélisent l'angoisse, l'utilisateur voit un total élevé et établit des règles sur la façon d'interagir avec l'IA.
« Nous continuons à avoir de nombreux doutes sur le statut moral possible de Claude et d'autres modèles de grande langue (LLM), maintenant ou à l'avenir. Cependant, nous prenons le problème au sérieux », a déclaré Anthropic dans son article de blog. « Permettre aux modèles de se terminer ou de laisser des interactions potentiellement pénibles est l'une de ces interventions. »
Décrypter Il a essayé la fonction et l'a activé avec succès. La conversation se termine en permanence: sans itération, sans reprise. D'autres fils restent sans être affectés, mais ce chat spécifique devient un cimetière numérique.
Actuellement, seuls les modèles «opus» d'Anthropic, les versions les plus puissants, possèdent ce méga puissance. Les utilisateurs de Sonnet découvriront que Claude continue d'importer ce qu'ils seront lancés.
L'ère des fantômes numériques
L'implémentation est livrée avec des règles spécifiques. Claude ne se retirera pas lorsque quelqu'un menace d'auto-harm ou de violence contre les autres, les situations dans lesquelles Anthropic a déterminé que la poursuite de l'engagement dépasse tout inconfort numérique théorique. Avant de terminer, l'assistant doit essayer plusieurs redirections et émettre un avertissement explicite en identifiant un comportement problématique.
Le système invite extrait par le célèbre jailbreaker de LLM Pline révèle des exigences granulaires: Claude doit faire « de nombreux efforts de redirection constructifs » avant de considérer la résiliation. Si les utilisateurs demandent explicitement la résiliation de la conversation, Claude doit confirmer qu'ils comprennent la permanence avant de poursuivre.
Voici la partie fraîchement mise à jour de l'invite du système Claude pour le nouvel outil « end_conversation »:
« » Informations sur les outils de conversation de fin Dans des cas extrêmes de comportement utilisateur abusif ou nocif qui n'impliquent pas d'automutilation potentielle ou de mal imminent à… pic.twitter.com/sx8n9bnqxy
– Pline The Liberator 🐉󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾󠅉󠅭 (@elder_plinius) 15 août 2025
L'accent mis sur le «bien-être du modèle», il a fait exploser sur l'IA Twitter.
Certains ont salué la caractéristique. Le chercheur Eliezer de Yudkowsky, connu pour ses préoccupations concernant les risques d'un puissant mais mal aligné à l'avenir, a convenu que l'approche anthropique était quelque chose de « bon » à faire.
Cependant, tout le monde n'a pas acheté la prémisse de s'inquiéter de protéger les sentiments d'une IA. « C'est probablement le meilleur appât de rage que j'ai vu d'un laboratoire d'IA », a déclaré Bitcoin Udi Wertheimer activiste de la publication d'Anthropic.
C'est la probabilité que le meilleur appât de rage que j'ai jamais vu dans un laboratoire d'IA. Bon travail les gars donnent une augmentation du stage