
Les modèles d’IA « trichent » déjà et font des choses que leurs créateurs n’avaient pas prévu, a déclaré le ministre adjoint australien de la Technologie, Andrew Charlton. À titre d'exemple du risque, il a cité l'annonce d'Anthropic l'année dernière selon laquelle dans 96 % des essais, l'agent d'IA de la simulation avait choisi le chantage pour éviter l'arrêt.
Selon le responsable, un tel comportement doit être identifié au stade des tests. L’Australian AI Safety Institute teste déjà des modèles avancés avec des partenaires technologiques.
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Voir l’article original en russe
