
DeepMind a introduit le modèle SAFE AI qui vérifie les faits dans les réponses LLM de meilleures personnes.
Tous les grands modèles de langage ont un problème commun : la fiabilité des informations générées. Les chatbots sont sujets aux hallucinations, ce qui les empêche de répondre correctement aux questions. De ce fait, chaque résultat doit être vérifié manuellement, ce qui augmente considérablement le temps nécessaire à la résolution du problème.
Les chercheurs de DeepMind ont créé un modèle d’IA qui signale automatiquement les inexactitudes. Le système s’appelle Search-Augmented Factuality Evaluator (SAFE) – « Advanced Search Fact Evaluator ».
Les développeurs ont créé un LLM qui sépare d’abord les déclarations ou les faits dans la réponse des chatbots. Ils utilisent ensuite la recherche Google pour trouver des sites qui vérifient les affirmations et effectuent des comparaisons.
Selon les chercheurs, l’utilisation d’un modèle d’IA coûtera 20 fois moins cher que la vérification des faits par des humains. Alors que le volume d’informations générées par les chatbots augmente rapidement, il sera très demandé de disposer d’une méthode de vérification peu coûteuse.
Pour la formation, l’équipe a utilisé un réseau neuronal pour tester 16 000 faits contenus dans les réponses de 13 modèles linguistiques majeurs de quatre familles (Gemini, GPT, Claude et PaLM-2). Ils ont comparé les résultats avec les conclusions de la vie vérificateurs de faits et a constaté que SAFE leur correspondait dans 72 % des cas.
Lors des tests de désaccords entre le modèle d’IA et les humains, SAFE avait raison dans 76 % des cas.
Après une lecture rapide, je n’arrive pas à comprendre grand-chose sur les sujets humains, mais il semble que surhumain signifie mieux qu’un travailleur de foule sous-payé, plutôt un véritable vérificateur de faits humains ? Cela rend la caractérisation trompeuse. (C’est comme dire que le logiciel d’échecs de 1985 était surhumain).…
-Gary Marcus (@GaryMarcus) 28 mars 2024
Selon le professeur Gary Marcus, il n’est pas tout à fait exact de dire que le modèle d’IA s’acquitte de la tâche à un « niveau surhumain », puisque le niveau de qualification des personnes qui ont participé à l’expérience est inconnu.
L’équipe DeepMind a publié le code SAFE sur GitHub.
Rappelons qu’en septembre 2023, le co-fondateur de l’entreprise, Mustafa Suleiman, a qualifié les robots interactifs capables d’effectuer des tâches pour une personne de prochaine étape dans le développement de l’IA.
Vous avez trouvé une erreur dans le texte ? Sélectionnez-le et appuyez sur CTRL+ENTRÉE
Newsletters ForkLog : restez à l’écoute de l’industrie Bitcoin !
Voir l’article original en russe
