Wikipédia révèle plusieurs accords avec des géants de l'IA pour utiliser leur contenu

Wikipédia révèle plusieurs accords avec des géants de l'IA pour utiliser leur contenu

En résumé

  • La Fondation Wikimedia a annoncé de nouveaux partenariats avec Ecosia, Microsoft, Mistral AI, Perplexity, Pleias et ProRata pour utiliser le contenu de Wikipédia dans la formation de modèles d'IA.
  • La fondation a noté que les visites humaines sur Wikipédia ont chuté de 8 % sur un an en octobre, les utilisateurs s'appuyant sur les résumés générés par l'IA.
  • Google fait face à des poursuites judiciaires de la part de Hachette et Cengage pour violation présumée du droit d'auteur en formant Gemini avec des livres sans licences appropriées.

La Fondation Wikimedia a annoncé une série de nouveaux partenariats avec des sociétés d'intelligence artificielle qui leur permettront d'utiliser le contenu de Wikipédia pour former et alimenter leurs modèles d'IA, alors que l'organisation à but non lucratif cherche à assurer sa durabilité à long terme dans un contexte de changement de comportement en ligne.

Les accords ont été signés via Wikimedia Enterprise, le produit commercial de la fondation conçu pour les réutilisateurs et distributeurs à grande échelle du contenu des projets Wikimedia. Les nouveaux partenaires incluent Ecosia, Microsoft, Mistral AI, Perplexity, Pleias et ProRata. Ils rejoignent des partenaires existants tels qu'Amazon, Google et Meta.

« À l'ère de l'IA, Wikipédia et ses connaissances créées et conservées par l'homme n'ont jamais été aussi précieuses », a déclaré la fondation dans un communiqué.

« Leurs connaissances alimentent les chatbots génératifs d'IA, les moteurs de recherche, les assistants vocaux, etc. Wikipédia est l'un des ensembles de données de la plus haute qualité utilisé dans la formation des grands modèles linguistiques (LLM). »

L'annonce a été faite dans le cadre d'une mise à jour liée au 25e anniversaire de Wikipédia.

L'encyclopédie en ligne fait partie des dix sites Web les plus visités au monde et est le seul de ce groupe exploité par une organisation à but non lucratif. Ses plus de 65 millions d'articles, publiés dans plus de 300 langues, sont consultés près de 15 milliards de fois chaque mois, selon la fondation.

Cependant, il a averti que les schémas de circulation sont en train de changer. En octobre, il a été noté que les visites humaines sur Wikipédia avaient chuté de 8 % sur un an, attribuant cette baisse au fait que les utilisateurs s'appuient sur des résumés générés par l'IA plutôt que de visiter directement le site. Près de 60 % des recherches Google se terminent désormais sans un clic, avec des réponses sur la page souvent basées sur le contenu de Wikipédia.

IA vs éditeurs

Les accords interviennent dans le cadre d’un débat plus large sur la manière dont les entreprises d’IA obtiennent les données de formation. Les grands modèles linguistiques sont généralement formés sur de grandes quantités de matériel en ligne, une pratique qui a suscité des critiques de la part des auteurs, des éditeurs et d'autres titulaires de droits qui soutiennent que l'utilisation d'œuvres protégées par le droit d'auteur sans autorisation constitue une violation.

Parmi eux, Reddit est impliqué dans plusieurs procès avec des sociétés d'IA concernant l'utilisation de son contenu pour former des modèles, bien qu'il ait conclu des accords de licence avec des sociétés telles que Google.

Jeudi, les grands éditeurs de livres Hachette Book Group et Cengage Group ont déposé une requête pour se joindre à un recours collectif existant contre Google, accusant l'entreprise d'avoir commis une « violation historique du droit d'auteur » pour construire sa plateforme Gemini AI. Le procès allègue que Google a copié des livres sans licences appropriées au cours de ses processus de formation à l'IA. L’affaire a été initialement déposée en 2023 par un groupe d’auteurs.

OpenAI fait face à un cas similaire de la part de plaignants tels que l'écrivain de « Game of Thrones » George RR Martin.

Les sociétés de divertissement insistent également sur la question. À la mi-décembre, Disney a envoyé à Google une lettre de cessation l'accusant de violation du droit d'auteur, alors même que Disney avait conclu un accord de licence distinct avec OpenAI couvrant des centaines de personnages pour les vidéos générées par l'IA. Disney a émis des avis similaires à d'autres sociétés d'IA et est impliqué dans un litige avec de grands studios contre la société d'imagerie Midjourney.

Le même mois, une coalition d’écrivains, d’acteurs et de technologues a lancé un nouveau groupe industriel visant à faire pression en faveur de normes applicables régissant la manière dont l’IA est formée et utilisée dans le secteur du divertissement. Plus de 500 personnalités ont soutenu l'initiative, dont Natalie Portman, Cate Blanchett, Ben Affleck, Guillermo del Toro et Taika Waititi.

La Commission européenne a également ouvert une enquête antitrust formelle pour déterminer si Google a violé les règles de concurrence de l'UE en utilisant le contenu des éditeurs et de YouTube pour alimenter ses services d'IA sans compensation ni consentement équitable.

Il n’est pas certain que les titulaires de droits d’auteur trouveront finalement un recours. Des juges fédéraux aux États-Unis ont récemment accordé des victoires partielles à Meta et Anthropic, estimant que leur utilisation de livres protégés par le droit d'auteur pour former des modèles d'IA constituait un usage loyal, tout en critiquant les entreprises pour avoir maintenu des bibliothèques permanentes d'œuvres piratées.

Débriefing quotidien Bulletin

Commencez chaque journée avec les principales actualités du moment, ainsi que des fonctionnalités originales, un podcast, des vidéos et bien plus encore.

Voir l’article original en espagnol

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚