Kadrey c. Meta Platforms

Traduit de l'anglais

Kadrey c. Meta Platforms est une action en justice pour violation du droit d'auteur intentée par des auteurs contre Meta concernant l'utilisation de livres piratés dans l'entraînement de ses grands modèles de langage LLaMA, alléguant une reproduction et une distribution non autorisées d'œuvres protégées.

Kadrey v. Meta Platforms est une action en justice civile déposée devant le tribunal de district des États-Unis pour le district nord de la Californie en 2023. Les demandeurs, un groupe d'auteurs comprenant Richard Kadrey, Sarah Silverman et Christopher Golden, allèguent que Meta Platforms, Inc. a violé leurs droits d'auteur en utilisant des copies piratées de leurs livres pour entraîner sa famille de grands modèles de langage LLaMA (Large Language Model Meta AI). L'affaire s'inscrit dans une vague plus large de litiges contre les développeurs de systèmes d'intelligence artificielle générative, soulevant des questions sur la légalité de l'entraînement de modèles sur des textes protégés par le droit d'auteur sans autorisation explicite.

Le procès se concentre sur l'utilisation par Meta d'un ensemble de données connu sous le nom de « Books3 », qui contient plus de 195 000 livres, dont beaucoup proviennent de la bibliothèque fantôme Bibliotik. Les demandeurs affirment que Meta a téléchargé et utilisé cet ensemble de données pour entraîner les modèles LLaMA, y compris LLaMA 1 et LLaMA 2, sans obtenir de licences ni rémunérer les auteurs. L'affaire est devenue un test clé pour l'application du droit d'auteur à l'apprentissage automatique, en particulier la doctrine de l'usage équitable.

Contexte et parties

Le demandeur principal, Richard Kadrey, est un auteur américain connu pour la série de fantasy urbaine Sandman Slim. Sarah Silverman, comédienne et auteure, et Christopher Golden, écrivain d'horreur et de fantasy, se sont joints à l'action. La plainte a été déposée le 7 juillet 2023 et a ensuite été consolidée avec des actions similaires, y compris une affaire intentée par l'auteur Paul Tremblay. Les défendeurs sont Meta Platforms, Inc. et sa filiale Meta AI, qui a développé les modèles LLaMA.

Les demandeurs sont représentés par le cabinet d'avocats Joseph Saveri Law Firm, qui a déposé plusieurs poursuites contre des entreprises d'IA. Meta est représentée par des avocats de Gibson, Dunn & Crutcher. L'affaire est assignée à la juge Jacqueline Scott Corley, qui supervise également d'autres litiges sur le droit d'auteur liés à l'IA.

Allégations de violation du droit d'auteur

L'allégation centrale est que Meta a reproduit et distribué des livres protégés par le droit d'auteur sans autorisation pendant le processus d'entraînement. Les demandeurs soutiennent que les modèles LLaMA, lorsqu'on les sollicite, peuvent générer un texte qui ressemble étroitement à des passages de leurs livres, démontrant que les modèles ont mémorisé et peuvent reproduire le matériel protégé. Ils affirment également que l'utilisation par Meta de l'ensemble de données Books3, créé par un utilisateur sur la plateforme axée sur l'IA The Eye, était délibérément infractionniste, car cet ensemble était largement connu pour contenir des livres piratés.

La plainte cite des exemples spécifiques, tels que le modèle générant un texte qui correspond à des extraits du roman « Sandman Slim » de Kadrey et des mémoires « The Bedwetter » de Silverman. Les demandeurs affirment que cette reproduction constitue une infraction directe et indirecte, ainsi qu'une infraction contributive, car Meta a facilité la création de l'ensemble de données infractionniste.

Défense de Meta et argument d'usage équitable

La principale défense de Meta est que l'entraînement de modèles d'IA sur des textes protégés par le droit d'auteur constitue un usage équitable en vertu de l'article 107 de la loi américaine sur le droit d'auteur. L'entreprise soutient que l'utilisation est transformative car les modèles ne reproduisent pas les livres dans leur intégralité, mais apprennent plutôt des modèles statistiques et des structures linguistiques. Meta affirme également que le processus d'entraînement est analogue à celui d'un humain qui lit un livre et en apprend, et que les modèles ne concurrencent pas les œuvres originales sur le marché.

Meta a déposé des requêtes en rejet de l'affaire, arguant que les demandeurs n'ont pas énoncé de réclamation valable car ils n'ont pas démontré que les modèles produisent des portions substantielles des œuvres protégées. L'entreprise souligne également que les modèles LLaMA sont open-source et que les données d'entraînement ne sont pas distribuées publiquement, ce qui, selon elle, limite tout préjudice sur le marché.

Historique procédural

Après le dépôt initial en juillet 2023, le tribunal a consolidé plusieurs affaires connexes sous le numéro de dossier principal 3:23-cv-03417. En novembre 2023, la juge Corley a rejeté la requête de Meta en rejet des réclamations pour infraction directe, mais a permis aux demandeurs de modifier leur plainte concernant l'infraction indirecte et contributive. Les demandeurs ont déposé une plainte modifiée en décembre 2023, ajoutant des allégations plus spécifiques.

En février 2024, Meta a déposé une nouvelle requête en rejet de la plainte modifiée, qui a été partiellement accordée en mai 2024. Le tribunal a rejeté la réclamation pour infraction contributive, mais a permis aux réclamations pour infraction directe et responsabilité indirecte de poursuivre. La phase de découverte est en cours, les deux parties cherchant des communications internes et des documents sur les données d'entraînement de Meta.

Contexte plus large des litiges sur le droit d'auteur liés à l'IA

L'affaire est l'une des nombreuses poursuites très médiatisées contre les développeurs d'IA. Des actions similaires ont été déposées contre OpenAI et Anthropic par des auteurs, y compris une action collective dirigée par la comédienne Sarah Silverman (qui a été partiellement rejetée par la suite), et contre Google par des auteurs concernant son modèle Gemini. Les résultats de ces affaires devraient façonner le paysage juridique de l'IA générative, influençant potentiellement la manière dont les entreprises collectent les données d'entraînement et si elles doivent obtenir des licences pour les œuvres protégées.

Le Bureau du droit d'auteur des États-Unis a également étudié la question, et en 2023, il a émis un avis de demande de commentaires publics sur l'intersection de l'IA et du droit d'auteur. Le bureau n'a pas encore publié de directives finales, mais ses rapports ont souligné la nécessité d'une approche équilibrée qui protège les auteurs tout en permettant l'innovation technologique.

Questions juridiques clés

L'affaire soulève plusieurs questions juridiques non résolues. Premièrement, la reproduction d'œuvres protégées pendant l'entraînement constitue-t-elle une « copie » au sens juridique, même si les copies sont transitoires et non directement distribuées ? Deuxièmement, la nature transformative des modèles d'IA plaide-t-elle en faveur de l'usage équitable, étant donné que les modèles peuvent générer de nouveaux textes mais aussi mémoriser et reproduire des passages ? Troisièmement, le préjudice sur le marché pour les auteurs est-il significatif, surtout si les modèles d'IA peuvent produire un texte qui se substitue aux livres originaux ?

Les tribunaux ont historiquement appliqué un test à quatre facteurs pour l'usage équitable, considérant le but et le caractère de l'utilisation, la nature de l'œuvre protégée, la quantité utilisée et l'effet sur le marché. Dans l'affaire connexe Authors Guild v. Google (2015), la cour d'appel du deuxième circuit a conclu que la numérisation de livres par Google pour la recherche était un usage équitable, mais cette affaire impliquait un affichage limité d'extraits. L'affaire Kadrey implique une reproduction plus étendue, ce qui pourrait conduire à un résultat différent.

Résultats potentiels et implications

Si les demandeurs prévalent, Meta pourrait être tenue de payer des dommages-intérêts légaux allant jusqu'à 150 000 $ par œuvre, ce qui pourrait représenter des milliards de dollars compte tenu du nombre de livres dans l'ensemble de données. L'entreprise pourrait également être ordonnée de détruire les modèles LLaMA ou de les réentraîner sur des données sous licence. Une telle décision pourrait avoir un effet dissuasif sur le développement de l'IA, forçant les entreprises à obtenir des licences pour toutes les données d'entraînement, ce qui serait coûteux et long.

À l'inverse, si Meta gagne sur l'usage équitable, cela établirait un précédent large selon lequel l'entraînement de l'IA sur des textes protégés est permis, accélérant potentiellement le développement des grands modèles de langage. Cela pourrait également affecter d'autres affaires en cours et encourager davantage d'entreprises à utiliser des données extraites sans compensation.

Statut actuel et procédures futures

À la fin de 2024, l'affaire est en phase de découverte. Les parties échangent des documents et procèdent à des dépositions. Aucune date de procès n'a été fixée, mais les analystes juridiques s'attendent à ce que l'affaire passe à des requêtes en jugement sommaire en 2025. Le tribunal pourrait également décider de certifier une action collective, ce qui élargirait le groupe de demandeurs pour inclure tous les auteurs dont les œuvres figurent dans l'ensemble de données Books3.

L'affaire a attiré des mémoires d'amicus curiae de diverses organisations, notamment l'Authors Guild, qui soutient les demandeurs, et l'Electronic Frontier Foundation, qui a déposé des mémoires dans des affaires similaires plaidant pour l'usage équitable. Le résultat sera probablement porté en appel, quelle que soit la décision du tribunal de district, atteignant potentiellement la Cour suprême.

Importance pour l'industrie de l'IA

L'affaire Kadrey est un indicateur clé pour l'industrie de l'IA. Elle teste les limites de ce qui constitue des données d'entraînement acceptables et si la nature open-source de modèles comme LLaMA change l'analyse juridique. L'affaire met également en évidence la tension entre l'innovation et les droits de propriété intellectuelle, un débat central pour l'avenir de l'Artificial intelligence et de l'Generative AI.

Des entreprises comme OpenAI et Anthropic suivent de près les procédures, car elles font face à des poursuites similaires. Le résultat pourrait influencer la manière dont elles négocient des accords de licence avec les éditeurs et les auteurs, et si elles investissent dans des méthodes d'entraînement alternatives qui évitent le matériel protégé par le droit d'auteur. L'affaire a également des implications pour la recherche en Machine learning, car de nombreux ensembles de données académiques contiennent des textes protégés.

Entre-temps, Meta a continué à publier de nouvelles versions de LLaMA, y compris LLaMA 3, qui a été entraîné sur un ensemble de données plus vaste pouvant inclure des œuvres protégées supplémentaires. L'entreprise a déclaré qu'elle s'engageait à respecter les droits de propriété intellectuelle, mais elle n'a pas divulgué le contenu complet de ses données d'entraînement, invoquant des secrets commerciaux.

Conclusion

Kadrey v. Meta Platforms est une affaire historique qui aidera à définir les limites juridiques de l'entraînement de l'IA. La décision aura des conséquences considérables pour les auteurs, les entreprises technologiques et le public. Bien que l'affaire soit encore en cours, son résultat est susceptible d'établir un précédent qui influencera la manière dont le droit d'auteur est appliqué aux Large language models et à d'autres systèmes de Neural network. La décision du tribunal sera examinée de près par les juristes, les décideurs politiques et les parties prenantes de l'industrie, car elle aborde des questions fondamentales sur l'équilibre entre la protection des œuvres créatives et la promotion du progrès technologique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:copyright-law·artificial-intelligence·litigation·meta-platforms
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique