Kadrey v. Meta Platforms

Traduzido do inglês

Kadrey v. Meta Platforms é um processo judicial por violação de direitos autorais movido por autores contra a Meta pelo uso de livros pirateados no treinamento de seus modelos de linguagem de grande escala LLaMA, alegando reprodução e distribuição não autorizadas de obras protegidas.

Kadrey v. Meta Platforms é um processo civil apresentado no Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia em 2023. Os demandantes, um grupo de autores que incluye Richard Kadrey, Sarah Silverman e Christopher Golden, alegam que Meta Platforms, Inc. infringiu seus direitos de autor ao usar cópias piratas de seus livros para treinar sua família de modelos de linguagem de grande escala LLaMA (Large Language Model Meta AI). O caso faz parte de uma onda mais ampla de litigios contra desenvolvedores de sistemas de inteligência artificial generativa, levantando questões sobre a legalidade de treinar modelos em textos protegidos por direitos de autor sem permiso explícito.

A ação judicial centra-se no uso por Meta de um conjunto de dados conhecido como "Books3", que contém mais de 195.000 livros, muitos dos quais foram obtidos da biblioteca sombra Bibliotik. Os demandantes afirmam que Meta baixou e usou este conjunto de dados para treinar os modelos LLaMA, incluindo LLaMA 1 e LLaMA 2, sem obter licencias nem compensar os autores. O caso se converteu em uma prova clave para a aplicação da lei de direitos de autor à aprendizagem automática, particularmente a doutrina do uso justo.

Antecedentes e Partes

O demandante principal, Richard Kadrey, é um autor americano conhecido pela série de fantasia urbana Sandman Slim. Sarah Silverman, comediante e autora, e Christopher Golden, escritor de terror e fantasia, uníronse à ação. A queixa foi apresentada em 7 de julho de 2023 e posteriormente consolidada com ações similares, incluindo um caso apresentado pelo autor Paul Tremblay. Os demandados são Meta Platforms, Inc. e sua subsidiária Meta AI, que desenvolveu os modelos LLaMA.

Os demandantes estão representados pelo escritório de advocacia Joseph Saveri Law Firm, que apresentou múltiples ações contra empresas de IA. Meta está representada por advogados de Gibson, Dunn & Crutcher. O caso está atribuído à juíza Jacqueline Scott Corley, que também supervisiona outros litigios de direitos de autor relacionados com IA.

Alegações de Infração de Direitos de Autor

A alegação central é que Meta reproduziu e distribuiu livros protegidos por direitos de autor sem autorização durante o processo de treinamento. Os demandantes argumentam que os modelos LLaMA, quando receben um prompt, podem gerar texto que se assemela estreitamente a passagens de seus livros, demonstrando que os modelos memorizaron e podem reproduzir o material protegido. Também afirmam que o uso por Meta do conjunto de dados Books3, que foi criado por um usuário na plataforma centrada em IA The Eye, era conscientemente infractor porque era amplamente conhecido que o conjunto de dados contenia livros piratas.

A queixa cita exemplos específicos, como o modelo que gera texto que coincide com extractos do romance "Sandman Slim" de Kadrey e das memórias "The Bedwetter" de Silverman. Os demandantes asseveram que esta reprodução constituye infração direta e vicaria, bem como infração contributiva, porque Meta facilitou a criação do conjunto de dados infractor.

Defensa de Meta e Argumento de Uso Justo

A defensa principal de Meta é que treinar modelos de IA em texto protegido por direitos de autor constituye uso justo segundo a Sección 107 da Lei de Direitos de Autor dos Estados Unidos. A empresa argumenta que o uso é transformador porque os modelos não reproduzem os livros em sua totalidade, senão que aprenden padrões estatísticos e estruturas lingüísticas. Meta também sostiene que o processo de treinamento é análogo a um humano que lee um livro e aprende dele, e que os modelos não competen com as obras originais no mercado.

Meta apresentou moções para desestimar o caso, argumentando que os demandantes não estabeleceron uma reclamación válida porque não demonstraron que os modelos producen porções substanciales das obras protegidas. A empresa também señala que os modelos LLaMA são de código aberto e que os dados de treinamento não são distribuidos públicamente, o que argumenta que limita qualquer dano ao mercado.

História Processal

Após a apresentação inicial em julho de 2023, o tribunal consolidou vários casos relacionados sob o número de caso principal 3:23-cv-03417. Em novembro de 2023, a juíza Corley negó a moção de Meta para desestimar as reclamaciones de infração direta, mas permitiu aos demandantes emendar sua queixa em relação à infração vicaria e contributiva. Os demandantes apresentaron uma queixa emendada em dezembro de 2023, agregando alegaciones más específicas.

Em fevereiro de 2024, Meta apresentou uma nova moção para desestimar a queixa emendada, que foi parcialmente concedida em maio de 2024. O tribunal desestimó a reclamación de infração contributiva, mas permitió que as reclamaciones de infração direta e responsabilidade vicaria continuaran. A fase de descubrimiento está em curso, com ambas partes buscando comunicaciones internas e documentação sobre os dados de treinamento de Meta.

Contexto Más Amplio dos Litigios de IA e Direitos de Autor

O caso é um de vários litigios de alto perfil contra desenvolvedores de IA. Ações similares foram apresentadas contra OpenAI e Anthropic por autores, incluindo uma ação coletiva liderada pela comediante Sarah Silverman (que foi posteriormente desestimada em parte), e contra Google por autores devido ao seu modelo Gemini. Os resultados destes casos se espera que moldem o panorama legal para a IA generativa, potencialmente influenciando como as empresas coletan dados de treinamento e se precisan licenciar obras protegidas.

O U.S. Copyright Office também tem estado estudando o tema, e em 2023 emitiu um aviso de investigação solicitando comentarios públicos sobre a intersección entre IA e direitos de autor. O escritório ainda não emitiu orientación final, mas seus informes têm enfatizado a necessidade de um enfoque equilibrado que proteja aos autores enquanto permite a inovação tecnológica.

Questões Legales Clave

O caso levanta várias questões legales não resolvidas. Primeiro, se a reproducción de obras protegidas durante o treinamento constituye "copia" no sentido legal, mesmo que as copias sejam transitorias e não distribuídas diretamente. Segundo, se a natureza transformadora dos modelos de IA pesa a favor do uso justo, dado que os modelos podem gerar texto novo mas também memorizar e reproduzir passagens. Terceiro, se o dano ao mercado para os autores é significativo, especialmente se os modelos de IA podem produzir texto que substituye os livros originais.

Os tribunales têm aplicado historicamente uma prueba de quatro factores para o uso justo, considerando o propósito e caráter do uso, a natureza da obra protegida, a quantidade usada e o efeito no mercado. No caso relacionado de Authors Guild v. Google (2015), o Segundo Circuito encontrou que a digitalización de livros por Google para busca era uso justo, mas esse caso envolvía exibição limitada de fragmentos. O caso Kadrey envolve reproducción más extensa, o que pode levar a um resultado diferente.

Resultados Potenciales e Implicaciones

Se os demandantes prevalecem, Meta poderia ser obrigada a pagar danos legais de até $150.000 por obra, o que poderia ascender a mil milhões de dólares dado o número de livros no conjunto de dados. A empresa também poderia ser ordenada a destruir os modelos LLaMA ou a reentrenarlos com dados licenciados. Tal decisión poderia ter um efeito dissuasivo no desenvolvimento de IA, forzando às empresas a obter licencias para todos os dados de treinamento, o que sería costoso e demorado.

Por outro lado, se Meta gana com base no uso justo, estabelecería um precedente amplio de que o treinamento de IA em texto protegido por direitos de autor é permitido, potencialmente acelerando o desenvolvimento de modelos de linguagem de grande escala. Isto também poderia afectar outros casos pendentes e animar a más empresas a usar dados raspados sem compensación.

Estado Actual e Procedimentos Futuros

Até finais de 2024, o caso está na fase de descubrimiento. As partes estão intercambiando documentos e realizando deposiciones. Não foi estabelecida uma data de juicio, mas analistas legales esperan que o caso avance a moções de juicio sumario em 2025. O tribunal também pode decidir certificar uma ação coletiva, o que expandiría o grupo de demandantes para incluir a todos os autores cujas obras estão no conjunto de dados Books3.

O caso tem atraído amicus curiae de várias organizações, incluindo a Authors Guild, que apoia aos demandantes, e a Electronic Frontier Foundation, que apresentou escritos em casos similares argumentando a favor do uso justo. É provável que o resultado seja apelado independentemente da decisión do tribunal distrital, potencialmente chegando à Suprema Corte.

Significado para a Industria da IA

O caso Kadrey é um indicador para a industria da IA. Testa os límites do que constituye dados de treinamento aceitables e se a natureza de código aberto de modelos como LLaMA cambia a análise legal. O caso também destaca a tensión entre inovação e direitos de propriedade intelectual, um debate que é central para o futuro da inteligência artificial e da IA generativa.

Empresas como OpenAI e Anthropic estão observando de cerca os procedimentos, já que enfrentan litigios similares. O resultado poderia influenciar como negocian acuerdos de licencia com editores e autores, e se invierten em métodos alternativos de treinamento que eviten material protegido por direitos de autor. O caso também tem implicações para a pesquisa em aprendizagem automática, já que muitos conjuntos de dados académicos contienen texto protegido.

Mentres tanto, Meta tem continuado a lançar novas versões de LLaMA, incluindo LLaMA 3, que foi treinado em um conjunto de datos maior que pode incluir obras protegidas adicionais. A empresa tem declarado que está comprometida a respeitar os direitos de propriedade intelectual, mas não tem divulgado o conteúdo completo de seus dados de treinamento, citando segredos comerciais.

Conclusão

Kadrey v. Meta Platforms é um caso histórico que ajudará a definir os límites legais do treinamento de IA. A decisión terá consequências de largo alcance para autores, empresas de tecnologia e o público. Embora o caso ainda esteja em curso, seu resultado é provável que estabeleza um precedente que influencie como a lei de direitos de autor se aplica aos modelos de linguagem de grande escala e outros sistemas de redes neuronais. A decisión do tribunal será examinada de cerca por académicos legales, formuladores de políticas e partes interessadas da industria, já que aborda questões fundamentais sobre o equilíbrio entre proteger obras creativas e fomentar o progresso tecnológico.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:copyright-law·artificial-intelligence·litigation·meta-platforms
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico