Kadrey contra Meta Platforms es una demanda civil presentada en el Tribunal de Distrito de los Estados Unidos para el Distrito Norte de California en 2023. Los demandantes, un grupo de autores que incluye a Richard Kadrey, Sarah Silverman y Christopher Golden, alegan que Meta Platforms, Inc. infringió sus derechos de autor al utilizar copias pirateadas de sus libros para entrenar su familia de modelos de lenguaje grandes LLaMA (Large Language Model Meta AI). El caso forma parte de una ola más amplia de litigios contra desarrolladores de sistemas de inteligencia artificial generativa, planteando preguntas sobre la legalidad de entrenar modelos con texto protegido por derechos de autor sin permiso explícito.
La demanda se centra en el uso por parte de Meta de un conjunto de datos conocido como "Books3", que contiene más de 195,000 libros, muchos de los cuales provienen de la biblioteca en la sombra Bibliotik. Los demandantes afirman que Meta descargó y utilizó este conjunto de datos para entrenar los modelos LLaMA, incluidos LLaMA 1 y LLaMA 2, sin obtener licencias ni compensar a los autores. El caso se ha convertido en una prueba clave para la aplicación de la ley de derechos de autor al aprendizaje automático, particularmente la doctrina del uso justo.
Antecedentes y Partes
El demandante principal, Richard Kadrey, es un autor estadounidense conocido por la serie de fantasía urbana Sandman Slim. Sarah Silverman, comediante y autora, y Christopher Golden, escritor de terror y fantasía, se unieron a la demanda. La queja se presentó el 7 de julio de 2023 y luego se consolidó con acciones similares, incluido un caso presentado por el autor Paul Tremblay. Los demandados son Meta Platforms, Inc. y su subsidiaria Meta AI, que desarrolló los modelos LLaMA.
Los demandantes están representados por el bufete de abogados Joseph Saveri Law Firm, que ha presentado múltiples demandas contra empresas de IA. Meta está representada por abogados de Gibson, Dunn & Crutcher. El caso está asignado a la jueza Jacqueline Scott Corley, quien también supervisa otras disputas de derechos de autor relacionadas con IA.
Alegaciones de Infracción de Derechos de Autor
La alegación central es que Meta reprodujo y distribuyó libros protegidos por derechos de autor sin autorización durante el proceso de entrenamiento. Los demandantes argumentan que los modelos LLaMA, cuando se les solicita, pueden generar texto que se asemeja estrechamente a pasajes de sus libros, demostrando que los modelos han memorizado y pueden reproducir el material protegido. También afirman que el uso por parte de Meta del conjunto de datos Books3, creado por un usuario en la plataforma centrada en IA The Eye, fue una infracción consciente porque el conjunto de datos era ampliamente conocido por contener libros pirateados.
La queja cita ejemplos específicos, como el modelo generando texto que coincide con extractos de la novela "Sandman Slim" de Kadrey y las memorias "The Bedwetter" de Silverman. Los demandantes afirman que esta reproducción constituye infracción directa y vicaria, así como infracción contributiva, porque Meta facilitó la creación del conjunto de datos infractor.
Defensa de Meta y Argumento de Uso Justo
La defensa principal de Meta es que entrenar modelos de IA con texto protegido por derechos de autor constituye uso justo según la Sección 107 de la Ley de Derechos de Autor de los Estados Unidos. La empresa argumenta que el uso es transformador porque los modelos no reproducen los libros en su totalidad, sino que aprenden patrones estadísticos y estructuras lingüísticas. Meta también sostiene que el proceso de entrenamiento es análogo a que un humano lea un libro y aprenda de él, y que los modelos no compiten con las obras originales en el mercado.
Meta ha presentado mociones para desestimar el caso, argumentando que los demandantes no lograron establecer una reclamación porque no demostraron que los modelos generen porciones sustanciales de las obras protegidas. La empresa también señala que los modelos LLaMA son de código abierto y que los datos de entrenamiento no se distribuyen públicamente, lo que argumenta limita cualquier daño al mercado.
Historia Procesal
Después de la presentación inicial en julio de 2023, el tribunal consolidó varios casos relacionados bajo el número de caso principal 3:23-cv-03417. En noviembre de 2023, la jueza Corley denegó la moción de Meta para desestimar las reclamaciones de infracción directa, pero permitió a los demandantes enmendar su queja respecto a la infracción vicaria y contributiva. Los demandantes presentaron una queja enmendada en diciembre de 2023, añadiendo alegaciones más específicas.
En febrero de 2024, Meta presentó una nueva moción para desestimar la queja enmendada, que fue parcialmente concedida en mayo de 2024. El tribunal desestimó la reclamación de infracción contributiva, pero permitió que las reclamaciones de infracción directa y responsabilidad vicaria continuaran. El descubrimiento de pruebas está en curso, con ambas partes buscando comunicaciones internas y documentación de datos de entrenamiento de Meta.
Contexto Más Amplio del Litigio sobre Derechos de Autor en IA
El caso es uno de varios juicios de alto perfil contra desarrolladores de IA. Se han presentado acciones similares contra OpenAI y Anthropic por autores, incluida una demanda colectiva liderada por la comediante Sarah Silverman (que fue parcialmente desestimada más tarde), y contra Google por autores por su modelo Gemini. Se espera que los resultados de estos casos den forma al panorama legal para la IA generativa, influyendo potencialmente en cómo las empresas recopilan datos de entrenamiento y si necesitan licenciar obras protegidas.
La Oficina de Derechos de Autor de los Estados Unidos también ha estado estudiando el tema, y en 2023 emitió un aviso de investigación solicitando comentarios públicos sobre la intersección entre IA y derechos de autor. La oficina aún no ha emitido una guía final, pero sus informes han enfatizado la necesidad de un enfoque equilibrado que proteja a los autores mientras permite la innovación tecnológica.
Cuestiones Legales Clave
El caso plantea varias cuestiones legales no resueltas. Primero, si la reproducción de obras protegidas durante el entrenamiento constituye "copia" en el sentido legal, incluso si las copias son transitorias y no se distribuyen directamente. Segundo, si la naturaleza transformadora de los modelos de IA favorece el uso justo, dado que los modelos pueden generar texto nuevo pero también memorizar y reproducir pasajes. Tercero, si el daño al mercado para los autores es significativo, especialmente si los modelos de IA pueden producir texto que sustituya a los libros originales.
Los tribunales han aplicado históricamente una prueba de cuatro factores para el uso justo, considerando el propósito y carácter del uso, la naturaleza de la obra protegida, la cantidad utilizada y el efecto en el mercado. En el caso relacionado de Authors Guild contra Google (2015), el Segundo Circuito encontró que la digitalización de libros por parte de Google para búsqueda era uso justo, pero ese caso involucraba una visualización limitada de fragmentos. El caso Kadrey involucra una reproducción más extensa, lo que podría llevar a un resultado diferente.
Resultados Potenciales e Implicaciones
Si los demandantes prevalecen, Meta podría ser obligada a pagar daños legales de hasta $150,000 por obra, lo que podría ascender a miles de millones de dólares dado el número de libros en el conjunto de datos. La empresa también podría recibir la orden de destruir los modelos LLaMA o reentrenarlos con datos licenciados. Tal fallo podría tener un efecto paralizante en el desarrollo de IA, forzando a las empresas a obtener licencias para todos los datos de entrenamiento, lo que sería costoso y consumiría mucho tiempo.
Por el contrario, si Meta gana sobre el uso justo, establecería un precedente amplio de que el entrenamiento de IA con texto protegido es permisible, acelerando potencialmente el desarrollo de modelos de lenguaje grandes. Esto también podría afectar otros casos pendientes y alentar a más empresas a usar datos extraídos sin compensación.
Estado Actual y Procedimientos Futuros
Hasta finales de 2024, el caso se encuentra en la fase de descubrimiento de pruebas. Las partes están intercambiando documentos y tomando declaraciones. No se ha fijado una fecha para el juicio, pero los analistas legales esperan que el caso avance a mociones de juicio sumario en 2025. El tribunal también podría decidir certificar una demanda colectiva, lo que expandiría el grupo de demandantes para incluir a todos los autores cuyas obras están en el conjunto de datos Books3.
El caso ha atraído escritos de amicus curiae de varias organizaciones, incluido el Authors Guild, que apoya a los demandantes, y la Electronic Frontier Foundation, que ha presentado escritos en casos similares argumentando a favor del uso justo. Es probable que el resultado sea apelado independientemente de la decisión del tribunal de distrito, llegando potencialmente a la Corte Suprema.
Importancia para la Industria de la IA
El caso Kadrey es un indicador clave para la industria de la IA. Prueba los límites de lo que constituye datos de entrenamiento aceptables y si la naturaleza de código abierto de modelos como LLaMA cambia el análisis legal. El caso también destaca la tensión entre innovación y derechos de propiedad intelectual, un debate central para el futuro de la Artificial intelligence y la Generative AI.
Empresas como OpenAI y Anthropic están observando de cerca los procedimientos, ya que enfrentan demandas similares. El resultado podría influir en cómo negocian acuerdos de licencia con editores y autores, y si invierten en métodos alternativos de entrenamiento que eviten material protegido. El caso también tiene implicaciones para la investigación en Machine learning, ya que muchos conjuntos de datos académicos contienen texto protegido.
Mientras tanto, Meta ha continuado lanzando nuevas versiones de LLaMA, incluido LLaMA 3, que fue entrenado con un conjunto de datos más grande que puede incluir obras protegidas adicionales. La empresa ha declarado que está comprometida a respetar los derechos de propiedad intelectual, pero no ha revelado el contenido completo de sus datos de entrenamiento, citando secretos comerciales.
Conclusión
Kadrey contra Meta Platforms es un caso histórico que ayudará a definir los límites legales del entrenamiento de IA. La decisión tendrá consecuencias de gran alcance para autores, empresas tecnológicas y el público. Aunque el caso aún está en curso, su resultado probablemente establecerá un precedente que influya en cómo se aplica la ley de derechos de autor a los Large language models y otros sistemas de Neural network. El fallo del tribunal será examinado de cerca por académicos legales, formuladores de políticas y partes interesadas de la industria, ya que aborda preguntas fundamentales sobre el equilibrio entre proteger obras creativas y fomentar el progreso tecnológico.