New York Times Co. contra Microsoft Corp.

Traducido del inglés

New York Times Co. v. Microsoft Corp. es una demanda por infracción de derechos de autor presentada en diciembre de 2023, que alega que OpenAI y Microsoft utilizaron artículos del NYT sin permiso para entrenar a ChatGPT y otros modelos de IA, solicitando daños y perjuicios y la eliminación del contenido infractor.

New York Times Co. v. Microsoft Corp. es un caso histórico de infracción de derechos de autor presentado el 27 de diciembre de 2023 ante el Tribunal de Distrito de los Estados Unidos para el Distrito Sur de Nueva York. La demandante, The New York Times Company, alega que OpenAI y Microsoft, mediante el desarrollo y despliegue de modelos de lenguaje de gran escala como ChatGPT y la infraestructura basada en Azure que los respalda, incurrieron en la reproducción y el uso no autorizados de millones de artículos periodísticos protegidos por derechos de autor para entrenar sus sistemas de inteligencia artificial. La demanda solicita daños legales, medidas cautelares y la destrucción de los pesos de los modelos infractores y los conjuntos de datos de entrenamiento, lo que la posiciona como uno de los desafíos legales más significativos para la aplicación comercial de la IA generativa.

El caso se centra en la intersección entre la ley de derechos de autor y el aprendizaje automático, específicamente en la práctica de entrenar modelos de lenguaje de gran escala con vastos corpus de texto extraídos de internet. The Times argumenta que OpenAI y Microsoft copiaron sus artículos en su totalidad para construir las redes neuronales subyacentes a ChatGPT, y que los modelos pueden reproducir o parafrasear de cerca contenido protegido, compitiendo así con los productos digitales del propio periódico. Microsoft es nombrado como demandado debido a su inversión multimillonaria en OpenAI y su integración de los modelos de OpenAI en productos como Bing Chat y Microsoft 365 Copilot. La demanda se ha convertido en un referente para determinar cómo los tribunales aplicarán las doctrinas de derechos de autor existentes al emergente campo de la IA generativa.

Antecedentes y Partes

The New York Times Company, fundada en 1851, es una de las organizaciones de noticias más prominentes de los Estados Unidos, con una base de suscripciones digitales que supera los 10 millones en 2023. Su modelo de negocio depende en gran medida de la información y el análisis exclusivos, protegidos por derechos de autor. OpenAI, fundada en 2015 como una organización sin fines de lucro y reestructurada como una entidad de ganancias limitadas en 2019, desarrolla sistemas avanzados de inteligencia artificial, incluida la serie GPT de modelos de lenguaje de gran escala. Microsoft, una corporación tecnológica global, ha invertido más de 13 mil millones de dólares en OpenAI desde 2019, proporcionando recursos de computación en la nube a través de su plataforma Azure e incorporando los modelos de OpenAI en sus propios productos.

La demanda nombra a Microsoft como co-demandado debido a su profundo entrelazamiento financiero y técnico con OpenAI. Azure, de Microsoft, aloja las cargas de trabajo de entrenamiento e inferencia de OpenAI, y la compañía tiene derechos exclusivos para comercializar ciertas tecnologías de OpenAI. The Times alega que Microsoft no es un mero inversor pasivo, sino un participante activo en el desarrollo y la distribución de los sistemas infractores.

Alegaciones de Infracción de Derechos de Autor

La denuncia detalla instancias específicas en las que ChatGPT y Bing Chat, de Microsoft, supuestamente reprodujeron artículos de The Times palabra por palabra o con solo alteraciones menores. Por ejemplo, la demanda cita una consulta sobre el incendio de Camp Fire de 2018 en California, donde ChatGPT supuestamente devolvió un extracto casi idéntico de un artículo de The Times, incluido el titular y el párrafo inicial. The Times argumenta que tales resultados demuestran que los modelos fueron entrenados con su contenido protegido y pueden generarlo bajo demanda, lo que constituye una infracción directa y vicaria.

The Times también afirma que OpenAI y Microsoft eliminaron u ocultaron información de gestión de derechos de autor, como firmas y fechas de publicación, de los datos de entrenamiento, violando la Ley de Derechos de Autor del Milenio Digital. La demanda sostiene que los demandados no buscaron una licencia o permiso de The Times, a pesar de tener los recursos para hacerlo, y que su uso de los artículos no es transformador, sino un sustituto de la obra original.

Argumentos Legales y Defensas

OpenAI y Microsoft aún no han presentado respuestas formales a la denuncia a principios de 2025, pero sus declaraciones públicas y presentaciones legales en casos relacionados sugieren posibles defensas. Estas incluyen la doctrina del uso justo, que permite el uso limitado de material protegido sin permiso para fines como crítica, comentario, reportaje, enseñanza o investigación. Los demandados pueden argumentar que el entrenamiento con texto protegido es un uso transformador, ya que los modelos no reproducen los artículos en su totalidad, sino que aprenden patrones estadísticos y estructuras lingüísticas.

Otra defensa probable es que los modelos no están diseñados para regurgitar artículos específicos, y que cualquier similitud se debe a la naturaleza del lenguaje y a la prevalencia de ciertas frases. OpenAI ha declarado que utiliza mecanismos de "exclusión voluntaria" para los sitios web que no desean que su contenido se use para el entrenamiento, aunque The Times argumenta que esto impone una carga indebida a los titulares de derechos de autor. El caso también puede plantear preguntas sobre si la salida de un modelo de lenguaje de gran escala constituye una obra derivada, un concepto que los tribunales aún no han explorado por completo en el contexto de la IA.

Historia Procesal y Casos Relacionados

La demanda fue asignada al juez Sidney H. Stein del Distrito Sur de Nueva York. A principios de 2024, el tribunal concedió una moción conjunta para consolidar casos relacionados con fines de instrucción previa al juicio, aunque el caso de The Times sigue siendo distinto. Varios otros titulares de derechos de autor han presentado demandas similares contra OpenAI y Microsoft, incluidos autores como Sarah Silverman y George R.R. Martin, y artistas visuales contra Stability AI y Midjourney. El caso de The Times es notable por su escala y por el estatus de la demandante como una importante organización de medios.

En febrero de 2024, el tribunal emitió una orden de programación que establecía un cronograma para el descubrimiento de pruebas, con una fecha de juicio tentativamente fijada para finales de 2025. Las partes han participado en una extensa práctica de mociones, incluidas mociones para desestimar y mociones para juicio sumario, aunque a principios de 2025 no se han emitido fallos definitivos. El caso ha atraído escritos de amicus curiae de diversas organizaciones, incluidos el Authors Guild y la Electronic Frontier Foundation, lo que refleja sus amplias implicaciones.

Implicaciones para la Industria de la IA

El resultado de este caso podría tener efectos profundos en el desarrollo de modelos de lenguaje de gran escala y en el campo más amplio de la inteligencia artificial. Si el tribunal falla a favor de The Times, podría exigir a OpenAI y Microsoft el pago de daños sustanciales y la modificación de sus prácticas de entrenamiento, lo que potencialmente requeriría el uso de conjuntos de datos con licencia o la implementación de un filtrado de contenido más robusto. Esto podría aumentar el costo del desarrollo de la IA y crear barreras de entrada para empresas más pequeñas e instituciones de investigación.

Por el contrario, un fallo a favor de los demandados afirmaría la legalidad del entrenamiento con texto disponible públicamente, proporcionando luz verde para la innovación continua en la IA generativa. El caso es observado de cerca por otras empresas tecnológicas, incluidas Anthropic, Google DeepMind y Meta AI, que enfrentan desafíos legales similares. También se cruza con los debates de políticas en curso sobre la regulación de la IA, ya que los gobiernos de los Estados Unidos y Europa consideran nuevas leyes que regulen el uso de material protegido por derechos de autor en el aprendizaje automático.

Contexto Técnico: Cómo se Entrenan los LLM

Para comprender los problemas legales, es útil considerar el proceso técnico de entrenamiento de un modelo de lenguaje de gran escala. Estos modelos, basados en la arquitectura Transformer (architecture) introducida en 2017, se entrenan con conjuntos de datos masivos que contienen miles de millones de palabras de libros, sitios web y otras fuentes. Durante el entrenamiento, el modelo ajusta sus parámetros internos - los pesos de sus conexiones de Neural network - para predecir la siguiente palabra en una secuencia, un proceso conocido como aprendizaje autosupervisado. Esto requiere que el modelo codifique regularidades estadísticas en el texto, incluidos hechos, estilos y, a veces, frases verbatim.

Los datos de entrenamiento para GPT-3 y GPT-4 de OpenAI incluyeron una gran parte de Common Crawl, un archivo web público, así como conjuntos de datos curados como Wikipedia y libros. The Times alega que sus artículos se incluyeron en estos conjuntos de datos sin permiso. La capacidad del modelo para reproducir pasajes específicos es un fenómeno conocido, a menudo denominado "memorización", que ocurre cuando ciertas secuencias aparecen con frecuencia en los datos de entrenamiento. Los investigadores han demostrado que los modelos de lenguaje de gran escala pueden regurgitar extractos largos de obras protegidas, lo que plantea preocupaciones sobre infracción.

La doctrina del uso justo, codificada en la Sección 107 de la Ley de Derechos de Autor de los EE. UU., considera cuatro factores: el propósito y el carácter del uso, la naturaleza de la obra protegida, la cantidad y sustancialidad de la porción utilizada, y el efecto en el mercado potencial. Los tribunales han aplicado el uso justo a tecnologías como los motores de búsqueda y la grabación de video, pero la aplicación al entrenamiento de IA es novedosa. En el caso de 2023 Authors Guild v. Google, el Segundo Circuito sostuvo que la digitalización de libros por parte de Google para búsqueda era uso justo, pero ese caso involucraba un uso no expresivo, mientras que los modelos de IA pueden generar contenido expresivo.

The Times argumenta que el uso no es transformador porque los modelos están diseñados para generar texto que compite con los artículos originales, lo que potencialmente reduce el tráfico al sitio web de The Times y los ingresos por suscripción. Los demandados pueden contraargumentar que los modelos no reemplazan los artículos, sino que proporcionan una nueva forma de acceder a la información, similar a un motor de búsqueda. El análisis de estos factores por parte del tribunal probablemente sentará un precedente para futuros casos que involucren a otras empresas de IA y creadores de contenido.

Estado Actual y Perspectivas

A principios de 2025, el caso se encuentra en la fase de descubrimiento de pruebas, con ambas partes intercambiando evidencia e informes de expertos. El tribunal aún no se ha pronunciado sobre las cuestiones legales fundamentales, y no se espera un juicio hasta al menos finales de 2025. Las partes han entablado conversaciones de conciliación, pero no se ha alcanzado ningún acuerdo. El caso es uno de varios juicios de alto perfil que darán forma al entorno legal para la IA, junto con casos que involucran a sellos discográficos y generadores de imágenes.

El resultado dependerá de cómo el tribunal interprete los hechos y aplique la ley existente a una tecnología en rápida evolución. Los académicos legales están divididos sobre el resultado probable, y algunos predicen una determinación de uso justo y otros anticipan un fallo a favor de The Times. El caso puede finalmente ser apelado ante el Segundo Circuito y posiblemente la Corte Suprema, dada su importancia nacional. Independientemente del resultado, ya ha llevado a muchas empresas de IA a buscar licencias de los proveedores de contenido, y ha acelerado los debates sobre la necesidad de nueva legislación para abordar los desafíos únicos planteados por la IA generativa.

Impacto en el Periodismo y los Medios

La demanda también ha puesto de relieve la tensión más amplia entre la industria de los medios y los desarrolladores de IA. Las organizaciones de noticias dependen de los derechos de autor para proteger su información, pero los sistemas de IA pueden agregar y resumir noticias de maneras que pueden socavar sus modelos de negocio. The Times ha sido proactivo en la exploración de sus propias herramientas de IA, pero insiste en que cualquier uso de su contenido debe ser compensado. Otros editores, incluidos Associated Press y Axel Springer, han firmado acuerdos de licencia con OpenAI, mientras que The Times ha optado por el litigio.

Si The Times prevalece, podría conducir a una ola de demandas similares de otros editores, lo que potencialmente obligaría a las empresas de IA a negociar acuerdos de licencia colectivos. Esto podría crear una nueva fuente de ingresos para las organizaciones de medios, pero también podría ralentizar el ritmo de la innovación en IA. Por el contrario, una pérdida para The Times podría envalentonar a las empresas de IA para continuar extrayendo contenido sin permiso, lo que potencialmente dañaría la viabilidad financiera del periodismo. El caso representa así una coyuntura crítica en la relación entre la tecnología y la prensa.

Conclusión

New York Times Co. v. Microsoft Corp. es una batalla legal fundamental que ayudará a definir los límites de los derechos de autor en la era de la inteligencia artificial. Su resolución tendrá consecuencias de gran alcance para los desarrolladores de IA, los creadores de contenido y el público, afectando cómo se produce, accede y monetiza la información. A medida que el caso avanza, será monitoreado de cerca por expertos legales, tecnólogos y ejecutivos de medios por igual, sirviendo como un caso de prueba para la aplicación de principios de derechos de autor centenarios a las formas más nuevas de inteligencia de máquina.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:copyright-law·artificial-intelligence·lawsuits·large-language-models
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial