LAION (acrónimo de Large-scale Artificial Intelligence Open Network) es una organización sin fines de lucro alemana que desarrolla modelos y conjuntos de datos de inteligencia artificial de código abierto. Es conocida principalmente por publicar varios conjuntos de datos a gran escala de imágenes y descripciones extraídas de la web, que se han utilizado para entrenar numerosos modelos de texto a imagen de alto perfil, incluidos Stable Diffusion e Imagen. La organización opera como una red comunitaria de voluntarios e investigadores, con el objetivo de democratizar el acceso a los datos y modelos de IA.
Fundada en el contexto del creciente interés en la IA generativa, el trabajo de LAION se centra en ofrecer alternativas a los conjuntos de datos propietarios en manos de las grandes empresas de IA. Al hacer que sus conjuntos de datos estén disponibles gratuitamente, la organización permite que investigadores y entidades más pequeñas participen en la investigación del aprendizaje automático sin depender de los recursos corporativos. Sus actividades también la han situado en el centro de debates legales y éticos sobre los datos de entrenamiento de la IA, en particular en lo relativo a los derechos de autor y la moderación de contenido.
Historia y fundación
LAION se estableció en Alemania como una entidad sin fines de lucro, con su nombre que significa Large-scale Artificial Intelligence Open Network. La iniciativa surgió de una comunidad de investigadores y entusiastas de la IA que buscaban replicar la escala de los conjuntos de datos utilizados por laboratorios comerciales como OpenAI. Los primeros esfuerzos de la organización se centraron en construir conjuntos de datos de imágenes y texto a gran escala a partir de datos web públicos, una tarea que requirió importantes recursos computacionales y coordinación de voluntarios.
En agosto de 2021, LAION publicó su primer conjunto de datos importante, LAION-400M, que contenía 400 millones de pares de imágenes y descripciones. Este conjunto de datos se derivó de un subconjunto aleatorio de páginas web recopiladas por Common Crawl entre 2014 y 2021. La publicación estuvo motivada por el deseo de recrear el proceso utilizado por OpenAI para recopilar los 400 millones de pares de imágenes y texto con los que se entrenó el modelo CLIP, ya que OpenAI había publicado el código y los pesos del modelo, pero no su conjunto de datos de entrenamiento. LAION-400M se convirtió rápidamente en un recurso para los investigadores que trabajaban en modelos de aprendizaje profundo, especialmente en el campo de la generación de texto a imagen.
En marzo de 2022, LAION publicó un conjunto de datos sucesor, LAION-5B, que comprende más de 5 mil millones de pares de imágenes y descripciones. En el momento de su publicación, era el conjunto de datos de libre acceso más grande de su tipo. La creación de LAION-5B fue financiada por Doodlebot, Hugging Face y Stability AI, esta última la empresa detrás del modelo de texto a imagen Stable Diffusion, que se entrenó con este conjunto de datos. La publicación marcó un hito importante en la investigación abierta de la IA, al proporcionar una escala de datos sin precedentes para entrenar modelos de redes neuronales.
Conjuntos de datos de imágenes
Los conjuntos de datos de imágenes de LAION se construyen a partir de Common Crawl, un conjunto de datos de páginas web recopiladas. Los desarrolladores buscaron en el HTML recopilado las etiquetas <img> y trataron sus atributos alt como descripciones. Utilizaron CLIP, un modelo basado en transformadores, para identificar y descartar imágenes cuyo contenido no parecía coincidir con sus descripciones. Es importante destacar que LAION no aloja el contenido de las imágenes recopiladas; más bien, los conjuntos de datos contienen URL que apuntan a las imágenes, que los investigadores deben descargar de forma independiente.
LAION-400M, publicado en agosto de 2021, consistía en 400 millones de pares de imágenes y descripciones extraídos de páginas web recopiladas entre 2014 y 2021. Se utilizó para entrenar Imagen, un modelo de texto a imagen anunciado por Google Brain en 2022, en combinación con conjuntos de datos internos privados. La escala y accesibilidad del conjunto de datos lo convirtieron en un recurso fundamental para la investigación temprana en IA generativa.
LAION-5B, publicado en marzo de 2022, amplió este enfoque con más de 5 mil millones de pares. En el momento de su publicación, era el conjunto de datos de libre acceso más grande de su tipo. El tamaño del conjunto de datos permitió el entrenamiento de modelos más sofisticados, incluido Stable Diffusion, que se convirtió en uno de los sistemas de texto a imagen de código abierto más utilizados. La construcción del conjunto de datos implicó un esfuerzo computacional significativo, incluidos procesos de filtrado y deduplicación para mejorar la calidad de los datos.
En agosto de 2024, LAION publicó una versión limpia del conjunto de datos llamada Re-LAION-5B, tras las preocupaciones sobre contenido dañino en la versión original. Este conjunto de datos actualizado tenía como objetivo abordar algunas de las críticas dirigidas a la publicación anterior, manteniendo al mismo tiempo su utilidad para la investigación en IA.
Desafíos legales
LAION se ha visto involucrada en varias disputas legales relacionadas con sus conjuntos de datos. En febrero de 2023, LAION fue mencionada en la demanda de Getty Images contra Stable Diffusion como parte no demandada. La demanda, presentada por Getty Images, alegaba que el proceso de entrenamiento de Stable Diffusion, que utilizaba LAION-5B, implicaba el uso no autorizado de imágenes con derechos de autor. LAION no fue demandada, pero se mencionó en el contexto del origen de los datos.
En abril de 2023, LAION fue demandada directamente por un fotógrafo alemán que solicitó que sus imágenes fueran eliminadas del conjunto de datos de entrenamiento. El fotógrafo argumentó que sus obras con derechos de autor estaban incluidas en LAION-5B sin su permiso. En septiembre de 2024, el Tribunal Regional de Hamburgo desestimó la demanda, en lo que se describió como un "fallo histórico sobre las excepciones de minería de texto y datos (TDM) para los datos de entrenamiento de IA" en Alemania y la UE en general. El fallo se consideró un precedente significativo para la legalidad del uso de datos extraídos de la web para el entrenamiento de IA según la ley de derechos de autor europea.
Estos procedimientos legales pusieron de relieve las tensiones más amplias entre el desarrollo de la IA y la ley de derechos de autor, un tema que sigue evolucionando a medida que los modelos de lenguaje grandes y otros sistemas de IA se vuelven más prevalentes. Los resultados de estos casos tienen implicaciones no solo para LAION, sino para todo el campo de la investigación abierta en IA.
Críticas y preocupaciones sobre el contenido
Varios estudios han demostrado que las imágenes en LAION-5B contienen contenido problemático, incluidos pares de imágenes y texto relacionados con violación, pornografía, estereotipos malignos, insultos racistas y étnicos, y otro material extremadamente problemático. Estos hallazgos plantearon preocupaciones sobre las implicaciones éticas del uso de dichos conjuntos de datos para el entrenamiento de IA, particularmente para modelos que se implementan en aplicaciones dirigidas al público.
Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles extraídos de sitios web públicos. Esto planteó preocupaciones sobre la privacidad, ya que las imágenes e información personal de individuos podrían incluirse sin su conocimiento o consentimiento.
En diciembre de 2023, el Observatorio de Internet de Stanford publicó un informe sobre LAION-5B que encontró 3,226 casos sospechosos de enlaces a material de abuso sexual infantil, de los cuales 1,008 fueron validados externamente. En respuesta, LAION eliminó temporalmente LAION-5B y LAION-400M, citando su "política de tolerancia cero hacia el contenido ilegal" y "una precaución adicional". La eliminación fue un paso significativo, ya que detuvo temporalmente el acceso a conjuntos de datos que se habían convertido en recursos estándar en la comunidad de investigación de IA.
La publicación de Re-LAION-5B en agosto de 2024 fue parte de los esfuerzos de LAION para abordar estos problemas. El conjunto de datos limpio tenía como objetivo filtrar contenido ilegal y dañino, preservando al mismo tiempo la utilidad del original para fines de investigación. Sin embargo, el incidente subrayó los desafíos de moderar conjuntos de datos a escala web y la necesidad de una vigilancia continua en la recopilación de datos para IA.
OpenAssistant
OpenAssistant fue un asistente de chat de código abierto basado en inteligencia artificial que podía comprender tareas, interactuar con sistemas de terceros y recuperar información de forma dinámica. El proyecto fue desarrollado por un grupo de voluntarios en colaboración con LAION. Uno de los objetivos del desarrollo incluía el acceso gratuito a modelos de lenguaje grandes que pudieran ejecutarse localmente en hardware de consumo, abordando las preocupaciones sobre la centralización de las capacidades de IA en las grandes corporaciones.
El proyecto contó con el respaldo de un esfuerzo mundial de crowdsourcing que involucró a más de 13,500 voluntarios que crearon 600,000 puntos de datos generados por humanos. Estos puntos de datos se utilizaron para entrenar los modelos del asistente, con el objetivo de crear una alternativa transparente y comunitaria a los chatbots propietarios. El 15 de abril de 2023, LAION y los colaboradores publicaron públicamente un asistente de chat de código abierto llamado OpenAssistant.
A pesar de su promesa inicial, el proyecto se ha cerrado desde entonces. Sin embargo, los conjuntos de datos y los modelos permanecen disponibles en Hugging Face, lo que permite a los investigadores continuar utilizando y construyendo sobre el trabajo. El legado del proyecto radica en su demostración de cómo el crowdsourcing puede utilizarse para crear datos y modelos de IA fuera de los entornos corporativos.
Impacto y legado
Los conjuntos de datos de LAION han tenido un impacto profundo en el campo de la inteligencia artificial, particularmente en el área de la generación de texto a imagen. Al proporcionar acceso abierto a conjuntos de datos a gran escala, LAION ha permitido que una amplia gama de investigadores y desarrolladores experimenten e implementen modelos de IA que de otro modo serían inaccesibles. El trabajo de la organización ha sido fundamental en el desarrollo de modelos de código abierto como Stable Diffusion, que se han convertido en puntos de referencia en el campo.
El enfoque de la organización también ha influido en los debates sobre la ética de los datos y los derechos de autor en la IA. Los desafíos legales y las preocupaciones sobre el contenido asociados con los conjuntos de datos de LAION han provocado discusiones sobre las responsabilidades de los creadores de conjuntos de datos y la necesidad de mejores herramientas de moderación de contenido. Estas discusiones han llevado a una mayor atención sobre cuestiones como la aumentación de datos y las técnicas de filtrado en la investigación de IA.
El modelo de desarrollo comunitario y de código abierto de LAION contrasta con los enfoques más cerrados de empresas como OpenAI y Google DeepMind. Aunque la organización ha enfrentado críticas significativas, sus contribuciones a la democratización de la investigación en IA son ampliamente reconocidas. A partir de 2025, LAION continúa operando, aunque sus actividades futuras pueden estar moldeadas por los debates legales y éticos en curso sobre los datos de entrenamiento de la IA.
Véase también
- Inteligencia artificial
- IA generativa
- Aprendizaje automático
- Modelo de lenguaje grande
- Inteligencia artificial y derechos de autor