Traducido del inglés

LAION (Large-scale Artificial Intelligence Open Network) es una organización alemana sin fines de lucro que crea modelos y conjuntos de datos de IA de código abierto, conocida principalmente por sus grandes conjuntos de datos de imagen-texto utilizados para entrenar modelos como Stable Diffusion.

LAION (acrónimo de Large-scale Artificial Intelligence Open Network) es una organización sin fines de lucro alemana que desarrolla modelos de inteligencia artificial y conjuntos de datos de código abierto. Es conocida principalmente por publicar varios conjuntos de datos a gran escala de imágenes y subtítulos extraídos de la web, que se han utilizado para entrenar una serie de modelos de texto a imagen de alto perfil, incluidos Stable Diffusion e Imagen. La organización tiene como objetivo democratizar el acceso a los recursos de IA, proporcionando a investigadores y desarrolladores datos y herramientas disponibles gratuitamente.

El trabajo de LAION se sitúa dentro del campo más amplio de la inteligencia artificial y el aprendizaje automático, centrándose en la creación de conjuntos de datos a gran escala que permiten el entrenamiento de modelos sofisticados. Sus conjuntos de datos se han convertido en recursos fundamentales para la investigación en IA generativa, particularmente en el área de la síntesis de texto a imagen.

Historia y Fundación

LAION fue fundada en Alemania como una organización sin fines de lucro para promover la investigación y el desarrollo abiertos en inteligencia artificial. La fecha exacta de fundación no está ampliamente documentada, pero la organización ganó prominencia en 2021 con el lanzamiento de su primer conjunto de datos importante. Los fundadores, un grupo de investigadores y entusiastas de la IA, tenían como objetivo abordar la falta de conjuntos de datos a gran escala disponibles públicamente para entrenar modelos como el CLIP de OpenAI, que se había publicado con código y pesos, pero no con sus datos de entrenamiento.

La organización opera con un modelo basado en voluntarios, dependiendo de las contribuciones de la comunidad de IA. Sus proyectos a menudo se financian a través de asociaciones y donaciones de empresas e individuos que comparten su misión de acceso abierto.

Conjuntos de Datos de Imágenes

LAION ha publicado varios conjuntos de datos a gran escala de pares de imagen-subtítulo, que han sido ampliamente utilizados por investigadores de IA. Los datos se derivan de Common Crawl, un conjunto de datos de páginas web extraídas. Los desarrolladores buscaron en el HTML extraído las etiquetas <img> y trataron sus atributos alt como subtítulos. Utilizaron CLIP para identificar y descartar imágenes cuyo contenido no parecía coincidir con sus subtítulos. LAION no aloja el contenido de las imágenes extraídas en sí; más bien, el conjunto de datos contiene URL que apuntan a imágenes, que los investigadores deben descargar ellos mismos.

El primer conjunto de datos de este tipo, LAION-400M, se publicó en agosto de 2021 y consistía en 400 millones de pares de imagen-subtítulo. Los pares se extrajeron de un subconjunto aleatorio de páginas web extraídas por Common Crawl entre 2014 y 2021. Fue un intento de recrear el proceso utilizado por OpenAI para recopilar los 400 millones de pares de imagen-subtítulo que utilizaron para entrenar el modelo CLIP - la empresa había elegido abrir el código y los pesos del modelo, pero no su conjunto de datos de entrenamiento. Imagen, un modelo de texto a imagen anunciado por Google Brain en 2022, se entrenó en LAION-400M en combinación con conjuntos de datos internos privados.

Un sucesor de más de 5 mil millones de pares, LAION-5B, se publicó en marzo de 2022. En el momento de su publicación, era el conjunto de datos de pares de imagen-subtítulo disponible gratuitamente más grande que existía. Su creación fue financiada por Doodlebot, Hugging Face y Stability AI, la empresa de IA detrás de la financiación del modelo de texto a imagen Stable Diffusion, que se entrenó en él.

OpenAssistant

OpenAssistant fue un asistente de chat de código abierto basado en inteligencia artificial (IA) que podía comprender tareas, interactuar con sistemas de terceros y recuperar información dinámicamente para hacerlo. El proyecto fue desarrollado por un grupo de voluntarios en colaboración con LAION. Uno de los objetivos del desarrollo incluía el acceso gratuito a grandes modelos de lenguaje que pudieran ejecutarse localmente en hardware de consumo. El proyecto contó con el respaldo de un esfuerzo mundial de crowdsourcing que involucró a más de 13,500 voluntarios que crearon 600,000 puntos de datos generados por humanos. El proyecto se ha cerrado desde entonces; sin embargo, los conjuntos de datos y modelos permanecen disponibles en Hugging Face.

Cuestiones Legales y Éticas

En febrero de 2023, LAION fue mencionada en la demanda de Getty Images contra Stable Diffusion como no parte. En abril de 2023, LAION fue demandada directamente por un fotógrafo alemán que quería que sus imágenes fueran eliminadas del conjunto de entrenamiento. En septiembre de 2024, el Tribunal Regional de Hamburgo desestimó la demanda, en lo que se describió como un "fallo histórico sobre las excepciones de TDM [minería de texto y datos] para datos de entrenamiento de IA" en Alemania y la UE en general.

Críticas y Controversias

Varios estudios muestran que las imágenes en LAION-5B contienen pares problemáticos de imágenes y texto de violación, pornografía, estereotipos malignos, insultos racistas y étnicos, y otro contenido extremadamente problemático.

Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles recopilados de sitios web públicos.

En diciembre de 2023, el Stanford Internet Observatory publicó un informe sobre LAION-5B que encontró 3,226 casos sospechosos de enlaces a material de abuso sexual infantil, con 1,008 de estos validados externamente. En respuesta, LAION eliminó temporalmente LAION-5B y LAION-400M citando su "política de tolerancia cero hacia contenido ilegal" y "un exceso de precaución". En agosto de 2024, LAION publicó un conjunto de datos limpio llamado Re-LAION-5B.

Impacto y Legado

Los conjuntos de datos de LAION han tenido un impacto significativo en el campo de la IA, permitiendo a los investigadores entrenar modelos sin necesidad de datos propietarios. El lanzamiento de LAION-400M y LAION-5B ha impulsado la innovación en la generación de texto a imagen, con modelos como Stable Diffusion que se han vuelto ampliamente utilizados tanto en investigación como en aplicaciones comerciales. El compromiso de la organización con el código abierto también ha influido en otras iniciativas, como el desarrollo de grandes modelos de lenguaje de código abierto.

A pesar de las controversias, LAION continúa siendo un actor clave en el ecosistema de IA abierta, proporcionando recursos que son esenciales para avanzar el estado del arte. Su victoria legal en Alemania ha sentado un precedente para el uso de datos extraídos de la web en el entrenamiento de IA, lo que podría tener implicaciones más amplias para la industria.

Direcciones Futuras

A partir de 2025, LAION continúa trabajando en nuevos conjuntos de datos y modelos, con un enfoque en mejorar la calidad de los datos y abordar las preocupaciones éticas. La organización también participa en discusiones sobre la regulación de la IA y el uso responsable de los datos. Sus proyectos en curso tienen como objetivo equilibrar la necesidad de datos a gran escala con la protección de los derechos individuales y la prevención de contenido dañino.

El papel de LAION en la comunidad de IA sigue siendo vital, ya que proporciona un contrapunto a los enfoques propietarios de las principales empresas tecnológicas como OpenAI, Anthropic y Google DeepMind. Al ofrecer alternativas abiertas, LAION ayuda a garantizar que el desarrollo de la IA siga siendo accesible y transparente.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·open-source·non-profit·datasets
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial