LAION-5B es un conjunto de datos abierto a gran escala de 5.850 millones de pares imagen-texto, creado por la organización sin fines de lucro LAION (Large-scale Artificial Intelligence Open Network). Publicado en 2022, es uno de los conjuntos de datos públicos más grandes de su tipo y se ha utilizado ampliamente para entrenar modelos generativos como Stable Diffusion. Es un recurso clave en el campo de la inteligencia artificial y el aprendizaje automático.
Historia y creación
LAION-5B fue precedido por LAION-400M, un conjunto de datos de 400 millones de pares imagen-texto publicado en agosto de 2021. El LAION-5B, más grande, se ensambló mediante el rastreo del corpus web Common Crawl, que archiva miles de millones de páginas web. El equipo utilizó un modelo CLIP, desarrollado por OpenAI, para calcular las incrustaciones de las imágenes y su texto alternativo o pies de foto asociados. Se conservaron los pares con alta similitud de coseno entre las incrustaciones de imagen y texto, mientras que se descartaron los pares de baja calidad o no coincidentes. El conjunto de datos resultante se publicó en octubre de 2022 en un artículo titulado "LAION-5B: An open large-scale dataset for training next generation image-text models". El proceso de creación se basó en técnicas de aprendizaje profundo y redes neuronales, en particular la arquitectura transformador utilizada en CLIP.
Composición y subconjuntos
LAION-5B consta de tres subconjuntos: LAION-2B-en (2.320 millones de pares en inglés), LAION-2B-multi (2.270 millones de pares multilingües) y LAION-1B-nolang (1.260 millones de pares sin filtro de idioma). El conjunto de datos no almacena imágenes directamente; en cambio, proporciona metadatos como URL de imágenes, texto alternativo, dimensiones y una puntuación de similitud. Este diseño permite a los investigadores descargar imágenes bajo demanda, pero también significa que algunas URL pueden volverse inaccesibles con el tiempo. Los subconjuntos están organizados para apoyar la investigación en aprendizaje multilingüe y translingüe, lo cual es relevante para los modelos de lenguaje de gran tamaño y los sistemas multimodales.
Aplicaciones
LAION-5B se ha utilizado para entrenar una variedad de modelos de IA generativa. El ejemplo más notable es Stable Diffusion, un modelo de texto a imagen lanzado en agosto de 2022 por Stability AI. Stable Diffusion utiliza una arquitectura de difusión latente con un U-Net y capas de atención cruzada para generar imágenes a partir de indicaciones de texto. El modelo se entrenó en un subconjunto de LAION-5B y demostró que se podía lograr una generación de imágenes de alta calidad con datos abiertos y métodos de código abierto. LAION-5B también se ha utilizado para entrenar modelos de imagen-texto, modelos contrastivos y otros sistemas multimodales. Sirve como punto de referencia para evaluar el rendimiento de dichos modelos en datos a gran escala. La escala y la diversidad del conjunto de datos son particularmente valiosas para las arquitecturas basadas en atención de múltiples cabezas, que se benefician de grandes cantidades de datos emparejados.
Controversias y limitaciones
El conjunto de datos ha suscitado preocupaciones en cuanto a privacidad, derechos de autor y sesgos. Debido a que se deriva de rastreos web, contiene fotos personales, obras de arte protegidas por derechos de autor y contenido potencialmente ofensivo o dañino. LAION ha intentado filtrar material problemático conocido, pero la enorme escala del conjunto de datos dificulta su eliminación completa. En 2023, el conjunto de datos se retiró temporalmente de línea tras una queja legal, aunque posteriormente se restauró con filtrado adicional. Los investigadores también han señalado que el conjunto de datos refleja los sesgos presentes en la web, incluidos los estereotipos de género y raza. Estos problemas son comunes en los conjuntos de datos web a gran escala y siguen siendo un área activa de investigación.
Impacto y legado
LAION-5B se ha convertido en un recurso estándar en la comunidad de IA de código abierto. Demostró que los conjuntos de datos a gran escala podían construirse y compartirse mediante una organización de voluntarios, en contraste con los conjuntos de datos propietarios mantenidos por empresas privadas. El conjunto de datos ha influido en esfuerzos posteriores para crear conjuntos de datos multimodales abiertos y ha permitido una ola de investigación en IA generativa y aprendizaje automático. Su publicación también puso de relieve la importancia de la gobernanza de datos y la necesidad de una curación responsable de conjuntos de datos.