LAION, abreviatura de Large-scale Artificial Intelligence Open Network, es una organización sin fines de lucro alemana fundada en 2021 por Christoph Schuhmann junto con un grupo distribuido de investigadores voluntarios. La misión central de la organización ha sido construir y publicar públicamente conjuntos de datos muy grandes que emparejan imágenes con sus descripciones de texto asociadas, extraídas de páginas web públicas, con el fin de brindar a investigadores fuera de los grandes laboratorios corporativos acceso a la escala de datos de entrenamiento que anteriormente solo estaba disponible dentro de empresas como OpenAI y Google.
Conjuntos de datos y su papel
Los lanzamientos más importantes de LAION fueron LAION-400M en 2021 y LAION-5B en 2022, conjuntos de datos de aproximadamente 400 millones y 5 mil millones de pares de imagen-texto respectivamente, filtrados mediante puntuación de similitud basada en CLIP contra páginas fuente extraídas en gran parte de índices relacionados con Common Crawl. LAION-5B se convirtió en la fuente principal de datos de entrenamiento para Stable Diffusion, el modelo de difusión lanzado por Stability AI en 2022, y también respaldó a OpenCLIP, una reproducción abierta del modelo CLIP original de OpenAI utilizado ampliamente para incrustación de imagen-texto y orientación en pipelines generativos posteriores, incluidas herramientas construidas alrededor de ControlNet y otras técnicas de condicionamiento.
El descubrimiento de CSAM y la limpieza
En diciembre de 2023, investigadores del Stanford Internet Observatory publicaron una auditoría que encontró que LAION-5B contenía un número pequeño pero no nulo de enlaces a material de abuso sexual infantil, identificados mediante coincidencia de hashes contra bases de datos conocidas de imágenes ilegales. Debido a que LAION distribuía solo URL y metadatos en lugar de alojar las imágenes en sí, el conjunto de datos no almacenaba directamente el contenido ilegal, pero el hallazgo implicaba que los modelos entrenados con el conjunto completo, incluidos los checkpoints de Stable Diffusion ampliamente utilizados, podrían haber sido influenciados por material problemático durante el entrenamiento. LAION eliminó el conjunto de datos de la distribución pública inmediatamente después del informe y trabajó con la Internet Watch Foundation y los investigadores de Stanford para filtrar los enlaces ofensivos antes de volver a publicar una versión limpia. El episodio se convirtió en un caso de estudio ampliamente citado en discusiones sobre ética de la IA y gobernanza de la IA en torno a los riesgos de los datos de entrenamiento ensamblados mediante scraping web automatizado a gran escala sin una moderación de contenido suficiente.
Impacto más amplio
A pesar de la controversia, los conjuntos de datos de LAION siguieron siendo infraestructura fundamental para la investigación abierta en IA generativa, y la organización continuó lanzando recursos adicionales, incluidos conjuntos de datos de audio y multilingües, posicionándose junto a grupos como EleutherAI como parte de un movimiento más amplio de datos abiertos destinado a mantener la investigación cercana a la frontera accesible fuera de un pequeño número de empresas bien financiadas. El incidente de CSAM impulsó conversaciones más amplias en la industria sobre estándares de auditoría de conjuntos de datos y contribuyó a un mayor escrutinio de los corpus de entrenamiento extraídos de la web utilizados en toda la industria de la IA generativa.