LAION, sigla para Large-scale Artificial Intelligence Open Network, é uma organização sem fins lucrativos alemã fundada em 2021 por Christoph Schuhmann juntamente com um grupo distribuído de pesquisadores voluntários. A missão central da organização tem sido construir e disponibilizar publicamente conjuntos de dados em grande escala que emparelham imagens com suas respectivas legendas de texto, extraídos de páginas públicas da web, a fim de dar a pesquisadores fora dos grandes laboratórios corporativos acesso ao tipo de escala de dados de treinamento que antes só estava disponível em empresas como OpenAI e Google.
Conjuntos de dados e seu papel
Os lançamentos mais relevantes da LAION foram o LAION-400M em 2021 e o LAION-5B em 2022, conjuntos de dados com aproximadamente 400 milhões e 5 bilhões de pares imagem-texto, respectivamente, filtrados usando pontuação de similaridade baseada em CLIP em relação a páginas de origem vindas em grande parte de índices relacionados ao Common Crawl. O LAION-5B se tornou a principal fonte de dados de treinamento para o Stable Diffusion, o modelo de difusão lançado pela Stability AI em 2022, e também apoiou o OpenCLIP, uma reprodução aberta do modelo CLIP original da OpenAI, amplamente utilizado para Embedding de imagem-texto e orientação em pipelines generativos downstream, incluindo ferramentas construídas em torno do ControlNet e outras técnicas de condicionamento.
A descoberta de CSAM e a limpeza
Em dezembro de 2023, pesquisadores do Stanford Internet Observatory publicaram uma auditoria que constatou que o LAION-5B continha um pequeno, porém não nulo, número de links para material de abuso sexual infantil, identificados por meio de correspondência de hashes contra bancos de dados conhecidos de imagens ilegais. Como a LAION distribuía apenas URLs e metadados, sem hospedar as imagens em si, o conjunto de dados não armazenava diretamente o conteúdo ilegal, mas a descoberta significava que modelos treinados no conjunto completo, incluindo checkpoints amplamente usados do Stable Diffusion, poderiam ter sido influenciados por material problemático durante o treinamento. A LAION removeu o conjunto de dados da distribuição pública imediatamente após o relatório e trabalhou com a Internet Watch Foundation e os pesquisadores de Stanford para filtrar os links ofensivos antes de relançar uma versão limpa. O episódio se tornou um estudo de caso amplamente citado em discussões sobre ética de IA e governança de IA em relação aos riscos de dados de treinamento montados por meio de raspagem automatizada da web em grande escala, sem moderação de conteúdo suficiente.
Impacto mais amplo
Apesar da controvérsia, os conjuntos de dados da LAION permaneceram como infraestrutura fundamental para a pesquisa aberta em IA generativa, e a organização continuou lançando recursos adicionais, incluindo conjuntos de dados de áudio e multilíngues, posicionando-se ao lado de grupos como a EleutherAI como parte de um movimento mais amplo de dados abertos destinado a manter a pesquisa de ponta acessível fora de um pequeno número de empresas bem financiadas. O incidente do CSAM gerou conversas mais amplas na indústria sobre padrões de auditoria de conjuntos de dados e contribuiu para um escrutínio maior dos corpora de treinamento raspados da web usados em toda a indústria de IA generativa.