Traduzido do inglês

LAION é uma organização sem fins lucrativos alemã que constrói e publica grandes conjuntos de dados abertos de pares imagem-texto extraídos da web pública, os quais sustentaram o treinamento do Stable Diffusion e dos modelos abertos de CLIP, e que posteriormente enfrentaram escrutínio após a descoberta de conteúdo ilegal em um de seus conjuntos de dados.

LAION, sigla para Large-scale Artificial Intelligence Open Network, é uma organização sem fins lucrativos alemã fundada em 2021 por Christoph Schuhmann juntamente com um grupo distribuído de pesquisadores voluntários. A missão central da organização tem sido construir e disponibilizar publicamente conjuntos de dados em grande escala que emparelham imagens com suas respectivas legendas de texto, extraídos de páginas públicas da web, a fim de dar a pesquisadores fora dos grandes laboratórios corporativos acesso ao tipo de escala de dados de treinamento que antes só estava disponível em empresas como OpenAI e Google.

Conjuntos de dados e seu papel

Os lançamentos mais relevantes da LAION foram o LAION-400M em 2021 e o LAION-5B em 2022, conjuntos de dados com aproximadamente 400 milhões e 5 bilhões de pares imagem-texto, respectivamente, filtrados usando pontuação de similaridade baseada em CLIP em relação a páginas de origem vindas em grande parte de índices relacionados ao Common Crawl. O LAION-5B se tornou a principal fonte de dados de treinamento para o Stable Diffusion, o modelo de difusão lançado pela Stability AI em 2022, e também apoiou o OpenCLIP, uma reprodução aberta do modelo CLIP original da OpenAI, amplamente utilizado para Embedding de imagem-texto e orientação em pipelines generativos downstream, incluindo ferramentas construídas em torno do ControlNet e outras técnicas de condicionamento.

A descoberta de CSAM e a limpeza

Em dezembro de 2023, pesquisadores do Stanford Internet Observatory publicaram uma auditoria que constatou que o LAION-5B continha um pequeno, porém não nulo, número de links para material de abuso sexual infantil, identificados por meio de correspondência de hashes contra bancos de dados conhecidos de imagens ilegais. Como a LAION distribuía apenas URLs e metadados, sem hospedar as imagens em si, o conjunto de dados não armazenava diretamente o conteúdo ilegal, mas a descoberta significava que modelos treinados no conjunto completo, incluindo checkpoints amplamente usados do Stable Diffusion, poderiam ter sido influenciados por material problemático durante o treinamento. A LAION removeu o conjunto de dados da distribuição pública imediatamente após o relatório e trabalhou com a Internet Watch Foundation e os pesquisadores de Stanford para filtrar os links ofensivos antes de relançar uma versão limpa. O episódio se tornou um estudo de caso amplamente citado em discussões sobre ética de IA e governança de IA em relação aos riscos de dados de treinamento montados por meio de raspagem automatizada da web em grande escala, sem moderação de conteúdo suficiente.

Impacto mais amplo

Apesar da controvérsia, os conjuntos de dados da LAION permaneceram como infraestrutura fundamental para a pesquisa aberta em IA generativa, e a organização continuou lançando recursos adicionais, incluindo conjuntos de dados de áudio e multilíngues, posicionando-se ao lado de grupos como a EleutherAI como parte de um movimento mais amplo de dados abertos destinado a manter a pesquisa de ponta acessível fora de um pequeno número de empresas bem financiadas. O incidente do CSAM gerou conversas mais amplas na indústria sobre padrões de auditoria de conjuntos de dados e contribuiu para um escrutínio maior dos corpora de treinamento raspados da web usados em toda a indústria de IA generativa.

Categorias:industry·open-source·datasets
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico