Traduzido do inglês

LAION-5B é um conjunto de dados aberto em larga escala com 5,85 bilhões de pares imagem-texto, lançado em 2022 pela organização sem fins lucrativos LAION. Ele é amplamente utilizado para treinar modelos generativos, como o [[stable-diffusion|Stable Diffusion]].

LAION-5B é um conjunto de dados aberto em larga escala composto por 5,85 bilhões de pares de imagem-texto, criado pela organização sem fins lucrativos LAION (Large-scale Artificial Intelligence Open Network). Lançado em 2022, é um dos maiores conjuntos de dados publicamente disponíveis desse tipo e tem sido amplamente utilizado para treinar modelos generativos, como o Stable Diffusion. É um recurso essencial no campo da inteligência artificial e do aprendizado de máquina.

História e criação

O LAION-5B foi precedido pelo LAION-400M, um conjunto de dados com 400 milhões de pares de imagem-texto lançado em agosto de 2021. O LAION-5B, maior, foi montado por meio da varredura do corpus da web Common Crawl, que arquiva bilhões de páginas da internet. A equipe usou um modelo CLIP, desenvolvido pela OpenAI, para calcular embeddings de imagens e seus textos alternativos ou legendas associados. Pares com alta similaridade de cosseno entre os embeddings de imagem e texto foram mantidos, enquanto pares de baixa qualidade ou incompatíveis foram descartados. O conjunto de dados resultante foi publicado em outubro de 2022 em um artigo intitulado "LAION-5B: An open large-scale dataset for training next generation image-text models". O processo de criação dependeu de técnicas de aprendizado profundo e redes neurais, particularmente da arquitetura transformer usada no CLIP.

Composição e subconjuntos

O LAION-5B consiste em três subconjuntos: LAION-2B-en (2,32 bilhões de pares em inglês), LAION-2B-multi (2,27 bilhões de pares multilíngues) e LAION-1B-nolang (1,26 bilhões de pares sem filtragem de idioma). O conjunto de dados não armazena imagens diretamente; em vez disso, fornece metadados, como URLs de imagens, texto alternativo, dimensões e uma pontuação de similaridade. Esse design permite que pesquisadores baixem imagens sob demanda, mas também significa que alguns URLs podem se tornar inacessíveis ao longo do tempo. Os subconjuntos são organizados para apoiar pesquisas em aprendizado multilíngue e entre línguas, o que é relevante para modelos de linguagem de grande escala e sistemas multimodais.

Aplicações

O LAION-5B tem sido usado para treinar uma variedade de modelos de IA generativa. O exemplo mais notável é o Stable Diffusion, um modelo de texto para imagem lançado em agosto de 2022 pela Stability AI. O Stable Diffusion usa uma arquitetura de difusão latente com um U-Net e camadas de atenção cruzada para gerar imagens a partir de prompts de texto. O modelo foi treinado em um subconjunto do LAION-5B e demonstrou que a geração de imagens de alta qualidade poderia ser alcançada com dados abertos e métodos de código aberto. O LAION-5B também tem sido usado para treinar modelos de imagem-texto, modelos contrastivos e outros sistemas multimodais. Ele serve como referência para avaliar o desempenho desses modelos em dados em larga escala. A escala e a diversidade do conjunto de dados são particularmente valiosas para arquiteturas baseadas em atenção de múltiplas cabeças, que se beneficiam de grandes quantidades de dados pareados.

Controvérsias e limitações

O conjunto de dados levantou preocupações em relação a privacidade, direitos autorais e viés. Por ser derivado de varreduras da web, contém fotos pessoais, obras de arte protegidas por direitos autorais e conteúdo potencialmente ofensivo ou prejudicial. A LAION tentou filtrar material problemático conhecido, mas a escala imensa do conjunto de dados torna a remoção completa difícil. Em 2023, o conjunto de dados foi temporariamente retirado do ar após uma queixa legal, embora tenha sido posteriormente restaurado com filtragem adicional. Pesquisadores também notaram que o conjunto de dados reflete os vieses presentes na web, incluindo estereótipos de gênero e raciais. Essas questões são comuns a grandes conjuntos de dados extraídos da web e permanecem uma área ativa de pesquisa.

Impacto e legado

O LAION-5B se tornou um recurso padrão na comunidade de IA de código aberto. Ele demonstrou que conjuntos de dados em larga escala poderiam ser construídos e compartilhados por uma organização voluntária, em contraste com conjuntos de dados proprietários mantidos por empresas privadas. O conjunto de dados influenciou esforços subsequentes para criar conjuntos de dados multimodais abertos e possibilitou uma onda de pesquisa em IA generativa e aprendizado de máquina. Seu lançamento também destacou a importância da governança de dados e a necessidade de curadoria responsável de conjuntos de dados.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:datasets·image-text-pairs·multimodal-learning·open-source-ai
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico