LAION (acrônimo para Large-scale Artificial Intelligence Open Network) é uma organização alemã sem fins lucrativos que desenvolve modelos e conjuntos de dados de inteligência artificial de código aberto. É mais conhecida por lançar vários grandes conjuntos de dados de imagens e legendas extraídos da web, que têm sido usados para treinar diversos modelos de texto para imagem de alto perfil, incluindo Stable Diffusion e Imagen. A organização visa democratizar o acesso a recursos de IA, fornecendo a pesquisadores e desenvolvedores dados e ferramentas disponíveis gratuitamente.
O trabalho da LAION está situado no campo mais amplo de inteligência artificial e aprendizado de máquina, com foco na criação de conjuntos de dados em grande escala que permitem o treinamento de modelos sofisticados. Seus conjuntos de dados se tornaram recursos fundamentais para a pesquisa em IA generativa, particularmente na área de síntese de texto para imagem.
História e Fundação
A LAION foi fundada na Alemanha como uma organização sem fins lucrativos para promover pesquisa e desenvolvimento abertos em inteligência artificial. A data exata de fundação não é amplamente documentada, mas a organização ganhou destaque em 2021 com o lançamento de seu primeiro grande conjunto de dados. Os fundadores, um grupo de pesquisadores e entusiastas de IA, visavam abordar a falta de conjuntos de dados públicos em grande escala para treinar modelos como o CLIP da OpenAI, que havia sido lançado com código e pesos, mas não com seus dados de treinamento.
A organização opera com um modelo baseado em voluntários, contando com contribuições da comunidade de IA. Seus projetos são frequentemente financiados por meio de parcerias e doações de empresas e indivíduos que compartilham sua missão de acesso aberto.
Conjuntos de Dados de Imagens
A LAION lançou publicamente vários grandes conjuntos de dados de pares imagem-legenda, amplamente utilizados por pesquisadores de IA. Os dados são derivados do Common Crawl, um conjunto de dados de páginas da web raspadas. Os desenvolvedores pesquisaram o HTML rastreado em busca de tags <img> e trataram seus atributos alt como legendas. Eles usaram o CLIP para identificar e descartar imagens cujo conteúdo não parecia corresponder às suas legendas. A LAION não hospeda o conteúdo das imagens raspadas em si; em vez disso, o conjunto de dados contém URLs que apontam para imagens, que os pesquisadores devem baixar por conta própria.
O primeiro desses conjuntos de dados, LAION-400M, foi lançado em agosto de 2021 e consistia em 400 milhões de pares imagem-legenda. Os pares foram extraídos de um subconjunto aleatório de páginas da web raspadas pelo Common Crawl entre 2014 e 2021. Foi uma tentativa de recriar o processo usado pela OpenAI para coletar os 400 milhões de pares imagem-legenda usados para treinar o modelo CLIP - a empresa havia optado por abrir o código e os pesos do modelo, mas não seu conjunto de dados de treinamento. Imagen, um modelo de texto para imagem anunciado pelo Google Brain em 2022, foi treinado no LAION-400M em combinação com conjuntos de dados internos privados.
Um sucessor com mais de 5 bilhões de pares, LAION-5B, foi lançado em março de 2022. Na época de seu lançamento, era o maior conjunto de dados de pares imagem-legenda disponível gratuitamente em existência. Sua criação foi financiada por Doodlebot, Hugging Face e Stability AI, a empresa de IA por trás do financiamento do modelo de texto para imagem Stable Diffusion, que foi treinado nele.
OpenAssistant
OpenAssistant foi um assistente de bate-papo de código aberto baseado em inteligência artificial (IA) que podia entender tarefas, interagir com sistemas de terceiros e recuperar informações dinamicamente para fazê-lo. O projeto foi desenvolvido por um grupo de voluntários em colaboração com a LAION. Um dos objetivos do desenvolvimento incluía acesso gratuito a grandes modelos de linguagem que pudessem ser executados localmente em hardware de consumo. O projeto foi apoiado por um esforço global de crowdsourcing envolvendo mais de 13.500 voluntários que criaram 600 mil pontos de dados gerados por humanos. O projeto foi posteriormente encerrado; no entanto, os conjuntos de dados e modelos permanecem disponíveis no Hugging Face.
Questões Legais e Éticas
Em fevereiro de 2023, a LAION foi nomeada no processo da Getty Images contra o Stable Diffusion como parte não envolvida. Em abril de 2023, a LAION foi diretamente processada por um fotógrafo alemão que queria ter suas imagens removidas do conjunto de treinamento. Em setembro de 2024, o Tribunal Regional de Hamburgo rejeitou o processo, no que foi descrito como uma "decisão histórica sobre exceções de TDM [mineração de texto e dados] para dados de treinamento de IA" na Alemanha e na UE em geral.
Críticas e Controvérsias
Vários estudos mostram que as imagens no LAION-5B contêm pares problemáticos de imagens e textos de estupro, pornografia, estereótipos malignos, insultos racistas e étnicos, e outro conteúdo extremamente problemático.
Uma investigação do Bayerischer Rundfunk mostrou que os conjuntos de dados da LAION, hospedados no Hugging Face, contêm grandes quantidades de dados privados e sensíveis coletados de sites públicos.
Em dezembro de 2023, o Stanford Internet Observatory divulgou um relatório sobre o LAION-5B que encontrou 3.226 casos suspeitos de links para material de abuso sexual infantil, com 1.008 deles validados externamente. Em resposta, a LAION removeu temporariamente o LAION-5B e o LAION-400M, citando sua "política de tolerância zero para conteúdo ilegal" e "por excesso de cautela". Em agosto de 2024, a LAION lançou um conjunto de dados limpo chamado Re-LAION-5B.
Impacto e Legado
Os conjuntos de dados da LAION tiveram um impacto significativo no campo da IA, permitindo que pesquisadores treinassem modelos sem a necessidade de dados proprietários. O lançamento do LAION-400M e do LAION-5B estimulou a inovação na geração de texto para imagem, com modelos como o Stable Diffusion se tornando amplamente usados tanto em pesquisas quanto em aplicações comerciais. O compromisso da organização com o código aberto também influenciou outras iniciativas, como o desenvolvimento de grandes modelos de linguagem de código aberto.
Apesar das controvérsias, a LAION continua sendo um ator-chave no ecossistema aberto de IA, fornecendo recursos essenciais para avançar o estado da arte. Sua vitória legal na Alemanha estabeleceu um precedente para o uso de dados raspados da web no treinamento de IA, o que pode ter implicações mais amplas para a indústria.
Direções Futuras
Em 2025, a LAION continua trabalhando em novos conjuntos de dados e modelos, com foco em melhorar a qualidade dos dados e abordar preocupações éticas. A organização também está envolvida em discussões sobre regulamentação de IA e uso responsável de dados. Seus projetos em andamento visam equilibrar a necessidade de dados em grande escala com a proteção dos direitos individuais e a prevenção de conteúdo prejudicial.
O papel da LAION na comunidade de IA permanece vital, pois fornece um contraponto às abordagens proprietárias das principais empresas de tecnologia como OpenAI, Anthropic e Google DeepMind. Ao oferecer alternativas abertas, a LAION ajuda a garantir que o desenvolvimento de IA permaneça acessível e transparente.
Ver Também
- Inteligência artificial
- Aprendizado de máquina
- IA generativa
- Grande modelo de linguagem
- Stable Diffusion
- Hugging Face
- Common Crawl
- CLIP
- Texto para imagem
- Código aberto
- Raspagem de dados
- Direitos autorais
- Ética da IA
- Regulamentação de IA
- Sem fins lucrativos