Traduzido do inglês

LAION (Large-scale Artificial Intelligence Open Network) é uma organização sem fins lucrativos alemã que cria conjuntos de dados e modelos de IA de código aberto, sendo mais conhecida por grandes conjuntos de dados de imagem-legenda, como o LAION-5B, usados para treinar modelos de texto para imagem, como Stable Diffusion e Imagen.

LAION (acrónimo de Large-scale Artificial Intelligence Open Network) é uma organização alemã sem fins lucrativos que desenvolve modelos e conjuntos de dados de inteligência artificial de código aberto. É mais conhecida por publicar vários conjuntos de dados extensos de imagens e legendas extraídos da web, que têm sido usados para treinar diversos modelos de texto-a-imagem de alto perfil, incluindo Stable Diffusion e Imagen. A organização opera como uma rede comunitária de voluntários e pesquisadores, com o objetivo de democratizar o acesso a dados de treinamento e modelos de IA.

Fundada no contexto do crescente interesse pela IA generativa, o trabalho da LAION se concentra em fornecer alternativas aos conjuntos de dados proprietários detidos por grandes empresas de IA. Ao disponibilizar gratuitamente seus conjuntos de dados, a organização permite que pesquisadores e entidades menores participem na pesquisa de aprendizado automático sem depender de recursos corporativos. Suas atividades também a colocaram no centro de debates legais e éticos sobre os dados de treinamento de IA, particularmente em relação aos direitos de autor e à moderação de conteúdo.

História e Fundação

LAION foi estabelecida na Alemania como uma entidade sem fins lucrativos, com seu nome significando Large-scale Artificial Intelligence Open Network. A iniciativa surgiu de uma comunidade de pesquisadores e entusiastas de IA que buscava replicar a escala dos conjuntos de dados usados por laboratorios comerciais como OpenAI. Os primeiros esforços da organização se concentraron na construção de conjuntos de dados de imagem-texto em grande escala a partir de dados web públicos, uma tarefa que exigía recursos computacionais significativos e coordinação de voluntários.

Em agosto de 2021, LAION publicó seu primeiro conjunto de dados importante, LAION-400M, contendo 400 milhões de pares de imagem-legenda. Este conjunto de dados foi derivado de um subconjunto aleatório de páginas web rastreadas por Common Crawl entre 2014 e 2021. A publicação foi motivada pelo desejo de recriar o processo usado por OpenAI para coletar os 400 milhões de pares de imagem-legenda para treinar o modelo CLIP, já que OpenAI havia aberto o código e os pesos do modelo, mas não seu conjunto de dados de treinamento. LAION-400M rapidamente se tornó um recurso para pesquisadores que trabalhavam em modelos de aprendizado profundo, particularmente no campo da generación de texto-a-imagem.

Em março de 2022, LAION publicó um conjunto de dados sucessor, LAION-5B, que comprende más de 5 mil milhões de pares de imagem-legenda. No momento de sua publicação, era o maior conjunto de dados disponível gratuitamente de seu tipo. A criação de LAION-5B foi financiada por Doodlebot, Hugging Face e Stability AI, sendo esta última a empresa por trás do modelo de texto-a-imagem Stable Diffusion, que foi treinado neste conjunto de dados. A publicação marcó um hito significativo na pesquisa de IA aberta, proporcionando uma escala de dados sem precedentes para o treinamento de modelos de redes neurais.

Conjuntos de Dados de Imagem

Os conjuntos de dados de imagem da LAION são construidos a partir do Common Crawl, um conjunto de dados de páginas web rastreadas. Os desenvolvedores buscaram nos HTML rastreados etiquetas <img> e trataram seus atributos alt como legendas. Usaram CLIP, um modelo baseado em transformadores, para identificar e descartar imagens cujo conteúdo não parecia corresponder às suas legendas. É importante destacar que LAION não hospeda o conteúdo das imagens rastreadas; em vez disso, os conjuntos de dados contienen URLs que apuntan a las imágenes, que los investigadores deben descargar de forma independiente.

LAION-400M, publicado em agosto de 2021, consistía en 400 milhões de pares de imagem-legenda extraídos de páginas web rastreadas entre 2014 e 2021. Fue usado para treinar Imagen, un modelo de texto-a-imagem anunciado por Google Brain en 2022, en combinación con conjuntos de datos internos privados. La escala y accesibilidad del conjunto de datos lo convirtieron en un recurso fundamental para la investigación temprana de IA generativa.

LAION-5B, publicado em março de 2022, expandió este enfoque con más de 5 mil milhões de pares. En el momento de su publicación, era el mayor conjunto de datos disponible gratuitamente de pares de imagen-legenda que existía. El tamaño del conjunto de datos permitió el entrenamiento de modelos más sofisticados, incluido Stable Diffusion, que se convirtió en uno de los sistemas de texto-a-imagen de código abierto más utilizados. La construcción del conjunto de datos implicó un esfuerzo computacional significativo, incluidos procesos de filtrado y deduplicación para mejorar la calidad de los datos.

En agosto de 2024, LAION publicó una versión limpia del conjunto de datos llamada Re-LAION-5B, tras las preocupaciones sobre contenido dañino en el original. Este conjunto de datos actualizado buscaba abordar algunas de las críticas dirigidas a la publicación anterior, manteniendo al mismo tiempo su utilidad para la investigación en IA.

Desafíos Legales

LAION ha estado involucrada en varias disputas legales relacionadas con sus conjuntos de datos. En febrero de 2023, LAION fue mencionada en la demanda de Getty Images contra Stable Diffusion como parte no demandada. La demanda, presentada por Getty Images, alegaba que el proceso de entrenamiento de Stable Diffusion, que utilizaba LAION-5B, implicaba el uso no autorizado de imágenes protegidas por derechos de autor. LAION no era demandada, pero fue mencionada en el contexto de la procedencia del conjunto de datos.

En abril de 2023, LAION fue demandada directamente por un fotógrafo alemán que buscaba que sus imágenes fueran eliminadas del conjunto de entrenamiento. El fotógrafo argumentaba que sus obras protegidas por derechos de autor estaban incluidas en LAION-5B sin permiso. En septiembre de 2024, el Tribunal Regional de Hamburgo desestimó la demanda, en lo que se describió como un "fallo histórico sobre las excepciones de TDM [extracción de texto y datos] para datos de entrenamiento de IA" en Alemania y en la UE en general. El fallo fue visto como un precedente significativo para la legalidad del uso de datos extraídos de la web para el entrenamiento de IA bajo la ley de derechos de autor europea.

Estos procedimientos legales pusieron de relieve las tensiones más amplias entre el desarrollo de la IA y la ley de derechos de autor, un tema que sigue evolucionando a medida que los modelos de lenguaje extensos y otros sistemas de IA se vuelven más prevalentes. Los resultados de estos casos tienen implicaciones no solo para LAION, sino para todo el campo de la investigación de IA abierta.

Críticas y Preocupaciones sobre el Contenido

Varios estudios han demostrado que las imágenes en LAION-5B contienen contenido problemático, incluidos pares de imágenes y texto relacionados con violación, pornografía, estereotipos malignos, insultos racistas y étnicos, y otro material extremadamente problemático. Estos hallazgos plantearon preocupaciones sobre las implicaciones éticas del uso de tales conjuntos de datos para el entrenamiento de IA, particularmente para modelos que se implementan en aplicaciones orientadas al público.

Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles recopilados de sitios web públicos. Esto planteó preocupaciones sobre la privacidad, ya que las imágenes y la información personal de individuos podrían estar incluidas sin su conocimiento o consentimiento.

En diciembre de 2023, el Observatorio de Internet de Stanford publicó un informe sobre LAION-5B que encontró 3.226 casos sospechosos de enlaces a material de abuso sexual infantil, con 1.008 de ellos validados externamente. En respuesta, LAION retiró temporalmente LAION-5B y LAION-400M, citando su "política de tolerancia cero hacia el contenido ilegal" y "una precaución excesiva". La retirada fue un paso significativo, ya que detuvo temporalmente el acceso a conjuntos de datos que se habían convertido en recursos estándar en la comunidad de investigación de IA.

La publicación en agosto de 2024 de Re-LAION-5B fue parte de los esfuerzos de LAION para abordar estos problemas. El conjunto de datos limpio buscaba filtrar contenido ilegal y dañino, preservando al mismo tiempo la utilidad del original para fines de investigación. Sin embargo, el incidente subrayó los desafíos de moderar conjuntos de datos a escala web y la necesidad de una vigilancia continua en la recopilación de datos de IA.

OpenAssistant

OpenAssistant fue un asistente de chat de inteligencia artificial de código abierto que podía comprender tareas, interactuar con sistemas de terceros y recuperar información dinámicamente para hacerlo. El proyecto fue desarrollado por un grupo de voluntarios en colaboración con LAION. Uno de los objetivos del desarrollo incluía el acceso gratuito a modelos de lenguaje extensos que pudieran ejecutarse localmente en hardware de consumo, abordando las preocupaciones sobre la centralización de las capacidades de IA en grandes corporaciones.

El proyecto fue respaldado por un esfuerzo de crowdsourcing mundial que involucró a más de 13.500 voluntarios que crearon 600.000 puntos de datos generados por humanos. Estos puntos de datos se utilizaron para entrenar los modelos del asistente, con el objetivo de crear una alternativa transparente y impulsada por la comunidad a los chatbots propietarios. El 15 de abril de 2023, LAION y los colaboradores publicaron públicamente un chatbot asistente de IA de código abierto llamado OpenAssistant.

A pesar de su promesa inicial, el proyecto ha sido cerrado desde entonces. Sin embargo, los conjuntos de datos y modelos siguen disponibles en Hugging Face, lo que permite a los investigadores continuar utilizando y construyendo sobre el trabajo. El legado del proyecto radica en su demostración de cómo el crowdsourcing puede usarse para crear datos de entrenamiento y modelos de IA fuera de entornos corporativos.

Impacto y Legado

Los conjuntos de datos de LAION han tenido un impacto profundo en el campo de la inteligencia artificial, particularmente en el área de la generación de texto-a-imagen. Al proporcionar acceso abierto a conjuntos de datos a gran escala, LAION ha permitido que una amplia gama de investigadores y desarrolladores experimenten e implementen modelos de IA que de otro modo serían inaccesibles. El trabajo de la organización ha sido fundamental en el desarrollo de modelos de código abierto como Stable Diffusion, que se han convertido en puntos de referencia en el campo.

El enfoque de la organización también ha influido en los debates sobre ética de datos y derechos de autor en la IA. Los desafíos legales y las preocupaciones sobre el contenido asociados con los conjuntos de datos de LAION han provocado discusiones sobre las responsabilidades de los creadores de conjuntos de datos y la necesidad de mejores herramientas de moderación de contenido. Estas discusiones han llevado a una mayor atención sobre cuestiones como la aumento de datos y las técnicas de filtrado en la investigación de IA.

El modelo de desarrollo de código abierto impulsado por la comunidad de LAION contrasta con los enfoques más cerrados de empresas como OpenAI y Google DeepMind. Aunque la organización ha enfrentado críticas significativas, sus contribuciones a la democratización de la investigación en IA son ampliamente reconocidas. A partir de 2025, LAION continúa operando, aunque sus actividades futuras pueden estar moldeadas por los debates legales y éticos en curso sobre los datos de entrenamiento de IA.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·open-source·datasets·nonprofit
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico