LAION-5B est un ensemble de données ouvert à grande échelle de 5,85 milliards de paires image-texte, créé par l'organisation à but non lucratif LAION (Large-scale Artificial Intelligence Open Network). Publié en 2022, il s'agit de l'un des plus grands ensembles de données publiquement disponibles de ce type, et il a été largement utilisé pour entraîner des modèles génératifs tels que Stable Diffusion. C'est une ressource clé dans le domaine de l'intelligence artificielle et de l'apprentissage automatique.
Historique et création
LAION-5B a été précédé par LAION-400M, un ensemble de données de 400 millions de paires image-texte publié en août 2021. Le plus grand LAION-5B a été assemblé en explorant le corpus web Common Crawl, qui archive des milliards de pages web. L'équipe a utilisé un modèle CLIP, développé par OpenAI, pour calculer les plongements (embeddings) des images et de leur texte alternatif ou de leurs légendes associés. Les paires présentant une similarité cosinus élevée entre les plongements d'image et de texte ont été conservées, tandis que les paires de faible qualité ou non correspondantes ont été écartées. L'ensemble de données résultant a été publié en octobre 2022 dans un article intitulé « LAION-5B : Un ensemble de données ouvert à grande échelle pour l'entraînement de modèles image-texte de nouvelle génération ». Le processus de création s'est appuyé sur des techniques issues de l'apprentissage profond et des réseaux de neurones, en particulier l'architecture transformeur utilisée dans CLIP.
Composition et sous-ensembles
LAION-5B se compose de trois sous-ensembles : LAION-2B-en (2,32 milliards de paires en anglais), LAION-2B-multi (2,27 milliards de paires multilingues) et LAION-1B-nolang (1,26 milliard de paires sans filtrage linguistique). L'ensemble de données ne stocke pas directement les images ; il fournit plutôt des métadonnées telles que les URL des images, le texte alternatif, les dimensions et un score de similarité. Cette conception permet aux chercheurs de télécharger les images à la demande, mais elle implique également que certaines URL peuvent devenir inaccessibles avec le temps. Les sous-ensembles sont organisés pour soutenir la recherche en apprentissage multilingue et interlinguistique, ce qui est pertinent pour les grands modèles de langage et les systèmes multimodaux.
Applications
LAION-5B a été utilisé pour entraîner une variété de modèles d'IA générative. L'exemple le plus notable est Stable Diffusion, un modèle texte-image publié en août 2022 par Stability AI. Stable Diffusion utilise une architecture de diffusion latente avec un U-Net et des couches de attention croisée pour générer des images à partir de prompts textuels. Le modèle a été entraîné sur un sous-ensemble de LAION-5B et a démontré qu'une génération d'images de haute qualité pouvait être réalisée avec des données ouvertes et des méthodes open source. LAION-5B a également été utilisé pour entraîner des modèles image-texte, des modèles contrastifs et d'autres systèmes multimodaux. Il sert de référence pour évaluer les performances de ces modèles sur des données à grande échelle. L'échelle et la diversité de l'ensemble de données sont particulièrement précieuses pour les architectures basées sur l'attention multi-têtes, qui bénéficient de grandes quantités de données appariées.
Controverses et limites
L'ensemble de données a soulevé des préoccupations concernant la vie privée, le droit d'auteur et les biais. Étant dérivé d'explorations web, il contient des photos personnelles, des œuvres protégées par le droit d'auteur et du contenu potentiellement offensant ou nuisible. LAION a tenté de filtrer les éléments problématiques connus, mais l'ampleur même de l'ensemble de données rend la suppression complète difficile. En 2023, l'ensemble de données a été temporairement mis hors ligne après une plainte légale, bien qu'il ait ensuite été restauré avec un filtrage supplémentaire. Les chercheurs ont également noté que l'ensemble de données reflète les biais présents sur le web, y compris les stéréotypes de genre et raciaux. Ces problèmes sont courants dans les grands ensembles de données issus du web et restent un domaine de recherche actif.
Impact et héritage
LAION-5B est devenu une ressource standard dans la communauté IA open source. Il a démontré que des ensembles de données à grande échelle pouvaient être construits et partagés par une organisation bénévole, contrairement aux ensembles de données propriétaires détenus par des entreprises privées. L'ensemble de données a influencé les efforts ultérieurs pour créer des ensembles de données multimodaux ouverts et a permis une vague de recherche en IA générative et en apprentissage automatique. Sa publication a également mis en évidence l'importance de la gouvernance des données et la nécessité d'une curation responsable des ensembles de données.