Traduit de l'anglais

LAION est une organisation à but non lucratif allemande qui crée et publie de grands ensembles de données ouverts de paires image-texte extraites du web public, qui ont sous-tendu l'entraînement de Stable Diffusion et des modèles CLIP ouverts, et qui ont ensuite fait l'objet d'un examen minutieux après la découverte de contenus illégaux dans l'un de ses ensembles de données.

LAION, acronyme de Large-scale Artificial Intelligence Open Network, est une organisation à but non lucratif allemande fondée en 2021 par Christoph Schuhmann avec un groupe distribué de chercheurs bénévoles. La mission centrale de l'organisation a été de construire et de publier publiquement de très grands ensembles de données associant des images à leurs légendes textuelles, extraites de pages web publiques, afin de donner aux chercheurs extérieurs aux grands laboratoires d'entreprise accès au type d'échelle de données d'entraînement qui n'était auparavant disponible qu'au sein d'entreprises comme OpenAI et Google.

Ensembles de données et leur rôle

Les publications les plus marquantes de LAION ont été LAION-400M en 2021 et LAION-5B en 2022, des ensembles de données d'environ 400 millions et 5 milliards de paires image-texte respectivement, filtrés à l'aide d'un score de similarité basé sur CLIP par rapport à des pages sources tirées en grande partie d'index liés à Common Crawl. LAION-5B est devenu la principale source de données d'entraînement pour Stable Diffusion, le modèle de diffusion publié par Stability AI en 2022, et il a également soutenu OpenCLIP, une reproduction ouverte du modèle CLIP original d'OpenAI, largement utilisée pour l'incorporation image-texte et l'orientation dans les pipelines génératifs en aval, y compris les outils construits autour de ControlNet et d'autres techniques de conditionnement.

La découverte du CSAM et le nettoyage

En décembre 2023, des chercheurs de l'Observatoire Internet de Stanford ont publié un audit révélant que LAION-5B contenait un petit nombre, mais non nul, de liens vers du matériel d'abus sexuel sur enfants, identifié par correspondance de hachage avec des bases de données d'images illégales connues. Étant donné que LAION distribuait uniquement des URL et des métadonnées plutôt que d'héberger les images elles-mêmes, l'ensemble de données ne stockait pas directement le contenu illégal, mais cette découverte signifiait que les modèles entraînés sur l'ensemble complet, y compris les points de contrôle Stable Diffusion largement utilisés, pouvaient plausiblement avoir été influencés par du matériel problématique pendant l'entraînement. LAION a retiré l'ensemble de données de la distribution publique immédiatement après le rapport et a travaillé avec la Internet Watch Foundation et les chercheurs de Stanford pour filtrer les liens problématiques avant de publier à nouveau une version nettoyée. Cet épisode est devenu une étude de cas largement citée dans les discussions sur éthique de l'IA et gouvernance de l'IA concernant les risques des données d'entraînement assemblées par extraction web automatisée à grande échelle sans modération de contenu suffisante.

Impact plus large

Malgré la controverse, les ensembles de données de LAION sont restés une infrastructure fondamentale pour la recherche ouverte en IA générative, et l'organisation a continué à publier des ressources supplémentaires, notamment des ensembles de données audio et multilingues, se positionnant aux côtés de groupes tels que EleutherAI dans le cadre d'un mouvement plus large de données ouvertes visant à maintenir la recherche de pointe accessible en dehors d'un petit nombre d'entreprises bien dotées en ressources. L'incident du CSAM a suscité des discussions plus larges dans l'industrie sur les normes d'audit des ensembles de données et a contribué à un examen accru des corpus d'entraînement extraits du web utilisés dans toute l'industrie de l'IA générative.

Catégories:industry·open-source·datasets
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique