Traduit de l'anglais

LAION (Large-scale Artificial Intelligence Open Network) est une organisation allemande à but non lucratif qui crée des modèles d'IA et des ensembles de données open-source, surtout connue pour ses grands ensembles de données image-texte utilisés pour entraîner des modèles comme Stable Diffusion.

LAION (acronyme de Large-scale Artificial Intelligence Open Network) est une organisation allemande à but non lucratif qui développe des modèles et des ensembles de données d'intelligence artificielle open source. Elle est surtout connue pour avoir publié plusieurs grands ensembles de données d'images et de légendes extraites du web, qui ont été utilisés pour entraîner un certain nombre de modèles de texte-à-image très médiatisés, notamment Stable Diffusion et Imagen. L'organisation vise à démocratiser l'accès aux ressources d'IA, en fournissant aux chercheurs et aux développeurs des données et des outils librement disponibles.

Le travail de LAION s'inscrit dans le domaine plus large de l'intelligence artificielle et de l'apprentissage automatique, en se concentrant sur la création d'ensembles de données à grande échelle qui permettent l'entraînement de modèles sophistiqués. Ses ensembles de données sont devenus des ressources fondamentales pour la recherche en IA générative, en particulier dans le domaine de la synthèse texte-à-image.

Histoire et Fondation

LAION a été fondée en Allemagne en tant qu'organisation à but non lucratif pour promouvoir la recherche et le développement ouverts en intelligence artificielle. La date exacte de sa fondation n'est pas largement documentée, mais l'organisation a gagné en importance en 2021 avec la publication de son premier grand ensemble de données. Les fondateurs, un groupe de chercheurs et de passionnés d'IA, visaient à combler le manque d'ensembles de données à grande échelle disponibles publiquement pour entraîner des modèles comme CLIP d'OpenAI, qui avait été publié avec son code et ses poids, mais pas ses données d'entraînement.

L'organisation fonctionne selon un modèle basé sur le bénévolat, s'appuyant sur les contributions de la communauté de l'IA. Ses projets sont souvent financés par des partenariats et des dons d'entreprises et de particuliers partageant sa mission d'accès ouvert.

Ensembles de Données d'Images

LAION a publié publiquement plusieurs grands ensembles de données de paires image-légende, largement utilisés par les chercheurs en IA. Les données proviennent de Common Crawl, un ensemble de pages web extraites. Les développeurs ont recherché les balises <img> dans le HTML extrait et ont traité leurs attributs alt comme des légendes. Ils ont utilisé CLIP pour identifier et éliminer les images dont le contenu ne semblait pas correspondre à leurs légendes. LAION n'héberge pas le contenu des images extraites elles-mêmes ; plutôt, l'ensemble de données contient des URL pointant vers des images, que les chercheurs doivent télécharger eux-mêmes.

Le premier ensemble de données de ce type, LAION-400M, a été publié en août 2021 et comprenait 400 millions de paires image-légende. Les paires ont été extraites d'un sous-ensemble aléatoire de pages web extraites par Common Crawl entre 2014 et 2021. Il s'agissait d'une tentative de recréer le processus utilisé par OpenAI pour collecter les 400 millions de paires image-légende utilisées pour entraîner le modèle CLIP - l'entreprise avait choisi de rendre open source le code et les poids du modèle, mais pas son ensemble de données d'entraînement. Imagen, un modèle texte-à-image annoncé par Google Brain en 2022, a été entraîné sur LAION-400M en combinaison avec des ensembles de données internes privés.

Un successeur de plus de 5 milliards de paires, LAION-5B, a été publié en mars 2022. Au moment de sa publication, c'était le plus grand ensemble de données de paires image-légende librement disponible. Sa création a été financée par Doodlebot, Hugging Face et Stability AI, la société d'IA derrière le financement du modèle texte-à-image Stable Diffusion, qui a été entraîné sur cet ensemble.

OpenAssistant

OpenAssistant était un assistant conversationnel open source basé sur l'intelligence artificielle (IA) qui pouvait comprendre des tâches, interagir avec des systèmes tiers et récupérer des informations dynamiquement pour ce faire. Le projet a été développé par un groupe de bénévoles en collaboration avec LAION. L'un des objectifs du développement comprenait un accès gratuit à de grands modèles de langage pouvant être exécutés localement sur du matériel grand public. Le projet a été soutenu par un effort de crowdsourcing mondial impliquant plus de 13 500 bénévoles qui ont créé 600 000 points de données générés par des humains. Le projet a depuis été fermé ; cependant, les ensembles de données et les modèles restent disponibles sur Hugging Face.

Problèmes Juridiques et Éthiques

En février 2023, LAION a été nommée dans le procès de Getty Images contre Stable Diffusion en tant que non-partie. En avril 2023, LAION a été directement poursuivie par un photographe allemand qui souhaitait que ses images soient retirées de l'ensemble d'entraînement. En septembre 2024, le tribunal régional de Hambourg a rejeté le procès, dans ce qui a été décrit comme un « arrêt historique sur les exceptions TDM [text and data mining] pour les données d'entraînement d'IA » en Allemagne et dans l'UE plus généralement.

Critiques et Controverses

Plusieurs études montrent que les images de LAION-5B contiennent des paires d'images et de textes problématiques, notamment du viol, de la pornographie, des stéréotypes malveillants, des insultes racistes et ethniques, et d'autres contenus extrêmement problématiques.

Une enquête de Bayerischer Rundfunk a montré que les ensembles de données de LAION, hébergés sur Hugging Face, contiennent de grandes quantités de données privées et sensibles récoltées sur des sites web publics.

En décembre 2023, le Stanford Internet Observatory a publié un rapport sur LAION-5B qui a trouvé 3 226 cas suspects de liens vers du matériel d'abus sexuel sur enfants, dont 1 008 ont été validés en externe. En réponse, LAION a temporairement retiré LAION-5B et LAION-400M, citant sa « politique de tolérance zéro pour le contenu illégal » et « par excès de prudence ». En août 2024, LAION a publié un ensemble de données nettoyé appelé Re-LAION-5B.

Impact et Héritage

Les ensembles de données de LAION ont eu un impact significatif sur le domaine de l'IA, permettant aux chercheurs d'entraîner des modèles sans avoir besoin de données propriétaires. La publication de LAION-400M et LAION-5B a stimulé l'innovation dans la génération texte-à-image, avec des modèles comme Stable Diffusion devenant largement utilisés dans les applications de recherche et commerciales. L'engagement de l'organisation en faveur de l'open source a également influencé d'autres initiatives, comme le développement de grands modèles de langage open source.

Malgré les controverses, LAION continue d'être un acteur clé de l'écosystème de l'IA ouverte, fournissant des ressources essentielles pour faire progresser l'état de l'art. Sa victoire juridique en Allemagne a établi un précédent pour l'utilisation de données extraites du web dans l'entraînement de l'IA, ce qui pourrait avoir des implications plus larges pour l'industrie.

Orientations Futures

En 2025, LAION continue de travailler sur de nouveaux ensembles de données et modèles, en se concentrant sur l'amélioration de la qualité des données et la résolution des préoccupations éthiques. L'organisation participe également à des discussions sur la réglementation de l'IA et l'utilisation responsable des données. Ses projets en cours visent à équilibrer le besoin de données à grande échelle avec la protection des droits individuels et la prévention des contenus nuisibles.

Le rôle de LAION dans la communauté de l'IA reste vital, car il offre un contrepoids aux approches propriétaires des grandes entreprises technologiques comme OpenAI, Anthropic et Google DeepMind. En offrant des alternatives ouvertes, LAION contribue à garantir que le développement de l'IA reste accessible et transparent.

Voir Aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·open-source·non-profit·datasets
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique