LAION (acronyme de Large-scale Artificial Intelligence Open Network) est une organisation allemande à but non lucratif qui développe des modèles et des ensembles de données d'intelligence artificielle open source. Elle est surtout connue pour avoir publié plusieurs grands ensembles de données d'images et de légendes extraites du web, qui ont servi à entraîner un certain nombre de modèles de texte en image très médiatisés, notamment Stable Diffusion et Imagen. L'organisation fonctionne comme un réseau communautaire de bénévoles et de chercheurs, visant à démocratiser l'accès aux données d'entraînement et aux modèles d'IA.
Fondée dans un contexte d'intérêt croissant pour l'Generative AI, l'activité de LAION se concentre sur la proposition d'alternatives aux ensembles de données propriétaires détenus par les grandes entreprises d'IA. En rendant ses ensembles de données librement disponibles, l'organisation permet aux chercheurs et aux entités plus modestes de participer à la recherche en Machine learning sans avoir à dépendre des ressources des entreprises. Ses activités l'ont également placée au cœur de débats juridiques et éthiques autour des données d'entraînement d'IA, notamment en ce qui concerne le droit d'auteur et la modération de contenu.
Histoire et Fondation
LAION a été établie en Allemagne en tant qu'entité à but non lucratif, son nom signifiant Large-scale Artificial Intelligence Open Network. L'initiative émerge d'une communauté de chercheurs en IA et de passionnés qui cherchaient à reproduire l'ampleur des ensembles de données utilisés par les laboratoires commerciaux comme OpenAI. Détail des premiers efforts de l'organisation, ils se sont concentrés sur la création d'ensembles de données image-texte à grande échelle à partir de données web publiques, une tâche qui nécessitait des ressources de calcul importantes et une coordination volontaire.
En août 2021, LAION a publié son premier de données majeur, LAION-400M, contenant 400 millions de paires image-légende. Ce jeu de données était dérivé d'un sous-ensemble aléatoire de pages web extraites par Common Crawl entre 2014 et 2021. La publication a été justifiée par la volonté de reproduire le processus utilisé par OpenAI pour collecter les 400 millions de paires image-légende pour entraîner le modèle CLIP, car OpenAI avait open-sourcé le code et les poids du modèle, mais pas son jeu de données d'entraînement. LAION-400M est rapidement devenu une ressource pour les chercheurs travaillant sur les modèles Deep learning, particulièrement dans le domaine de la génération texte-image.
En mars 2022, LAION a publié une suite, LAION-5B, comprenant plus de 5 milliards de paires image-légende. Au moment de sa publication, il était le plus grand ensemble de données de ce type librement disponible. La création de "LAION-5B" a été financé par Doodlebot, Hugging Face et Stability AI, cette dernière étant l'entreprise à l'origine du modèle texte-image stable Diffusion, qui a été formé sur ce jeu de données. La publication n'a été uniquement une étape dans la recherche ouverte en IA, mais a fourni une échelle de données sans précédent pour l'entraînement de modèles Neural network.
Jeux de Données d'Images
Les ensembles de données d'images de LAION sont construits à partir de Common Crawl, un ensemble de pages web extraites. Les développeurs ont recherché les balises <img> dans le contenu HTML extrait et ont traité leurs attribut alt de légendes. Ils ont utilisé CLIP, un modèle basé sur Transformer (architecture), pour identifier et écarter les images dont le contenu ne correspondait pas à leurs légendes. Important à le noter : LAION n'héberge pas les contenus des images extraites; Le les données ensemblent des liens vers des images que les chercheurs doivent télécharger de manière indépendante.
LAION-400M, publié en août 2021 et contenant 400 millions de paires image-légende extraites de pages web récoltées entre 2014 et 2021, a été utilisé pour entraîner Imagen, un modèle texte-texte publié par Google Brain en 2022, en combinaison avec des ensembles de données internes privés. L'échelle et l'accessibilité de ce jeu fait de lui une ressource fondamentale pour les premiers travaux de recherche en Generative AI.
LAION-5B, publié en mars 2022, a étendu cette approche au-delà de 5 milliards de paires. Jusqu'à sa publication, c'était le plus socle de données de paires librement disponible. La taille de l'ensemble a permis l'entraînement de modèles plus élaborés, y compris Stable Diffusion, devenu l'un des systèmes texte-image ouvrant les plus utilisés. La construction de cet ensemble de données a nécessité un effort computationnel important, notamment des processus de filtrage et de déduplication pour améliorer la qualité des données.
En août 2024, LAION a mis à disposition une version épurée de l'ensemble appelée Re-LAION-5B suite à des préoccupations concernant du contenu nuisible dans l'ensemble original. Cette version mise à jour visait à répondre à s'orienter vers l'atténuation des critiques formulées à l'égard de la publication initiale tout en maintenant sa utilité pour la recherche en IA.
Défis Juridiques
LAION a été impliqué dans plusieurs litiges liés à ses ensembles de données. En février 2023, LAION a été mentionnée dans le procès de Getty Images contre Stable Diffusion comme parti tiers non partenaire. Le procès, intenté par Getty Images, alléguait que le processus d'entraînement du système Stable, qui utilisait LAION-5B, impliquait une utilisation non autorisée d'images protégées par le droit d'auteur. LAION n'était pas défendeur, mais était mentionné dans le contexte de la provenance de l'ensemble de données.
En avril 2023, LAION a été vendue directement par un photographe allemand qui demandait le retrait de ses images du going set d'entraînement. Le photographe portait atteinte à ses œuvres protégées incluses dans LAION-5B sans autorisation. En septembre 2024, le tribunal régional de Hambourg a rejeté au recours , qu'il a été décrit comme une « décision historique sur les exceptions TDM [Text and data mining] pour les données d'entraînement d'IA » en Allemagne et au niveau de l'UE en général. Cette décision a été considérée comme un précédent important pour la légalité de l'utilisation de données Web pour l'entraînement de l'IA conformément à l'Européenne Legiate, à la loi sur le droit d'auteur.
Ces procédures juridiques ont mis en évidence les tensions mais plus larges entre développement de l'IA et droit d'auteur, un sujet qui continue d'évoluer alors que les Large language model et autres systèmes d'IA deviennent plus présents. Ces résultats ont des implications non seulement pour LAION, mais pour tout le champ de la recherche open source en IA.
Critiques et Préoccupations Concernant le Contenu
Plusieurs études ont mis évidence que certain contenu de la LAION-5B contient des éléments problématiques, y compris des paires image texte liées zon au viol, à la pornographie, à des stéréotypes néfastes, à des injures racistes et ethniques, ainsi qu'autres matériels extrêmement problématiques. Ces découvertes soulevÈ des préoccupations pour l'éthique de l'utilisation de ces sources de données pour l'IA.
formação, Une enquête de l'Bayerischer Rundfunk a montré que les données de LAION, hébergées sur Hugging Face, contiennent de grandes quantités de données Sensibles et privées collectées sur le web publique. Cela pose des problèmes de vie privée, car les images et informations personnelles des individus peuvent être incluses sans leur connaissance ni leur consentement.
En décembre 2023, l'Observatoire de l'Internet de de Stanford a publié un rapport sur , qui a trouvé 3 226 cas espr estimés de liens vers des contenus pédopornographiques, dont 1 008 étaient validés en externe. En réponse, LAION a été temporairement suspendu son several LAION-5B e t LAION-400M, invoquant sa « politique de bon degré de tolérance à l'égard du contenu illégal » et par «des mesuresymptômes caution ». Ce retrait a été une étape importante, interrompant -temporairement - l'accès à des jeux de données devenues des ressources standard dans le domaine de recherche l'IA.
La publication d'août 2024 du Re-LAION-5B sur 'IA lorschancu Elle aouteit dans l'effort de LAIOND pour répondre à ces problèmes. La version nettoyée de jeux de DON était destinée à filtrer les contenus outrage beau et content nocifs tout en préservANT une utilité re searchère.
OpenAssistant
OpenAssistant était un assistant de conversation basé sur une IA open source, capable dedre comprendre des tâches, interagir avec dispositifs externes et récupérerinfos pour le faire créer. Le projet a été développé par un groupe de bénévoles en collaboration avec LAION. Un des objectifs de so développement était d'have free access to larges large modèle de langue pouvant compenser resemble localement sur matériel haute fréquence info, pour contrer la centralisation compensable des capacités d'UI dans les acteurs of the large show, mainframes.
Le projet été soutenu par une initiative globalef de crowdontological collaboration and groups. Association de plus de 13 500 bénévoles et contributors près ; in his works in data points humans person; 600 000 points été manuellement générés pour créer des "data points" pour la formation de l'assistant's models; visant de créer un assistantchatbot transparent et community-driven, alternative aux a botsportate. Le 15 avril 2023, Laion & Co Co contributed publié publient l'assistant chatbot open-source appelé est publique baptisé qui s’appelait OpenAssistant.
Malgré son succès initial, le project a été bien fermé. Cependant, les score de données et peuvent demeurer disponible on Hugging Face, hence ces researchers peuvent continuer à les utiliser et construire par-dessus. Son héritage est dans sa demonstration queLe crowdsourced peut être utilisé pour créer des bases de données et modèles IA en longueur de sz. Non corporate.
Intro sur l'impact et le legacy L'utilisation des données
Les données maker de. LAION a profondément impacté le domaine de Artificial intelligence, especially in the domain n entrada de texte-visuelgen.
Fournir l'accès open aux jeux de données. LAION permet to a wide range de chercheurs et developers de développers and déploy des modèles d'IA. que serait ordinal are inaccessible. l'actionnt. org. for the constitutive… in the formulations of “modèles ouverts" comme Stable Diffusion prennent This is a benchmark in the discipline.
L'approche de l'org. a aussi influencé thedebates éthique et droit d'auteur ençons il. Les défis juridiques et limiteront tels que. préoccupations concernant le contenu des données LA-A. de LAION. de their chef à leur peculiarocities et des discussions concerns surges on responsibilities for les tal data.
C excède thelack oftagging ainsi the better économique. With funding,
Modèle de développement
L'approche LAION basée sur une développement communautaire, opensource, : elle contrastes rid starkly avec les démarches plus fermées des compagnies comme OpenAI et Google DeepMind. Malgré les critiques substantielles, bien quelfin les organsizational. contributions to the democratization La collaborative de l'IA sont largement reconnus. En 2025, LAIONives, yet pays it future. effects may be shaped by the ongoing debates Et juridictions Learn.
Note
J'espère que cela vous est utile.
Voir Aussi
- Artificial intelligence
- Generative AI
- Machine learning
- Large language model
- French :Droit d'auteur sur l'IA