LAION-5B 5.85 अरब छवि-पाठ जोड़ों का एक बड़े पैमाने पर खुला डेटासेट है, जिसे गैर-लाभकारी संगठन LAION (लार्ज-स्केल आर्टिफिशियल इंटेलिजेंस ओपन नेटवर्क) द्वारा बनाया गया है। 2022 में जारी, यह अपनी तरह के सबसे बड़े सार्वजनिक रूप से उपलब्ध डेटासेट में से एक है और इसका व्यापक रूप से स्टेबल डिफ्यूजन जैसे जनरेटिव मॉडल को प्रशिक्षित करने के लिए उपयोग किया गया है। यह कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में एक प्रमुख संसाधन है।
इतिहास और निर्माण
LAION-5B से पहले LAION-400M था, जो अगस्त 2021 में जारी 400 मिलियन छवि-पाठ जोड़ों का एक डेटासेट था। बड़ा LAION-5B कॉमन क्रॉल वेब कॉर्पस को क्रॉल करके तैयार किया गया था, जो अरबों वेब पेजों को संग्रहीत करता है। टीम ने OpenAI द्वारा विकसित CLIP मॉडल का उपयोग करके छवियों और उनके संबंधित ऑल्ट-टेक्स्ट या कैप्शन के एम्बेडिंग की गणना की। छवि और पाठ एम्बेडिंग के बीच उच्च कोसाइन समानता वाले जोड़े बनाए रखे गए, जबकि निम्न-गुणवत्ता या बेमेल जोड़े को हटा दिया गया। परिणामी डेटासेट अक्टूबर 2022 में "LAION-5B: An open large-scale dataset for training next generation image-text models" शीर्षक वाले एक पेपर में प्रकाशित किया गया था। निर्माण प्रक्रिया गहन शिक्षण और तंत्रिका नेटवर्क की तकनीकों पर निर्भर थी, विशेष रूप से CLIP में उपयोग किए जाने वाले ट्रांसफॉर्मर आर्किटेक्चर पर।
संरचना और उपसमुच्चय
LAION-5B में तीन उपसमुच्चय शामिल हैं: LAION-2B-en (2.32 अरब अंग्रेजी जोड़े), LAION-2B-multi (2.27 अरब बहुभाषी जोड़े), और LAION-1B-nolang (1.26 अरब जोड़े बिना भाषा फ़िल्टरिंग के)। डेटासेट सीधे छवियों को संग्रहीत नहीं करता है; इसके बजाय, यह छवि URL, ऑल्ट-टेक्स्ट, आयाम और समानता स्कोर जैसे मेटाडेटा प्रदान करता है। यह डिज़ाइन शोधकर्ताओं को मांग पर छवियों को डाउनलोड करने की अनुमति देता है, लेकिन इसका मतलब यह भी है कि कुछ URL समय के साथ दुर्गम हो सकते हैं। उपसमुच्चय बहुभाषी और क्रॉस-लिंगुअल लर्निंग में अनुसंधान का समर्थन करने के लिए आयोजित किए जाते हैं, जो बड़े भाषा मॉडल और मल्टीमॉडल सिस्टम के लिए प्रासंगिक है।
अनुप्रयोग
LAION-5B का उपयोग विभिन्न जनरेटिव एआई मॉडल को प्रशिक्षित करने के लिए किया गया है। सबसे उल्लेखनीय उदाहरण स्टेबल डिफ्यूजन है, जो अगस्त 2022 में स्टेबिलिटी एआई द्वारा जारी एक टेक्स्ट-टू-इमेज मॉडल है। स्टेबल डिफ्यूजन टेक्स्ट प्रॉम्प्ट से छवियां उत्पन्न करने के लिए यू-नेट और क्रॉस-अटेंशन परतों के साथ एक अव्यक्त प्रसार आर्किटेक्चर का उपयोग करता है। मॉडल को LAION-5B के एक उपसमुच्चय पर प्रशिक्षित किया गया था और यह प्रदर्शित किया कि खुले डेटा और ओपन-सोर्स तरीकों से उच्च-गुणवत्ता वाली छवि निर्माण प्राप्त किया जा सकता है। LAION-5B का उपयोग छवि-पाठ मॉडल, कंट्रास्टिव मॉडल और अन्य मल्टीमॉडल सिस्टम को प्रशिक्षित करने के लिए भी किया गया है। यह बड़े पैमाने पर डेटा पर ऐसे मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए एक मानदंड के रूप में कार्य करता है। डेटासेट का पैमाना और विविधता विशेष रूप से मल्टी-हेड अटेंशन-आधारित आर्किटेक्चर के लिए मूल्यवान है, जो बड़ी मात्रा में युग्मित डेटा से लाभान्वित होते हैं।
विवाद और सीमाएं
डेटासेट ने गोपनीयता, कॉपीराइट और पूर्वाग्रह के संबंध में चिंताएं उठाई हैं। चूंकि यह वेब क्रॉल से प्राप्त होता है, इसमें व्यक्तिगत तस्वीरें, कॉपीराइट कलाकृतियां और संभावित रूप से आपत्तिजनक या हानिकारक सामग्री शामिल है। LAION ने ज्ञात समस्याग्रस्त सामग्री को फ़िल्टर करने का प्रयास किया है, लेकिन डेटासेट का विशाल पैमाना पूर्ण निष्कासन को कठिन बनाता है। 2023 में, एक कानूनी शिकायत के बाद डेटासेट को अस्थायी रूप से ऑफ़लाइन ले लिया गया था, हालांकि इसे बाद में अतिरिक्त फ़िल्टरिंग के साथ बहाल कर दिया गया था। शोधकर्ताओं ने यह भी नोट किया है कि डेटासेट वेब पर मौजूद पूर्वाग्रहों को दर्शाता है, जिसमें लिंग और नस्लीय रूढ़ियां शामिल हैं। ये मुद्दे बड़े वेब-स्क्रैप किए गए डेटासेट में आम हैं और अनुसंधान का एक सक्रिय क्षेत्र बने हुए हैं।
प्रभाव और विरासत
LAION-5B ओपन-सोर्स एआई समुदाय में एक मानक संसाधन बन गया है। इसने प्रदर्शित किया कि बड़े पैमाने पर डेटासेट एक स्वयंसेवी संगठन द्वारा बनाए और साझा किए जा सकते हैं, निजी कंपनियों द्वारा रखे गए मालिकाना डेटासेट के विपरीत। डेटासेट ने खुले मल्टीमॉडल डेटासेट बनाने के बाद के प्रयासों को प्रभावित किया है और जनरेटिव एआई और मशीन लर्निंग में अनुसंधान की एक लहर को सक्षम किया है। इसकी रिलीज़ ने डेटा शासन के महत्व और जिम्मेदार डेटासेट क्यूरेशन की आवश्यकता पर भी प्रकाश डाला।