अंग्रेज़ी से अनुवादित

LAION (लार्ज-स्केल आर्टिफिशियल इंटेलिजेंस ओपन नेटवर्क) एक जर्मन गैर-लाभकारी संगठन है जो ओपन-सोर्स AI डेटासेट और मॉडल बनाता है, और LAION-5B जैसे बड़े इमेज-कैप्शन डेटासेट के लिए सबसे अधिक जाना जाता है, जिनका उपयोग स्टेबल डिफ्यूजन और इमेजेन जैसे टेक्स्ट-टू-इमेज मॉडल को प्रशिक्षित करने के लिए किया जाता है।

LAION (Large-scale Artificial Intelligence Open Network का संक्षिप्त रूप) एक जर्मन गैर-लाभकारी संगठन है जो खुले-स्रोत कृत्रिम बुद्धिमत्ता मॉडल और डेटासेट विकसित करता है। यह वेब से स्क्रैप किए गए चित्रों और कैप्शन के कई बड़े डेटासेट जारी करने के लिए सबसे अधिक जाना जाता है, जिनका उपयोग कई प्रमुख टेक्स्ट-टू-इमेज मॉडल, जिनमें स्टेबल डिफ्यूज़न और इमेजेन शामिल हैं, को प्रशिक्षित करने के लिए किया गया है। संगठन स्वयंसेवकों और शोधकर्ताओं के समुदाय-संचालित नेटवर्क के रूप में कार्य करता है, जिसका उद्देश्य AI प्रशिक्षण डेटा और मॉडल तक पहुंच को लोकतांत्रिक बनाना है।

Generative AI में बढ़ती रुचि के संदर्भ में स्थापित, LAION का काम प्रमुख AI कंपनियों द्वारा रखे गए मालिकाना डेटासेट के विकल्प प्रदान करने पर केंद्रित है। अपने डेटासेट को स्वतंत्र रूप से उपलब्ध कराकर, संगठन शोधकर्ताओं और छोटे संस्थाओं को कॉर्पोरेट संसाधनों पर निर्भर हुए बिना Machine learning अनुसंधान में भाग लेने में सक्षम बनाता है। इसकी गतिविधियों ने इसे AI प्रशिक्षण डेटा से संबंधित कानूनी और नैतिक बहसों के केंद्र में भी रखा है, विशेष रूप से कॉपीराइट और सामग्री मॉडरेशन के संबंध में।

इतिहास और स्थापना

LAION की स्थापना जर्मनी में एक गैर-लाभकारी संस्था के रूप में हुई थी, और इसका नाम Large-scale Artificial Intelligence Open Network के लिए खड़ा है। यह पहल AI शोधकर्ताओं और उत्साही लोगों के एक समुदाय से उभरी, जिन्होंने OpenAI जैसी वाणिज्यिक प्रयोगशालाओं द्वारा उपयोग किए जाने वाले डेटासेट के पैमाने को दोहराने की मांग की। संगठन के शुरुआती प्रयास सार्वजनिक रूप से उपलब्ध वेब डेटा से बड़े पैमाने पर इमेज-टेक्स्ट डेटासेट बनाने पर केंद्रित थे, एक ऐसा कार्य जिसके लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों और स्वयंसेवक समन्वय की आवश्यकता थी।

अगस्त 2021 में, LAION ने अपना पहला प्रमुख डेटासेट, LAION-400M जारी किया, जिसमें 400 मिलियन इमेज-कैप्शन जोड़े थे। यह डेटासेट 2014 और 2021 के बीच कॉमन क्रॉल द्वारा स्क्रैप किए गए वेबपेजों के एक यादृच्छिक उपसमुच्चय से प्राप्त किया गया था। यह रिलीज़ उस प्रक्रिया को फिर से बनाने की इच्छा से प्रेरित थी जिसका उपयोग OpenAI ने CLIP मॉडल को प्रशिक्षित करने के लिए 400 मिलियन इमेज-कैप्शन जोड़े एकत्र करने में किया था, क्योंकि OpenAI ने मॉडल के कोड और वेट्स को ओपन-सोर्स किया था लेकिन अपने प्रशिक्षण डेटासेट को नहीं। LAION-400M जल्दी ही Deep learning मॉडल पर काम करने वाले शोधकर्ताओं के लिए एक संसाधन बन गया, विशेष रूप से टेक्स्ट-टू-इमेज जनरेशन के क्षेत्र में।

मार्च 2022 में, LAION ने एक उत्तराधिकारी डेटासेट, LAION-5B जारी किया, जिसमें 5 बिलियन से अधिक इमेज-कैप्शन जोड़े शामिल थे। अपनी रिलीज़ के समय, यह अपनी तरह का सबसे बड़ा स्वतंत्र रूप से उपलब्ध डेटासेट था। LAION-5B का निर्माण डूडलबॉट, हगिंग फेस और स्टेबिलिटी AI द्वारा वित्त पोषित किया गया था, बाद वाली कंपनी स्टेबल डिफ्यूज़न टेक्स्ट-टू-इमेज मॉडल के पीछे थी, जिसे इस डेटासेट पर प्रशिक्षित किया गया था। यह रिलीज़ खुले AI अनुसंधान में एक महत्वपूर्ण मील का पत्थर साबित हुई, जिसने Neural network मॉडल को प्रशिक्षित करने के लिए डेटा का अभूतपूर्व पैमाना प्रदान किया।

इमेज डेटासेट

LAION के इमेज डेटासेट कॉमन क्रॉल से निर्मित होते हैं, जो स्क्रैप किए गए वेब पेजों का एक डेटासेट है। डेवलपर्स ने क्रॉल किए गए HTML में <img> टैग खोजे और उनके alt विशेषताओं को कैप्शन के रूप में माना। उन्होंने CLIP, एक Transformer (architecture)-आधारित मॉडल का उपयोग उन छवियों की पहचान करने और त्यागने के लिए किया जिनकी सामग्री उनके कैप्शन से मेल नहीं खाती थी। महत्वपूर्ण बात यह है कि LAION स्क्रैप की गई छवियों की सामग्री को होस्ट नहीं करता है; बल्कि, डेटासेट में छवियों की ओर इशारा करने वाले URL होते हैं, जिन्हें शोधकर्ताओं को स्वतंत्र रूप से डाउनलोड करना होता है।

LAION-400M, अगस्त 2021 में जारी, 2014 और 2021 के बीच स्क्रैप किए गए वेबपेजों से निकाले गए 400 मिलियन इमेज-कैप्शन जोड़े से बना था। इसका उपयोग इमेजेन को प्रशिक्षित करने के लिए किया गया था, जो 2022 में गूगल ब्रेन द्वारा घोषित एक टेक्स्ट-टू-इमेज मॉडल है, जिसे निजी आंतरिक डेटासेट के साथ संयोजन में उपयोग किया गया था। डेटासेट का पैमाना और पहुंच ने इसे प्रारंभिक Generative AI अनुसंधान के लिए एक आधारभूत संसाधन बना दिया।

LAION-5B, मार्च 2022 में जारी, 5 बिलियन से अधिक जोड़ों के साथ इस दृष्टिकोण का विस्तार किया। अपनी रिलीज़ के अनुसार, यह इमेज-कैप्शन जोड़ों का सबसे बड़ा स्वतंत्र रूप से उपलब्ध डेटासेट था। डेटासेट के आकार ने अधिक परिष्कृत मॉडलों के प्रशिक्षण को सक्षम किया, जिनमें स्टेबल डिफ्यूज़न शामिल है, जो सबसे व्यापक रूप से उपयोग किए जाने वाले ओपन-सोर्स टेक्स्ट-टू-इमेज सिस्टम में से एक बन गया। डेटासेट के निर्माण में महत्वपूर्ण कम्प्यूटेशनल प्रयास शामिल थे, जिसमें डेटा गुणवत्ता में सुधार के लिए फ़िल्टरिंग और डीडुप्लिकेशन प्रक्रियाएं शामिल थीं।

अगस्त 2024 में, LAION ने मूल में हानिकारक सामग्री के बारे में चिंताओं के बाद Re-LAION-5B नामक डेटासेट का एक साफ़ संस्करण जारी किया। इस अद्यतन डेटासेट का उद्देश्य पहले की रिलीज़ पर लगाई गई कुछ आलोचनाओं को संबोधित करना था, साथ ही AI अनुसंधान के लिए इसकी उपयोगिता बनाए रखना था।

कानूनी चुनौतियाँ

LAION अपने डेटासेट से संबंधित कई कानूनी विवादों में शामिल रहा है। फरवरी 2023 में, LAION को स्टेबल डिफ्यूज़न के खिलाफ गेटी इमेजेस मुकदमे में एक गैर-पक्ष के रूप में नामित किया गया था। गेटी इमेजेस द्वारा दायर मुकदमे में आरोप लगाया गया था कि स्टेबल डिफ्यूज़न की प्रशिक्षण प्रक्रिया, जिसमें LAION-5B का उपयोग किया गया था, में कॉपीराइट छवियों का अनधिकृत उपयोग शामिल था। LAION प्रतिवादी नहीं था, लेकिन डेटासेट की उत्पत्ति के संदर्भ में इसका उल्लेख किया गया था।

अप्रैल 2023 में, LAION पर सीधे एक जर्मन फोटोग्राफर द्वारा मुकदमा दायर किया गया, जिसने अपनी छवियों को प्रशिक्षण सेट से हटाने की मांग की। फोटोग्राफर ने तर्क दिया कि उनके कॉपीराइट कार्यों को बिना अनुमति के LAION-5B में शामिल किया गया था। सितंबर 2024 में, हैम्बर्ग के क्षेत्रीय न्यायालय ने मुकदमे को खारिज कर दिया, जिसे जर्मनी और यूरोपीय संघ में "AI प्रशिक्षण डेटा के लिए TDM [टेक्स्ट और डेटा माइनिंग] अपवादों पर ऐतिहासिक फैसला" के रूप में वर्णित किया गया। यह फैसला यूरोपीय कॉपीराइट कानून के तहत AI प्रशिक्षण के लिए वेब-स्क्रैप किए गए डेटा के उपयोग की वैधता के लिए एक महत्वपूर्ण मिसाल के रूप में देखा गया।

इन कानूनी कार्यवाहियों ने AI विकास और कॉपीराइट कानून के बीच व्यापक तनावों को उजागर किया, एक ऐसा विषय जो Large language model और अन्य AI प्रणालियों के अधिक प्रचलित होने के साथ विकसित होता रहता है। इन मामलों के परिणामों का न केवल LAION के लिए, बल्कि खुले AI अनुसंधान के पूरे क्षेत्र के लिए निहितार्थ हैं।

आलोचना और सामग्री संबंधी चिंताएँ

कई अध्ययनों से पता चला है कि LAION-5B में छवियों में समस्याग्रस्त सामग्री शामिल है, जिसमें बलात्कार, अश्लील साहित्य, दुर्भावनापूर्ण रूढ़िवादिता, नस्लवादी और जातीय अपमान, और अन्य अत्यंत समस्याग्रस्त सामग्री से संबंधित छवियां और पाठ जोड़े शामिल हैं। इन निष्कर्षों ने ऐसे डेटासेट का उपयोग करके AI प्रशिक्षण के नैतिक निहितार्थों के बारे में चिंताएं उठाईं, विशेष रूप से उन मॉडलों के लिए जो सार्वजनिक-सामना करने वाले अनुप्रयोगों में तैनात हैं।

बायरिशर रुंडफंक की एक जांच से पता चला कि LAION के डेटासेट, जो हगिंग फेस पर होस्ट किए गए हैं, में सार्वजनिक वेबसाइटों से एकत्र किए गए बड़ी मात्रा में निजी और संवेदनशील डेटा शामिल हैं। इसने गोपनीयता संबंधी चिंताएं उठाईं, क्योंकि व्यक्तियों की छवियां और व्यक्तिगत जानकारी उनके ज्ञान या सहमति के बिना शामिल की जा सकती हैं।

दिसंबर 2023 में, स्टैनफोर्ड इंटरनेट ऑब्जर्वेटरी ने LAION-5B पर एक रिपोर्ट जारी की जिसमें बाल यौन शोषण सामग्री के लिंक के 3,226 संदिग्ध उदाहरण पाए गए, जिनमें से 1,008 बाहरी रूप से मान्य किए गए थे। इसके जवाब में, LAION ने "अवैध सामग्री के लिए शून्य-सहिष्णुता नीति" और "अत्यधिक सावधानी" का हवाला देते हुए LAION-5B और LAION-400M को अस्थायी रूप से हटा दिया। यह कदम महत्वपूर्ण था, क्योंकि इसने उन डेटासेट तक पहुंच को अस्थायी रूप से रोक दिया जो AI अनुसंधान समुदाय में मानक संसाधन बन गए थे।

अगस्त 2024 में Re-LAION-5B की रिलीज़ इन मुद्दों को संबोधित करने के LAION के प्रयासों का हिस्सा थी। साफ़ किए गए डेटासेट का उद्देश्य अवैध और हानिकारक सामग्री को फ़िल्टर करना था, साथ ही अनुसंधान उद्देश्यों के लिए मूल की उपयोगिता को संरक्षित करना था। हालांकि, इस घटना ने वेब-स्केल डेटासेट को मॉडरेट करने की चुनौतियों और AI डेटा संग्रह में निरंतर सतर्कता की आवश्यकता को रेखांकित किया।

ओपनअसिस्टेंट

ओपनअसिस्टेंट एक कृत्रिम बुद्धिमत्ता ओपन-सोर्स चैट-आधारित सहायक था जो कार्यों को समझ सकता था, तीसरे पक्ष की प्रणालियों के साथ बातचीत कर सकता था, और ऐसा करने के लिए गतिशील रूप से जानकारी प्राप्त कर सकता था। यह परियोजना LAION के सहयोग से स्वयंसेवकों के एक समूह द्वारा विकसित की गई थी। विकास के लक्ष्यों में से एक में उपभोक्ता हार्डवेयर पर स्थानीय रूप से चलाए जा सकने वाले बड़े भाषा मॉडल तक मुफ्त पहुंच शामिल थी, जो बड़े निगमों में AI क्षमताओं के केंद्रीकरण के बारे में चिंताओं को संबोधित करती थी।

यह परियोजना एक विश्वव्यापी क्राउडसोर्सिंग प्रयास द्वारा समर्थित थी जिसमें 13,500 से अधिक स्वयंसेवक शामिल थे, जिन्होंने 600,000 मानव-जनित डेटा बिंदु बनाए। इन डेटा बिंदुओं का उपयोग सहायक के मॉडल को प्रशिक्षित करने के लिए किया गया था, जिसका उद्देश्य मालिकाना चैटबॉट के लिए एक पारदर्शी और समुदाय-संचालित विकल्प बनाना था। 15 अप्रैल 2023 को, LAION और योगदानकर्ताओं ने सार्वजनिक रूप से ओपनअसिस्टेंट नामक एक ओपन-सोर्स AI सहायक चैटबॉट जारी किया।

अपने प्रारंभिक वादे के बावजूद, परियोजना को तब से बंद कर दिया गया है। हालांकि, डेटासेट और मॉडल हगिंग फेस पर उपलब्ध रहते हैं, जिससे शोधकर्ताओं को काम का उपयोग और निर्माण जारी रखने की अनुमति मिलती है। परियोजना की विरासत इस प्रदर्शन में निहित है कि कॉर्पोरेट सेटिंग्स के बाहर AI प्रशिक्षण डेटा और मॉडल बनाने के लिए क्राउडसोर्सिंग का उपयोग कैसे किया जा सकता है।

प्रभाव और विरासत

LAION के डेटासेट का Artificial intelligence के क्षेत्र पर गहरा प्रभाव पड़ा है, विशेष रूप से टेक्स्ट-टू-इमेज जनरेशन के क्षेत्र में। बड़े पैमाने पर डेटासेट तक खुली पहुंच प्रदान करके, LAION ने शोधकर्ताओं और डेवलपर्स की एक विस्तृत श्रृंखला को AI मॉडल के साथ प्रयोग करने और तैनात करने में सक्षम बनाया है जो अन्यथा दुर्गम होते। संगठन का काम स्टेबल डिफ्यूज़न जैसे ओपन-सोर्स मॉडल के विकास में सहायक रहा है, जो क्षेत्र में बेंचमार्क बन गए हैं।

संगठन के दृष्टिकोण ने AI में डेटा नैतिकता और कॉपीराइट के बारे में बहसों को भी प्रभावित किया है। LAION के डेटासेट से जुड़ी कानूनी चुनौतियों और सामग्री संबंधी चिंताओं ने डेटासेट निर्माताओं की जिम्मेदारियों और बेहतर सामग्री मॉडरेशन उपकरणों की आवश्यकता के बारे में चर्चाओं को प्रेरित किया है। इन चर्चाओं ने AI अनुसंधान में Data Augmentation और फ़िल्टरिंग तकनीकों जैसे मुद्दों पर बढ़ते ध्यान को जन्म दिया है।

LAION का समुदाय-संचालित, ओपन-सोर्स विकास का मॉडल OpenAI और Google DeepMind जैसी कंपनियों के अधिक बंद दृष्टिकोणों के विपरीत है। हालांकि संगठन को महत्वपूर्ण आलोचना का सामना करना पड़ा है, AI अनुसंधान के लोकतंत्रीकरण में इसके योगदान को व्यापक रूप से स्वीकार किया जाता है। 2025 तक, LAION काम करना जारी रखता है, हालांकि इसकी भविष्य की गतिविधियां AI प्रशिक्षण डेटा के आसपास चल रही कानूनी और नैतिक बहसों से आकार ले सकती हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·open-source·datasets·nonprofit
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास