अंग्रेज़ी से अनुवादित

LAION (लार्ज-स्केल आर्टिफिशियल इंटेलिजेंस ओपन नेटवर्क) एक जर्मन गैर-लाभकारी संगठन है जो ओपन-सोर्स AI मॉडल और डेटासेट बनाता है, जो अपने बड़े इमेज-टेक्स्ट डेटासेट के लिए सबसे प्रसिद्ध है, जिनका उपयोग स्टेबल डिफ्यूजन जैसे मॉडलों को प्रशिक्षित करने के लिए किया जाता है।

LAION (लार्ज-स्केल आर्टिफिशियल इंटेलिजेंस ओपन नेटवर्क का संक्षिप्त रूप) एक जर्मन गैर-लाभकारी संगठन है जो ओपन-सोर्स कृत्रिम बुद्धिमत्ता मॉडल और डेटासेट विकसित करता है। यह वेब से एकत्रित छवियों और कैप्शन के कई बड़े डेटासेट जारी करने के लिए सबसे अधिक जाना जाता है, जिनका उपयोग कई प्रमुख टेक्स्ट-टू-इमेज मॉडल, जिनमें स्टेबल डिफ्यूजन और इमेजेन शामिल हैं, को प्रशिक्षित करने के लिए किया गया है। संगठन का लक्ष्य एआई संसाधनों तक पहुंच को लोकतांत्रिक बनाना है, जिससे शोधकर्ताओं और डेवलपर्स को स्वतंत्र रूप से उपलब्ध डेटा और उपकरण मिल सकें।

LAION का कार्य कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के व्यापक क्षेत्र के भीतर स्थित है, जो बड़े पैमाने के डेटासेट के निर्माण पर केंद्रित है जो परिष्कृत मॉडलों के प्रशिक्षण को सक्षम बनाते हैं। इसके डेटासेट जनरेटिव एआई में अनुसंधान के लिए मूलभूत संसाधन बन गए हैं, विशेष रूप से टेक्स्ट-टू-इमेज संश्लेषण के क्षेत्र में।

इतिहास और स्थापना

LAION की स्थापना जर्मनी में एक गैर-लाभकारी संगठन के रूप में की गई थी ताकि कृत्रिम बुद्धिमत्ता में खुले अनुसंधान और विकास को बढ़ावा दिया जा सके। सटीक स्थापना तिथि व्यापक रूप से प्रलेखित नहीं है, लेकिन संगठन ने 2021 में अपने पहले प्रमुख डेटासेट के जारी होने के साथ प्रमुखता प्राप्त की। संस्थापक, एआई शोधकर्ताओं और उत्साही लोगों का एक समूह, जिसका उद्देश्य OpenAI के CLIP जैसे मॉडलों को प्रशिक्षित करने के लिए सार्वजनिक रूप से उपलब्ध बड़े पैमाने के डेटासेट की कमी को दूर करना था, जिसे कोड और वेट के साथ जारी किया गया था लेकिन इसके प्रशिक्षण डेटा के बिना।

संगठन एक स्वयंसेवक-आधारित मॉडल के साथ संचालित होता है, जो एआई समुदाय के योगदान पर निर्भर करता है। इसकी परियोजनाओं को अक्सर उन कंपनियों और व्यक्तियों से साझेदारी और दान के माध्यम से वित्त पोषित किया जाता है जो खुली पहुंच के इसके मिशन को साझा करते हैं।

छवि डेटासेट

LAION ने सार्वजनिक रूप से छवि-कैप्शन जोड़ों के कई बड़े डेटासेट जारी किए हैं, जिनका व्यापक रूप से एआई शोधकर्ताओं द्वारा उपयोग किया गया है। डेटा कॉमन क्रॉल से प्राप्त होता है, जो स्क्रैप किए गए वेब पेजों का एक डेटासेट है। डेवलपर्स ने क्रॉल किए गए HTML में <img> टैग खोजे और उनके alt विशेषताओं को कैप्शन के रूप में माना। उन्होंने उन छवियों की पहचान करने और त्यागने के लिए CLIP का उपयोग किया जिनकी सामग्री उनके कैप्शन से मेल नहीं खाती थी। LAION स्वयं स्क्रैप की गई छवियों की सामग्री होस्ट नहीं करता है; बल्कि, डेटासेट में छवियों की ओर इशारा करने वाले URL होते हैं, जिन्हें शोधकर्ताओं को स्वयं डाउनलोड करना पड़ता है।

ऐसा पहला डेटासेट, LAION-400M, अगस्त 2021 में जारी किया गया था और इसमें 400 मिलियन छवि-कैप्शन जोड़े शामिल थे। ये जोड़े 2014 और 2021 के बीच कॉमन क्रॉल द्वारा स्क्रैप किए गए वेबपेजों के एक यादृच्छिक उपसमूह से निकाले गए थे। यह OpenAI द्वारा CLIP मॉडल को प्रशिक्षित करने के लिए उपयोग किए गए 400 मिलियन छवि-कैप्शन जोड़े एकत्र करने की प्रक्रिया को फिर से बनाने का एक प्रयास था - कंपनी ने मॉडल के कोड और वेट को ओपन-सोर्स करना चुना था, लेकिन इसके प्रशिक्षण डेटासेट को नहीं। इमेजेन, 2022 में गूगल ब्रेन द्वारा घोषित एक टेक्स्ट-टू-इमेज मॉडल, को निजी आंतरिक डेटासेट के साथ संयोजन में LAION-400M पर प्रशिक्षित किया गया था।

5 बिलियन से अधिक जोड़ों का उत्तराधिकारी, LAION-5B, मार्च 2022 में जारी किया गया था। अपने जारी होने के समय, यह अस्तित्व में छवि-कैप्शन जोड़ों का सबसे बड़ा स्वतंत्र रूप से उपलब्ध डेटासेट था। इसका निर्माण डूडलबॉट, हगिंग फेस और स्टेबिलिटी एआई द्वारा वित्त पोषित किया गया था, जो स्टेबल डिफ्यूजन टेक्स्ट-टू-इमेज मॉडल के वित्त पोषण के पीछे की एआई कंपनी है, जिसे इस पर प्रशिक्षित किया गया था।

ओपनअसिस्टेंट

ओपनअसिस्टेंट एक कृत्रिम बुद्धिमत्ता (एआई) ओपन सोर्स चैट-आधारित सहायक था जो कार्यों को समझ सकता था, तीसरे पक्ष की प्रणालियों के साथ बातचीत कर सकता था और ऐसा करने के लिए गतिशील रूप से जानकारी प्राप्त कर सकता था। यह परियोजना LAION के सहयोग से स्वयंसेवकों के एक समूह द्वारा विकसित की गई थी। विकास के लक्ष्यों में से एक में बड़े भाषा मॉडलों तक मुफ्त पहुंच शामिल थी जिन्हें उपभोक्ता हार्डवेयर पर स्थानीय रूप से चलाया जा सकता है। यह परियोजना 13,500 से अधिक स्वयंसेवकों को शामिल करने वाले एक विश्वव्यापी क्राउडसोर्सिंग प्रयास द्वारा समर्थित थी, जिन्होंने 600k मानव-जनित डेटा बिंदु बनाए। यह परियोजना तब से बंद कर दी गई है; हालांकि, डेटासेट और मॉडल हगिंग फेस पर उपलब्ध हैं।

कानूनी और नैतिक मुद्दे

फरवरी 2023 में, LAION को स्टेबल डिफ्यूजन के खिलाफ गेटी इमेजेज मुकदमे में एक गैर-पक्ष के रूप में नामित किया गया था। अप्रैल 2023 में, LAION पर सीधे एक जर्मन फोटोग्राफर द्वारा मुकदमा दायर किया गया था जो अपनी छवियों को प्रशिक्षण सेट से हटाना चाहता था। सितंबर 2024 में, हैम्बर्ग के क्षेत्रीय न्यायालय ने मुकदमे को खारिज कर दिया, जिसे जर्मनी और यूरोपीय संघ में "एआई प्रशिक्षण डेटा के लिए टीडीएम [टेक्स्ट और डेटा माइनिंग] अपवादों पर ऐतिहासिक फैसला" के रूप में वर्णित किया गया था।

आलोचना और विवाद

कई अध्ययनों से पता चलता है कि LAION-5B में छवियों में बलात्कार, पोर्नोग्राफी, दुर्भावनापूर्ण रूढ़ियों, नस्लवादी और जातीय अपशब्दों और अन्य अत्यंत समस्याग्रस्त सामग्री के समस्याग्रस्त चित्र और पाठ जोड़े शामिल हैं।

बायरिशर रुंडफंक की एक जांच से पता चला कि LAION के डेटासेट, जो हगिंग फेस पर होस्ट किए गए हैं, में सार्वजनिक वेबसाइटों से एकत्रित निजी और संवेदनशील डेटा की बड़ी मात्रा शामिल है।

दिसंबर 2023 में, स्टैनफोर्ड इंटरनेट ऑब्जर्वेटरी ने LAION-5B पर एक रिपोर्ट जारी की जिसमें बाल यौन शोषण सामग्री के लिंक के 3,226 संदिग्ध उदाहरण पाए गए, जिनमें से 1,008 बाहरी रूप से मान्य किए गए थे। इसके जवाब में, LAION ने अपनी "अवैध सामग्री के लिए शून्य सहिष्णुता नीति" और "अत्यधिक सावधानी" का हवाला देते हुए अस्थायी रूप से LAION-5B और LAION-400M को हटा दिया। अगस्त 2024 में, LAION ने Re-LAION-5B नामक एक साफ किया हुआ डेटासेट जारी किया।

प्रभाव और विरासत

LAION के डेटासेट ने एआई के क्षेत्र पर महत्वपूर्ण प्रभाव डाला है, जिससे शोधकर्ताओं को मालिकाना डेटा की आवश्यकता के बिना मॉडलों को प्रशिक्षित करने में सक्षम बनाया गया है। LAION-400M और LAION-5B की रिलीज़ ने टेक्स्ट-टू-इमेज जनरेशन में नवाचार को बढ़ावा दिया है, जिसमें स्टेबल डिफ्यूजन जैसे मॉडल अनुसंधान और वाणिज्यिक अनुप्रयोगों दोनों में व्यापक रूप से उपयोग किए जा रहे हैं। ओपन सोर्स के प्रति संगठन की प्रतिबद्धता ने अन्य पहलों को भी प्रभावित किया है, जैसे कि ओपन-सोर्स बड़े भाषा मॉडल का विकास।

विवादों के बावजूद, LAION ओपन एआई पारिस्थितिकी तंत्र में एक प्रमुख खिलाड़ी बना हुआ है, जो अत्याधुनिक को आगे बढ़ाने के लिए आवश्यक संसाधन प्रदान करता है। जर्मनी में इसकी कानूनी जीत ने एआई प्रशिक्षण में वेब-स्क्रैप किए गए डेटा के उपयोग के लिए एक मिसाल कायम की है, जिसके उद्योग के लिए व्यापक निहितार्थ हो सकते हैं।

भविष्य की दिशाएँ

2025 तक, LAION नए डेटासेट और मॉडलों पर काम करना जारी रखता है, जिसमें डेटा गुणवत्ता में सुधार और नैतिक चिंताओं को संबोधित करने पर ध्यान केंद्रित किया गया है। संगठन एआई विनियमन और डेटा के जिम्मेदार उपयोग के बारे में चर्चाओं में भी शामिल है। इसकी चल रही परियोजनाओं का उद्देश्य बड़े पैमाने के डेटा की आवश्यकता को व्यक्तिगत अधिकारों की सुरक्षा और हानिकारक सामग्री की रोकथाम के साथ संतुलित करना है।

एआई समुदाय में LAION की भूमिका महत्वपूर्ण बनी हुई है, क्योंकि यह OpenAI, Anthropic, और Google DeepMind जैसी प्रमुख तकनीकी कंपनियों के मालिकाना दृष्टिकोणों का प्रतिकार प्रदान करता है। खुले विकल्पों की पेशकश करके, LAION यह सुनिश्चित करने में मदद करता है कि एआई विकास सुलभ और पारदर्शी बना रहे।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·open-source·non-profit·datasets
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास