अंग्रेज़ी से अनुवादित

LAION-400M एक बड़े पैमाने का खुला डेटासेट है जिसमें 400 मिलियन छवि-पाठ जोड़े शामिल हैं, जिसे LAION गैर-लाभकारी संगठन द्वारा बहुविध AI मॉडलों के खुले अनुसंधान और प्रशिक्षण को सक्षम करने के लिए बनाया गया था। इसे 2021 में जारी किया गया था और यह दृष्टि-भाषा मॉडलों के प्रशिक्षण के लिए व्यापक रूप से उपयोग किया जाता है।

LAION-400M एक बड़े पैमाने का खुला डेटासेट है जिसमें 40 करोड़ इमेज-टेक्स्ट जोड़े शामिल हैं, जिसे LAION गैर-लाभकारी संगठन द्वारा तैयार किया गया है। अगस्त 2021 में जारी, इसे कृत्रिम बुद्धिमत्ता में खुले अनुसंधान और विकास को सुविधाजनक बनाने के लिए डिज़ाइन किया गया था, विशेष रूप से मल्टीमॉडल मॉडलों के प्रशिक्षण के लिए जो दृश्य और पाठ्य जानकारी को संरेखित करते हैं। यह डेटासेट अपने पैमाने, पहुंच और डेटा तक पहुंच को लोकतांत्रिक बनाने में अपनी भूमिका के लिए उल्लेखनीय है, जो पहले केवल बड़े निगमों के लिए उपलब्ध था।

डेटासेट का निर्माण सार्वजनिक वेब पेजों को क्रॉल करके और इमेज और alt-text जोड़े निकालकर किया गया था, इसके बाद निम्न-गुणवत्ता या बेमेल जोड़ों को हटाने के लिए एक फ़िल्टरिंग प्रक्रिया लागू की गई। यह दृष्टिकोण OpenAI के CLIP जैसे स्वामित्व वाले डेटासेट के लिए उपयोग की जाने वाली पद्धति को दर्शाता है, लेकिन पूरी तरह से खुले लाइसेंस के साथ। LAION-400M कई बाद की AI परियोजनाओं के लिए एक आधारभूत संसाधन के रूप में कार्य करता है, जिसमें Stable Diffusion का प्रशिक्षण शामिल है, जो एक लोकप्रिय टेक्स्ट-टू-इमेज मॉडल है।

संरचना और क्यूरेशन

LAION-400M में ठीक 40 करोड़ इमेज-टेक्स्ट जोड़े शामिल हैं, जो एक वेब क्रॉल से प्राप्त किए गए हैं। क्यूरेशन पाइपलाइन में कई चरण शामिल थे: पहले, सार्वजनिक रूप से उपलब्ध वेब पेजों से इमेज और उनसे जुड़े alt-text या कैप्शन एकत्र किए गए। फिर, एक पूर्व-प्रशिक्षित CLIP मॉडल (विशेष रूप से OpenAI का ViT-B/32) का उपयोग करके प्रत्येक इमेज और उसके टेक्स्ट के बीच समानता को स्कोर करने के लिए एक फ़िल्टरिंग प्रक्रिया लागू की गई। कम समानता स्कोर वाले जोड़ों को हटा दिया गया, यह सुनिश्चित करते हुए कि शेष डेटा में दृश्य सामग्री और पाठ्य विवरण के बीच उचित संरेखण हो।

इसके अतिरिक्त, डेटासेट में मूल URL, इमेज आयाम और टेक्स्ट लंबाई जैसे मेटाडेटा शामिल हैं, जो डाउनस्ट्रीम कार्यों के लिए उपयोगी हैं। फ़िल्टरिंग ने डुप्लिकेट इमेज और टेक्स्ट को भी हटा दिया, जिससे अतिरेक कम हुआ। अंतिम डेटासेट Parquet फ़ाइलों और इमेज URL के सेट के रूप में वितरित किया जाता है, जिससे उपयोगकर्ता स्वयं इमेज डाउनलोड कर सकते हैं, जो डेटासेट के आकार को प्रबंधनीय रखता है जबकि पूरी सामग्री को संरक्षित करता है।

AI अनुसंधान में महत्व

LAION-400M की रिलीज़ ने खुले AI अनुसंधान में एक महत्वपूर्ण मोड़ चिह्नित किया। इसकी उपलब्धता से पहले, बड़े पैमाने पर विज़न-भाषा मॉडलों के प्रशिक्षण के लिए स्वामित्व वाले डेटासेट तक पहुंच की आवश्यकता होती थी, जो अक्सर OpenAI या Google DeepMind जैसी कंपनियों के पास होते थे। LAION-400M ने एक सार्वजनिक विकल्प प्रदान किया, जिससे शैक्षणिक संस्थानों और स्वतंत्र शोधकर्ताओं को पैमाने पर मॉडलों के साथ प्रयोग करने में सक्षम बनाया गया। इसे सैकड़ों पेपरों में उद्धृत किया गया है और यह कई प्रभावशाली मॉडलों के प्रशिक्षण में एक प्रमुख घटक है, जिसमें Stable Diffusion और विभिन्न CLIP वेरिएंट शामिल हैं।

डेटासेट ने डेटा शासन, लाइसेंसिंग और वेब-स्क्रैप किए गए डेटा के उपयोग के नैतिक निहितार्थों के बारे में चर्चाओं को भी प्रेरित किया। जबकि इमेज सार्वजनिक रूप से उपलब्ध हैं, उनकी कॉपीराइट स्थिति भिन्न होती है, और LAION को संभावित कॉपीराइट उल्लंघन के लिए जांच का सामना करना पड़ा है। जवाब में, LAION ने जोर दिया है कि डेटासेट URL और मेटाडेटा का संग्रह है, न कि स्वयं इमेज, और सामग्री हटाने के लिए उपकरण प्रदान किए हैं।

तकनीकी विशिष्टताएँ

LAION-400M एक प्रारूप में संग्रहीत है जिसमें प्रत्येक जोड़े के लिए एक अद्वितीय पहचानकर्ता, इमेज URL, टेक्स्ट कैप्शन और चौड़ाई, ऊंचाई और समानता स्कोर जैसे अतिरिक्त मेटाडेटा शामिल हैं। डेटासेट को कुशल डाउनलोडिंग और प्रोसेसिंग के लिए कई शार्ड्स में विभाजित किया गया है। उपयोगकर्ता आमतौर पर मेटाडेटा फ़ाइलें डाउनलोड करते हैं और फिर मांग पर इमेज प्राप्त करते हैं, जो लचीले भंडारण और बैंडविड्थ प्रबंधन की अनुमति देता है।

प्रशिक्षण के लिए, डेटासेट का उपयोग अक्सर PyTorch और TensorFlow जैसे फ्रेमवर्क के साथ किया जाता है, और यह मानक डेटा लोडर के साथ संगत है। टेक्स्ट अंग्रेजी में है, और इमेज प्राकृतिक दृश्यों से लेकर अमूर्त कला तक कई श्रेणियों को कवर करती हैं। औसत इमेज रिज़ॉल्यूशन लगभग 400x400 पिक्सेल है, हालांकि यह काफी भिन्न होता है।

प्रभाव और विरासत

LAION-400M का मशीन लर्निंग के क्षेत्र पर स्थायी प्रभाव पड़ा है। इसने ओपन-सोर्स टेक्स्ट-टू-इमेज जनरेशन के विकास को सक्षम किया, जो पहले बंद प्रणालियों द्वारा प्रभुत्व था। इस डेटा पर प्रशिक्षित मॉडलों की सफलता ने प्रदर्शित किया कि स्वामित्व वाले डेटासेट के बिना उच्च-गुणवत्ता वाले परिणाम प्राप्त किए जा सकते हैं, जिससे आगे की खुली डेटा पहलों को प्रोत्साहन मिला। इसने LAION-5B जैसे बड़े उत्तराधिकारियों के निर्माण को भी जन्म दिया, जिसमें 5 अरब जोड़े शामिल हैं।

डेटासेट का उपयोग इमेज जनरेशन के अलावा विभिन्न अनुप्रयोगों में किया गया है, जिसमें इमेज वर्गीकरण, दृश्य प्रश्न उत्तर और क्रॉस-मोडल पुनर्प्राप्ति शामिल हैं। इसकी उपलब्धता ने मॉडल व्याख्या और पूर्वाग्रह पर अनुसंधान को भी सुविधाजनक बनाया है, क्योंकि शोधकर्ता यह समझने के लिए डेटा का विश्लेषण कर सकते हैं कि मॉडल क्या सीखते हैं।

विवाद और नैतिक विचार

LAION-400M के उपयोग ने सहमति और कॉपीराइट के बारे में नैतिक प्रश्न उठाए हैं। डेटासेट में कई इमेज व्यक्तिगत ब्लॉग, सोशल मीडिया और अन्य वेबसाइटों से बिना स्पष्ट अनुमति के स्क्रैप की गई हैं। जबकि डेटासेट अनुसंधान के लिए है, इसका उपयोग वाणिज्यिक उत्पादों में किया गया है, जिससे कानूनी चुनौतियाँ उत्पन्न हुई हैं। 2023 में, कई कलाकारों ने ऐसे डेटा पर प्रशिक्षित मॉडलों का उपयोग करने वाली कंपनियों के खिलाफ मुकदमे दायर किए, जिसमें उनके कार्यों के अनधिकृत उपयोग का हवाला दिया गया।

LAION ने व्यक्तियों को डेटासेट से अपनी इमेज हटाने का अनुरोध करने के लिए एक तंत्र प्रदान करके और इस बात पर जोर देकर जवाब दिया है कि डेटासेट एक शोध कलाकृति है। हालांकि, बहस जारी है, जो AI के युग में खुली पहुंच और व्यक्तिगत अधिकारों के बीच तनाव को उजागर करती है।

भविष्य की दिशाएँ

2025 तक, LAION-400M एक व्यापक रूप से उपयोग किया जाने वाला संसाधन बना हुआ है, हालांकि इसे बेहतर क्यूरेशन और नैतिक सुरक्षा उपायों वाले नए डेटासेट द्वारा तेजी से पूरक किया जा रहा है। इसके निर्माण से सीखे गए पाठों ने अधिक जिम्मेदार डेटा संग्रह प्रथाओं के विकास को सूचित किया है, जिसमें हानिकारक सामग्री के लिए बेहतर फ़िल्टरिंग और स्पष्ट लाइसेंसिंग शामिल है। डेटासेट की विरासत AI नवाचार को तेज करने में खुले डेटा की शक्ति का प्रमाण है, साथ ही वेब-स्केल डेटा संग्रह की जटिलताओं के बारे में एक चेतावनी के रूप में भी कार्य करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·vision-language·open-source·multimodal
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास