OpenWebText एक ओपन-सोर्स डेटासेट है जिसमें Reddit सबमिशन से निकाले गए वेब पेज शामिल हैं, जिसे OpenAI के GPT-2 भाषा मॉडल को प्रशिक्षित करने के लिए उपयोग किए गए निजी WebText कॉर्पस को दोहराने के लिए बनाया गया है। यह बड़े भाषा मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए एक बड़ा और विविध पाठ कॉर्पस प्रदान करता है।
पृष्ठभूमि और प्रेरणा
OpenWebText को 2019 में Aaron Gokaslan और Vanya Cohen द्वारा पेश किया गया था, जो उस समय क्रमशः University of Maryland और Johns Hopkins University से संबद्ध शोधकर्ता थे। प्रेरणा OpenAI के उस निर्णय से उपजी जिसमें GPT-2 को प्रशिक्षित करने के लिए उपयोग किए गए पूर्ण WebText डेटासेट को जारी नहीं किया गया था। WebText में Reddit पोस्ट के आउटबाउंड लिंक शामिल थे जिन्हें कम से कम 3 karma मिला था, जो कुल मिलाकर लगभग 40GB पाठ था। पुनरुत्पादन क्षमता और आगे के शोध को सक्षम करने के लिए, Gokaslan और Cohen ने 2005 से अप्रैल 2018 तक Reddit सबमिशन से सभी आउटबाउंड लिंक को स्क्रैप करके, समान karma सीमा लागू करके, और अंग्रेजी-भाषा सामग्री के लिए फ़िल्टर करके OpenWebText बनाया। परिणामी डेटासेट में 8 मिलियन से अधिक दस्तावेज़ हैं, जो कुल मिलाकर लगभग 38GB पाठ है, जो मूल WebText के आकार और विविधता को निकटता से दर्शाता है।
डेटासेट की विशेषताएँ
OpenWebText एक बड़े पैमाने का, असंरचित पाठ कॉर्पस है। Wikipedia या पुस्तकों जैसे क्यूरेटेड डेटासेट के विपरीत, यह लेखन शैलियों, विषयों और प्रारूपों की एक विस्तृत विविधता को कैप्चर करता है, जिसमें समाचार लेख, ब्लॉग पोस्ट, फोरम चर्चाएँ और व्यक्तिगत वेबसाइटें शामिल हैं। यह विविधता इसे सामान्य-उद्देश्यीय भाषा मॉडलों को प्रशिक्षित करने के लिए मूल्यवान बनाती है। डेटासेट को पाठ फ़ाइलों के संग्रह के रूप में प्रदान किया जाता है, जिसमें प्रत्येक दस्तावेज़ एक नई पंक्ति द्वारा अलग किया जाता है। यह शोध समुदाय में अगले-शब्द भविष्यवाणी और अन्य भाषा मॉडलिंग कार्यों पर मॉडल प्रदर्शन का मूल्यांकन करने के लिए एक बेंचमार्क के रूप में आमतौर पर उपयोग किया जाता है। हालाँकि, क्योंकि यह सार्वजनिक वेब सामग्री से प्राप्त होता है, यह डुप्लिकेट सामग्री, निम्न-गुणवत्ता वाले पाठ, और ऑनलाइन प्रवचन में मौजूद संभावित पूर्वाग्रहों जैसे मुद्दों को विरासत में लेता है।
भाषा मॉडल प्रशिक्षण में उपयोग
OpenWebText को प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में व्यापक रूप से अपनाया गया है। यह कई ओपन-सोर्स भाषा मॉडलों के लिए एक मानक प्रशिक्षण कॉर्पस के रूप में कार्य करता है, जिसमें GPT-2 वेरिएंट और अन्य ट्रांसफॉर्मर-आधारित आर्किटेक्चर शामिल हैं। उदाहरण के लिए, Hugging Face OpenWebText का एक पूर्व-संसाधित संस्करण प्रदान करता है जो फाइन-ट्यूनिंग और मूल्यांकन के लिए आमतौर पर उपयोग किया जाता है। शोधकर्ता अक्सर GPT-2 के विरुद्ध मॉडल प्रदर्शन की तुलना करने के लिए इसका उपयोग करते हैं, क्योंकि यह एक तुलनीय प्रशिक्षण वितरण प्रदान करता है। डेटासेट का उपयोग डेटा क्यूरेशन, मॉडल स्केलिंग, और प्रशिक्षण डेटा के मॉडल व्यवहार पर प्रभावों के अध्ययन में भी किया गया है। इसकी उपलब्धता ने बड़े भाषा मॉडल विकास में पुनरुत्पादनीय शोध को सुविधाजनक बनाया है, विशेष रूप से जनरेटिव AI के संदर्भ में।
प्रभाव और सीमाएँ
OpenWebText ने बड़े पैमाने के वेब कॉर्पस तक पहुँच को लोकतांत्रिक बनाकर ओपन-सोर्स AI समुदाय पर महत्वपूर्ण प्रभाव डाला है। इसने स्वामित्व डेटासेट तक पहुँच के बिना शोधकर्ताओं को GPT-2 के समान पैमाने के मॉडलों को प्रशिक्षित और मूल्यांकन करने में सक्षम बनाया है। हालाँकि, डेटासेट की सीमाएँ हैं। यह क्यूरेटेड कॉर्पस जितना स्वच्छ नहीं है, और इसमें बॉयलरप्लेट पाठ, नेविगेशन तत्वों और अन्य शोर की पर्याप्त मात्रा शामिल है। इसके अतिरिक्त, Reddit karma पर आधारित स्क्रैपिंग पद्धति एक चयन पूर्वाग्रह पेश करती है, जो Reddit उपयोगकर्ताओं को आकर्षित करने वाली सामग्री का पक्ष लेती है। डेटासेट में कई शामिल वेब पेजों के लिए स्पष्ट लाइसेंसिंग जानकारी का भी अभाव है, जिससे कॉपीराइट चिंताएँ उठती हैं। इन मुद्दों के बावजूद, OpenWebText बड़े भाषा मॉडलों के विकास में एक मौलिक संसाधन बना हुआ है और शैक्षणिक साहित्य में संदर्भित होता रहता है।
संबंधित डेटासेट और विकास
OpenWebText NLP में उपयोग किए जाने वाले वेब-स्केल पाठ डेटासेट के व्यापक पारिस्थितिकी तंत्र का हिस्सा है। अन्य उल्लेखनीय उदाहरणों में Common Crawl शामिल है, जो वेब का एक विशाल क्रॉल है, और The Pile, जो विविध स्रोतों का एक क्यूरेटेड संग्रह है। C4 (Colossal Clean Crawled Corpus) और RefinedWeb जैसे अधिक हाल के डेटासेट, कच्चे वेब क्रॉल में मौजूद शोर और गुणवत्ता के कुछ मुद्दों को संबोधित करने के लिए विकसित किए गए हैं। ये नए डेटासेट अधिक परिष्कृत फ़िल्टरिंग और डीडुप्लिकेशन तकनीकों का उपयोग करते हैं। फिर भी, OpenWebText एक ऐतिहासिक बेंचमार्क और डेटा क्यूरेशन विधियों के मूल्यांकन के लिए एक आधार रेखा के रूप में प्रासंगिक बना हुआ है। इसके निर्माण ने कृत्रिम बुद्धिमत्ता के क्षेत्र में खुले डेटा के महत्व को भी उजागर किया, जिसने सार्वजनिक उपयोग के लिए प्रशिक्षण कॉर्पस जारी करने के बाद के प्रयासों को प्रभावित किया।
यह भी देखें
- बड़ा भाषा मॉडल
- GPT-2
- Common Crawl
- The Pile
- डेटा क्यूरेशन