विकिटेक्स्ट सत्यापित विकिपीडिया लेखों से निकाले गए अंग्रेजी पाठ डेटासेट का एक संग्रह है, जिसे भाषा मॉडलों के प्रशिक्षण और बेंचमार्किंग के लिए डिज़ाइन किया गया है। इसे पेन ट्रीबैंक जैसे पहले के डेटासेट की तुलना में एक बड़ा और अधिक यथार्थवादी कॉर्पस प्रदान करने के लिए पेश किया गया था, जिसमें मूल लेख संरचना - शीर्षक, सूचियाँ और लिंक - को संरक्षित करने पर ध्यान केंद्रित किया गया था। यह डेटासेट आमतौर पर मशीन लर्निंग और डीप लर्निंग पर शोध में अगले-शब्द भविष्यवाणी और मॉडल मूल्यांकन जैसे कार्यों के लिए उपयोग किया जाता है।
प्राथमिक संस्करण विकिटेक्स्ट-2 और विकिटेक्स्ट-103 हैं, जिनमें क्रमशः 2 मिलियन और 103 मिलियन टोकन होते हैं। इन डेटासेट को तालिकाओं और सूचियों को बाहर करने के लिए क्यूरेट किया गया है, और वे अज्ञात शब्दों के लिए विशेष टोकन के साथ कच्चे पाठ को बनाए रखते हैं, जिससे वे बड़े शब्दावली और दीर्घकालिक निर्भरताओं को संभालने की मॉडल की क्षमता का परीक्षण करने के लिए उपयुक्त होते हैं। विकिटेक्स्ट क्षेत्र में एक मानक बेंचमार्क बन गया है, जिसे तंत्रिका नेटवर्क और बड़े भाषा मॉडल पर कई पत्रों में उद्धृत किया गया है।
डेटासेट निर्माण
विकिटेक्स्ट को 2016 में सेल्सफोर्स रिसर्च द्वारा बनाया गया था, जिसका लक्ष्य पिछले विकल्पों की तुलना में अधिक चुनौतीपूर्ण कॉर्पस प्रदान करना था। निष्कर्षण प्रक्रिया में विकिपीडिया से उन लेखों को लेना शामिल था जिन्हें विकिपीडिया समुदाय द्वारा 'अच्छे' या 'फीचर्ड' के रूप में रेट किया गया था, जिससे उच्च गुणवत्ता और स्थिरता सुनिश्चित हुई। फिर पाठ को मार्कअप हटाने के लिए साफ किया गया, लेकिन मूल केस, विराम चिह्न और संख्याओं को संरक्षित किया गया, जो पहले के डेटासेट से एक अंतर है जो अक्सर सब कुछ लोअरकेस में बदल देते थे।
एक प्रमुख विशेषता विकिटेक्स्ट-103 के लिए 267,735-शब्द शब्दावली का उपयोग है, जिसमें प्रशिक्षण सेट में कम से कम तीन बार दिखने वाले सभी शब्द शामिल हैं। दुर्लभ शब्दों को '<unk>' टोकन से बदल दिया जाता है। यह बड़ी शब्दावली मॉडल को कई शब्दों के लिए प्रतिनिधित्व सीखने के लिए मजबूर करती है, जिससे उनकी सामान्यीकरण करने की क्षमता का परीक्षण होता है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट में एक अलग समय अवधि के लेख शामिल हैं ताकि रिसाव से बचा जा सके।
भाषा मॉडलिंग में अनुप्रयोग
विकिटेक्स्ट मुख्य रूप से भाषा मॉडलों के मूल्यांकन के लिए उपयोग किया जाता है, जो शब्दों के अनुक्रम की संभावना की भविष्यवाणी करते हैं। शोधकर्ता पर्प्लेक्सिटी मापने के लिए इसका उपयोग करते हैं, जो एक मीट्रिक है जो दर्शाता है कि मॉडल अगले शब्द की कितनी अच्छी भविष्यवाणी करता है। कम पर्प्लेक्सिटी स्कोर बेहतर होते हैं, और विकिटेक्स्ट-103 ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि ओपनएआई और गूगल-डीपमाइंड द्वारा विकसित मॉडल की तुलना के लिए एक मानक बन गया है।
उदाहरण के लिए, GPT-2 और BERT जैसे मॉडलों का विकिटेक्स्ट-103 पर मूल्यांकन किया गया है, जिसमें समय के साथ रिपोर्ट किए गए पर्प्लेक्सिटी स्कोर में सुधार हुआ है। डेटासेट के लंबे लेख, जिनकी औसत लंबाई लगभग 3,000 शब्द है, मॉडल की लंबी-श्रृंखला संदर्भ को संभालने की क्षमता का परीक्षण करते हैं, जो दस्तावेज़ सारांश और प्रश्न-उत्तर जैसे कार्यों के लिए महत्वपूर्ण है। यह विकिटेक्स्ट को आर्टिफिशियल इंटेलिजेंस अनुसंधान को आगे बढ़ाने के लिए एक मूल्यवान संसाधन बनाता है।
अन्य डेटासेट के साथ तुलना
विकिटेक्स्ट से पहले, मानक बेंचमार्क पेन ट्रीबैंक (PTB) था, जिसमें वॉल स्ट्रीट जर्नल लेखों से केवल लगभग 1 मिलियन टोकन होते हैं। PTB छोटा है और इसकी शब्दावली सीमित है, जिससे मॉडल के लिए कम पर्प्लेक्सिटी प्राप्त करना आसान हो जाता है। विकिटेक्स्ट बड़ी शब्दावली और लंबे दस्तावेज़ों का उपयोग करके अधिक यथार्थवादी चुनौती प्रदान करता है, जो वास्तविक दुनिया के पाठ को बेहतर ढंग से दर्शाता है।
एक अन्य डेटासेट, वन बिलियन वर्ड बेंचमार्क, बड़ा है लेकिन इसमें फेरबदल किए गए वाक्य शामिल हैं, जिससे दस्तावेज़ संरचना खो जाती है। विकिटेक्स्ट मूल लेख क्रम को बनाए रखता है, जिससे मॉडल सुसंगत कथाओं से सीख सकते हैं। यह संरचनात्मक अंतर उन मॉडलों के प्रशिक्षण के लिए महत्वपूर्ण है जिन्हें वाक्यों और पैराग्राफों के बीच संदर्भ को समझने की आवश्यकता होती है, जो जनरेटिव एआई प्रणालियों के लिए एक प्रमुख क्षमता है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, विकिटेक्स्ट की सीमाएँ हैं। डेटासेट विकिपीडिया से लिया गया है, जिसकी एक औपचारिक, विश्वकोशीय शैली है, इसलिए यह अनौपचारिक या संवादात्मक भाषा का प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, सफाई प्रक्रिया तालिकाओं और सूचियों को हटा देती है, जो कुछ कार्यों के लिए जानकारीपूर्ण हो सकते हैं। कुछ शोधकर्ताओं ने नोट किया है कि '<unk>' टोकन हैंडलिंग मूल्यांकन को पक्षपाती बना सकता है, क्योंकि मॉडल दुर्लभ शब्दों को सीखने के बजाय उस पर निर्भर हो सकते हैं।
एक और आलोचना यह है कि विकिटेक्स्ट-103, हालांकि बड़ा है, फिर भी बड़े भाषा मॉडल जैसे एंथ्रोपिक या माइक्रोसॉफ्ट के प्रशिक्षण के लिए उपयोग किए जाने वाले आधुनिक वेब-स्केल डेटासेट से छोटा है। 2025 तक, कई मॉडल खरबों टोकन पर प्रशिक्षित होते हैं, जिससे विकिटेक्स्ट उत्पादन प्रणालियों के लिए प्रशिक्षण स्रोत के बजाय शैक्षणिक अनुसंधान के लिए एक बेंचमार्क बन गया है। फिर भी, यह क्षेत्र में प्रतिलिपि प्रस्तुत करने योग्य तुलनाओं के लिए एक मानक बना हुआ है।
भविष्य की दिशाएँ
विकिटेक्स्ट के विकास ने द पाइल और रेडपाजामा जैसे अन्य डेटासेट के निर्माण को प्रभावित किया है, जो कई स्रोतों को जोड़ते हैं। इन नए डेटासेट का लक्ष्य विविध पाठ प्रकारों और बड़े पैमाने को शामिल करके विकिटेक्स्ट की सीमाओं को संबोधित करना है। हालाँकि, विकिटेक्स्ट की सरलता और उपयोग में आसानी शिक्षा और अनुसंधान में इसकी निरंतर प्रासंगिकता सुनिश्चित करती है, विशेष रूप से डीप लर्निंग मूल बातों का अध्ययन करने वालों के लिए।
शोधकर्ता बहुभाषी और बहु-मोडल कार्यों के लिए विकिटेक्स्ट को अनुकूलित करने के तरीकों की भी खोज कर रहे हैं, हालाँकि मूल संस्करण केवल अंग्रेजी में है। जैसे-जैसे एआई मॉडल विकसित होते हैं, उच्च-गुणवत्ता, संरचित डेटासेट की आवश्यकता बनी रहती है, और विकिटेक्स्ट ऐसे संसाधनों के निर्माण के तरीके का एक मौलिक उदाहरण के रूप में कार्य करता है। इसकी विरासत कई पत्रों में स्पष्ट है जो इसे बेसलाइन के रूप में उद्धृत करते हैं, जिससे मशीन लर्निंग विकास के इतिहास में इसका स्थान सुनिश्चित होता है।