I'll need the actual wiki text to translate. Please provide the article content you'd like translated into Hindi.

अंग्रेज़ी से अनुवादित

विकिटेक्स्ट एक बड़े पैमाने का भाषा मॉडलिंग डेटासेट है जो विकिपीडिया लेखों से प्राप्त किया गया है, और इसका व्यापक रूप से प्राकृतिक भाषा प्रसंस्करण में तंत्रिका नेटवर्क मॉडल के प्रशिक्षण और मूल्यांकन के लिए उपयोग किया जाता है।

विकिटेक्स्ट सत्यापित विकिपीडिया लेखों से निकाले गए अंग्रेजी पाठ डेटासेट का एक संग्रह है, जिसे भाषा मॉडलों के प्रशिक्षण और बेंचमार्किंग के लिए डिज़ाइन किया गया है। इसे पेन ट्रीबैंक जैसे पहले के डेटासेट की तुलना में एक बड़ा और अधिक यथार्थवादी कॉर्पस प्रदान करने के लिए पेश किया गया था, जिसमें मूल लेख संरचना - शीर्षक, सूचियाँ और लिंक - को संरक्षित करने पर ध्यान केंद्रित किया गया था। यह डेटासेट आमतौर पर मशीन लर्निंग और डीप लर्निंग पर शोध में अगले-शब्द भविष्यवाणी और मॉडल मूल्यांकन जैसे कार्यों के लिए उपयोग किया जाता है।

प्राथमिक संस्करण विकिटेक्स्ट-2 और विकिटेक्स्ट-103 हैं, जिनमें क्रमशः 2 मिलियन और 103 मिलियन टोकन होते हैं। इन डेटासेट को तालिकाओं और सूचियों को बाहर करने के लिए क्यूरेट किया गया है, और वे अज्ञात शब्दों के लिए विशेष टोकन के साथ कच्चे पाठ को बनाए रखते हैं, जिससे वे बड़े शब्दावली और दीर्घकालिक निर्भरताओं को संभालने की मॉडल की क्षमता का परीक्षण करने के लिए उपयुक्त होते हैं। विकिटेक्स्ट क्षेत्र में एक मानक बेंचमार्क बन गया है, जिसे तंत्रिका नेटवर्क और बड़े भाषा मॉडल पर कई पत्रों में उद्धृत किया गया है।

डेटासेट निर्माण

विकिटेक्स्ट को 2016 में सेल्सफोर्स रिसर्च द्वारा बनाया गया था, जिसका लक्ष्य पिछले विकल्पों की तुलना में अधिक चुनौतीपूर्ण कॉर्पस प्रदान करना था। निष्कर्षण प्रक्रिया में विकिपीडिया से उन लेखों को लेना शामिल था जिन्हें विकिपीडिया समुदाय द्वारा 'अच्छे' या 'फीचर्ड' के रूप में रेट किया गया था, जिससे उच्च गुणवत्ता और स्थिरता सुनिश्चित हुई। फिर पाठ को मार्कअप हटाने के लिए साफ किया गया, लेकिन मूल केस, विराम चिह्न और संख्याओं को संरक्षित किया गया, जो पहले के डेटासेट से एक अंतर है जो अक्सर सब कुछ लोअरकेस में बदल देते थे।

एक प्रमुख विशेषता विकिटेक्स्ट-103 के लिए 267,735-शब्द शब्दावली का उपयोग है, जिसमें प्रशिक्षण सेट में कम से कम तीन बार दिखने वाले सभी शब्द शामिल हैं। दुर्लभ शब्दों को '<unk>' टोकन से बदल दिया जाता है। यह बड़ी शब्दावली मॉडल को कई शब्दों के लिए प्रतिनिधित्व सीखने के लिए मजबूर करती है, जिससे उनकी सामान्यीकरण करने की क्षमता का परीक्षण होता है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट में एक अलग समय अवधि के लेख शामिल हैं ताकि रिसाव से बचा जा सके।

भाषा मॉडलिंग में अनुप्रयोग

विकिटेक्स्ट मुख्य रूप से भाषा मॉडलों के मूल्यांकन के लिए उपयोग किया जाता है, जो शब्दों के अनुक्रम की संभावना की भविष्यवाणी करते हैं। शोधकर्ता पर्प्लेक्सिटी मापने के लिए इसका उपयोग करते हैं, जो एक मीट्रिक है जो दर्शाता है कि मॉडल अगले शब्द की कितनी अच्छी भविष्यवाणी करता है। कम पर्प्लेक्सिटी स्कोर बेहतर होते हैं, और विकिटेक्स्ट-103 ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि ओपनएआई और गूगल-डीपमाइंड द्वारा विकसित मॉडल की तुलना के लिए एक मानक बन गया है।

उदाहरण के लिए, GPT-2 और BERT जैसे मॉडलों का विकिटेक्स्ट-103 पर मूल्यांकन किया गया है, जिसमें समय के साथ रिपोर्ट किए गए पर्प्लेक्सिटी स्कोर में सुधार हुआ है। डेटासेट के लंबे लेख, जिनकी औसत लंबाई लगभग 3,000 शब्द है, मॉडल की लंबी-श्रृंखला संदर्भ को संभालने की क्षमता का परीक्षण करते हैं, जो दस्तावेज़ सारांश और प्रश्न-उत्तर जैसे कार्यों के लिए महत्वपूर्ण है। यह विकिटेक्स्ट को आर्टिफिशियल इंटेलिजेंस अनुसंधान को आगे बढ़ाने के लिए एक मूल्यवान संसाधन बनाता है।

अन्य डेटासेट के साथ तुलना

विकिटेक्स्ट से पहले, मानक बेंचमार्क पेन ट्रीबैंक (PTB) था, जिसमें वॉल स्ट्रीट जर्नल लेखों से केवल लगभग 1 मिलियन टोकन होते हैं। PTB छोटा है और इसकी शब्दावली सीमित है, जिससे मॉडल के लिए कम पर्प्लेक्सिटी प्राप्त करना आसान हो जाता है। विकिटेक्स्ट बड़ी शब्दावली और लंबे दस्तावेज़ों का उपयोग करके अधिक यथार्थवादी चुनौती प्रदान करता है, जो वास्तविक दुनिया के पाठ को बेहतर ढंग से दर्शाता है।

एक अन्य डेटासेट, वन बिलियन वर्ड बेंचमार्क, बड़ा है लेकिन इसमें फेरबदल किए गए वाक्य शामिल हैं, जिससे दस्तावेज़ संरचना खो जाती है। विकिटेक्स्ट मूल लेख क्रम को बनाए रखता है, जिससे मॉडल सुसंगत कथाओं से सीख सकते हैं। यह संरचनात्मक अंतर उन मॉडलों के प्रशिक्षण के लिए महत्वपूर्ण है जिन्हें वाक्यों और पैराग्राफों के बीच संदर्भ को समझने की आवश्यकता होती है, जो जनरेटिव एआई प्रणालियों के लिए एक प्रमुख क्षमता है।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, विकिटेक्स्ट की सीमाएँ हैं। डेटासेट विकिपीडिया से लिया गया है, जिसकी एक औपचारिक, विश्वकोशीय शैली है, इसलिए यह अनौपचारिक या संवादात्मक भाषा का प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, सफाई प्रक्रिया तालिकाओं और सूचियों को हटा देती है, जो कुछ कार्यों के लिए जानकारीपूर्ण हो सकते हैं। कुछ शोधकर्ताओं ने नोट किया है कि '<unk>' टोकन हैंडलिंग मूल्यांकन को पक्षपाती बना सकता है, क्योंकि मॉडल दुर्लभ शब्दों को सीखने के बजाय उस पर निर्भर हो सकते हैं।

एक और आलोचना यह है कि विकिटेक्स्ट-103, हालांकि बड़ा है, फिर भी बड़े भाषा मॉडल जैसे एंथ्रोपिक या माइक्रोसॉफ्ट के प्रशिक्षण के लिए उपयोग किए जाने वाले आधुनिक वेब-स्केल डेटासेट से छोटा है। 2025 तक, कई मॉडल खरबों टोकन पर प्रशिक्षित होते हैं, जिससे विकिटेक्स्ट उत्पादन प्रणालियों के लिए प्रशिक्षण स्रोत के बजाय शैक्षणिक अनुसंधान के लिए एक बेंचमार्क बन गया है। फिर भी, यह क्षेत्र में प्रतिलिपि प्रस्तुत करने योग्य तुलनाओं के लिए एक मानक बना हुआ है।

भविष्य की दिशाएँ

विकिटेक्स्ट के विकास ने द पाइल और रेडपाजामा जैसे अन्य डेटासेट के निर्माण को प्रभावित किया है, जो कई स्रोतों को जोड़ते हैं। इन नए डेटासेट का लक्ष्य विविध पाठ प्रकारों और बड़े पैमाने को शामिल करके विकिटेक्स्ट की सीमाओं को संबोधित करना है। हालाँकि, विकिटेक्स्ट की सरलता और उपयोग में आसानी शिक्षा और अनुसंधान में इसकी निरंतर प्रासंगिकता सुनिश्चित करती है, विशेष रूप से डीप लर्निंग मूल बातों का अध्ययन करने वालों के लिए।

शोधकर्ता बहुभाषी और बहु-मोडल कार्यों के लिए विकिटेक्स्ट को अनुकूलित करने के तरीकों की भी खोज कर रहे हैं, हालाँकि मूल संस्करण केवल अंग्रेजी में है। जैसे-जैसे एआई मॉडल विकसित होते हैं, उच्च-गुणवत्ता, संरचित डेटासेट की आवश्यकता बनी रहती है, और विकिटेक्स्ट ऐसे संसाधनों के निर्माण के तरीके का एक मौलिक उदाहरण के रूप में कार्य करता है। इसकी विरासत कई पत्रों में स्पष्ट है जो इसे बेसलाइन के रूप में उद्धृत करते हैं, जिससे मशीन लर्निंग विकास के इतिहास में इसका स्थान सुनिश्चित होता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·natural-language-processing·language-modeling·wikipedia
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास