Reuters-21578 एक क्लासिक टेक्स्ट वर्गीकरण बेंचमार्क डेटासेट है, जिसमें 1987 में प्रकाशित रॉयटर्स न्यूज़वायर सेवा के 21,578 समाचार लेख शामिल हैं। यह दशकों से मशीन लर्निंग और सूचना पुनर्प्राप्ति एल्गोरिदम के मूल्यांकन के लिए एक आधारशिला रहा है। डेटासेट को एक मानक ट्रेन-टेस्ट विभाजन के साथ वितरित किया जाता है, आमतौर पर "ModApte" विभाजन का उपयोग करते हुए, जो प्रशिक्षण के लिए 9,603 दस्तावेज़ और परीक्षण के लिए 3,299 आरक्षित करता है, जबकि कई विषयों या बिना विषयों वाले दस्तावेज़ों के एक हिस्से को हटा देता है। प्रत्येक लेख को 135 श्रेणियों के एक सेट से एक या अधिक विषय लेबल सौंपे जाते हैं, जिसमें आर्थिक संकेतक, कॉर्पोरेट अधिग्रहण और कृषि वस्तुएं शामिल हैं।
यह डेटासेट Reuters-22173 कॉर्पस से उत्पन्न हुआ था, जिसे 1990 के दशक में अनुसंधान उद्देश्यों के लिए संकलित किया गया था। -21578 संस्करण विसंगतियों को दूर करने और एक स्वच्छ, अधिक व्यापक रूप से अपनाया गया बेंचमार्क प्रदान करने के लिए बनाया गया था। इसे कई प्लेटफार्मों पर होस्ट किया गया है, जिसमें UCI मशीन लर्निंग रिपॉजिटरी और विभिन्न शैक्षणिक पाठ्यक्रम वेबसाइटें शामिल हैं, जो टेक्स्ट वर्गीकरण प्रयोगों के लिए एक वास्तविक मानक बन गया है।
ऐतिहासिक संदर्भ और निर्माण
Reuters-21578 मुख्य रूप से 1987 के रॉयटर्स न्यूज़वायर कहानियों के एक बड़े संग्रह से लिया गया था। प्रारंभिक संकलन मैसाचुसेट्स विश्वविद्यालय और अन्य संस्थानों की परियोजनाओं का हिस्सा था, जिसका उद्देश्य सूचना पुनर्प्राप्ति प्रणालियों के मूल्यांकन के लिए एक यथार्थवादी कॉर्पस प्रदान करना था। पूर्ण डेटासेट में मूल रूप से 21,000 से अधिक दस्तावेज़ थे, लेकिन प्रीप्रोसेसिंग चरणों ने गायब या अस्पष्ट लेबल वाले दस्तावेज़ों को हटा दिया, जिसके परिणामस्वरूप आज उपयोग किए जाने वाले 21,578 लेख बचे। ModApte विभाजन, जिसका नाम शोधकर्ताओं डेविड डी. लुईस और मार्क रिंगुएट के नाम पर रखा गया है, जिन्होंने तकनीकी रिपोर्ट के लेखकों से संक्षिप्त नाम (ModApte) का उपयोग किया, मानक मूल्यांकन प्रोटोकॉल बन गया, जिससे अध्ययनों में तुलनीयता सुनिश्चित हुई।
डेटासेट की संरचना विशिष्ट न्यूज़वायर प्रारूप का पालन करती है, जिसमें एक शीर्षक, मुख्य पाठ और तिथि और लेखक जैसे मेटाडेटा शामिल हैं, हालांकि अधिकांश मूल्यांकन विषय-लेबल वाले मुख्य पाठ पर केंद्रित होते हैं। विषय लेबल रॉयटर्स संपादकों द्वारा मैन्युअल रूप से सौंपे गए थे, जो वर्गीकरण कार्यों के लिए उच्च-गुणवत्ता वाली ग्राउंड ट्रुथ प्रदान करते हैं।
मशीन लर्निंग में बेंचमार्क भूमिका
Reuters-21578 टेक्स्ट वर्गीकरण के लिए मशीन लर्निंग को आगे बढ़ाने में सहायक रहा है। 1990 के दशक के अंत और 2000 के दशक के शुरुआती कार्यों ने इस डेटासेट का उपयोग नाइव बेयस, सपोर्ट वेक्टर मशीन और निर्णय पेड़ जैसे एल्गोरिदम की तुलना करने के लिए किया। उदाहरण के लिए, 1998 में जोआचिम्स द्वारा एक ऐतिहासिक अध्ययन ने दिखाया कि सपोर्ट वेक्टर मशीनों ने इस बेंचमार्क पर बेहतर प्रदर्शन हासिल किया, शीर्ष-10 श्रेणियों के लिए माइक्रो-औसत F1 स्कोर लगभग 0.86 था, जबकि k-निकटतम पड़ोसी के लिए लगभग 0.82 और नाइव बेयस के लिए 0.72 था। इन परिणामों ने उच्च-आयामी टेक्स्ट डेटा के लिए SVM को एक शक्तिशाली उपकरण के रूप में स्थापित करने में मदद की।
शोधकर्ताओं ने ची-स्क्वायर आँकड़े और सूचना लाभ जैसी फीचर चयन तकनीकों का पता लगाने के लिए भी डेटासेट का उपयोग किया, जिसने शोर को कम करके वर्गीकरण सटीकता में काफी सुधार किया। डेटासेट का मध्यम आकार और स्पष्ट लेबल संरचना इसे बड़े कॉर्पस में स्केल करने से पहले विधियों के प्रोटोटाइप के लिए आदर्श बनाती है।
प्राकृतिक भाषा प्रसंस्करण पर प्रभाव
प्राकृतिक भाषा प्रसंस्करण के व्यापक क्षेत्र में, Reuters-21578 ने प्रारंभिक तंत्रिका नेटवर्क मॉडल के लिए एक मानक मूल्यांकन प्रदान किया। ट्रांसफॉर्मर-पूर्व आर्किटेक्चर, जैसे कि टेक्स्ट के लिए कन्वोल्यूशनल तंत्रिका नेटवर्क (उदाहरण के लिए, किम यून द्वारा 2014 का मॉडल) और आवर्ती नेटवर्क, उनकी प्रभावशीलता प्रदर्शित करने के लिए इस डेटासेट पर परीक्षण किए गए थे। उदाहरण के लिए, वाक्य वर्गीकरण पर CNN के लिए किम के 2014 के पेपर ने Reuters-21578 पर 0.872 का माइक्रो-F1 बताया, जो रैखिक कर्नेल के साथ पारंपरिक SVM (0.855) से थोड़ा बेहतर था। इसने संरचित टेक्स्ट वर्गीकरण के लिए गहन शिक्षण में रुचि बढ़ाने में मदद की।
बाद में, बड़े भाषा मॉडल और फाइन-ट्यूनिंग दृष्टिकोणों के आगमन के साथ, Reuters-21578 नई आर्किटेक्चर के लिए एक त्वरित सैनिटी चेक बना रहा, हालांकि इसका छोटा आकार इसे प्रारंभिक चरण के प्रयोगों तक सीमित करता था। डेटासेट का उपयोग अक्सर एम्बेडिंग तकनीकों और ट्रांसफर लर्निंग को बेंचमार्क करने के लिए किया जाता है, जहां पूर्व-प्रशिक्षित मॉडल को ModApte विभाजन पर फाइन-ट्यून किया जाता है।
डेटा विशेषताएँ और प्रीप्रोसेसिंग
डेटासेट में 21,578 लेख शामिल हैं, लेकिन सभी के पास पूर्ण पाठ नहीं है। औसत दस्तावेज़ लंबाई लगभग 200 शब्द है। लेबल परस्पर अनन्य नहीं हैं; एक दस्तावेज़ कई श्रेणियों से संबंधित हो सकता है, जैसे "earn" और "acq"। व्यवहार में, कई अध्ययन समस्या को प्रत्येक श्रेणी के लिए बाइनरी वर्गीकरण में बदल देते हैं या शीर्ष 10 सबसे लगातार श्रेणियों पर ध्यान केंद्रित करते हैं, जो अधिकांश दस्तावेज़ों को कवर करती हैं। वितरण तिरछा है, "earn" श्रेणी में लगभग 3,776 प्रशिक्षण दस्तावेज़ हैं, जबकि कई श्रेणियों में 10 से कम उदाहरण हैं, जो दुर्लभ-वर्ग वर्गीकरण के लिए चुनौतियाँ पेश करते हैं।
प्रीप्रोसेसिंग में आमतौर पर टोकनाइज़ेशन, लोअरकेसिंग, स्टॉप-वर्ड हटाना और स्टेमिंग शामिल है। डेटासेट का उपयोग अक्सर बाइनरी या मल्टी-लेबल वर्गीकरण कार्य के रूप में किया जाता है, जिसमें प्रेसिजन, रिकॉल और F1-स्कोर (माइक्रो और मैक्रो औसत) जैसे मेट्रिक्स होते हैं।
विरासत और निरंतर उपयोग
हालांकि 20 न्यूज़ग्रुप्स और AG न्यूज़ जैसे नए डेटासेट उभरे हैं, Reuters-21578 मौलिक टेक्स्ट वर्गीकरण मुद्दों को समझने के लिए एक संदर्भ बना हुआ है। इसका उपयोग अक्सर कृत्रिम बुद्धिमत्ता और सूचना पुनर्प्राप्ति पर शैक्षणिक पाठ्यक्रमों में छात्रों को क्लासिफायर बनाने और मूल्यांकन करने का तरीका सिखाने के लिए किया जाता है। इसका ऐतिहासिक महत्व साहित्य में मान्यता प्राप्त है, जिसे अक्सर टेक्स्ट वर्गीकरण के सर्वेक्षणों में उद्धृत किया जाता है।
2020 के दशक की शुरुआत तक, डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है, मूल स्रोतों के उचित उद्धरण के साथ। इसने व्युत्पन्न संस्करणों को भी प्रेरित किया है, जैसे कि अतिरिक्त प्रीप्रोसेसिंग या विभिन्न विभाजनों के साथ Reuters-21578, लेकिन मूल ModApte विभाजन सबसे आम आधार रेखा बना हुआ है। बेंचमार्क की दीर्घायु इसकी गुणवत्ता और इसके लेबलिंग की स्पष्टता को रेखांकित करती है, जिससे यह प्रतिलिपि प्रस्तुत करने योग्य अनुसंधान के लिए एक टिकाऊ उपकरण बन जाता है।
संदर्भ और आगे पढ़ना
शोधकर्ता आमतौर पर डेविड डी. लुईस की तकनीकी रिपोर्ट, "Reuters-21578 Text Categorization Test Collection, Distribution 1.0" (1997) का उद्धरण देते हैं, जो डेटासेट के निर्माण और इच्छित उपयोग का वर्णन करती है। ऐतिहासिक परिप्रेक्ष्य के लिए, लुईस और रिंगुएट के 1992 के पेपर ने संभाव्य क्लासिफायर के संदर्भ में ModApte विभाजन पेश किया। ये दस्तावेज़ डेटासेट की उत्पत्ति के लिए प्राथमिक आधार प्रदान करते हैं।
यह भी देखें
- मशीन लर्निंग इस डेटासेट पर लागू एल्गोरिदम के लिए।
- तंत्रिका नेटवर्क इस पर परीक्षण किए गए गहन शिक्षण मॉडल के लिए।
- डेटा संवर्धन वर्गीकरण प्रदर्शन में सुधार के लिए उपयोग की जाने वाली विधियों के लिए।
संक्षेप में, Reuters-21578 एक मौलिक डेटासेट है जिसने टेक्स्ट वर्गीकरण के क्षेत्र को आकार दिया, एक स्थिर, अच्छी तरह से प्रलेखित परीक्षण बिस्तर प्रदान करता है जो आधुनिक NLP अनुसंधान को सूचित करना जारी रखता है।