अंग्रेज़ी से अनुवादित

AG News एक बड़े पैमाने का समाचार लेख वर्गीकरण डेटासेट है, जिसमें 120,000 से अधिक अंग्रेजी समाचार शीर्षक और विवरण शामिल हैं, जिसका उपयोग मशीन लर्निंग में पाठ वर्गीकरण एल्गोरिदम के बेंचमार्किंग के लिए किया जाता है।

AG News समाचार लेख वर्गीकरण के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। इसमें 120,000 से अधिक अंग्रेजी समाचार शीर्षक और लघु विवरण शामिल हैं, जिनमें से प्रत्येक को चार वर्गों में से एक को सौंपा गया है: विश्व, खेल, व्यवसाय, और विज्ञान/प्रौद्योगिकी। यह डेटासेट शैक्षणिक खोज इंजन AG's Corpus द्वारा एकत्रित समाचार लेखों के बड़े कोष से लिया गया था, और यह मशीन लर्निंग और प्राकृतिक भाषा प्रसंस्करण में पाठ वर्गीकरण मॉडल के मूल्यांकन के लिए एक मानक परीक्षण मंच बन गया है।

यह डेटासेट अपनी सरलता और पैमाने के लिए उल्लेखनीय है, जो इसे पाठ वर्गीकरण के लिए गहन शिक्षण दृष्टिकोणों की खोज करने वाले शोधकर्ताओं और अभ्यासकर्ताओं के लिए एक सामान्य प्रारंभिक बिंदु बनाता है। प्रत्येक नमूने में एक शीर्षक और एक विवरण होता है, जिसमें वर्ग लेबल विषय को इंगित करता है। चार वर्ग संतुलित हैं, प्रति वर्ग लगभग 30,000 प्रशिक्षण उदाहरण और 1,900 परीक्षण उदाहरण हैं, जो मॉडल प्रदर्शन का एक विश्वसनीय माप प्रदान करते हैं।

इतिहास और उत्पत्ति

AG News डेटासेट 2015 में न्यूयॉर्क विश्वविद्यालय में जियांग झांग और सहकर्मियों द्वारा एक शोध परियोजना के भाग के रूप में पेश किया गया था। शोधकर्ताओं ने AG's Corpus से समाचार लेख निकाले, जो 2,000 से अधिक समाचार स्रोतों से एकत्रित 1 मिलियन से अधिक समाचार लेखों का संग्रह है। उन्होंने उन लेखों का चयन किया जो चार श्रेणियों में से एक में आते थे और वर्गीकरण कार्यों के लिए एक संतुलित उपसमुच्चय का निर्माण किया। यह डेटासेट DBpedia और Yahoo! Answers जैसे समान बेंचमार्क के साथ जारी किया गया था, जिसका उद्देश्य पाठ वर्गीकरण एल्गोरिदम के लिए विविध चुनौतियाँ प्रदान करना था।

AG News का निर्माण तंत्रिका नेटवर्क मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए बड़े, स्वच्छ और सार्वजनिक रूप से उपलब्ध डेटासेट की आवश्यकता से प्रेरित था। उस समय, कई मौजूदा डेटासेट छोटे थे या महत्वपूर्ण पूर्व-प्रसंस्करण की आवश्यकता थी। AG News ने स्पष्ट लेबल के साथ एक सीधा वर्गीकरण कार्य प्रदान किया, जिससे शोधकर्ताओं को डेटा सफाई के बजाय मॉडल आर्किटेक्चर और प्रशिक्षण तकनीकों पर ध्यान केंद्रित करने में सक्षम बनाया गया।

डेटासेट संरचना

AG News में दो फ़ाइलें हैं: एक प्रशिक्षण के लिए और एक परीक्षण के लिए। प्रशिक्षण सेट में 120,000 नमूने शामिल हैं, जबकि परीक्षण सेट में 7,600 नमूने हैं। प्रत्येक नमूना तीन फ़ील्ड के साथ एक CSV पंक्ति है: वर्ग सूचकांक (1 से 4), शीर्षक, और विवरण। वर्ग सूचकांक क्रमशः विश्व, खेल, व्यवसाय, और विज्ञान/प्रौद्योगिकी के अनुरूप हैं। शीर्षक आमतौर पर छोटे होते हैं, अक्सर 10 शब्दों से कम, जबकि विवरण एक या दो वाक्य होते हैं, जो शीर्षक के लिए संदर्भ प्रदान करते हैं।

डेटासेट को विराम चिह्न हटाने और सभी पाठ को लोअरकेस में बदलने के लिए पूर्व-संसाधित किया जाता है, हालांकि मूल मामला और विराम चिह्न कच्चे संस्करण में उपलब्ध हैं। यह पूर्व-प्रसंस्करण टोकनाइज़ेशन को सरल बनाता है और मॉडल को स्वरूपण के बजाय शब्द पैटर्न पर ध्यान केंद्रित करने की अनुमति देता है। संतुलित वर्ग वितरण यह सुनिश्चित करता है कि सटीकता एक सार्थक मीट्रिक है, क्योंकि यादृच्छिक अनुमान 25% सटीकता देगा।

मशीन लर्निंग में अनुप्रयोग

AG News का उपयोग अक्सर पाठ वर्गीकरण मॉडल को बेंचमार्क करने के लिए किया जाता है, पारंपरिक तरीकों जैसे सपोर्ट वेक्टर मशीन और लॉजिस्टिक रिग्रेशन से लेकर आधुनिक ट्रांसफॉर्मर-आधारित आर्किटेक्चर तक। यह नए मॉडल डिज़ाइन के लिए एक सैनिटी चेक के रूप में कार्य करता है, क्योंकि AG News पर उच्च सटीकता प्राप्त करना इंगित करता है कि एक मॉडल पाठ में बुनियादी अर्थ और वाक्यविन्यास पैटर्न को पकड़ सकता है।

बड़े भाषा मॉडल के युग में, AG News का उपयोग अक्सर फाइन-ट्यूनिंग और मूल्यांकन के लिए किया जाता है। BERT और GPT जैसे मॉडल परीक्षण सेट पर लगभग पूर्ण सटीकता प्राप्त कर सकते हैं, जो पाठ वर्गीकरण की परिपक्वता को प्रदर्शित करता है। हालांकि, डेटासेट शैक्षिक उद्देश्यों और विभिन्न आर्किटेक्चर की दक्षता की तुलना करने के लिए मूल्यवान बना हुआ है, विशेष रूप से संसाधन-बाधित सेटिंग्स में।

शोधकर्ता स्थानांतरण शिक्षण, डोमेन अनुकूलन, और डेटा वृद्धि तकनीकों का अध्ययन करने के लिए भी AG News का उपयोग करते हैं। इसकी सरलता नियंत्रित प्रयोगों की अनुमति देती है, और इसका आकार अत्यधिक कम्प्यूटेशनल लागत के बिना प्रशिक्षण का समर्थन करता है। परिणामस्वरूप, AG News सैकड़ों शैक्षणिक पत्रों में दिखाई देता है और मशीन लर्निंग पाठ्यक्रमों में एक प्रमुख घटक है।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, AG News की सीमाएँ हैं। चार श्रेणियाँ व्यापक हैं, और कुछ लेख गलत लेबल या अस्पष्ट हो सकते हैं, जिससे लेबल में शोर हो सकता है। डेटासेट भी अपेक्षाकृत पुराना है, जिसमें 2000 के दशक की शुरुआत के लेख शामिल हैं, इसलिए यह वर्तमान समाचार रुझानों या शब्दावली को प्रतिबिंबित नहीं कर सकता है। इसके अतिरिक्त, पूर्व-प्रसंस्करण विराम चिह्न हटाता है और पाठ को लोअरकेस करता है, जो शैलीगत अंतरों को अस्पष्ट कर सकता है जो वास्तविक दुनिया के अनुप्रयोगों में प्रासंगिक हो सकते हैं।

एक और आलोचना यह है कि AG News आधुनिक मॉडलों के लिए बहुत आसान है, कई 90% से अधिक सटीकता प्राप्त करते हैं। इसने कुछ शोधकर्ताओं को अधिक चुनौतीपूर्ण बेंचमार्क खोजने के लिए प्रेरित किया है, जैसे कि बारीक-दानेदार श्रेणियों या असंतुलित वर्ग वितरण वाले। फिर भी, AG News एक उपयोगी आधार रेखा और पाठ वर्गीकरण को समझने के लिए एक प्रारंभिक बिंदु बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·text-classification·machine-learning·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास