अंग्रेज़ी से अनुवादित

Amazon Polarity एक भावना वर्गीकरण डेटासेट है जो Amazon उत्पाद समीक्षाओं से प्राप्त किया गया है, जिसमें 3.6 मिलियन प्रशिक्षण और 400,000 परीक्षण नमूने शामिल हैं जिन्हें सकारात्मक या नकारात्मक के रूप में लेबल किया गया है, और यह [[machine-learning]] मॉडलों के बेंचमार्किंग के लिए व्यापक रूप से उपयोग किया जाता है।

Amazon Polarity एक बड़े पैमाने पर भावना वर्गीकरण डेटासेट है जो Amazon उत्पाद समीक्षाओं से निर्मित है। इसका उपयोग आमतौर पर बाइनरी टेक्स्ट वर्गीकरण कार्यों पर मशीन लर्निंग और डीप लर्निंग मॉडल के मूल्यांकन के लिए एक बेंचमार्क के रूप में किया जाता है। डेटासेट प्रत्येक समीक्षा को एक लेबल के साथ जोड़ता है जो दर्शाता है कि व्यक्त की गई भावना सकारात्मक है या नकारात्मक, जो समीक्षा की स्टार रेटिंग से लिया गया है।

यह डेटासेट वाक्य वर्गीकरण के लिए मानकीकृत बेंचमार्क बनाने के व्यापक प्रयास के हिस्से के रूप में पेश किया गया था, साथ ही IMDB और Yelp Polarity जैसे समान डेटासेट भी शामिल हैं। इसे पहली बार 2015 में जियांग झांग, जुनबो झाओ और यान लेकुन द्वारा लिखे गए एक पेपर में प्रस्तुत किया गया था, जिसमें संबंधित Amazon Full डेटासेट भी पेश किया गया था। पोलैरिटी संस्करण मूल पांच-वर्ग रेटिंग समस्या को दो वर्गों में सरल बनाता है: 1 या 2 स्टार वाली समीक्षाओं को नकारात्मक लेबल किया जाता है, जबकि 4 या 5 स्टार वाली समीक्षाओं को सकारात्मक लेबल किया जाता है। 3-स्टार रेटिंग वाली समीक्षाओं को डेटासेट से बाहर रखा गया है।

निर्माण और आँकड़े

यह डेटासेट Amazon समीक्षाओं के एक बड़े संग्रह से लिया गया है जो 18 वर्षों से अधिक के उत्पाद प्रतिक्रिया को शामिल करता है। मूल कॉर्पस में 35 मिलियन से अधिक समीक्षाएँ हैं जिनमें किताबें, इलेक्ट्रॉनिक्स, कपड़े और घरेलू सामान सहित उत्पाद श्रेणियों की एक विस्तृत श्रृंखला शामिल है। पोलैरिटी संस्करण के लिए, निर्माताओं ने दो वर्गों के बीच संतुलन सुनिश्चित करने के लिए एक उपसमुच्चय का नमूना लिया।

अंतिम डेटासेट में 3,600,000 प्रशिक्षण उदाहरण और 400,000 परीक्षण उदाहरण शामिल हैं। प्रत्येक उदाहरण में समीक्षा पाठ और एक बाइनरी लेबल होता है। समीक्षाएँ बिना प्रीप्रोसेसिंग के कच्चे पाठ के रूप में प्रस्तुत की जाती हैं, जिसमें मूल कैपिटलाइज़ेशन, विराम चिह्न और कभी-कभी टाइपो संरक्षित रहते हैं। यह डेटासेट को उन मॉडलों के लिए एक यथार्थवादी परीक्षण बनाता है जिन्हें शोर, अनौपचारिक भाषा को संभालना होता है।

अनुसंधान में उपयोग

Amazon Polarity प्राकृतिक भाषा प्रसंस्करण अनुसंधान में एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर विभिन्न क्लासिफायरों के प्रदर्शन की तुलना करने के लिए किया जाता है, पारंपरिक तरीकों जैसे सपोर्ट वेक्टर मशीन और लॉजिस्टिक रिग्रेशन से लेकर आधुनिक Deep learning आर्किटेक्चर तक। डेटासेट का बड़ा आकार इसे Neural network मॉडल, जिसमें Transformer (architecture)-आधारित आर्किटेक्चर शामिल हैं, को प्रशिक्षित करने के लिए विशेष रूप से उपयुक्त बनाता है।

शोधकर्ता अक्सर परीक्षण सेट पर सटीकता को प्राथमिक मीट्रिक के रूप में रिपोर्ट करते हैं। अत्याधुनिक मॉडल, विशेष रूप से BERT और इसके उत्तराधिकारियों जैसे Large language model पर आधारित, 95% से अधिक सटीकता प्राप्त करते हैं। डेटासेट का उपयोग डोमेन अनुकूलन, ट्रांसफर लर्निंग और प्रतिकूल उदाहरणों के प्रति मजबूती पर अध्ययनों में भी किया जाता है। चूंकि समीक्षाएँ विविध उत्पाद श्रेणियों से आती हैं, Amazon Polarity पर प्रशिक्षित मॉडल उपभोक्ता भाषा के विभिन्न डोमेन में सामान्यीकरण करने की उम्मीद करते हैं।

अन्य डेटासेट से संबंध

Amazon Polarity उसी लेखकों द्वारा बनाए गए डेटासेट के एक परिवार का हिस्सा है, जिसमें Amazon Full, IMDB और Yelp Polarity शामिल हैं। ये डेटासेट एक सामान्य प्रारूप साझा करते हैं और अक्सर तुलनात्मक अध्ययनों में एक साथ उपयोग किए जाते हैं। उदाहरण के लिए, IMDB डेटासेट विशेष रूप से फिल्म समीक्षाओं पर केंद्रित है, जबकि Yelp Polarity रेस्तरां और व्यवसाय समीक्षाओं से लिया गया है। साथ में, वे पाठ शैलियों और शब्दावली की एक श्रृंखला प्रदान करते हैं, जिससे शोधकर्ताओं को डोमेन में मॉडल सामान्यीकरण का परीक्षण करने की अनुमति मिलती है।

यह डेटासेट जूलियन मैकऑले और सहयोगियों द्वारा संकलित मूल Amazon समीक्षा कॉर्पस से भी संबंधित है, जो अनुशंसा प्रणाली अनुसंधान में व्यापक रूप से उपयोग किया जाता है। उस कॉर्पस में उत्पाद आईडी, उपयोगकर्ता आईडी और टाइमस्टैम्प जैसे अतिरिक्त मेटाडेटा शामिल हैं, जो पोलैरिटी संस्करण में शामिल नहीं हैं।

सीमाएँ और विचार

Amazon Polarity की एक सीमा यह है कि यह एक सूक्ष्म पांच-सितारा रेटिंग प्रणाली को बाइनरी वर्गीकरण में सरल बनाता है। यह सरलीकरण भावना की तीव्रता के बारे में जानकारी खो देता है, क्योंकि 1-स्टार और 2-स्टार समीक्षाओं को समान रूप से माना जाता है। इसके अतिरिक्त, 3-स्टार समीक्षाओं का बहिष्करण भावना स्पेक्ट्रम के बीच में एक अंतर पैदा करता है, जो वास्तविक दुनिया के वितरण को प्रतिबिंबित नहीं कर सकता है।

डेटासेट Amazon समीक्षाओं में मौजूद पूर्वाग्रहों को भी विरासत में लेता है, जैसे चरम रेटिंग की ओर रुझान और उत्पाद श्रेणियों में समीक्षा व्यवहार में अंतर। कुछ शोधकर्ताओं ने नोट किया है कि डेटासेट में डुप्लिकेट या लगभग डुप्लिकेट समीक्षाएँ हैं, जो सावधानी से न संभाले जाने पर प्रदर्शन मीट्रिक को बढ़ा सकती हैं। इन मुद्दों के बावजूद, Amazon Polarity भावना विश्लेषण के लिए एक व्यापक रूप से उपयोग किया जाने वाला और विश्वसनीय बेंचमार्क बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:sentiment-analysis·dataset·natural-language-processing·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास