अंग्रेज़ी से अनुवादित

Amazon Reviews अमेज़न.कॉम से उत्पाद समीक्षाओं का एक बड़े पैमाने का डेटासेट है, जिसका व्यापक रूप से भावना विश्लेषण, पाठ वर्गीकरण और अनुशंसा प्रणाली अनुसंधान के लिए उपयोग किया जाता है, जिसमें 2014 तक 130 मिलियन से अधिक समीक्षाएँ शामिल हैं।

Amazon Reviews एक सार्वजनिक रूप से उपलब्ध डेटासेट है जिसमें Amazon.com के उत्पाद समीक्षाएँ और मेटाडेटा शामिल हैं, जो वैश्विक स्तर पर सबसे बड़े ई-कॉमर्स प्लेटफार्मों में से एक है। यह डेटासेट प्राकृतिक भाषा प्रसंस्करण (NLP) और मशीन लर्निंग में एक मानक बेंचमार्क बन गया है, विशेष रूप से भावना विश्लेषण, पहलू-आधारित राय खनन, और अनुशंसा प्रणालियों जैसे कार्यों के लिए। इसे पहली बार 2011 में जे. मैकऑले और जे. लेस्कोवेक द्वारा एक पेपर में प्रस्तुत किया गया था, और बाद में 2014 में इसे 20 से अधिक उत्पाद श्रेणियों, जैसे पुस्तकें, इलेक्ट्रॉनिक्स, कपड़े, और घरेलू सामान, में 130 मिलियन से अधिक समीक्षाओं को शामिल करने के लिए विस्तारित किया गया।

इतिहास और संस्करण

मूल Amazon Reviews डेटासेट, जिसे अक्सर "Amazon उत्पाद डेटा" संग्रह के रूप में संदर्भित किया जाता है, जूलियन मैकऑले और उनके सहयोगियों द्वारा कैलिफोर्निया विश्वविद्यालय, सैन डिएगो में जारी किया गया था। 2011 संस्करण में लगभग 35 मिलियन समीक्षाएँ थीं, जबकि 2014 विस्तार में अधिक श्रेणियाँ और मेटाडेटा जोड़े गए, जिसमें उत्पाद विवरण, मूल्य, और सह-खरीद जानकारी शामिल थी। बाद में, "Amazon Reviews 2018" डेटासेट के रूप में जाना जाने वाला एक नया संस्करण मैकऑले के समूह द्वारा जारी किया गया, जिसमें मध्य-2018 तक 233 मिलियन से अधिक समीक्षाएँ थीं, जिसमें छवियों और सत्यापित खरीद फ्लैग जैसी समृद्ध मेटाडेटा शामिल थी। ये डेटासेट आमतौर पर शैक्षणिक अनुसंधान और उद्योग प्रतियोगिताओं में उपयोग किए जाते हैं, और ये कैलिफोर्निया विश्वविद्यालय, सैन डिएगो की वेबसाइट से डाउनलोड के लिए उपलब्ध हैं।

डेटा संरचना और विशेषताएँ

डेटासेट में प्रत्येक समीक्षा में आमतौर पर एक अद्वितीय पहचानकर्ता, समीक्षक आईडी, उत्पाद आईडी (ASIN), समग्र रेटिंग (1 से 5 के पैमाने पर), समीक्षा पाठ, समीक्षा शीर्षक, समीक्षा का टाइमस्टैम्प, और कभी-कभी अन्य उपयोगकर्ताओं से सहायकता वोट शामिल होते हैं। मेटाडेटा फ़ाइलों में उत्पाद जानकारी जैसे शीर्षक, विवरण, मूल्य, श्रेणी, और बिक्री रैंक शामिल हैं। डेटासेट JSON प्रारूप में प्रदान किया गया है, जिसमें प्रत्येक पंक्ति एक एकल समीक्षा या उत्पाद का प्रतिनिधित्व करती है। यह संरचना शोधकर्ताओं को पायथन या आर जैसी प्रोग्रामिंग भाषाओं का उपयोग करके डेटा को आसानी से पार्स और विश्लेषण करने की अनुमति देती है। डेटासेट का बड़ा पैमाना और विविधता इसे Transformer (architecture)-आधारित आर्किटेक्चर सहित गहन शिक्षण मॉडल को प्रशिक्षित करने के लिए उपयुक्त बनाती है।

अनुसंधान और उद्योग में अनुप्रयोग

Amazon Reviews का व्यापक रूप से शैक्षणिक अनुसंधान में भावना विश्लेषण के लिए उपयोग किया गया है, जहाँ मॉडल अपने पाठ के आधार पर समीक्षा की ध्रुवीयता (सकारात्मक, नकारात्मक, तटस्थ) की भविष्यवाणी करते हैं। यह पाठ वर्गीकरण, विषय मॉडलिंग, और अनुशंसा प्रणालियों के लिए एक बेंचमार्क के रूप में भी कार्य करता है, जहाँ लक्ष्य ऐतिहासिक समीक्षाओं के आधार पर उपयोगकर्ता की प्राथमिकताओं की भविष्यवाणी करना है। उद्योग में, कंपनियाँ उत्पाद की गुणवत्ता की निगरानी करने, ग्राहक प्रतिक्रिया को समझने, और अपने अनुशंसा एल्गोरिदम को बेहतर बनाने के लिए समान समीक्षा डेटा का उपयोग करती हैं। डेटासेट का उपयोग नकली समीक्षाओं, समीक्षा सहायकता, और ऑनलाइन वर्ड-ऑफ-माउथ की गतिशीलता के प्रभाव का अध्ययन करने के लिए भी किया गया है। कई Machine learning और Deep learning पेपर इस डेटासेट पर परिणाम रिपोर्ट करते हैं, जिससे यह नए NLP मॉडल के मूल्यांकन के लिए एक वास्तविक मानक बन गया है।

चुनौतियाँ और सीमाएँ

अपनी लोकप्रियता के बावजूद, Amazon Reviews डेटासेट में कई सीमाएँ हैं। पहला, यह अत्यधिक असंतुलित है, जिसमें अधिकांश समीक्षाएँ सकारात्मक (रेटिंग 4 और 5) हैं, जो मॉडल को सकारात्मक भविष्यवाणियों की ओर पक्षपाती बना सकती हैं। दूसरा, डेटासेट में शोरगुल वाला पाठ शामिल है, जिसमें टाइपो, स्लैंग, और गैर-मानक व्याकरण शामिल हैं, जो पारंपरिक NLP पाइपलाइनों के लिए चुनौतीपूर्ण हो सकता है। तीसरा, समीक्षाएँ आवश्यक रूप से Amazon उपयोगकर्ताओं की पूरी आबादी का प्रतिनिधित्व नहीं करती हैं, क्योंकि वे स्व-चयनित हैं। चौथा, डेटासेट स्थिर है, जिसका अर्थ है कि यह उत्पाद लाइनों या उपयोगकर्ता व्यवहार में हाल के परिवर्तनों को प्रतिबिंबित नहीं करता है। अंत में, गोपनीयता संबंधी चिंताएँ उत्पन्न होती हैं क्योंकि डेटा में समीक्षक आईडी शामिल हैं, हालाँकि वे कुछ हद तक अनामित हैं। शोधकर्ता अक्सर नमूनाकरण तकनीकों, डेटा वृद्धि, या डोमेन अनुकूलन विधियों का उपयोग करके इन मुद्दों का समाधान करते हैं।

संबंधित डेटासेट और विस्तार

Amazon Reviews से कई विस्तार और संबंधित डेटासेट विकसित किए गए हैं। उदाहरण के लिए, Amazon Review Data (2018) में छवियों और सत्यापित खरीद स्थिति जैसे अतिरिक्त फ़ील्ड शामिल हैं। Amazon Multilingual Review डेटासेट कई भाषाओं में समीक्षाएँ प्रदान करता है, जिससे क्रॉस-भाषाई अनुसंधान संभव होता है। एक अन्य संस्करण, Amazon Counterfactual डेटासेट, NLP में प्रतितथ्यात्मक तर्क के लिए बनाया गया था। इसके अतिरिक्त, डेटासेट का उपयोग पहलू-आधारित भावना विश्लेषण के लिए बेंचमार्क बनाने के लिए किया गया है, जैसे SemEval कार्य। ये विस्तार शोधकर्ताओं को अधिक जटिल समस्याओं, जैसे मल्टीमॉडल लर्निंग (पाठ और छवियाँ) और अनुशंसा प्रणालियों में निष्पक्षता का पता लगाने की अनुमति देते हैं। डेटासेट को अक्सर क्लाउड वातावरण में बड़े पैमाने पर प्रसंस्करण के लिए Google Cloud या Azure सेवाओं जैसे अन्य स्रोतों के साथ भी जोड़ा जाता है।

NLP और AI विकास पर प्रभाव

Amazon Reviews डेटासेट ने NLP और Artificial intelligence अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसका उपयोग BERT, GPT, और अन्य Large language model आर्किटेक्चर जैसे मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है। उदाहरण के लिए, शोधकर्ताओं ने भावना वर्गीकरण में अत्याधुनिक परिणाम प्राप्त करने के लिए Amazon Reviews पर BERT को फाइन-ट्यून किया है। डेटासेट ने Transfer learning तकनीकों के विकास में भी योगदान दिया है, जहाँ सामान्य पाठ पर पूर्व-प्रशिक्षित मॉडल को विशिष्ट डोमेन के लिए अनुकूलित किया जाता है। इसके अलावा, यह Neural network आर्किटेक्चर, जिसमें convolutional-neural-networks और recurrent-neural-networks शामिल हैं, की प्रभावशीलता का अध्ययन करने में सहायक रहा है। इस तरह के एक बड़े, वास्तविक-विश्व डेटासेट की उपलब्धता ने NLP में नवाचार की गति को तेज कर दिया है, जिससे शोधकर्ताओं को परिकल्पनाओं का परीक्षण करने और नए एल्गोरिदम विकसित करने में सक्षम बनाया गया है जो बाद में वाणिज्यिक प्रणालियों में तैनात किए जाते हैं।

पहुँच और उपयोग दिशानिर्देश

Amazon Reviews डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है, लेकिन उपयोगकर्ताओं को प्रदाताओं द्वारा निर्दिष्ट उपयोग की शर्तों का पालन करना होगा। आमतौर पर, डेटासेट एक गैर-वाणिज्यिक लाइसेंस के तहत वितरित किया जाता है, और शोधकर्ताओं को प्रकाशनों में डेटा का उपयोग करते समय मूल पेपरों का उल्लेख करना आवश्यक होता है। डेटासेट को संपीड़ित प्रारूपों में डाउनलोड किया जा सकता है, और लोडिंग और प्रीप्रोसेसिंग की सुविधा के लिए विभिन्न उपकरण और लाइब्रेरी विकसित की गई हैं। उदाहरण के लिए, Hugging Face Datasets लाइब्रेरी Amazon Reviews तक पहुँचने के लिए एक सुविधाजनक इंटरफ़ेस प्रदान करती है। डेटासेट का उपयोग करते समय, नैतिक निहितार्थों पर विचार करना महत्वपूर्ण है, जैसे उपयोगकर्ता की गोपनीयता की रक्षा करना और पूर्वाग्रहों के प्रसार से बचना। शोधकर्ताओं को डेटा हैंडलिंग के लिए सर्वोत्तम प्रथाओं का पालन करने और पुनरुत्पादन के लिए किसी भी प्रीप्रोसेसिंग चरणों का दस्तावेजीकरण करने के लिए प्रोत्साहित किया जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:datasets·natural-language-processing·sentiment-analysis·recommender-systems
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास