येल्प समीक्षाएं येल्प पर प्रकाशित उपयोगकर्ता-जनित समीक्षाओं और रेटिंग्स के संग्रह को संदर्भित करती हैं, जो 2004 में पूर्व पेपाल कर्मचारियों रसेल सिमंस और जेरेमी स्टॉपेलमैन द्वारा स्थापित एक क्राउड-सोर्स्ड समीक्षा मंच है। यह डेटासेट प्राकृतिक भाषा प्रसंस्करण और मशीन लर्निंग में भावना विश्लेषण, अनुशंसा प्रणाली, और पाठ वर्गीकरण जैसे कार्यों के लिए एक मानक बेंचमार्क बन गया है। शोधकर्ता और व्यवसायी येल्प समीक्षाओं का उपयोग एल्गोरिदम विकसित करने और मूल्यांकन करने के लिए करते हैं जो असंरचित पाठ से उपयोगकर्ता की भावना का अनुमान लगा सकते हैं, रेटिंग्स की भविष्यवाणी कर सकते हैं, और उपभोक्ता व्यवहार को समझ सकते हैं।
येल्प डेटासेट में लाखों समीक्षाएं शामिल हैं, जिनमें से प्रत्येक के साथ एक स्टार रेटिंग (1 से 5), व्यवसाय मेटाडेटा, और उपयोगकर्ता जानकारी होती है। 31 दिसंबर, 2024 तक, येल्प पर लगभग 308 मिलियन समीक्षाएं योगदान की गई थीं, और कंपनी ने 2024 में डेस्कटॉप और मोबाइल पर 76 मिलियन से अधिक अद्वितीय आगंतुकों की सूचना दी। डेटासेट अक्सर शैक्षणिक उपयोग के लिए उपसमूहों में जारी किया जाता है, जिसमें येल्प डेटासेट चैलेंज शोध के लिए एक बड़ा नमूना प्रदान करता है। समीक्षाएं रेस्तरां, खरीदारी, और सेवाओं सहित व्यवसाय श्रेणियों की एक विस्तृत श्रृंखला को कवर करती हैं, जिससे यह डोमेन-विशिष्ट भाषा का अध्ययन करने के लिए एक समृद्ध स्रोत बन जाता है।
ऐतिहासिक संदर्भ
येल्प की स्थापना 2004 में एमआरएल वेंचर्स, एक व्यवसाय इनक्यूबेटर, में पेपाल के सह-संस्थापक मैक्स लेवचिन के प्रारंभिक वित्तपोषण के साथ की गई थी। प्लेटफ़ॉर्म शुरू में एक ईमेल-आधारित रेफरल नेटवर्क के रूप में शुरू हुआ, लेकिन उपयोग डेटा से पता चलने के बाद कि उपयोगकर्ता बिना मांगे समीक्षाएं लिखना पसंद करते हैं, यह उपयोगकर्ता-लिखित समीक्षाओं की ओर मुड़ गया। 2005 तक, पुनः डिज़ाइन की गई साइट ने लोकप्रियता हासिल की, और 2006 तक, इसके एक मिलियन मासिक आगंतुक थे। येल्प ने 2009 से अंतरराष्ट्रीय स्तर पर विस्तार किया, जिसमें यूनाइटेड किंगडम, कनाडा, फ्रांस, और अन्य देशों में साइटें शामिल थीं। कंपनी मार्च 2012 में सार्वजनिक हुई और 2014 में लाभदायक बन गई। इस वृद्धि ने समीक्षाओं का एक विशाल संचय किया, जो शोध में उपयोग किए जाने वाले डेटासेट का आधार बना।
डेटासेट विशेषताएं
येल्प समीक्षा डेटासेट अपने आकार और विविधता के लिए उल्लेखनीय है। इसमें विभिन्न लंबाई, भावनाओं, और लेखन शैलियों वाली समीक्षाएं शामिल हैं, जो वास्तविक दुनिया के उपयोगकर्ता व्यवहार को दर्शाती हैं। स्टार रेटिंग्स पर्यवेक्षित लर्निंग कार्यों के लिए एक संख्यात्मक लक्ष्य प्रदान करती हैं, जबकि समीक्षा पाठ समृद्ध भाषाई विशेषताएं प्रदान करता है। डेटासेट में स्थान, श्रेणी, और घंटे जैसे व्यवसाय गुण भी शामिल हैं, जो बहु-मोडल विश्लेषण को सक्षम बनाते हैं। उदाहरण के लिए, शोधकर्ता अध्ययन कर सकते हैं कि समीक्षा भावना व्यवसाय प्रकार या भौगोलिक क्षेत्र के अनुसार कैसे भिन्न होती है। डेटासेट का उपयोग अक्सर पहलू-आधारित भावना विश्लेषण के लिए मॉडल प्रशिक्षित करने के लिए किया जाता है, जहां लक्ष्य भोजन की गुणवत्ता या सेवा जैसे विशिष्ट पहलुओं के प्रति भावनाओं की पहचान करना है।
मशीन लर्निंग में अनुप्रयोग
मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में, येल्प समीक्षाएं भावना विश्लेषण और पाठ वर्गीकरण के लिए एक सामान्य बेंचमार्क है। तंत्रिका नेटवर्क और ट्रांसफॉर्मर जैसे मॉडल समीक्षा पाठ से रेटिंग्स की भविष्यवाणी करने के लिए डेटासेट पर प्रशिक्षित किए जाते हैं। उदाहरण के लिए, एक बड़ा भाषा मॉडल प्रतिक्रियाएं उत्पन्न करने या ग्राहक प्रतिक्रिया का विश्लेषण करने के लिए येल्प समीक्षाओं पर फाइन-ट्यून किया जा सकता है। डेटासेट का उपयोग अनुशंसा प्रणालियों में भी किया जाता है, जहां एल्गोरिदम पिछली समीक्षाओं के आधार पर उपयोगकर्ता की प्राथमिकताओं की भविष्यवाणी करते हैं। अमेज़न वेब सर्विसेज और गूगल क्लाउड जैसी कंपनियां मशीन लर्निंग सेवाएं प्रदान करती हैं जो ऐसे डेटासेट को संसाधित कर सकती हैं, और स्टैनफोर्ड एआई लैब और एमआईटी सीएसएआईएल जैसे संस्थानों के शोधकर्ताओं ने येल्प डेटा का उपयोग करके अध्ययन प्रकाशित किए हैं।
चुनौतियां और नैतिक विचार
येल्प समीक्षा डेटासेट चुनौतियों से रहित नहीं है। नकली समीक्षाएं, जिन्हें एस्ट्रोटर्फिंग के रूप में भी जाना जाता है, एक लगातार समस्या रही है, जहां व्यवसाय या व्यक्ति रेटिंग्स में हेरफेर करने के लिए झूठी सकारात्मक या नकारात्मक समीक्षाएं जमा करते हैं। येल्प ने ऐसी समीक्षाओं का पता लगाने और फ़िल्टर करने के लिए एल्गोरिदम लागू किए हैं, लेकिन डेटासेट में अभी भी शोर हो सकता है। शोधकर्ताओं को मॉडल प्रशिक्षित करते समय इसका ध्यान रखना चाहिए, क्योंकि पक्षपाती या धोखाधड़ी वाला डेटा गलत भविष्यवाणियों का कारण बन सकता है। इसके अतिरिक्त, डेटासेट गोपनीयता संबंधी चिंताएं उठाता है, क्योंकि समीक्षाओं में उपयोगकर्ताओं या व्यवसायों के बारे में व्यक्तिगत जानकारी हो सकती है। डेटासेट के नैतिक उपयोग के लिए अनामीकरण और डेटा संरक्षण विनियमों का अनुपालन आवश्यक है। कंपनी को अपनी समीक्षा फ़िल्टरिंग प्रथाओं के लिए आलोचना का सामना करना पड़ा है, जो कुछ लोगों का तर्क है कि विज्ञापन नहीं करने वाले व्यवसायों के लिए अनुचित है।
भविष्य की दिशाएं
2020 के दशक के मध्य तक, येल्प समीक्षाएं गहन शिक्षण और जनरेटिव एआई शोध को आगे बढ़ाने के लिए एक मूल्यवान संसाधन बनी हुई हैं। बड़े भाषा मॉडल के उदय के साथ, डेटासेट का उपयोग वास्तविक दुनिया के पाठ पर मॉडल प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। भविष्य का कार्य सूक्ष्म अभिव्यक्तियों, व्यंग्य, और सांस्कृतिक विविधताओं के लिए भावना विश्लेषण में सुधार पर केंद्रित हो सकता है। छवियों और मेटाडेटा जैसे बहु-मोडल डेटा का एकीकरण भी मॉडल क्षमताओं को बढ़ा सकता है। इसके अलावा, डेटासेट का पैमाना इसे एडब्ल्यूएस ट्रेनियम या सेरेब्रास जैसी वितरित प्रणालियों पर मॉडल प्रशिक्षित करने के लिए उपयुक्त बनाता है, जो बड़े पैमाने पर गणना के लिए डिज़ाइन किए गए हैं। जैसे-जैसे येल्प बढ़ता रहेगा, डेटासेट का विस्तार होने की संभावना है, जो शोध और अनुप्रयोग के लिए और भी अधिक अवसर प्रदान करेगा।
यह भी देखें
- मशीन लर्निंग
- sentiment-analysis
- प्राकृतिक भाषा प्रसंस्करण