अंग्रेज़ी से अनुवादित

QQP (Quora Question Pairs) 400,000 से अधिक प्रश्न जोड़ों का एक डेटासेट है, जो Quora से लिया गया है, जिसे अर्थगत समानता के लिए लेबल किया गया है, और इसका उपयोग आमतौर पर डुप्लिकेट प्रश्न पहचान के लिए मशीन लर्निंग मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए किया जाता है।

क्वोरा प्रश्न युग्म (QQP) डेटासेट प्रश्न-उत्तर मंच क्वोरा से प्राप्त प्रश्न युग्मों का एक संग्रह है। प्रत्येक युग्म को एक बाइनरी मान के साथ लेबल किया गया है जो यह दर्शाता है कि दोनों प्रश्न शब्दार्थ रूप से समतुल्य हैं या नहीं, अर्थात वे एक ही बात पूछते हैं। यह डेटासेट 2017 में एक कागल प्रतियोगिता के भाग के रूप में जारी किया गया था और तब से यह प्राकृतिक भाषा प्रसंस्करण (NLP) के क्षेत्र में एक मानक बेंचमार्क बन गया है।

अवलोकन

QQP डेटासेट में 400,000 से अधिक प्रश्न युग्म शामिल हैं, जिनमें लगभग 37% युग्म डुप्लिकेट के रूप में लेबल किए गए हैं। प्रश्न विषयों की एक विस्तृत श्रृंखला को कवर करते हैं, जो क्वोरा की उपयोगकर्ता-जनित सामग्री की विविधता को दर्शाते हैं। डेटासेट को प्रशिक्षण और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट के लेबल प्रतियोगिता मूल्यांकन के लिए छिपाए गए हैं। प्राथमिक कार्य बाइनरी वर्गीकरण है: प्रश्नों के एक युग्म को देखते हुए, भविष्यवाणी करें कि वे डुप्लिकेट हैं या नहीं।

निर्माण और उद्देश्य

यह डेटासेट क्वोरा द्वारा अपने मंच पर डुप्लिकेट प्रश्नों की समस्या को हल करने के लिए बनाया गया था। क्वोरा का लक्ष्य ऐसे एल्गोरिदम के विकास को प्रोत्साहित करना था जो डुप्लिकेट प्रश्नों को स्वचालित रूप से पहचान और विलय कर सकें, जिससे उपयोगकर्ता अनुभव में सुधार हो। कागल प्रतियोगिता ने हजारों प्रतिभागियों को आकर्षित किया और पाठ समानता और शब्दार्थ मिलान तकनीकों में महत्वपूर्ण प्रगति की।

मशीन लर्निंग में अनुप्रयोग

QQP का व्यापक रूप से मशीन लर्निंग और डीप लर्निंग अनुसंधान में उपयोग किया जाता है। यह शब्दार्थ पाठ्य समानता, पैराफ्रेज़ पहचान और डुप्लिकेट प्रश्न पहचान जैसे कार्यों पर मॉडलों के मूल्यांकन के लिए एक बेंचमार्क के रूप में कार्य करता है। कई अत्याधुनिक मॉडल, जिनमें Transformer (architecture) आर्किटेक्चर पर आधारित मॉडल शामिल हैं, को QQP पर प्रशिक्षित और मूल्यांकित किया गया है। डेटासेट का उपयोग ट्रांसफर लर्निंग अध्ययनों में भी किया जाता है, जहां बड़े कोरपोरा पर पूर्व-प्रशिक्षित मॉडल को प्रदर्शन में सुधार के लिए QQP पर फाइन-ट्यून किया जाता है।

चुनौतियाँ और सीमाएँ

डेटासेट कई चुनौतियाँ प्रस्तुत करता है। प्रश्न अक्सर अनौपचारिक होते हैं, उनमें टाइपो होते हैं, और समान आशय व्यक्त करने के लिए अलग-अलग शब्दों का उपयोग कर सकते हैं। कुछ युग्म लगभग-डुप्लिकेट होते हैं, जिनके लिए संदर्भ और शब्दार्थ की सूक्ष्म समझ की आवश्यकता होती है। इसके अतिरिक्त, डेटासेट में वर्ग असंतुलन है, जिसमें डुप्लिकेट युग्मों की तुलना में अधिक गैर-डुप्लिकेट युग्म हैं। शोधकर्ताओं को मॉडल और मूल्यांकन मेट्रिक्स डिजाइन करते समय इन कारकों को ध्यान में रखना चाहिए।

संबंधित डेटासेट और बेंचमार्क

QQP का उपयोग अक्सर अन्य NLP बेंचमार्क के साथ किया जाता है, जैसे कि स्टैनफोर्ड प्रश्न उत्तर डेटासेट (SQuAD) और सामान्य भाषा समझ मूल्यांकन (GLUE) बेंचमार्क। GLUE में, QQP को सामान्य-उद्देश्य भाषा मॉडलों के मूल्यांकन के लिए एक कार्य के रूप में शामिल किया गया है। डेटासेट को SuperGLUE और पाइल जैसे बड़े संग्रहों में भी शामिल किया गया है, जो मॉडल मूल्यांकन के लिए व्यापक संदर्भ प्रदान करता है।

प्रभाव और विरासत

QQP डेटासेट का NLP समुदाय पर स्थायी प्रभाव पड़ा है। इसे कई शोध पत्रों में उद्धृत किया गया है और इसने वाक्य एम्बेडिंग, ध्यान तंत्र और मॉडल व्याख्यात्मकता जैसे क्षेत्रों में प्रगति को प्रेरित किया है। प्रतियोगिता का लीडरबोर्ड नए दृष्टिकोणों की तुलना के लिए एक संदर्भ बिंदु बना हुआ है। डेटासेट शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों के लिए एक मूल्यवान संसाधन बना हुआ है, विशेष रूप से ग्राहक सहायता और सूचना पुनर्प्राप्ति प्रणालियों में।

यह भी देखें

संदर्भ

  • चेन, जेड., एट अल. (2018). "क्वोरा प्रश्न युग्म." कागल.
  • वांग, ए., एट अल. (2018). "GLUE: ए मल्टी-टास्क बेंचमार्क एंड एनालिसिस प्लेटफॉर्म फॉर नेचुरल लैंग्वेज अंडरस्टैंडिंग." प्रोसीडिंग्स ऑफ EMNLP.
  • डेवलिन, जे., एट अल. (2019). "BERT: प्री-ट्रेनिंग ऑफ डीप बिडायरेक्शनल ट्रांसफॉर्मर्स फॉर लैंग्वेज अंडरस्टैंडिंग." प्रोसीडिंग्स ऑफ NAACL.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:datasets·natural-language-processing·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास