अंग्रेज़ी से अनुवादित

MRPC (Microsoft Research Paraphrase Corpus) समाचार स्रोतों से 5,801 वाक्य जोड़ों का एक बेंचमार्क डेटासेट है, जिसका उपयोग पैराफ्रेज़ डिटेक्शन पर मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए किया जाता है, जो एक मुख्य प्राकृतिक भाषा समझ कार्य है।

Microsoft Research Paraphrase Corpus (MRPC) प्राकृतिक भाषा प्रसंस्करण (NLP) में पैराफ्रेज़ डिटेक्शन के कार्य के लिए एक मानक बेंचमार्क डेटासेट है। इसमें हजारों ऑनलाइन समाचार स्रोतों से स्वचालित रूप से निकाले गए 5,801 वाक्य जोड़े शामिल हैं, जिनमें प्रत्येक जोड़े को या तो शब्दार्थ रूप से समतुल्य (पैराफ्रेज़) या नहीं के रूप में लेबल किया गया है। इस कोरपस को 2005 में Microsoft Research के शोधकर्ताओं द्वारा पेश किया गया था, और तब से यह मशीन-लर्निंग मॉडलों, विशेष रूप से वाक्य समझ के लिए तंत्रिका-नेटवर्क आर्किटेक्चर के विकास में, व्यापक रूप से उपयोग किया जाने वाला मूल्यांकन सेट बन गया है।

MRPC अपनी वास्तविक-विश्व उत्पत्ति के लिए उल्लेखनीय है: वाक्य जोड़े समान घटनाओं को कवर करने वाले समाचार लेखों से एकत्र किए गए थे, जिससे शब्दों, वाक्यविन्यास और विवरण में प्राकृतिक भिन्नता के कारण पैराफ्रेज़ डिटेक्शन कार्य चुनौतीपूर्ण हो जाता है। डेटासेट को 4,076 जोड़ों के प्रशिक्षण सेट और 1,725 जोड़ों के परीक्षण सेट में विभाजित किया गया है, जिसमें मानव एनोटेशन ग्राउंड-ट्रुथ लेबल प्रदान करते हैं। वर्षों से, MRPC को व्यापक GLUE बेंचमार्क (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) में शामिल किया गया है, जहां यह एकल-वाक्य और वाक्य-जोड़ी वर्गीकरण कार्य के रूप में कार्य करता है।

Dataset Construction and Annotation

MRPC का निर्माण पहले विभिन्न ऑनलाइन स्रोतों से समाचार लेख एकत्र करके, फिर उम्मीदवार वाक्य जोड़ों की पहचान करने के लिए एक ह्यूरिस्टिक का उपयोग करके किया गया था जो पैराफ्रेज़ हो सकते हैं। ह्यूरिस्टिक आसपास के संदर्भ की समानता पर निर्भर था, जैसे कि विभिन्न लेखों में एक ही घटना का वर्णन। इस स्वचालित उम्मीदवार पीढ़ी के बाद, मानव एनोटेटर्स ने प्रत्येक जोड़े को या तो "शब्दार्थ रूप से समतुल्य" या "समतुल्य नहीं" के रूप में मैन्युअल रूप से लेबल किया। एनोटेशन प्रक्रिया में कई न्यायाधीश शामिल थे, और असहमतियों को चर्चा के माध्यम से हल किया गया, जिससे उच्च गुणवत्ता वाला गोल्ड स्टैंडर्ड सुनिश्चित हुआ। अंतिम डेटासेट में सकारात्मक और नकारात्मक उदाहरणों का लगभग संतुलित वितरण है, जिसमें लगभग 67% जोड़े पैराफ्रेज़ के रूप में लेबल किए गए हैं।

MRPC का वर्णन करने वाला मूल पेपर, जिसका शीर्षक "Automatic Evaluation of Paraphrase Quality" (2005) है, ने कोरपस के आधार पर पैराफ्रेज़ गुणवत्ता के लिए एक स्वचालित मीट्रिक भी पेश किया। हालांकि, डेटासेट स्वयं पर्यवेक्षित मॉडलों के लिए प्रशिक्षण और परीक्षण संसाधन के रूप में जल्दी से अधिक प्रभावशाली बन गया। इसका मध्यम आकार शास्त्रीय क्लासिफायर और प्रारंभिक तंत्रिका मॉडल को प्रशिक्षित करने के लिए संभव बनाता है, जबकि आधुनिक डीप-लर्निंग प्रणालियों के लिए एक सार्थक चुनौती प्रदान करता है।

Role in Model Evaluation

MRPC वाक्य-जोड़ी वर्गीकरण मॉडल के मूल्यांकन में एक प्रमुख उपकरण बन गया। 2010 के दशक की शुरुआत में, इसका उपयोग शब्दार्थ समानता के लिए आवर्तक तंत्रिका नेटवर्क और कन्वोल्यूशनल तंत्रिका नेटवर्क का परीक्षण करने के लिए किया गया था। बाद में, ट्रांसफॉर्मर-आधारित मॉडल के आगमन के साथ, MRPC को GLUE बेंचमार्क में शामिल किया गया, जिसने सामान्य-उद्देश्य भाषा मॉडल के मूल्यांकन को मानकीकृत किया। उदाहरण के लिए, BERT (बिडायरेक्शनल एनकोडर रिप्रेजेंटेशन्स फ्रॉम ट्रांसफॉर्मर्स) ने अपने GLUE स्कोर के हिस्से के रूप में MRPC पर परिणाम रिपोर्ट किए, और OpenAI, Anthropic, और Google DeepMind के बाद के बड़े-भाषा-मॉडल का मूल्यांकन GLUE कार्यों, जिसमें MRPC भी शामिल है, पर उनकी वाक्य समझ क्षमताओं को प्रदर्शित करने के लिए किया गया है।

कार्य को एक बाइनरी वर्गीकरण समस्या के रूप में तैयार किया गया है: वाक्यों की एक जोड़ी दी गई है, मॉडल को एक लेबल आउटपुट करना होगा जो इंगित करता है कि क्या वे पैराफ्रेज़ हैं। प्रदर्शन को आमतौर पर सटीकता और F1 स्कोर का उपयोग करके मापा जाता है, जिसमें GLUE लीडरबोर्ड में F1 स्कोर प्राथमिक मीट्रिक है। अत्याधुनिक मॉडलों ने 90% से ऊपर F1 स्कोर हासिल किए हैं, जबकि मानव प्रदर्शन लगभग 85-90% अनुमानित है, जो दर्शाता है कि कार्य लगभग संतृप्त है लेकिन प्रतिगमन परीक्षण के लिए अभी भी उपयोगी है।

Influence on Paraphrase Research

बेंचमार्क के रूप में इसके उपयोग के अलावा, MRPC ने पैराफ्रेज़ उत्पादन और डिटेक्शन पर शोध को प्रभावित किया है। डेटासेट पैराफ्रेज़ जोड़ों का एक प्राकृतिक सेट प्रदान करता है जिसका उपयोग पैराफ्रेज़ उत्पन्न करने के लिए अनुक्रम-से-अनुक्रम मॉडल को प्रशिक्षित करने के साथ-साथ अनपर्यवेक्षित विधियों का मूल्यांकन करने के लिए किया गया है। इसका उपयोग कृत्रिम-बुद्धिमत्ता व्याख्या अध्ययनों में भी किया गया है, जहां शोधकर्ता विश्लेषण करते हैं कि पैराफ्रेज़ निर्णय लेते समय मॉडल किन भाषाई विशेषताओं पर भरोसा करते हैं।

MRPC की एक सीमा इसका अपेक्षाकृत छोटा आकार और संकीर्ण डोमेन (समाचार पाठ) है, जो अकेले उपयोग किए जाने पर ओवरफिटिंग का कारण बन सकता है। इसे संबोधित करने के लिए, शोधकर्ता अक्सर MRPC को अन्य पैराफ्रेज़ डेटासेट, जैसे कि Quora Question Pairs डेटासेट, के साथ जोड़ते हैं, या बहु-कार्य शिक्षण ढांचे के भीतर इसे फाइन-ट्यूनिंग कार्य के रूप में उपयोग करते हैं। कोरपस की एनोटेशन शोर के लिए भी आलोचना की गई है, लेकिन इसकी दीर्घायु और उपयोग में आसानी के कारण यह एक डी फैक्टो मानक बना हुआ है।

Legacy and Continued Use

2020 के दशक के मध्य तक, MRPC को शैक्षणिक पत्रों में संदर्भित किया जाता रहा है और इसे Hugging Face's Datasets जैसी लोकप्रिय NLP लाइब्रेरी में शामिल किया गया है। इसका उपयोग अक्सर SST-2 और QQP जैसे अन्य GLUE कार्यों के साथ, नए आर्किटेक्चर के लिए एक सैनिटी चेक के रूप में किया जाता है। जबकि SuperGLUE और MMLU जैसे नए बेंचमार्क उभरे हैं, MRPC की सरलता और स्पष्ट कार्य परिभाषा इसे डीबगिंग और पैराफ्रेज़ डिटेक्शन सिखाने के लिए एक उपयोगी उपकरण बनाती है। डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है, और Microsoft Research द्वारा इसका निर्माण क्षेत्र में बाद के कोरपस-निर्माण प्रयासों के लिए एक मॉडल रहा है।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·dataset·benchmark·paraphrase-detection
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास