अंग्रेज़ी से अनुवादित

PAWS (Paraphrase Adversaries from Word Scrambling) एक डेटासेट है जो पर्यायवाची पहचान और प्राकृतिक भाषा समझ का मूल्यांकन करने के लिए है, जिसमें स्वचालित रूप से उत्पन्न पर्यायवाची शामिल हैं जिनमें उच्च शाब्दिक ओवरलैप लेकिन कम शब्दार्थ समानता होती है, जो उन मॉडलों को चुनौती देने के लिए डिज़ाइन किया गया है जो शब्द-स्तरीय संकेतों पर निर्भर करते हैं।

PAWS (Paraphrase Adversaries from Word Scrambling) एक बेंचमार्क डेटासेट है, जिसे 2019 में प्राकृतिक भाषा प्रसंस्करण मॉडल की उन वाक्यों को पहचानने की क्षमता का मूल्यांकन करने के लिए पेश किया गया था, जो वास्तविक पर्यायवाची हैं, बनाम उन वाक्यों की जो कई शब्द साझा करते हैं लेकिन अर्थ में भिन्न होते हैं। यह डेटासेट Google के शोधकर्ताओं द्वारा बनाया गया था और कृत्रिम-बुद्धिमत्ता और मशीन-लर्निंग के क्षेत्र में सतही शाब्दिक मिलान से परे शब्दार्थ समझ का परीक्षण करने के लिए व्यापक रूप से उपयोग किया जाता है। PAWS में वाक्यों के जोड़े शामिल हैं जो या तो वास्तविक पर्यायवाची हैं या गैर-पर्यायवाची, जिनमें गैर-पर्यायवाची उदाहरण स्रोत वाक्य के शब्द क्रम को उलट-पलट कर उत्पन्न किए जाते हैं, जिसके परिणामस्वरूप उच्च शब्द अतिव्यापन लेकिन परिवर्तित अर्थ होता है।

PAWS की मुख्य चुनौती इसके निर्माण में निहित है: प्रत्येक गैर-पर्यायवाची जोड़ी शब्दों का एक बड़ा अनुपात साझा करती है (अक्सर 90% से अधिक यूनिग्राम अतिव्यापन) फिर भी विभिन्न प्रस्तावों को व्यक्त करती है। यह डिज़ाइन सीधे तौर पर कई शुरुआती तंत्रिका मॉडलों की कमजोरी को लक्षित करता है, जो शब्दार्थ समानता के लिए शाब्दिक अतिव्यापन पर निर्भर रहते थे। मॉडलों को वाक्य-विन्यास और शब्द क्रम पर ध्यान देने के लिए मजबूर करके, PAWS तंत्रिका-नेटवर्क आर्किटेक्चर के लिए एक मानक तनाव परीक्षण बन गया है, जिसमें ट्रांसफॉर्मर-आधारित मॉडल जैसे बड़े-भाषा-मॉडल शामिल हैं।

डेटासेट निर्माण और विविधताएँ

मूल PAWS डेटासेट दो स्रोतों से बनाया गया था: विकिपीडिया वाक्य और Quora प्रश्न जोड़े। विकिपीडिया भाग के लिए, वाक्यों को नियमों के एक सेट का उपयोग करके स्वचालित रूप से उलट-पलट किया गया था जो शब्दों या वाक्यांशों को बदलते हैं जबकि व्याकरणिकता को जितना संभव हो संरक्षित रखते हैं। मानव एनोटेटरों ने फिर प्रत्येक जोड़ी को पर्यायवाची या नहीं के रूप में लेबल किया, गुणवत्ता सुनिश्चित करते हुए। Quora भाग मौजूदा प्रश्न जोड़ों से लिया गया था, जिसमें गैर-पर्यायवाची को उच्च शाब्दिक अतिव्यापन के साथ चुना गया था। अंतिम डेटासेट में अंग्रेजी में 108,000 से अधिक जोड़े शामिल हैं, जो प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित हैं। एक बहुभाषी संस्करण, PAWS-X, बाद में जारी किया गया था, जो छह भाषाओं को कवर करता है: फ्रेंच, स्पेनिश, जर्मन, चीनी, जापानी और कोरियाई, क्रॉस-भाषाई सामान्यीकरण का मूल्यांकन करने के लिए।

मूल्यांकन और मॉडल प्रदर्शन

PAWS आमतौर पर एक द्विआधारी वर्गीकरण कार्य के रूप में उपयोग किया जाता है: एक वाक्य जोड़ी दिए जाने पर, भविष्यवाणी करें कि क्या वे पर्यायवाची हैं। शुरुआती गहन-शिक्षण मॉडल, जिनमें द्विदिशात्मक LSTM और शुरुआती ट्रांसफॉर्मर शामिल हैं, PAWS पर खराब प्रदर्शन करते थे, अक्सर मानक प्रशिक्षण डेटा का उपयोग करते समय यादृच्छिक अनुमान से थोड़ा अधिक सटीकता प्राप्त करते थे। इसने उन मॉडलों की अपर्याप्तता को उजागर किया जो मुख्य रूप से शब्द अतिव्यापन पर निर्भर थे। बाद के सुधार वाक्य-विन्यास जानकारी, जैसे निर्भरता वृक्ष, को शामिल करने या बड़े कोरपोरा पर प्रीट्रेनिंग से आए। आधुनिक बड़े-भाषा-मॉडल, जैसे कि ओपनएआई और एंथ्रोपिक द्वारा विकसित, PAWS पर उच्च सटीकता प्राप्त करते हैं, लेकिन डेटासेट यह जांचने के लिए एक उपयोगी नैदानिक उपकरण बना हुआ है कि क्या मॉडल वास्तव में अर्थ समझते हैं बनाम सांख्यिकीय नियमितताओं का शोषण करते हैं।

प्राकृतिक भाषा समझ अनुसंधान पर प्रभाव

PAWS ने अधिक मजबूत प्राकृतिक-भाषा-समझ बेंचमार्क और प्रशिक्षण तकनीकों के विकास को प्रभावित किया है। इसका उपयोग डेटा संवर्धन विधियों, जैसे बैक-ट्रांसलेशन और शब्द-क्रम गड़बड़ी, की प्रभावशीलता का मूल्यांकन करने के लिए किया गया है ताकि मॉडल मजबूती में सुधार हो सके। शोधकर्ताओं ने शब्द क्रम को पकड़ने में स्थितीय-एन्कोडिंग और मल्टी-हेड-अटेंशन तंत्रों की सीमाओं का अध्ययन करने के लिए भी PAWS का उपयोग किया है। डेटासेट को सैकड़ों पत्रों में उद्धृत किया गया है और यह कई मॉडल मूल्यांकन सुइट्स में एक मानक घटक है, अन्य प्रतिकूल बेंचमार्क के साथ।

सीमाएँ और आलोचनाएँ

जबकि PAWS मूल्यवान है, इसकी सीमाएँ हैं। उलट-पलट प्रक्रिया ऐसे वाक्य उत्पन्न कर सकती है जो व्याकरणिक रूप से अजीब या अप्राकृतिक हैं, जो वास्तविक दुनिया के पर्यायवाची विविधताओं को प्रतिबिंबित नहीं कर सकते हैं। इसके अतिरिक्त, द्विआधारी लेबलिंग (पर्यायवाची बनाम गैर-पर्यायवाची) शब्दार्थ समानता की डिग्री को नहीं पकड़ती है। कुछ आलोचकों का तर्क है कि PAWS पर उच्च प्रदर्शन सामान्य शब्दार्थ क्षमता की गारंटी नहीं देता है, क्योंकि मॉडल इस डेटासेट के लिए विशिष्ट अनुमानी सीख सकते हैं। फिर भी, PAWS उन मॉडलों की पहचान करने के लिए एक व्यापक रूप से उपयोग किया जाने वाला उपकरण बना हुआ है जो शाब्दिक संकेतों पर अत्यधिक निर्भर हैं।

संबंधित बेंचमार्क और भविष्य की दिशाएँ

PAWS प्रतिकूल डेटासेट के एक व्यापक परिवार का हिस्सा है जो मॉडल कमजोरियों को उजागर करने के लिए डिज़ाइन किया गया है, जैसे GLUE और SuperGLUE बेंचमार्क। इसके निर्माण ने WIKIPAR और QQP जैसे कठिन नकारात्मक उदाहरणों के साथ समान डेटासेट को प्रेरित किया। भविष्य का कार्य PAWS को अधिक भाषाओं, डोमेन और कार्यों, जैसे प्राकृतिक भाषा अनुमान या प्रश्न उत्तरण, तक विस्तारित कर सकता है। जैसे-जैसे जनरेटिव-एआई विकसित होता रहता है, PAWS एक अनुस्मारक के रूप में कार्य करता है कि सच्ची समझ के लिए केवल शब्दों का मिलान नहीं, बल्कि भाषा की संरचनात्मक संरचना को समझना आवश्यक है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·dataset·benchmark·semantic-similarity
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास