抱歉,您提供的源文本似乎不完整。请提供完整的英文维基百科文章标题或内容,以便我准确翻译为印地语。

अंग्रेज़ी से अनुवादित

ANLI (Adversarial NLI) एक बेंचमार्क है जो प्राकृतिक भाषा अनुमान मॉडलों का मूल्यांकन करने के लिए प्रतिकूल रूप से उत्पन्न उदाहरणों का उपयोग करता है, जिसे 2019 में मानक NLI डेटासेट से परे मजबूती का परीक्षण करने के लिए पेश किया गया था।

ANLI (प्रतिकूल प्राकृतिक भाषा अनुमान) एक बेंचमार्क डेटासेट है जिसे प्राकृतिक भाषा अनुमान (NLI) मॉडल की मजबूती का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2019 में फेसबुक एआई रिसर्च (अब मेटा एआई का हिस्सा) के शोधकर्ताओं और सहयोगियों, जिनमें यिक्सिन नी, अदीना विलियम्स और अन्य शामिल हैं, द्वारा पेश किया गया था। बेंचमार्क में कठिनाई के बढ़ते क्रम में प्रतिकूल उदाहरणों के तीन दौर शामिल हैं, जो मानव-और-मॉडल-इन-द-लूप प्रक्रिया के माध्यम से उत्पन्न होते हैं। ANLI का उद्देश्य SNLI और MultiNLI जैसे पहले के NLI डेटासेट की सीमाओं से आगे बढ़ना है, जो उन घटनाओं पर ध्यान केंद्रित करता है जो मॉडल के लिए चुनौतीपूर्ण हैं, जैसे बहु-चरणीय तर्क, निषेध और विश्व ज्ञान। यह बड़े भाषा मॉडल और अन्य NLI प्रणालियों के लिए एक मानक मूल्यांकन बन गया है, जो सामान्यीकरण और तर्क क्षमताओं में अंतराल को उजागर करता है।

ANLI का निर्माण एक प्रतिकूल प्रक्रिया का पालन करता है। प्रत्येक दौर में, मानव एनोटेटर ऐसे आधार और परिकल्पना तैयार करने का प्रयास करते हैं जो वर्तमान अत्याधुनिक मॉडल को गलत भविष्यवाणियाँ करने के लिए प्रेरित करें। मॉडल को मौजूदा NLI डेटा पर प्रशिक्षित किया जाता है और फिर नए उदाहरणों के संपर्क में लाया जाता है; यदि यह विफल होता है, तो उदाहरण को बनाए रखा जाता है। यह प्रक्रिया तीन दौरों में दोहराई जाती है, जिसमें प्रत्येक दौर जटिलता में वृद्धि करता है और अधिक परिष्कृत तर्क की आवश्यकता होती है। अंतिम डेटासेट में 160,000 से अधिक उदाहरण शामिल हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित हैं। दौरों को R1, R2 और R3 के रूप में लेबल किया गया है, जिसमें R3 सबसे चुनौतीपूर्ण है। यह डिज़ाइन सुनिश्चित करता है कि बेंचमार्क कठिन बना रहे, भले ही मॉडल में सुधार हो, क्योंकि उदाहरण विशेष रूप से ज्ञात कमजोरियों पर लक्षित होते हैं।

मूल्यांकन और मेट्रिक्स

ANLI आमतौर पर NLI मॉडल के मूल्यांकन के लिए एक परीक्षण सेट के रूप में उपयोग किया जाता है, जिसमें सटीकता प्राथमिक मेट्रिक है। मॉडल को मानक NLI डेटासेट (जैसे MultiNLI) पर प्रशिक्षित किया जाता है और फिर उसके प्रशिक्षण सेट पर अतिरिक्त फाइन-ट्यूनिंग के बिना ANLI पर मूल्यांकन किया जाता है, ताकि सामान्यीकरण को मापा जा सके। हालाँकि, कुछ अध्ययन ANLI प्रशिक्षण डेटा का उपयोग फाइन-ट्यूनिंग के लिए भी करते हैं, जो स्कोर को बढ़ा सकता है लेकिन उचित तुलना के लिए आम तौर पर हतोत्साहित किया जाता है। बेंचमार्क को मशीन लर्निंग समुदाय में व्यापक रूप से अपनाया गया है, कई पेपर GLUE और SuperGLUE जैसे अन्य बेंचमार्क के साथ ANLI सटीकता की रिपोर्ट करते हैं। 2023 तक, सर्वश्रेष्ठ मॉडल ANLI पर लगभग 70-80% सटीकता प्राप्त करते हैं, जो मानव प्रदर्शन से अभी भी काफी नीचे है, जो 90% से अधिक अनुमानित है।

महत्व और प्रभाव

ANLI का NLI अनुसंधान पर महत्वपूर्ण प्रभाव पड़ा है, जो मानक डेटासेट पर प्रशिक्षित मॉडल की सीमाओं को उजागर करता है। इसने अधिक मजबूत आर्किटेक्चर और प्रशिक्षण तकनीकों के विकास को प्रेरित किया है, जैसे बेहतर तर्क क्षमताओं वाले ट्रांसफॉर्मर, डेटा संवर्धन, और मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF)। बेंचमार्क का उपयोग तर्क के संबंध में स्थितीय एन्कोडिंग और मल्टी-हेड अटेंशन जैसी घटनाओं का अध्ययन करने के लिए भी किया गया है। इसके अलावा, ANLI ने Adversarial SQuAD और HANS जैसे अन्य प्रतिकूल बेंचमार्क के निर्माण को प्रभावित किया है, और इसे SuperGLUE जैसे व्यापक मूल्यांकन सुइट्स में एकीकृत किया गया है, जहाँ यह मॉडल मजबूती के लिए एक नैदानिक उपकरण के रूप में कार्य करता है।

सीमाएँ और आलोचनाएँ

अपने प्रभाव के बावजूद, ANLI को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि प्रतिकूल उदाहरण अक्सर अप्राकृतिक या अत्यधिक कृत्रिम होते हैं, जिससे मॉडल को उन किनारे मामलों पर विफल होने के लिए दंडित किया जाता है जो वास्तविक दुनिया के उपयोग को प्रतिबिंबित नहीं कर सकते हैं। इसके अतिरिक्त, बेंचमार्क का अंग्रेजी पर ध्यान केंद्रित करना बहुभाषी सेटिंग्स में इसकी प्रयोज्यता को सीमित करता है। मानव-और-मॉडल-इन-द-लूप प्रक्रिया की प्रतिलिपि प्रस्तुत करने की क्षमता के बारे में भी चिंताएँ हैं, क्योंकि सटीक उत्पादन प्रक्रिया पूरी तरह से पारदर्शी नहीं हो सकती है। फिर भी, ANLI NLI प्रणालियों के तनाव-परीक्षण के लिए एक मूल्यवान उपकरण बना हुआ है और प्राकृतिक भाषा प्रसंस्करण (NLP) में प्रतिकूल मजबूती पर चल रहे अनुसंधान को प्रेरित किया है।

संबंधित बेंचमार्क और भविष्य की दिशाएँ

ANLI NLP में प्रतिकूल और गतिशील बेंचमार्क की ओर व्यापक प्रवृत्ति का हिस्सा है। अन्य उदाहरणों में SuperGLUE शामिल है, जो ANLI को एक घटक के रूप में शामिल करता है, और हालिया BIG-bench, जिसमें विभिन्न प्रकार के तर्क कार्य शामिल हैं। भविष्य की दिशाओं में ANLI को अन्य भाषाओं और डोमेन तक विस्तारित करना, साथ ही जनरेटिव एआई मॉडल का उपयोग करके प्रतिकूल उदाहरण उत्पन्न करने के अधिक कुशल तरीके विकसित करना शामिल है। जैसे-जैसे एआई प्रणालियाँ अधिक सक्षम होती जाती हैं, ANLI जैसे बेंचमार्क विकसित होते रहेंगे ताकि वे चुनौतीपूर्ण और प्रासंगिक बने रहें।

यह भी देखें

नोट: कुछ आंतरिक लिंक प्लेसहोल्डर हैं और मौजूदा लेखों के अनुरूप नहीं हो सकते हैं; प्रदान की गई स्लग सूची में ये विशिष्ट शब्द शामिल नहीं थे, इसलिए लिंक बाधाओं का पालन करने के लिए उन्हें छोड़ दिया गया है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·natural-language-inference·adversarial·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास