अंग्रेज़ी से अनुवादित

CoLA एक बेंचमार्क डेटासेट है जिसमें 10,657 अंग्रेजी वाक्य व्याकरणिक स्वीकार्यता के लिए लेबल किए गए हैं, जिसका उपयोग तंत्रिका नेटवर्क और बड़े भाषा मॉडल का मूल्यांकन भाषाई निर्णय कार्यों पर करने के लिए किया जाता है। इसका सार्वजनिक संस्करण प्रशिक्षण और विकास के लिए 9,594 वाक्य शामिल करता है।

कोरपस ऑफ लिंग्विस्टिक एक्सेप्टेबिलिटी (CoLA) एक बेंचमार्क डेटासेट है जिसे कृत्रिम तंत्रिका नेटवर्क, जिसमें बड़े भाषा मॉडल शामिल हैं, की अंग्रेजी वाक्यों के व्याकरणिक रूप से सही होने का निर्णय करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें प्रकाशित भाषाविज्ञान साहित्य से लिए गए 10,657 वाक्य शामिल हैं, जिनमें से प्रत्येक को मैन्युअल रूप से व्याकरणिक या अव्याकरणिक के रूप में लेबल किया गया है। यह डेटासेट वाक्य-रचना की सुव्यवस्थितता के प्रति मॉडल की संवेदनशीलता को मापने के लिए एक मानक परीक्षण के रूप में कार्य करता है, जो अर्थ संबंधी समझ या तथ्यात्मक स्मरण से भिन्न कार्य है।

CoLA को मशीन लर्निंग सिस्टम में भाषाई ज्ञान की जांच के लिए एक बड़े, विश्वसनीय संसाधन की आवश्यकता को संबोधित करने के लिए पेश किया गया था। इसके वाक्य कई प्रकार की वाक्य-रचना घटनाओं को कवर करते हैं, जिनमें कर्ता-क्रिया समझौता, द्वीप बाधाएं, और तर्क संरचना शामिल हैं, जो मुख्य रूप से प्राकृतिक पाठ पर प्रशिक्षित मॉडलों के लिए एक कठोर चुनौती बनाते हैं। लेबल शैक्षणिक स्रोतों से देशी वक्ताओं के निर्णयों को दर्शाते हैं, जो स्वीकार्यता के लिए एक सुसंगत आधार सत्य प्रदान करते हैं।

डेटासेट संरचना

पूर्ण CoLA डेटासेट में 10,657 वाक्य शामिल हैं, जिनमें से प्रत्येक स्वीकार्यता दर्शाने वाले बाइनरी लेबल से युक्त है। वाक्य प्रकाशित भाषाविज्ञान अनुसंधान से उत्पन्न होते हैं, यह सुनिश्चित करते हुए कि वे विविध और अक्सर सूक्ष्म व्याकरणिक अंतरों का प्रतिनिधित्व करते हैं। CoLA का सार्वजनिक संस्करण 9,594 वाक्यों का है, जिन्हें प्रशिक्षण और विकास सेटों में विभाजित किया गया है। शेष 1,063 वाक्य एक होल्ड-आउट परीक्षण सेट के लिए आरक्षित हैं, जो ओवरफिटिंग को रोकने और उचित मूल्यांकन सुनिश्चित करने के लिए सार्वजनिक रूप से जारी नहीं किया गया है।

डेटासेट में प्रत्येक वाक्य के साथ मेटाडेटा होता है, जिसमें इसका स्रोत प्रकाशन और यह जिस विशिष्ट भाषाई घटना को दर्शाता है, शामिल है। यह संरचना शोधकर्ताओं को विभिन्न व्याकरणिक श्रेणियों में मॉडल प्रदर्शन का विश्लेषण करने की अनुमति देती है। बाइनरी लेबलिंग कार्य को सरल बनाती है, लेकिन स्वीकार्यता निर्णयों की अंतर्निहित जटिलता का मतलब है कि किनारे के मामलों पर मानव एनोटेटर भी असहमत हो सकते हैं, यह बारीकी डेटासेट के डिज़ाइन में परिलक्षित होती है।

एनएलपी मूल्यांकन में भूमिका

CoLA प्राकृतिक भाषा प्रसंस्करण में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया है, विशेष रूप से Transformer (architecture)-आधारित मॉडलों की भाषाई क्षमताओं का आकलन करने के लिए। इसे GLUE बेंचमार्क में शामिल किया गया है, जो सामान्य भाषा समझ को मापने वाले कार्यों का एक संग्रह है। GLUE में, CoLA एक मॉडल के व्याकरणिक निर्णय का परीक्षण करता है, जो भावना विश्लेषण और पाठ्य आनुषंगिकता जैसे कार्यों का पूरक है। CoLA पर प्रदर्शन आमतौर पर मैथ्यू के सहसंबंध गुणांक के रूप में रिपोर्ट किया जाता है, जो व्याकरणिक और अव्याकरणिक उदाहरणों के बीच असंतुलन को ध्यान में रखता है।

बड़े भाषा मॉडल जैसे कि OpenAI, Anthropic, और Google DeepMind द्वारा विकसित, CoLA वाक्य-रचना क्षमता का एक नियंत्रित माप प्रदान करता है। उत्पादक कार्यों के विपरीत, CoLA को स्पष्ट बाइनरी निर्णयों की आवश्यकता होती है, जिससे मॉडल के व्याकरणिक ज्ञान को उसकी प्रवाहशीलता से अलग करना आसान हो जाता है। हालांकि, मॉडल अक्सर अन्य GLUE कार्यों की तुलना में CoLA पर खराब प्रदर्शन करते हैं, जो सूक्ष्म स्वीकार्यता निर्णयों को पकड़ने की कठिनाई को उजागर करता है।

अनुप्रयोग और सीमाएं

शोधकर्ता विभिन्न आर्किटेक्चर की भाषाई क्षमताओं की तुलना करने के लिए CoLA का उपयोग करते हैं, जिसमें तंत्रिका नेटवर्क और गहन शिक्षण प्रणालियाँ शामिल हैं। यह अध्ययन करने में सहायक रहा है कि क्या मॉडल अमूर्त व्याकरणिक नियम सीखते हैं या प्रशिक्षण डेटा में सांख्यिकीय पैटर्न पर भरोसा करते हैं। अध्ययनों से पता चला है कि CoLA पर प्रदर्शन मॉडल आकार और प्रशिक्षण डेटा के साथ सहसंबंधित होता है, लेकिन अत्याधुनिक प्रणालियाँ भी दुर्लभ या जटिल निर्माणों के साथ संघर्ष करती हैं।

डेटासेट की सीमाओं में शैक्षणिक स्रोतों से लिखित, औपचारिक वाक्यों पर इसकी निर्भरता शामिल है, जो रोजमर्रा की भाषा के उपयोग को प्रतिबिंबित नहीं कर सकती है। इसके अतिरिक्त, बाइनरी लेबल योजना स्वीकार्यता की ढाल प्रकृति को अति सरल बनाती है, क्योंकि कुछ वाक्य सीमांत रूप से स्वीकार्य हैं। इन बाधाओं के बावजूद, CoLA कृत्रिम बुद्धिमत्ता अनुसंधान में व्याकरणिक निर्णय का मूल्यांकन करने के लिए एक मानक संदर्भ बना हुआ है।

संबंधित बेंचमार्क और विस्तार

CoLA ने भाषाई क्षमता के अन्य पहलुओं की जांच करने वाले समान डेटासेट और विस्तारों को प्रेरित किया है। उदाहरण के लिए, BLiMP बेंचमार्क न्यूनतम जोड़े के साथ वाक्य-रचना घटनाओं की एक व्यापक श्रृंखला प्रदान करता है, जबकि SuperGLUE सुइट में अधिक चुनौतीपूर्ण कार्य शामिल हैं। ये संसाधन अधिक सूक्ष्म निदान प्रदान करके CoLA के पूरक हैं। डेटासेट की पद्धति, जो प्रकाशित भाषाविज्ञान साहित्य का लाभ उठाती है, को अन्य भाषाओं में अपनाया गया है, हालांकि अंग्रेजी प्राथमिक ध्यान केंद्रित है।

2020 के दशक की शुरुआत तक, CoLA शैक्षणिक और औद्योगिक अनुसंधान में एक मानक मूल्यांकन उपकरण बना हुआ है। व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में इसका एकीकरण इसकी निरंतर प्रासंगिकता सुनिश्चित करता है, भले ही नए डेटासेट उभर रहे हों। होल्ड-आउट परीक्षण सेट, हालांकि दुर्गम है, ईमानदार रिपोर्टिंग को प्रोत्साहित करता है और बेंचमार्क गेमिंग को रोकता है, एक प्रथा जो इस क्षेत्र में तेजी से महत्वपूर्ण हो गई है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·benchmark-dataset·linguistics·grammatical-acceptability
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास