The Corpus of Linguistic Acceptability (CoLA) एक प्राकृतिक भाषा प्रसंस्करण में बेंचमार्क डेटासेट है, जिसमें 10,657 अंग्रेजी वाक्य शामिल हैं, जिनमें से प्रत्येक को व्याकरणिक स्वीकार्यता के लिए लेबल किया गया है। यह कॉर्पस 2018 में कम्प्यूटेशनल मॉडल की व्याकरणिक और अव्याकरणिक वाक्यों के बीच अंतर करने की क्षमता का मूल्यांकन करने के लिए पेश किया गया था, एक ऐसा कार्य जिसके लिए गहन भाषाई ज्ञान की आवश्यकता होती है। CoLA बड़े भाषा मॉडल और अन्य तंत्रिका नेटवर्क आर्किटेक्चर के लिए एक मानक मूल्यांकन उपकरण बन गया है, जो व्याकरणिक क्षमता के लिए एक प्रॉक्सी के रूप में कार्य करता है।
यह डेटासेट भाषाविज्ञान शोधकर्ताओं द्वारा संकलित किया गया था और इसमें भाषाई साहित्य से लिए गए वाक्य शामिल हैं, जो वाक्य-विन्यास संबंधी घटनाओं की एक विस्तृत श्रृंखला को कवर करते हैं। प्रत्येक वाक्य को एक बाइनरी लेबल के साथ एनोटेट किया गया है जो दर्शाता है कि यह एक देशी वक्ता के लिए स्वीकार्य है या नहीं। कार्य को एक बाइनरी वर्गीकरण समस्या के रूप में तैयार किया गया है, जहां मॉडल को प्रत्येक वाक्य के लिए लेबल की भविष्यवाणी करनी होती है। CoLA का उपयोग अक्सर सामान्य भाषा समझ का आकलन करने के लिए अन्य बेंचमार्क के साथ संयोजन में किया जाता है, और यह व्यापक रूप से उद्धृत GLUE (जनरल लैंग्वेज अंडरस्टैंडिंग इवैल्यूएशन) सूट का एक घटक है।
निर्माण और एनोटेशन
CoLA को एलेक्स वारस्टेड और सहयोगियों द्वारा बनाया गया था, जो प्रकाशित भाषाई उदाहरणों और पाठ्यपुस्तकों से लिया गया था। वाक्यों को विशिष्ट व्याकरणिक अंतरों को चित्रित करने के लिए चुना गया था, जैसे कि कर्ता-क्रिया समझौता, द्वीप बाधाएं, और अनाफोरा। एनोटेटर, जो प्रशिक्षित भाषाविद थे, ने प्रत्येक वाक्य को एक पैमाने पर स्वीकार्यता के लिए आंका, जिसे बाद में बाइनरी लेबल में संक्षिप्त किया गया। अंतिम कॉर्पस में 8,514 प्रशिक्षण उदाहरण, 1,043 विकास उदाहरण, और 1,100 परीक्षण उदाहरण शामिल हैं, जिसमें परीक्षण सेट आधिकारिक मूल्यांकन के लिए अलग रखा गया है। एनोटेशन प्रक्रिया ने स्थिरता पर जोर दिया, विश्वसनीयता सुनिश्चित करने के लिए अंतर-एनोटेटर समझौते को मापा गया।
कार्य और मूल्यांकन
CoLA से जुड़ा प्राथमिक कार्य प्रत्येक वाक्य को व्याकरणिक (स्वीकार्य) या अव्याकरणिक (अस्वीकार्य) के रूप में वर्गीकृत करना है। प्रदर्शन को आमतौर पर मैथ्यूज सहसंबंध गुणांक (MCC) का उपयोग करके मापा जाता है, जो सकारात्मक और नकारात्मक उदाहरणों के बीच असंतुलन को ध्यान में रखता है। एक यादृच्छिक आधार रेखा शून्य के करीब MCC प्राप्त करेगी, जबकि मानव प्रदर्शन लगभग 0.99 होने का अनुमान है। मॉडल का मूल्यांकन अलग रखे गए परीक्षण सेट पर किया जाता है, और परिणाम अक्सर लीडरबोर्ड पर रिपोर्ट किए जाते हैं। कार्य के लिए मॉडल को याद रखने से परे सामान्यीकरण करने की आवश्यकता होती है, क्योंकि कई वाक्य नए होते हैं और विशिष्ट वाक्य-विन्यास नियमों का परीक्षण करते हैं।
एआई अनुसंधान में महत्व
CoLA ने कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में व्याकरणिक ज्ञान पर अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। यह यह जांचने के लिए एक नियंत्रित वातावरण प्रदान करता है कि क्या मॉडल ने अमूर्त वाक्य-विन्यास पैटर्न सीखे हैं, न कि केवल सांख्यिकीय नियमितताएं। अध्ययनों से पता चला है कि ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि मल्टी-हेड अटेंशन का उपयोग करने वाले, CoLA पर उच्च स्कोर प्राप्त कर सकते हैं, लेकिन वे अक्सर सतही स्तर के संकेतों पर निर्भर करते हैं। इससे तंत्रिका मॉडल में भाषाई ज्ञान की प्रकृति के बारे में बहस हुई है। CoLA का उपयोग प्रशिक्षण डेटा आकार, मॉडल आर्किटेक्चर, और फाइन-ट्यूनिंग रणनीतियों के व्याकरणिक क्षमता पर प्रभाव का मूल्यांकन करने के लिए भी किया जाता है।
अन्य बेंचमार्क से संबंध
CoLA GLUE बेंचमार्क का हिस्सा है, जिसमें प्राकृतिक भाषा अनुमान, भावना विश्लेषण, और प्रश्न उत्तर को कवर करने वाले नौ कार्य शामिल हैं। GLUE के भीतर, CoLA को व्याकरणिकता के लिए एक नैदानिक कार्य माना जाता है, जो स्टैनफोर्ड सेंटिमेंट ट्रीबैंक और मल्टी-जॉनर नेचुरल लैंग्वेज इंफरेंस कॉर्पस जैसे कार्यों का पूरक है। यह बेंचमार्क विभिन्न मॉडलों की तुलना करने में सहायक रहा है, जिसमें प्रारंभिक गहन शिक्षण दृष्टिकोण और बाद के बड़े पैमाने पर पूर्व-प्रशिक्षण विधियां शामिल हैं। स्वीकार्यता पर CoLA का ध्यान इसे अन्य कार्यों से अलग करता है जो अर्थ या व्यावहारिक समझ पर जोर देते हैं, जिससे यह वाक्य-विन्यास प्रसंस्करण का एक अद्वितीय परीक्षण बन जाता है।
सीमाएं और आलोचनाएं
व्यापक उपयोग के बावजूद, CoLA की सीमाएं हैं। बाइनरी लेबलिंग स्वीकार्यता की ढाल प्रकृति को अति सरल बनाती है, क्योंकि कुछ वाक्य सीमांत रूप से स्वीकार्य हैं। कॉर्पस भी केवल अंग्रेजी तक सीमित है, और इसके उदाहरण औपचारिक भाषाई साहित्य से लिए गए हैं, जो रोजमर्रा के उपयोग को प्रतिबिंबित नहीं कर सकते हैं। आलोचकों का तर्क है कि CoLA पर उच्च प्रदर्शन आवश्यक रूप से मानव-जैसी व्याकरणिक क्षमता का संकेत नहीं देता है, क्योंकि मॉडल स्पूरियस सहसंबंधों का शोषण कर सकते हैं। इसके अतिरिक्त, परीक्षण सेट छोटा है, जो मूल्यांकन परिणामों में उच्च भिन्नता पैदा कर सकता है। शोधकर्ताओं ने इनमें से कुछ मुद्दों को संबोधित करने के लिए बहुभाषी स्वीकार्यता कॉर्पस जैसे विस्तार प्रस्तावित किए हैं।