Quoref प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक बेंचमार्क डेटासेट है, जिसे विशेष रूप से प्रश्न उत्तर देने के संदर्भ में कोरफेरेंस समाधान करने की मशीन की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2019 में टोरंटो विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस की एक टीम द्वारा पेश किया गया, यह डेटासेट मौजूदा पठन समझ बेंचमार्क में एक अंतर को संबोधित करने के लिए बनाया गया था, जो अक्सर मॉडलों को पाठ में संस्थाओं के बीच संबंधों को पूरी तरह से समझे बिना प्रश्नों का उत्तर देने की अनुमति देता था।
नाम Quoref "प्रश्न" और "कोरफेरेंस" का एक पोर्टमैंटो है, जो इसके दोहरे फोकस को दर्शाता है। डेटासेट में 4,700 विकिपीडिया अनुच्छेदों से प्राप्त 24,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं। प्रत्येक प्रश्न इस तरह से डिज़ाइन किया गया है कि सही उत्तर देने के लिए मॉडल को एक कोरफेरेंस को हल करना आवश्यक है, जिसका अर्थ है कि इसे पहचानना होगा कि अनुच्छेद में कौन सा संज्ञा वाक्यांश या सर्वनाम उसी इकाई को संदर्भित करता है जैसा कि दूसरा। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "उसने किससे शादी की?" जहाँ सर्वनाम "वह" अनुच्छेद में पहले उल्लिखित एक विशिष्ट व्यक्ति को संदर्भित करता है, और मॉडल को उत्तर खोजने के लिए उस सर्वनाम को सही पूर्ववर्ती से जोड़ना होगा।
निर्माण और डिज़ाइन
Quoref डेटासेट एक अर्ध-स्वचालित प्रक्रिया का उपयोग करके बनाया गया था। निर्माताओं ने पहले विकिपीडिया से ऐसे अनुच्छेद चुने जिनमें कोरफेरेंट उल्लेखों का उच्च घनत्व था। फिर उन्होंने उसी इकाई को संदर्भित करने वाले उल्लेखों के समूहों की पहचान करने के लिए एक कोरफेरेंस समाधान प्रणाली का उपयोग किया। इन समूहों से, उन्होंने एक उल्लेख को सर्वनाम या वर्णनात्मक वाक्यांश के साथ बदलकर प्रश्न उत्पन्न किए, और फिर उस इकाई और अनुच्छेद में किसी अन्य के बीच संबंध के बारे में पूछा। प्रश्नों को मानव एनोटेटरों द्वारा फ़िल्टर और मान्य किया गया ताकि यह सुनिश्चित हो सके कि वे उत्तर देने योग्य थे और कोरफेरेंस समाधान वास्तव में आवश्यक था।
एक प्रमुख डिज़ाइन विकल्प प्रश्नों को गैर-तुच्छ बनाना था। अनुच्छेदों को इतना लंबा चुना गया कि सरल शाब्दिक मिलान विफल हो जाए। प्रश्नों में अक्सर मॉडल को कई वाक्यों में संस्थाओं को ट्रैक करने की आवश्यकता होती है, और उत्तर स्पैन हमेशा कोरफेरेंट उल्लेख के समान नहीं होते हैं, जिससे मॉडल को पूरे अनुच्छेद के बारे में तर्क करने के लिए मजबूर होना पड़ता है।
मूल्यांकन और प्रभाव
Quoref पठन समझ मॉडलों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है, विशेष रूप से ट्रांसफॉर्मर और बड़े भाषा मॉडल पर आधारित। जब इसे जारी किया गया था, उस समय के अत्याधुनिक मॉडल, जैसे BERT, ने लगभग 70% का F1 स्कोर हासिल किया, जबकि मानव प्रदर्शन 94% अनुमानित था। इस महत्वपूर्ण अंतर ने कार्य की कठिनाई को उजागर किया और अधिक परिष्कृत कोरफेरेंस समाधान तकनीकों और ध्यान तंत्रों में अनुसंधान को प्रेरित किया।
डेटासेट का उपयोग प्रमुख AI अनुसंधान संगठनों, जिनमें OpenAI और Google DeepMind शामिल हैं, के मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है। इसे SuperGLUE जैसे व्यापक बेंचमार्क में भी शामिल किया गया है, जो सामान्य भाषा समझ का आकलन करने के लिए कई कार्यों को एकत्रित करता है। Quoref से प्राप्त अंतर्दृष्टि ने तंत्रिका नेटवर्क वास्तुकलाओं के विकास को प्रभावित किया है जो स्पष्ट रूप से इकाई संबंधों को मॉडल करते हैं, जैसे कि इकाई-स्पैन और ग्राफ-आधारित मॉडल।
सीमाएँ और आलोचनाएँ
जबकि Quoref एक मूल्यवान संसाधन है, इसकी सीमाएँ हैं। डेटासेट केवल विकिपीडिया से प्राप्त है, जो एक औपचारिक, विश्वकोशीय शैली में लिखा गया है। इसका मतलब है कि कोरफेरेंस पैटर्न अपेक्षाकृत साफ और अच्छी तरह से संरचित हैं, बातचीत या सोशल मीडिया पाठ में पाई जाने वाली अधिक अव्यवस्थित, अस्पष्ट भाषा के विपरीत। इसके अतिरिक्त, प्रश्न एक टेम्पलेट से उत्पन्न होते हैं, जो एक निश्चित डिग्री की पूर्वानुमेयता ला सकता है। कुछ शोधकर्ताओं ने नोट किया है कि मॉडल वास्तव में कोरफेरेंस समाधान किए बिना उच्च स्कोर प्राप्त करने के लिए सतही पैटर्न, जैसे उत्तर स्पैन की स्थिति, का फायदा उठा सकते हैं।
एक और आलोचना यह है कि डेटासेट सभी प्रकार के कोरफेरेंस को कवर नहीं करता है, जैसे कि ब्रिजिंग संदर्भ (उदाहरण के लिए, "कार" पहले उल्लिखित "वाहन" को संदर्भित करना) या कैटाफोरा (जहाँ एक सर्वनाम अपने पूर्ववर्ती से पहले दिखाई देता है)। यह सामान्य कोरफेरेंस क्षमता के परीक्षण के रूप में इसकी व्यापकता को सीमित करता है।
विरासत और भविष्य की दिशाएँ
Quoref की शुरुआत ने मशीन लर्निंग अनुसंधान में अधिक चुनौतीपूर्ण और लक्षित बेंचमार्क की ओर एक व्यापक प्रवृत्ति में योगदान दिया है। इसने अन्य भाषाओं और संदर्भ समाधान के अधिक जटिल रूपों, जैसे कि अस्थायी या कारण संबंधों से जुड़े, के लिए समान डेटासेट के निर्माण को प्रेरित किया है। जैसे-जैसे जनरेटिव AI मॉडल में सुधार जारी है, Quoref एक प्रासंगिक परीक्षण बना हुआ है, जिसमें GPT-4 जैसे आधुनिक मॉडल लगभग मानव-स्तरीय प्रदर्शन प्राप्त कर रहे हैं, हालाँकि यह कार्य अभी भी छोटे, अधिक कुशल मॉडलों के लिए चुनौतियाँ पेश करता है।
डेटासेट सार्वजनिक रूप से उपलब्ध है और अक्सर शैक्षणिक अनुसंधान और उद्योग मूल्यांकन में उपयोग किया जाता है। यह एक अनुस्मारक के रूप में कार्य करता है कि सच्ची भाषा समझ के लिए केवल पैटर्न मिलान नहीं, बल्कि एक प्रवचन में संस्थाओं को ट्रैक करने और जोड़ने की क्षमता की आवश्यकता होती है, एक कौशल जो कई वास्तविक दुनिया के अनुप्रयोगों के लिए मौलिक है, सूचना निष्कर्षण से लेकर संवाद प्रणालियों तक।
यह भी देखें
- कृत्रिम बुद्धिमत्ता
- गहन शिक्षण
- प्राकृतिक भाषा प्रसंस्करण (नोट: प्रदान की गई सूची में नहीं, लेकिन संबंधित)
- कोरफेरेंस समाधान (नोट: प्रदान की गई सूची में नहीं, लेकिन संबंधित)