QAngaroo एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की बहु-चरणीय तर्क क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। मानक प्रश्न-उत्तर कार्यों के विपरीत, जिनमें एकल तथ्य प्राप्त करने की आवश्यकता होती है, QAngaroo ऐसे प्रश्न प्रस्तुत करता है जिनमें कई अलग-अलग दस्तावेज़ों या अनुच्छेदों से जानकारी को संयोजित करना आवश्यक होता है। यह नाम "प्रश्न-उत्तर" और "कंगारू" का एक संयोजन है, जो साक्ष्य के टुकड़ों के बीच कूदने पर केंद्रित कार्य को दर्शाता है। इसे 2018 में यूनिवर्सिटी कॉलेज लंदन और फेसबुक एआई रिसर्च के शोधकर्ताओं, जिनमें जोहान्स वेल्बल, पोंटस स्टेनेटॉर्प और सेबेस्टियन रीडेल शामिल हैं, द्वारा पेश किया गया था।
इस बेंचमार्क में दो मुख्य उपसमूह शामिल हैं: विकीहॉप और मेडहॉप। विकीहॉप विकिपीडिया लेखों से निर्मित है, जहाँ प्रत्येक प्रश्न सहायक दस्तावेज़ों के एक समूह से प्राप्त होता है जो सामूहिक रूप से उत्तर रखते हैं। मेडहॉप चिकित्सा सारांशों से बनाया गया है, जो दवा-दवा अंतःक्रिया भविष्यवाणियों पर केंद्रित है, और जैव चिकित्सा साहित्य पर तर्क की आवश्यकता होती है। दोनों उपसमूह इस प्रकार डिज़ाइन किए गए हैं कि उत्तर किसी एक दस्तावेज़ में नहीं पाया जा सकता, जिससे मॉडलों को कई स्रोतों से साक्ष्य एकत्र करने के लिए मजबूर किया जाता है।
कार्य डिज़ाइन और मूल्यांकन
QAngaroo में प्रत्येक उदाहरण में एक क्वेरी, उम्मीदवार उत्तर विकल्पों का एक समूह और सहायक दस्तावेज़ों का एक संग्रह शामिल होता है। मॉडल को प्रदान किए गए संदर्भ पर तर्क करके सही उत्तर का चयन करना होता है। मूल्यांकन मीट्रिक सटीकता है, जो सही उत्तर दिए गए प्रश्नों के प्रतिशत को मापती है। यह बेंचमार्क जानबूझकर चुनौतीपूर्ण है, क्योंकि सहायक दस्तावेज़ अक्सर शोरगुल वाले होते हैं और अप्रासंगिक जानकारी रखते हैं, जिससे मॉडलों को केवल प्रासंगिक टुकड़ों की पहचान और संयोजन करना पड़ता है।
डेटासेट एक अर्ध-स्वचालित पाइपलाइन का उपयोग करके बनाया गया था। विकीहॉप के लिए, निर्माताओं ने विकिपीडिया के आंतरिक हाइपरलिंक्स का उपयोग करके बहु-चरणीय प्रश्न उत्पन्न किए। उन्होंने एक मध्यवर्ती इकाई के माध्यम से जुड़े इकाइयों के जोड़े की पहचान की, फिर एक ऐसा प्रश्न बनाया जो दो अंत बिंदुओं के बीच संबंध का अनुमान लगाने की आवश्यकता रखता है। मेडहॉप के लिए, उन्होंने चिकित्सा सारांशों पर एक समान दृष्टिकोण का उपयोग किया, जो दवाओं के बीच अंतःक्रियाओं पर केंद्रित था।
अनुसंधान पर प्रभाव
QAngaroo Machine learning और Deep learning मॉडलों में बहु-चरणीय तर्क क्षमताओं का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन गया है। इसका व्यापक रूप से Neural network आर्किटेक्चर पर शोध में उपयोग किया गया है, विशेष रूप से उन मॉडलों में जो ध्यान तंत्र और स्मृति-वर्धित नेटवर्क का उपयोग करते हैं। इस बेंचमार्क ने प्रारंभिक Large language model की सीमाओं को उजागर किया, जो अक्सर स्पष्ट बहु-चरणीय अनुमान की आवश्यकता वाले कार्यों में संघर्ष करते थे। इसने विशेष मॉडलों के विकास को प्रेरित किया, जैसे कि ग्राफ तंत्रिका नेटवर्क जो दस्तावेज़ संरचना पर कार्य करते हैं, और पुनरावृत्त पठन दृष्टिकोण जो कई पासों में साक्ष्य चयन को परिष्कृत करते हैं।
बेंचमार्क ने एआई में तर्क की व्यापक समझ में भी योगदान दिया। इसने प्रदर्शित किया कि सरल Sequence-to-Sequence (Seq2Seq) मॉडल अक्सर बहु-चरणीय कार्यों पर विफल होते हैं, जबकि स्पष्ट तर्क घटकों वाले मॉडल, जैसे Graph Neural Network या साक्ष्य चयन के लिए Reinforcement learning का उपयोग करने वाले, काफी बेहतर प्रदर्शन करते हैं। 2023 तक, विकीहॉप पर अत्याधुनिक परिणाम 70% से अधिक सटीकता तक पहुँच चुके हैं, लेकिन बेंचमार्क अनसुलझा बना हुआ है, जिसमें मानव प्रदर्शन लगभग 90% अनुमानित है।
सीमाएँ और आलोचनाएँ
अपने प्रभाव के बावजूद, QAngaroo को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं ने नोट किया है कि बेंचमार्क का निर्माण मॉडलों को शॉर्टकट का शोषण करने की अनुमति दे सकता है, जैसे कि उम्मीदवार विकल्पों के माध्यम से उत्तर रिसाव या सहायक दस्तावेज़ों में सतही पैटर्न। उदाहरण के लिए, उत्तर अक्सर वह इकाई होती है जो दस्तावेज़ों में सबसे अधिक बार दिखाई देती है, जिसका आवृत्ति-आधारित ह्यूरिस्टिक्स द्वारा शोषण किया जा सकता है। इससे चिंताएँ उत्पन्न हुई हैं कि QAngaroo पर उच्च स्कोर वास्तविक तर्क क्षमता को प्रतिबिंबित नहीं कर सकते।
इसके अतिरिक्त, बेंचमार्क का विकिपीडिया और चिकित्सा सारांशों पर ध्यान इसकी डोमेन कवरेज को सीमित करता है। प्रश्न अपेक्षाकृत छोटे होते हैं और तर्क चरण आमतौर पर दो या तीन हॉप तक सीमित होते हैं, जो वास्तविक दुनिया के बहु-चरणीय तर्क कार्यों की जटिलता को पकड़ नहीं सकते। परिणामस्वरूप, कुछ शोधकर्ताओं ने अधिक विविध और चुनौतीपूर्ण बेंचमार्क की मांग की है, जिससे बाद के डेटासेट जैसे HotpotQA और 2WikiMultiHopQA का विकास हुआ।
विरासत और निरंतर उपयोग
इन सीमाओं के बावजूद, QAngaroo एआई मॉडलों का मूल्यांकन और तुलना करने के लिए एक व्यापक रूप से उपयोग किया जाने वाला उपकरण बना हुआ है। यह कई सार्वजनिक लीडरबोर्ड में शामिल है और अक्सर प्रश्न-उत्तर और तर्क पर शोध पत्रों में आधार रेखा के रूप में उपयोग किया जाता है। बेंचमार्क के डिज़ाइन सिद्धांत, विशेष रूप से कई सहायक दस्तावेज़ों का उपयोग और साक्ष्य एकत्रीकरण की आवश्यकता, ने कई बाद के डेटासेट के निर्माण को प्रभावित किया है। यह मॉडलों की व्याख्यात्मकता का अध्ययन करने के लिए एक मूल्यवान संसाधन के रूप में भी कार्य करता है, क्योंकि बहु-चरणीय संरचना शोधकर्ताओं को मॉडल द्वारा लिए गए तर्क पथ का पता लगाने की अनुमति देती है।
व्यापक क्षेत्र के संदर्भ में, QAngaroo तर्क बेंचमार्क की एक श्रृंखला का हिस्सा है जिसने Artificial intelligence की सीमाओं को आगे बढ़ाया है। इसका उपयोग विभिन्न संस्थानों के मॉडलों का मूल्यांकन करने के लिए किया गया है, जिनमें Google DeepMind, OpenAI, और Stanford AI Lab और BAIR (Berkeley AI Research) जैसी शैक्षणिक प्रयोगशालाएँ शामिल हैं। जबकि नए बेंचमार्क उभरे हैं, बहु-चरणीय तर्क के महत्व को उजागर करने और मॉडल डिज़ाइन पर इसके प्रभाव में QAngaroo की भूमिका एआई अनुसंधान में इसकी निरंतर प्रासंगिकता सुनिश्चित करती है।
यह भी देखें
- HotpotQA
- multi-hop-reasoning
- question-answering
- Natural language processing