ComplexWebQuestions एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की बहु-चरणीय प्रश्न उत्तर देने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। सरल प्रश्न-उत्तर कार्यों के विपरीत, जिनमें एक एकल तथ्य प्राप्त करना आवश्यक होता है, बहु-चरणीय प्रश्नों की मांग होती है कि एक मॉडल सही उत्तर तक पहुंचने के लिए कई, अक्सर भिन्न, स्रोतों से जानकारी एकत्र और एकीकृत करे। यह डेटासेट 2018 में शोधकर्ताओं की एक टीम द्वारा मौजूदा बेंचमार्क की सीमाओं को संबोधित करने के लिए पेश किया गया था, जो मुख्य रूप से एकल-चरणीय तर्क पर केंद्रित थे या वास्तविक दुनिया के वेब टेक्स्ट की जटिलता के बिना संरचित ज्ञान आधारों पर निर्भर थे।
डेटासेट में 34,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक WebQuestionsSP डेटासेट से व्युत्पन्न है, लेकिन अतिरिक्त बाधाओं और रचनात्मक संरचना के साथ संवर्धित है। प्रश्नों को दो या अधिक तर्क चरणों की आवश्यकता के लिए डिज़ाइन किया गया है, जिसमें अक्सर ऐसी संस्थाएं और संबंध शामिल होते हैं जो ज्ञान ग्राफ के विभिन्न हिस्सों में फैले होते हैं या ज्ञान आधार से जानकारी को पाठ्य अंशों के साथ संयोजित करने की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "उस देश की राजधानी क्या है जहां एफिल टॉवर स्थित है?" जिसके लिए पहले देश (फ्रांस) की पहचान करना और फिर उसकी राजधानी (पेरिस) खोजना आवश्यक है।
निर्माण और एनोटेशन
ComplexWebQuestions का निर्माण एक अर्ध-स्वचालित प्रक्रिया शामिल थी। शोधकर्ताओं ने WebQuestionsSP डेटासेट से शुरुआत की, जिसमें Freebase ज्ञान ग्राफ पर प्रश्न और उनके संबंधित SPARQL क्वेरी शामिल हैं। फिर उन्होंने अतिरिक्त बाधाओं, जैसे अतिशयोक्ति, तुलना, और लौकिक या स्थानिक फ़िल्टर पेश करने के लिए टेम्पलेट्स और परिवर्तनों का एक सेट लागू किया। इस प्रक्रिया ने नए, अधिक जटिल प्रश्न उत्पन्न किए जो मूल डेटासेट में मौजूद नहीं थे। प्रत्येक उत्पन्न प्रश्न को तब एक SPARQL क्वेरी के साथ जोड़ा गया था जिसे सही उत्तर प्राप्त करने के लिए Freebase के विरुद्ध निष्पादित किया जा सकता था, जिससे ग्राउंड-ट्रुथ लेबल सुनिश्चित होते थे। डेटासेट में 'रचनात्मक' प्रश्नों का एक सेट भी शामिल है जिन्हें कई संबंधों को संयोजित करने की आवश्यकता होती है, और प्रश्नों का एक उपसमूह जो दिए गए संदर्भ में 'उत्तर देने योग्य नहीं' हैं, जो यथार्थवाद की एक परत जोड़ता है।
मूल्यांकन और मेट्रिक्स
ComplexWebQuestions का उपयोग आमतौर पर संरचित और असंरचित डेटा के संयोजन पर बहु-चरणीय तर्क करने की क्षमता के लिए मॉडल का मूल्यांकन करने के लिए किया जाता है। प्राथमिक मूल्यांकन मीट्रिक सटीक मिलान सटीकता है, जहां एक मॉडल का अनुमानित उत्तर स्वर्ण उत्तर स्ट्रिंग से बिल्कुल मेल खाना चाहिए। कुछ अध्ययन F1 स्कोर पर भी रिपोर्ट करते हैं, जो आंशिक मिलानों को ध्यान में रखता है। बेंचमार्क का उपयोग विभिन्न दृष्टिकोणों का परीक्षण करने के लिए किया गया है, जिसमें तंत्रिका नेटवर्क, बड़े भाषा मॉडल, और मशीन लर्निंग को प्रतीकात्मक तर्क के साथ संयोजित करने वाली हाइब्रिड प्रणालियाँ शामिल हैं। प्रारंभिक परिणामों से पता चला कि उस समय के सबसे आधुनिक मॉडल भी डेटासेट के साथ संघर्ष करते थे, 50% से नीचे सटीकता प्राप्त करते थे, जो बहु-चरणीय तर्क की कठिनाई को उजागर करता है।
महत्व और प्रभाव
ComplexWebQuestions प्राकृतिक भाषा प्रसंस्करण और कृत्रिम बुद्धिमत्ता के क्षेत्र में एक मानक बेंचमार्क बन गया है। इसने अधिक परिष्कृत तर्क तंत्रों, जैसे ग्राफ तंत्रिका नेटवर्क, ध्यान-आधारित मॉडल, और पुनर्प्राप्ति-संवर्धित जनरेशन में अनुसंधान को प्रेरित किया है। ज्ञान आधारों को पाठ के साथ संयोजित करने पर डेटासेट का जोर हाइब्रिड आर्किटेक्चर के विकास को प्रभावित किया है जो संरचित और असंरचित दोनों जानकारी का लाभ उठा सकते हैं। यह ट्रांसफॉर्मर-आधारित मॉडलों की तर्क क्षमताओं का मूल्यांकन करने के लिए एक परीक्षण मंच के रूप में भी कार्य करता है, जिसमें आधुनिक जनरेटिव एआई प्रणालियों में उपयोग किए जाने वाले मॉडल शामिल हैं। बेंचमार्क को सैकड़ों पेपरों में उद्धृत किया गया है और यह बहु-चरणीय प्रश्न उत्तर देने में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है।
सीमाएं और आलोचनाएं
व्यापक उपयोग के बावजूद, ComplexWebQuestions को कुछ आलोचनाओं का सामना करना पड़ा है। डेटासेट एक एकल ज्ञान आधार (Freebase) से व्युत्पन्न है, जो वेब सामग्री की विविधता का पूरी तरह से प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, प्रश्न निर्माण प्रक्रिया, हालांकि स्वचालित है, ऐसे प्रश्न उत्पन्न कर सकती है जो कुछ हद तक कृत्रिम हैं या भाषाई पैटर्न शामिल हैं जो प्राकृतिक उपयोगकर्ता क्वेरी के प्रतिनिधि नहीं हैं। कुछ शोधकर्ताओं ने नोट किया है कि SPARQL क्वेरी पर डेटासेट की निर्भरता का मतलब है कि मॉडल कभी-कभी शॉर्टकट का शोषण कर सकते हैं, जैसे वास्तव में तर्क करने के बजाय क्वेरी पैटर्न से मेल खाना सीखना। परिणामस्वरूप, नए बेंचमार्क पेश किए गए हैं जिनका उद्देश्य इन सीमाओं को संबोधित करना है, लेकिन ComplexWebQuestions बहु-चरणीय तर्क की चुनौतियों को समझने के लिए एक मूल्यवान संसाधन बना हुआ है।
संबंधित कार्य और भविष्य की दिशाएं
ComplexWebQuestions के विकास ने संबंधित बेंचमार्क के एक परिवार को प्रेरित किया है, जिसमें HotpotQA शामिल है, जो विकिपीडिया लेखों पर बहु-चरणीय तर्क पर केंद्रित है, और QAngaroo, जिसमें वैज्ञानिक ग्रंथों पर बहु-चरणीय तर्क के लिए डेटासेट शामिल हैं। ये बेंचमार्क सामूहिक रूप से उन सीमाओं को आगे बढ़ाते हैं जो एआई प्रणालियाँ जटिल तर्क के संदर्भ में प्राप्त कर सकती हैं। भविष्य की दिशाओं में अधिक विविध डेटा स्रोतों को शामिल करना, खुले-अंत वाले प्रश्नों को संभालना, और मॉडल तर्क प्रक्रियाओं की व्याख्या में सुधार करना शामिल है। जैसे-जैसे गहन शिक्षण और बड़े भाषा मॉडल विकसित होते रहते हैं, ComplexWebQuestions जैसे बेंचमार्क यह आकलन करने में महत्वपूर्ण भूमिका निभाएंगे कि क्या ये मॉडल वास्तव में दुनिया को समझते हैं और उसके बारे में तर्क करते हैं या केवल पैटर्न को याद करते हैं।
इन्फोबॉक्स
- प्रकार: बेंचमार्क डेटासेट
- पेश किया गया: 2018
- पेश किया गया द्वारा: एलोन तालमोर और जोनाथन बेरेंट (तेल अवीव विश्वविद्यालय)
- संबंधित: HotpotQA, webquestionssp
श्रेणियां
- प्रश्न-उत्तर
- बेंचमार्क
- बहु-चरणीय-तर्क
- प्राकृतिक-भाषा-प्रसंस्करण