अंग्रेज़ी से अनुवादित

ComplexWebQuestions वेब डेटा पर मल्टी-हॉप प्रश्न उत्तर देने के लिए एक बेंचमार्क डेटासेट है, जिसमें मॉडलों को जटिल प्रश्नों का उत्तर देने के लिए कई स्रोतों से जानकारी संयोजित करने की आवश्यकता होती है। इसे 2018 में AI प्रणालियों में तर्क क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था।

ComplexWebQuestions एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की बहु-चरणीय प्रश्न उत्तर देने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। सरल प्रश्न-उत्तर कार्यों के विपरीत, जिनमें एक एकल तथ्य प्राप्त करना आवश्यक होता है, बहु-चरणीय प्रश्नों की मांग होती है कि एक मॉडल सही उत्तर तक पहुंचने के लिए कई, अक्सर भिन्न, स्रोतों से जानकारी एकत्र और एकीकृत करे। यह डेटासेट 2018 में शोधकर्ताओं की एक टीम द्वारा मौजूदा बेंचमार्क की सीमाओं को संबोधित करने के लिए पेश किया गया था, जो मुख्य रूप से एकल-चरणीय तर्क पर केंद्रित थे या वास्तविक दुनिया के वेब टेक्स्ट की जटिलता के बिना संरचित ज्ञान आधारों पर निर्भर थे।

डेटासेट में 34,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक WebQuestionsSP डेटासेट से व्युत्पन्न है, लेकिन अतिरिक्त बाधाओं और रचनात्मक संरचना के साथ संवर्धित है। प्रश्नों को दो या अधिक तर्क चरणों की आवश्यकता के लिए डिज़ाइन किया गया है, जिसमें अक्सर ऐसी संस्थाएं और संबंध शामिल होते हैं जो ज्ञान ग्राफ के विभिन्न हिस्सों में फैले होते हैं या ज्ञान आधार से जानकारी को पाठ्य अंशों के साथ संयोजित करने की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "उस देश की राजधानी क्या है जहां एफिल टॉवर स्थित है?" जिसके लिए पहले देश (फ्रांस) की पहचान करना और फिर उसकी राजधानी (पेरिस) खोजना आवश्यक है।

निर्माण और एनोटेशन

ComplexWebQuestions का निर्माण एक अर्ध-स्वचालित प्रक्रिया शामिल थी। शोधकर्ताओं ने WebQuestionsSP डेटासेट से शुरुआत की, जिसमें Freebase ज्ञान ग्राफ पर प्रश्न और उनके संबंधित SPARQL क्वेरी शामिल हैं। फिर उन्होंने अतिरिक्त बाधाओं, जैसे अतिशयोक्ति, तुलना, और लौकिक या स्थानिक फ़िल्टर पेश करने के लिए टेम्पलेट्स और परिवर्तनों का एक सेट लागू किया। इस प्रक्रिया ने नए, अधिक जटिल प्रश्न उत्पन्न किए जो मूल डेटासेट में मौजूद नहीं थे। प्रत्येक उत्पन्न प्रश्न को तब एक SPARQL क्वेरी के साथ जोड़ा गया था जिसे सही उत्तर प्राप्त करने के लिए Freebase के विरुद्ध निष्पादित किया जा सकता था, जिससे ग्राउंड-ट्रुथ लेबल सुनिश्चित होते थे। डेटासेट में 'रचनात्मक' प्रश्नों का एक सेट भी शामिल है जिन्हें कई संबंधों को संयोजित करने की आवश्यकता होती है, और प्रश्नों का एक उपसमूह जो दिए गए संदर्भ में 'उत्तर देने योग्य नहीं' हैं, जो यथार्थवाद की एक परत जोड़ता है।

मूल्यांकन और मेट्रिक्स

ComplexWebQuestions का उपयोग आमतौर पर संरचित और असंरचित डेटा के संयोजन पर बहु-चरणीय तर्क करने की क्षमता के लिए मॉडल का मूल्यांकन करने के लिए किया जाता है। प्राथमिक मूल्यांकन मीट्रिक सटीक मिलान सटीकता है, जहां एक मॉडल का अनुमानित उत्तर स्वर्ण उत्तर स्ट्रिंग से बिल्कुल मेल खाना चाहिए। कुछ अध्ययन F1 स्कोर पर भी रिपोर्ट करते हैं, जो आंशिक मिलानों को ध्यान में रखता है। बेंचमार्क का उपयोग विभिन्न दृष्टिकोणों का परीक्षण करने के लिए किया गया है, जिसमें तंत्रिका नेटवर्क, बड़े भाषा मॉडल, और मशीन लर्निंग को प्रतीकात्मक तर्क के साथ संयोजित करने वाली हाइब्रिड प्रणालियाँ शामिल हैं। प्रारंभिक परिणामों से पता चला कि उस समय के सबसे आधुनिक मॉडल भी डेटासेट के साथ संघर्ष करते थे, 50% से नीचे सटीकता प्राप्त करते थे, जो बहु-चरणीय तर्क की कठिनाई को उजागर करता है।

महत्व और प्रभाव

ComplexWebQuestions प्राकृतिक भाषा प्रसंस्करण और कृत्रिम बुद्धिमत्ता के क्षेत्र में एक मानक बेंचमार्क बन गया है। इसने अधिक परिष्कृत तर्क तंत्रों, जैसे ग्राफ तंत्रिका नेटवर्क, ध्यान-आधारित मॉडल, और पुनर्प्राप्ति-संवर्धित जनरेशन में अनुसंधान को प्रेरित किया है। ज्ञान आधारों को पाठ के साथ संयोजित करने पर डेटासेट का जोर हाइब्रिड आर्किटेक्चर के विकास को प्रभावित किया है जो संरचित और असंरचित दोनों जानकारी का लाभ उठा सकते हैं। यह ट्रांसफॉर्मर-आधारित मॉडलों की तर्क क्षमताओं का मूल्यांकन करने के लिए एक परीक्षण मंच के रूप में भी कार्य करता है, जिसमें आधुनिक जनरेटिव एआई प्रणालियों में उपयोग किए जाने वाले मॉडल शामिल हैं। बेंचमार्क को सैकड़ों पेपरों में उद्धृत किया गया है और यह बहु-चरणीय प्रश्न उत्तर देने में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है।

सीमाएं और आलोचनाएं

व्यापक उपयोग के बावजूद, ComplexWebQuestions को कुछ आलोचनाओं का सामना करना पड़ा है। डेटासेट एक एकल ज्ञान आधार (Freebase) से व्युत्पन्न है, जो वेब सामग्री की विविधता का पूरी तरह से प्रतिनिधित्व नहीं कर सकता है। इसके अतिरिक्त, प्रश्न निर्माण प्रक्रिया, हालांकि स्वचालित है, ऐसे प्रश्न उत्पन्न कर सकती है जो कुछ हद तक कृत्रिम हैं या भाषाई पैटर्न शामिल हैं जो प्राकृतिक उपयोगकर्ता क्वेरी के प्रतिनिधि नहीं हैं। कुछ शोधकर्ताओं ने नोट किया है कि SPARQL क्वेरी पर डेटासेट की निर्भरता का मतलब है कि मॉडल कभी-कभी शॉर्टकट का शोषण कर सकते हैं, जैसे वास्तव में तर्क करने के बजाय क्वेरी पैटर्न से मेल खाना सीखना। परिणामस्वरूप, नए बेंचमार्क पेश किए गए हैं जिनका उद्देश्य इन सीमाओं को संबोधित करना है, लेकिन ComplexWebQuestions बहु-चरणीय तर्क की चुनौतियों को समझने के लिए एक मूल्यवान संसाधन बना हुआ है।

संबंधित कार्य और भविष्य की दिशाएं

ComplexWebQuestions के विकास ने संबंधित बेंचमार्क के एक परिवार को प्रेरित किया है, जिसमें HotpotQA शामिल है, जो विकिपीडिया लेखों पर बहु-चरणीय तर्क पर केंद्रित है, और QAngaroo, जिसमें वैज्ञानिक ग्रंथों पर बहु-चरणीय तर्क के लिए डेटासेट शामिल हैं। ये बेंचमार्क सामूहिक रूप से उन सीमाओं को आगे बढ़ाते हैं जो एआई प्रणालियाँ जटिल तर्क के संदर्भ में प्राप्त कर सकती हैं। भविष्य की दिशाओं में अधिक विविध डेटा स्रोतों को शामिल करना, खुले-अंत वाले प्रश्नों को संभालना, और मॉडल तर्क प्रक्रियाओं की व्याख्या में सुधार करना शामिल है। जैसे-जैसे गहन शिक्षण और बड़े भाषा मॉडल विकसित होते रहते हैं, ComplexWebQuestions जैसे बेंचमार्क यह आकलन करने में महत्वपूर्ण भूमिका निभाएंगे कि क्या ये मॉडल वास्तव में दुनिया को समझते हैं और उसके बारे में तर्क करते हैं या केवल पैटर्न को याद करते हैं।

इन्फोबॉक्स

  • प्रकार: बेंचमार्क डेटासेट
  • पेश किया गया: 2018
  • पेश किया गया द्वारा: एलोन तालमोर और जोनाथन बेरेंट (तेल अवीव विश्वविद्यालय)
  • संबंधित: HotpotQA, webquestionssp

श्रेणियां

  • प्रश्न-उत्तर
  • बेंचमार्क
  • बहु-चरणीय-तर्क
  • प्राकृतिक-भाषा-प्रसंस्करण
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:question-answering·benchmark·multi-hop-reasoning·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास