HotpotQA एक बड़े पैमाने पर डेटासेट है जिसे मल्टी-हॉप प्रश्न उत्तर देने पर कृत्रिम बुद्धिमत्ता प्रणालियों को प्रशिक्षित करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2018 में कार्नेगी मेलन विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था। डेटासेट में 113,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक के लिए मॉडल को सही उत्तर तक पहुंचने के लिए विकिपीडिया के कई सहायक दस्तावेजों में तर्क करने की आवश्यकता होती है। सरल प्रश्न उत्तर बेंचमार्क के विपरीत जो एक ही अनुच्छेद पर निर्भर करते हैं, HotpotQA स्पष्ट रूप से एक प्रणाली की मल्टी-हॉप तर्क करने की क्षमता का परीक्षण करता है, जिसमें कई स्रोतों से जानकारी को तार्किक श्रृंखला में जोड़ना शामिल है।
HotpotQA का प्राथमिक लक्ष्य मशीन रीडिंग समझ और तर्क में अनुसंधान को आगे बढ़ाना है। यह पहले के डेटासेट की एक महत्वपूर्ण सीमा को संबोधित करता है, जिसमें अक्सर ऐसे प्रश्न होते थे जिनका उत्तर एक ही अनुच्छेद से दिया जा सकता था। दो या दो से अधिक दस्तावेजों से जानकारी के संश्लेषण की आवश्यकता के द्वारा, HotpotQA मॉडल को अधिक परिष्कृत समझ और अनुमान की ओर धकेलता है। डेटासेट व्यापक रूप से Machine learning और Artificial intelligence के क्षेत्रों में एक बेंचमार्क के रूप में उपयोग किया जाता है, विशेष रूप से बड़े भाषा मॉडल और अन्य तंत्रिका आर्किटेक्चर की तर्क क्षमताओं का मूल्यांकन करने के लिए।
डेटासेट निर्माण
HotpotQA डेटासेट एक दो-चरणीय क्राउडसोर्सिंग पाइपलाइन का उपयोग करके बनाया गया था। पहले, श्रमिकों को ऐसे प्रश्न लिखने के लिए कहा गया था जिनके लिए कई विकिपीडिया लेखों से जानकारी की आवश्यकता होती है, इस बाधा के साथ कि उत्तर किसी एक लेख में नहीं पाया जा सकता है। दूसरे, इन प्रश्नों को मान्य किया गया और सहायक तथ्यों की पहचान एनोटेटरों द्वारा की गई। प्रत्येक प्रश्न के साथ सहायक तथ्यों की एक सूची होती है, जो स्रोत दस्तावेजों से विशिष्ट वाक्य होते हैं जो प्रश्न का उत्तर देने के लिए आवश्यक साक्ष्य प्रदान करते हैं। यह डिज़ाइन उत्तर भविष्यवाणी और साक्ष्य निष्कर्षण दोनों की अनुमति देता है, जिससे मॉडल तर्क का अधिक पारदर्शी मूल्यांकन संभव हो पाता है।
डेटासेट में दो मुख्य प्रकार के प्रश्न शामिल हैं: ब्रिज और तुलना। ब्रिज प्रश्नों के लिए एक दस्तावेज़ से दूसरे दस्तावेज़ में एक इकाई को जोड़ने की आवश्यकता होती है, जैसे किसी फिल्म को उसके निर्देशक से जोड़कर किसी व्यक्ति के जन्मस्थान की पहचान करना। तुलना प्रश्नों के लिए दो संस्थाओं के गुणों की तुलना करने की आवश्यकता होती है, जैसे यह निर्धारित करना कि दो नदियों में से कौन सी लंबी है। यह विविधता सुनिश्चित करती है कि मॉडल को केवल सरल तथ्य पुनर्प्राप्ति नहीं, बल्कि विभिन्न तर्क पैटर्न को संभालना चाहिए।
मूल्यांकन मेट्रिक्स
HotpotQA का मूल्यांकन आमतौर पर कई मेट्रिक्स का उपयोग करके किया जाता है। उत्तर भविष्यवाणी के लिए, प्राथमिक मीट्रिक सटीक मिलान (EM) है, जो उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड ट्रुथ उत्तर से बिल्कुल मेल खाती हैं। इसके अतिरिक्त, F1 स्कोर का उपयोग आंशिक मिलानों को ध्यान में रखने के लिए किया जाता है, जो भविष्यवाणी और सही उत्तर के बीच टोकनों के ओवरलैप पर विचार करता है। सहायक तथ्य भविष्यवाणी कार्य के लिए, संयुक्त F1 और EM स्कोर की गणना की जाती है, जिसके लिए मॉडल को सही साक्ष्य वाक्यों की पहचान करने की आवश्यकता होती है। ये मेट्रिक्स अंतिम उत्तर सटीकता और तर्क प्रक्रिया दोनों का व्यापक मूल्यांकन प्रदान करते हैं।
मूल 2018 रिलीज़ में, डेटासेट को प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित किया गया था, जिसमें परीक्षण सेट का उपयोग सार्वजनिक लीडरबोर्ड के लिए किया गया था। लीडरबोर्ड ने शोधकर्ताओं को अपने मॉडल की तुलना अत्याधुनिक दृष्टिकोणों से करने की अनुमति दी, जिससे क्षेत्र में तेजी से प्रगति को बढ़ावा मिला। समय के साथ, HotpotQA Natural language processing समुदाय में एक मानक बेंचमार्क बन गया है, हालांकि यह प्रदान किए गए लिंक स्लग में स्पष्ट रूप से सूचीबद्ध नहीं है।
एआई अनुसंधान पर प्रभाव
HotpotQA का तर्क मॉडल के विकास पर महत्वपूर्ण प्रभाव पड़ा है। इसने ध्यान तंत्र, मेमोरी नेटवर्क और ग्राफ-आधारित तर्क को शामिल करने वाले आर्किटेक्चर में नवाचारों को प्रेरित किया है। उदाहरण के लिए, शुरुआती मॉडलों ने प्रश्न और कई दस्तावेजों को संयुक्त रूप से एन्कोड करने के लिए Transformer (architecture)-आधारित एन्कोडर का उपयोग किया, जबकि बाद के दृष्टिकोणों ने दस्तावेजों में संस्थाओं के बीच संबंधों को मॉडल करने के लिए ग्राफ तंत्रिका नेटवर्क का उपयोग किया। डेटासेट ने व्याख्यात्मकता के महत्व को भी उजागर किया, क्योंकि सहायक तथ्य एनोटेशन शोधकर्ताओं को यह विश्लेषण करने में सक्षम बनाते हैं कि मॉडल ने कोई विशेष भविष्यवाणी क्यों की।
डेटासेट का उपयोग OpenAI, Anthropic, और Google DeepMind द्वारा विकसित आधुनिक बड़े भाषा मॉडल की तर्क क्षमताओं का मूल्यांकन करने के लिए किया गया है। ये मॉडल, जिन्हें अक्सर कुछ-शॉट उदाहरणों के साथ ठीक-ट्यून या प्रेरित किया जाता है, ने HotpotQA पर उच्च स्कोर प्राप्त किए हैं, जो बहु-चरणीय अनुमान की उनकी क्षमता को प्रदर्शित करते हैं। हालांकि, डेटासेट चुनौतीपूर्ण बना हुआ है, क्योंकि मॉडल अभी भी जटिल अस्थायी या कारण तर्क की आवश्यकता वाले प्रश्नों से जूझते हैं। हाल के वर्षों में, अत्याधुनिक प्रणालियाँ विकास सेट पर 90% से अधिक सटीक मिलान प्राप्त करती हैं, लेकिन परीक्षण सेट लीडरबोर्ड में सुधार की गुंजाइश बनी हुई है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, HotpotQA को आलोचना का सामना करना पड़ा है। एक सीमा यह है कि प्रश्न क्राउडवर्कर्स द्वारा उत्पन्न किए जाते हैं, जो पूर्वाग्रह या अप्राकृतिक वाक्यांशों को पेश कर सकते हैं। इसके अतिरिक्त, डेटासेट एकमात्र ज्ञान स्रोत के रूप में विकिपीडिया पर केंद्रित है, जो विषयों की विविधता को सीमित करता है और वास्तविक दुनिया के प्रश्न उत्तर परिदृश्यों को प्रतिबिंबित नहीं कर सकता है जहां जानकारी विभिन्न डोमेन में बिखरी हुई है। कुछ शोधकर्ताओं ने नोट किया है कि मॉडल शॉर्टकट का फायदा उठा सकते हैं, जैसे कि इकाई सह-घटना पैटर्न पर भरोसा करना, वास्तविक तर्क करने के बजाय। इससे अधिक चुनौतीपूर्ण बेंचमार्क के विकास को बढ़ावा मिला है जो ऐसे मुद्दों को कम करने का लक्ष्य रखते हैं।
एक और चिंता डेटासेट की स्थिर प्रकृति है। चूंकि विकिपीडिया लगातार अपडेट होता रहता है, HotpotQA में उपयोग किए गए दस्तावेज़ समय के साथ पुराने हो सकते हैं, जो समय के साथ मूल्यांकन की वैधता को प्रभावित कर सकते हैं। हालांकि, डेटासेट नियंत्रित प्रयोगों के लिए एक मूल्यवान संसाधन बना हुआ है, क्योंकि यह दस्तावेजों और एनोटेशन का एक निश्चित सेट प्रदान करता है।
संबंधित बेंचमार्क
HotpotQA मल्टी-हॉप प्रश्न उत्तर डेटासेट के व्यापक परिवार का हिस्सा है। इसकी तुलना अक्सर QAngaroo, ComplexWebQuestions, और MuSiQue जैसे अन्य बेंचमार्क से की जाती है। ये डेटासेट पैमाने, प्रश्न जटिलता और आवश्यक हॉप्स की संख्या में भिन्न होते हैं। HotpotQA का सहायक तथ्य एनोटेशन पर जोर इसे कई अन्य से अलग करता है, जिससे यह साक्ष्य-आधारित तर्क का अध्ययन करने के लिए विशेष रूप से उपयोगी हो जाता है। Deep learning और तंत्रिका नेटवर्क के संदर्भ में, HotpotQA नवीन आर्किटेक्चर और प्रशिक्षण प्रतिमानों को विकसित करने के लिए एक कठोर परीक्षण मैदान के रूप में कार्य करता है।