2WikiHop एक प्रश्न-उत्तर डेटासेट है जिसे विशेष रूप से कृत्रिम बुद्धिमत्ता प्रणालियों में बहु-चरणीय तर्क क्षमताओं का मूल्यांकन करने के लिए निर्मित किया गया है। इसे पहले के डेटासेट की सीमाओं को संबोधित करने के लिए पेश किया गया था, जो मुख्य रूप से एकल-चरणीय तथ्य पुनर्प्राप्ति का परीक्षण करते थे। इस डेटासेट के लिए मॉडलों को सही उत्तर तक पहुंचने के लिए कई अलग-अलग विकिपीडिया लेखों से जानकारी एकत्र करने और संश्लेषित करने की आवश्यकता होती है, जिससे यह अधिक उन्नत मशीन लर्निंग और डीप लर्निंग मॉडल के लिए एक बेंचमार्क बन जाता है।
डेटासेट में ऐसे प्रश्न शामिल हैं जिनके लिए दो या अधिक तर्क चरणों की आवश्यकता होती है, प्रत्येक चरण में जानकारी का एक अलग टुकड़ा शामिल होता है। उदाहरण के लिए, एक प्रश्न किसी ऐसे व्यक्ति के बारे में पूछ सकता है जो किसी कंपनी का संस्थापक है जिसे किसी अन्य कंपनी द्वारा अधिग्रहित किया गया था, जिसके लिए मॉडल को पहले संस्थापक की पहचान करनी होती है और फिर अधिग्रहण का पता लगाना होता है। यह संरचना सरल पैटर्न मिलान से आगे बढ़ती है और ऐसे मॉडलों के विकास को प्रोत्साहित करती है जो ज्ञान आधार पर स्पष्ट तर्क कर सकते हैं।
निर्माण और संरचना
2WikiHop को विकिपीडिया लेखों से स्वचालित रूप से प्रश्न उत्पन्न करके बनाया गया था, जिसमें एक पाइपलाइन का उपयोग किया गया है जो इकाई-संबंध जोड़े निकालती है और उन्हें बहु-चरणीय क्वेरी में जोड़ती है। डेटासेट में ऐसे प्रश्न शामिल हैं जिनका एक ही सही उत्तर होता है और साथ ही ऐसे प्रश्न भी शामिल हैं जिनके लिए विकल्पों के एक सेट से चयन करना आवश्यक होता है। प्रत्येक प्रश्न के साथ सहायक दस्तावेजों का एक सेट होता है, जो वे विकिपीडिया लेख हैं जिनमें आवश्यक जानकारी होती है। निर्माण प्रक्रिया यह सुनिश्चित करती है कि तर्क पथ गैर-तुच्छ है, जिसमें अक्सर ऐसी इकाइयाँ शामिल होती हैं जो पाठ में सीधे लिंक नहीं होती हैं, इस प्रकार वास्तविक अनुमान की आवश्यकता होती है।
डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें यह सुनिश्चित करने पर ध्यान केंद्रित किया गया है कि परीक्षण सेट में प्रशिक्षण के दौरान न देखे गए तर्क पैटर्न वाले प्रश्न शामिल हों, ताकि सामान्यीकरण को मापा जा सके। प्रश्नों को इस तरह से डिज़ाइन किया गया है कि मनुष्य उन्हें अपेक्षाकृत आसानी से उत्तर दे सकें, लेकिन वे कई मौजूदा तंत्रिका नेटवर्क मॉडलों के लिए महत्वपूर्ण चुनौतियाँ पेश करते हैं, विशेष रूप से Transformer (architecture) आर्किटेक्चर पर आधारित मॉडलों के लिए।
एआई अनुसंधान के लिए प्रासंगिकता
2WikiHop प्राकृतिक भाषा प्रसंस्करण और मशीन लर्निंग के क्षेत्र में एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर बड़े भाषा मॉडल और अन्य जनरेटिव एआई प्रणालियों की तर्क क्षमताओं का मूल्यांकन करने के लिए किया जाता है। डेटासेट उन मॉडलों के बीच अंतर को उजागर करता है जो जानकारी पुनर्प्राप्त कर सकते हैं और जो इसे प्रभावी ढंग से संयोजित कर सकते हैं। 2WikiHop का उपयोग करने वाले अनुसंधान ने विशेष आर्किटेक्चर के विकास को जन्म दिया है, जैसे कि ग्राफ तंत्रिका नेटवर्क जो संस्थाओं के बीच संबंधों को स्पष्ट रूप से मॉडल करते हैं, और पुनर्प्राप्ति-संवर्धित दृष्टिकोण जो गतिशील रूप से प्रासंगिक मार्ग लाते हैं।
डेटासेट विशेष रूप से बहु-चरणीय ध्यान तंत्र और कई चरणों में एक सुसंगत तर्क श्रृंखला बनाए रखने की मॉडलों की क्षमता का अध्ययन करने के लिए उपयोगी है। इसका उपयोग Transformer (architecture)-आधारित मॉडलों की सीमाओं का पता लगाने के लिए भी किया गया है, जो अक्सर लंबी दूरी की निर्भरता और जटिल अनुमान कार्यों से जूझते हैं।
चुनौतियाँ और सीमाएँ
2WikiHop द्वारा उत्पन्न मुख्य चुनौतियों में से एक यह है कि सहायक दस्तावेज़ लंबे हो सकते हैं, और प्रासंगिक जानकारी विभिन्न अनुभागों में बिखरी हो सकती है। मॉडलों को अप्रासंगिक सामग्री को अनदेखा करना और प्रश्न से संबंधित विशिष्ट संस्थाओं और संबंधों पर ध्यान केंद्रित करना सीखना चाहिए। इसके अतिरिक्त, डेटासेट में ऐसे प्रश्न शामिल हैं जिनके लिए सामान्य ज्ञान तर्क या अस्थायी अनुमान की आवश्यकता होती है, जो हमेशा पाठ में स्पष्ट रूप से नहीं बताए जाते हैं।
एक और सीमा यह है कि स्वचालित निर्माण प्रक्रिया पूर्वाग्रहों को पेश कर सकती है, जैसे कि कुछ उत्तर प्रकारों के अधिक बार दिखाई देने की प्रवृत्ति। शोधकर्ताओं ने नोट किया है कि कुछ मॉडल वास्तविक तर्क किए बिना इन पूर्वाग्रहों का फायदा उठा सकते हैं, सतह-स्तरीय पैटर्न पर भरोसा करके उच्च स्कोर प्राप्त कर सकते हैं। इसने अधिक मजबूत मूल्यांकन मेट्रिक्स और प्रतिकूल परीक्षण सेटों के विकास को प्रेरित किया है।
अनुप्रयोग और प्रभाव
2WikiHop के साथ काम करने से प्राप्त अंतर्दृष्टि ने वास्तविक दुनिया के अनुप्रयोगों में प्रश्न-उत्तर प्रणालियों के डिजाइन को प्रभावित किया है, जैसे कि अमेज़न वेब सर्विसेज के AWS ट्रेनियम-आधारित मॉडल और गूगल क्लाउड की एआई सेवाएँ। डेटासेट का उपयोग ओपनएआई के GPT-4 और एंथ्रोपिक के क्लॉड मॉडल के प्रदर्शन को बेंचमार्क करने के लिए भी किया गया है, जो उनकी तर्क क्षमताओं का तुलनात्मक माप प्रदान करता है। इसके अलावा, इसने व्याख्यात्मक एआई में अनुसंधान को बढ़ावा दिया है, क्योंकि विश्वसनीय प्रणालियों के निर्माण के लिए तर्क पथ को समझना महत्वपूर्ण है।
डेटासेट का प्रभाव एमआईटी सीएसएआईएल और स्टैनफोर्ड एआई लैब जैसे शैक्षणिक संस्थानों तक फैला हुआ है, जहाँ इसका उपयोग पाठ्यक्रमों और अनुसंधान परियोजनाओं में उन्नत डीप लर्निंग तकनीकों पर छात्रों को प्रशिक्षित करने के लिए किया जाता है। इसे गूगल डीपमाइंड और सैमसंग रिसर्च जैसी उद्योग प्रयोगशालाओं द्वारा भी नए मॉडल आर्किटेक्चर का परीक्षण करने के लिए अपनाया गया है।
भविष्य की दिशाएँ
जैसे-जैसे एआई मॉडल अधिक शक्तिशाली होते जा रहे हैं, 2WikiHop बेंचमार्क विकसित होता रहता है। शोधकर्ता तर्क चरणों की संख्या बढ़ाकर, अधिक विविध प्रश्न प्रकार पेश करके और बहु-मोडल जानकारी को शामिल करके डेटासेट को अधिक चुनौतीपूर्ण बनाने के तरीकों की खोज कर रहे हैं। 2WikiHop को उन मॉडलों को विकसित करने के लिए एक आधार के रूप में उपयोग करने में भी रुचि है जो प्राकृतिक भाषा में अपने तर्क की व्याख्या कर सकते हैं, जो पारदर्शिता और विश्वास को बढ़ाएगा।
लंबी अवधि में, लक्ष्य 2WikiHop जैसे डेटासेट से आगे बढ़कर अधिक खुले-अंत वाले तर्क कार्यों की ओर जाना है जिनके लिए बाहरी ज्ञान स्रोतों के साथ गतिशील बातचीत की आवश्यकता होती है। हालाँकि, अभी के लिए, 2WikiHop कृत्रिम बुद्धिमत्ता की मुख्य चुनौतियों में से एक में प्रगति को मापने के लिए एक महत्वपूर्ण उपकरण बना हुआ है: जटिल प्रश्नों का उत्तर देने के लिए जानकारी के कई टुकड़ों पर तर्क करने की क्षमता।