BoolQ (बूलियन प्रश्न) प्राकृतिक भाषा समझ के लिए एक डेटासेट है जो किसी मशीन की दिए गए पाठ के आधार पर हाँ/नहीं प्रश्नों का उत्तर देने की क्षमता का मूल्यांकन करता है। इसे 2019 में क्रिस्टोफर क्लार्क, केंटन ली, मिंग-वेई चांग, टॉम क्वियाटकोव्स्की, माइकल कॉलिन्स और क्रिस्टीना टुटानोवा द्वारा कार्नेगी मेलन विश्वविद्यालय और Google AI भाषा से पेश किया गया था। डेटासेट में 15,942 प्रश्न हैं, जिनमें से प्रत्येक विकिपीडिया के एक छोटे अनुच्छेद और एक द्विआधारी उत्तर (हाँ या नहीं) के साथ जोड़ा गया है। प्रश्न स्वाभाविक रूप से उत्पन्न होते हैं, जो मानव एनोटेटरों द्वारा बनाए जाते हैं जिन्हें अनुच्छेद की सामग्री के आधार पर प्रश्न तैयार करने के लिए कहा गया था, जिससे वे सिंथेटिक या टेम्पलेट-आधारित प्रश्नों की तुलना में अधिक यथार्थवादी और चुनौतीपूर्ण बन जाते हैं।
BoolQ SuperGLUE बेंचमार्क का हिस्सा है, जो सामान्य-उद्देश्य भाषा समझ मॉडल का मूल्यांकन करने के लिए डिज़ाइन किए गए कार्यों का एक समूह है। SuperGLUE में, BoolQ पठन समझ और तार्किक तर्क का परीक्षण करता है, जिसके लिए मॉडल को अनुच्छेद में प्रासंगिक जानकारी की पहचान करने और एक सरल लेकिन अक्सर सूक्ष्म निर्णय लेने की आवश्यकता होती है। डेटासेट की कठिनाई इस तथ्य से उत्पन्न होती है कि उत्तर हमेशा स्पष्ट रूप से नहीं दिया जाता है; मॉडल को संदर्भ से उत्तर का अनुमान लगाना चाहिए, निषेध को संभालना चाहिए, और उन प्रश्नों से निपटना चाहिए जिनके कई संभावित व्याख्याएँ हो सकती हैं।
निर्माण और एनोटेशन
BoolQ डेटासेट का निर्माण पहले विकिपीडिया लेखों से विविध विषयों, जिनमें इतिहास, विज्ञान और संस्कृति शामिल हैं, पर अनुच्छेदों का चयन करके किया गया था। फिर एनोटेटरों को एक अनुच्छेद दिखाया गया और उनसे एक हाँ/नहीं प्रश्न लिखने को कहा गया जिसका उत्तर पाठ में दी गई जानकारी का उपयोग करके दिया जा सके। उन्हें ऐसे प्रश्नों से बचने का निर्देश दिया गया जो बहुत आसान हों या बाहरी ज्ञान पर बहुत अधिक निर्भर हों, यह सुनिश्चित करते हुए कि प्रश्नों के लिए अनुच्छेद की वास्तविक समझ आवश्यक हो। फिर प्रत्येक प्रश्न का उत्तर एनोटेटरों के एक अलग समूह द्वारा दिया गया, जिसमें बहुमत वोट अंतिम लेबल निर्धारित करता था। डेटासेट को 9,427 प्रशिक्षण उदाहरणों, 3,270 विकास उदाहरणों और 3,245 परीक्षण उदाहरणों में विभाजित किया गया था, जिसमें परीक्षण सेट आधिकारिक मूल्यांकन के लिए अलग रखा गया था।
कार्य और मूल्यांकन
BoolQ कार्य में, एक मॉडल को एक अनुच्छेद और एक प्रश्न दिया जाता है, और उसे "हाँ" या "नहीं" आउटपुट करना होता है। प्राथमिक मूल्यांकन मीट्रिक सटीकता है, जो सही उत्तर दिए गए प्रश्नों का प्रतिशत है। यादृच्छिक अनुमान 50% सटीकता प्राप्त करेगा, लेकिन डेटासेट पर मानव प्रदर्शन लगभग 90% अनुमानित है, जो परिष्कृत तर्क की आवश्यकता को दर्शाता है। प्रारंभिक मॉडल, जैसे कि Transformer (architecture) आर्किटेक्चर पर आधारित, इस कार्य से जूझते थे, पहले प्रकाशित परिणाम लगभग 60-70% सटीकता प्राप्त करते थे। Large language model और Neural network दृष्टिकोणों की शुरुआत, विशेष रूप से BoolQ पर फाइन-ट्यून किए गए, ने प्रदर्शन में काफी सुधार किया, 2021 तक अत्याधुनिक मॉडल 90% से अधिक सटीकता प्राप्त कर रहे थे।
चुनौतियाँ और महत्व
BoolQ Machine learning प्रणालियों के लिए कई चुनौतियाँ प्रस्तुत करता है। प्रश्नों में अक्सर पूर्वधारणाएँ होती हैं या मॉडल को कोरफेरेंस रिज़ॉल्यूशन, अस्थायी तर्क और विश्व ज्ञान जैसी जटिल भाषाई घटनाओं को संभालने की आवश्यकता होती है। उदाहरण के लिए, "क्या वाटरलू की लड़ाई 19वीं शताब्दी में लड़ी गई थी?" जैसे प्रश्न के लिए मॉडल को अनुच्छेद में तारीख का पता लगाना और उसे सही शताब्दी में मैप करना आवश्यक है। इसके अतिरिक्त, अनुच्छेद हमेशा प्रश्न से सीधे प्रासंगिक नहीं होते हैं, जिसके लिए मॉडल को अप्रासंगिक जानकारी को फ़िल्टर करने की आवश्यकता होती है। BoolQ पठन समझ पर शोध को आगे बढ़ाने में प्रभावशाली रहा है और इसका उपयोग Artificial intelligence प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क के रूप में किया गया है, जिसमें OpenAI, Anthropic और Google DeepMind द्वारा विकसित प्रणालियाँ शामिल हैं।
अन्य बेंचमार्क से संबंध
BoolQ SuperGLUE बेंचमार्क में कई डेटासेट में से एक है, जिसमें MultiRC (बहु-वाक्य पठन समझ), ReCoRD (सामान्य ज्ञान तर्क के साथ पठन समझ) और COPA (कारण तर्क) जैसे कार्य भी शामिल हैं। कुछ अन्य बेंचमार्क के विपरीत जो निष्कर्षणात्मक प्रश्नोत्तर पर केंद्रित हैं, जहाँ उत्तर पाठ का एक अंश होता है, BoolQ को द्विआधारी निर्णय की आवश्यकता होती है, जिससे यह समझ का अधिक प्रत्यक्ष परीक्षण बन जाता है। यह पहले के SQuAD (स्टैनफोर्ड प्रश्नोत्तर डेटासेट) से भी संबंधित है, लेकिन इसमें भिन्न है कि SQuAD प्रश्न आमतौर पर एक अंश के साथ उत्तर देने योग्य होते हैं, जबकि BoolQ प्रश्न अधिक खुले-अंत वाले होने और अनुमान की आवश्यकता के लिए डिज़ाइन किए गए हैं।
मॉडल विकास पर प्रभाव
BoolQ का उपयोग Deep learning मॉडल के विकास और मूल्यांकन में व्यापक रूप से किया गया है। यह BERT और RoBERTa जैसे Transformer (architecture)-आधारित मॉडल के विकास में एक प्रमुख बेंचमार्क था, जिन्होंने पिछले दृष्टिकोणों पर महत्वपूर्ण लाभ दिखाया। डेटासेट का उपयोग मॉडल की सीमाओं का अध्ययन करने के लिए भी किया गया है, जैसे कि सतह-स्तर के संकेतों पर निर्भर रहने या प्रतिकूल उदाहरणों से भ्रमित होने की उनकी प्रवृत्ति। 2024 तक, BoolQ प्राकृतिक भाषा प्रसंस्करण अनुसंधान में एक मानक मूल्यांकन उपकरण बना हुआ है, और इसे अक्सर नए Large language model के प्रशिक्षण और परीक्षण में शामिल किया जाता है, जो Generative AI के व्यापक क्षेत्र में योगदान देता है।