OpenBookQA एक प्रश्न-उत्तर बेंचमार्क है जिसे 2018 में पेश किया गया था, जो स्पष्ट वैज्ञानिक तथ्यों और अंतर्निहित सामान्य ज्ञान दोनों का उपयोग करके बहु-चरणीय तर्क करने की मशीन की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया था। यह बेंचमार्क एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस (AI2) में टोडोर मिहायलोव, पीटर क्लार्क, तुसार खोट और आशीष सभरवाल सहित शोधकर्ताओं की एक टीम द्वारा बनाया गया था। इसमें प्राथमिक विद्यालय स्तर के विज्ञान के 5,957 बहुविकल्पीय प्रश्न शामिल हैं, जिनमें से प्रत्येक 1,326 प्रारंभिक विज्ञान तथ्यों की "खुली किताब" से मुख्य विज्ञान तथ्यों के एक छोटे से समूह के साथ जोड़ा गया है। कार्य के लिए मॉडलों को चार विकल्पों में से सही उत्तर चुनना होता है, लेकिन महत्वपूर्ण रूप से, प्रदान किए गए तथ्य अकेले अपर्याप्त हैं; मॉडलों को सही उत्तर तक पहुंचने के लिए उन्हें व्यापक दुनिया के ज्ञान और तार्किक तर्क के साथ जोड़ना होगा।
यह बेंचमार्क पहले के प्रश्न-उत्तर डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो अक्सर मॉडलों को उथले पैटर्न मिलान या रटने के माध्यम से सफल होने की अनुमति देते थे। OpenBookQA में, प्रश्नों को इस तरह से तैयार किया गया है कि सही उत्तर सीधे प्रदान किए गए तथ्यों में नहीं बताया गया है, जिससे सिस्टम को यह तर्क करने के लिए मजबूर होना पड़ता है कि तथ्य प्रश्न पर कैसे लागू होते हैं। यह बेंचमार्क को तर्क क्षमता का अधिक कठोर परीक्षण बनाता है, और यह Artificial intelligence और Machine learning के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया है।
डिज़ाइन और संरचना
OpenBookQA में 5,957 प्रश्न हैं, जो प्रशिक्षण (4,957), विकास (500) और परीक्षण (500) सेटों में विभाजित हैं। प्रत्येक प्रश्न चार उत्तर विकल्पों वाला एक बहुविकल्पीय आइटम है। बेंचमार्क में 1,326 विज्ञान तथ्यों की एक "खुली किताब" शामिल है, जो छोटे, घोषणात्मक कथन हैं जैसे "पौधों को भोजन बनाने के लिए सूर्य के प्रकाश की आवश्यकता होती है" या "पानी 100 डिग्री सेल्सियस पर उबलता है।" ये तथ्य प्रारंभिक विज्ञान पाठ्यपुस्तकों से लिए गए हैं और जीव विज्ञान, भौतिकी और रसायन विज्ञान जैसे विषयों को कवर करते हैं।
प्रश्नों को इस तरह से डिज़ाइन किया गया है कि बुनियादी विज्ञान ज्ञान वाला मानव उन्हें आसानी से उत्तर दे सकता है, लेकिन उन्हें दिए गए तथ्यों को सामान्य ज्ञान के साथ जोड़ने की आवश्यकता होती है। उदाहरण के लिए, एक प्रश्न पूछ सकता है: "यदि किसी पौधे को एक अंधेरे कमरे में रखा जाए तो निम्नलिखित में से कौन सा होने की सबसे अधिक संभावना है?" प्रदान किए गए तथ्य यह बता सकते हैं कि "पौधों को बढ़ने के लिए प्रकाश की आवश्यकता होती है," लेकिन सही उत्तर के लिए यह अनुमान लगाना आवश्यक है कि पौधा अच्छी तरह से नहीं बढ़ेगा, जो स्पष्ट रूप से नहीं बताया गया है। यह डिज़ाइन मॉडलों को सरल पुनर्प्राप्ति से आगे जाकर तर्क में संलग्न होने के लिए मजबूर करता है।
बेंचमार्क में "क्राउडसोर्स्ड" प्रश्नों का एक सेट भी शामिल है जिन्हें मानव एनोटेटरों द्वारा मान्य किया गया था ताकि यह सुनिश्चित किया जा सके कि वे स्पष्ट हैं और गैर-विशेषज्ञों द्वारा उत्तर देने योग्य हैं। निर्माताओं ने प्रश्नों को उत्पन्न करने और फ़िल्टर करने के लिए एक बहु-चरणीय प्रक्रिया का उपयोग किया, जिससे उच्च गुणवत्ता और कठिनाई सुनिश्चित हुई।
मूल्यांकन और प्रदर्शन
OpenBookQA Large language model और अन्य AI प्रणालियों के मूल्यांकन के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया है। प्रारंभिक मॉडल, जिनमें Transformer (architecture) आर्किटेक्चर पर आधारित मॉडल शामिल थे, ने खराब प्रदर्शन किया, जिसमें सटीकता अक्सर 60% से कम थी, जबकि मानव प्रदर्शन लगभग 92% था। इस अंतर ने स्पष्ट ज्ञान को अंतर्निहित तर्क के साथ संयोजित करने की चुनौती को उजागर किया।
समय के साथ, Deep learning में प्रगति और बड़े मॉडलों के विकास के साथ प्रदर्शन में काफी सुधार हुआ। 2021 तक, GPT-3 जैसे मॉडलों ने बेंचमार्क पर लगभग 80% सटीकता हासिल की, और 2023 तक, OpenAI और Google DeepMind सहित अत्याधुनिक सिस्टम 90% सटीकता के करीब या उससे अधिक पहुंच रहे थे। ये सुधार मॉडल आकार को बढ़ाने, बेहतर प्रशिक्षण डेटा और चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों से प्रेरित थे, जो मॉडलों को चरण-दर-चरण तर्क करने के लिए प्रोत्साहित करते हैं।
इन लाभों के बावजूद, OpenBookQA एक चुनौतीपूर्ण बेंचमार्क बना हुआ है क्योंकि यह उस तर्क का परीक्षण करता है जो सरल पैटर्न मिलान द्वारा आसानी से कैप्चर नहीं किया जाता है। यहां तक कि जब मॉडल उच्च स्कोर प्राप्त करते हैं, शोधकर्ता ध्यान देते हैं कि वे अभी भी सच्ची समझ के बजाय सांख्यिकीय नियमितताओं पर भरोसा कर सकते हैं, जिससे बेंचमार्क वर्तमान AI प्रणालियों की सीमाओं की जांच के लिए एक उपयोगी उपकरण बन जाता है।
प्रभाव और विरासत
OpenBookQA ने बाद के बेंचमार्क के डिज़ाइन को प्रभावित किया है, जैसे कि ARC (AI2 रीजनिंग चैलेंज) और CommonsenseQA, जो समान रूप से पुनर्प्राप्ति पर तर्क पर जोर देते हैं। इसने ज्ञान-वर्धित मॉडलों में अनुसंधान को भी बढ़ावा दिया है, जो तर्क में सुधार के लिए बाहरी ज्ञान आधार या पुनर्प्राप्ति तंत्र को शामिल करते हैं। बेंचमार्क का उपयोग अक्सर किसी मॉडल की सामान्य बुद्धिमत्ता का आकलन करने के लिए अन्य मूल्यांकनों के साथ किया जाता है, और यह Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संगठनों के लीडरबोर्ड में दिखाई देता है।
खुली किताब तर्क पर बेंचमार्क का ध्यान AI में रटने और समझ के बीच अंतर के बारे में चर्चाओं में भी योगदान दिया है। इसे सैकड़ों शोध पत्रों में उद्धृत किया गया है और यह कई मॉडल मूल्यांकन सुइट्स का एक मानक घटक है, जिसमें Amazon Web Services और Google Cloud द्वारा उनकी AI सेवाओं में उपयोग किए जाने वाले सुइट्स शामिल हैं।
सीमाएं और आलोचनाएं
कुछ शोधकर्ताओं ने OpenBookQA की आलोचना की है कि यह बहुत संकीर्ण है, क्योंकि यह प्राथमिक विद्यालय स्तर के विज्ञान पर केंद्रित है और अधिक जटिल तर्क कार्यों के लिए सामान्यीकृत नहीं हो सकता है। दूसरों ने नोट किया है कि बेंचमार्क का बहुविकल्पीय प्रारूप मॉडलों द्वारा उत्तर विकल्पों में सांख्यिकीय पूर्वाग्रहों का फायदा उठाकर खेला जा सकता है, जैसे कि सबसे लंबा उत्तर या प्रश्न के साथ सबसे अधिक ओवरलैप वाला उत्तर चुनना। इसे कम करने के लिए, निर्माताओं ने एक "आंशिक क्रेडिट" स्कोरिंग योजना पेश की, लेकिन इसने इन चिंताओं को पूरी तरह से संबोधित नहीं किया है।
इसके अतिरिक्त, तथ्यों के एक निश्चित सेट पर बेंचमार्क की निर्भरता का मतलब है कि बड़े कॉर्पोरा पर प्रशिक्षित मॉडल पहले से ही समान प्रश्न या तथ्य देख चुके होंगे, जिससे संभावित डेटा संदूषण हो सकता है। इसने कुछ शोधकर्ताओं को अधिक गतिशील बेंचमार्क की मांग करने के लिए प्रेरित किया है जो संतृप्ति से बचने के लिए समय के साथ अद्यतन किए जाते हैं।
इन सीमाओं के बावजूद, OpenBookQA तर्क क्षमताओं के मूल्यांकन के लिए एक मूल्यवान उपकरण बना हुआ है और Neural network और Generative AI प्रणालियों में अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसके डिज़ाइन सिद्धांतों ने अधिक व्यापक बेंचमार्क के विकास को सूचित किया है जिनका उद्देश्य संज्ञानात्मक कौशल की एक व्यापक श्रेणी को कैप्चर करना है।