चिल्ड्रन्स बुक टेस्ट (CBT) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की पढ़ने की समझ की क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2015 में पेश किया गया, इसे गूगल डीपमाइंड के शोधकर्ताओं द्वारा मशीन लर्निंग मॉडल के लिए एक चुनौतीपूर्ण फिर भी सुलभ परीक्षण प्रदान करने के लिए बनाया गया था। यह परीक्षण बच्चों की पुस्तकों के एक बड़े कोष से निकाले गए वाक्यों से निर्मित है, जो प्रोजेक्ट गुटेनबर्ग के माध्यम से ऑनलाइन स्वतंत्र रूप से उपलब्ध हैं। कार्य में कहानी के पूर्ववर्ती संदर्भ को देखते हुए, एक वाक्य से लुप्त शब्द की भविष्यवाणी करना शामिल है। इसके लिए मॉडल को कथा संरचना, चरित्र संबंधों और सामान्य ज्ञान को समझने की आवश्यकता होती है, न कि केवल स्थानीय पाठ में पैटर्न का मिलान करने की।
CBT को भाषा समझ के लिए मौजूदा मूल्यांकन विधियों में एक अंतर को संबोधित करने के लिए विकसित किया गया था। पिछले बेंचमार्क अक्सर पार्ट-ऑफ-स्पीच टैगिंग या वाक्यात्मक पार्सिंग जैसे कार्यों पर केंद्रित थे, जो अर्थ की समझ को सीधे मापते नहीं हैं। CBT का डिज़ाइन, स्वाभाविक रूप से होने वाले कथा पाठ का उपयोग करते हुए, इसे एक अधिक यथार्थवादी परीक्षण बनाता है कि एक मॉडल कहानी का अनुसरण कितनी अच्छी तरह कर सकता है। यह डेटासेट क्षेत्र में एक मानक संदर्भ बिंदु बन गया है, जिसका उपयोग विभिन्न तंत्रिका नेटवर्क आर्किटेक्चर और प्रशिक्षण तकनीकों के प्रदर्शन की तुलना करने के लिए किया जाता है।
डेटासेट संरचना और कार्य
CBT डेटासेट को चार अलग-अलग उपसमूहों में विभाजित किया गया है, जिनमें से प्रत्येक एक अलग प्रकार के शब्द को लक्षित करता है: संज्ञा, क्रिया, विशेषण और पूर्वसर्ग। प्रत्येक उपसमूह में 'प्रश्नों' की एक श्रृंखला होती है, जहां एक प्रश्न एक पुस्तक से 21 क्रमागत वाक्यों का एक अंश होता है। पहले 20 वाक्य संदर्भ के रूप में कार्य करते हैं, और 21वें वाक्य से एक शब्द हटा दिया जाता है। मॉडल को संदर्भ और अधूरा वाक्य, साथ ही 10 उम्मीदवार शब्दों की एक सूची के साथ प्रस्तुत किया जाता है। इनमें से केवल एक उम्मीदवार मूल पाठ का सही शब्द है; अन्य नौ एक ही प्रकार के यादृच्छिक रूप से चुने गए शब्द हैं (उदाहरण के लिए, यदि लुप्त शब्द संज्ञा है तो अन्य संज्ञाएं)। मॉडल का कार्य सही शब्द का चयन करना है।
यह बहुविकल्पीय प्रारूप मूल्यांकन को सरल बनाता है, क्योंकि इसके लिए मॉडल को मुक्त-रूप पाठ उत्पन्न करने की आवश्यकता नहीं होती है। व्याकुलता पैदा करने वाले शब्दों का यादृच्छिक चयन यह सुनिश्चित करता है कि मॉडल केवल शब्द आवृत्ति या सामान्य सह-अभिवृत्तियों को सीखकर सफल नहीं हो सकता; उसे व्यापक कथा संदर्भ का उपयोग करना चाहिए। उदाहरण के लिए, यदि कहानी में 'टॉम' नामक एक चरित्र और एक 'कुत्ते' का उल्लेख है, और लुप्त शब्द 'टॉम ने ___ के साथ खेला' जैसे वाक्य में एक संज्ञा है, तो मॉडल को यह अनुमान लगाना चाहिए कि पूर्ववर्ती कहानी की घटनाओं के आधार पर 'कुत्ता' 'गेंद' की तुलना में अधिक संभावित है।
निर्माण और कोष
CBT के लिए कोष प्रोजेक्ट गुटेनबर्ग से डाउनलोड की गई 98 बच्चों की पुस्तकों से संकलित किया गया था। इन पुस्तकों को चुना गया क्योंकि वे सार्वजनिक डोमेन में हैं और इनमें अपेक्षाकृत सरल भाषा होती है, जो उन्हें समझ के परीक्षण के लिए उपयुक्त बनाती है। फेलिक्स हिल, एंटोनी बोर्डेस, सुमित चोपड़ा और जेसन वेस्टन के नेतृत्व वाले शोधकर्ताओं ने वाक्यों को निकालने और परीक्षण उदाहरण बनाने के लिए पुस्तकों को संसाधित किया। अंतिम डेटासेट में सभी चार शब्द-प्रकार के उपसमूहों में 687,000 से अधिक प्रश्न हैं। संज्ञा उपसमूह सबसे बड़ा है, जिसमें लगभग 250,000 प्रश्न हैं, जबकि पूर्वसर्ग उपसमूह सबसे छोटा है, जिसमें लगभग 75,000 प्रश्न हैं।
डेटासेट की एक प्रमुख विशेषता यह है कि इसे प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिनमें से प्रत्येक के लिए उपयोग की जाने वाली पुस्तकों में कोई ओवरलैप नहीं है। यह सुनिश्चित करता है कि मॉडल का परीक्षण उन कहानियों पर किया जाता है जो उन्होंने प्रशिक्षण के दौरान कभी नहीं देखी हैं, जिससे उन्हें नई कथाओं के लिए सामान्यीकरण करने के लिए मजबूर होना पड़ता है। बच्चों की पुस्तकों का उपयोग जानबूझकर किया गया है: उनमें स्पष्ट कथाएं, आवर्ती पात्र और रोजमर्रा की वस्तुएं होती हैं, जो तर्क के लिए समृद्ध संदर्भ प्रदान करती हैं।
एआई अनुसंधान में महत्व
CBT ने प्राकृतिक भाषा समझ के लिए गहन शिक्षण पर अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई। जब इसे जारी किया गया था, तो कई मौजूदा मॉडलों ने खराब प्रदर्शन किया, विशेष रूप से संज्ञा और क्रिया उपसमूहों पर, जिन्हें कहानी के बारे में गहन तर्क की आवश्यकता होती है। इसने मेमोरी-संवर्धित नेटवर्क और ध्यान-आधारित मॉडल जैसे नए आर्किटेक्चर के विकास को प्रेरित किया। बेंचमार्क ने 'क्लोज़-शैली' कार्यों के विचार को लोकप्रिय बनाने में मदद की, जहां एक शब्द हटा दिया जाता है और उसकी भविष्यवाणी की जानी होती है, समझ का मूल्यांकन करने के तरीके के रूप में।
बाद में, CBT का उपयोग प्रारंभिक ट्रांसफार्मर मॉडल का मूल्यांकन करने के लिए किया गया, जिन्होंने आवर्ती नेटवर्क पर पर्याप्त सुधार दिखाया। CBT और समान बेंचमार्क पर ट्रांसफार्मर की सफलता ने बड़े भाषा मॉडल के उदय में योगदान दिया। जबकि ओपनएआई और एंथ्रोपिक जैसे आधुनिक मॉडल अब CBT पर लगभग पूर्ण अंक प्राप्त करते हैं, डेटासेट मॉडल व्यवहार को समझने के लिए एक उपयोगी नैदानिक उपकरण बना हुआ है, विशेष रूप से नियंत्रित सेटिंग्स में जहां शोधकर्ता विशिष्ट तर्क क्षमताओं की जांच कर सकते हैं।
सीमाएं और आलोचनाएं
अपने प्रभाव के बावजूद, CBT की कई सीमाएं हैं। आलोचकों ने कहा है कि बहुविकल्पीय प्रारूप को उन मॉडलों द्वारा खेला जा सकता है जो सच्ची समझ के बजाय उम्मीदवार सूचियों में सांख्यिकीय नियमितताओं का शोषण करते हैं। उदाहरण के लिए, एक मॉडल उन शब्दों को प्राथमिकता देना सीख सकता है जो संदर्भ में अक्सर दिखाई देते हैं, भले ही वे शब्दार्थ रूप से उपयुक्त न हों। इसके अतिरिक्त, कार्य के लिए केवल एक शब्द का चयन करना आवश्यक है, जो पढ़ने की समझ का एक अपेक्षाकृत संकीर्ण पहलू है; यह खुले-अंत वाले प्रश्नों का उत्तर देने, कहानी को सारांशित करने या अनिर्दिष्ट जानकारी के बारे में अनुमान लगाने की क्षमता का परीक्षण नहीं करता है।
एक और आलोचना यह है कि व्याकुलता पैदा करने वाले शब्दों का यादृच्छिक चयन कभी-कभी आसान प्रश्न बना सकता है, जहां सही शब्द एकमात्र ऐसा होता है जो व्याकरणिक रूप से समझ में आता है। यह प्रदर्शन स्कोर को बढ़ा सकता है। शोधकर्ताओं ने इन मुद्दों को संबोधित करने के लिए CBT के वेरिएंट प्रस्तावित किए हैं, जैसे अधिक चुनौतीपूर्ण व्याकुलता पैदा करने वाले शब्दों का उपयोग करना या मुक्त-रूप पीढ़ी की आवश्यकता। फिर भी, CBT की सादगी और प्रतिलिपि प्रस्तुत करने की क्षमता ने इसे एक स्थायी बेंचमार्क बना दिया है, और यह अभी भी तुलना के लिए आधार रेखा के रूप में पेपरों में उद्धृत किया जाता है।
विरासत और प्रभाव
CBT ने LAMBADA और स्टैनफोर्ड प्रश्न उत्तर डेटासेट (SQuAD) जैसे बाद के बेंचमार्क के डिज़ाइन को प्रभावित किया, जो समझ का परीक्षण करने के लिए कथा या प्रासंगिक पाठ का भी उपयोग करते हैं। इसने लंबे अंशों पर तर्क पर केंद्रित मूल्यांकन मैट्रिक्स के विकास में भी योगदान दिया। डेटासेट डाउनलोड के लिए उपलब्ध है और शैक्षणिक और औद्योगिक सेटिंग्स में मशीन लर्निंग और कृत्रिम बुद्धिमत्ता का अध्ययन करने वाले शोधकर्ताओं के लिए एक सामान्य उपकरण बना हुआ है। इसके निर्माण ने प्रशिक्षण और मूल्यांकन के लिए प्राकृतिक, मानव-लेखित पाठ का उपयोग करने के महत्व को उजागर किया, एक सिद्धांत जो क्षेत्र का मार्गदर्शन करना जारी रखता है।