DROP (Discrete Reasoning Over Paragraphs) एक बेंचमार्क डेटासेट है जो पठन समझ और प्रश्न-उत्तर प्रणालियों के मूल्यांकन के लिए उपयोग किया जाता है। इसे 2019 में कार्नेगी मेलन विश्वविद्यालय और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। डेटासेट में विकिपीडिया लेखों से प्राप्त 96,000 से अधिक प्रश्न शामिल हैं, जिन्हें जोड़, गिनती, छंटाई और तुलना जैसे विवेकपूर्ण तर्क संचालन की आवश्यकता के लिए डिज़ाइन किया गया है, न कि केवल पाठ के एक अंश को निकालने के लिए। यह DROP को पहले के पठन समझ बेंचमार्क जैसे SQuAD से अलग करता है, जो मुख्य रूप से पैसेज में सीधे उत्तर खोजने की क्षमता का परीक्षण करता था।
DROP के निर्माण का उद्देश्य यह अवलोकन था कि कई मौजूदा प्रश्न-उत्तर मॉडल उत्तर निकालने में उत्कृष्ट थे, लेकिन उन प्रश्नों से जूझते थे जिनमें पाठ के कई हिस्सों से जानकारी को संयोजित करना या सरल अंकगणित करना शामिल था। बेंचमार्क को इन सीमाओं को उजागर करने और क्षेत्र को अधिक मजबूत तर्क क्षमताओं की ओर धकेलने के लिए डिज़ाइन किया गया था। DROP में प्रत्येक प्रश्न विकिपीडिया लेख के एक पैराग्राफ के साथ जोड़ा गया है, और उत्तर एक अंश, संख्या, तारीख या वस्तुओं की सूची हो सकता है। प्रश्नों को जोड़, घटाव, गिनती, छंटाई और तुलना जैसे संचालन की आवश्यकता के लिए तैयार किया गया है, जिसमें अक्सर अस्थायी या संख्यात्मक तर्क शामिल होता है।
डेटासेट संरचना और मूल्यांकन
DROP डेटासेट को प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित किया गया है। प्रशिक्षण सेट में लगभग 77,000 प्रश्न हैं, विकास सेट में लगभग 9,500, और परीक्षण सेट में लगभग 9,500। प्रत्येक उदाहरण में एक पैसेज, एक प्रश्न और एक या अधिक संदर्भ उत्तर शामिल हैं। मूल्यांकन सटीक मिलान (EM) और F1 स्कोर का उपयोग करके किया जाता है, जो अनुमानित और संदर्भ उत्तरों के बीच ओवरलैप को मापते हैं। चूंकि उत्तर संख्या या सूचियाँ हो सकते हैं, मूल्यांकन स्क्रिप्ट प्रारूपों को सामान्य करती है और अल्पविराम और तारीख प्रारूपों जैसी विविधताओं को संभालती है।
प्रारंभिक प्रदर्शन और चुनौतियाँ
जब DROP जारी किया गया था, उस समय के सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडलों ने लगभग 30-40% F1 स्कोर प्राप्त किया, जो मानव प्रदर्शन से काफी नीचे था, जिसका अनुमान लगभग 96% F1 था। बेंचमार्क ने मौजूदा तंत्रिका मॉडलों की तर्क क्षमताओं में महत्वपूर्ण अंतराल को उजागर किया, विशेष रूप से संख्यात्मक संचालन और बहु-चरणीय अनुमान को संभालने में। DROP को हल करने के शुरुआती प्रयासों में अक्सर हाइब्रिड सिस्टम शामिल थे जो तंत्रिका पठन समझ को प्रतीकात्मक तर्क मॉड्यूल, जैसे अंकगणितीय कैलकुलेटर या प्रोग्राम जनरेटर के साथ जोड़ते थे।
बाद की प्रगति और तकनीकें
समय के साथ, मॉडल आर्किटेक्चर और प्रशिक्षण विधियों में सुधार ने DROP पर पर्याप्त लाभ प्राप्त किया। ट्रांसफॉर्मर-आधारित मॉडलों की शुरूआत, विशेष रूप से बड़े कॉर्पोरा पर पूर्व-प्रशिक्षित, ने प्रदर्शन को बेहतर बनाने में मदद की। BERT और इसके उत्तराधिकारी जैसे मॉडल, जब DROP पर फाइन-ट्यून किए गए, तो उच्च स्कोर प्राप्त किया लेकिन फिर भी जटिल तर्क से जूझते रहे। बाद में, बाहरी उपकरणों को शामिल करने वाले दृष्टिकोण, जैसे प्रोग्राम संश्लेषण या विशेषीकृत हानि फ़ंक्शन, ने मॉडलों को स्पष्ट अंकगणितीय संचालन करने में सक्षम बनाया। 2021 तक, कुछ सिस्टम ने 85% से अधिक F1 स्कोर प्राप्त किया, जो मानव-स्तरीय प्रदर्शन के करीब था, मुख्य रूप से बड़े पूर्व-प्रशिक्षित मॉडलों के उपयोग और प्रतीकात्मक तर्क घटकों के एकीकरण के कारण।
AI अनुसंधान पर प्रभाव
DROP बेंचमार्क का प्राकृतिक भाषा प्रसंस्करण और कृत्रिम बुद्धिमत्ता के क्षेत्र पर स्थायी प्रभाव पड़ा है। इसने हाइब्रिड न्यूरो-प्रतीकात्मक प्रणालियों पर शोध को प्रेरित किया, जो तंत्रिका नेटवर्क को स्पष्ट तर्क तंत्र के साथ जोड़ते हैं। इसने तर्क क्षमताओं का परीक्षण करने वाले अधिक चुनौतीपूर्ण बेंचमार्क के विकास को भी प्रभावित किया, जैसे कि बहु-हॉप अनुमान या गणितीय समस्या समाधान की आवश्यकता वाले। DROP पठन समझ और तर्क के लिए एक मानक मूल्यांकन उपकरण बना हुआ है, और इसे अक्सर आधुनिक बड़े भाषा मॉडल के प्रशिक्षण और मूल्यांकन में शामिल किया जाता है।
संबंधित बेंचमार्क और भविष्य की दिशाएँ
DROP तर्क बेंचमार्क के एक व्यापक परिवार का हिस्सा है जिसमें अनुक्रम-से-अनुक्रम परिवर्तन, मल्टी-हेड अटेंशन-आधारित मॉडल और पाठ्यक्रम सीखने के दृष्टिकोण जैसे कार्य शामिल हैं। जबकि DROP पाठ पर विवेकपूर्ण तर्क पर केंद्रित है, नए बेंचमार्क ने दृश्य तर्क, सामान्य ज्ञान और बहु-मोडल समझ को शामिल करने के लिए विस्तार किया है। 2020 के दशक की शुरुआत तक, कई अत्याधुनिक बड़े भाषा मॉडल का मूल्यांकन उनके सामान्य तर्क आकलन के हिस्से के रूप में DROP पर किया जाता है, और बेंचमार्क मशीन समझ में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है।