अंग्रेज़ी से अनुवादित

शेरलॉक एक विज़ुअल कॉमनसेंस रीज़निंग डेटासेट है, जिसे 2020 में पेश किया गया था, ताकि AI मॉडलों की उन सवालों के जवाब देने की क्षमता का मूल्यांकन किया जा सके, जिनमें वस्तुओं, दृश्यों और उनके अंतःक्रियाओं के बारे में वास्तविक-विश्व ज्ञान की आवश्यकता होती है।

शेरलॉक एक बड़े पैमाने का डेटासेट और बेंचमार्क है जो दृश्य सामान्य ज्ञान तर्क के लिए है, जिसे 2020 में चैपल हिल में उत्तरी कैरोलिना विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा पेश किया गया था। डेटासेट में लगभग 21,000 छवियों से प्राप्त 103,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जो विज़ुअल जीनोम परियोजना से स्रोतित हैं, और प्रत्येक प्रश्न को सरल वस्तु पहचान से परे सामान्य ज्ञान की आवश्यकता के लिए डिज़ाइन किया गया है। शेरलॉक को दृश्य प्रश्न उत्तर (VQA) बेंचमार्क में एक अंतर को संबोधित करने के लिए बनाया गया था, जो अक्सर शाब्दिक दृश्य विवरणों पर ध्यान केंद्रित करते हैं, न कि उस अंतर्निहित, रोज़मर्रा के ज्ञान पर जो मनुष्य छवियों की व्याख्या करने के लिए उपयोग करते हैं।

डेटासेट दो पूरक कार्यों के आसपास संरचित है: एक बहुविकल्पीय प्रश्न उत्तर कार्य और एक तर्क निर्माण कार्य। बहुविकल्पीय कार्य में, मॉडल को चार विकल्पों में से सही उत्तर चुनना होता है, जहाँ सही उत्तर के लिए अनकहे गुणों या संबंधों का अनुमान लगाना आवश्यक होता है, जैसे कि यह भविष्यवाणी करना कि सर्फ़बोर्ड पकड़े हुए व्यक्ति के समुद्र तट के पास होने की संभावना है। तर्क निर्माण कार्य मॉडल से पूछता है कि वे एक स्वतंत्र-रूप स्पष्टीकरण उत्पन्न करें कि दिया गया उत्तर सही क्यों है, जिससे मॉडल अपनी भविष्यवाणियों के पीछे सामान्य ज्ञान तर्क को स्पष्ट करने के लिए प्रोत्साहित होते हैं। यह दोहरी संरचना शेरलॉक को पहचान और तर्क दोनों क्षमताओं का एक कठोर परीक्षण बनाती है।

निर्माण और एनोटेशन

शेरलॉक का निर्माण दो-चरणीय क्राउडसोर्सिंग पाइपलाइन का उपयोग करके किया गया था। पहले, एनोटेटर्स को विज़ुअल जीनोम से छवियाँ दिखाई गईं और उन्हें ऐसे प्रश्न लिखने के लिए कहा गया जिनका उत्तर केवल दृश्यमान वस्तुओं या विशेषताओं को सूचीबद्ध करके नहीं दिया जा सकता था, बल्कि सामान्य ज्ञान अनुमान की आवश्यकता होती थी। उदाहरण के लिए, एक प्रश्न पूछ सकता है, "व्यक्ति हेलमेट क्यों पहन रहा है?" जब हेलमेट दृश्यमान हो लेकिन कारण (जैसे, मोटरसाइकिल चलाना) नहीं होता। दूसरे, प्रत्येक प्रश्न को चार उत्तर विकल्पों के साथ जोड़ा गया, एक सही और तीन प्रशंसनीय व्याकुलता वाले, और एनोटेटर्स ने सही उत्तर की व्याख्या करने वाला एक संक्षिप्त तर्क भी लिखा। अंतिम डेटासेट में 103,302 प्रश्न हैं, जिसमें लगभग 80/20 का ट्रेन/टेस्ट विभाजन है, और प्रत्येक छवि औसतन पाँच प्रश्नों से जुड़ी है।

गुणवत्ता सुनिश्चित करने के लिए, एनोटेशन प्रक्रिया में समीक्षा और फ़िल्टरिंग के कई दौर शामिल थे। जो प्रश्न अस्पष्ट थे, बाहरी तथ्यात्मक ज्ञान की आवश्यकता थी (जैसे विशिष्ट ऐतिहासिक घटनाएँ), या जिनके कई प्रशंसनीय उत्तर थे, उन्हें हटा दिया गया। परिणामी डेटासेट रोज़मर्रा, सार्वभौमिक सामान्य ज्ञान पर जोर देता है, जैसे कि यह समझना कि छाता पकड़े हुए व्यक्ति के बारिश की उम्मीद करने की संभावना है या रसोई का चाकू भोजन काटने के लिए उपयोग किया जाता है।

मूल्यांकन और मीट्रिक्स

मॉडल का मूल्यांकन दो प्राथमिक मीट्रिक्स पर किया जाता है: बहुविकल्पीय कार्य पर सटीकता और उत्पन्न तर्कों की गुणवत्ता। बहुविकल्पीय कार्य के लिए, सटीकता केवल सही उत्तर दिए गए प्रश्नों का प्रतिशत है। तर्क निर्माण के लिए, मूल पेपर ने BLEU स्कोर का उपयोग किया, हालाँकि बाद के काम ने अक्सर ROUGE या मानव मूल्यांकन जैसे अधिक मजबूत मीट्रिक्स को नियोजित किया है। बेंचमार्क को समकालीन मॉडलों के लिए चुनौतीपूर्ण होने के लिए डिज़ाइन किया गया है; मूल पेपर में, एक Residual Network (ResNet) और ध्यान तंत्र पर आधारित एक मजबूत दृश्य प्रश्न उत्तर मॉडल ने लगभग 55% की सटीकता हासिल की, जबकि एक नमूना उपसमुच्चय पर मानव प्रदर्शन लगभग 90% था। यह महत्वपूर्ण अंतर दृश्य सामान्य ज्ञान तर्क की कठिनाई को उजागर करता है और आगे के शोध को प्रेरित करता है।

महत्व और प्रभाव

शेरलॉक Computer vision और Natural language processing के क्षेत्रों में एक मानक बेंचमार्क बन गया है, विशेष रूप से दृष्टि और भाषा के प्रतिच्छेदन पर शोध के लिए। इसका उपयोग कई मॉडलों का मूल्यांकन करने के लिए किया गया है, जिनमें Transformer (architecture) आर्किटेक्चर और Large language model पर आधारित मॉडल शामिल हैं। डेटासेट का सरल पहचान पर तर्क पर जोर बाद के बेंचमार्कों को प्रभावित किया है, जैसे कि VCR (विज़ुअल कॉमनसेंस रीजनिंग) और OK-VQA, जो समान रूप से बाहरी ज्ञान की आवश्यकता होती है। शेरलॉक ने दृष्टि-भाषा कार्यों में स्पष्टीकरण उत्पन्न करने के तरीकों के विकास में भी योगदान दिया, जो Artificial intelligence प्रणालियों में व्याख्यात्मकता और विश्वास के लिए बढ़ती रुचि का एक क्षेत्र है।

डेटासेट विशेष रूप से Deep learning मॉडलों की सीमाओं का अध्ययन करने के लिए उपयोगी रहा है। उदाहरण के लिए, विश्लेषणों ने दिखाया है कि मॉडल अक्सर सच्चे तर्क के बजाय उत्तर विकल्पों में सांख्यिकीय नियमितताओं पर निर्भर करते हैं, और वे उन प्रश्नों के साथ संघर्ष करते हैं जिनके लिए स्थानिक या लौकिक अनुमान की आवश्यकता होती है। इसने अधिक मजबूत प्रशिक्षण तकनीकों पर शोध को बढ़ावा दिया है, जिसमें Curriculum Learning और Data Augmentation शामिल हैं, साथ ही बाहरी ज्ञान आधारों का एकीकरण भी शामिल है।

सीमाएँ और आलोचनाएँ

अपने प्रभाव के बावजूद, शेरलॉक की कई आधारों पर आलोचना की गई है। तर्क मूल्यांकन के लिए BLEU का उपयोग मानव निर्णय के साथ खराब सहसंबंध के लिए जाना जाता है, जिससे मान्य लेकिन अलग ढंग से शब्दित तर्कों के लिए भ्रामक रूप से कम स्कोर होते हैं। इसके अतिरिक्त, विज़ुअल जीनोम छवियों पर डेटासेट की निर्भरता पूर्वाग्रहों को पेश करती है, जैसे कि पश्चिमी, शहरी संदर्भों से सामान्य वस्तुओं और दृश्यों का अधिक प्रतिनिधित्व, जो उस पर प्रशिक्षित मॉडलों की सामान्यीकरण क्षमता को सीमित कर सकता है। कुछ शोधकर्ताओं ने यह भी नोट किया है कि बहुविकल्पीय प्रारूप को मॉडलों द्वारा धोखा दिया जा सकता है जो उत्तर विकल्पों में सूक्ष्म भाषाई संकेतों का शोषण करते हैं, जो कई VQA बेंचमार्कों में एक आम समस्या है। इन सीमाओं ने अधिक विविध और विरोधात्मक रूप से निर्मित डेटासेट के लिए आह्वान किया है।

विरासत और भविष्य की दिशाएँ

शेरलॉक दृष्टि-भाषा समुदाय में एक व्यापक रूप से उद्धृत संसाधन बना हुआ है और अक्सर उन मॉडलों के लिए प्रीट्रेनिंग या मूल्यांकन लक्ष्य के रूप में उपयोग किया जाता है जो दृश्य और पाठ्य समझ को संयोजित करने का लक्ष्य रखते हैं। इसका डिज़ाइन अनुवर्ती डेटासेटों को प्रेरित किया है जो विशिष्ट प्रकार के सामान्य ज्ञान पर ध्यान केंद्रित करते हैं, जैसे कि भौतिक तर्क या सामाजिक संपर्क। 2020 के मध्य तक, Transformer (architecture) आर्किटेक्चर पर निर्मित और बड़े मल्टीमॉडल कॉर्पोरा पर प्रशिक्षित अत्याधुनिक मॉडलों ने शेरलॉक पर काफी अधिक सटीकता हासिल की है, कुछ 80% से अधिक, हालाँकि मानव-स्तरीय प्रदर्शन अभी भी अप्राप्य है। डेटासेट Generative AI प्रणालियों की तर्क क्षमताओं की जाँच करने और ऐसे तरीकों को विकसित करने के लिए एक मूल्यवान उपकरण के रूप में कार्य करना जारी रखता है जो ऐसे तर्क को अधिक स्पष्ट और सत्यापन योग्य बनाते हैं।

यह भी देखें

संदर्भ

मूल शेरलॉक पेपर 2020 कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में प्रस्तुत किया गया था और CVPR कार्यवाही में उपलब्ध है। डेटासेट सार्वजनिक रूप से होस्ट किया गया है और परियोजना की आधिकारिक वेबसाइट के माध्यम से एक्सेस किया जा सकता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·computer-vision·natural-language-processing·commonsense-reasoning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास