अंग्रेज़ी से अनुवादित

ImageNet-Sketch 50,000 श्वेत-श्याम स्केच छवियों का एक डेटासेट है, जो 1,000 ImageNet वर्गों में फैला है, और इसे प्राकृतिक फोटो से अमूर्त रेखा चित्रों तक डोमेन शिफ्ट के तहत मॉडल की मजबूती का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

ImageNet-Sketch एक बेंचमार्क डेटासेट है जिसे 2019 में पेश किया गया था, ताकि यह परीक्षण किया जा सके कि छवि वर्गीकरण मॉडल एक अलग दृश्य डोमेन में कितनी अच्छी तरह सामान्यीकरण करते हैं। इसमें 50,000 ग्रेस्केल स्केच छवियां शामिल हैं, जिनमें मूल ImageNet डेटासेट के 1,000 वर्गों में से प्रत्येक के लिए 50 छवियां हैं। स्केच Google Image खोजों से "sketch of [class name]" जैसे शब्दों के लिए एकत्र किए गए हैं, और यह सुनिश्चित करने के लिए मैन्युअल रूप से फ़िल्टर किए गए हैं कि वे इच्छित वस्तु को दर्शाते हैं। प्राकृतिक तस्वीरों के विपरीत, ये छवियां अमूर्त रेखा चित्र हैं, जिनमें अक्सर न्यूनतम विवरण होता है, जो उन्हें मानक फोटो डेटासेट पर प्रशिक्षित मॉडल के लिए एक चुनौतीपूर्ण डोमेन-शिफ्ट परीक्षण बनाता है।

यह डेटासेट कैलिफोर्निया विश्वविद्यालय, बर्कले के शोधकर्ताओं द्वारा बनाया गया था, जिनमें हाओहान वांग, सोंगवेई गे, ज़ाचरी लिप्टन और एरिक ज़िंग शामिल हैं। इसे "Learning Robust Global Representations by Penalizing Local Predictive Power" शीर्षक वाले एक पेपर के साथ जारी किया गया था, जिसे 2019 के कॉन्फ्रेंस ऑन न्यूरल इंफॉर्मेशन प्रोसेसिंग सिस्टम्स (NeurIPS) में प्रस्तुत किया गया था। प्राथमिक प्रेरणा वितरण शिफ्ट के प्रति मॉडल की मजबूती का मूल्यांकन करने के लिए एक सरल लेकिन प्रभावी जांच प्रदान करना था, विशेष रूप से वास्तविक दुनिया की छवियों से अमूर्त मानव स्केच तक का बदलाव। ImageNet-Sketch तब से मशीन-लर्निंग और डीप-लर्निंग के क्षेत्र में एक मानक मूल्यांकन सेट बन गया है, जिसे अक्सर ImageNet-C और ImageNet-R जैसे अन्य मजबूती बेंचमार्क के साथ उपयोग किया जाता है।

निर्माण और विशेषताएं

निर्माण प्रक्रिया में प्रत्येक 1,000 ImageNet वर्गों के लिए "sketch of [class]" पैटर्न के साथ Google Image खोज को क्वेरी करना शामिल था। फिर लौटाई गई छवियों को गैर-स्केच छवियों, जैसे तस्वीरें या आरेख, को हटाने और यह सुनिश्चित करने के लिए फ़िल्टर किया गया कि प्रत्येक वर्ग में कम से कम 50 मान्य स्केच हों। अंतिम डेटासेट में प्रति वर्ग ठीक 50 छवियां हैं, जो कुल 50,000 छवियां बनाती हैं। सभी छवियों को न्यूरल-नेटवर्क क्लासिफायर के लिए मानक इनपुट आकार से मेल खाने के लिए एक सुसंगत रिज़ॉल्यूशन, आमतौर पर 224x224 पिक्सेल, में आकार दिया गया है।

ImageNet-Sketch की एक प्रमुख विशेषता मानव-निर्मित स्केच पर इसकी निर्भरता है, जो स्वाभाविक रूप से प्राकृतिक छवियों की तुलना में अधिक अमूर्त और कम फोटोरियलिस्टिक होते हैं। ये स्केच अक्सर रंग, बनावट और बारीक विवरण को छोड़ देते हैं, जिससे मॉडल को वैश्विक आकार और संरचनात्मक संकेतों पर निर्भर रहना पड़ता है। यह डेटासेट विशेष रूप से यह अध्ययन करने के लिए उपयोगी बनाता है कि क्या मॉडल ने मजबूत, सामान्यीकरण योग्य विशेषताएं सीखी हैं या प्राकृतिक छवियों में सतही आंकड़ों पर अति-फिटिंग की है।

मजबूती मूल्यांकन में भूमिका

ImageNet-Sketch का व्यापक रूप से डोमेन शिफ्ट के तहत छवि क्लासिफायर की मजबूती को मापने के लिए उपयोग किया जाता है। ImageNet पर प्रशिक्षित मॉडल आमतौर पर ImageNet-Sketch पर मूल्यांकन करने पर सटीकता में महत्वपूर्ण गिरावट दिखाते हैं, अक्सर प्राकृतिक छवियों पर लगभग 70-80% शीर्ष-1 सटीकता से स्केच पर 20-30% तक। यह प्रदर्शन अंतर कई डीप-लर्निंग मॉडलों की भंगुरता को उजागर करता है जब वे वितरण-बाहर इनपुट का सामना करते हैं।

डेटासेट को अक्सर मजबूती लीडरबोर्ड और अध्ययनों में शामिल किया जाता है। उदाहरण के लिए, यह ImageNet-C और ImageNet-P भ्रष्टाचार बेंचमार्क का एक मुख्य घटक है, हालांकि यह इस मायने में अलग है कि यह सिंथेटिक भ्रष्टाचार के बजाय एक प्राकृतिक, मानव-निर्मित डोमेन शिफ्ट का प्रतिनिधित्व करता है। शोधकर्ताओं ने विभिन्न मजबूती तकनीकों की प्रभावशीलता का मूल्यांकन करने के लिए ImageNet-Sketch का उपयोग किया है, जैसे डेटा-ऑगमेंटेशन रणनीतियां, प्रतिकूल प्रशिक्षण, और रिज़िड्यूअल-नेटवर्क वेरिएंट जैसे वास्तुशिल्प परिवर्तन। इसका उपयोग मॉडल के आंतरिक प्रतिनिधित्व की जांच के लिए भी किया गया है, जिससे पता चलता है कि कई मॉडल वैश्विक आकार के बजाय बनावट और स्थानीय पैटर्न पर भारी निर्भर करते हैं, जिसे स्केच बाधित करते हैं।

अन्य बेंचमार्क से संबंध

ImageNet-Sketch अन्य डोमेन-शिफ्ट डेटासेट जैसे ImageNet-R (जिसमें पेंटिंग और कार्टून जैसे कलात्मक रेंडरिंग शामिल हैं) और ImageNet-A (जिसमें स्वाभाविक रूप से होने वाले प्रतिकूल उदाहरण शामिल हैं) का पूरक है। जबकि ImageNet-R में कलात्मक शैलियों का मिश्रण शामिल है, ImageNet-Sketch विशेष रूप से रेखा चित्रों पर केंद्रित है, जो आकार-आधारित पहचान का एक स्वच्छ परीक्षण प्रदान करता है। डेटासेट Sketchy डेटासेट और TU-Berlin स्केच डेटासेट से भी संबंधित है, लेकिन यह अपने पैमाने और ImageNet वर्गों के साथ सीधे संरेखण में अद्वितीय है।

आर्टिफिशियल-इंटेलिजेंस अनुसंधान के व्यापक संदर्भ में, ImageNet-Sketch वर्तमान मॉडलों की सीमाओं को उजागर करने और मजबूत और सामान्यीकरण योग्य शिक्षण में रुचि बढ़ाने में सहायक रहा है। इसे अक्सर डोमेन सामान्यीकरण, स्व-पर्यवेक्षित शिक्षण और मॉडल व्याख्यात्मकता पर पेपरों में उद्धृत किया जाता है। 2025 तक, यह कंप्यूटर विज़न में एक मानक मूल्यांकन उपकरण बना हुआ है, जिसमें कई अत्याधुनिक मॉडल इस बेंचमार्क पर अपने प्रदर्शन की रिपोर्ट करते हैं।

सीमाएं और आलोचनाएं

ImageNet-Sketch की एक सीमा यह है कि स्केच वेब खोजों से एकत्र किए जाते हैं, जो शैली या सामग्री में पूर्वाग्रह पेश कर सकते हैं। उदाहरण के लिए, कुछ वर्गों में दूसरों की तुलना में अधिक विविध स्केच शैलियां हो सकती हैं, और फ़िल्टरिंग प्रक्रिया अनजाने में ऐसी छवियों को शामिल कर सकती है जो शुद्ध स्केच नहीं हैं। इसके अतिरिक्त, डेटासेट स्थिर है, इसलिए यह समय के साथ विकसित होने वाली स्केच शैलियों को कैप्चर नहीं करता है। इन मुद्दों के बावजूद, इसकी सरलता और उपयोग में आसानी ने इसे शोधकर्ताओं के लिए एक लोकप्रिय विकल्प बना दिया है।

एक और आलोचना यह है कि ImageNet-Sketch पर प्रदर्शन गिरावट वास्तविक दुनिया के डोमेन शिफ्ट को पूरी तरह से प्रतिबिंबित नहीं कर सकती है, क्योंकि स्केच एक चरम अमूर्तता हैं। हालांकि, यह चरमता ही है जो डेटासेट को तनाव-परीक्षण मॉडल के लिए मूल्यवान बनाती है। यह शोधकर्ताओं को ऐसे तरीके विकसित करने के लिए मजबूर करता है जो पिक्सेल पैटर्न को याद करने से परे जाते हैं और इसके बजाय अधिक अमूर्त, स्थानांतरणीय प्रतिनिधित्व सीखते हैं।

अनुसंधान और उद्योग में उपयोग

शैक्षणिक अनुसंधान में, ImageNet-Sketch का उपयोग अक्सर नए आर्किटेक्चर और प्रशिक्षण विधियों को बेंचमार्क करने के लिए किया जाता है। उदाहरण के लिए, विज़न ट्रांसफॉर्मर और कन्वोल्यूशनल नेटवर्क पर अध्ययन अक्सर मजबूती प्रदर्शित करने के लिए इस डेटासेट पर परिणाम रिपोर्ट करते हैं। इसका उपयोग फाउंडेशन मॉडल के विकास में भी किया जाता है, जहां विविध डेटा पर प्रीट्रेनिंग से ऐसे वितरण-बाहर सेटों पर प्रदर्शन में सुधार होने की उम्मीद है। उद्योग में, छवि पहचान प्रणालियों पर काम करने वाली कंपनियां, जैसे स्वायत्त ड्राइविंग या चिकित्सा इमेजिंग में, मॉडल सामान्यीकरण के लिए एक सैनिटी चेक के रूप में ImageNet-Sketch का उपयोग कर सकती हैं, हालांकि यह अनुसंधान सेटिंग्स में अधिक आम है।

डेटासेट सार्वजनिक रूप से डाउनलोड के लिए उपलब्ध है, और इसका उपयोग मूल ImageNet शर्तों द्वारा शासित है, जो गैर-वाणिज्यिक अनुसंधान उपयोग की अनुमति देते हैं। इसे हजारों पेपरों में उद्धृत किया गया है, जिससे यह क्षेत्र में सबसे प्रभावशाली मजबूती बेंचमार्क में से एक बन गया है। 2025 तक, यह एक प्रासंगिक और व्यापक रूप से उपयोग किया जाने वाला संसाधन बना हुआ है, खासकर जब समुदाय विविध और अप्रत्याशित वातावरण में विश्वसनीय मॉडल बनाने पर केंद्रित है।

भविष्य की दिशाएं

आगे देखते हुए, शोधकर्ता ImageNet-Sketch को अन्य डोमेन, जैसे 3D स्केच या एनिमेटेड चित्र, तक विस्तारित करने और बारीक-दाने वाले वर्गों के साथ अधिक चुनौतीपूर्ण संस्करण बनाने के तरीकों की खोज कर रहे हैं। डेटासेट का उपयोग उन मॉडलों को प्रशिक्षित करने के लिए भी रुचि है जो स्वाभाविक रूप से अधिक मजबूत हैं, न कि केवल उनका मूल्यांकन करने के लिए। उदाहरण के लिए, कुछ काम ने आकार पूर्वाग्रह में सुधार के लिए प्रशिक्षण सेटों में स्केच डेटा को शामिल करने की खोज की है, जो अन्य डोमेन शिफ्टों पर बेहतर सामान्यीकरण का कारण बन सकता है। डेटासेट वास्तव में मजबूत आर्टिफिशियल-इंटेलिजेंस सिस्टम प्राप्त करने के चल रहे प्रयास में एक आधारशिला बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·robustness·domain-shift
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास