अंग्रेज़ी से अनुवादित

CIFAR-10-C मशीन लर्निंग मॉडल की सामान्य छवि विकृतियों और शोर के खिलाफ मजबूती का मूल्यांकन करने के लिए इस्तेमाल किया जाने वाला CIFAR-10 छवियों के खराब संस्करणों का एक बेंचमार्क डेटासेट है।

CIFAR-10-C एक बेंचमार्क डेटासेट है जिसे मशीन लर्निंग मॉडल, विशेष रूप से कंप्यूटर विज़न में उपयोग होने वाले मॉडल की मजबूती (robustness) का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसमें मूल CIFAR-10 परीक्षण सेट के दूषित (corrupted) संस्करण शामिल हैं, जिसमें 10 कक्षाओं (हवाई जहाज, ऑटोमोबाइल, पक्षी, बिल्ली, हिरण, कुत्ता, मेंढक, घोड़ा, जहाज, ट्रक) में 10,000 छवियाँ हैं। 'C' का अर्थ 'corrupted' (दूषित) है। यह डेटासेट 2019 में डैन हेंड्रिक्स और थॉमस डाइटेरिच सहित शोधकर्ताओं द्वारा पेश किया गया था, और तब से यह आकलन करने के लिए एक मानक उपकरण बन गया है कि मॉडल अप्रत्याशित इनपुट विकृतियों के लिए कितनी अच्छी तरह सामान्यीकरण करते हैं।

CIFAR-10-C का प्राथमिक उद्देश्य किसी मॉडल की मजबूती को मापना है, जिसका अर्थ है वास्तविक दुनिया की सेटिंग्स में होने वाली सामान्य दूषणों (corruptions) से बदली गई छवियों का सामना करने पर सटीक भविष्यवाणियाँ बनाए रखने की क्षमता। इन दूषणों में गाऊसी शोर, धुंधलापन, मौसम प्रभाव (जैसे कोहरा और बर्फ), और डिजिटल विकृतियाँ (जैसे JPEG संपीड़न) शामिल हैं। प्रतिकूल हमलों (adversarial attacks) के विपरीत, जो जानबूझकर मॉडल को धोखा देने के लिए तैयार किए जाते हैं, CIFAR-10-C में दूषण प्राकृतिक और अनुकूलित नहीं होते, जो कैमरों, सेंसरों या संचरण से छवि गुणवत्ता में सामान्य भिन्नताओं को दर्शाते हैं।

संरचना और दूषण

CIFAR-10-C में 15 विभिन्न प्रकार के दूषण शामिल हैं, जिनमें से प्रत्येक को पाँच स्तरों (1 से 5) पर लागू किया जाता है। इसके परिणामस्वरूप परीक्षण सेट के 75 अलग-अलग दूषित संस्करण बनते हैं। दूषणों को चार श्रेणियों में विभाजित किया गया है: शोर (गाऊसी, शॉट, आवेग), धुंधलापन (डिफोकस, फ्रॉस्टेड, ग्लास, मोशन, ज़ूम), मौसम (बर्फ, पाला, कोहरा, चमक), और डिजिटल (कंट्रास्ट, इलास्टिक, पिक्सेलेट, JPEG)। प्रत्येक दूषित छवि मूल साफ छवि से निर्धारक एल्गोरिदम का उपयोग करके उत्पन्न की जाती है, जिससे प्रयोगों में पुनरुत्पादन सुनिश्चित होता है।

गंभीरता स्तर शोधकर्ताओं को यह अध्ययन करने की अनुमति देते हैं कि विकृति बढ़ने पर प्रदर्शन कैसे घटता है। उदाहरण के लिए, एक मॉडल गंभीरता 1 पर उच्च सटीकता प्राप्त कर सकता है लेकिन गंभीरता 5 पर काफी गिर सकता है। बेंचमार्क आमतौर पर सभी दूषणों और गंभीरताओं में औसत त्रुटि दर की रिपोर्ट करता है, जिसे अक्सर 'मीन करप्शन एरर' (mCE) कहा जाता है। यह मीट्रिक त्रुटि को एक बेसलाइन मॉडल (आमतौर पर एक मानक ResNet) के खिलाफ सामान्यीकृत करता है ताकि तुलनात्मक मजबूती स्कोर प्रदान किया जा सके।

मजबूती अनुसंधान में उपयोग

CIFAR-10-C व्यापक रूप से Machine learning और Deep learning समुदायों में नई आर्किटेक्चर और प्रशिक्षण तकनीकों को बेंचमार्क करने के लिए उपयोग किया जाता है। शोधकर्ता अक्सर साफ CIFAR-10 डेटा पर प्रशिक्षित मॉडल का मूल्यांकन करते हैं और फिर उन्हें CIFAR-10-C पर परीक्षण करते हैं ताकि यह देखा जा सके कि वे कितनी अच्छी तरह सामान्यीकरण करते हैं। यह मूल CIFAR-10 परीक्षण सटीकता के लिए एक मानक पूरक बन गया है, क्योंकि उच्च साफ सटीकता दूषणों के प्रति मजबूती की गारंटी नहीं देती।

कई मजबूती-बढ़ाने वाले तरीकों को इस डेटासेट का उपयोग करके मान्य किया गया है। उदाहरण के लिए, Data Augmentation तकनीकें जो प्रशिक्षण के दौरान दूषणों का अनुकरण करती हैं, जैसे AugMix या CutMix, ने CIFAR-10-C पर महत्वपूर्ण सुधार दिखाए हैं। इसके अतिरिक्त, Batch Normalization और अन्य नियमितीकरण विधियों का इस संदर्भ में अध्ययन किया गया है। डेटासेट का उपयोग Neural network आर्किटेक्चर की मजबूती का मूल्यांकन करने के लिए भी किया गया है, जिसमें Residual Network (ResNet) विविधताएँ और हाल के ट्रांसफॉर्मर-आधारित मॉडल शामिल हैं।

अन्य बेंचमार्क से संबंध

CIFAR-10-C उसी लेखकों द्वारा बनाए गए दूषण बेंचमार्क के परिवार का हिस्सा है, जिसमें CIFAR-100-C (100-कक्षा संस्करण के लिए) और ImageNet-C (बड़े ImageNet डेटासेट के लिए) शामिल हैं। ये बेंचमार्क समान दूषण प्रकार और गंभीरता स्तर साझा करते हैं, जिससे क्रॉस-डेटासेट तुलना संभव होती है। अंतर्निहित विचार यह है कि मजबूती का परीक्षण विभिन्न डोमेन और पैमानों पर किया जाना चाहिए।

यह डेटासेट वितरण बदलाव (distribution shift) की अवधारणा से भी संबंधित है, जो Artificial intelligence में एक केंद्रीय चुनौती है। जबकि CIFAR-10-C सिंथेटिक दूषणों पर केंद्रित है, अन्य बेंचमार्क जैसे CIFAR-10.1 (एक प्राकृतिक रूप से स्थानांतरित संस्करण) या CIFAR-10-R (वास्तविक दुनिया की विकृतियों के साथ) विभिन्न प्रकार के वितरण बदलाव का परीक्षण करके इसे पूरक करते हैं। साथ में, वे मॉडल मजबूती की अधिक संपूर्ण तस्वीर प्रदान करते हैं।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, CIFAR-10-C की सीमाएँ हैं। दूषण सिंथेटिक हैं और वास्तविक दुनिया की विकृतियों की विविधता को पूरी तरह से पकड़ नहीं सकते। कुछ शोधकर्ताओं का तर्क है कि मॉडल विशिष्ट दूषण प्रकारों के लिए अति-अनुकूलित हो सकते हैं, बेंचमार्क पर उच्च मजबूती प्राप्त करते हैं लेकिन अदृश्य दूषणों पर विफल होते हैं। इससे 'दूषण-अज्ञेयवादी' प्रशिक्षण विधियों का विकास हुआ है और अधिक चुनौतीपूर्ण बेंचमार्क जैसे CIFAR-10-CBAR (जो दूषणों को प्रतिकूल विक्षोभों के साथ जोड़ता है) की शुरुआत हुई है।

एक और आलोचना यह है कि डेटासेट अपेक्षाकृत छोटा है (प्रति दूषण 10,000 छवियाँ), जिससे परिणामों में उच्च भिन्नता हो सकती है। हालांकि, इसकी सरलता और कम कम्प्यूटेशनल लागत इसे मजबूती अनुसंधान के लिए एक सुलभ प्रारंभिक बिंदु बनाती है, विशेष रूप से शैक्षणिक प्रयोगशालाओं और छोटे संगठनों के लिए। 2020 के दशक की शुरुआत तक, CIFAR-10-C क्षेत्र में सबसे अधिक उद्धृत मजबूती बेंचमार्क में से एक बना हुआ है।

व्यावहारिक विचार

CIFAR-10-C का उपयोग करते समय, आधिकारिक मूल्यांकन प्रोटोकॉल का पालन करना महत्वपूर्ण है। डेटासेट आमतौर पर मूल रिपॉजिटरी से डाउनलोड किया जाता है, और छवियों को उत्पन्न करने के लिए दूषण एल्गोरिदम प्रदान किए जाते हैं। मॉडल को केवल साफ CIFAR-10 प्रशिक्षण डेटा पर प्रशिक्षित किया जाना चाहिए (या ऐसे संवर्धन के साथ जिसमें परीक्षण दूषण शामिल न हों) ताकि निष्पक्ष मूल्यांकन सुनिश्चित हो सके। मानक मीट्रिक सभी 75 स्थितियों में औसत त्रुटि दर है, लेकिन शोधकर्ता अक्सर विशिष्ट कमजोरियों की पहचान करने के लिए प्रति-दूषण परिणामों की रिपोर्ट करते हैं।

चिकित्सकों के लिए, CIFAR-10-C उन वातावरणों में तैनाती से पहले मॉडल का तनाव-परीक्षण करने के लिए एक मूल्यवान उपकरण के रूप में कार्य करता है जहाँ छवि गुणवत्ता भिन्न हो सकती है। इसका उपयोग स्वायत्त ड्राइविंग, चिकित्सा इमेजिंग, और अन्य सुरक्षा-महत्वपूर्ण अनुप्रयोगों पर अध्ययन में किया गया है, जहाँ शोर और धुंधलापन के प्रति मजबूती आवश्यक है। बेंचमार्क ने PyTorch और TensorFlow जैसे फ्रेमवर्क में मजबूती टूलकिट और लाइब्रेरी के विकास को भी प्रभावित किया है।

संक्षेप में, CIFAR-10-C विज़न मॉडल की मजबूती का मूल्यांकन और सुधार करने के लिए एक मौलिक बेंचमार्क है। इसके व्यवस्थित दूषण और गंभीरता स्तर सामान्य छवि विकृतियों को संभालने की क्षमता को मापने का एक स्पष्ट, पुनरुत्पादनीय तरीका प्रदान करते हैं, जिससे यह Artificial intelligence अनुसंधान समुदाय में एक आवश्यक संसाधन बन जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·computer-vision·robustness·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास