अंग्रेज़ी से अनुवादित

क्लास एक्टिवेशन मैपिंग डीप लर्निंग में एक तकनीक है जो विज़ुअल हीटमैप उत्पन्न करती है, जो न्यूरल नेटवर्क के वर्गीकरण निर्णय के लिए सबसे प्रभावशाली छवि क्षेत्रों को उजागर करती है, जिससे मॉडल की व्याख्यात्मकता में सहायता मिलती है। इसे 2016 में बोलेई झोउ एट अल. द्वारा पेश किया गया था।

क्लास एक्टिवेशन मैपिंग (CAM) डीप लर्निंग में एक तकनीक है जो कन्वोल्यूशनल न्यूरल नेटवर्क की भविष्यवाणियों के लिए दृश्य स्पष्टीकरण उत्पन्न करती है। यह एक मोटा हीटमैप तैयार करता है जो इनपुट छवि के उन क्षेत्रों को उजागर करता है जो किसी विशिष्ट आउटपुट क्लास के लिए सबसे अधिक प्रासंगिक होते हैं, जिससे मॉडल व्याख्यात्मकता का एक रूप मिलता है। यह विधि 2016 में बोलेई झोउ और सहकर्मियों के एक शोधपत्र में प्रस्तुत की गई थी, और तब से यह छवि वर्गीकरण मॉडल को समझने और डीबग करने के लिए एक मौलिक उपकरण बन गई है।

CAM के पीछे मुख्य विचार कन्वोल्यूशनल नेटवर्क के फीचर मैप्स में संरक्षित स्थानिक जानकारी का लाभ उठाना है। एक विशिष्ट वर्गीकरण आर्किटेक्चर में, अंतिम कन्वोल्यूशनल परत फीचर मैप्स का एक सेट उत्पन्न करती है, जिनमें से प्रत्येक अलग-अलग दृश्य पैटर्न को कैप्चर करता है। इन फीचर मैप्स को किसी विशेष क्लास के लिए उनके महत्व के अनुसार भारित करके और फिर उन्हें जोड़कर, एक एकल स्थानिक मैप प्राप्त किया जा सकता है जो इंगित करता है कि मॉडल अपना निर्णय लेने के लिए कहाँ "देखता" है। इस मैप को आमतौर पर इनपुट छवि के आकार तक अपसैंपल किया जाता है और हीटमैप के रूप में ओवरले किया जाता है।

ऐतिहासिक संदर्भ और प्रेरणा

2010 के दशक में डीप लर्निंग के उदय ने छवि वर्गीकरण जैसे कार्यों में अभूतपूर्व सटीकता लाई, लेकिन इसने एक "ब्लैक बॉक्स" समस्या भी पेश की: यह अक्सर स्पष्ट नहीं होता था कि मॉडल ने कोई विशेष भविष्यवाणी क्यों की। पारदर्शिता की इस कमी ने चिकित्सा इमेजिंग और स्वायत्त ड्राइविंग जैसे महत्वपूर्ण क्षेत्रों में अपनाने में बाधा उत्पन्न की। CAM को व्याख्यात्मकता की इस आवश्यकता के जवाब में विकसित किया गया था, जो कन्वोल्यूशनल नेटवर्क के तर्क को देखने का एक सरल फिर भी प्रभावी तरीका प्रदान करता है।

CAM से पहले, डिकन्वोल्यूशनल नेटवर्क और ऑक्लूजन संवेदनशीलता जैसी विज़ुअलाइज़ेशन तकनीकें मौजूद थीं, लेकिन वे या तो कम्प्यूटेशनल रूप से महंगी थीं या कम सहज परिणाम प्रदान करती थीं। CAM ने खुद को अलग किया क्योंकि इसमें कोई अतिरिक्त प्रशिक्षण या आर्किटेक्चरल परिवर्तन की आवश्यकता नहीं थी, जब तक कि नेटवर्क अंतिम वर्गीकरण परत से पहले एक ग्लोबल एवरेज पूलिंग परत का उपयोग करता था। यह बाधा मूल विधि की एक प्रमुख सीमा थी, जिसके कारण बाद में कई वेरिएंट विकसित हुए।

तकनीकी तंत्र

मूल CAM कार्यान्वयन उन नेटवर्कों पर लागू होता है जो अंतिम कन्वोल्यूशनल परत के बाद एक ग्लोबल एवरेज पूलिंग (GAP) परत का उपयोग करते हैं। ऐसी आर्किटेक्चर में, अंतिम कन्वोल्यूशनल परत के फीचर मैप्स को प्रत्येक स्थानिक आयाम में औसत किया जाता है, जिससे मानों का एक वेक्टर उत्पन्न होता है। इस वेक्टर को फिर सॉफ्टमैक्स सक्रियण के साथ एक पूर्ण रूप से जुड़ी परत में डाला जाता है ताकि क्लास स्कोर उत्पन्न हो सकें।

किसी दिए गए क्लास c के लिए, k-वें फीचर मैप को क्लास स्कोर से जोड़ने वाला भार w_k^c दर्शाया जाता है। क्लास c के लिए क्लास एक्टिवेशन मैप की गणना फीचर मैप्स A_k के भारित योग के रूप में की जाती है, जिसके बाद केवल सकारात्मक योगदान रखने के लिए ReLU सक्रियण लगाया जाता है:

M_c = ReLU(Σ_k w_k^c * A_k)

यह योग एक 2D स्थानिक मैप उत्पन्न करता है जिसे मूल छवि आकार तक अपसैंपल किया जा सकता है। परिणामी हीटमैप उन क्षेत्रों को उजागर करता है जो वर्गीकरण का दृढ़ता से समर्थन करते हैं, जिसमें चमकीले क्षेत्र उच्च प्रासंगिकता दर्शाते हैं।

GAP का उपयोग महत्वपूर्ण है क्योंकि यह नेटवर्क को ऐसे फीचर मैप्स सीखने के लिए मजबूर करता है जो वैश्विक रूप से विभेदक होते हैं, न कि केवल एक स्थान पर ध्यान केंद्रित करते हैं। यह गुण भारित योग को स्थानीयकरण उपकरण के रूप में सार्थक बनाता है।

वेरिएंट और विस्तार

मूल CAM की सीमाओं को दूर करने के लिए कई विस्तार प्रस्तावित किए गए हैं। एक उल्लेखनीय वेरिएंट Grad-CAM है, जिसे 2017 में रामप्रसाद आर. सेल्वराजू और सहकर्मियों द्वारा पेश किया गया था। Grad-CAM CAM को किसी भी कन्वोल्यूशनल न्यूरल नेटवर्क के लिए सामान्यीकृत करता है, बिना GAP परत की आवश्यकता के। यह भार की गणना फीचर मैप्स के संबंध में क्लास स्कोर के ग्रेडिएंट्स के वैश्विक औसत के रूप में करता है, जो एक अधिक लचीला दृष्टिकोण प्रदान करता है।

एक अन्य विस्तार Grad-CAM++ है, जो सकारात्मक आंशिक व्युत्पन्नों के भारित संयोजन का उपयोग करके स्थानीयकरण सटीकता में सुधार करता है। Score-CAM और Ablation-CAM जैसी अन्य विधियाँ वैकल्पिक भारण योजनाएँ प्रदान करती हैं, जो अक्सर अधिक दृश्य रूप से स्पष्ट हीटमैप उत्पन्न करती हैं। ये वेरिएंट चिकित्सा छवि विश्लेषण जैसे क्षेत्रों में व्यापक रूप से अपनाए गए हैं, जहाँ मॉडल निर्णयों को समझना नैदानिक विश्वास के लिए महत्वपूर्ण है।

अनुप्रयोग और प्रभाव

CAM और इसके व्युत्पन्नों ने कई क्षेत्रों में अनुप्रयोग पाए हैं। चिकित्सा इमेजिंग में, वे रेडियोलॉजिस्टों को यह सत्यापित करने में मदद करते हैं कि निमोनिया या त्वचा कैंसर जैसी बीमारियों का निदान करने वाला मॉडल कलाकृतियों के बजाय नैदानिक रूप से प्रासंगिक विशेषताओं पर ध्यान केंद्रित कर रहा है। स्वायत्त ड्राइविंग में, वे इंजीनियरों को दृश्य के कौन से हिस्से वाहन के निर्णयों को प्रभावित करते हैं, यह दिखाकर धारणा प्रणालियों को डीबग करने में सहायता करते हैं।

व्याख्यात्मकता के अलावा, CAM का उपयोग कमजोर पर्यवेक्षित वस्तु स्थानीयकरण के लिए किया गया है। चूंकि हीटमैप विभेदक क्षेत्रों को उजागर करते हैं, वे महंगे बाउंडिंग बॉक्स एनोटेशन के बिना डिटेक्शन मॉडल को प्रशिक्षित करने के लिए स्यूडो-लेबल के रूप में काम कर सकते हैं। यह अनुप्रयोग विशेष रूप से बड़े पैमाने के डेटासेट में मूल्यवान रहा है जहाँ मैनुअल लेबलिंग अव्यावहारिक है।

इस तकनीक ने Machine learning के अन्य क्षेत्रों में भी शोध को प्रभावित किया है, जिसमें प्राकृतिक भाषा प्रसंस्करण शामिल है, जहाँ ट्रांसफॉर्मर मॉडल को समझाने के लिए समान ध्यान-आधारित विधियों का उपयोग किया जाता है। हालाँकि, CAM सबसे सीधे रूप से कन्वोल्यूशनल आर्किटेक्चर से जुड़ा हुआ है।

सीमाएँ और विचार

अपनी उपयोगिता के बावजूद, CAM की ज्ञात सीमाएँ हैं। हीटमैप मोटे होते हैं और वस्तुओं की सूक्ष्म सीमाओं को कैप्चर नहीं कर सकते हैं। वे केवल सबसे विभेदक भागों को दर्शाते हैं, जो भ्रामक हो सकते हैं यदि मॉडल स्प्यूरियस सहसंबंधों पर निर्भर करता है। उदाहरण के लिए, भेड़ियों और हस्कीज़ को वर्गीकृत करने के लिए प्रशिक्षित एक मॉडल जानवर के बजाय पृष्ठभूमि में बर्फ पर ध्यान केंद्रित कर सकता है, और CAM उस बर्फ को उजागर करेगा।

इसके अलावा, मूल CAM को एक विशिष्ट नेटवर्क आर्किटेक्चर की आवश्यकता होती है, जो इसकी प्रत्यक्ष प्रयोज्यता को सीमित करता है। जबकि Grad-CAM जैसे वेरिएंट इसे संबोधित करते हैं, वे अपनी स्वयं की धारणाएँ पेश करते हैं, जैसे ग्रेडिएंट्स की रैखिकता, जो हमेशा सही नहीं हो सकती है। परिणामस्वरूप, CAM को मॉडल तर्क के निश्चित प्रमाण के बजाय एक खोजपूर्ण उपकरण के रूप में सबसे अच्छा उपयोग किया जाता है।

हाल के वर्षों में, व्याख्यात्मक AI के क्षेत्र में SHAP और LIME जैसी विधियों के साथ विस्तार हुआ है, लेकिन CAM अपनी सरलता और कम्प्यूटेशनल दक्षता के कारण एक लोकप्रिय विकल्प बना हुआ है। यह व्याख्यात्मकता अनुसंधान में एक मानक आधार रेखा बना हुआ है और अक्सर डीप लर्निंग लाइब्रेरीज़ और फ्रेमवर्क में शामिल किया जाता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:interpretability·deep-learning·computer-vision·explainable-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास