ग्रेडिएंट-वेटेड क्लास एक्टिवेशन मैपिंग (Grad-CAM) Deep learning में एक तकनीक है जो कन्वोल्यूशनल न्यूरल नेटवर्क के निर्णयों को अधिक व्याख्येय बनाने के लिए उपयोग की जाती है। यह एक मोटा, हीटमैप-जैसा विज़ुअलाइज़ेशन उत्पन्न करता है जो इनपुट छवि के उन क्षेत्रों को उजागर करता है जो किसी विशेष भविष्यवाणी के लिए सबसे अधिक प्रभावशाली होते हैं। पहले के क्लास एक्टिवेशन मैपिंग विधियों के विपरीत, जिन्हें एक विशिष्ट नेटवर्क आर्किटेक्चर की आवश्यकता होती थी, Grad-CAM बिना आर्किटेक्चरल परिवर्तन या पुनः प्रशिक्षण के CNN-आधारित मॉडल की व्यापक श्रेणी के साथ काम करता है। इसे 2017 में रामप्रसाद आर. सेल्वराजू, माइकल कोग्सवेल, अभिषेक दास, रामकृष्ण वेदांतम, देवी पारिख और ध्रुव बत्रा द्वारा पेश किया गया था, और IEEE इंटरनेशनल कॉन्फ्रेंस ऑन कंप्यूटर विज़न (ICCV) में प्रकाशित किया गया था। यह विधि मॉडल डिबगिंग, वैज्ञानिक विश्लेषण और AI प्रणालियों में विश्वास निर्माण के लिए एक मानक उपकरण बन गई है।
Grad-CAM का मूल विचार अंतिम कन्वोल्यूशनल परत के फीचर मैप्स के संबंध में लक्ष्य वर्ग स्कोर के ग्रेडिएंट्स का उपयोग करना है। ये ग्रेडिएंट्स इंगित करते हैं कि फीचर मैप में प्रत्येक स्थानिक स्थान वर्ग स्कोर में कितना योगदान देता है। स्थानिक आयामों पर ग्रेडिएंट्स का वैश्विक-औसत-पूलिंग करके, Grad-CAM प्रत्येक फीचर मैप चैनल के लिए महत्व भार प्राप्त करता है। फीचर मैप्स का भारित संयोजन फिर केवल सकारात्मक योगदान रखने के लिए ReLU सक्रियण से गुजरता है, जिससे एक मोटा स्थानीकरण मानचित्र उत्पन्न होता है। यह मानचित्र इनपुट छवि आकार तक अपसैंपल किया जाता है और यह दिखाने के लिए ओवरले किया जाता है कि मॉडल 'कहाँ देखा'।
Grad-CAM पहले के दृष्टिकोणों को सामान्यीकृत करता है। मूल क्लास एक्टिवेशन मैपिंग (CAM) विधि, जिसे 2016 में झोउ एट अल. द्वारा पेश किया गया था, के लिए एक वैश्विक औसत पूलिंग परत के बाद एक पूरी तरह से जुड़ी परत की आवश्यकता थी, और पूरी तरह से जुड़ी परत के भार चैनल महत्व के रूप में कार्य करते थे। Grad-CAM ग्रेडिएंट्स का उपयोग करके इस बाधा को हटा देता है, जिससे यह कन्वोल्यूशनल परत वाले किसी भी CNN पर लागू हो जाता है। इस लचीलेपन ने Grad-CAM को कंप्यूटर विज़न अनुसंधान और अनुप्रयोगों में व्यापक रूप से अपनाया है।
गणितीय सूत्रीकरण
किसी दिए गए छवि और रुचि के वर्ग c के लिए, मान लें कि y^c सॉफ्टमैक्स परत से पहले वर्ग c के लिए कच्चा स्कोर (लॉगिट) है। मान लें कि A^k अंतिम कन्वोल्यूशनल परत का k-वां फीचर मैप है, जिसके स्थानिक आयाम H x W हैं। चैनल k के लिए महत्व भार alpha_k^c की गणना y^c के A^k के संबंध में ग्रेडिएंट के वैश्विक औसत पूलिंग द्वारा की जाती है:
alpha_k^c = (1/Z) * sum_i sum_j (dy^c / dA^k_{ij})
जहाँ Z = H * W स्थानिक स्थानों की संख्या है। Grad-CAM मानचित्र L^c तब फीचर मैप्स का एक भारित संयोजन है, जिसके बाद ReLU होता है:
L^c = ReLU( sum_k alpha_k^c * A^k )
ReLU यह सुनिश्चित करता है कि केवल वे फीचर्स जिनका वर्ग स्कोर पर सकारात्मक प्रभाव है, उजागर हों। परिणामी मानचित्र को बाइलिनियर इंटरपोलेशन का उपयोग करके इनपुट छवि रिज़ॉल्यूशन तक अपसैंपल किया जाता है और विज़ुअलाइज़ेशन के लिए [0,1] सीमा में सामान्यीकृत किया जाता है।
अन्य विज़ुअलाइज़ेशन विधियों के साथ तुलना
Grad-CAM एट्रिब्यूशन विधियों के एक परिवार से संबंधित है जो इनपुट क्षेत्रों को उजागर करके मॉडल भविष्यवाणियों की व्याख्या करते हैं। अन्य विधियों में सैलिएंसी मैप्स (सिमोनियन एट अल., 2013) शामिल हैं, जो इनपुट छवि के संबंध में वर्ग स्कोर के ग्रेडिएंट का उपयोग करते हैं; गाइडेड बैकप्रोपेगेशन (स्प्रिंगेनबर्ग एट अल., 2014), जो तेज विज़ुअलाइज़ेशन उत्पन्न करने के लिए बैकप्रोपेगेशन को संशोधित करता है; और इंटीग्रेटेड ग्रेडिएंट्स (सुंदरराजन एट अल., 2017), जो एक बेसलाइन से एक पथ के साथ ग्रेडिएंट्स को संचित करता है। Grad-CAM वर्ग-विभेदक है और मोटे मानचित्र उत्पन्न करता है, जबकि गाइडेड बैकप्रोपेगेशन बारीक-दानेदार लेकिन वर्ग-अज्ञेय मानचित्र उत्पन्न करता है। दोनों के सर्वोत्तम को संयोजित करने के लिए, लेखकों ने Grad-CAM++ पेश किया, जो फीचर मैप्स को भार देने के लिए उच्च-क्रम ग्रेडिएंट्स का उपयोग करता है, और एक गाइडेड Grad-CAM संस्करण भी प्रस्तावित किया जो गाइडेड बैकप्रोपेगेशन को Grad-CAM मानचित्रों के साथ तत्व-वार गुणा करता है, जिससे उच्च-रिज़ॉल्यूशन, वर्ग-विभेदक विज़ुअलाइज़ेशन प्राप्त होते हैं।
कंप्यूटर विज़न में अनुप्रयोग
Grad-CAM कई डोमेन में लागू किया गया है। चिकित्सा इमेजिंग में, यह रेडियोलॉजिस्टों को यह समझने में मदद करता है कि मॉडल एक्स-रे, MRI या CT स्कैन में घाव या असामान्यता को क्यों चिह्नित करता है। उदाहरण के लिए, छाती एक्स-रे में निमोनिया का पता लगाने के लिए प्रशिक्षित एक मॉडल को यह जांच कर सत्यापित किया जा सकता है कि उजागर क्षेत्र फेफड़ों की अपारदर्शिता के अनुरूप हैं या नहीं। स्वायत्त ड्राइविंग में, Grad-CAM दिखा सकता है कि मॉडल लेन का पता लगाने या बाधा पहचान के लिए सड़क दृश्य के किन हिस्सों का उपयोग करता है, जिससे सुरक्षा सत्यापन में सहायता मिलती है। बारीक-दानेदार वर्गीकरण में, जैसे पक्षी प्रजातियाँ या कार मॉडल, Grad-CAM उन विभेदक विशेषताओं (जैसे चोंच का आकार या हेडलाइट्स) को प्रकट करता है जो भविष्यवाणियों को संचालित करती हैं। इसका उपयोग रिमोट सेंसिंग, कृषि और औद्योगिक निरीक्षण में भी किया गया है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, Grad-CAM की सीमाएँ हैं। स्थानीकरण मानचित्र मोटे होते हैं, आमतौर पर अंतिम कन्वोल्यूशनल परत के रिज़ॉल्यूशन पर, जो बारीक विवरणों को खो सकते हैं। विधि लक्ष्य परत की पसंद के प्रति संवेदनशील है; पहले की परतों का उपयोग करने से बारीक लेकिन कम वर्ग-विभेदक मानचित्र मिलते हैं। Grad-CAM भ्रामक विज़ुअलाइज़ेशन उत्पन्न कर सकता है जब मॉडल नकारात्मक साक्ष्य (जैसे, किसी विशेषता की अनुपस्थिति) का उपयोग करता है या जब ग्रेडिएंट्स शोरग्रस्त होते हैं। कुछ अध्ययनों ने दिखाया है कि Grad-CAM मानचित्रों को भविष्यवाणी बदले बिना प्रतिकूल गड़बड़ी द्वारा हेरफेर किया जा सकता है, जिससे व्याख्येयता के लिए उनकी विश्वसनीयता पर चिंताएँ बढ़ती हैं। इसके अतिरिक्त, विधि मानती है कि मॉडल का निर्णय स्थानिक विशेषताओं पर आधारित है, जो सभी आर्किटेक्चर के लिए सही नहीं हो सकता है।
विस्तार और प्रकार
Grad-CAM की सीमाओं को संबोधित करने के लिए कई विस्तार प्रस्तावित किए गए हैं। Grad-CAM++ (चट्टोपाध्याय एट अल., 2018) अधिक सटीक मानचित्र उत्पन्न करने के लिए सकारात्मक आंशिक व्युत्पन्नों का एक भारित संयोजन उपयोग करता है, विशेष रूप से कई वस्तु उदाहरणों के लिए। Score-CAM (वांग एट अल., 2020) भार के रूप में आत्मविश्वास में वृद्धि का उपयोग करके ग्रेडिएंट्स को समाप्त करता है, जिससे शोर कम होता है। Ablation-CAM (देसाई और रामास्वामी, 2020) चैनल महत्व की गणना के लिए एब्लेशन अध्ययन का उपयोग करता है। Layer-CAM (जियांग एट अल., 2021) उच्च-रिज़ॉल्यूशन मानचित्र उत्पन्न करने के लिए ग्रेडिएंट-आधारित और ग्रेडिएंट-मुक्त विधियों को जोड़ता है। इन प्रकारों को कमजोर-पर्यवेक्षित वस्तु स्थानीकरण के लिए PASCAL VOC और COCO जैसे डेटासेट पर ब