इंटीग्रेटेड ग्रेडिएंट्स Machine learning में एक तकनीक है जो Deep learning मॉडलों, विशेष रूप से Neural network की भविष्यवाणियों को समझाने के लिए उपयोग की जाती है। यह प्रत्येक इनपुट फीचर के लिए एक एट्रिब्यूशन मान की गणना करता है, जो दर्शाता है कि उस फीचर ने किसी विशिष्ट भविष्यवाणी के लिए मॉडल के आउटपुट में कितना योगदान दिया। यह विधि 2017 के एक पेपर में मुकुंद सुंदरराजन, अंकुर ताली और क़िक़ी यान द्वारा प्रस्तुत की गई थी, और यह कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण जैसे क्षेत्रों में मॉडलों की व्याख्या के लिए व्यापक रूप से उपयोग की जाती है।
मूल विचार यह मापना है कि मॉडल का आउटपुट कैसे बदलता है जब एक इनपुट को एक तटस्थ आधार रेखा (जैसे शून्य वेक्टर या पूरी तरह से काली छवि) से वास्तविक इनपुट तक अंतर्वेशित किया जाता है। इस सीधी-रेखा पथ के साथ इनपुट के संबंध में आउटपुट के ग्रेडिएंट्स को संचित करके, इंटीग्रेटेड ग्रेडिएंट्स प्रति फीचर एक एकल, सुसंगत एट्रिब्यूशन स्कोर प्रदान करता है। यह दृष्टिकोण सरल ग्रेडिएंट-आधारित विधियों से खुद को अलग करता है, जो संतृप्ति समस्याओं से ग्रस्त हो सकती हैं जहां ग्रेडिएंट उन फीचर्स के लिए शून्य हो जाते हैं जो पहले से ही दृढ़ता से सक्रिय हैं।
स्वयंसिद्ध आधार
इंटीग्रेटेड ग्रेडिएंट्स को दो प्रमुख स्वयंसिद्धों को संतुष्ट करने के लिए डिज़ाइन किया गया था जो किसी भी एट्रिब्यूशन विधि के लिए वांछनीय माने जाते हैं। पहला है संवेदनशीलता, जो बताता है कि यदि कोई फीचर आधार रेखा और इनपुट के बीच भिन्न है, और उस फीचर को अकेले बदलने से मॉडल का आउटपुट बदलता है, तो उस फीचर को गैर-शून्य एट्रिब्यूशन मिलना चाहिए। दूसरा है कार्यान्वयन अपरिवर्तनशीलता, जिसके लिए आवश्यक है कि दो कार्यात्मक रूप से समतुल्य मॉडल (यानी, मॉडल जो सभी इनपुट के लिए समान आउटपुट उत्पन्न करते हैं, भले ही उनकी आंतरिक गणना भिन्न हो) समान एट्रिब्यूशन उत्पन्न करें। यह गुण महत्वपूर्ण है क्योंकि कई तंत्रिका नेटवर्क आर्किटेक्चर को कई तरीकों से लागू किया जा सकता है, और उपयोगकर्ता ऐसे स्पष्टीकरण चाहते हैं जो मॉडल के व्यवहार से जुड़े हों न कि उसके विशिष्ट कोड से।
एक तीसरा स्वयंसिद्ध, पूर्णता, भी संतुष्ट है: सभी एट्रिब्यूशन का योग इनपुट पर मॉडल के आउटपुट और आधार रेखा पर उसके आउटपुट के बीच के अंतर के बराबर है। यह एक उपयोगी सत्यापन प्रदान करता है और एट्रिब्यूशन को आउटपुट परिवर्तन में योगदान के रूप में सीधे व्याख्या योग्य बनाता है।
गणितीय परिभाषा
एक मॉडल \(f\) (आमतौर पर एक तंत्रिका नेटवर्क) के लिए इनपुट \(x \in \mathbb{R}^n\) और आधार रेखा \(x'\) के साथ, \(i\)-वें फीचर के लिए इंटीग्रेटेड ग्रेडिएंट को इस प्रकार परिभाषित किया गया है:
\[ IG_i(x) = (x_i - x'_i) \times \int_{\alpha=0}^{1} \frac{\partial f(x' + \alpha(x - x'))}{\partial x_i} \, d\alpha \]
व्यवहार में, अभिन्न को पथ के साथ \(m\) समान रूप से दूरी वाले बिंदुओं पर एक असतत योग द्वारा अनुमानित किया जाता है, आमतौर पर \(m\) 20 से 300 के बीच उपयोग किया जाता है। आधार रेखा का चयन महत्वपूर्ण है; सामान्य आधार रेखाओं में शून्य वेक्टर, प्रशिक्षण डेटासेट का माध्य, या इनपुट का धुंधला संस्करण शामिल है। पाठ मॉडल के लिए, आधार रेखा एक सभी-शून्य एम्बेडिंग वेक्टर हो सकती है।
अन्य एट्रिब्यूशन विधियों के साथ तुलना
इंटीग्रेटेड ग्रेडिएंट्स से पहले, सामान्य एट्रिब्यूशन तकनीकों में ग्रेडिएंट संतृप्ति (इनपुट पर कच्चा ग्रेडिएंट) और अवरोधन-आधारित विधियां (इनपुट के हिस्सों को बाधित करना और आउटपुट परिवर्तनों को मापना) शामिल थीं। कच्चे ग्रेडिएंट अक्सर विफल हो जाते हैं क्योंकि वे उन फीचर्स के लिए लगभग शून्य हो सकते हैं जो महत्वपूर्ण हैं लेकिन पहले से ही सिग्मॉइड या टैनह जैसे सक्रियण फ़ंक्शन के संतृप्त क्षेत्र में हैं। अवरोधन विधियां कम्प्यूटेशनल रूप से महंगी हैं और अवरोधन के चयन के प्रति संवेदनशील हो सकती हैं। इंटीग्रेटेड ग्रेडिएंट्स पूरे पथ पर ग्रेडिएंट्स को संचित करके संतृप्ति समस्या को संबोधित करता है, और यह कम्प्यूटेशनल रूप से कुशल है क्योंकि इसमें मानक बैकप्रोपेगेशन के समान केवल कुछ आगे और पीछे के पास की आवश्यकता होती है।
एक अन्य लोकप्रिय विधि, SHAP (SHapley Additive exPlanations), गेम थ्योरी पर आधारित है और विभिन्न सैद्धांतिक गारंटी प्रदान करती है, लेकिन यह सटीक रूप से गणना करने के लिए अधिक महंगी हो सकती है। इंटीग्रेटेड ग्रेडिएंट्स को अक्सर इसकी सादगी और गति के लिए पसंद किया जाता है, विशेष रूप से बड़े मॉडलों के लिए।
प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग
Natural language processing कार्यों में, इंटीग्रेटेड ग्रेडिएंट्स का उपयोग अक्सर Transformer (architecture)-आधारित मॉडलों की भविष्यवाणियों को समझाने के लिए किया जाता है, जिसमें Large language model शामिल हैं। उदाहरण के लिए, एक भावना वर्गीकरण मॉडल को देखते हुए, विधि उजागर कर सकती है कि कौन से शब्द वाक्य में भविष्यवाणी को सकारात्मक या नकारात्मक की ओर सबसे दृढ़ता से धकेलते हैं। यह प्रत्येक टोकन के एम्बेडिंग को एक फीचर के रूप में मानकर और एम्बेडिंग आयामों पर एट्रिब्यूशन की गणना करके, फिर उन्हें प्रति टोकन एकत्रित करके किया जाता है।
शोधकर्ताओं ने मॉडलों को डीबग करने, स्प्यूरियस सहसंबंधों की पहचान करने और यह सत्यापित करने के लिए इंटीग्रेटेड ग्रेडिएंट्स का उपयोग किया है कि मॉडल प्रासंगिक जानकारी पर ध्यान दे रहे हैं। उदाहरण के लिए, प्रश्न-उत्तर प्रणालियों में, एट्रिब्यूशन प्रकट कर सकते हैं कि क्या मॉडल मार्ग के सही हिस्से पर निर्भर करता है या असंबंधित संकेतों पर। यह विधि मशीन अनुवाद जैसे कार्यों के लिए Sequence-to-Sequence (Seq2Seq) मॉडलों पर भी लागू की गई है, जहां यह दिखा सकती है कि कौन से स्रोत शब्द प्रत्येक उत्पन्न लक्ष्य शब्द को प्रभावित करते हैं।
कंप्यूटर विज़न में अनुप्रयोग
कंप्यूटर विज़न में, इंटीग्रेटेड ग्रेडिएंट्स सैलिएंसी मानचित्र उत्पन्न करते हैं जो मॉडल के वर्गीकरण निर्णय के लिए सबसे अधिक जिम्मेदार पिक्सेल या छवि क्षेत्रों को उजागर करते हैं। ImageNet पर प्रशिक्षित मॉडल के लिए, एक कुत्ते की छवि के लिए एट्रिब्यूशन मानचित्र कुत्ते के चेहरे और शरीर को उजागर कर सकता है जबकि पृष्ठभूमि को अनदेखा कर सकता है। इन मानचित्रों को अक्सर मूल छवि पर ओवरले किए गए हीटमैप के रूप में देखा जाता है।
इस विधि का उपयोग Residual Network (ResNet) आर्किटेक्चर और अन्य गहरे मॉडलों का विश्लेषण करने के लिए किया गया है, जिससे शोधकर्ताओं को यह समझने में मदद मिलती है कि परतों में फीचर्स कैसे संयुक्त होते हैं। यह चिकित्सा इमेजिंग में भी एक सामान्य उपकरण है, जहां व्याख्यात्मकता महत्वपूर्ण है; उदाहरण के लिए, एट्रिब्यूशन दिखा सकते हैं कि रेडियोलॉजी स्कैन के कौन से हिस्से ने निदान को प्रभावित किया, जिससे चिकित्सकों को मॉडल निर्णयों को सत्यापित करने में सहायता मिलती है।
विस्तार और विविधताएं
मूल इंटीग्रेटेड ग्रेडिएंट्स के कई विस्तार प्रस्तावित किए गए हैं। अपेक्षित इंटीग्रेटेड ग्रेडिएंट्स एक वितरण से नमूना लिए गए कई आधार रेखाओं पर औसत करते हैं, जो आधार रेखा चयन के प्रति संवेदनशीलता को कम कर सकते हैं। इंटीग्रेटेड हेसियन दूसरे-क्रम डेरिवेटिव के विचार का विस्तार करते हैं, जो फीचर इंटरैक्शन के बारे में जानकारी प्रदान करते हैं। एक अन्य संस्करण, DeepLIFT, एक संबंधित विधि है जो एक अलग बैकप्रोपेगेशन नियम का उपयोग करती है लेकिन संवेदनशीलता स्वयंसिद्ध को संतुष्ट करने के लक्ष्य को साझा करती है।
पाठ टोकन जैसे असतत इनपुट वाले मॉडलों के लिए, चिकित्सक अक्सर एम्बेडिंग परत पर एट्रिब्यूशन की गणना करते हैं और फिर आयामों में एकत्रित करते हैं। कुछ कार्यों ने इंटीग्रेटेड ग्रेडिएंट्स को ग्राफ़ जैसे संरचित डेटा को संभालने के लिए भी अनुकूलित किया है, जहां पथ नोड या किनारे फीचर्स पर परिभाषित किया गया है।
व्यावहारिक विचार
चरणों की संख्या \(m\) चुनने में सटीकता और गणना के बीच एक समझौता शामिल है। बहुत कम चरण शोर अनुमानों का कारण बन सकते हैं, जबकि बहुत अधिक रनटाइम बढ़ाते हैं। एक सामान्य डिफ़ॉल्ट \(m = 50\) या \(m = 100\) है। आधार रेखा का चयन भी महत्वपूर्ण है; छवियों के लिए, एक काली छवि (सभी शून्य) मानक है, लेकिन सामान्यीकृत इनपुट के साथ प्रशिक्षित मॉडलों के लिए, माध्य पिक्सेल मान अधिक उपयुक्त हो सकता है। पाठ के लिए, शून्य एम्बेडिंग वेक्टर का उपयोग विशिष्ट है, हालांकि कुछ अध्ययन पैडिंग टोकन के एम्बेडिंग जैसे विशेष टोकन का उपयोग करने का सुझाव देते हैं।
एट्रिब्यूशन नकारात्मक हो सकते हैं, यह दर्शाता है कि एक फीचर भविष्यवाणी को लक्ष्य वर्ग से दूर धकेलता है। पूर्ण मान लेना या सकारात्मक और नकारात्मक योगदान को अलग-अलग देखना आम है। पूर्णता स्वयंसिद्ध सुनिश्चित करता है कि एट्रिब्यूशन का योग आउटपुट अंतर के बराबर है, जिसका उपयोग कार्यान्वयन को सत्यापित करने के लिए किया जा सकता है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, इंटीग्रेटेड ग्रेडिएंट्स की सीमाएं हैं। आधार रेखा का चयन परिणामों को महत्वपूर्ण रूप से प्रभावित कर सकता है, और इसे चुनने के लिए कोई सार्वभौमिक रूप से स्वीकृत नियम नहीं है। विधि एक सीधी-रेखा पथ मानती है, जो मॉडल की वास्तविक निर्णय सीमा को प्रतिबिंबित नहीं कर सकती है। कुछ अध्ययनों ने दिखाया है कि एट्रिब्यूशन इनपुट में छोटे अवरोधों के प्रति संवेदनशील हो सकते हैं, जो मजबूती के बारे में प्रश्न उठाते हैं। इसके अतिरिक्त, बहुत गहरे मॉडलों के लिए, अभिन्न अनुमान को अभिसरण करने के लिए कई चरणों की आवश्यकता हो सकती है, जिससे कम्प्यूटेशनल लागत बढ़ जाती है।
एक और आलोचना यह है कि एट्रिब्यूशन स्थानीय हैं और मॉडल व्यवहार की वैश्विक समझ प्रदान नहीं करते हैं। वे एक एकल भविष्यवाणी की व्याख्या करते हैं लेकिन मॉडल के समग्र तर्क की नहीं। शोधकर्ताओं ने गहरी अंतर्दृष्टि प्राप्त करने के लिए इंटीग्रेटेड ग्रेडिएंट्स को अन्य तकनीकों, जैसे Model Pruning या Data Augmentation के साथ संयोजित करने का प्रस्ताव दिया है।
अन्य व्याख्यात्मकता उपकरणों के साथ संबंध
इंटीग्रेटेड ग्रेडिएंट्स व्याख्यात्मकता विधियों के व्यापक पारिस्थितिकी तंत्र का हिस्सा है। यह कई लोकप्रिय पुस्तकालयों में लागू किया गया है, जिसमें PyTorch के लिए Captum पुस्तकालय और AI Explainability 360 टूलकिट शामिल हैं। ये पुस्तकालय विभिन्न मॉडल आर्किटेक्चर पर एट्रिब्यूशन की गणना के लिए एपीआई प्रदान करते हैं, जिससे विधि चिकित्सकों के लिए सुलभ हो जाती है। यह विधि Artificial intelligence सुरक्षा और निष्पक्षता पर शोध में भी उपयोग की जाती है, जहां ऑडिटिंग और विनियमन के लिए मॉडल निर्णयों को समझना महत्वपूर्ण है।
Generative AI के संदर्भ में, इंटीग्रेटेड ग्रेडिएंट्स को Stable Diffusion और GPT-शैली मॉडलों के आउटपुट की व्याख्या करने के लिए लागू किया गया है, हालांकि उच्च-आयामी आउटपुट स्थान चुनौतियां पेश करता है। Large language model के लिए, एट्रिब्यूशन शब्दावली या टोकन एम्बेडिंग पर गणना की जा सकती है, जिससे यह पहचानने में मदद मिलती है कि प्रॉम्प्ट के कौन से हिस्से किसी विशेष प्रतिक्रिया को चलाते हैं।
भविष्य की दिशाएं
जैसे-जैसे मॉडल आकार और जटिलता में बढ़ते हैं, कुशल और विश्वसनीय एट्रिब्यूशन विधियों की आवश्यकता बढ़ती है। इंटीग्रेटेड ग्रेडिएंट्स एक मौलिक तकनीक बनी हुई है, लेकिन चल रहे शोध का उद्देश्य इसकी कम्प्यूटेशनल दक्षता में सुधार करना, हाइपरपैरामीटर के प्रति संवेदनशीलता को कम करना और इसे नए मॉडल प्रकारों तक विस्तारित करना है। कारण संबंधी स्पष्टीकरण प्रदान करने वाली विधियों को विकसित करने में भी रुचि है, न कि केवल सहसंबंध, जिसके लिए एट्रिब्यूशन को हस्तक्षेप-आधारित दृष्टिकोणों के साथ एकीकृत करने की आवश्यकता होगी।
कुल मिलाकर, इंटीग्रेटेड ग्रेडिएंट्स मशीन लर्निंग व्याख्यात्मकता टूलबॉक्स में एक मानक उपकरण बन गया है, जिसे इसकी सैद्धांतिक गारंटी और व्यावहारिक उपयोग में आसानी के लिए महत्व दिया जाता है। शिक्षा और उद्योग में इसका अपनाना एआई प्रणालियों में पारदर्शिता की ओर एक व्यापक प्रवृत्ति को दर्शाता है, जो नैतिक विचारों और नियामक आवश्यकताओं दोनों से प्रेरित है।