सैलिएंसी मैप एक दृश्य प्रतिनिधित्व है जो किसी छवि के उन क्षेत्रों को उजागर करता है जो किसी दिए गए कार्य के लिए सबसे अधिक प्रासंगिक हैं, चाहे वह मानव दृश्य ध्यान के लिए हो या मशीन लर्निंग मॉडल के निर्णयों के लिए। कंप्यूटर विज़न में, ऐसे मैप मानव दृश्य प्रणाली या अन्यथा अपारदर्शी मॉडल के लिए प्रत्येक पिक्सेल के महत्व की डिग्री को दर्शाते हैं। उदाहरण के लिए, एक तस्वीर में, दर्शक पहले किले या हल्के बादलों को देख सकता है; उस छवि का सैलिएंसी मैप उन क्षेत्रों को उनकी प्रमुखता दर्शाने के लिए चमकाएगा। जहाँ आई-ट्रैकिंग सैलिएंसी मैप मानव दृष्टि का अनुमान लगाते हैं, वहीं मशीन लर्निंग में ग्रेडिएंट-आधारित सैलिएंसी मैप यह प्रकट करते हैं कि मॉडल भविष्यवाणी करते समय कहाँ ध्यान केंद्रित करता है।
कृत्रिम बुद्धिमत्ता के संदर्भ में, सैलिएंसी मैप व्याख्यात्मक AI में एक केंद्रीय उपकरण बन गए हैं। वे गहरे तंत्रिका नेटवर्क द्वारा निर्णयों तक पहुँचने के तरीके के दृश्य स्पष्टीकरण प्रदान करते हैं, उन इनपुट पिक्सेल या विशेषताओं को उजागर करके जो आउटपुट को सबसे अधिक प्रभावित करते हैं। यह तकनीक छवि वर्गीकरण और वस्तु पहचान के लिए विशेष रूप से सामान्य है, लेकिन यह बाद के ट्रांसफॉर्मर आर्किटेक्चर तक ध्यान मैप के माध्यम से विस्तारित होती है। यह अवधारणा संज्ञानात्मक विज्ञान और मशीन लर्निंग को जोड़ती है, और मानव दृष्टि में इसकी जड़ों ने एल्गोरिथम दृष्टिकोण और मूल्यांकन विधियों दोनों को आकार दिया है।
मानव दृश्य सैलिएंसी
मानव सैलिएंसी मैप उन स्थानों की भविष्यवाणी करने का लक्ष्य रखते हैं जो पहले किसी व्यक्ति का ध्यान आकर्षित करते हैं। V1 सैलिएंसी परिकल्पना के अनुसार, प्राथमिक दृश्य कॉर्टेक्स (V1) सैलिएंसी मैप के लिए जिम्मेदार प्रतीत होता है, जिससे सैलिएंसी एक जैविक रूप से आधारित घटना बन जाती है। मानव सैलिएंसी के कम्प्यूटेशनल मॉडल अक्सर रंग, कंट्रास्ट, किनारों और गति जैसी निम्न-स्तरीय विशेषताओं पर निर्भर करते हैं।
इस क्षेत्र में सबसे सामान्य अनुप्रयोग हैं:
- छवि और वीडियो संपीड़न: मानव आँख किसी फ्रेम में केवल एक छोटे से रुचि क्षेत्र पर ध्यान केंद्रित करती है; सैलिएंसी मैप का उपयोग उस क्षेत्र के बाहर निम्न गुणवत्ता पर एन्कोडिंग की अनुमति देता है, जिससे कथित हानि के बिना फ़ाइल आकार कम हो जाता है।
- छवि और वीडियो गुणवत्ता मूल्यांकन: गुणवत्ता मेट्रिक्स जो सैलिएंट क्षेत्रों में अंतर को अधिक भार देते हैं, व्यक्तिपरक मानव राय के साथ उच्च सहसंबंध प्राप्त करते हैं।
- छवि रीटार्गेटिंग: महत्वपूर्ण सामग्री को संरक्षित करने के लिए गैर-सूचनात्मक क्षेत्रों को विस्तारित या सिकोड़कर छवियों का आकार बदलना, सटीक सैलिएंसी अनुमानों पर निर्भर करता है।
- वस्तु पहचान और पहचान: जटिल एल्गोरिदम को पूरी छवि पर लागू करने के बजाय, उन्हें सबसे सैलिएंट क्षेत्रों पर लागू किया जाता है, जिनमें संभवतः पहचाने जाने वाली वस्तुएँ होती हैं।
क्लासिक अनुमान एल्गोरिदम तीन मुख्य प्रकारों में आते हैं, जैसा कि OpenCV में लागू किया गया है: स्थैतिक सैलिएंसी (छवि विशेषताओं और आँकड़ों पर आधारित), गति सैलिएंसी (ऑप्टिकल फ्लो से गति पर आधारित, जहाँ गतिशील वस्तुएँ सैलिएंट होती हैं), और ऑब्जेक्टनेस (जो संभावित वस्तुओं के चारों ओर बाउंडिंग बॉक्स प्रदान करता है)। एक नई स्थैतिक विधि भी है जिसे दृश्य विरूपण संवेदनशीलता कहा जाता है, जो वास्तविक किनारों (वस्तु आकृति) को बनावट वाले क्षेत्रों की तुलना में अधिक सैलिएंट मानती है; यह किनारों को अलग करने के लिए छोटे ग्रेडिएंट थ्रेशोल्ड, रूपात्मक संचालन और दूरी परिवर्तन का उपयोग करती है।
विभाजन के रूप में सैलिएंसी
सैलिएंसी अनुमान को छवि विभाजन का एक उदाहरण माना जा सकता है। छवि विभाजन एक डिजिटल छवि को कई खंडों या सुपरपिक्सेल में विभाजित करने की प्रक्रिया है। लक्ष्य छवि प्रतिनिधित्व को कुछ सार्थक और विश्लेषण करने में आसान बनाना है, अक्सर हर पिक्सेल को लेबल निर्दिष्ट करके। सैलिएंसी के लिए, विभाजन समस्या द्विआधारी है: प्रत्येक पिक्सेल को या तो अग्रभूमि (सैलिएंट) या पृष्ठभूमि के भाग के रूप में लेबल करें। आउटपुट अक्सर एक द्विआधारी मास्क होता है जहाँ सैलिएंट वस्तु सफेद और बाकी काला होता है, या एक सतत हीटमैप होता है जहाँ तीव्रता सैलिएंसी को इंगित करती है।
यह संबंध विशेष रूप से महत्वपूर्ण है क्योंकि विभाजन तकनीक और हानि फ़ंक्शन पुनः उपयोग किए जा सकते हैं, और सैलिएंट क्षेत्रों की समग्र समझ छवि विभाजन जैसे कार्यों में मदद करती है। हालाँकि, सैलिएंसी मैप आमतौर पर कठोर सीमाओं के बजाय नरम या श्रेणीबद्ध महत्व प्रदान करते हैं।
गहन शिक्षण के लिए ग्रेडिएंट-आधारित सैलिएंसी
जब तंत्रिका नेटवर्क पर लागू किया जाता है, तो सैलिएंसी मैप अक्सर इनपुट के संबंध में वर्ग स्कोर के ग्रेडिएंट को लेकर गणना की जाती है। इसे 2010 के दशक में कन्वोल्यूशनल नेटवर्क के लिए विकसित किया गया था, और पहले प्रमुख दृष्टिकोणों ने सरल ग्रेडिएंट का उपयोग किया: प्रत्येक पिक्सेल के लिए, कोई गणना करता है कि आउटपुट स्कोर उस पिक्सेल में छोटे बदलाव के प्रति कितना संवेदनशील है। ग्रेडिएंट का परिमाण सापेक्ष महत्व को इंगित करता है।
अधिक परिष्कृत तकनीकें निम्नलिखित हैं:
- एकीकृत ग्रेडिएंट: यह बेसलाइन इनपुट से वास्तविक इनपुट तक एक पथ के साथ ग्रेडिएंट को जोड़कर महत्व निर्दिष्ट करता है, संतृप्ति को ध्यान में रखने और आरोपण सुनिश्चित करने के लिए यदि भविष्यवाणी स्कोर केवल मध्यवर्ती बिंदुओं पर बदलते हैं।
- क्लास एक्टिवेशन मैपिंग (CAM): यह अंतिम कन्वोल्यूशनल परत से फीचर मैप, लक्ष्य वर्ग के लिए इसके भार का उपयोग करता है, और एक मोटा सैलिएंसी मैप उत्पन्न करता है, आमतौर पर एक स्थानिक रिज़ॉल्यूशन में जिसे अपसैंपल किया जाता है।
- ग्रेडिएंट-भारित क्लास एक्टिवेशन मैपिंग (Grad-CAM): CAM का एक विस्तार जो सक्रियणों को भार देने के लिए फीचर मैप के संबंध में वर्ग स्कोर के ग्रेडिएंट का उपयोग करता है।
ये विधियाँ कन्वोल्यूशनल तंत्रिका नेटवर्क (जैसे, Residual Network (ResNet)) के लिए विशिष्ट हैं, लेकिन उन्हें ध्यान तंत्र के माध्यम से Transformer (architecture) मॉडल के लिए सामान्यीकृत किया गया है, जिससे ध्यान मैप, ध्यान रोलआउट, या विभेदक ध्यान मैप सीखने वाले उत्पन्न होते हैं।
ट्रांसफॉर्मर में ध्यान मैप
प्राकृतिक भाषा प्रसंस्करण और दृष्टि में Transformer (architecture) आर्किटेक्चर के उदय के साथ, सैलिएंसी मैप ध्यान भार का रूप लेते हैं। एक ट्रांसफॉर्मर में, Multi-Head Attention तंत्र स्कोर की गणना करता है जो इंगित करता है कि इनपुट में एक टोकन दूसरे पर कितना ध्यान देता है। इन भारों को परतों और हेड्स में एकत्रित किया जा सकता है ताकि किसी दिए गए इनपुट, जैसे कि एक छवि, के लिए सैलिएंसी मैप उत्पन्न किया जा सके। ध्यान रोलआउट और वर्ग-विभेदक ध्यान मैप जैसी तकनीकें इन मैपों को अधिक व्याख्या योग्य बनाने के लिए विकसित की गई हैं।
ये मैप अक्सर छवियों के लिए वर्गीकरण निर्णयों की व्याख्या करने के लिए उपयोग किए जाते हैं, लेकिन यही विचार पाठ पर लागू होता है, जहाँ वे महत्वपूर्ण शब्दों या टोकन को उजागर करते हैं। 2020 के दशक तक, ट्रांसफॉर्मर में सैलिएंसी पहचान एक सक्रिय शोध क्षेत्र है, जो Large language model व्याख्या का समर्थन करता है, लेकिन वे ग्रेडिएंट-आधारित मैपों की तुलना में मॉडल के प्रति कम वफादार हो सकते हैं, क्योंकि ध्यान स्कोर हमेशा आउटपुट के लिए कारणात्मक रूप से जिम्मेदार नहीं होते हैं।
उदाहरण एल्गोरिथम कार्यान्वयन
जबकि कई एल्गोरिदम जटिल हैं, एक सरल स्थैतिक सैलिएंसी सूत्र प्रस्तावित किया गया था। यह फ्रेम में प्रत्येक पिक्सेल की सभी अन्य पिक्सेल से दूरी की गणना करता है। एक पिक्सेल I_k के लिए, सैलिएंसी SALS(I_k) सभी पिक्सेल पर योग द्वारा दी जाती है:
SALS(I_k) = Σ_{i=1}^N |I_k - I_i|,
जहाँ I_i [0,255] में पिक्सेल मान है और N पिक्सेल की कुल संख्या है। यह SALS(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N| तक विस्तारित होता है।
सूत्र को छवि हिस्टोग्राम के संदर्भ में व्यक्त किया जा सकता है: SALS(I_k) = Σ_n F_n × |I_k - I_n|, जहाँ F_n तीव्रता मान n (n 0 से 255 तक) की आवृत्ति है। हिस्टोग्राम गणना में कम्प्यूटेशनल समय O(N) होता है। यह पूरी छवि के सापेक्ष प्रत्येक पिक्सेल के महत्व का एक अद्वितीय प्रतिनिधित्व देता है।
यह प्रकार एक क्लासिक दृष्टिकोण है, जो अब अक्सर तंत्रिका नेटवर्क द्वारा प्रतिस्थापित किया जाता है, लेकिन यह मूल सिद्धांत को दर्शाता है।
तंत्रिका नेटवर्क सैलिएंसी विधियाँ
ग्रेडिएंट-आधारित और पारंपरिक विधियों के अतिरिक्त, आधुनिक तंत्रिका नेटवर्क अक्सर विशेष रूप से सैलिएंसी मैप आउटपुट करने के लिए प्रशिक्षित होते हैं, अक्सर वीडियो और बहु-मोडल डेटा के लिए। तीन उल्लेखनीय उदाहरण:
- TASED-Net: एक एनकोडर से मिलकर बनता है जो निम्न-रिज़ॉल्यूशन स्पेटिओटेम्पोरल विशेषताओं को निकालता है, उसके बाद एक भविष्यवाणी नेटवर्क जो सभी अस्थायी जानकारी को एकत्रित करते हुए स्थानिक विशेषताओं को डिकोड करता है।
- STRA-Net: दृश्य और ऑप्टिकल फ्लो युग्मन के माध्यम से स्पेटिओटेम्पोरल विशेषताओं को एकीकृत करता है, और ध्यान तंत्र का उपयोग करके बहु-पैमाने सैलिएंसी पर ध्यान केंद्रित करता है।
- STAViS: स्पेटिओटेम्पोरल दृश्य और श्रवण जानकारी को जोड़ता है। यह एक एकल नेटवर्क का उपयोग करता है जो ध्वनि स्रोतों को स्थानीयकृत करना सीखता है और फिर अंतिम मैप उत्पन्न करने के लिए दो सैलिएंसी संकेतों को जोड़ता है।
ये नेटवर्क समय के साथ मानव निर्धारण की भविष्यवाणी करने के लिए वीडियो डेटासेट पर प्रशिक्षित होते हैं। वे दिखाते हैं कि सैलिएंसी डेटा से सीखा जा सकता है, और उन्होंने फ्रेम-स्तरीय विधियों को गति और ऑडियो के साथ समृद्ध किया।
व्याख्यात्मक AI में अनुप्रयोग
व्याख्यात्मक कृत्रिम बुद्धिमत्ता (XAI) में, सैलिएंसी मैप यह समझने के लिए एक प्रमुख विधि है कि एक कृत्रिम बुद्धिमत्ता मॉडल क्या देख रहा है। छवि वर्गीकरण या वस्तु पहचान करने वाले मॉडल के लिए, सैलिएंसी मैप इंगित करता है कि भविष्यवाणी के लिए कौन से पिक्सेल या क्षेत्र सबसे अधिक प्रभावशाली हैं। उदाहरण के लिए, यदि एक तंत्रिका नेटवर्क एक तस्वीर को कुत्ते के रूप में वर्गीकृत करता है, तो सैलिएंसी मैप कुत्ते के सिर और पूंछ को उजागर कर सकता है, पृष्ठभूमि को नहीं। यह उन क्षेत्रों को उजागर करता है जो किसी विशेष वर्ग निर्णय में सबसे अधिक योगदान करते हैं।
सैलिएंसी विधि का चुनाव गुणवत्ता और व्याख्या को प्रभावित करता है। सरल ग्रेडिएंट तेज़ होते हैं लेकिन शोरगुल वाले हो सकते हैं और अप्रासंगिक क्षेत्रों के लिए महत्व उत्पन्न कर सकते हैं, जबकि एकीकृत ग्रेडिएंट और CAM अधिक सार्थक स्पष्टीकरण प्रदान कर सकते हैं। सिस्टम-स्तरीय सुरक्षा और जवाबदेही के साथ, सैलिएंसी मैप यह सत्यापित करने के लिए उपयोग किए जाते हैं कि एक मॉडल प्रासंगिक विशेषताओं पर निर्भर कर रहा है, न कि पृष्ठभूमि या वॉटरमार्क के कारण स्पूरियस सहसंबंधों पर।
हालाँकि, सैलिएंसी मैप पूरी कहानी नहीं बताते हैं। वे महत्व इंगित करते हैं लेकिन मॉडल के तर्क या प्रतिकूल परिदृश्यों को नहीं। 2020 के दशक तक, अधिक मजबूत और वफादार व्याख्या में अनुसंधान जारी है।
निष्कर्ष
सैलिएंसी मैप मानव दृष्टि की समझ को गहरे शिक्षण मॉडल के आंतरिक कार्य से जोड़ते हैं। वे ध्यान के जैविक मॉडल और मॉडल डिबगिंग, छवि संपीड़न, या निर्णय स्पष्टीकरण के लिए एक व्यावहारिक उपकरण दोनों के रूप में कार्य करते हैं। क्लासिक छवि प्रसंस्करण से Deep learning दृष्टिकोण और Transformer (architecture)-आधारित ध्यान तक विकास के साथ, सैलिएंसी मैपिंग अधिक लचीली और शक्तिशाली बन गई है, हालाँकि यह अभी भी प्रश्न उठाती है कि वास्तव में "महत्वपूर्ण" क्षेत्र क्या है। उनका विकास जारी है, और सैलिएंसी मैप पिक्सेल-स्तरीय और तंत्रिका मॉडल व्याख्या दोनों का एक अभिन्न अंग हैं।