कंप्यूटर विज़न में, एक सैलिएंसी मैप एक ऐसी छवि है जो या तो उस क्षेत्र को उजागर करती है जिस पर लोगों की आंखें पहले केंद्रित होती हैं या मशीन लर्निंग मॉडल के लिए सबसे अधिक प्रासंगिक क्षेत्रों को। सैलिएंसी मैप का लक्ष्य मानव दृश्य प्रणाली या अन्यथा अपारदर्शी एमएल मॉडल के लिए एक पिक्सेल के महत्व की डिग्री को प्रतिबिंबित करना है। उदाहरण के लिए, एक परिदृश्य की छवि में, एक व्यक्ति पहले एक किले और हल्के बादलों को देख सकता है, इसलिए वे क्षेत्र सैलिएंसी मैप पर उजागर होंगे। सैलिएंसी मैप व्यापक रूप से छवि संपीड़न से लेकर व्याख्यात्मक कृत्रिम बुद्धिमत्ता तक के अनुप्रयोगों में उपयोग किए जाते हैं, जहां वे मॉडल निर्णयों के दृश्य स्पष्टीकरण प्रदान करते हैं।
सैलिएंसी की अवधारणा मानव दृश्य ध्यान के अध्ययन से उत्पन्न होती है। प्राथमिक दृश्य कॉर्टेक्स (V1) सैलिएंसी मैप के लिए जिम्मेदार प्रतीत होता है, V1 सैलिएंसी परिकल्पना के अनुसार। मशीन लर्निंग में, सैलिएंसी मैप आमतौर पर गहरे तंत्रिका नेटवर्क के लिए उत्पन्न होते हैं, विशेष रूप से कन्वोल्यूशनल तंत्रिका नेटवर्क और ट्रांसफॉर्मर के लिए, यह इंगित करने के लिए कि इनपुट के कौन से हिस्से आउटपुट को सबसे अधिक प्रभावित करते हैं।
मानव आंख अनुप्रयोग
सैलिएंसी मैप के विभिन्न समस्याओं में अनुप्रयोग हैं। मानव आंख के ध्यान के लिए, वे इसमें उपयोग किए जाते हैं:
- छवि और वीडियो संपीड़न: मानव आंख फ्रेम में केवल एक छोटे से रुचि के क्षेत्र पर केंद्रित होती है। इसलिए, पूरे फ्रेम को समान गुणवत्ता के साथ संपीड़ित करना आवश्यक नहीं है। सैलिएंसी मैप का उपयोग करने से समान दृश्य धारणा के साथ वीडियो का अंतिम आकार कम हो जाता है।
- छवि और वीडियो गुणवत्ता मूल्यांकन: छवि या वीडियो गुणवत्ता मीट्रिक का मुख्य कार्य उपयोगकर्ता राय के साथ उच्च सहसंबंध है। सैलिएंट क्षेत्रों में अंतर को अधिक महत्व दिया जाता है और इस प्रकार गुणवत्ता स्कोर में अधिक योगदान होता है।
- छवि रीटार्गेटिंग: इसका उद्देश्य गैर-सूचनात्मक क्षेत्रों का विस्तार या संकुचन करके एक छवि का आकार बदलना है। रीटार्गेटिंग एल्गोरिदम सैलिएंसी मैप की उपलब्धता पर निर्भर करते हैं जो सभी सैलिएंट छवि विवरणों का सटीक अनुमान लगाते हैं।
- वस्तु पहचान और पहचान: पूरी छवि पर कम्प्यूटेशनल रूप से जटिल एल्गोरिदम लागू करने के बजाय, इसे छवि के सबसे सैलिएंट क्षेत्रों पर लागू किया जा सकता है जिनमें वस्तु होने की सबसे अधिक संभावना है।
व्याख्यात्मक एआई
सैलिएंसी मैप व्याख्यात्मक कृत्रिम बुद्धिमत्ता में एक प्रमुख उपकरण हैं, जो मशीन लर्निंग मॉडल, विशेष रूप से गहरे तंत्रिका नेटवर्क की निर्णय लेने की प्रक्रिया के दृश्य स्पष्टीकरण प्रदान करते हैं। ये मैप इनपुट डेटा में उन क्षेत्रों को उजागर करते हैं जो मॉडल के आउटपुट पर सबसे अधिक प्रभावशाली होते हैं, प्रभावी रूप से यह संकेत देते हैं कि मॉडल भविष्यवाणी करते समय कहां "देख" रहा है। उदाहरण के लिए, छवि वर्गीकरण कार्यों में, सैलिएंसी मैप उन पिक्सेल या क्षेत्रों की पहचान कर सकते हैं जो एक विशिष्ट वर्ग निर्णय में सबसे अधिक योगदान करते हैं।
कन्वोल्यूशनल तंत्रिका नेटवर्क के लिए विकसित, सैलिएंसी मैपिंग तकनीकें इनपुट डेटा के संबंध में वर्ग स्कोर के ग्रेडिएंट को सरलता से लेने से लेकर अधिक जटिल एल्गोरिदम, जैसे एकीकृत ग्रेडिएंट और क्लास एक्टिवेशन मैपिंग तक होती हैं। ट्रांसफॉर्मर आर्किटेक्चर में, ध्यान तंत्र ने समान सैलिएंसी मैप को जन्म दिया, जैसे ध्यान मैप, ध्यान रोलआउट, और वर्ग-विभेदक ध्यान मैप।
एक विभाजन समस्या के रूप में सैलिएंसी
सैलिएंसी अनुमान को छवि विभाजन के एक उदाहरण के रूप में देखा जा सकता है। कंप्यूटर विज़न में, छवि विभाजन एक डिजिटल छवि को कई खंडों (पिक्सेल के सेट, जिन्हें सुपरपिक्सेल भी कहा जाता है) में विभाजित करने की प्रक्रिया है। विभाजन का लक्ष्य एक छवि के प्रतिनिधित्व को कुछ ऐसा बनाना है जो अधिक सार्थक और विश्लेषण करने में आसान हो। छवि विभाजन आमतौर पर छवियों में वस्तुओं और सीमाओं (रेखाएं, वक्र, आदि) का पता लगाने के लिए उपयोग किया जाता है। अधिक सटीक रूप से, छवि विभाजन एक छवि में हर पिक्सेल को एक लेबल निर्दिष्ट करने की प्रक्रिया है ताकि समान लेबल वाले पिक्सेल कुछ विशेषताओं को साझा करें।
क्लासिक एल्गोरिदम
OpenCV में लागू किए गए क्लासिक सैलिएंसी अनुमान एल्गोरिदम के तीन रूप हैं:
- स्थिर सैलिएंसी: छवि की रुचि के क्षेत्रों को स्थानीयकृत करने के लिए छवि सुविधाओं और आंकड़ों पर निर्भर करता है।
- गति सैलिएंसी: ऑप्टिकल प्रवाह द्वारा पता लगाए गए वीडियो में गति पर निर्भर करता है। जो वस्तुएं चलती हैं उन्हें सैलिएंट माना जाता है।
- ऑब्जेक्टनेस: ऑब्जेक्टनेस दर्शाता है कि एक छवि विंडो किसी वस्तु को कवर करने की कितनी संभावना है। ये एल्गोरिदम बाउंडिंग बॉक्स का एक सेट उत्पन्न करते हैं जहां एक वस्तु छवि में स्थित हो सकती है।
क्लासिक दृष्टिकोणों के अलावा, तंत्रिका-नेटवर्क-आधारित विधियां भी लोकप्रिय हैं। गति सैलिएंसी अनुमान के लिए तंत्रिका नेटवर्क के उदाहरण हैं:
- TASED-Net: दो बिल्डिंग ब्लॉक से मिलकर बनता है। पहले, एनकोडर नेटवर्क कम-रिज़ॉल्यूशन स्पेटिओटेम्पोरल सुविधाओं को निकालता है, और फिर निम्नलिखित भविष्यवाणी नेटवर्क सभी अस्थायी जानकारी को एकत्र करते हुए स्थानिक रूप से एन्कोडेड सुविधाओं को डिकोड करता है।
- STRA-Net: दो आवश्यक मुद्दों पर जोर देता है। पहले, उपस्थिति और ऑप्टिकल प्रवाह युग्मन के माध्यम से एकीकृत स्पेटिओटेम्पोरल सुविधाएं, और फिर ध्यान तंत्र के माध्यम से सीखी गई बहु-पैमाने सैलिएंसी।
- STAViS: स्पेटिओटेम्पोरल दृश्य और श्रवण जानकारी को जोड़ता है। यह दृष्टिकोण एक एकल नेटवर्क का उपयोग करता है जो ध्वनि स्रोतों को स्थानीयकृत करना और अंतिम सैलिएंसी मैप प्राप्त करने के लिए दो सैलिएंसी को फ्यूज करना सीखता है।
एक नई स्थिर सैलिएंसी विधि है जिसे दृश्य विरूपण संवेदनशीलता कहा जाता है। यह इस विचार पर आधारित है कि सच्चे किनारे, यानी वस्तु आकृति, अन्य जटिल बनावट वाले क्षेत्रों की तुलना में अधिक सैलिएंट हैं। यह क्लासिक किनारे का पता लगाने वाले एल्गोरिदम से अलग तरीके से किनारों का पता लगाता है। यह ग्रेडिएंट परिमाण के लिए काफी छोटी सीमा का उपयोग करता है ताकि ग्रेडिएंट की उपस्थिति पर विचार किया जा सके। यह ऊर्ध्वाधर, क्षैतिज और दो विकर्ण दिशाओं के लिए चार बाइनरी मैप प्राप्त करता है। छोटे अंतराल को बंद करने के लिए बाइनरी छवियों पर रूपात्मक क्लोजिंग और ओपनिंग लागू की जाती है। ब्लॉब-जैसी आकृतियों को साफ करने के लिए, यह दूरी परिवर्तन का उपयोग करता है। आखिरकार, जुड़े पिक्सेल समूह व्यक्तिगत किनारे (या आकृति) हैं। यह निर्धारित करने के लिए जुड़े पिक्सेल सेट के आकार की एक सीमा का उपयोग किया जाता है कि एक छवि ब्लॉक में एक बोधगम्य किनारा (सैलिएंट क्षेत्र) है या नहीं।
उदाहरण कार्यान्वयन
एक सरल सैलिएंसी मैप की गणना प्रत्येक पिक्सेल की उसी फ्रेम में बाकी पिक्सेल की दूरी की गणना करके की जा सकती है। एक पिक्सेल \(I_k\) के लिए सैलिएंसी मान इस प्रकार दिया गया है:
\(\mathrm{SALS}(I_k) = \sum_{i=1}^{N} |I_k - I_i|\)
जहां \(I_i\) पिक्सेल \(i\) का मान है, [0,255] की सीमा में। विस्तारित रूप है:
\(\mathrm{SALS}(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N|\)
जहां N वर्तमान फ्रेम में पिक्सेल की कुल संख्या है। सूत्र को समान तीव्रता मान वाले पिक्सेल को समूहित करके पुनर्गठित किया जा सकता है:
\(\mathrm{SALS}(I_k) = \sum_{n=0}^{255} F_n \times |I_k - I_n|\)
जहां \(F_n\) तीव्रता मान \(I_n\) की आवृत्ति है। आवृत्तियों को हिस्टोग्राम के रूप में व्यक्त किया जाता है, और हिस्टोग्राम का कम्प्यूटेशनल समय \(O(N)\) है। यह दृष्टिकोण कुशल है और कई क्लासिक सैलिएंसी पहचान विधियों का आधार बनता है।
तंत्रिका नेटवर्क दृष्टिकोण
आधुनिक सैलिएंसी मैप पीढ़ी अक्सर गहन शिक्षा पर निर्भर करती है। कन्वोल्यूशनल तंत्रिका नेटवर्क के लिए, ग्रेडिएंट-आधारित विधियां इनपुट छवि के संबंध में वर्ग स्कोर के व्युत्पन्न की गणना करती हैं, एक सैलिएंसी मैप उत्पन्न करती हैं जो सबसे मजबूत प्रभाव वाले पिक्सेल को उजागर करता है। एकीकृत ग्रेडिएंट और क्लास एक्टिवेशन मैपिंग (CAM) अधिक उन्नत तकनीकें हैं जो चिकनी और अधिक विभेदक मैप प्रदान करती हैं। ट्रांसफॉर्मर में, ध्यान तंत्र ध्यान मैप उत्पन्न करते हैं जिन्हें परतों में एकत्र किया जा सकता है, जिन्हें ध्यान रोलआउट के रूप में जाना जाता है, ताकि दृश्य और पाठ्य इनपुट के लिए सैलिएंसी मैप बनाया जा सके। ये विधियां मॉडल व्याख्या के लिए Machine learning और Deep learning में व्यापक रूप से उपयोग की जाती हैं।
अन्य डोमेन में अनुप्रयोग
जबकि सैलिएंसी मैप कंप्यूटर विज़न में सबसे आम हैं, उन्हें अन्य डोमेन में अनुकूलित किया गया है। प्राकृतिक भाषा प्रसंस्करण में, सैलिएंसी मैप उन शब्दों या टोकन को उजागर कर सकते हैं जो मॉडल की भविष्यवाणी को सबसे अधिक प्रभावित करते हैं, विशेष रूप से Transformer (architecture)-आधारित मॉडल जैसे Large language model में। ऑडियो प्रोसेसिंग में, सैलिएंसी मैप वर्गीकरण के लिए प्रासंगिक समय-आवृत्ति क्षेत्रों को इंगित कर सकते हैं। अंतर्निहित सिद्धांत समान रहता है: इनपुट के उन हिस्सों की पहचान करें जो आउटपुट के लिए सबसे अधिक मायने रखते हैं।
चुनौतियां और सीमाएं
सैलिएंसी मैप आलोचना से मुक्त नहीं हैं। वे इनपुट में छोटे गड़बड़ी के प्रति संवेदनशील हो सकते हैं, जिससे अस्थिर स्पष्टीकरण हो सकते हैं। कुछ विधियां ऐसे मैप उत्पन्न करती हैं जो वर्ग-विभेदक नहीं होते हैं, जिसका अर्थ है कि वे उन क्षेत्रों को उजागर करते हैं जो सामान्य रूप से सैलिएंट हैं न कि किसी विशेष भविष्यवाणी के लिए विशिष्ट। इसके अतिरिक्त, सैलिएंसी मैप की गुणवत्ता का मूल्यांकन करना मुश्किल है, क्योंकि मॉडल ध्यान के लिए कोई जमीनी सत्य नहीं है। शोधकर्ता विश्वसनीयता और व्याख्या में सुधार के लिए नई तकनीकों का विकास जारी रखते हैं, अक्सर Neural network अनुसंधान और Artificial intelligence नैतिकता से अंतर्दृष्टि प्राप्त करते हैं।
भविष्य की दिशाएं
जैसे-जैसे Artificial intelligence मॉडल अधिक जटिल होते जाते हैं, पारदर्शी स्पष्टीकरण की आवश्यकता बढ़ती है। सैलिएंसी मैप व्याख्यात्मक एआई में एक प्रमुख उपकरण बने रहने की संभावना है, विशेष रूप से चिकित्सा इमेजिंग और स्वायत्त ड्राइविंग जैसे उच्च-दांव अनुप्रयोगों के लिए। Generative AI और मल्टीमॉडल मॉडल में प्रगति सैलिएंसी के नए रूपों को जन्म दे सकती है जो दृश्य, पाठ्य और श्रवण संकेतों को जोड़ते हैं। MIT CSAIL, Stanford AI Lab, और BAIR (Berkeley AI Research) जैसे संस्थानों में अनुसंधान व्याख्या की सीमाओं को आगे बढ़ाना जारी रखता है, सैलिएंसी मैप एक मौलिक तकनीक के रूप में सेवारत हैं।