अंग्रेज़ी से अनुवादित

सैलिएंसी मैप एक छवि है जो मानव धारणा या मशीन लर्निंग मॉडल के लिए सबसे दृश्य रूप से महत्वपूर्ण क्षेत्रों को उजागर करती है, जिसे अक्सर ग्रेडिएंट्स या अटेंशन से गणना की जाती है। यह गहरे तंत्रिका नेटवर्क की व्याख्या के लिए व्याख्यात्मक AI में एक प्रमुख उपकरण है।

सैलिएंसी मैप एक दृश्य प्रतिनिधित्व है जो किसी छवि के उन क्षेत्रों को उजागर करता है जो किसी दिए गए कार्य के लिए सबसे अधिक प्रासंगिक हैं, चाहे वह मानव दृश्य ध्यान के लिए हो या मशीन लर्निंग मॉडल के निर्णयों के लिए। कंप्यूटर विज़न में, ऐसे मैप मानव दृश्य प्रणाली या अन्यथा अपारदर्शी मॉडल के लिए प्रत्येक पिक्सेल के महत्व की डिग्री को दर्शाते हैं। उदाहरण के लिए, एक तस्वीर में, दर्शक पहले किले या हल्के बादलों को देख सकता है; उस छवि का सैलिएंसी मैप उन क्षेत्रों को उनकी प्रमुखता दर्शाने के लिए चमकाएगा। जहाँ आई-ट्रैकिंग सैलिएंसी मैप मानव दृष्टि का अनुमान लगाते हैं, वहीं मशीन लर्निंग में ग्रेडिएंट-आधारित सैलिएंसी मैप यह प्रकट करते हैं कि मॉडल भविष्यवाणी करते समय कहाँ ध्यान केंद्रित करता है।

कृत्रिम बुद्धिमत्ता के संदर्भ में, सैलिएंसी मैप व्याख्यात्मक AI में एक केंद्रीय उपकरण बन गए हैं। वे गहरे तंत्रिका नेटवर्क द्वारा निर्णयों तक पहुँचने के तरीके के दृश्य स्पष्टीकरण प्रदान करते हैं, उन इनपुट पिक्सेल या विशेषताओं को उजागर करके जो आउटपुट को सबसे अधिक प्रभावित करते हैं। यह तकनीक छवि वर्गीकरण और वस्तु पहचान के लिए विशेष रूप से सामान्य है, लेकिन यह बाद के ट्रांसफॉर्मर आर्किटेक्चर तक ध्यान मैप के माध्यम से विस्तारित होती है। यह अवधारणा संज्ञानात्मक विज्ञान और मशीन लर्निंग को जोड़ती है, और मानव दृष्टि में इसकी जड़ों ने एल्गोरिथम दृष्टिकोण और मूल्यांकन विधियों दोनों को आकार दिया है।

मानव दृश्य सैलिएंसी

मानव सैलिएंसी मैप उन स्थानों की भविष्यवाणी करने का लक्ष्य रखते हैं जो पहले किसी व्यक्ति का ध्यान आकर्षित करते हैं। V1 सैलिएंसी परिकल्पना के अनुसार, प्राथमिक दृश्य कॉर्टेक्स (V1) सैलिएंसी मैप के लिए जिम्मेदार प्रतीत होता है, जिससे सैलिएंसी एक जैविक रूप से आधारित घटना बन जाती है। मानव सैलिएंसी के कम्प्यूटेशनल मॉडल अक्सर रंग, कंट्रास्ट, किनारों और गति जैसी निम्न-स्तरीय विशेषताओं पर निर्भर करते हैं।

इस क्षेत्र में सबसे सामान्य अनुप्रयोग हैं:

  • छवि और वीडियो संपीड़न: मानव आँख किसी फ्रेम में केवल एक छोटे से रुचि क्षेत्र पर ध्यान केंद्रित करती है; सैलिएंसी मैप का उपयोग उस क्षेत्र के बाहर निम्न गुणवत्ता पर एन्कोडिंग की अनुमति देता है, जिससे कथित हानि के बिना फ़ाइल आकार कम हो जाता है।
  • छवि और वीडियो गुणवत्ता मूल्यांकन: गुणवत्ता मेट्रिक्स जो सैलिएंट क्षेत्रों में अंतर को अधिक भार देते हैं, व्यक्तिपरक मानव राय के साथ उच्च सहसंबंध प्राप्त करते हैं।
  • छवि रीटार्गेटिंग: महत्वपूर्ण सामग्री को संरक्षित करने के लिए गैर-सूचनात्मक क्षेत्रों को विस्तारित या सिकोड़कर छवियों का आकार बदलना, सटीक सैलिएंसी अनुमानों पर निर्भर करता है।
  • वस्तु पहचान और पहचान: जटिल एल्गोरिदम को पूरी छवि पर लागू करने के बजाय, उन्हें सबसे सैलिएंट क्षेत्रों पर लागू किया जाता है, जिनमें संभवतः पहचाने जाने वाली वस्तुएँ होती हैं।

क्लासिक अनुमान एल्गोरिदम तीन मुख्य प्रकारों में आते हैं, जैसा कि OpenCV में लागू किया गया है: स्थैतिक सैलिएंसी (छवि विशेषताओं और आँकड़ों पर आधारित), गति सैलिएंसी (ऑप्टिकल फ्लो से गति पर आधारित, जहाँ गतिशील वस्तुएँ सैलिएंट होती हैं), और ऑब्जेक्टनेस (जो संभावित वस्तुओं के चारों ओर बाउंडिंग बॉक्स प्रदान करता है)। एक नई स्थैतिक विधि भी है जिसे दृश्य विरूपण संवेदनशीलता कहा जाता है, जो वास्तविक किनारों (वस्तु आकृति) को बनावट वाले क्षेत्रों की तुलना में अधिक सैलिएंट मानती है; यह किनारों को अलग करने के लिए छोटे ग्रेडिएंट थ्रेशोल्ड, रूपात्मक संचालन और दूरी परिवर्तन का उपयोग करती है।

विभाजन के रूप में सैलिएंसी

सैलिएंसी अनुमान को छवि विभाजन का एक उदाहरण माना जा सकता है। छवि विभाजन एक डिजिटल छवि को कई खंडों या सुपरपिक्सेल में विभाजित करने की प्रक्रिया है। लक्ष्य छवि प्रतिनिधित्व को कुछ सार्थक और विश्लेषण करने में आसान बनाना है, अक्सर हर पिक्सेल को लेबल निर्दिष्ट करके। सैलिएंसी के लिए, विभाजन समस्या द्विआधारी है: प्रत्येक पिक्सेल को या तो अग्रभूमि (सैलिएंट) या पृष्ठभूमि के भाग के रूप में लेबल करें। आउटपुट अक्सर एक द्विआधारी मास्क होता है जहाँ सैलिएंट वस्तु सफेद और बाकी काला होता है, या एक सतत हीटमैप होता है जहाँ तीव्रता सैलिएंसी को इंगित करती है।

यह संबंध विशेष रूप से महत्वपूर्ण है क्योंकि विभाजन तकनीक और हानि फ़ंक्शन पुनः उपयोग किए जा सकते हैं, और सैलिएंट क्षेत्रों की समग्र समझ छवि विभाजन जैसे कार्यों में मदद करती है। हालाँकि, सैलिएंसी मैप आमतौर पर कठोर सीमाओं के बजाय नरम या श्रेणीबद्ध महत्व प्रदान करते हैं।

गहन शिक्षण के लिए ग्रेडिएंट-आधारित सैलिएंसी

जब तंत्रिका नेटवर्क पर लागू किया जाता है, तो सैलिएंसी मैप अक्सर इनपुट के संबंध में वर्ग स्कोर के ग्रेडिएंट को लेकर गणना की जाती है। इसे 2010 के दशक में कन्वोल्यूशनल नेटवर्क के लिए विकसित किया गया था, और पहले प्रमुख दृष्टिकोणों ने सरल ग्रेडिएंट का उपयोग किया: प्रत्येक पिक्सेल के लिए, कोई गणना करता है कि आउटपुट स्कोर उस पिक्सेल में छोटे बदलाव के प्रति कितना संवेदनशील है। ग्रेडिएंट का परिमाण सापेक्ष महत्व को इंगित करता है।

अधिक परिष्कृत तकनीकें निम्नलिखित हैं:

  • एकीकृत ग्रेडिएंट: यह बेसलाइन इनपुट से वास्तविक इनपुट तक एक पथ के साथ ग्रेडिएंट को जोड़कर महत्व निर्दिष्ट करता है, संतृप्ति को ध्यान में रखने और आरोपण सुनिश्चित करने के लिए यदि भविष्यवाणी स्कोर केवल मध्यवर्ती बिंदुओं पर बदलते हैं।
  • क्लास एक्टिवेशन मैपिंग (CAM): यह अंतिम कन्वोल्यूशनल परत से फीचर मैप, लक्ष्य वर्ग के लिए इसके भार का उपयोग करता है, और एक मोटा सैलिएंसी मैप उत्पन्न करता है, आमतौर पर एक स्थानिक रिज़ॉल्यूशन में जिसे अपसैंपल किया जाता है।
  • ग्रेडिएंट-भारित क्लास एक्टिवेशन मैपिंग (Grad-CAM): CAM का एक विस्तार जो सक्रियणों को भार देने के लिए फीचर मैप के संबंध में वर्ग स्कोर के ग्रेडिएंट का उपयोग करता है।

ये विधियाँ कन्वोल्यूशनल तंत्रिका नेटवर्क (जैसे, Residual Network (ResNet)) के लिए विशिष्ट हैं, लेकिन उन्हें ध्यान तंत्र के माध्यम से Transformer (architecture) मॉडल के लिए सामान्यीकृत किया गया है, जिससे ध्यान मैप, ध्यान रोलआउट, या विभेदक ध्यान मैप सीखने वाले उत्पन्न होते हैं।

ट्रांसफॉर्मर में ध्यान मैप

प्राकृतिक भाषा प्रसंस्करण और दृष्टि में Transformer (architecture) आर्किटेक्चर के उदय के साथ, सैलिएंसी मैप ध्यान भार का रूप लेते हैं। एक ट्रांसफॉर्मर में, Multi-Head Attention तंत्र स्कोर की गणना करता है जो इंगित करता है कि इनपुट में एक टोकन दूसरे पर कितना ध्यान देता है। इन भारों को परतों और हेड्स में एकत्रित किया जा सकता है ताकि किसी दिए गए इनपुट, जैसे कि एक छवि, के लिए सैलिएंसी मैप उत्पन्न किया जा सके। ध्यान रोलआउट और वर्ग-विभेदक ध्यान मैप जैसी तकनीकें इन मैपों को अधिक व्याख्या योग्य बनाने के लिए विकसित की गई हैं।

ये मैप अक्सर छवियों के लिए वर्गीकरण निर्णयों की व्याख्या करने के लिए उपयोग किए जाते हैं, लेकिन यही विचार पाठ पर लागू होता है, जहाँ वे महत्वपूर्ण शब्दों या टोकन को उजागर करते हैं। 2020 के दशक तक, ट्रांसफॉर्मर में सैलिएंसी पहचान एक सक्रिय शोध क्षेत्र है, जो Large language model व्याख्या का समर्थन करता है, लेकिन वे ग्रेडिएंट-आधारित मैपों की तुलना में मॉडल के प्रति कम वफादार हो सकते हैं, क्योंकि ध्यान स्कोर हमेशा आउटपुट के लिए कारणात्मक रूप से जिम्मेदार नहीं होते हैं।

उदाहरण एल्गोरिथम कार्यान्वयन

जबकि कई एल्गोरिदम जटिल हैं, एक सरल स्थैतिक सैलिएंसी सूत्र प्रस्तावित किया गया था। यह फ्रेम में प्रत्येक पिक्सेल की सभी अन्य पिक्सेल से दूरी की गणना करता है। एक पिक्सेल I_k के लिए, सैलिएंसी SALS(I_k) सभी पिक्सेल पर योग द्वारा दी जाती है:

SALS(I_k) = Σ_{i=1}^N |I_k - I_i|,

जहाँ I_i [0,255] में पिक्सेल मान है और N पिक्सेल की कुल संख्या है। यह SALS(I_k) = |I_k - I_1| + |I_k - I_2| + ... + |I_k - I_N| तक विस्तारित होता है।

सूत्र को छवि हिस्टोग्राम के संदर्भ में व्यक्त किया जा सकता है: SALS(I_k) = Σ_n F_n × |I_k - I_n|, जहाँ F_n तीव्रता मान n (n 0 से 255 तक) की आवृत्ति है। हिस्टोग्राम गणना में कम्प्यूटेशनल समय O(N) होता है। यह पूरी छवि के सापेक्ष प्रत्येक पिक्सेल के महत्व का एक अद्वितीय प्रतिनिधित्व देता है।

यह प्रकार एक क्लासिक दृष्टिकोण है, जो अब अक्सर तंत्रिका नेटवर्क द्वारा प्रतिस्थापित किया जाता है, लेकिन यह मूल सिद्धांत को दर्शाता है।

तंत्रिका नेटवर्क सैलिएंसी विधियाँ

ग्रेडिएंट-आधारित और पारंपरिक विधियों के अतिरिक्त, आधुनिक तंत्रिका नेटवर्क अक्सर विशेष रूप से सैलिएंसी मैप आउटपुट करने के लिए प्रशिक्षित होते हैं, अक्सर वीडियो और बहु-मोडल डेटा के लिए। तीन उल्लेखनीय उदाहरण:

  • TASED-Net: एक एनकोडर से मिलकर बनता है जो निम्न-रिज़ॉल्यूशन स्पेटिओटेम्पोरल विशेषताओं को निकालता है, उसके बाद एक भविष्यवाणी नेटवर्क जो सभी अस्थायी जानकारी को एकत्रित करते हुए स्थानिक विशेषताओं को डिकोड करता है।
  • STRA-Net: दृश्य और ऑप्टिकल फ्लो युग्मन के माध्यम से स्पेटिओटेम्पोरल विशेषताओं को एकीकृत करता है, और ध्यान तंत्र का उपयोग करके बहु-पैमाने सैलिएंसी पर ध्यान केंद्रित करता है।
  • STAViS: स्पेटिओटेम्पोरल दृश्य और श्रवण जानकारी को जोड़ता है। यह एक एकल नेटवर्क का उपयोग करता है जो ध्वनि स्रोतों को स्थानीयकृत करना सीखता है और फिर अंतिम मैप उत्पन्न करने के लिए दो सैलिएंसी संकेतों को जोड़ता है।

ये नेटवर्क समय के साथ मानव निर्धारण की भविष्यवाणी करने के लिए वीडियो डेटासेट पर प्रशिक्षित होते हैं। वे दिखाते हैं कि सैलिएंसी डेटा से सीखा जा सकता है, और उन्होंने फ्रेम-स्तरीय विधियों को गति और ऑडियो के साथ समृद्ध किया।

व्याख्यात्मक AI में अनुप्रयोग

व्याख्यात्मक कृत्रिम बुद्धिमत्ता (XAI) में, सैलिएंसी मैप यह समझने के लिए एक प्रमुख विधि है कि एक कृत्रिम बुद्धिमत्ता मॉडल क्या देख रहा है। छवि वर्गीकरण या वस्तु पहचान करने वाले मॉडल के लिए, सैलिएंसी मैप इंगित करता है कि भविष्यवाणी के लिए कौन से पिक्सेल या क्षेत्र सबसे अधिक प्रभावशाली हैं। उदाहरण के लिए, यदि एक तंत्रिका नेटवर्क एक तस्वीर को कुत्ते के रूप में वर्गीकृत करता है, तो सैलिएंसी मैप कुत्ते के सिर और पूंछ को उजागर कर सकता है, पृष्ठभूमि को नहीं। यह उन क्षेत्रों को उजागर करता है जो किसी विशेष वर्ग निर्णय में सबसे अधिक योगदान करते हैं।

सैलिएंसी विधि का चुनाव गुणवत्ता और व्याख्या को प्रभावित करता है। सरल ग्रेडिएंट तेज़ होते हैं लेकिन शोरगुल वाले हो सकते हैं और अप्रासंगिक क्षेत्रों के लिए महत्व उत्पन्न कर सकते हैं, जबकि एकीकृत ग्रेडिएंट और CAM अधिक सार्थक स्पष्टीकरण प्रदान कर सकते हैं। सिस्टम-स्तरीय सुरक्षा और जवाबदेही के साथ, सैलिएंसी मैप यह सत्यापित करने के लिए उपयोग किए जाते हैं कि एक मॉडल प्रासंगिक विशेषताओं पर निर्भर कर रहा है, न कि पृष्ठभूमि या वॉटरमार्क के कारण स्पूरियस सहसंबंधों पर।

हालाँकि, सैलिएंसी मैप पूरी कहानी नहीं बताते हैं। वे महत्व इंगित करते हैं लेकिन मॉडल के तर्क या प्रतिकूल परिदृश्यों को नहीं। 2020 के दशक तक, अधिक मजबूत और वफादार व्याख्या में अनुसंधान जारी है।

निष्कर्ष

सैलिएंसी मैप मानव दृष्टि की समझ को गहरे शिक्षण मॉडल के आंतरिक कार्य से जोड़ते हैं। वे ध्यान के जैविक मॉडल और मॉडल डिबगिंग, छवि संपीड़न, या निर्णय स्पष्टीकरण के लिए एक व्यावहारिक उपकरण दोनों के रूप में कार्य करते हैं। क्लासिक छवि प्रसंस्करण से Deep learning दृष्टिकोण और Transformer (architecture)-आधारित ध्यान तक विकास के साथ, सैलिएंसी मैपिंग अधिक लचीली और शक्तिशाली बन गई है, हालाँकि यह अभी भी प्रश्न उठाती है कि वास्तव में "महत्वपूर्ण" क्षेत्र क्या है। उनका विकास जारी है, और सैलिएंसी मैप पिक्सेल-स्तरीय और तंत्रिका मॉडल व्याख्या दोनों का एक अभिन्न अंग हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·explainable-ai·visual-attention·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास