छवि संलयन एक कंप्यूटेशनल तकनीक है जो एक ही दृश्य की दो या अधिक स्रोत छवियों से पूरक जानकारी को एक एकल समग्र छवि में एकीकृत करती है। लक्ष्य एक ऐसा आउटपुट तैयार करना है जो किसी भी व्यक्तिगत इनपुट छवि की तुलना में अधिक सूचनाप्रद और मानव दृश्य धारणा या बाद के स्वचालित विश्लेषण के लिए बेहतर अनुकूल हो। इस प्रक्रिया में आम तौर पर स्रोत छवियों को संरेखित करना (पंजीकरण) और फिर पिक्सेल, फीचर, या निर्णय स्तर पर एक संलयन नियम लागू करना शामिल होता है। अनुप्रयोग रिमोट सेंसिंग, चिकित्सा निदान, निगरानी, और फोटोग्राफी तक फैले हुए हैं, जहां मल्टी-सेंसर या मल्टी-एक्सपोज़र डेटा आम है।
यह अवधारणा सिग्नल प्रोसेसिंग और कंप्यूटर विज़न से ली गई है, जिसका प्रारंभिक कार्य 1980 के दशक में हुआ था। आधुनिक दृष्टिकोण डेटा से इष्टतम संलयन रणनीतियों को सीखने के लिए गहन शिक्षण, विशेष रूप से कन्वोल्यूशनल न्यूरल नेटवर्क और ट्रांसफॉर्मर आर्किटेक्चर का लाभ उठाते हैं। छवि संलयन, छवि सिलाई (जो देखने का एक व्यापक क्षेत्र बनाती है) और छवि सम्मिश्रण (जो संक्रमण को सुचारू करता है) से अलग है, क्योंकि यह केवल ज्यामितीय संरेखण के बजाय सूचना निष्कर्षण पर जोर देता है।
पिक्सेल-स्तरीय संलयन विधियाँ
पिक्सेल-स्तरीय संलयन संरेखित छवियों के तीव्रता मानों पर सीधे कार्य करता है। सबसे सरल तकनीकों में औसत शामिल है, जहां प्रत्येक आउटपुट पिक्सेल संबंधित इनपुट पिक्सेल का माध्य होता है, और भारित औसत, जहां वजन स्थानीय कंट्रास्ट या तीक्ष्णता जैसे मेट्रिक्स के आधार पर चुने जाते हैं। अधिक उन्नत विधियाँ लाप्लासियन पिरामिड या असतत तरंगिका रूपांतरण जैसे बहु-स्तरीय रूपांतरणों का उपयोग करती हैं। इनमें, छवियों को आवृत्ति बैंड में विघटित किया जाता है, और संलयन नियम प्रति बैंड अधिकतम गतिविधि (जैसे, उच्चतम निरपेक्ष मान) वाले गुणांक का चयन करते हैं, फिर समग्र का पुनर्निर्माण करते हैं। ये विधियाँ सरल औसत की तुलना में किनारों और विवरणों को बेहतर संरक्षित करती हैं, लेकिन यदि विघटन और पुनर्निर्माण पूरी तरह से मेल नहीं खाते हैं तो कलाकृतियाँ पेश कर सकती हैं।
मल्टी-एक्सपोज़र संलयन के लिए, जहां छवियां चमक में भिन्न होती हैं, पिक्सेल-स्तरीय विधियाँ अक्सर वजन चयन का मार्गदर्शन करने के लिए एक गुणवत्ता मानचित्र (जैसे, संतृप्ति, कंट्रास्ट, और अच्छी तरह से उजागर होने के आधार पर) की गणना करती हैं। यह उच्च गतिशील रेंज (एचडीआर) इमेजिंग के लिए उपभोक्ता फोटोग्राफी में आम है।
फीचर-स्तरीय और निर्णय-स्तरीय संलयन
फीचर-स्तरीय संलयन प्रत्येक स्रोत छवि से प्रमुख विशेषताओं को निकालता है, जैसे कि किनारे, कोने, या बनावट वर्णनकर्ता, और उन्हें एक संयुक्त फीचर वेक्टर में जोड़ता है। इस वेक्टर का उपयोग फिर वर्गीकरण या विभाजन कार्यों के लिए किया जाता है। उदाहरण के लिए, रिमोट सेंसिंग में, पैन-शार्पनिंग एक उच्च-रिज़ॉल्यूशन पैनक्रोमैटिक छवि को कम-रिज़ॉल्यूशन मल्टीस्पेक्ट्रल छवि के साथ जोड़ता है, जिसमें पूर्व से स्थानिक विवरण बाद में इंजेक्ट किया जाता है, अक्सर फीचर स्तर पर। निर्णय-स्तरीय संलयन, जिसे सिमेंटिक संलयन के रूप में भी जाना जाता है, कई क्लासिफायर या डिटेक्टरों के आउटपुट को जोड़ता है, जिनमें से प्रत्येक एक अलग स्रोत पर काम करता है। विधियों में बहुमत मतदान, बायेसियन अनुमान, या डेम्पस्टर-शेफर सिद्धांत शामिल हैं। यह स्तर सेंसर शोर के प्रति मजबूत है, लेकिन इसके लिए आवश्यक है कि प्रत्येक स्रोत एक सार्थक निर्णय प्रदान करे।
गहन शिक्षण दृष्टिकोण
2010 के दशक के मध्य से, गहन शिक्षण ने छवि संलयन अनुसंधान पर हावी रहा है। कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) का उपयोग युग्मित प्रशिक्षण डेटा से सीधे संलयन नियम सीखने के लिए किया जाता है। एक विशिष्ट आर्किटेक्चर में एक एनकोडर होता है जो प्रत्येक इनपुट से विशेषताएं निकालता है, एक संलयन परत जो इन विशेषताओं को जोड़ती है (जैसे, तत्व-वार जोड़ या ध्यान तंत्र के माध्यम से), और एक डिकोडर जो संलग्न छवि का पुनर्निर्माण करता है। यू-नेट आर्किटेक्चर, मूल रूप से बायोमेडिकल विभाजन के लिए विकसित किया गया था, इसकी बहु-स्तरीय फीचर निष्कर्षण और स्किप कनेक्शन के कारण अक्सर संलयन के लिए अनुकूलित किया जाता है जो बारीक विवरणों को संरक्षित करते हैं।
हाल ही में, ट्रांसफॉर्मर-आधारित मॉडल, जो मल्टी-हेड अटेंशन तंत्र पर निर्भर करते हैं, छवियों में लंबी दूरी की निर्भरताओं को पकड़ने के लिए लागू किए गए हैं। ये मॉडल छवि पैच को टोकन के रूप में मानते हैं और वैश्विक संदर्भ सीखते हैं, जो बड़े समान क्षेत्रों या जटिल बनावट वाले दृश्यों के लिए संलयन गुणवत्ता में सुधार कर सकता है। प्रशिक्षण आम तौर पर स्रोत छवियों के प्रति निष्ठा (जैसे, माध्य वर्ग त्रुटि) और अवधारणात्मक गुणवत्ता (जैसे, संरचनात्मक समानता सूचकांक) को संतुलित करने वाले नुकसान कार्यों का उपयोग करता है। कुछ विधियाँ दृश्य रूप से यथार्थवादी आउटपुट उत्पन्न करने के लिए जनरेटिव एडवर्सेरियल नेटवर्क का उपयोग करती हैं, हालांकि यह प्रशिक्षण अस्थिरता जोड़ता है।
अनुप्रयोग और चुनौतियाँ
रिमोट सेंसिंग में, छवि संलयन उपग्रह इमेजरी के पैन-शार्पनिंग, ऑप्टिकल और रडार डेटा (जैसे, सेंटीनेल-1 और सेंटीनेल-2 से) के संयोजन, और परिवर्तन का पता लगाने के लिए महत्वपूर्ण है। चिकित्सा इमेजिंग में, यह शारीरिक और कार्यात्मक दोनों जानकारी प्रदान करने के लिए कंप्यूटेड टोमोग्राफी (सीटी) और चुंबकीय अनुनाद इमेजिंग (एमआरआई) स्कैन को जोड़ता है, जिससे निदान और सर्जिकल योजना में सहायता मिलती है। निगरानी में, दृश्य और अवरक्त छवियों का संलयन कम रोशनी या अस्पष्ट स्थितियों में वस्तु का पता लगाने को बढ़ाता है। स्वायत्त वाहन कैमरा, लिडार, और रडार डेटा का संलयन उपयोग करते हैं, हालांकि यह अक्सर छवि संलयन के बजाय सेंसर संलयन के अंतर्गत आता है।
मुख्य चुनौतियों में स्रोतों के बीच गलत संरेखण, अलग-अलग रिज़ॉल्यूशन, और स्थानिक विवरण और वर्णक्रमीय निष्ठा के बीच व्यापार-बंद शामिल हैं। संलग्न छवियों का मूल्यांकन करना मुश्किल है क्योंकि एक सत्य समग्र शायद ही कभी मौजूद होता है; पारस्परिक जानकारी, किनारे संरक्षण, और दृश्य सूचना निष्ठा जैसे मेट्रिक्स का उपयोग किया जाता है, लेकिन व्यक्तिपरक मूल्यांकन आम बना रहता है। 2020 के दशक की शुरुआत तक, कोई भी एक विधि हर परिदृश्य में अन्य सभी से बेहतर प्रदर्शन नहीं करती है, और अनुसंधान अनुकूली और कार्य-विशिष्ट संलयन पर जारी है।
व्यापक एआई से संबंध
छवि संलयन कंप्यूटर विज़न का एक उप-क्षेत्र है और मशीन लर्निंग और डीप लर्निंग से निकटता से जुड़ा हुआ है। यह डेटा ऑग्मेंटेशन के साथ तकनीक साझा करता है, जो मॉडल मजबूती में सुधार के लिए छवियों को जोड़ता या संशोधित करता है। संलयन एल्गोरिदम के विकास को न्यूरल नेटवर्क आर्किटेक्चर और प्रशिक्षण विधियों में प्रगति से लाभ हुआ है, जैसे अवशिष्ट नेटवर्क और बैच सामान्यीकरण। एमआईटी सीएसएआईएल और स्टैनफोर्ड एआई लैब जैसे संस्थानों के शोध समूहों ने सैद्धांतिक नींव और व्यावहारिक कार्यान्वयन दोनों में योगदान दिया है। उद्योग अपनाने को गूगल डीपमाइंड (उपग्रह इमेजरी विश्लेषण के लिए) और सैमसंग रिसर्च (स्मार्टफोन कैमरा सुधार के लिए) जैसी कंपनियों के उत्पादों में देखा जाता है।
भविष्य की दिशाएँ
उभरते रुझानों में बहुविध समझ के लिए बड़े भाषा मॉडल के साथ संलयन शामिल है, जहां छवि संलयन को समृद्ध दृश्य प्रतिनिधित्व उत्पन्न करने के लिए पाठ्य विवरणों के साथ जोड़ा जाता है। कुशल आर्किटेक्चर और हार्डवेयर त्वरक जैसे एडब्ल्यूएस ट्रेनियम या क्वालकॉम चिप्स द्वारा संचालित एज डिवाइसों पर वास्तविक समय संलयन एक और फोकस है। इसके अतिरिक्त, लेबल किए गए प्रशिक्षण डेटा पर निर्भरता कम करने के लिए अनसुपरवाइज्ड और सेल्फ-सुपरवाइज्ड संलयन विधियों की खोज की जा रही है। जनरेटिव मॉडल के साथ संलयन का एकीकरण ऐसी छवियों को संश्लेषित करने में सक्षम बना सकता है जो केवल समग्र नहीं हैं, बल्कि आदर्श परिस्थितियों में दृश्य के संभावित पुनर्निर्माण हैं।
कुल मिलाकर, छवि संलयन अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें अधिक बुद्धिमान, संदर्भ-जागरूक एल्गोरिदम की ओर एक प्रक्षेपवक्र है जो विविध सेंसर और कार्यों के अनुकूल हो सकते हैं।