एक छवि आघूर्ण (image moment) एक सांख्यिकीय माप है जो डिजिटल छवि के पिक्सेल तीव्रता से परिकलित किया जाता है। यह पिक्सेल मानों के भारित औसत को दर्शाता है, जिससे अदिश संख्याओं का एक समुच्चय प्राप्त होता है जो छवि के ज्यामितीय गुणों, जैसे क्षेत्रफल, केन्द्रक, अभिविन्यास, और आकार जटिलता का वर्णन करता है। आघूर्ण कुछ रूपांतरणों (जैसे, अनुवाद, घूर्णन, स्केलिंग) के प्रति अपरिवर्तनीय होते हैं जब उन्हें उचित रूप से सामान्यीकृत किया जाता है, जिससे वे मजबूत छवि विश्लेषण के लिए मूल्यवान बन जाते हैं। वे कंप्यूटर विज़न में एक आधारभूत उपकरण के रूप में कार्य करते हैं, जो पिक्सेल-दर-पिक्सेल मिलान के बिना दृश्य पैटर्न के कुशल प्रतिनिधित्व और तुलना को सक्षम बनाते हैं।
छवि आघूर्ण आमतौर पर बाइनरी या ग्रेस्केल छवियों से परिकलित किए जाते हैं, जहाँ प्रत्येक पिक्सेल का एक तीव्रता मान होता है। तीव्रता फलन \(I(x, y)\) वाली डिजिटल छवि के लिए, क्रम \((p+q)\) का कच्चा आघूर्ण सभी पिक्सेल पर \(x^p y^q I(x, y)\) के योग के रूप में परिभाषित किया जाता है। ये कच्चे आघूर्ण छवि में तीव्रता के वितरण को पकड़ते हैं। हालाँकि, कच्चे आघूर्ण छवि की स्थिति पर निर्भर करते हैं, इसलिए केंद्रीय आघूर्ण अक्सर उपयोग किए जाते हैं; वे छवि के केन्द्रक के सापेक्ष परिकलित होते हैं, जो अनुवाद अपरिवर्तनीयता प्रदान करते हैं। आगे सामान्यीकरण से पैमाने-अपरिवर्तनीय आघूर्ण प्राप्त होते हैं, और केंद्रीय आघूर्णों के संयोजन घूर्णन-अपरिवर्तनीय वर्णनकर्ता उत्पन्न कर सकते हैं, जैसे कि 1962 में प्रस्तुत हू के सात अपरिवर्तनीय आघूर्ण।
छवि आघूर्ण की अवधारणा की जड़ें संभाव्यता सिद्धांत और यांत्रिकी में हैं, जहाँ आघूर्ण द्रव्यमान वितरण का वर्णन करते हैं। छवि प्रसंस्करण में, वे 1960 और 1970 के दशक में आकार विश्लेषण के लिए लोकप्रिय हुए। तब से, वे वस्तु पहचान, वर्ण पहचान, और चिकित्सा इमेजिंग जैसे क्षेत्रों में एक मानक तकनीक बन गए हैं। उनकी गणनात्मक सरलता और निम्न आयामीता उन्हें वास्तविक समय अनुप्रयोगों के लिए उपयुक्त बनाती है, हालाँकि वे गहन शिक्षण जैसी अधिक जटिल विशेषताओं की तुलना में सूक्ष्म विवरण खो सकते हैं।
कंप्यूटर विज़न में अनुप्रयोग
छवि आघूर्ण कंप्यूटर विज़न में व्यापक रूप से उन कार्यों के लिए उपयोग किए जाते हैं जिनमें आकार वर्णन और मिलान की आवश्यकता होती है। उदाहरण के लिए, ऑप्टिकल कैरेक्टर पहचान (OCR) में, आघूर्ण अक्षरों और अंकों को उनके ज्यामितीय गुणों द्वारा पहचानने में मदद करते हैं। औद्योगिक निरीक्षण में, वे निर्मित भाग के आघूर्णों की तुलना संदर्भ से करके दोषों की उपस्थिति या अनुपस्थिति की पुष्टि करते हैं। आघूर्ण वीडियो अनुक्रमों में वस्तु ट्रैकिंग भी सक्षम बनाते हैं, जहाँ केन्द्रक (पहले-क्रम आघूर्ण से व्युत्पन्न) अनुसरण के लिए एक स्थिर बिंदु प्रदान करता है। इसके अतिरिक्त, वे छवि पंजीकरण में उपयोग किए जाते हैं, जहाँ एक ही दृश्य की छवियों को संरेखित करने के लिए अनुवाद और घूर्णन का अनुमान लगाना आवश्यक होता है, जिसे आघूर्णों से प्राप्त किया जा सकता है।
आघूर्ण प्रकार और गुण
कई प्रकार के आघूर्ण मौजूद हैं, प्रत्येक के अलग-अलग गुण हैं। कच्चे आघूर्ण सबसे सरल हैं लेकिन रूपांतरणों के प्रति अपरिवर्तनीय नहीं हैं। केंद्रीय आघूर्ण, केन्द्रक के सापेक्ष परिभाषित, अनुवाद-अपरिवर्तनीय हैं। सामान्यीकृत केंद्रीय आघूर्ण, क्षेत्रफल (शून्य-क्रम आघूर्ण) द्वारा स्केल किए गए, पैमाने की अपरिवर्तनीयता प्रदान करते हैं। हू के आघूर्ण, सामान्यीकृत केंद्रीय आघूर्णों के सात अरेखीय संयोजन, अनुवाद, पैमाने, और घूर्णन के प्रति अपरिवर्तनीय हैं, जिससे वे आकार पहचान के लिए लोकप्रिय हैं। ज़र्निके आघूर्ण, 1980 में प्रस्तुत, एक इकाई डिस्क पर ऑर्थोगोनल बहुपदों का उपयोग करते हैं, जो बेहतर शोर सहनशीलता और कम सूचना अतिरेक प्रदान करते हैं। लीजेंड्रे आघूर्ण, लीजेंड्रे बहुपदों पर आधारित, भी ऑर्थोगोनल वर्णनकर्ता प्रदान करते हैं। ये उन्नत आघूर्ण उच्च-क्रम विवरण पकड़ते हैं, जिससे अधिक विभेदक आकार विश्लेषण संभव होता है।
गणना और कार्यान्वयन
छवि आघूर्णों की गणना सीधी और कुशल है। एक असतत छवि के लिए, क्रम \((p+q)\) का कच्चा आघूर्ण सभी पिक्सेल पर पुनरावृत्ति करके और \(x^p y^q\) को तीव्रता से गुणा करके योग करने से परिकलित किया जाता है। केन्द्रक पहले-क्रम आघूर्णों से प्राप्त होता है: \(\bar{x} = m_{10}/m_{00}\) और \(\bar{y} = m_{01}/m_{00}\), जहाँ \(m_{00}\) कुल तीव्रता है (बाइनरी छवियों के लिए क्षेत्रफल)। केंद्रीय आघूर्ण तब इस केन्द्रक के सापेक्ष परिकलित किए जाते हैं। व्यवहार में, आघूर्ण अक्सर इंटीग्रल इमेज (सम-क्षेत्र तालिकाओं) का उपयोग करके परिकलित किए जाते हैं ताकि किसी भी आयताकार क्षेत्र के लिए स्थिर-समय गणना प्राप्त हो सके, जो वास्तविक समय प्रसंस्करण के लिए लाभकारी है। OpenCV जैसी लाइब्रेरीज़ आघूर्ण गणना के लिए अंतर्निहित फलन प्रदान करती हैं, जिससे अनुप्रयोगों में उनका उपयोग सरल हो जाता है।
आधुनिक मशीन लर्निंग से संबंध
जबकि छवि आघूर्ण शास्त्रीय तकनीकें हैं, वे Machine learning और Deep learning के युग में प्रासंगिक बने हुए हैं। वे कभी-कभी पारंपरिक क्लासिफायर में हस्त-निर्मित विशेषताओं के रूप में या Neural network मॉडल में फीड करने से पहले छवियों को सामान्य करने के लिए प्रीप्रोसेसिंग चरणों के रूप में उपयोग किए जाते हैं। उदाहरण के लिए, आघूर्ण छवियों को एक मानक अभिविन्यास में संरेखित या क्रॉप करने में मदद कर सकते हैं, जिससे Convolutional neural network (CNN) आधारित प्रणालियों का प्रदर्शन बेहतर होता है। हालाँकि, Residual Network (ResNet) और U-Net जैसे गहन शिक्षण मॉडल आमतौर पर सीधे कच्चे पिक्सेल से विशेषताएँ सीखते हैं, जिससे स्पष्ट आघूर्ण गणना की आवश्यकता कम हो जाती है। फिर भी, आघूर्ण व्याख्यात्मकता के लिए मूल्यवान हैं, क्योंकि वे सहज ज्यामितीय सारांश प्रदान करते हैं जो सीखे गए प्रतिनिधित्वों को पूरक कर सकते हैं। हाइब्रिड दृष्टिकोणों में, आघूर्ण सीखी गई विशेषताओं के साथ संयुक्त हो सकते हैं ताकि मजबूती बढ़े, विशेष रूप से सीमित प्रशिक्षण डेटा वाले परिदृश्यों में।
सीमाएँ और विस्तार
छवि आघूर्णों की सीमाएँ हैं। वे वैश्विक वर्णनकर्ता हैं, जिसका अर्थ है कि वे पूरी छवि का सारांश प्रस्तुत करते हैं, जो स्थानीय भिन्नताओं को अस्पष्ट कर सकता है। कई वस्तुओं वाले जटिल दृश्यों के लिए, पूरी छवि के आघूर्ण अर्थपूर्ण नहीं हैं; इसके बजाय, विभाजन के बाद प्रत्येक जुड़े घटक के लिए आघूर्ण परिकलित किए जाते हैं। इसके अतिरिक्त, आघूर्ण शोर के प्रति संवेदनशील हैं, विशेष रूप से उच्च-क्रम वाले, जो तीव्रता उतार-चढ़ाव को बढ़ाते हैं। इसे कम करने के लिए, शोर वाले वातावरण में ज़र्निके जैसे ऑर्थोगोनल आघूर्ण पसंद किए जाते हैं। विस्तारों में रंग आघूर्ण शामिल हैं, जो रंग चैनलों पर आघूर्ण परिकलित करते हैं, और वेवलेट आघूर्ण, जो आघूर्णों को बहु-रिज़ॉल्यूशन विश्लेषण के साथ जोड़ते हैं। ये प्रकार रंग छवियों और बहु-पैमाने विश्लेषण के लिए आघूर्णों की प्रयोज्यता का विस्तार करते हैं।
संक्षेप में, छवि आघूर्ण छवि आकृतियों और वितरणों का वर्णन करने का एक संक्षिप्त, गणितीय रूप से आधारित तरीका प्रदान करते हैं। उनके अपरिवर्तनीयता गुण और गणनात्मक दक्षता ने कंप्यूटर विज़न में उनके निरंतर उपयोग को सुनिश्चित किया है, भले ही आधुनिक Artificial intelligence विधियाँ विकसित हो रही हों। वे शास्त्रीय छवि विश्लेषण और समकालीन शिक्षण-आधारित दृष्टिकोणों के बीच एक पुल के रूप में कार्य करते हैं, जो ज्यामितीय समझ के लिए एक सरल फिर भी शक्तिशाली उपकरण प्रदान करते हैं।