छवि निर्माण वह भौतिक और गणितीय प्रक्रिया है जिसके द्वारा त्रि-आयामी दृश्य में वस्तुओं से परावर्तित या उत्सर्जित प्रकाश को द्वि-आयामी छवि उत्पन्न करने के लिए कैद किया जाता है। यह प्रक्रिया फोटोग्राफी, सिनेमैटोग्राफी, चिकित्सा इमेजिंग और कंप्यूटर विज़न प्रणालियों के लिए केंद्रीय है। इसमें लेंस और एपर्चर जैसे ऑप्टिकल तत्वों के साथ प्रकाश की अंतःक्रिया और सेंसर द्वारा प्रकाश ऊर्जा का डिजिटल या एनालॉग सिग्नल में रूपांतरण शामिल है। कैमरों को डिजाइन करने, छवियों की व्याख्या करने और वस्तु पहचान और दृश्य पुनर्निर्माण जैसे कार्यों के लिए एल्गोरिदम विकसित करने के लिए छवि निर्माण को समझना आवश्यक है।
छवि निर्माण का अध्ययन ज्यामितीय प्रकाशिकी पर आधारित है, जो बताता है कि प्रकाश किरणें लेंस के माध्यम से कैसे यात्रा करती हैं और अपवर्तित होती हैं, और रेडियोमेट्री, जो प्रकाश की ऊर्जा को मापती है। छवि निर्माण का एक पूर्ण मॉडल कैमरे के आंतरिक मापदंडों (फोकल लंबाई, मुख्य बिंदु, लेंस विरूपण) और बाहरी मापदंडों (अंतरिक्ष में स्थिति और अभिविन्यास) को ध्यान में रखता है। ये पैरामीटर 3D विश्व निर्देशांक को 2D छवि निर्देशांक में मैप करते हैं, एक परिवर्तन जिसे अक्सर पिनहोल कैमरा मॉडल द्वारा दर्शाया जाता है। वास्तविक कैमरे लेंस विपथन, विवर्तन और सेंसर शोर के कारण इस आदर्श मॉडल से विचलित होते हैं, जिन्हें उन्नत इमेजिंग पाइपलाइनों में ठीक या मॉडल किया जाता है।
ऑप्टिकल सिद्धांत
पिनहोल कैमरा मॉडल छवि निर्माण का सबसे सरल प्रतिनिधित्व है, जहां प्रकाश एक छोटे छिद्र से गुजरता है और एक समतल पर उल्टी छवि प्रक्षेपित करता है। एक वास्तविक लेंस पिनहोल को बदल देता है ताकि अधिक प्रकाश एकत्र किया जा सके और उसे केंद्रित किया जा सके, अपवर्तन का उपयोग करके एक बिंदु स्रोत से किरणों को सेंसर पर एक बिंदु पर अभिसरित किया जा सके। फोकल लंबाई आवर्धन और दृश्य क्षेत्र निर्धारित करती है; छोटी फोकल लंबाई व्यापक कोण उत्पन्न करती है, जबकि लंबी फोकल लंबाई दूर की वस्तुओं को बड़ा करती है। एपर्चर आकार प्रकाश की मात्रा और क्षेत्र की गहराई को नियंत्रित करता है, छोटे एपर्चर अधिक सीमा पर तीक्ष्णता बढ़ाते हैं लेकिन चमक कम करते हैं। विवर्तन, प्रकाश की तरंग प्रकृति के कारण, बहुत छोटे एपर्चर पर रिज़ॉल्यूशन को सीमित करता है।
रेडियोमेट्रिक और फोटोमेट्रिक कारक
रेडियोमेट्री प्रकाश स्रोतों से सेंसर तक ऊर्जा स्थानांतरण का वर्णन करती है। प्रत्येक सेंसर पिक्सेल पर विकिरण दृश्य की परावर्तनशीलता, रोशनी की तीव्रता और ऑप्टिकल प्रणाली की संचरण दक्षता पर निर्भर करता है। द्विदिश परावर्तन वितरण फलन (BRDF) यह दर्शाता है कि एक सतह घटना और देखने के कोणों के कार्य के रूप में प्रकाश को कैसे परावर्तित करती है, जो छायांकन और उपस्थिति को प्रभावित करता है। फोटोमेट्रिक प्रभावों में विग्नेटिंग शामिल है, जहां प्रकाश संग्रह में कमी के कारण छवि के किनारे गहरे होते हैं, और लेंस फ्लेयर, आंतरिक प्रतिबिंबों के कारण होता है। सेंसर प्रतिक्रिया, जिसे अक्सर रैखिक या गामा-सुधारित फलन के रूप में मॉडल किया जाता है, आपतित फोटॉनों को डिजिटल मानों में परिवर्तित करती है, जिसमें फोटॉन शॉट शोर और इलेक्ट्रॉनिक रीडआउट शोर से उत्पन्न शोर होता है।
ज्यामितीय परिवर्तन
छवि निर्माण 3D बिंदुओं को 2D निर्देशांक में परिवर्तनों की एक श्रृंखला के माध्यम से मैप करता है: विश्व से कैमरा निर्देशांक (कठोर शरीर घूर्णन और अनुवाद), कैमरा से छवि समतल (परिप्रेक्ष्य प्रक्षेपण), और छवि समतल से पिक्सेल निर्देशांक (स्केलिंग और अनुवाद)। यह सजातीय निर्देशांक में 3x4 प्रक्षेपण मैट्रिक्स के रूप में व्यक्त किया जाता है। लेंस विरूपण, विशेष रूप से रेडियल और स्पर्शरेखा घटक, आदर्श प्रक्षेपण को विकृत करता है और अंशांकन मापदंडों का उपयोग करके ठीक किया जाता है। बहु-कैमरा प्रणालियों के लिए, एपिपोलर ज्यामिति दृश्यों में संबंधित बिंदुओं के बीच संबंध का वर्णन करती है, जिससे गहराई अनुमान और 3D पुनर्निर्माण सक्षम होता है।
डिजिटल सेंसर और नमूनाकरण
आधुनिक डिजिटल कैमरे चार्ज-युग्मित उपकरण (CCD) या पूरक धातु-ऑक्साइड-अर्धचालक (CMOS) सेंसर का उपयोग करते हैं, जो फोटॉनों को विद्युत आवेशों में परिवर्तित करते हैं। प्रत्येक सेंसर तत्व (पिक्सेल) एक्सपोज़र समय पर प्रकाश को एकीकृत करता है, और एक रंग फ़िल्टर सरणी (जैसे बायर पैटर्न) लाल, हरे और नीले तरंग दैर्ध्य का नमूना लेती है। परिणामी मोज़ेक को पूर्ण-रंग छवि उत्पन्न करने के लिए डिमोज़ेक किया जाता है। नमूनाकरण सिद्धांत, न्यक्विस्ट-शैनन प्रमेय द्वारा शासित, यह निर्धारित करता है कि सेंसर का स्थानिक रिज़ॉल्यूशन एलियासिंग से बचने के लिए दृश्य में उच्चतम स्थानिक आवृत्ति से कम से कम दोगुना होना चाहिए। एंटी-एलियासिंग फ़िल्टर, सेंसर से पहले रखे जाते हैं, मोइरे पैटर्न को रोकने के लिए उच्च-आवृत्ति विवरण को धुंधला करते हैं।
कंप्यूटर विज़न और AI में अनुप्रयोग
छवि निर्माण मॉडल कंप्यूटर विज़न के लिए मौलिक हैं। कैमरा अंशांकन, जो आंतरिक और बाहरी मापदंडों का अनुमान लगाता है, संरचना से गति और एक साथ स्थानीयकरण और मानचित्रण (SLAM) जैसे कार्यों के लिए एक पूर्वापेक्षा है। Artificial intelligence और Machine learning में, सिंथेटिक छवि निर्माण Neural network मॉडल के लिए प्रशिक्षण डेटा बनाने के लिए छवि निर्माण के सटीक प्रतिपादन पर निर्भर करता है। Data Augmentation जैसी तकनीकें मॉडल मजबूती में सुधार के लिए प्रकाश, दृष्टिकोण और सेंसर शोर में भिन्नताओं का अनुकरण करती हैं। Deep learning आर्किटेक्चर, जैसे Residual Network (ResNet) और U-Net, अक्सर डीनोइज़िंग, सुपर-रिज़ॉल्यूशन और गहराई भविष्यवाणी जैसे कार्यों के लिए छवियों को संसाधित करते समय एक आगे छवि निर्माण मॉडल मानते हैं। MIT CSAIL और BAIR (Berkeley AI Research) जैसे संस्थानों में अनुसंधान स्वायत्त ड्राइविंग, चिकित्सा इमेजिंग और संवर्धित वास्तविकता में अनुप्रयोगों के लिए इन मॉडलों को परिष्कृत करना जारी रखता है।
ऐतिहासिक विकास
छवि निर्माण की अवधारणा प्राचीन कैमरा ऑब्स्क्यूरा अवलोकनों से जुड़ी है, जहां एक छोटे छेद के माध्यम से प्रकाश एक उल्टा दृश्य प्रक्षेपित करता था। 19वीं शताब्दी में फोटोग्राफिक लेंस का विकास, जोसेफ पेट्ज़वल जैसी हस्तियों द्वारा अग्रणी, ने तीक्ष्णता और प्रकाश संग्रह में सुधार किया। 20वीं शताब्दी में इलेक्ट्रॉनिक सेंसर का आविष्कार देखा गया, जिसमें 1969 में बेल-लैब्स में विलार्ड बॉयल और जॉर्ज स्मिथ द्वारा CCD विकसित किया गया। डिजिटल इमेजिंग 1990 के दशक में व्यापक हो गई, और कम्प्यूटेशनल फोटोग्राफी, जो प्रकाशिकी को पोस्ट-प्रोसेसिंग एल्गोरिदम के साथ जोड़ती है, 2000 के दशक में उभरी। आज, छवि निर्माण मॉडल Generative AI प्रणालियों में एकीकृत हैं जो फोटोरियलिस्टिक छवियों को संश्लेषित करते हैं, उन्हीं भौतिक सिद्धांतों पर निर्माण करते हैं जो वास्तविक कैमरों को नियंत्रित करते हैं।