एक न्यूरल रेडियंस फील्ड, या NeRF, एक त्रि-आयामी दृश्य को तंत्रिका नेटवर्क के अंदर प्रस्तुत करने की एक विधि है। किसी दृश्य के कुछ दर्जन तस्वीरों को ज्ञात कैमरा स्थितियों के साथ देखते हुए, एक NeRF एक फ़ंक्शन सीखता है जो किसी भी 3D निर्देशांक और देखने की दिशा को रंग और घनत्व में मैप करता है; कैमरा किरणों के साथ रेंडरिंग तब दृश्य की फोटोयथार्थवादी छवियाँ उत्पन्न करती है जो कभी कैप्चर नहीं किए गए दृष्टिकोणों से होती हैं। यह तकनीक, जिसे 2020 में बेन मिल्डेनहॉल और UC बर्कले और Google के सहयोगियों द्वारा पेश किया गया था, ने 3D पुनर्निर्माण को गहन शिक्षण समस्या के रूप में पुनः परिभाषित किया और एक बड़ा शोध उपक्षेत्र शुरू किया।
यह कैसे काम करता है
मुख्य मॉडल एक छोटा मल्टीलेयर परसेप्ट्रॉन है जो प्रति दृश्य ग्रेडिएंट डिसेंट के साथ प्रशिक्षित होता है: प्रत्येक प्रशिक्षण फोटो के प्रत्येक पिक्सेल के लिए, कैमरा किरण के साथ बिंदुओं का नमूना लिया जाता है, नेटवर्क प्रत्येक बिंदु पर रंग और घनत्व की भविष्यवाणी करता है, और वॉल्यूमेट्रिक रेंडरिंग उन्हें एक पिक्सेल रंग में संयोजित करती है जिसकी तुलना ग्राउंड ट्रुथ से की जाती है। दृश्य स्वयं नेटवर्क के भार बन जाता है, जो ज्यामिति और उपस्थिति का एक संक्षिप्त और निरंतर प्रतिनिधित्व है जो एक सीखा प्रतिनिधित्व के रूप में संग्रहीत होता है, न कि मेश या वोक्सेल के रूप में।
विकास और उत्तराधिकारी
प्रारंभिक NeRF को प्रशिक्षित होने में घंटों और एक एकल फ्रेम रेंडर करने में सेकंड लगते थे। NVIDIA के Instant-NGP (2022) जैसे अनुवर्ती कार्य ने हैश-ग्रिड एन्कोडिंग और GPU अनुकूलन का उपयोग करके प्रशिक्षण को सेकंड में कम कर दिया, और सैकड़ों वेरिएंट ने गतिशील दृश्यों, प्रतिबिंबों और बड़े पैमाने के वातावरण को संबोधित किया। 2023 में, 3D गाऊसी स्प्लैटिंग ने कई अनुप्रयोगों के लिए NeRF को विस्थापित कर दिया, जो वास्तविक समय रेंडरिंग के साथ तुलनीय गुणवत्ता प्रदान करता है, हालांकि NeRF-शैली के अंतर्निहित प्रतिनिधित्व विश्व मॉडल और रोबोटिक्स सिमुलेशन पर शोध में प्रभावशाली बने हुए हैं।
अनुप्रयोग
NeRF तकनीकें फोटोग्रामेट्री, विज़ुअल इफेक्ट्स, ई-कॉमर्स उत्पाद कैप्चर और मैपिंग में दिखाई देती हैं, जिसमें Google का इमर्सिव व्यू शामिल है। टेक्स्ट-से-3D जनरेशन में उन्होंने अंतर्निहित 3D प्रतिनिधित्व के रूप में कार्य किया जिसे DreamFusion (2022) जैसे प्रारंभिक सिस्टम द्वारा अनुकूलित किया गया था। वे एम्बोडिएड AI और कंप्यूटर विज़न शोध को भी सूचित करते हैं, जहाँ वास्तविक स्थानों के फोटोयथार्थवादी डिजिटल ट्विन का उपयोग सिमुलेशन में रोबोट प्रशिक्षित करने के लिए किया जाता है।