ईजेनफेस एक कंप्यूटर विज़न तकनीक है जो चेहरे की पहचान और छवि संपीड़न के लिए उपयोग की जाती है, जो चेहरे की छवियों को आधार छवियों के भारित संयोजन के रूप में प्रस्तुत करती है, जिन्हें ईजेनफेस कहा जाता है। 1980 के दशक के अंत और 1990 के दशक की शुरुआत में विकसित, यह चेहरे की छवियों के संग्रह पर प्रिंसिपल कंपोनेंट एनालिसिस (PCA) लागू करती है, जो भिन्नता के सबसे महत्वपूर्ण पैटर्न निकालती है। फिर प्रत्येक चेहरे को गुणांकों के एक छोटे वेक्टर द्वारा वर्णित किया जाता है, जिससे कुशल तुलना, पुनर्निर्माण और वर्गीकरण संभव होता है। यह विधि मशीन लर्निंग के क्षेत्र में आधारभूत थी और छवि प्रसंस्करण में आयाम कटौती का एक क्लासिक उदाहरण बनी हुई है।
यह दृष्टिकोण प्रत्येक चेहरे की छवि को एक उच्च-आयामी वेक्टर के रूप में मानता है (उदाहरण के लिए, एक 100x100 पिक्सेल छवि 10,000-आयामी वेक्टर बन जाती है)। PCA प्रशिक्षण सेट में संरेखित चेहरों के बीच अधिकतम विचरण की दिशाओं की पहचान करता है। ये दिशाएँ, जब छवियों में पुनः आकार दी जाती हैं, भूतिया चेहरे की विशेषताओं के रूप में दिखाई देती हैं और ईजेनफेस कहलाती हैं। एक नया चेहरा इस उप-स्थान पर प्रक्षेपित किया जाता है, जिससे एक संक्षिप्त प्रस्तुति मिलती है जो उसकी पहचान को पकड़ती है जबकि प्रकाश और पृष्ठभूमि जैसी अप्रासंगिक विवरणों को हटा देती है।
ऐतिहासिक विकास
ईजेनफेस विधि को मैथ्यू टर्क और एलेक्स पेंटलैंड द्वारा 1991 में "ईजेनफेस फॉर रिकग्निशन" शीर्षक से जर्नल ऑफ कॉग्निटिव न्यूरोसाइंस में प्रकाशित एक पेपर में पेश किया गया था। उनका काम ब्राउन यूनिवर्सिटी में सिरोविच और किर्बी (1987) के पहले के शोध पर आधारित था, जिन्होंने प्रदर्शित किया कि चेहरे की छवियों को प्रिंसिपल कंपोनेंट्स का उपयोग करके कुशलता से प्रस्तुत किया जा सकता है। टर्क और पेंटलैंड ने इसे स्वचालित चेहरे की पहचान तक विस्तारित किया, जिससे 16 विषयों के डेटाबेस पर उच्च सटीकता प्राप्त हुई। यह तकनीक कंप्यूटर विज़न के पहले व्यावहारिक अनुप्रयोगों में से एक के रूप में प्रमुखता से उभरी और फिशरफेस और लोकल-बाइनरी-पैटर्न जैसी बाद की विधियों को प्रभावित किया।
गणितीय आधार
इसके मूल में, ईजेनफेस PCA पर निर्भर करता है, एक सांख्यिकीय प्रक्रिया जो सहसंबद्ध चरों को कम संख्या में असंबद्ध चरों में बदलती है जिन्हें प्रिंसिपल कंपोनेंट्स कहा जाता है। N चेहरे की छवियों के प्रशिक्षण सेट के लिए, प्रत्येक M पिक्सेल आकार का, एल्गोरिदम माध्य चेहरे और केंद्रित छवियों के सहप्रसरण मैट्रिक्स की गणना करता है। इस सहप्रसरण मैट्रिक्स के eigenvectors, उनके eigenvalues द्वारा क्रमबद्ध, भिन्नता के प्रमुख मोड का प्रतिनिधित्व करते हैं। आमतौर पर, केवल शीर्ष K eigenvectors (जहाँ K, M से बहुत छोटा है) बनाए रखे जाते हैं, जो अधिकांश विचरण को पकड़ते हैं। यह आयामीता को M से K तक कम करता है, जिससे तेज़ गणना और भंडारण संभव होता है।
एक चेहरे की छवि x का ईजेनफेस उप-स्थान पर प्रक्षेपण शीर्ष K eigenvectors के साथ डॉट उत्पादों द्वारा दिया जाता है। ये गुणांक एक फीचर वेक्टर बनाते हैं जो चेहरे को विशिष्ट रूप से चित्रित करता है। पुनर्निर्माण माध्य चेहरे और भारित ईजेनफेस को जोड़कर प्राप्त किया जाता है, जिसमें K बढ़ने पर अनुमान त्रुटि घटती है। यह रैखिक मॉडल मानता है कि चेहरे एक निम्न-आयामी मैनिफोल्ड पर स्थित हैं, जो सुसंगत प्रकाश के तहत सामने से और संरेखित छवियों के लिए लगभग सही है।
अनुप्रयोग और सीमाएँ
ईजेनफेस का व्यापक रूप से प्रारंभिक चेहरे की पहचान प्रणालियों में उपयोग किया गया था, जिसमें 1990 के दशक में सुरक्षा और निगरानी अनुप्रयोग शामिल थे। वे छवि संपीड़न में भी उपयोगी पाए गए, जहाँ पूर्ण पिक्सेल डेटा के बजाय गुणांकों का एक छोटा सेट संग्रहीत करने से भंडारण आवश्यकताएँ कम होती हैं। हालाँकि, विधि की उल्लेखनीय सीमाएँ हैं। यह प्रकाश, मुद्रा और चेहरे की अभिव्यक्ति में भिन्नता के प्रति संवेदनशील है, क्योंकि ये गैर-रैखिक परिवर्तन पेश करते हैं जिन्हें PCA अच्छी तरह से नहीं पकड़ सकता। प्रशिक्षण सेट में चेहरों का गलत संरेखण प्रदर्शन को काफी कम कर देता है। तकनीक को स्थिर ईजेनफेस उत्पन्न करने के लिए अपेक्षाकृत बड़े प्रशिक्षण सेट की भी आवश्यकता होती है, और यह मानती है कि चेहरे लगभग सामने की ओर और समान रूप से स्केल किए गए हैं।
इन कमियों के बावजूद, ईजेनफेस ने अधिक मजबूत दृष्टिकोणों की नींव रखी। फिशरफेस (रैखिक भेदभाव विश्लेषण का उपयोग करके) और कर्नेल PCA जैसे विस्तारों ने कक्षा जानकारी या गैर-रैखिक मैपिंग शामिल करके कुछ सीमाओं को संबोधित किया। आधुनिक डीप लर्निंग विधियाँ, विशेष रूप से न्यूरल नेटवर्क और कन्वोल्यूशनल न्यूरल नेटवर्क, ने व्यावहारिक प्रणालियों में ईजेनफेस को काफी हद तक बदल दिया है, जो बड़े पैमाने के डेटासेट पर बेहतर सटीकता प्राप्त करते हैं। फिर भी, ईजेनफेस आर्टिफिशियल इंटेलिजेंस शिक्षा में एक शैक्षणिक आधारशिला बने हुए हैं, जो फीचर निष्कर्षण और आयाम कटौती की मुख्य अवधारणाओं को दर्शाते हैं।
विरासत और प्रभाव
ईजेनफेस विधि ने न केवल चेहरे की पहचान को प्रभावित किया, बल्कि वस्तु पहचान और चिकित्सा इमेजिंग जैसे व्यापक क्षेत्रों को भी प्रभावित किया। डेटा से निम्न-आयामी उप-स्थान सीखने का इसका सिद्धांत कई अनसुपरवाइज्ड लर्निंग तकनीकों के लिए एक टेम्पलेट बन गया। MIT CSAIL और कार्नेगी मेलन यूनिवर्सिटी जैसे संस्थानों के शोधकर्ताओं ने इस काम पर आधार बनाया, जिससे कंप्यूटर विज़न और पैटर्न रिकग्निशन में प्रगति हुई। तकनीक ने अन्य वस्तु वर्गों के लिए ईजेनफीचर्स के विकास को भी प्रेरित किया, जैसे ईजेनहैंड्स और ईजेनजीन्स, इसकी सामान्यता को प्रदर्शित करते हुए।
जेनरेटिव AI के युग में, एक अव्यक्त स्थान में छवियों का प्रतिनिधित्व करने की अवधारणा ईजेनफेस विचार को प्रतिध्वनित करती है। वैरिएशनल ऑटोएनकोडर और जेनरेटिव एडवर्सेरियल नेटवर्क गैर-रैखिक अव्यक्त प्रतिनिधित्व सीखते हैं, लेकिन संक्षिप्त, सार्थक एन्कोडिंग का मौलिक लक्ष्य वही रहता है। इस प्रकार, ईजेनफेस शास्त्रीय सांख्यिकीय विधियों और आधुनिक डीप लर्निंग प्रतिमानों के बीच एक ऐतिहासिक पुल के रूप में कार्य करते हैं।
व्यावहारिक कार्यान्वयन
ईजेनफेस को लागू करने में कई चरण शामिल हैं: संरेखित चेहरे की छवियों के डेटासेट को एकत्र करना और प्रीप्रोसेस करना, माध्य और सहप्रसरण की गणना करना, eigenvectors निकालना, और नई छवियों को प्रक्षेपित करना। OpenCV और scikit-learn जैसी लाइब्रेरी अंतर्निहित PCA फ़ंक्शन प्रदान करती हैं, जिससे तकनीक शैक्षिक परियोजनाओं के लिए सुलभ हो जाती है। एक विशिष्ट कार्यान्वयन 1000 चेहरों के डेटासेट का प्रतिनिधित्व करने के लिए 100 ईजेनफेस का उपयोग कर सकता है, जो मान्यता के लिए पर्याप्त विवरण बनाए रखते हुए 100:1 का संपीड़न अनुपात प्राप्त करता है। कम्प्यूटेशनल लागत ईजेन-डीकंपोजिशन द्वारा हावी है, जो भोले कार्यान्वयन के लिए O(M^2 N) के रूप में स्केल करती है, लेकिन डेटा मैट्रिक्स पर सीधे सिंगुलर वैल्यू डीकंपोजिशन (SVD) का उपयोग करके कम किया जा सकता है।
वास्तविक समय के अनुप्रयोगों के लिए, प्रक्षेपण चरण तेज़ है, जिसमें केवल बनाए रखे गए ईजेनफेस के साथ डॉट उत्पाद शामिल हैं। इस दक्षता ने ईजेनफेस को प्रारंभिक एम्बेडेड सिस्टम और मोबाइल उपकरणों के लिए आकर्षक बना दिया, हालाँकि आधुनिक हार्डवेयर और एल्गोरिदम ने ध्यान डीप लर्निंग मॉडल पर स्थानांतरित कर दिया है। फिर भी, ईजेनफेस नए चेहरे की पहचान एल्गोरिदम की बेंचमार्किंग और सरलता और प्रदर्शन के बीच व्यापार-नापसंद को समझने के लिए एक मूल्यवान आधार रेखा बने हुए हैं।