प्रिंसिपल कंपोनेंट एनालिसिस (पीसीए) एक सांख्यिकीय प्रक्रिया है जो एक ऑर्थोगोनल ट्रांसफॉर्मेशन का उपयोग करके संभावित रूप से सहसंबंधित चरों के अवलोकनों के एक सेट को रैखिक रूप से असंबंधित चरों के मानों के एक सेट में परिवर्तित करती है, जिन्हें प्रिंसिपल कंपोनेंट्स कहा जाता है। ट्रांसफॉर्मेशन को इस प्रकार परिभाषित किया गया है कि पहले प्रिंसिपल कंपोनेंट में सबसे बड़ा संभव विचरण हो (अर्थात, डेटा में जितनी संभव हो उतनी परिवर्तनशीलता के लिए जिम्मेदार हो), और प्रत्येक अगला कंपोनेंट इस बाधा के तहत उच्चतम संभव विचरण रखता है कि यह पिछले कंपोनेंट्स के लिए ऑर्थोगोनल है। पीसीए मशीन लर्निंग और डेटा साइंस में सबसे मौलिक तकनीकों में से एक है, जिसका उपयोग खोजपूर्ण डेटा विश्लेषण, आयामीता में कमी और फीचर निष्कर्षण के लिए किया जाता है।
यह विधि 1901 में कार्ल पियर्सन द्वारा पेश की गई थी और बाद में 1933 में हेरोल्ड हॉटेलिंग द्वारा स्वतंत्र रूप से विकसित की गई। यह करहुनेन-लोएव ट्रांसफॉर्म और सिंगुलर वैल्यू डिकंपोज़िशन (एसवीडी) से भी निकटता से संबंधित है। पीसीए को अक्सर अन्य एल्गोरिदम से पहले लागू किया जाता है ताकि फीचर्स की संख्या कम हो सके, आयामीता के अभिशाप को कम किया जा सके, और कम्प्यूटेशनल दक्षता में सुधार हो सके। यह एक रैखिक विधि है, जिसका अर्थ है कि यह मानता है कि अंतर्निहित संरचना एक रैखिक उप-स्थान पर स्थित है, जो अत्यधिक अरैखिक डेटा के लिए एक सीमा है।
गणितीय सूत्रीकरण
एक डेटा मैट्रिक्स X को देखते हुए जिसमें n अवलोकन और p चर हैं, पीसीए p ऑर्थोगोनल वैक्टर (प्रिंसिपल कंपोनेंट लोडिंग) का एक सेट खोजता है जो प्रक्षेपित डेटा के विचरण को अधिकतम करते हैं। पहला प्रिंसिपल कंपोनेंट अधिकतम विचरण की दिशा है, दूसरा पहले के लिए ऑर्थोगोनल है और अगला उच्चतम विचरण प्राप्त करता है, और इसी तरह। गणितीय रूप से, प्रिंसिपल कंपोनेंट्स डेटा के सहप्रसरण मैट्रिक्स के आइजनवेक्टर हैं, और संबंधित आइजनवैल्यू प्रत्येक कंपोनेंट द्वारा समझाए गए विचरण की मात्रा को इंगित करते हैं।
गणना में आम तौर पर डेटा को केंद्रित करना (प्रत्येक चर का माध्य घटाना) और वैकल्पिक रूप से स्केलिंग (मानक विचलन से विभाजित करना) शामिल है ताकि यह सुनिश्चित हो सके कि चर तुलनीय हैं। फिर सहप्रसरण मैट्रिक्स की गणना की जाती है, और इसके आइजनवेक्टर और आइजनवैल्यू पाए जाते हैं। वैकल्पिक रूप से, पीसीए को केंद्रित डेटा मैट्रिक्स पर एसवीडी का उपयोग करके किया जा सकता है, जो संख्यात्मक रूप से अधिक स्थिर है, खासकर जब चरों की संख्या बड़ी हो।
आयामीता में कमी और विचरण की व्याख्या
पीसीए के प्राथमिक उपयोगों में से एक आयामीता में कमी है। केवल पहले k प्रिंसिपल कंपोनेंट्स (जहां k, p से बहुत छोटा है) का चयन करके, कोई डेटा को कम आयामों के साथ प्रस्तुत कर सकता है जबकि अधिकांश विचरण को बनाए रखता है। प्रत्येक कंपोनेंट द्वारा समझाए गए विचरण का अनुपात उसके आइजनवैल्यू को सभी आइजनवैल्यू के योग से विभाजित करके दिया जाता है। एक सामान्य अनुमान यह है कि k को इस प्रकार चुना जाए कि संचयी समझाया गया विचरण एक सीमा तक पहुंच जाए, जैसे कि 95%।
यह कमी विशेष रूप से उच्च-आयामी सेटिंग्स में उपयोगी है, जैसे कि जीनोमिक्स या इमेज प्रोसेसिंग, जहां फीचर्स की संख्या हजारों या लाखों में हो सकती है। पीसीए डेटा को दो या तीन आयामों में देखने, छिपी हुई संरचना को प्रकट करने और कम विचरण वाले कंपोनेंट्स को हटाकर शोर को कम करने में मदद कर सकता है, जो अक्सर शोर से जुड़े होते हैं।
मशीन लर्निंग में अनुप्रयोग
पीसीए का व्यापक रूप से मशीन लर्निंग पाइपलाइनों में प्रीप्रोसेसिंग चरण के रूप में उपयोग किया जाता है। यह उन एल्गोरिदम के प्रदर्शन में सुधार कर सकता है जो सहसंबंधित फीचर्स के प्रति संवेदनशील हैं, जैसे कि रैखिक प्रतिगमन और लॉजिस्टिक प्रतिगमन। यह मापदंडों की संख्या कम करके ओवरफिटिंग को कम करने में भी मदद करता है। डीप लर्निंग में, पीसीए का उपयोग कभी-कभी न्यूरल नेटवर्क में डेटा फीड करने से पहले फीचर निष्कर्षण के लिए किया जाता है, हालांकि आधुनिक नेटवर्क अक्सर उच्च-आयामी इनपुट को सीधे संभालते हैं।
कंप्यूटर विज़न में, पीसीए का उपयोग चेहरे की पहचान (ईजेनफेस) के लिए किया जाता है, जहां प्रत्येक चेहरे की छवि को निचले-आयामी उप-स्थान पर प्रक्षेपित किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, पीसीए को शब्द एम्बेडिंग पर लागू किया जा सकता है ताकि उनकी आयामीता कम हो सके। वित्त में, पीसीए का उपयोग परिसंपत्ति रिटर्न को चलाने वाले मुख्य कारकों की पहचान करने के लिए किया जाता है। बायोइन्फॉर्मेटिक्स में, पीसीए जीन अभिव्यक्ति डेटा और जनसंख्या आनुवंशिकी का विश्लेषण करने के लिए एक मानक उपकरण है।
अन्य तकनीकों से संबंध
पीसीए कारक विश्लेषण से निकटता से संबंधित है, लेकिन वे इस मायने में भिन्न हैं कि कारक विश्लेषण चरों के बीच सहसंबंधों की व्याख्या करने वाले अव्यक्त कारकों के अस्तित्व को मानता है, जबकि पीसीए एक विशुद्ध रूप से वर्णनात्मक तकनीक है जो किसी अंतर्निहित मॉडल को नहीं मानती है। पीसीए बहुआयामी स्केलिंग (एमडीएस) से भी संबंधित है, जिसका उद्देश्य जोड़ीवार दूरियों को संरक्षित करना है, और टी-वितरित स्टोकेस्टिक नेबर एम्बेडिंग (टी-एसएनई) से, जो अक्सर विज़ुअलाइज़ेशन के लिए उपयोग की जाने वाली एक अरैखिक तकनीक है।
आर्टिफिशियल इंटेलिजेंस के संदर्भ में, पीसीए की तुलना अक्सर ऑटोएनकोडर से की जाती है, जो न्यूरल नेटवर्क हैं जो एक अरैखिक निम्न-आयामी प्रतिनिधित्व सीखते हैं। जबकि पीसीए रैखिक है और इसका एक बंद-रूप समाधान है, ऑटोएनकोडर अरैखिक संरचनाओं को पकड़ सकते हैं लेकिन पुनरावृत्त अनुकूलन की आवश्यकता होती है। बड़े पैमाने पर डेटा के लिए, अनुमानित प्रिंसिपल कंपोनेंट्स की कुशलता से गणना करने के लिए यादृच्छिक पीसीए एल्गोरिदम विकसित किए गए हैं।
व्यावहारिक विचार और सीमाएं
पीसीए मानता है कि डेटा केंद्रित है और प्रिंसिपल कंपोनेंट्स ऑर्थोगोनल हैं। यह चरों के स्केलिंग के प्रति संवेदनशील है; इसलिए, डेटा को मानकीकृत करना (जेड-स्कोर सामान्यीकरण) अक्सर अनुशंसित किया जाता है, खासकर जब चर विभिन्न इकाइयों में मापे जाते हैं। पीसीए आउटलायर्स के प्रति भी संवेदनशील है, जो अधिकतम विचरण की दिशा को असमान रूप से प्रभावित कर सकते हैं। इस मुद्दे को संबोधित करने के लिए रोबस्ट पीसीए वेरिएंट विकसित किए गए हैं।
एक और सीमा यह है कि पीसीए एक रैखिक विधि है, इसलिए यह अरैखिक संबंधों को पकड़ने में विफल हो सकता है। ऐसे मामलों में, कर्नेल पीसीए या अन्य अरैखिक आयामीता में कमी तकनीकें अधिक उपयुक्त हो सकती हैं। इसके अतिरिक्त, प्रिंसिपल कंपोनेंट्स हमेशा व्याख्या योग्य नहीं होते हैं, क्योंकि वे सभी मूल चरों के रैखिक संयोजन होते हैं, जिन्हें डोमेन-विशिष्ट शब्दों में समझाना मुश्किल हो सकता है।
सॉफ्टवेयर और कार्यान्वयन
पीसीए अधिकांश सांख्यिकीय और मशीन लर्निंग लाइब्रेरीज़ में लागू किया गया है। पायथन में, स्किकिट-लर्न लाइब्रेरी एक पीसीए क्लास प्रदान करती है जो एसवीडी का उपयोग करती है। आर में, prcomp और princomp फ़ंक्शन आमतौर पर उपयोग किए जाते हैं। MATLAB और जूलिया में भी पीसीए के लिए अंतर्निहित फ़ंक्शन हैं। बहुत बड़े डेटासेट के लिए, अपाचे स्पार्क का एमएललिब वितरित पीसीए कार्यान्वयन प्रदान करता है।
ऐतिहासिक संदर्भ और प्रमुख योगदानकर्ता
कार्ल पियर्सन, एक ब्रिटिश गणितज्ञ और सांख्यिकीविद्, ने 1901 में "ऑन लाइन्स एंड प्लेन्स ऑफ क्लोसेस्ट फिट टू सिस्टम्स ऑफ पॉइंट्स इन स्पेस" शीर्षक वाले एक पेपर में पीसीए पेश किया। हेरोल्ड हॉटेलिंग, एक अमेरिकी सांख्यिकीविद्, ने बाद में 1933 में विधि को औपचारिक रूप दिया और "प्रिंसिपल कंपोनेंट्स" शब्द गढ़ा। यह विधि तब से बहुभिन्नरूपी सांख्यिकी और डेटा विश्लेषण की आधारशिला बन गई है।
1980 और 1990 के दशक में, पीसीए ने चेहरे की पहचान के लिए ईजेनफेस के विकास के साथ कंप्यूटर विज़न के क्षेत्र में प्रमुखता प्राप्त की। हाल ही में, पीसीए को आधुनिक मशीन लर्निंग वर्कफ़्लो में एकीकृत किया गया है और लगभग हर परिचयात्मक डेटा साइंस पाठ्यक्रम में पढ़ाया जाता है। यह अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें स्पार्स पीसीए, रोबस्ट पीसीए और प्रोबेबिलिस्टिक पीसीए जैसे विस्तार शामिल हैं।
निष्कर्ष
प्रिंसिपल कंपोनेंट एनालिसिस डेटा की आयामीता को कम करने के लिए एक शक्तिशाली और बहुमुखी उपकरण है, जबकि जितना संभव हो उतना विचरण संरक्षित करता है। इसकी सरलता, गणितीय सुंदरता और व्यापक प्रयोज्यता इसे किसी भी डेटा वैज्ञानिक या मशीन लर्निंग व्यवसायी के टूलकिट में एक आवश्यक तकनीक बनाती है। अपनी रैखिक प्रकृति और कुछ सीमाओं के बावजूद, पीसीए का उपयोग आर्टिफिशियल इंटेलिजेंस से लेकर वित्त और जीव विज्ञान तक कई डोमेन में डेटा अन्वेषण, प्रीप्रोसेसिंग और विज़ुअलाइज़ेशन के लिए व्यापक रूप से जारी है।