कर्नेल घनत्व अनुमान (KDE) एक गैर-पैरामीट्रिक तकनीक है जिसका उपयोग डेटा बिंदुओं के एक सीमित नमूने के आधार पर एक यादृच्छिक चर के संभाव्यता घनत्व फलन (PDF) का अनुमान लगाने के लिए किया जाता है। पैरामीट्रिक विधियों के विपरीत, जो एक विशिष्ट वितरण (जैसे, सामान्य या घातांकीय) मानती हैं, KDE ऐसी कोई धारणा नहीं बनाता है, जिससे यह जटिल, बहु-मोडल वितरणों को मॉडल करने में सक्षम होता है। अनुमान प्रत्येक डेटा बिंदु पर एक चिकना कर्नेल फलन (आमतौर पर गाऊसी) रखकर और इन योगदानों का औसत निकालकर बनाया जाता है, जिसमें एक बैंडविड्थ पैरामीटर परिणामी वक्र की चिकनाई को नियंत्रित करता है। KDE खोजपूर्ण डेटा विश्लेषण, विज़ुअलाइज़ेशन और विभिन्न Machine learning एल्गोरिदम में एक निर्माण खंड के रूप में मौलिक है।
इस विधि को इसके आधुनिक रूप में 1956 में मरे रोसेनब्लैट और 1962 में इमैनुएल पार्ज़ेन द्वारा पेश किया गया था, और इसे कभी-कभी पार्ज़ेन-रोसेनब्लैट विंडो विधि कहा जाता है। तब से यह सांख्यिकी, अर्थमिति और Artificial intelligence जैसे क्षेत्रों में विसंगति का पता लगाने और घनत्व-आधारित क्लस्टरिंग जैसे कार्यों के लिए एक मानक उपकरण बन गया है।
गणितीय सूत्रीकरण
अज्ञात घनत्व \(f(x)\) से लिए गए स्वतंत्र और समान रूप से वितरित नमूनों \(x_1, x_2, \dots, x_n\) को देखते हुए, कर्नेल घनत्व अनुमानक को इस प्रकार परिभाषित किया गया है:
\[ \hat{f}_h(x) = \frac{1}{n h} \sum_{i=1}^{n} K\left( \frac{x - x_i}{h} \right) \]
जहाँ \(K\) कर्नेल फलन है (एक सममित, गैर-ऋणात्मक फलन जो 1 तक समाकलित होता है) और \(h > 0\) बैंडविड्थ है (जिसे स्मूथिंग पैरामीटर भी कहा जाता है)। सामान्य कर्नेल विकल्पों में गाऊसी कर्नेल \(K(u) = (1/\sqrt{2\pi}) \exp(-u^2/2)\), एपनेचनिकोव कर्नेल और समान कर्नेल शामिल हैं। बैंडविड्थ \(h\) कर्नेल की चौड़ाई निर्धारित करता है और सीधे पूर्वाग्रह-विचरण व्यापार-बंद को प्रभावित करता है: एक छोटा \(h\) कम पूर्वाग्रह लेकिन उच्च विचरण के साथ एक लहरदार अनुमान उत्पन्न करता है, जबकि एक बड़ा \(h\) उच्च पूर्वाग्रह के साथ एक चिकना अनुमान देता है।
बैंडविड्थ की तुलना में कर्नेल का चुनाव अनुमान पर अपेक्षाकृत मामूली प्रभाव डालता है। एपनेचनिकोव कर्नेल माध्य समाकलित वर्ग त्रुटि (MISE) दक्षता के संदर्भ में इष्टतम है, लेकिन गाऊसी कर्नेल अपनी चिकनाई और कम्प्यूटेशनल सुविधा के कारण सबसे व्यापक रूप से उपयोग किया जाता है।
बैंडविड्थ चयन
KDE की गुणवत्ता के लिए उपयुक्त बैंडविड्थ का चयन करना महत्वपूर्ण है। कई डेटा-संचालित विधियाँ मौजूद हैं, जिनमें शामिल हैं:
- सिल्वरमैन का अंगूठे का नियम (1986): गाऊसी कर्नेल के लिए, इष्टतम बैंडविड्थ \(h = 1.06 \, \hat{\sigma} \, n^{-1/5}\) के रूप में अनुमानित है, जहाँ \(\hat{\sigma}\) नमूना मानक विचलन है। यह सरल है लेकिन बहु-मोडल वितरणों को अधिक चिकना कर सकता है।
- स्कॉट का नियम (1992): बहुभिन्नरूपी डेटा के लिए एक समान सूत्र \(h = n^{-1/(d+4)}\), जहाँ \(d\) आयाम है।
- क्रॉस-वैलिडेशन: न्यूनतम वर्ग क्रॉस-वैलिडेशन या संभावना क्रॉस-वैलिडेशन जैसी विधियाँ एक भविष्य कहनेवाला मानदंड को अनुकूलित करके \(h\) का चयन करती हैं, जो अक्सर गैर-सामान्य डेटा के लिए बेहतर प्रदर्शन की ओर ले जाती हैं।
- प्लग-इन विधियाँ: ये घनत्व के अज्ञात कार्यात्मक (जैसे, दूसरा व्युत्पन्न) का अनुमान लगाकर एक स्पर्शोन्मुख रूप से इष्टतम बैंडविड्थ की गणना करती हैं।
व्यवहार में, जटिल डेटा के लिए क्रॉस-वैलिडेशन को प्राथमिकता दी जाती है, जबकि त्वरित अनुमानों के लिए अंगूठे के नियम विधियों का उपयोग किया जाता है।
बहुभिन्नरूपी और अनुकूली KDE
KDE स्वाभाविक रूप से बहुभिन्नरूपी डेटा तक फैलता है, एक बहुभिन्नरूपी कर्नेल का उपयोग करके, जो अक्सर एकपरिमाणीय कर्नेल का उत्पाद या एक सहप्रसरण मैट्रिक्स के साथ बहुभिन्नरूपी गाऊसी होता है। बैंडविड्थ एक बैंडविड्थ मैट्रिक्स बन जाता है, जो पूर्ण या विकर्ण हो सकता है। उच्च-आयामी डेटा के लिए, KDE आयामीता के अभिशाप से ग्रस्त है, क्योंकि आवश्यक नमूनों की संख्या आयाम के साथ तेजी से बढ़ती है, जिससे लगभग 5-10 आयामों से परे अनुमान अविश्वसनीय हो जाता है।
अनुकूली KDE नमूना स्थान में बैंडविड्थ को भिन्न होने की अनुमति देता है, कम डेटा घनत्व वाले क्षेत्रों में एक बड़ा बैंडविड्थ और घने डेटा वाले क्षेत्रों में एक छोटा बैंडविड्थ का उपयोग करता है। यह भारी-पूंछ वाले या तिरछे वितरणों के लिए प्रदर्शन में सुधार करता है। अब्रामसन नियम (1982) पायलट घनत्व अनुमानों के आधार पर स्थानीय बैंडविड्थ सेट करने के लिए एक सामान्य विधि है।
मशीन लर्निंग और AI में अनुप्रयोग
KDE का उपयोग Machine learning और Artificial intelligence के कई क्षेत्रों में किया जाता है:
- विसंगति का पता लगाना: सामान्य डेटा के घनत्व का अनुमान लगाकर, बहुत कम अनुमानित घनत्व वाले बिंदुओं को आउटलायर के रूप में चिह्नित किया जा सकता है। यह नेटवर्क घुसपैठ का पता लगाने, धोखाधड़ी का पता लगाने और औद्योगिक गुणवत्ता नियंत्रण में लागू किया जाता है।
- डेटा विज़ुअलाइज़ेशन: KDE प्लॉट (जैसे, seaborn या R के ggplot2 में) एकपरिमाणीय या द्विचर डेटा के वितरण प्रदर्शित करने के लिए मानक हैं, अक्सर चिकने हिस्टोग्राम या समोच्च प्लॉट के रूप में।
- क्लस्टरिंग: मीन-शिफ्ट क्लस्टरिंग, एक गैर-पैरामीट्रिक एल्गोरिदम, घनत्व के मोड खोजने के लिए KDE का उपयोग करता है, जो क्लस्टर केंद्रों के रूप में कार्य करते हैं। यह छवि विभाजन और कंप्यूटर विज़न में उपयोग किया जाता है।
- बायेसियन अनुमान: KDE का उपयोग जटिल मॉडलों में पश्च वितरणों का अनुमान लगाने के लिए किया जा सकता है, विशेष रूप से अनुमानित बायेसियन गणना (ABC) में।
- जनरेटिव मॉडलिंग: कुछ Generative AI दृष्टिकोण डेटा वितरण को मॉडल करने के लिए KDE का उपयोग करते हैं, हालांकि Neural network-आधारित जनरेटिव मॉडल जैसी आधुनिक गहन शिक्षण विधियों ने उच्च-आयामी डेटा के लिए इसे काफी हद तक बदल दिया है।
KDE गैर-पैरामीट्रिक सांख्यिकी में एक मौलिक अवधारणा भी है, जिसे अक्सर सांख्यिकीय शिक्षण पाठ्यक्रमों में Residual Network (ResNet) (हालांकि असंबंधित) और Loss Functions जैसी विधियों के साथ पढ़ाया जाता है।
कम्प्यूटेशनल विचार और सॉफ्टवेयर
KDE की गणना करने के लिए प्रत्येक क्वेरी बिंदु के लिए \(n\) डेटा बिंदुओं में से प्रत्येक पर कर्नेल का मूल्यांकन करना आवश्यक है, जिससे \(m\) मूल्यांकन बिंदुओं के लिए \(O(n m)\) जटिलता होती है। बड़े डेटासेट के लिए, यह निषेधात्मक हो सकता है। कुशल कार्यान्वयन समान रूप से दूरी वाले ग्रिड के लिए तेज़ फूरियर ट्रांसफॉर्म (FFT) या कर्नेल मूल्यांकन की संख्या को कम करने के लिए पेड़-आधारित विधियों (जैसे, KD-पेड़) का उपयोग करते हैं। Python में SciPy, scikit-learn और statsmodels जैसी लाइब्रेरी अनुकूलित KDE फलन प्रदान करती हैं, जैसा कि R और MATLAB करते हैं।
Deep learning के संदर्भ में, KDE का उपयोग कभी-कभी अव्यक्त स्थानों में घनत्व अनुमान या उत्पन्न नमूनों की गुणवत्ता का मूल्यांकन करने के लिए किया जाता है, हालांकि उच्च-आयामी कार्यों के लिए सामान्यीकरण प्रवाह और परिवर्तनशील ऑटोएन्कोडर जैसे विकल्प अधिक सामान्य हैं।
सीमाएँ और विस्तार
KDE की कई सीमाएँ हैं: यह बैंडविड्थ विकल्प के प्रति संवेदनशील है, उच्च आयामों में ग्रस्त है, और सीमा पूर्वाग्रह उत्पन्न कर सकता है जब घनत्व का समर्थन बाध्य होता है (जैसे, केवल-सकारात्मक डेटा)। विस्तार में सीमाओं को संभालने के लिए प्रतिबिंब विधियाँ या परिवर्तन-आधारित दृष्टिकोण और अनुकूली स्मूथिंग के लिए परिवर्तनीय कर्नेल का उपयोग शामिल है। इन मुद्दों के बावजूद, KDE घनत्व अनुमान के लिए एक मजबूत और व्याख्या योग्य उपकरण बना हुआ है, जिसमें एक समृद्ध सैद्धांतिक आधार और सांख्यिकी और Machine learning में व्यापक व्यावहारिक प्रयोज्यता है।