अंग्रेज़ी से अनुवादित

Naive Bayes वर्गीकारक प्रोबेबिलिस्टिक वर्गीकारकों का एक परिवार है जो वर्ग दिए जाने पर विशेषताओं की स्वतंत्रता मान लेते हैं, जिससे अवास्तविक धारणाओं के बावजूद कुशल और स्केलेबल वर्गीकरण संभव होता है।

Naive Bayes वर्गीकरणकर्ता Machine learning में प्रोबेबिलिस्टिक वर्गीकरणकर्ताओं का एक परिवार है जो Bayes के प्रमेय के आधार पर उदाहरणों को वर्ग लेबल प्रदान करते हैं, जिसमें एक प्रमुख सरलीकरण धारणा होती है: लक्ष्य वर्ग दिए जाने पर विशेषताएँ सशर्त रूप से स्वतंत्र होती हैं। यह धारणा, जिसे अक्सर naive स्वतंत्रता धारणा कहा जाता है, का अर्थ है कि प्रत्येक विशेषता वर्ग की प्रायिकता में स्वतंत्र रूप से योगदान करती है, विशेषताओं के बीच किसी भी सहसंबंध को अनदेखा करते हुए। इस अति-सरलीकरण के बावजूद, naive Bayes वर्गीकरणकर्ता कई वास्तविक-विश्व अनुप्रयोगों में प्रभावी साबित हुए हैं, विशेष रूप से पाठ वर्गीकरण और स्पैम फ़िल्टरिंग में, और वे क्षेत्र में एक मौलिक आधार रेखा बने हुए हैं।

"naive" नाम स्वतंत्रता धारणा की अवास्तविक प्रकृति को दर्शाता है, क्योंकि वास्तविक-विश्व विशेषताएँ अक्सर सहसंबद्ध होती हैं। फिर भी, मॉडल की सरलता महत्वपूर्ण कम्प्यूटेशनल लाभ लाती है। naive Bayes वर्गीकरणकर्ता को प्रशिक्षित करने में आम तौर पर अवलोकनों की गिनती करके पैरामीटरों का अनुमान लगाना शामिल होता है, जो अधिकतम संभावना अनुमान के तहत एक बंद-रूप अभिव्यक्ति के साथ किया जा सकता है, जिससे कई अन्य मॉडलों द्वारा आवश्यक पुनरावृत्तीय अनुकूलन से बचा जा सकता है। यह naive Bayes को अत्यधिक स्केलेबल बनाता है, जिसमें आवश्यक पैरामीटरों का अनुमान लगाने के लिए केवल थोड़ी मात्रा में प्रशिक्षण डेटा की आवश्यकता होती है।

यह ध्यान रखना महत्वपूर्ण है कि Bayes के प्रमेय का उपयोग करने के बावजूद, naive Bayes आवश्यक रूप से एक Bayesian विधि नहीं है। मॉडल को Bayesian या frequentist दृष्टिकोणों का उपयोग करके फिट किया जा सकता है, और "naive" शब्द स्वतंत्रता धारणा को संदर्भित करता है, न कि सांख्यिकीय दर्शन को।

ऐतिहासिक पृष्ठभूमि

naive Bayes की उत्पत्ति 18वीं शताब्दी में Thomas Bayes के कार्य से जुड़ी है, जिन्होंने वह प्रमेय तैयार किया जो उनका नाम रखता है। हालाँकि, स्वतंत्रता धारणा के साथ वर्गीकरण के लिए Bayes के प्रमेय का विशिष्ट अनुप्रयोग बहुत बाद में उभरा। 1950 और 1960 के दशक में, पैटर्न पहचान और सूचना पुनर्प्राप्ति के शोधकर्ताओं ने प्रोबेबिलिस्टिक वर्गीकरणकर्ताओं की खोज शुरू की। एक उल्लेखनीय प्रारंभिक अनुप्रयोग 1960 के दशक में था, जब naive Bayes का उपयोग पाठ वर्गीकरण के लिए किया गया था, विशेष रूप से दस्तावेज़ पुनर्प्राप्ति प्रणालियों के संदर्भ में।

वर्गीकरणकर्ता ने 1990 के दशक में स्पैम फ़िल्टरिंग के उदय के साथ प्रमुखता प्राप्त की। 1998 में, Sahami और Stanford AI Lab के सहयोगियों ने ईमेल स्पैम पहचान के लिए naive Bayes की प्रभावशीलता प्रदर्शित की, जो एक विहित उपयोग मामला बन गया। तब से, naive Bayes को विभिन्न डोमेन में व्यापक रूप से अपनाया गया है, जिसमें चिकित्सा निदान, भावना विश्लेषण और अनुशंसा प्रणालियाँ शामिल हैं।

प्रोबेबिलिस्टिक मॉडल

इसके मूल में, naive Bayes एक सशर्त प्रायिकता मॉडल है। एक विशेषता वेक्टर \(\mathbf{x} = (x_1, \ldots, x_n)\) द्वारा प्रदर्शित उदाहरण के लिए, वर्गीकरणकर्ता Bayes के प्रमेय का उपयोग करके प्रत्येक वर्ग \(C_k\) की प्रायिकता की गणना करता है:

\[ p(C_k \mid \mathbf{x}) = \frac{p(C_k) \, p(\mathbf{x} \mid C_k)}{p(\mathbf{x})} \]

व्यवहार में, हर \(p(\mathbf{x})\) किसी दिए गए उदाहरण के लिए स्थिर होता है, इसलिए निर्णय नियम अंश पर केंद्रित होता है। अंश संयुक्त प्रायिकता \(p(C_k, x_1, \ldots, x_n)\) है, जो naive स्वतंत्रता धारणा के तहत इस प्रकार कारकित होती है:

\[ p(C_k) \prod_{i=1}^{n} p(x_i \mid C_k) \]

यह कारकीकरण अनुमान लगाने के लिए पैरामीटरों की संख्या को नाटकीय रूप से कम कर देता है। पूर्ण संयुक्त वितरण को मॉडल करने के बजाय, वर्गीकरणकर्ता को केवल पूर्व प्रायिकता \(p(C_k)\) और प्रत्येक विशेषता और वर्ग के लिए सशर्त प्रायिकताओं \(p(x_i \mid C_k)\) का अनुमान लगाने की आवश्यकता होती है। यह आम तौर पर प्रशिक्षण डेटा में आवृत्तियों की गिनती करके किया जाता है, जिससे मॉडल को लागू करना और अद्यतन करना आसान हो जाता है।

प्रशिक्षण और पैरामीटर अनुमान

naive Bayes वर्गीकरणकर्ता को प्रशिक्षित करने में लेबल किए गए प्रशिक्षण डेटा से पूर्व प्रायिकताओं और सशर्त प्रायिकताओं का अनुमान लगाना शामिल है। अधिकतम संभावना अनुमान के लिए, वर्ग \(C_k\) के लिए पूर्व प्रायिकता उस वर्ग से संबंधित प्रशिक्षण उदाहरणों के अनुपात के रूप में अनुमानित की जाती है। सशर्त प्रायिकता \(p(x_i \mid C_k)\) विशेषता प्रकार के आधार पर अनुमानित की जाती है:

  • श्रेणीबद्ध विशेषताओं के लिए, यह वर्ग के भीतर प्रत्येक मान की आवृत्ति है।
  • सतत विशेषताओं के लिए, एक सामान्य दृष्टिकोण Gaussian वितरण मानना और प्रत्येक वर्ग के लिए माध्य और प्रसरण का अनुमान लगाना है।

एक चुनौती शून्य-आवृत्ति समस्या है: यदि कोई विशेषता मान किसी दिए गए वर्ग के लिए प्रशिक्षण डेटा में कभी नहीं दिखाई देता है, तो अनुमानित प्रायिकता शून्य हो जाती है, जो उत्पाद पर हावी हो सकती है और खराब भविष्यवाणियों की ओर ले जा सकती है। इसे संबोधित करने के लिए, Laplace स्मूथिंग (add-one स्मूथिंग) जैसी स्मूथिंग तकनीकें अक्सर लागू की जाती हैं, जो शून्य प्रायिकताओं से बचने के लिए सभी गणनाओं में एक छोटा स्थिरांक जोड़ती हैं।

क्योंकि प्रशिक्षण में सरल गिनती शामिल है, naive Bayes को बड़े डेटासेट पर भी कुशलतापूर्वक प्रशिक्षित किया जा सकता है। यह स्केलेबिलिटी इसे वास्तविक-समय अनुप्रयोगों के लिए एक लोकप्रिय विकल्प बनाती है, जैसे स्पैम फ़िल्टर जिन्हें नए ईमेल आने पर अद्यतन करने की आवश्यकता होती है।

विविधताएँ और विस्तार

विभिन्न डेटा प्रकारों को संभालने और प्रदर्शन में सुधार करने के लिए naive Bayes के कई प्रकार मौजूद हैं। सबसे सामान्य प्रकारों में शामिल हैं:

  • Gaussian Naive Bayes: मानता है कि सतत विशेषताएँ प्रत्येक वर्ग के भीतर सामान्य वितरण का पालन करती हैं।
  • Multinomial Naive Bayes: असतत विशेषताओं के लिए उपयुक्त, अक्सर पाठ वर्गीकरण में उपयोग किया जाता है जहाँ विशेषताएँ शब्द गणना या आवृत्तियाँ होती हैं।
  • Bernoulli Naive Bayes: बाइनरी विशेषताओं के लिए डिज़ाइन किया गया, जैसे किसी दस्तावेज़ में किसी शब्द की उपस्थिति या अनुपस्थिति।

ये प्रकार सशर्त प्रायिकताओं को मॉडल करने के तरीके में भिन्न होते हैं लेकिन समान स्वतंत्रता धारणा साझा करते हैं। ट्री-ऑगमेंटेड naive Bayes (TAN) जैसे विस्तार विशेषताओं के बीच कुछ निर्भरताओं की अनुमति देकर स्वतंत्रता धारणा को शिथिल करते हैं, लेकिन वे अधिक जटिल और कम सामान्य रूप से उपयोग किए जाते हैं।

अनुप्रयोग

naive Bayes वर्गीकरणकर्ताओं ने अपनी सरलता और दक्षता के कारण कई डोमेन में अनुप्रयोग पाए हैं। कुछ उल्लेखनीय अनुप्रयोगों में शामिल हैं:

  • स्पैम फ़िल्टरिंग: जैसा कि उल्लेख किया गया है, naive Bayes व्यापक रूप से ईमेल को स्पैम या गैर-स्पैम के रूप में वर्गीकृत करने के लिए उपयोग किया जाता है, अक्सर न्यूनतम कम्प्यूटेशनल संसाधनों के साथ उच्च सटीकता प्राप्त करता है।
  • पाठ वर्गीकरण: स्पैम के अलावा, naive Bayes का उपयोग भावना विश्लेषण, विषय वर्गीकरण और भाषा पहचान के लिए किया जाता है।
  • चिकित्सा निदान: स्वास्थ्य सेवा में, naive Bayes को लक्षणों और परीक्षण परिणामों के आधार पर बीमारियों का निदान करने के लिए लागू किया गया है, जैसे किसी रोगी के किसी विशेष स्थिति होने की संभावना की भविष्यवाणी करना।
  • अनुशंसा प्रणालियाँ: कुछ अनुशंसा इंजन पिछले व्यवहार के आधार पर उपयोगकर्ता की प्राथमिकताओं की भविष्यवाणी करने के लिए naive Bayes का उपयोग करते हैं।
  • वास्तविक-समय वर्गीकरण: अपनी गति के कारण, naive Bayes तत्काल भविष्यवाणियों की आवश्यकता वाले अनुप्रयोगों के लिए उपयुक्त है, जैसे नेटवर्क घुसपैठ का पता लगाना।

इनमें से कई अनुप्रयोगों में, naive Bayes आश्चर्यजनक रूप से अच्छा प्रदर्शन करता है, अक्सर अधिक परिष्कृत मॉडलों के बराबर, विशेष रूप से जब स्वतंत्रता धारणा लगभग मान्य होती है या जब डेटासेट छोटा होता है।

ताकत और सीमाएँ

naive Bayes कई लाभ प्रदान करता है। यह लागू करने में सरल, कम्प्यूटेशनल रूप से कुशल है, और कम प्रशिक्षण डेटा की आवश्यकता होती है। मॉडल व्याख्या करने में भी आसान है, क्योंकि प्रत्येक विशेषता के योगदान को समझने के लिए प्रायिकताओं की जाँच की जा सकती है। इसके अतिरिक्त, naive Bayes वर्गीकरण के दौरान लापता विशेषताओं को अनदेखा करके लापता डेटा को शालीनता से संभालता है।

हालाँकि, स्वतंत्रता धारणा एक प्रमुख सीमा है। कई वास्तविक-विश्व समस्याओं में, विशेषताएँ सहसंबद्ध होती हैं, और इन सहसंबंधों को अनदेखा करना उप-इष्टतम प्रदर्शन का कारण बन सकता है। अध्ययनों से पता चला है कि naive Bayes अक्सर अति-आत्मविश्वासी प्रायिकता अनुमान उत्पन्न करता है, जो समस्याग्रस्त हो सकता है जब मॉडल का उपयोग अनिश्चितता परिमाणीकरण के लिए किया जाता है। इसके अलावा, व्यापक तुलनाओं में, जैसे 2006 का विश्लेषण, naive Bayes को बूस्टेड ट्री और रैंडम फ़ॉरेस्ट जैसे अधिक उन्नत एल्गोरिदम द्वारा, विशेष रूप से जटिल डेटासेट पर, बेहतर प्रदर्शन किया गया था।

इन सीमाओं के बावजूद, naive Bayes एक मूल्यवान उपकरण बना हुआ है, विशेष रूप से एक आधार रेखा मॉडल के रूप में। इसका प्रदर्शन अक्सर आश्चर्यजनक रूप से अच्छा होता है, और यह अधिक जटिल प्रोबेबिलिस्टिक मॉडलों को समझने के लिए एक आधार प्रदान करता है।

सैद्धांतिक औचित्य

अपनी अवास्तविक धारणाओं के बावजूद naive Bayes की स्पष्ट प्रभावशीलता ने शोधकर्ताओं को आकर्षित किया है। 2004 में, Bayesian वर्गीकरण समस्या के विश्लेषण ने इस घटना के लिए सैद्धांतिक कारण प्रदान किए। अध्ययन ने दिखाया कि भले ही स्वतंत्रता धारणा का उल्लंघन हो, वर्गीकरणकर्ता कुछ शर्तों के तहत इष्टतम वर्गीकरण सटीकता प्राप्त कर सकता है, क्योंकि वर्गों की रैंकिंग सही रह सकती है भले ही प्रायिकता अनुमान पक्षपाती हों। इस अंतर्दृष्टि ने यह समझाने में मदद की कि naive Bayes व्यवहार में अच्छा क्यों काम करता है, जिससे कई अनुप्रयोगों में इसका निरंतर उपयोग हुआ।

अन्य मॉडलों से संबंध

naive Bayes अन्य प्रोबेबिलिस्टिक वर्गीकरणकर्ताओं, जैसे लॉजिस्टिक रिग्रेशन, से निकटता से संबंधित है। जबकि लॉजिस्टिक रिग्रेशन पश्च प्रायिकता को सीधे मॉडल करता है और विशेषता स्वतंत्रता नहीं मानता है, naive Bayes संयुक्त वितरण को मॉडल करता है और फिर पश्च प्राप्त करता है। कुछ मामलों में, दोनों मॉडल समान निर्णय सीमाएँ उत्पन्न कर सकते हैं, लेकिन वे पैरामीटरों का अनुमान लगाने और अनिश्चितता को संभालने के तरीके में भिन्न होते हैं।

naive Bayes एक प्रकार का Bayesian नेटवर्क भी है, विशेष रूप से एक सरल जहाँ वर्ग चर सभी विशेषता नोड्स का जनक है। यह संबंध इसे ग्राफिकल मॉडलों के व्यापक ढांचे के भीतर रखता है, जिनका व्यापक रूप से Artificial intelligence और Machine learning में उपयोग किया जाता है।

आधुनिक अभ्यास में, naive Bayes अक्सर एक आधार रेखा के रूप में उपयोग किया जाता है जिसके खिलाफ Neural network और Deep learning आर्किटेक्चर जैसे अधिक जटिल मॉडलों की तुलना की जाती है। इसकी सरलता और गति इसे प्रारंभिक प्रयोगों और उन समस्याओं के लिए एक आकर्षक विकल्प बनाती है जहाँ व्याख्यात्मकता महत्वपूर्ण है।

निष्कर्ष

naive Bayes वर्गीकरणकर्ता मशीन लर्निंग में एक अद्वितीय स्थान रखते हैं। वे सबसे सरल प्रोबेबिलिस्टिक वर्गीकरणकर्ताओं में से हैं, फिर भी उन्होंने विविध अनुप्रयोगों में उल्लेखनीय उपयोगिता प्रदर्शित की है। naive स्वतंत्रता धारणा, जबकि अक्सर अवास्तविक होती है, कुशल प्रशिक्षण और भविष्यवाणी को सक्षम बनाती है, जिससे naive Bayes कई समस्याओं के लिए एक व्यावहारिक विकल्प बन जाता है। हालाँकि अधिक उन्नत मॉडल उच्च सटीकता प्रदान कर सकते हैं, naive Bayes एक मौलिक तकनीक बना हुआ है जिसे हर व्यवसायी को समझना चाहिए, दोनों इसके ऐतिहासिक महत्व और क्षेत्र में इसकी निरंतर प्रासंगिकता के लिए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·probabilistic-classifier·bayesian-statistics·classification
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास