अधिकतम संभावना अनुमान (एमएलई) सांख्यिकी में किसी प्रायिकता वितरण के अज्ञात मापदंडों का अनुमान लगाने की एक मौलिक विधि है। मूल विचार उन मापदंड मानों का चयन करना है जो मानी गई सांख्यिकीय मॉडल के अंतर्गत प्रेक्षित डेटा को सबसे अधिक संभाव्य बनाते हैं। यह एक संभावना फलन का निर्माण करके प्राप्त किया जाता है, जो मापदंडों के फलन के रूप में दिए गए डेटा को देखने की प्रायिकता को दर्शाता है, और फिर उन मापदंड मानों को खोजना जो इस फलन को अधिकतम करते हैं। एमएलई को मशीन-लर्निंग, अर्थमिति, और कृत्रिम-बुद्धिमत्ता जैसे क्षेत्रों में व्यापक रूप से लागू किया जाता है, क्योंकि नियमित परिस्थितियों में इसके वांछनीय गुण होते हैं, जिनमें संगति और दक्षता शामिल हैं।
यह अवधारणा पहली बार सर रोनाल्ड फिशर द्वारा 20वीं शताब्दी की शुरुआत में विकसित की गई थी, जो कार्ल फ्रेडरिक गॉस और अन्यों के पहले के कार्य पर आधारित थी। फिशर ने 1912 के एक पेपर में औपचारिक रूप से इस विधि को पेश किया और बाद के प्रकाशनों में इसका विस्तार किया, जिससे इसकी सैद्धांतिक नींव स्थापित हुई। यह विधि 1920 और 1930 के दशक में सांख्यिकीय अनुमान की आधारशिला के रूप में प्रमुखता प्राप्त कर गई, और यह शास्त्रीय और आधुनिक डेटा विश्लेषण दोनों में एक मानक उपकरण बनी हुई है।
गणितीय सूत्रीकरण
प्रायिकता घनत्व फलन (या द्रव्यमान फलन) \( f(x; \theta) \) वाले प्रायिकता वितरण से लिए गए स्वतंत्र और समान रूप से वितरित प्रेक्षणों \( x_1, x_2, \ldots, x_n \) के समुच्चय को देखते हुए, जहां \( \theta \) अज्ञात मापदंडों का एक सदिश है, संभावना फलन इस प्रकार परिभाषित किया गया है:
\[ L(\theta) = \prod_{i=1}^n f(x_i; \theta) \]
व्यवहार में, संभावना के प्राकृतिक लघुगणक के साथ काम करना अक्सर अधिक सुविधाजनक होता है, जिसे लॉग-संभावना कहा जाता है, क्योंकि यह गुणनफल को योग में बदल देता है और अवकलन को सरल बनाता है:
\[ \ell(\theta) = \log L(\theta) = \sum_{i=1}^n \log f(x_i; \theta) \]
अधिकतम संभावना अनुमान \( \hat{\theta} \) \( \theta \) का वह मान है जो \( \ell(\theta) \) को अधिकतम करता है, जो आमतौर पर \( \theta \) के सापेक्ष लॉग-संभावना के अवकलज को शून्य के बराबर सेट करके और परिणामी समीकरणों को हल करके पाया जाता है। कई सामान्य वितरणों के लिए, बंद-रूप समाधान मौजूद हैं, जबकि अन्य को ग्रेडिएंट एसेंट या न्यूटन-रफसन एल्गोरिदम जैसे संख्यात्मक अनुकूलन विधियों की आवश्यकता होती है।
गुण और औचित्य
एमएलई अनुमानकों में कुछ वांछनीय स्पर्शोन्मुख गुण होते हैं जब कुछ नियमितता शर्तें पूरी होती हैं। वे संगत होते हैं, जिसका अर्थ है कि जैसे-जैसे नमूना आकार बढ़ता है, अनुमान वास्तविक मापदंड मानों में प्रायिकता में अभिसरण करते हैं। वे स्पर्शोन्मुख रूप से सामान्य भी होते हैं, अनुमानक का वितरण सही मापदंड के केंद्र में सामान्य वितरण के करीब पहुंचता है, और स्पर्शोन्मुख रूप से कुशल होते हैं, जैसा कि क्रैमर-राव निचली सीमा द्वारा वर्णित है, न्यूनतम संभव विचरण प्राप्त करते हैं। ये गुण एमएलई को कई सांख्यिकीय अनुप्रयोगों में एक पसंदीदा विकल्प बनाते हैं।
हालांकि, एमएलई परिमित नमूनों में पक्षपाती हो सकता है, और इसका प्रदर्शन मानी गई मॉडल की शुद्धता पर निर्भर करता है। यदि मॉडल गलत निर्दिष्ट है, तो अनुमान असंगत हो सकते हैं। इसके अतिरिक्त, कई मापदंडों वाले जटिल मॉडलों के लिए, संभावना सतह में कई स्थानीय अधिकतम हो सकते हैं, जिसके लिए सावधानीपूर्वक अनुकूलन रणनीतियों की आवश्यकता होती है।
मशीन लर्निंग में अनुप्रयोग
मशीन-लर्निंग में, एमएलई कई पर्यवेक्षित और अप्रशिक्षित शिक्षण एल्गोरिदम की नींव के रूप में कार्य करता है। उदाहरण के लिए, लॉजिस्टिक रिग्रेशन अपने गुणांक का अनुमान प्रेक्षित द्विआधारी परिणामों की संभावना को अधिकतम करके लगाता है। इसी तरह, तंत्रिका-नेटवर्क प्रशिक्षण अक्सर अधिकतम संभावना सिद्धांतों का उपयोग करता है, जहां हानि फलन मॉडल के आउटपुट वितरण के अंतर्गत डेटा की नकारात्मक लॉग-संभावना से मेल खाता है। सॉफ्टमैक्स आउटपुट वाले वर्गीकरण कार्यों के लिए, यह क्रॉस-एन्ट्रॉपी हानि को कम करने के बराबर है।
गहन-शिक्षण में, एमएलई जनरेटिव मॉडलों के प्रशिक्षण को रेखांकित करता है, जिसमें जनरेटिव-एआई प्रणालियाँ शामिल हैं। वैरिएशनल ऑटोएनकोडर और नॉर्मलाइजिंग फ्लो स्पष्ट रूप से संभावना या इसकी निचली सीमा को अधिकतम करते हैं। ओपनएआई और एंथ्रोपिक द्वारा विकसित बड़े भाषा मॉडल, अगले-टोकन भविष्यवाणी कार्यों पर अधिकतम संभावना अनुमान का उपयोग करके प्रशिक्षित किए जाते हैं, जहां उद्देश्य प्रेक्षित टोकन अनुक्रम की प्रायिकता को अधिकतम करना है।
विस्तार और भिन्नताएं
एमएलई की कई सीमाओं को संबोधित करने वाले कई विस्तार हैं। अधिकतम पश्च (एमएपी) अनुमान पश्च वितरण को अधिकतम करके पूर्व जानकारी को शामिल करता है, जो संभावना गुणा पूर्व के समानुपाती होता है। दंडित संभावना विधियाँ, जैसे रिज या लैस्सो रिग्रेशन, ओवरफिटिंग को रोकने के लिए लॉग-संभावना में नियमितीकरण शर्तें जोड़ती हैं। अपेक्षा-अधिकतमीकरण (ईएम) एल्गोरिदम अव्यक्त चर वाले मॉडलों को संभालता है, दो-चरणीय प्रक्रिया में पुनरावृत्त रूप से अपेक्षित मानों की गणना करता है और संभावना को अधिकतम करता है।
बायेसियन दृष्टिकोण, एमएलई से अलग होते हुए भी, अक्सर संभावना फलन को एक घटक के रूप में उपयोग करते हैं। एमएलई के विपरीत, जो बिंदु अनुमान प्रदान करता है, बायेसियन अनुमान मापदंडों पर पूर्ण पश्च वितरण प्रदान करता है। इस अंतर के बावजूद, एमएलई को समान पूर्व वितरण के साथ बायेसियन अनुमान का एक विशेष मामला माना जा सकता है।
ऐतिहासिक विकास
विधि की उत्पत्ति 18वीं शताब्दी में देखी जा सकती है, जिसमें डैनियल बर्नौली और बाद में गॉस ने विशिष्ट समस्याओं के लिए समान विचारों का उपयोग किया। हालांकि, यह रोनाल्ड फिशर थे जिन्होंने 1912 के अपने पेपर "ऑन एन एब्सोल्यूट क्राइटेरियन फॉर फिटिंग फ्रीक्वेंसी कर्व्स" में सामान्य ढांचे को औपचारिक रूप दिया। 1920 के दशक में फिशर के बाद के कार्य ने संभावना सिद्धांत और अधिकतम संभावना अनुमानकों के गुणों की स्थापना की। 1922 के उनके प्रभावशाली पेपर "ऑन द मैथमैटिकल फाउंडेशन्स ऑफ थियोरेटिकल स्टैटिस्टिक्स" के प्रकाशन के बाद यह विधि व्यापक रूप से अपनाई गई। तब से, एमएलई सांख्यिकी पाठ्यक्रमों में एक मानक विषय और वैज्ञानिक अनुसंधान में एक व्यावहारिक उपकरण बन गया है।
कम्प्यूटेशनल विचार
कई वास्तविक दुनिया के अनुप्रयोगों के लिए, संभावना फलन विश्लेषणात्मक अधिकतमीकरण के लिए बहुत जटिल है। ग्रेडिएंट-आधारित विधियों जैसी संख्यात्मक अनुकूलन तकनीकों का उपयोग किया जाता है। मशीन-लर्निंग ढांचे में, स्वचालित विभेदन मापदंडों के सापेक्ष लॉग-संभावना के ग्रेडिएंट की कुशल गणना की अनुमति देता है, जिससे लाखों मापदंडों वाले मॉडलों का स्केलेबल प्रशिक्षण संभव होता है। जीपीयू और एडब्ल्यूएस-ट्रेनियम चिप्स सहित विशेष हार्डवेयर, इन गणनाओं को तेज करते हैं, जिससे बड़े पैमाने के मॉडलों के लिए एमएलई-आधारित प्रशिक्षण संभव हो जाता है।
अपनी उम्र के बावजूद, एमएलई अनुसंधान का एक जीवंत क्षेत्र बना हुआ है, जिसमें मजबूत अनुमान, उच्च-आयामी सेटिंग्स, और सूचना सिद्धांत से संबंधों पर चल रहे कार्य शामिल हैं। इसकी सरलता और सैद्धांतिक गारंटी आधुनिक कृत्रिम-बुद्धिमत्ता और सांख्यिकी दोनों में इसकी निरंतर प्रासंगिकता सुनिश्चित करती है।