सांख्यिकीय अधिगम सिद्धांत मशीन लर्निंग के लिए एक ढांचा है जो सांख्यिकी और कार्यात्मक विश्लेषण के क्षेत्रों से लिया गया है। यह डेटा के आधार पर एक भविष्यवाणी फ़ंक्शन खोजने की सांख्यिकीय अनुमान समस्या से संबंधित है। इस सिद्धांत ने कंप्यूटर विज़न, वाक् पहचान और जैव सूचना विज्ञान जैसे क्षेत्रों में सफल अनुप्रयोगों को जन्म दिया है, और यह कई आधुनिक मशीन-लर्निंग एल्गोरिदम को रेखांकित करता है, जिसमें गहन-अधिगम और तंत्रिका-नेटवर्क मॉडल शामिल हैं।
मुख्य विचार अधिगम को एक अनुकूलन समस्या के रूप में औपचारिक रूप देना है: प्रशिक्षण उदाहरणों के एक सेट को देखते हुए, पूर्वनिर्धारित परिकल्पना स्थान से एक फ़ंक्शन का चयन करें जो भविष्यवाणी त्रुटि को मापने वाले हानि फ़ंक्शन को कम करता है। क्योंकि सच्चा अंतर्निहित संभाव्यता वितरण अज्ञात है, सिद्धांत अनुभवजन्य जोखिम न्यूनीकरण पर निर्भर करता है और सीखे गए फ़ंक्शन की सामान्यीकरण त्रुटि पर सीमाएँ प्रदान करता है।
परिचय
अधिगम के लक्ष्य समझ और भविष्यवाणी हैं। अधिगम कई श्रेणियों में आता है, जिसमें पर्यवेक्षित अधिगम, अप्रशिक्षित अधिगम, ऑनलाइन अधिगम और सुदृढीकरण अधिगम शामिल हैं। सांख्यिकीय अधिगम सिद्धांत के परिप्रेक्ष्य से, पर्यवेक्षित अधिगम सबसे अच्छी तरह समझा जाता है। पर्यवेक्षित अधिगम में डेटा के एक प्रशिक्षण सेट से सीखना शामिल है। प्रशिक्षण सेट में हर बिंदु एक इनपुट-आउटपुट जोड़ी है, जहां इनपुट आउटपुट को मैप करता है। अधिगम समस्या में इनपुट और आउटपुट के बीच मैप करने वाले फ़ंक्शन का अनुमान लगाना शामिल है, ताकि सीखा गया फ़ंक्शन भविष्य के इनपुट से आउटपुट की भविष्यवाणी करने के लिए उपयोग किया जा सके।
आउटपुट के प्रकार के आधार पर, पर्यवेक्षित अधिगम समस्याएँ या तो प्रतिगमन की समस्याएँ हैं या वर्गीकरण की। यदि आउटपुट मानों की एक सतत श्रेणी लेता है, तो यह एक प्रतिगमन समस्या है। ओम के नियम को एक उदाहरण के रूप में उपयोग करते हुए, वोल्टेज को इनपुट और करंट को आउटपुट के रूप में प्रतिगमन किया जा सकता है। प्रतिगमन वोल्टेज और करंट के बीच कार्यात्मक संबंध को R के रूप में पाएगा, जैसे कि V = IR। वर्गीकरण समस्याएँ वे हैं जिनके लिए आउटपुट लेबल के एक असतत सेट से एक तत्व होगा। वर्गीकरण मशीन लर्निंग अनुप्रयोगों के लिए बहुत आम है। उदाहरण के लिए, चेहरे की पहचान में, एक व्यक्ति के चेहरे की तस्वीर इनपुट होगी, और आउटपुट लेबल उस व्यक्ति का नाम होगा। इनपुट को एक बड़े बहुआयामी वेक्टर द्वारा दर्शाया जाएगा जिसके तत्व चित्र में पिक्सेल का प्रतिनिधित्व करते हैं।
प्रशिक्षण सेट डेटा के आधार पर एक फ़ंक्शन सीखने के बाद, उस फ़ंक्शन को डेटा के एक परीक्षण सेट पर मान्य किया जाता है, जो डेटा प्रशिक्षण सेट में प्रकट नहीं हुआ था।
औपचारिक विवरण
X को सभी संभावित इनपुट का वेक्टर स्थान मानें, और Y को सभी संभावित आउटपुट का वेक्टर स्थान मानें। सांख्यिकीय अधिगम सिद्धांत यह दृष्टिकोण लेता है कि उत्पाद स्थान Z = X × Y पर कुछ अज्ञात संभाव्यता वितरण है, अर्थात कुछ अज्ञात p(z) = p(x, y) मौजूद है। प्रशिक्षण सेट इस संभाव्यता वितरण से n नमूनों से बना है, और इसे S = {(x1, y1), …, (xn, yn)} = {z1, …, zn} के रूप में नोट किया जाता है। प्रत्येक xi प्रशिक्षण डेटा से एक इनपुट वेक्टर है, और yi वह आउटपुट है जो इसके अनुरूप है।
इस औपचारिकता में, अनुमान समस्या में एक फ़ंक्शन f: X → Y खोजना शामिल है जैसे कि f(x) ~ y। H को फ़ंक्शन f: X → Y का एक स्थान मानें जिसे परिकल्पना स्थान कहा जाता है। परिकल्पना स्थान उन फ़ंक्शन का स्थान है जिसे एल्गोरिदम खोजेगा। V(f(x), y) को हानि फ़ंक्शन मानें, जो भविष्यवाणी मान f(x) और वास्तविक मान y के बीच अंतर के लिए एक मीट्रिक है। अपेक्षित जोखिम को I[f] = ∫ V(f(x), y) p(x, y) dx dy के रूप में परिभाषित किया गया है। लक्ष्य फ़ंक्शन, सबसे अच्छा संभव फ़ंक्शन f जिसे चुना जा सकता है, उस f द्वारा दिया जाता है जो f = argmin_{h ∈ H} I[h] को संतुष्ट करता है।
क्योंकि संभाव्यता वितरण p(x, y) अज्ञात है, अपेक्षित जोखिम के लिए एक प्रॉक्सी माप का उपयोग किया जाना चाहिए। यह माप प्रशिक्षण सेट पर आधारित है, जो इस अज्ञात संभाव्यता वितरण से एक नमूना है।
अनुभवजन्य जोखिम न्यूनीकरण
अनुभवजन्य जोखिम की गणना प्रशिक्षण सेट पर औसत हानि के रूप में की जाती है: I_emp[f] = (1/n) Σ V(f(xi), yi)। अनुभवजन्य जोखिम न्यूनीकरण (ERM) सिद्धांत उस फ़ंक्शन f का चयन करता है जो इस अनुभवजन्य जोखिम को कम करता है। हालांकि, अकेले अनुभवजन्य जोखिम को कम करने से अतिअनुकूलन हो सकता है, जहां फ़ंक्शन प्रशिक्षण डेटा पर अच्छा प्रदर्शन करता है लेकिन अनदेखे डेटा पर खराब प्रदर्शन करता है। इसे संबोधित करने के लिए, सांख्यिकीय अधिगम सिद्धांत नियमितीकरण और क्षमता नियंत्रण जैसी अवधारणाओं का परिचय देता है।
नियमितीकरण अत्यधिक जटिल फ़ंक्शन को हतोत्साहित करने के लिए अनुभवजन्य जोखिम में एक दंड शब्द जोड़ता है। क्षमता माप, जैसे कि वैपनिक-चेरवोनेन्किस (VC) आयाम, परिकल्पना स्थान की जटिलता को मापते हैं। VC आयाम सांख्यिकीय अधिगम सिद्धांत में एक मौलिक अवधारणा है, जो बिंदुओं के सबसे बड़े सेट का माप प्रदान करता है जिसे परिकल्पना स्थान द्वारा तोड़ा जा सकता है। सामान्यीकरण त्रुटि पर सीमाएँ अक्सर VC आयाम और प्रशिक्षण नमूनों की संख्या पर निर्भर करती हैं।
सामान्यीकरण सीमाएँ
सांख्यिकीय अधिगम सिद्धांत में एक केंद्रीय परिणाम यह है कि, उच्च संभावना के साथ, एक सीखे गए फ़ंक्शन का अपेक्षित जोखिम उसके अनुभवजन्य जोखिम और एक शब्द से बंधा होता है जो परिकल्पना स्थान की जटिलता के साथ बढ़ता है और प्रशिक्षण नमूनों की संख्या के साथ घटता है। औपचारिक रूप से, VC आयाम d वाले परिकल्पना स्थान के लिए, कम से कम 1 - δ की संभावना के साथ, H में सभी f के लिए, निम्नलिखित सीमा धारण करती है: I[f] ≤ I_emp[f] + O(√(d/n) + √(log(1/δ)/n))। यह सीमा अल्पअनुकूलन और अतिअनुकूलन के बीच व्यापार-बंद को दर्शाती है: एक बड़ा परिकल्पना स्थान अनुभवजन्य जोखिम को कम कर सकता है लेकिन जटिलता दंड को बढ़ाता है।
ये सीमाएँ संरचनात्मक जोखिम न्यूनीकरण के सिद्धांत को प्रेरित करती हैं, जो एक परिकल्पना स्थान चुनकर अनुभवजन्य जोखिम और मॉडल जटिलता को संतुलित करता है जो सीमा को कम करता है। इस सिद्धांत ने कई मशीन लर्निंग एल्गोरिदम के डिजाइन को प्रभावित किया है, जिसमें सपोर्ट वेक्टर मशीनें शामिल हैं।
अनुप्रयोग और प्रभाव
सांख्यिकीय अधिगम सिद्धांत का मशीन लर्निंग के विकास पर गहरा प्रभाव पड़ा है। यह समझने के लिए एक सैद्धांतिक आधार प्रदान करता है कि एल्गोरिदम सामान्यीकरण क्यों करते हैं, और इसने सपोर्ट वेक्टर मशीनों और नियमितीकरण तकनीकों जैसे एल्गोरिदम के डिजाइन का मार्गदर्शन किया है। अनुभवजन्य जोखिम न्यूनीकरण और क्षमता नियंत्रण के सिद्धांत आधुनिक गहन-अधिगम ढांचे में अंतर्निहित हैं, जहां ड्रॉपआउट और बैच-सामान्यीकरण जैसी तकनीकों को नियमितीकरण के रूपों के रूप में देखा जा सकता है।
सिद्धांत तंत्रिका-नेटवर्क मॉडल के विश्लेषण को भी सूचित करता है, जिसमें ट्रांसफार्मर आर्किटेक्चर शामिल हैं जो बड़े-भाषा-मॉडल में उपयोग किए जाते हैं। एमआईटी-सीएसएआईएल और स्टैनफोर्ड-एआई-लैब जैसे संस्थानों के शोधकर्ता जनरेटिव-एआई और अन्य क्षेत्रों में चुनौतियों का समाधान करने के लिए इन नींवों पर निर्माण करना जारी रखते हैं।
व्यवहार में, सांख्यिकीय अधिगम सिद्धांत को कंप्यूटर विज़न, वाक् पहचान और जैव सूचना विज्ञान, अन्य क्षेत्रों के बीच लागू किया गया है। इसके सिद्धांत हार्डवेयर और सॉफ्टवेयर सिस्टम के विकास के लिए भी प्रासंगिक हैं, जैसे कि गूगल-डीपमाइंड और ओपनएआई से, जो मजबूत अधिगम एल्गोरिदम पर निर्भर करते हैं।
यह भी देखें
- मशीन-लर्निंग
- गहन-अधिगम
- तंत्रिका-नेटवर्क
- पर्यवेक्षित-अधिगम
- empirical-risk-minimization
- vc-dimension