लॉजिस्टिक रिग्रेशन एक सांख्यिकीय और मशीन लर्निंग विधि है जिसका उपयोग बाइनरी वर्गीकरण के लिए किया जाता है, जहाँ लक्ष्य एक या अधिक इनपुट विशेषताओं के आधार पर दो संभावित परिणामों में से एक की भविष्यवाणी करना होता है। अपने नाम के बावजूद, यह पारंपरिक अर्थों में एक रिग्रेशन एल्गोरिदम नहीं है, बल्कि एक वर्गीकरण एल्गोरिदम है। यह विशेषताओं के रैखिक संयोजन पर लॉजिस्टिक फ़ंक्शन लागू करके किसी दिए गए इनपुट के किसी विशेष वर्ग से संबंधित होने की संभावना का मॉडल बनाता है। आउटपुट 0 और 1 के बीच का मान होता है, जिसे बाइनरी निर्णय लेने के लिए थ्रेशोल्ड किया जा सकता है। लॉजिस्टिक रिग्रेशन Machine learning में एक मूलभूत तकनीक है और अक्सर परिचयात्मक पाठ्यक्रमों में पढ़ाया जाने वाला पहला वर्गीकरण मॉडल होता है, क्योंकि यह सरल, व्याख्या योग्य और रैखिक रूप से अलग किए जा सकने वाले डेटा पर मजबूत प्रदर्शन करता है।
लॉजिस्टिक रिग्रेशन की उत्पत्ति 19वीं शताब्दी के मध्य में हुई, जिसमें लॉजिस्टिक फ़ंक्शन को 1844 में पियरे फ्रांस्वा वेरहुल्स्ट द्वारा जनसंख्या वृद्धि का मॉडल बनाने के लिए पेश किया गया था। लॉजिस्टिक रिग्रेशन का आधुनिक सांख्यिकीय सूत्रीकरण 1950 और 1960 के दशक में विकसित किया गया था, विशेष रूप से 1958 में डेविड कॉक्स और बाद में डी. आर. कॉक्स और अन्य द्वारा। मशीन लर्निंग के संदर्भ में, लॉजिस्टिक रिग्रेशन 1990 और 2000 के दशक में एक प्रमुख तकनीक बन गया, विशेष रूप से टेक्स्ट वर्गीकरण और स्पैम पहचान के लिए। यह चिकित्सा, अर्थशास्त्र और सामाजिक विज्ञान जैसे क्षेत्रों में व्यापक रूप से उपयोग किया जाता है, जहाँ व्याख्या योग्यता और संभाव्य आउटपुट को महत्व दिया जाता है।
गणितीय सूत्रीकरण
लॉजिस्टिक रिग्रेशन का मूल लॉजिस्टिक फ़ंक्शन है, जिसे सिग्मॉइड फ़ंक्शन के रूप में भी जाना जाता है, जिसे σ(z) = 1 / (1 + e^(-z)) के रूप में परिभाषित किया गया है। किसी दिए गए इनपुट वेक्टर x के लिए वेट w और बायस b के साथ, मॉडल z = w·x + b की गणना करता है, फिर अनुमानित संभावना p = σ(z) प्राप्त करने के लिए सिग्मॉइड लागू करता है। निर्णय सीमा वहाँ होती है जहाँ p = 0.5 होता है, जो z = 0 के अनुरूप है। मॉडल पैरामीटर w और b को देखे गए परिणामों की संभावना को अधिकतम करके डेटा से सीखा जाता है, आमतौर पर ग्रेडिएंट डिसेंट या अन्य अनुकूलन एल्गोरिदम का उपयोग करके।
प्रशिक्षण में उपयोग किया जाने वाला लॉस फ़ंक्शन बाइनरी क्रॉस-एन्ट्रॉपी (लॉग लॉस) है, जो अनुमानित संभावना और वास्तविक लेबल के बीच अंतर को मापता है। N नमूनों के डेटासेट के लिए, लॉस L = -1/N Σ [y_i log(p_i) + (1 - y_i) log(1 - p_i)] है, जहाँ y_i वास्तविक लेबल (0 या 1) है। इस लॉस को कम करना लॉग-लाइक्लिहुड को अधिकतम करने के बराबर है। रैखिक रिग्रेशन के विपरीत, जो कम से कम वर्गों का उपयोग करता है, लॉजिस्टिक रिग्रेशन अधिकतम संभावना अनुमान का उपयोग करता है, जो कुछ शर्तों के तहत स्थिरता और दक्षता जैसे वांछनीय सांख्यिकीय गुण प्रदान करता है।
रैखिक मॉडल से संबंध
लॉजिस्टिक रिग्रेशन एक रैखिक मॉडल है क्योंकि निर्णय सीमा इनपुट विशेषताओं का एक रैखिक फ़ंक्शन है। हालाँकि, रैखिक रिग्रेशन के विपरीत, जो निरंतर मानों की भविष्यवाणी करता है, लॉजिस्टिक रिग्रेशन संभावनाओं की भविष्यवाणी करता है। यह रैखिक आउटपुट को लॉजिस्टिक फ़ंक्शन के माध्यम से बदलकर प्राप्त किया जाता है, जो गैर-रैखिक है। मॉडल को बहुपदीय विशेषताओं को जोड़कर या कर्नेल विधियों का उपयोग करके गैर-रैखिक संबंधों को संभालने के लिए बढ़ाया जा सकता है, लेकिन मूल मॉडल पैरामीटर में रैखिक रहता है।
Machine learning के व्यापक परिदृश्य में, लॉजिस्टिक रिग्रेशन की तुलना अक्सर सपोर्ट वेक्टर मशीन (SVM) और पर्सेप्ट्रॉन जैसे अन्य रैखिक वर्गीकरणकर्ताओं से की जाती है। जहाँ SVM वर्गों के बीच मार्जिन को अधिकतम करने का लक्ष्य रखते हैं, वहीं लॉजिस्टिक रिग्रेशन संभाव्य आउटपुट प्रदान करता है और स्वाभाविक रूप से कैलिब्रेटेड होता है। यह इसे विशेष रूप से उपयोगी बनाता है जब निर्णय के लिए आत्मविश्वास माप की आवश्यकता होती है, जैसे चिकित्सा निदान या क्रेडिट स्कोरिंग में। लॉजिस्टिक रिग्रेशन अधिक जटिल मॉडलों के लिए एक निर्माण खंड के रूप में भी कार्य करता है, जिसमें Neural network शामिल हैं, जहाँ इसका उपयोग बाइनरी वर्गीकरण कार्यों के लिए आउटपुट परत में सक्रियण फ़ंक्शन के रूप में किया जाता है।
प्रशिक्षण और अनुकूलन
लॉजिस्टिक रिग्रेशन मॉडल को प्रशिक्षित करने में क्रॉस-एन्ट्रॉपी लॉस को कम करने वाले वेट खोजना शामिल है। यह आमतौर पर पुनरावृत्त अनुकूलन एल्गोरिदम का उपयोग करके किया जाता है, जिसमें ग्रेडिएंट डिसेंट सबसे आम है। ग्रेडिएंट डिसेंट में, वेट को लॉस के ग्रेडिएंट की नकारात्मक दिशा में अद्यतन किया जाता है। लर्निंग रेट चरण आकार को नियंत्रित करता है, और बड़े डेटासेट के लिए स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) और मिनी-बैच ग्रेडिएंट डिसेंट जैसे वेरिएंट का उपयोग किया जाता है।
ओवरफिटिंग को रोकने के लिए अक्सर रेगुलराइज़ेशन लागू किया जाता है, खासकर जब विशेषताओं की संख्या बड़ी होती है। सामान्य रेगुलराइज़ेशन तकनीकों में L1 (लैस्सो) और L2 (रिज) रेगुलराइज़ेशन शामिल हैं, जो लॉस फ़ंक्शन में पेनल्टी टर्म जोड़ते हैं। L1 रेगुलराइज़ेशन स्पार्सिटी को प्रोत्साहित करता है, कुछ वेट को शून्य पर सेट करता है, जो फीचर चयन के लिए उपयोगी हो सकता है। L2 रेगुलराइज़ेशन वेट को शून्य की ओर सिकोड़ता है लेकिन उन्हें बिल्कुल शून्य पर सेट नहीं करता है। व्यवहार में, L2 रेगुलराइज़ेशन के साथ लॉजिस्टिक रिग्रेशन कई वर्गीकरण समस्याओं के लिए एक मजबूत बेसलाइन है।
मशीन लर्निंग में अनुप्रयोग
लॉजिस्टिक रिग्रेशन का उपयोग विभिन्न प्रकार के अनुप्रयोगों में किया जाता है। स्वास्थ्य सेवा में, इसका उपयोग लक्षणों और परीक्षण परिणामों के आधार पर रोगी के किसी बीमारी से ग्रस्त होने की संभावना की भविष्यवाणी करने के लिए किया जाता है। वित्त में, इसका उपयोग क्रेडिट स्कोरिंग और धोखाधड़ी का पता लगाने के लिए किया जाता है। विपणन में, यह ग्राहक के चर्न या खरीदारी की संभावना की भविष्यवाणी करने में मदद करता है। प्राकृतिक भाषा प्रसंस्करण में, लॉजिस्टिक रिग्रेशन का उपयोग भावना विश्लेषण और स्पैम पहचान के लिए किया जाता है, जहाँ विशेषताएँ अक्सर शब्द गणना या TF-IDF वेक्टर होती हैं।
Artificial intelligence के संदर्भ में, लॉजिस्टिक रिग्रेशन का उपयोग अक्सर अधिक जटिल एल्गोरिदम के साथ तुलना करने के लिए एक बेसलाइन मॉडल के रूप में किया जाता है। इसकी सरलता और व्याख्या योग्यता इसे विशेषताओं और परिणामों के बीच संबंध को समझने के लिए एक मूल्यवान उपकरण बनाती है। उदाहरण के लिए, एक चिकित्सा अध्ययन में, मॉडल के गुणांकों को अन्य विशेषताओं को स्थिर रखते हुए, विशेषता में एक इकाई परिवर्तन के लिए परिणाम के लॉग-ऑड्स के रूप में व्याख्या किया जा सकता है। यह व्याख्या योग्यता गहरे तंत्रिका नेटवर्क जैसे ब्लैक-बॉक्स मॉडल पर एक प्रमुख लाभ है।
विस्तार और वेरिएंट
मल्टी-क्लास वर्गीकरण और गैर-रैखिक सीमाओं को संभालने के लिए लॉजिस्टिक रिग्रेशन के कई विस्तार मौजूद हैं। मल्टीनोमियल लॉजिस्टिक रिग्रेशन, जिसे सॉफ्टमैक्स रिग्रेशन के रूप में भी जाना जाता है, सॉफ्टमैक्स फ़ंक्शन का उपयोग करके बाइनरी लॉजिस्टिक रिग्रेशन को कई वर्गों तक सामान्यीकृत करता है। यह आमतौर पर Deep learning में दो से अधिक वर्गों वाले वर्गीकरण कार्यों के लिए उपयोग किया जाता है। एक अन्य वेरिएंट ऑर्डिनल लॉजिस्टिक रिग्रेशन है, जिसका उपयोग तब किया जाता है जब वर्गों का एक प्राकृतिक क्रम होता है, जैसे 1 से 5 तक की रेटिंग।
गैर-रैखिक समस्याओं के लिए, लॉजिस्टिक रिग्रेशन को कर्नेल विधियों के साथ जोड़ा जा सकता है, जिससे कर्नेल लॉजिस्टिक रिग्रेशन बनता है। यह मॉडल को विशेषताओं को उच्च-आयामी स्थान पर अंतर्निहित रूप से मैप करके मूल फीचर स्पेस में गैर-रैखिक निर्णय सीमाएँ खोजने की अनुमति देता है। हालाँकि, यह दृष्टिकोण कम्प्यूटेशनल रूप से अधिक महंगा है और तंत्रिका नेटवर्क की तुलना में कम सामान्य है। व्यवहार में, अत्यधिक गैर-रैखिक समस्याओं के लिए, चिकित्सक अक्सर Neural network या Transformer (architecture)-आधारित मॉडल की ओर रुख करते हैं, जो कच्चे डेटा से जटिल प्रतिनिधित्व सीख सकते हैं।
तंत्रिका नेटवर्क के साथ तुलना
लॉजिस्टिक रिग्रेशन को सिग्मॉइड सक्रियण फ़ंक्शन के साथ एकल-परत तंत्रिका नेटवर्क के रूप में देखा जा सकता है। वास्तव में, एक लॉजिस्टिक रिग्रेशन मॉडल बिना किसी छिपी परत और एक आउटपुट न्यूरॉन वाले तंत्रिका नेटवर्क के बराबर है। यह संबंध महत्वपूर्ण है क्योंकि यह शास्त्रीय सांख्यिकी और आधुनिक गहन शिक्षण के बीच की कड़ी को जोड़ता है। जबकि छिपी परतों वाले तंत्रिका नेटवर्क जटिल गैर-रैखिक संबंधों का मॉडल बना सकते हैं, लॉजिस्टिक रिग्रेशन एक शक्तिशाली और कुशल बेसलाइन बना हुआ है, खासकर जब डेटा रैखिक रूप से अलग किया जा सकता है या जब व्याख्या योग्यता महत्वपूर्ण होती है।
बड़े पैमाने पर Machine learning के युग में, लॉजिस्टिक रिग्रेशन अभी भी कई उत्पादन प्रणालियों में उपयोग किया जाता है, विशेष रूप से ऑनलाइन विज्ञापन और अनुशंसा प्रणालियों में, जहाँ तेज़ प्रशिक्षण और अनुमान की आवश्यकता होती है। उदाहरण के लिए, लॉजिस्टिक रिग्रेशन का उपयोग अक्सर क्लिक-थ्रू दर भविष्यवाणी में किया जाता है, जहाँ लक्ष्य उस संभावना की भविष्यवाणी करना है कि उपयोगकर्ता किसी विज्ञापन पर क्लिक करेगा। Deep learning मॉडल के उदय के बावजूद, लॉजिस्टिक रिग्रेशन कई टेबुलर डेटा समस्याओं के लिए एक प्रतिस्पर्धी विकल्प बना हुआ है।
व्यावहारिक विचार
लॉजिस्टिक रिग्रेशन लागू करते समय, कई व्यावहारिक विचार महत्वपूर्ण हैं। फीचर स्केलिंग अक्सर आवश्यक होती है ताकि ग्रेडिएंट डिसेंट जल्दी से परिवर्तित हो, खासकर जब विशेषताओं के अलग-अलग पैमाने हों। लापता मानों और आउटलायर्स को संभालना भी महत्वपूर्ण है, क्योंकि लॉजिस्टिक रिग्रेशन चरम मानों के प्रति संवेदनशील है। इसके अतिरिक्त, मॉडल मानता है कि परिणाम के लॉग-ऑड्स विशेषताओं से रैखिक रूप से संबंधित हैं, जो व्यवहार में सत्य नहीं हो सकता है। ऐसे मामलों में, फीचर इंजीनियरिंग या अधिक लचीले मॉडल का उपयोग आवश्यक हो सकता है।
लॉजिस्टिक रिग्रेशन मॉडल के मूल्यांकन में आमतौर पर सटीकता, परिशुद्धता, रिकॉल, F1-स्कोर और ROC वक्र के अंतर्गत क्षेत्र (AUC) जैसे मेट्रिक्स शामिल होते हैं। AUC विशेष रूप से उपयोगी है क्योंकि यह चुने गए निर्णय थ्रेशोल्ड से स्वतंत्र, सभी थ्रेशोल्ड पर वर्गों के बीच अंतर करने की मॉडल की क्षमता को मापता है। कैलिब्रेशन एक और महत्वपूर्ण पहलू है; लॉजिस्टिक रिग्रेशन आउटपुट स्वाभाविक रूप से अच्छी तरह से कैलिब्रेटेड होते हैं, जिसका अर्थ है कि 0.8 की अनुमानित संभावना लंबे समय में लगभग 80% की वास्तविक आवृत्ति से मेल खाती है।
ऐतिहासिक संदर्भ और प्रभाव
लॉजिस्टिक रिग्रेशन के विकास को Thomas G. Dietterich और Michael I. Jordan जैसे सांख्यिकीविदों ने प्रभावित किया है, जिन्होंने मशीन लर्निंग में इसके एकीकरण में योगदान दिया। Michael I. Jordan संभाव्य ग्राफिकल मॉडल और सांख्यिकी और मशीन लर्निंग के बीच संबंध पर अपने काम के लिए जाने जाते हैं। लॉजिस्टिक रिग्रेशन Stanford AI Lab और MIT CSAIL जैसे संस्थानों में पढ़ाए जाने वाले पाठ्यक्रमों में भी एक मौलिक विषय है, जहाँ इसका उपयोग छात्रों को वर्गीकरण और संभाव्य मॉडलिंग से परिचित कराने के लिए किया जाता है।
कृत्रिम बुद्धिमत्ता के व्यापक इतिहास में, लॉजिस्टिक रिग्रेशन कई आधुनिक तकनीकों से पहले का है लेकिन प्रासंगिक बना हुआ है। इसका उपयोग अक्सर नए एल्गोरिदम के मूल्यांकन के लिए एक बेंचमार्क के रूप में किया जाता है। उदाहरण के लिए, जब एक नया वर्गीकरण विधि प्रस्तावित की जाती है, तो सुधार प्रदर्शित करने के लिए इसकी तुलना आमतौर पर लॉजिस्टिक रिग्रेशन से की जाती है। यह स्थायी प्रासंगिकता मॉडल की सरलता, प्रभावशीलता और व्याख्या योग्यता का प्रमाण है।
निष्कर्ष
लॉजिस्टिक रिग्रेशन सांख्यिकीय मॉडलिंग और मशीन लर्निंग की आधारशिला है। संभाव्य भविष्यवाणियाँ प्रदान करने की इसकी क्षमता, इसकी व्याख्या योग्यता और दक्षता के साथ मिलकर, इसे बाइनरी वर्गीकरण के लिए एक बहुमुखी उपकरण बनाती है। जबकि गहरे तंत्रिका नेटवर्क जैसे अधिक जटिल मॉडल ने कई क्षेत्रों में अत्याधुनिक परिणाम प्राप्त किए हैं, लॉजिस्टिक रिग्रेशन एक मूल्यवान बेसलाइन और कई वास्तविक दुनिया की समस्याओं के लिए एक व्यावहारिक समाधान बना हुआ है। मशीन लर्निंग का अध्ययन करने वाले किसी भी व्यक्ति के लिए लॉजिस्टिक रिग्रेशन को समझना आवश्यक है, क्योंकि यह तंत्रिका नेटवर्क और संभाव्य ग्राफिकल मॉडल जैसे अधिक उन्नत विषयों की नींव रखता है।