अंग्रेज़ी से अनुवादित

रैखिक प्रतिगमन एक सांख्यिकीय विधि है जो एक आश्रित चर और एक या अधिक स्वतंत्र चरों के बीच संबंध को एक रैखिक पूर्वानुमान फलन के माध्यम से मॉडल करती है, जिसे आमतौर पर न्यूनतम वर्ग विधि द्वारा अनुमानित किया जाता है। इसका व्यापक रूप से पूर्वानुमान और अनुमान के लिए उपयोग किया जाता है।

रैखिक प्रतिगमन एक सांख्यिकीय मॉडल है जो एक अदिश प्रतिक्रिया (आश्रित चर) और एक या अधिक व्याख्यात्मक चर (प्रतिगामी या स्वतंत्र चर) के बीच संबंध का अनुमान लगाता है। ठीक एक व्याख्यात्मक चर वाले मॉडल को सरल रैखिक प्रतिगमन कहा जाता है; दो या अधिक व्याख्यात्मक चर वाले मॉडल को बहु रैखिक प्रतिगमन कहा जाता है। यह शब्द बहुचर रैखिक प्रतिगमन से अलग है, जो एकल आश्रित चर के बजाय कई सहसंबद्ध आश्रित चर की भविष्यवाणी करता है।

रैखिक प्रतिगमन में संबंधों को रैखिक भविष्यवक्ता फलनों का उपयोग करके मॉडल किया जाता है, जिनके अज्ञात मापदंडों का अनुमान डेटा से लगाया जाता है। सबसे सामान्यतः, व्याख्यात्मक चर के मानों को देखते हुए प्रतिक्रिया की सशर्त माध्य को उन मानों का एक एफ़िन फलन माना जाता है; कम सामान्यतः, सशर्त माध्यिका या कुछ अन्य मात्रात्मक का उपयोग किया जाता है। प्रतिगमन विश्लेषण के सभी रूपों की तरह, रैखिक प्रतिगमन भविष्यवक्ताओं को देखते हुए प्रतिक्रिया के सशर्त संभाव्यता वितरण पर केंद्रित है, न कि सभी चर के संयुक्त संभाव्यता वितरण पर, जो बहुचर विश्लेषण का क्षेत्र है।

रैखिक प्रतिगमन मशीन लर्निंग एल्गोरिदम का भी एक प्रकार है, विशेष रूप से एक पर्यवेक्षित एल्गोरिदम, जो लेबल किए गए डेटासेट से सीखता है और डेटा बिंदुओं को एक अनुकूलित रैखिक फलन में मैप करता है जिसका उपयोग नए डेटासेट पर भविष्यवाणी के लिए किया जा सकता है। यह पहला प्रकार का प्रतिगमन विश्लेषण था जिसका कठोरता से अध्ययन किया गया और व्यावहारिक अनुप्रयोगों में व्यापक रूप से उपयोग किया गया, क्योंकि जो मॉडल अपने अज्ञात मापदंडों पर रैखिक रूप से निर्भर करते हैं, वे गैर-रैखिक मॉडल की तुलना में फिट करना आसान होते हैं, और परिणामी अनुमानकों के सांख्यिकीय गुण निर्धारित करना आसान होता है।

ऐतिहासिक विकास

न्यूनतम वर्गों की विधि, जो रैखिक प्रतिगमन के लिए केंद्रीय है, पहली बार एड्रियन-मैरी लीजेंड्रे द्वारा 1805 में और स्वतंत्र रूप से कार्ल फ्रेडरिक गॉस द्वारा 1809 में प्रकाशित की गई थी। गॉस ने दावा किया कि उन्होंने 1795 से इस विधि का उपयोग किया था, और उनके कार्य ने सामान्य वितरण और गॉस-मार्कोव प्रमेय के लिए सैद्धांतिक आधार स्थापित किया। प्रारंभिक अनुप्रयोगों में खगोलीय गणना, भूगणित और ग्रहों की कक्षाओं की भविष्यवाणी शामिल थी। 19वीं शताब्दी के अंत तक, रैखिक प्रतिगमन सामाजिक और जैविक विज्ञानों में एक मानक उपकरण बन गया था, विशेष रूप से फ्रांसिस गैल्टन के कार्य के माध्यम से, जिन्होंने आनुवंशिकता के संदर्भ में "प्रतिगमन" शब्द पेश किया, और कार्ल पियर्सन, जिन्होंने सहसंबंध और प्रतिगमन विश्लेषण को औपचारिक रूप दिया।

20वीं शताब्दी में, कम्प्यूटेशनल विधियों के विकास और सांख्यिकी के एक अनुशासन के रूप में उदय ने रैखिक प्रतिगमन की प्रयोज्यता का विस्तार किया। 1920 के दशक में रोनाल्ड फिशर द्वारा मैट्रिक्स संकेतन और सामान्य रैखिक मॉडल की शुरूआत ने प्रतिगमन को विचरण के विश्लेषण के साथ एकीकृत किया। बाद में, 1950 और 1960 के दशक में इलेक्ट्रॉनिक कंप्यूटरों की उपलब्धता ने बड़े प्रतिगमन मॉडल को फिट करना संभव बना दिया, जिससे अर्थशास्त्र, इंजीनियरिंग और प्राकृतिक विज्ञानों में व्यापक उपयोग हुआ।

गणितीय सूत्रीकरण

n सांख्यिकीय इकाइयों के डेटा सेट को देखते हुए, एक रैखिक प्रतिगमन मॉडल मानता है कि आश्रित चर y और प्रतिगामी के सदिश x के बीच संबंध रैखिक है। इस संबंध को एक विक्षोभ पद या त्रुटि चर ε के माध्यम से मॉडल किया जाता है, जो एक अप्रेक्षित यादृच्छिक चर है जो रैखिक संबंध में शोर जोड़ता है। मॉडल निम्न रूप लेता है:

y_i = β_0 + β_1 x_i1 + ... + β_p x_ip + ε_i = x_i^T β + ε_i, i = 1, ..., n के लिए,

जहाँ β अज्ञात मापदंडों का एक सदिश है, और x_i^T β सदिशों x_i और β के बीच आंतरिक गुणनफल है। अक्सर इन n समीकरणों को मैट्रिक्स संकेतन में y = Xβ + ε के रूप में एक साथ रखा जाता है, जहाँ X एक n × (p+1) डिज़ाइन मैट्रिक्स है।

मापदंडों β का अनुमान आमतौर पर एक लागत फलन को न्यूनतम करके लगाया जाता है। सबसे सामान्य दृष्टिकोण साधारण न्यूनतम वर्ग (OLS) है, जो वर्ग अवशेषों के योग को न्यूनतम करता है। OLS अनुमानक का बंद-रूप समाधान β_hat = (X^T X)^{-1} X^T y है, बशर्ते मैट्रिक्स X^T X व्युत्क्रमणीय हो। गॉस-मार्कोव मान्यताओं के तहत, OLS सर्वोत्तम रैखिक निष्पक्ष अनुमानक (BLUE) है।

अनुमान विधियाँ और प्रकार

रैखिक प्रतिगमन मॉडल अक्सर न्यूनतम वर्ग दृष्टिकोण का उपयोग करके फिट किए जाते हैं, लेकिन उन्हें अन्य मानदंडों में फिट की कमी को न्यूनतम करके भी फिट किया जा सकता है, जैसे कि न्यूनतम पूर्ण विचलन प्रतिगमन, या न्यूनतम वर्ग लागत फलन के दंडित संस्करण को न्यूनतम करके। रिज प्रतिगमन गुणांकों में L2-मानदंड दंड जोड़ता है, जो उन्हें शून्य की ओर सिकोड़ता है और बहुसंरेखण में मदद करता है। लैस्सो (न्यूनतम पूर्ण संकोचन और चयन संचालक) L1-मानदंड दंड जोड़ता है, जो कुछ गुणांकों को बिल्कुल शून्य पर सेट कर सकता है, जिससे चर चयन होता है। इलास्टिक नेट दोनों दंडों को जोड़ता है।

कई बड़े आउटलायर वाले डेटासेट पर लागत के रूप में माध्य वर्ग त्रुटि (MSE) का उपयोग एक मॉडल में परिणाम दे सकता है जो वास्तविक डेटा की तुलना में आउटलायर को अधिक फिट करता है, क्योंकि MSE बड़ी त्रुटियों को उच्च महत्व देता है। इसलिए, यदि डेटासेट में कई बड़े आउटलायर हैं, तो आउटलायर-प्रतिरोधी लागत फलन, जैसे कि ह्यूबर हानि या मात्रात्मक प्रतिगमन, का उपयोग किया जाना चाहिए। इसके विपरीत, न्यूनतम वर्ग दृष्टिकोण का उपयोग उन मॉडलों को फिट करने के लिए किया जा सकता है जो रैखिक मॉडल नहीं हैं, जैसे कि बहुपद प्रतिगमन, भविष्यवक्ताओं को रूपांतरित करके। इस प्रकार, हालांकि "न्यूनतम वर्ग" और "रैखिक मॉडल" शब्द निकटता से जुड़े हुए हैं, वे पर्यायवाची नहीं हैं।

भविष्यवाणी और अनुमान में अनुप्रयोग

रैखिक प्रतिगमन के कई व्यावहारिक उपयोग हैं, जो दो व्यापक श्रेणियों में आते हैं। पहला, यदि लक्ष्य भविष्यवाणी या पूर्वानुमान है, तो रैखिक प्रतिगमन एक देखे गए डेटा सेट पर एक भविष्यवाणी मॉडल फिट कर सकता है, त्रुटि या विचरण को न्यूनतम करते हुए। ऐसे मॉडल को विकसित करने के बाद, यदि व्याख्यात्मक चर के अतिरिक्त मान बिना किसी साथ की प्रतिक्रिया मान के एकत्र किए जाते हैं, तो फिट किए गए मॉडल का उपयोग प्रतिक्रिया की भविष्यवाणी करने के लिए किया जा सकता है। यह अर्थशास्त्र, वित्त और पर्यावरण विज्ञान जैसे क्षेत्रों में आम है।

दूसरा, यदि लक्ष्य प्रतिक्रिया चर में भिन्नता की व्याख्या करना है, तो रैखिक प्रतिगमन विश्लेषण प्रतिक्रिया और व्याख्यात्मक चर के बीच संबंध की ताकत को माप सकता है। यह निर्धारित कर सकता है कि क्या कुछ व्याख्यात्मक चर का प्रतिक्रिया के साथ कोई रैखिक संबंध नहीं है, या पहचान सकता है कि व्याख्यात्मक चर के कौन से उपसमुच्चय में अनावश्यक जानकारी है। यह सामाजिक विज्ञान, महामारी विज्ञान और विपणन विश्लेषण में व्यापक रूप से उपयोग किया जाता है।

रैखिक प्रतिगमन मशीन लर्निंग में एक मौलिक निर्माण खंड के रूप में भी कार्य करता है। यह एक सरल, व्याख्या योग्य मॉडल है जिसे अक्सर अधिक जटिल एल्गोरिदम के लिए आधार रेखा के रूप में उपयोग किया जाता है। कई आधुनिक तकनीकें, जैसे कि तंत्रिका नेटवर्क और गहन शिक्षण, को रैखिक मॉडल के सामान्यीकरण के रूप में देखा जा सकता है। पर्यवेक्षित शिक्षण में, रैखिक प्रतिगमन का उपयोग प्रतिगमन कार्यों के लिए किया जाता है, जहाँ आउटपुट एक सतत मान होता है, और इसकी तुलना अक्सर निर्णय वृक्ष या सपोर्ट वेक्टर मशीन जैसे अधिक लचीले मॉडल से की जाती है।

सीमाएँ और विस्तार

रैखिक प्रतिगमन प्रतिक्रिया और भविष्यवक्ताओं के बीच एक रैखिक संबंध मानता है, जो वास्तविक-विश्व डेटा में सत्य नहीं हो सकता है। यह आउटलायर के प्रति संवेदनशील है और यदि भविष्यवक्ताओं की संख्या अवलोकनों की संख्या के सापेक्ष बड़ी है तो अतिअनुकूलन हो सकता है। भविष्यवक्ताओं के बीच बहुसंरेखण गुणांक अनुमानों के विचरण को बढ़ा सकता है। इन मुद्दों को संबोधित करने के लिए, बहुपद प्रतिगमन, सामान्यीकृत रैखिक मॉडल (GLM) और नियमितीकरण विधियों जैसे विस्तार विकसित किए गए हैं।

अपनी सरलता के बावजूद, रैखिक प्रतिगमन सबसे व्यापक रूप से उपयोग किए जाने वाले सांख्यिकीय उपकरणों में से एक बना हुआ है। इसकी व्याख्या क्षमता और कम्प्यूटेशनल दक्षता इसे सांख्यिकी और मशीन लर्निंग दोनों पाठ्यक्रमों में एक प्रमुख तत्व बनाती है। 2020 के दशक तक, यह डेटा विज्ञान में एक मौलिक तकनीक बना हुआ है, जो अक्सर खोजपूर्ण विश्लेषण में पहले कदम के रूप में और अधिक जटिल मॉडल के लिए एक बेंचमार्क के रूप में कार्य करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:statistics·regression-analysis·machine-learning·supervised-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास