पूर्वाग्रह-विचरण समझौता (bias–variance tradeoff) सांख्यिकी और मशीन-लर्निंग में एक मौलिक अवधारणा है, जो एक मॉडल की जटिलता, उसकी पूर्वानुमान सटीकता और अनदेखे डेटा पर सामान्यीकरण करने की उसकी क्षमता के बीच संबंध का वर्णन करती है। पर्यवेक्षित अधिगम (supervised learning) में, नए डेटा पर एक मॉडल की अपेक्षित त्रुटि को तीन घटकों में विघटित किया जा सकता है: पूर्वाग्रह (bias), विचरण (variance), और अपरिवर्तनीय त्रुटि (irreducible error)। पूर्वाग्रह अधिगम एल्गोरिदम में गलत धारणाओं से उत्पन्न होता है, जिससे अधोअन्वयन (underfitting) होता है जब मॉडल सुविधाओं और आउटपुट के बीच प्रासंगिक संबंधों को खो देता है। विचरण प्रशिक्षण सेट में छोटे उतार-चढ़ाव के प्रति संवेदनशीलता से उत्पन्न होता है, जिससे अति-अन्वयन (overfitting) होता है जब मॉडल यादृच्छिक शोर को पकड़ लेता है। यह समझौता इसलिए उभरता है क्योंकि पूर्वाग्रह को कम करने से अक्सर विचरण बढ़ जाता है, और इसके विपरीत, जिससे दोनों को एक साथ न्यूनतम करना असंभव हो जाता है।
पूर्वाग्रह–विचरण विघटन इस संबंध को औपचारिक रूप देता है, अपेक्षित सामान्यीकरण त्रुटि को वर्गित पूर्वाग्रह, विचरण, और समस्या में निहित शोर के कारण अपरिवर्तनीय त्रुटि के योग के रूप में व्यक्त करता है। यह ढांचा मॉडल चयन, नियमितीकरण (regularization), और रैखिक प्रतिगमन से लेकर डीप-लर्निंग और न्यूरल-नेटवर्क मॉडल तक एल्गोरिदम के व्यवहार को समझने के लिए केंद्रीय है।
प्रेरणा
पूर्वाग्रह–विचरण समझौता पर्यवेक्षित अधिगम में एक केंद्रीय समस्या है। आदर्श रूप से, कोई ऐसा मॉडल चाहता है जो प्रशिक्षण डेटा में नियमितताओं को सटीक रूप से दर्शाता हो और साथ ही अनदेखे डेटा पर अच्छी तरह से सामान्यीकरण करता हो। उच्च-विचरण विधियाँ प्रशिक्षण डेटा को अच्छी तरह से प्रस्तुत कर सकती हैं लेकिन शोर या अप्रतिनिधि नमूनों पर अति-अन्वयन का जोखिम उठाती हैं। उच्च-पूर्वाग्रह एल्गोरिदम सरल मॉडल उत्पन्न करते हैं जो महत्वपूर्ण पैटर्न को खोकर अधोअन्वयन कर सकते हैं।
एक सामान्य भ्रांति यह है कि जटिल मॉडल में उच्च विचरण होना चाहिए। जबकि उच्च-विचरण मॉडल कुछ अर्थों में जटिल होते हैं, विपरीत आवश्यक रूप से सत्य नहीं है। जटिलता को मापदंडों की संख्या से खराब तरीके से मापा जाता है। उदाहरण के लिए, फलन \(f_{a,b}(x) = a \sin(bx)\) में केवल दो मापदंड हैं, लेकिन उच्च आवृत्ति पर दोलन करके किसी भी संख्या में बिंदुओं को प्रक्षेपित कर सकता है, जिससे उच्च पूर्वाग्रह और उच्च विचरण दोनों होते हैं।
सटीकता और परिशुद्धता के सादृश्य से अवधारणा को स्पष्ट करने में मदद मिलती है। सटीकता पूर्वाग्रह से संबंधित है; केवल स्थानीय जानकारी का उपयोग करने से एक नमूना सटीक दिख सकता है लेकिन अधोअन्वयन हो सकता है। परिशुद्धता विचरण से संबंधित है; व्यापक स्थान से डेटा का चयन करने से परिशुद्धता में सुधार होता है लेकिन यदि बहुत कम बिंदुओं का उपयोग किया जाए तो अति-अन्वयन हो सकता है। नियमितीकरण, जैसे संकोचन (shrinkage), इन त्रुटियों को संतुलित करने के लिए मॉडल को चिकना कर सकता है।
पूर्वाग्रह–विचरण विघटन
मान लीजिए कि एक प्रशिक्षण सेट में बिंदु \(x_1, \dots, x_n\) शामिल हैं, जिनमें लेबल \(y_i = f(x_i) + \varepsilon_i\) है, जहाँ \(f(x)\) वास्तविक फलन है और \(\varepsilon_i\) विचरण \(\sigma^2\) के साथ शून्य-माध्य शोर है। एक अधिगम एल्गोरिदम प्रशिक्षण डेटा \(D\) के आधार पर एक अनुमान \(\hat{f}(x; D)\) उत्पन्न करता है। बिंदु \(x\) पर अपेक्षित वर्ग त्रुटि को इस प्रकार विघटित किया जा सकता है:
\[\mathbb{E}[(y - \hat{f}(x; D))^2] = \text{Bias}^2(\hat{f}(x)) + \text{Var}(\hat{f}(x)) + \sigma^2\]
जहाँ पूर्वाग्रह \(\mathbb{E}[\hat{f}(x)] - f(x)\) है, विचरण \(\mathbb{E}[(\hat{f}(x) - \mathbb{E}[\hat{f}(x)])^2]\) है, और \(\sigma^2\) अपरिवर्तनीय शोर है। यह विघटन दर्शाता है कि एक पूर्ण मॉडल भी शून्य त्रुटि प्राप्त नहीं कर सकता है यदि डेटा में शोर हो।
त्रुटि के स्रोत
पूर्वाग्रह त्रुटि अधिगम एल्गोरिदम में गलत धारणाओं के परिणामस्वरूप होती है। उच्च पूर्वाग्रह अधोअन्वयन का कारण बनता है, जहाँ मॉडल प्रासंगिक संबंधों को पकड़ने में विफल रहता है। विचरण त्रुटि प्रशिक्षण सेट में छोटे उतार-चढ़ाव के प्रति संवेदनशीलता के कारण होती है। उच्च विचरण अति-अन्वयन का कारण बनता है, जहाँ मॉडल अंतर्निहित पैटर्न के बजाय शोर को फिट करता है।
इस समझौते को अक्सर मॉडल जटिलता को x-अक्ष पर और त्रुटि को y-अक्ष पर रखकर देखा जाता है। जैसे-जैसे जटिलता बढ़ती है, पूर्वाग्रह घटता है लेकिन विचरण बढ़ता है। कुल त्रुटि एक U-आकार का वक्र बनाती है, जिसमें एक इष्टतम जटिलता होती है जो कुल त्रुटि को न्यूनतम करती है। यह अवधारणा सरल रैखिक मॉडल से लेकर बड़े-भाषा-मॉडल में जटिल ट्रांसफॉर्मर वास्तुकला तक व्यापक रूप से लागू होती है।
समझौते का प्रबंधन
व्यवसायी क्रॉस-वैलिडेशन, नियमितीकरण, और एन्सेम्बल विधियों जैसी तकनीकों के माध्यम से पूर्वाग्रह–विचरण समझौते का प्रबंधन करते हैं। क्रॉस-वैलिडेशन सामान्यीकरण त्रुटि का अनुमान लगाने और मॉडल जटिलता का चयन करने में मदद करता है। नियमितीकरण जटिलता के लिए दंड जोड़ता है, गुणांकों को संकुचित करता है और विचरण को कम करता है, बढ़े हुए पूर्वाग्रह की कीमत पर। एन्सेम्बल विधियाँ, जैसे बैगिंग और बूस्टिंग, कई मॉडलों को संयोजित करके विचरण को कम करती हैं, बिना पूर्वाग्रह में काफी वृद्धि किए।
आधुनिक कृत्रिम-बुद्धिमत्ता में, यह समझौता प्रासंगिक बना हुआ है। उदाहरण के लिए, लाखों मापदंडों वाले डीप-लर्निंग मॉडल में अक्सर कम पूर्वाग्रह लेकिन उच्च विचरण होता है, जिसके लिए बड़े डेटासेट और नियमितीकरण की आवश्यकता होती है ताकि सामान्यीकरण हो सके। इसके विपरीत, सरल मॉडल जटिल कार्यों में अधोअन्वयन कर सकते हैं। यह समझौता जनरेटिव-एआई प्रणालियों के डिज़ाइन को भी प्रभावित करता है, जहाँ मॉडल क्षमता और सामान्यीकरण को संतुलित करना महत्वपूर्ण है।
ऐतिहासिक संदर्भ
पूर्वाग्रह–विचरण समझौते की जड़ें शास्त्रीय सांख्यिकी में हैं, जिनमें थॉमस-डाइटरिच और माइकल-जॉर्डन जैसे शोधकर्ताओं के योगदान शामिल हैं, जिन्होंने मशीन-लर्निंग के लिए विघटन को औपचारिक रूप देने में मदद की। इस अवधारणा को मिट-सीएसएआईएल और स्टैनफोर्ड-एआई-लैब जैसे संस्थानों के पाठ्यक्रमों में पढ़ाया गया है, और यह सांख्यिकीय अधिगम सिद्धांत की आधारशिला बनी हुई है। जैसे-जैसे मॉडल जटिलता में बढ़े हैं, समझौता विकसित हुआ है, लेकिन पूर्वाग्रह और विचरण के बीच मौलिक तनाव बना हुआ है।