बूटस्ट्रैप एग्रीगेशन, जिसे सामान्यतः बैगिंग के नाम से जाना जाता है, मशीन लर्निंग में एक एन्सेम्बल लर्निंग विधि है जिसे भविष्यवाणी मॉडल की सटीकता और मजबूती में सुधार के लिए डिज़ाइन किया गया है। यह मूल प्रशिक्षण डेटासेट से कई बूटस्ट्रैप नमूने (प्रतिस्थापन के साथ यादृच्छिक उपसमुच्चय) उत्पन्न करके, प्रत्येक नमूने पर एक अलग आधार मॉडल प्रशिक्षित करके, और फिर उनकी भविष्यवाणियों को एकत्रित करके काम करता है। प्रतिगमन कार्यों के लिए, अंतिम भविष्यवाणी आमतौर पर सभी आधार मॉडल आउटपुट का औसत होती है; वर्गीकरण के लिए, यह बहुमत मत होता है। बैगिंग मुख्य रूप से विचरण को कम करती है, जिससे अति-अनुकूलन को कम करने में मदद मिलती है, और यह उच्च-विचरण वाले एल्गोरिदम जैसे निर्णय वृक्षों के लिए विशेष रूप से प्रभावी है।
इस तकनीक को लियो ब्राइमन ने 1994 में अपने पेपर "बैगिंग प्रेडिक्टर्स" में पेश किया था। यह एन्सेम्बल लर्निंग में एक मूलभूत अवधारणा है, जो बूस्टिंग (जो क्रमिक रूप से त्रुटियों को सुधारता है) और स्टैकिंग (जो मेटा-लर्नर के माध्यम से विविध मॉडलों को जोड़ता है) से अलग है। बैगिंग व्यवहार में व्यापक रूप से उपयोग की जाती है, विशेष रूप से यादृच्छिक वनों के मूल के रूप में, जहां इसे फीचर सबसैंपलिंग के साथ जोड़ा जाता है। इसकी सरलता और प्रभावशीलता ने इसे शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों में, वित्त से लेकर स्वास्थ्य सेवा तक, एक मानक उपकरण बना दिया है।
ऐतिहासिक विकास
बैगिंग 1990 के दशक की शुरुआत के व्यापक सांख्यिकीय और मशीन लर्निंग अनुसंधान से उभरी, जो कई मॉडलों के संयोजन में बढ़ती रुचि द्वारा चिह्नित अवधि थी। कैलिफोर्निया विश्वविद्यालय, बर्कले के सांख्यिकीविद् लियो ब्राइमन ने 1994 में इस दृष्टिकोण को औपचारिक रूप दिया, जो ब्रैडली एफ्रॉन द्वारा बूटस्ट्रैप विधियों पर पहले के काम पर आधारित था। ब्राइमन ने सैद्धांतिक और अनुभवजन्य दोनों रूप से प्रदर्शित किया कि परेशान डेटासेट पर प्रशिक्षित मॉडलों से भविष्यवाणियों का औसत त्रुटि को कम कर सकता है, खासकर अस्थिर शिक्षार्थियों के लिए जिनके आउटपुट छोटे डेटा परिवर्तनों के साथ महत्वपूर्ण रूप से बदलते हैं।
2001 में ब्राइमन द्वारा यादृच्छिक वनों की शुरुआत के बाद विधि ने तेजी से आकर्षण प्राप्त किया, जिसने निर्णय वृक्षों में प्रत्येक विभाजन के लिए फीचर्स के एक उपसमुच्चय को बेतरतीब ढंग से चुनकर बैगिंग का विस्तार किया। इस नवाचार ने आधार मॉडलों को और अधिक असंबद्ध कर दिया, जिससे प्रदर्शन में पर्याप्त लाभ हुआ। तब से, बैगिंग को कई सॉफ्टवेयर लाइब्रेरीज़ में एकीकृत किया गया है, जिनमें scikit-learn, R का randomForest पैकेज और TensorFlow Decision Forests शामिल हैं, जिससे यह दुनिया भर के व्यवसायियों के लिए सुलभ हो गया है।
एल्गोरिथमिक विवरण
बैगिंग एल्गोरिदम सीधे तरीके से आगे बढ़ता है। आकार n के एक प्रशिक्षण सेट को देखते हुए, प्रक्रिया B बूटस्ट्रैप नमूने उत्पन्न करती है, प्रत्येक आकार n का, प्रतिस्थापन के साथ समान रूप से खींचा जाता है। इसका मतलब है कि कुछ मूल उदाहरण एक नमूने में कई बार दिखाई दे सकते हैं, जबकि अन्य को छोड़ दिया जाता है (किसी भी नमूने में लगभग 63.2% अद्वितीय उदाहरण दिखाई देते हैं, बाकी डुप्लिकेट होते हैं)। प्रत्येक नमूने के लिए, एक आधार मॉडल स्वतंत्र रूप से प्रशिक्षित किया जाता है, अक्सर एक ही एल्गोरिदम और हाइपरपैरामीटर का उपयोग करके। आधार मॉडल निर्णय वृक्ष, तंत्रिका नेटवर्क या अन्य शिक्षार्थी हो सकते हैं।
एकत्रीकरण कार्य पर निर्भर करता है। प्रतिगमन के लिए, भविष्यवाणियों का औसत लिया जाता है: \( \hat{f}(x) = \frac{1}{B} \sum_{b=1}^{B} \hat{f}_b(x) \)। वर्गीकरण के लिए, अंतिम वर्ग आधार मॉडलों के बीच बहुमत मत द्वारा निर्धारित किया जाता है। बूटस्ट्रैप नमूनों की संख्या B एक प्रमुख हाइपरपैरामीटर है; विशिष्ट मान 50 से 500 तक होते हैं, कुछ सौ से अधिक होने पर घटते लाभ के साथ। बैगिंग को आधार मॉडलों के लिए क्रॉस-वैलिडेशन की आवश्यकता नहीं होती है, क्योंकि आउट-ऑफ-बैग नमूने (वे उदाहरण जो किसी दिए गए बूटस्ट्रैप नमूने में शामिल नहीं हैं) का उपयोग अलग वैलिडेशन सेट के बिना सामान्यीकरण त्रुटि का अनुमान लगाने के लिए किया जा सकता है।
सैद्धांतिक आधार
बैगिंग की प्रभावशीलता विचरण में कमी से उत्पन्न होती है। भविष्यवाणी विचरण \( \sigma^2 \) और मॉडलों के बीच जोड़ीवार सहसंबंध \( \rho \) वाले आधार मॉडल के लिए, एन्सेम्बल औसत का विचरण लगभग \( \rho \sigma^2 + (1-\rho)\sigma^2/B \) होता है। जैसे-जैसे B बढ़ता है, दूसरा पद गायब हो जाता है, जिससे \( \rho \sigma^2 \) बचता है। इस प्रकार, बैगिंग सबसे अच्छा तब काम करती है जब आधार मॉडल अस्थिर (उच्च विचरण) होते हैं लेकिन बहुत अधिक सहसंबद्ध नहीं होते। निर्णय वृक्ष आदर्श होते हैं क्योंकि छोटे डेटा परिवर्तन अलग-अलग विभाजनों की ओर ले जाते हैं, फिर भी समग्र संरचना सहसंबंध को मध्यम रखने के लिए पर्याप्त समान रहती है।
ब्राइमन के मूल विश्लेषण ने दिखाया कि बैगिंग प्रतिगमन के लिए माध्य वर्ग त्रुटि और वर्गीकरण के लिए गलत वर्गीकरण दर को कम कर सकती है, बशर्ते आधार शिक्षार्थी अस्थिर हो। यह रैखिक प्रतिगमन जैसे स्थिर शिक्षार्थियों को महत्वपूर्ण रूप से मदद नहीं करती, जहां विचरण पहले से ही कम होता है। यह विधि आधार मॉडल भविष्यवाणियों के प्रसार के माध्यम से अनिश्चितता अनुमान के लिए एक प्राकृतिक तंत्र भी प्रदान करती है, जिसका उपयोग भविष्यवाणी अंतराल बनाने के लिए किया जा सकता है।
व्यावहारिक अनुप्रयोग
बैगिंग विविध डोमेन में लागू की जाती है। वित्त में, इसका उपयोग क्रेडिट स्कोरिंग और धोखाधड़ी का पता लगाने के लिए किया जाता है, जहां झूठी सकारात्मक को कम करना महत्वपूर्ण है। स्वास्थ्य सेवा में, बैग किए गए निर्णय वृक्ष इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से रोगी परिणामों की भविष्यवाणी और रोगों का निदान करने में मदद करते हैं। रिमोट सेंसिंग में, यादृच्छिक वन (एक बैगिंग संस्करण) उपग्रह इमेजरी से भूमि कवर को वर्गीकृत करते हैं। यह विधि पाठ वर्गीकरण के लिए प्राकृतिक भाषा प्रसंस्करण में भी आम है, हालांकि गहन शिक्षण मॉडल अक्सर अन्य नियमितीकरण तकनीकों पर निर्भर करते हैं।
एक उल्लेखनीय अनुप्रयोग Machine learning प्रतियोगिताओं में एन्सेम्बल विधियों में है, जहां बैगिंग को अक्सर बूस्टिंग के साथ जोड़ा जाता है या भविष्यवाणियों को स्थिर करने के लिए अंतिम चरण के रूप में उपयोग किया जाता है। उदाहरण के लिए, नेटफ्लिक्स प्राइज़ और कागल प्रतियोगिताओं में, प्रतिभागी अक्सर छोटे सटीकता लाभ निकालने के लिए अपने सर्वश्रेष्ठ मॉडलों को बैग करते हैं। उद्योग में, Amazon Web Services और Google Cloud जैसी कंपनियां प्रबंधित सेवाएं प्रदान करती हैं जिनमें बैगिंग कार्यान्वयन शामिल हैं, जो मैन्युअल ऑर्केस्ट्रेशन के बिना स्केलेबल मॉडल प्रशिक्षण सक्षम करती हैं।
सीमाएं और विस्तार
बैगिंग की कई सीमाएं हैं। यह पूर्वाग्रह को कम नहीं करती; यदि आधार मॉडल व्यवस्थित रूप से कम-फिटिंग कर रहा है, तो बैगिंग इसे ठीक नहीं करेगी। यह आधार मॉडलों की संख्या के साथ कम्प्यूटेशनल लागत को रैखिक रूप से भी बढ़ाती है, हालांकि चूंकि प्रत्येक मॉडल स्वतंत्र है, प्रशिक्षण को आसानी से समानांतर किया जा सकता है। कई मॉडलों को संग्रहीत करते समय मेमोरी उपयोग उच्च हो सकता है। इसके अलावा, बैगिंग बहुत बड़े डेटासेट के लिए कम प्रभावी है जहां एक एकल मॉडल पहले से ही अच्छी तरह से सामान्यीकरण करता है, या रैखिक सपोर्ट वेक्टर मशीनों जैसे स्थिर एल्गोरिदम के लिए।
विस्तार इनमें से कुछ मुद्दों को संबोधित करते हैं। यादृच्छिक वन वृक्षों को और अधिक असंबद्ध करने के लिए फीचर सबसैंपलिंग जोड़ते हैं। पेस्टिंग (या सबबैगिंग) प्रतिस्थापन के बिना छोटे यादृच्छिक नमूनों पर प्रशिक्षित करता है, कम्प्यूटेशनल भार को कम करता है। ब्रैगिंग (ग्रेडिएंट बूस्टिंग के साथ बूटस्ट्रैप एग्रीगेशन) सटीकता में सुधार के लिए बैगिंग को बूस्टिंग के साथ जोड़ता है। तंत्रिका नेटवर्क के लिए, एक संबंधित तकनीक जिसे डीप एन्सेम्बल्स कहा जाता है, विभिन्न यादृच्छिक आरंभिकरण के साथ कई नेटवर्क प्रशिक्षित करती है, प्रभावी रूप से वजन स्तर पर बैगिंग लागू करती है। ये प्रकार आधुनिक एन्सेम्बल लर्निंग पर ब्राइमन के मूल विचार के स्थायी प्रभाव को उजागर करते हैं।