बूटस्ट्रैप एग्रीगेशन, जिसे आमतौर पर बैगिंग कहा जाता है, Machine learning में एक एन्सेम्बल मेटा-एल्गोरिदम है जिसे वर्गीकरण और प्रतिगमन एल्गोरिदम की स्थिरता और सटीकता में सुधार करने के लिए डिज़ाइन किया गया है। यह विचरण को कम करता है और ओवरफिटिंग को कम करने में मदद करता है। हालांकि बैगिंग अक्सर निर्णय वृक्ष विधियों पर लागू होती है, इसका उपयोग किसी भी प्रकार के मॉडल के साथ किया जा सकता है। यह व्यापक एन्सेम्बल औसत दृष्टिकोण का एक विशेष मामला है, जहां एकल भविष्यवाणी उत्पन्न करने के लिए कई मॉडलों को संयोजित किया जाता है।
यह तकनीक 1990 के दशक में थॉमस डाइटेरिच द्वारा पेश की गई थी, हालांकि "बैगिंग" शब्द माइकल जॉर्डन द्वारा 1994 के एक पेपर में गढ़ा गया था। तब से बैगिंग मशीन लर्निंग में एक मौलिक उपकरण बन गया है, विशेष रूप से रैंडम फॉरेस्ट और अन्य एन्सेम्बल विधियों के विकास में।
मुख्य विचार
बैगिंग के पीछे मुख्य विचार औसत की शक्ति का लाभ उठाना है। प्रशिक्षण डेटा के थोड़े अलग उपसमुच्चय पर प्रशिक्षित व्यक्तिगत मॉडल में असंबद्ध त्रुटियां होती हैं। उनकी भविष्यवाणियों का औसत लेकर, ये त्रुटियां रद्द हो जाती हैं, जिससे एक अधिक मजबूत और सटीक अंतिम मॉडल बनता है। यह विशेष रूप से अस्थिर एल्गोरिदम के लिए फायदेमंद है, जहां प्रशिक्षण डेटा में छोटे बदलाव सीखे गए मॉडल में बड़े बदलाव ला सकते हैं।
बैगिंग एल्गोरिदम
आकार \( n \) का एक मानक प्रशिक्षण सेट \( D \) दिए जाने पर, बैगिंग \( m \) नए प्रशिक्षण सेट \( D_i \) उत्पन्न करता है, प्रत्येक आकार \( n' \) का, \( D \) से समान रूप से और प्रतिस्थापन के साथ नमूना लेकर। यह नमूनाकरण प्रक्रिया बूटस्ट्रैपिंग के रूप में जानी जाती है। जब \( n' = n \), बड़े \( n \) के लिए, प्रत्येक \( D_i \) में \( D \) से लगभग 63.2% अद्वितीय नमूने होने की उम्मीद है, बाकी डुप्लिकेट होते हैं। यह अंश सीमा \( 1 - 1/e \) से उत्पन्न होता है। प्रतिस्थापन के साथ नमूनाकरण सुनिश्चित करता है कि प्रत्येक बूटस्ट्रैप नमूना दूसरों से स्वतंत्र है, क्योंकि प्रत्येक नमूने का चयन पिछले चयनों पर निर्भर नहीं करता है।
\( m \) बूटस्ट्रैप नमूने उत्पन्न करने के बाद, \( m \) मॉडल फिट किए जाते हैं, प्रत्येक नमूने पर एक। प्रतिगमन कार्यों के लिए, अंतिम भविष्यवाणी व्यक्तिगत मॉडल आउटपुट का औसत है। वर्गीकरण कार्यों के लिए, अंतिम भविष्यवाणी मतदान द्वारा निर्धारित की जाती है, आमतौर पर बहुमत मत।
प्रमुख शर्तें: मूल, बूटस्ट्रैप और आउट-ऑफ-बैग डेटासेट
बूटस्ट्रैप एग्रीगेशन में, तीन प्रकार के डेटासेट प्रासंगिक हैं: मूल डेटासेट, बूटस्ट्रैप डेटासेट और आउट-ऑफ-बैग डेटासेट। मूल डेटासेट दिया गया प्रशिक्षण डेटा है। बूटस्ट्रैप डेटासेट मूल डेटासेट से प्रतिस्थापन के साथ यादृच्छिक रूप से नमूना लेकर बनाया जाता है, और इसका आकार मूल के समान होता है। उदाहरण के लिए, यदि मूल डेटासेट में 12 लोग शामिल हैं जिनके नाम एमिली, जेसी, जॉर्ज, कॉन्स्टेंटाइन, लेक्सी, थियोडोर, जॉन, जेम्स, रेचेल, एंथनी, एली और जमाल हैं, तो एक बूटस्ट्रैप नमूने में जेम्स, एली, कॉन्स्टेंटाइन, लेक्सी, जॉन, कॉन्स्टेंटाइन, थियोडोर, कॉन्स्टेंटाइन, एंथनी, लेक्सी, कॉन्स्टेंटाइन और थियोडोर शामिल हो सकते हैं। यहां, कॉन्स्टेंटाइन चार बार, लेक्सी दो बार और थियोडोर दो बार दिखाई देता है।
आउट-ऑफ-बैग डेटासेट में वे अवलोकन शामिल होते हैं जो बूटस्ट्रैप नमूने में चयनित नहीं किए गए थे। उदाहरण में, आउट-ऑफ-बैग सेट एमिली, जेसी, जॉर्ज, रेचेल और जमाल होगा। चूंकि सेट डुप्लिकेट को अनदेखा करते हैं, अंतर मूल सेट और बूटस्ट्रैप सेट के अद्वितीय तत्वों के बीच लिया जाता है।
निर्णय वृक्षों और रैंडम फॉरेस्ट में अनुप्रयोग
बैगिंग अक्सर निर्णय वृक्षों के साथ उपयोग की जाती है, जिससे रैंडम फॉरेस्ट का निर्माण होता है। एक रैंडम फॉरेस्ट में, प्रत्येक वृक्ष को बूटस्ट्रैप नमूने पर प्रशिक्षित किया जाता है, और इसके अतिरिक्त, प्रत्येक विभाजन पर, केवल सुविधाओं का एक छोटा यादृच्छिक उपसमुच्चय माना जाता है। यह वृक्षों के बीच और विविधता लाता है, जिससे एन्सेम्बल अधिक मजबूत बनता है।
बूटस्ट्रैप डेटासेट से निर्णय वृक्ष बनाने के लिए, एल्गोरिदम प्रत्येक सुविधा की जांच करता है और निर्धारित करता है कि यह नमूनों को सकारात्मक और नकारात्मक वर्गों में कितनी अच्छी तरह अलग करता है। यह अक्सर एक कन्फ्यूजन मैट्रिक्स का उपयोग करके किया जाता है, जो सही सकारात्मक, गलत सकारात्मक, सही नकारात्मक और गलत नकारात्मक की सूची देता है। सुविधाओं को सूचना लाभ या "अच्छाई" के माप जैसे मेट्रिक्स के आधार पर रैंक किया जाता है। शीर्ष सुविधा का उपयोग नमूनों को दो सेटों में विभाजित करने के लिए किया जाता है: वे जिनके पास सुविधा है और वे जिनके पास नहीं है। यह प्रक्रिया प्रत्येक उपसमुच्चय के लिए पुनरावर्ती रूप से तब तक दोहराई जाती है जब तक कि एक रोक मानदंड, जैसे अधिकतम गहराई, तक नहीं पहुंच जाता। पत्तियों पर, नमूनों को बहुमत वर्ग के आधार पर सकारात्मक या नकारात्मक के रूप में वर्गीकृत किया जाता है।
रैंडम फॉरेस्ट, जो बैगिंग को यादृच्छिक सुविधा चयन के साथ जोड़ते हैं, उच्च सटीकता प्राप्त करने के लिए दिखाए गए हैं और व्यवहार में व्यापक रूप से उपयोग किए जाते हैं। वन में वृक्षों की संख्या प्रदर्शन को प्रभावित करती है; उदाहरण के लिए, 50 वृक्षों वाला एक मॉडल आमतौर पर 10 वृक्षों वाले मॉडल से बेहतर प्रदर्शन करता है, क्योंकि अधिक वृक्षों के साथ सभी बूटस्ट्रैप नमूनों से बाहर छोड़े जाने वाले अवलोकन की संभावना कम हो जाती है।
विभिन्न एल्गोरिदम पर प्रभाव
बैगिंग अस्थिर प्रक्रियाओं के लिए सुधार लाता है, जिनमें कृत्रिम तंत्रिका नेटवर्क, वर्गीकरण और प्रतिगमन वृक्ष, और रैखिक प्रतिगमन में उपसमुच्चय चयन शामिल हैं। यह प्रीइमेज लर्निंग में सुधार करने के लिए भी दिखाया गया है। दूसरी ओर, बैगिंग स्थिर विधियों जैसे कि k-निकटतम पड़ोसियों के प्रदर्शन को हल्के से खराब कर सकता है, क्योंकि समान मॉडलों पर औसत लेने से विचरण में महत्वपूर्ण कमी नहीं होती है और पूर्वाग्रह पेश हो सकता है।
सैद्धांतिक अंतर्दृष्टि
बैगिंग की प्रभावशीलता विचरण में कमी पर आधारित है। उच्च विचरण वाले मॉडल के लिए, जैसे कि गहरा निर्णय वृक्ष, प्रशिक्षण डेटा में छोटे बदलाव बहुत अलग मॉडल बना सकते हैं। बूटस्ट्रैप नमूनों पर प्रशिक्षित कई मॉडलों पर औसत लेकर, अंतिम भविष्यवाणी का विचरण कम हो जाता है, अक्सर पूर्वाग्रह में महत्वपूर्ण वृद्धि के बिना। यह विशेष रूप से उच्च-आयामी सेटिंग्स में महत्वपूर्ण है, जैसे कि Deep learning और Artificial intelligence अनुप्रयोगों में सामना किया जाता है।
व्यावहारिक विचार
बैगिंग कम्प्यूटेशनल रूप से कुशल है क्योंकि प्रत्येक मॉडल को स्वतंत्र रूप से प्रशिक्षित किया जा सकता है, जिससे इसे समानांतर करना आसान हो जाता है। इसने बड़े पैमाने पर मशीन लर्निंग पाइपलाइनों में इसकी लोकप्रियता में योगदान दिया है, जिसमें Amazon Web Services और Google Cloud जैसे क्लाउड प्रदाताओं द्वारा उपयोग किए जाने वाले शामिल हैं। व्यवहार में, बूटस्ट्रैप नमूनों की संख्या \( m \) अक्सर उपलब्ध कम्प्यूटेशनल संसाधनों के आधार पर चुनी जाती है, जिसमें विशिष्ट मान 10 से लेकर कुछ सौ तक होते हैं।
अन्य एन्सेम्बल विधियों से संबंध
बैगिंग अन्य एन्सेम्बल तकनीकों, जैसे बूस्टिंग और स्टैकिंग से निकटता से संबंधित है। जबकि बूस्टिंग त्रुटियों को सुधारने के लिए अनुक्रमिक रूप से मॉडल प्रशिक्षित करने पर केंद्रित है, बैगिंग मॉडल को समानांतर में प्रशिक्षित करता है और उन्हें औसत या मतदान द्वारा जोड़ता है। यह अंतर बैगिंग को विचरण कम करने के लिए विशेष रूप से उपयुक्त बनाता है, जबकि बूस्टिंग पूर्वाग्रह कम करने में अधिक प्रभावी है। रैंडम फॉरेस्ट, निर्णय वृक्षों के साथ बैगिंग का एक विशिष्ट कार्यान्वयन, मशीन लर्निंग में सबसे व्यापक रूप से उपयोग किए जाने वाले एन्सेम्बल तरीकों में से हैं।
निष्कर्ष
बैगिंग मशीन लर्निंग में एक मौलिक तकनीक बनी हुई है, जो मॉडल स्थिरता और सटीकता में सुधार करने का एक सरल फिर भी शक्तिशाली तरीका प्रदान करती है। इसके सिद्धांतों ने अधिक उन्नत एन्सेम्बल विधियों के विकास को प्रभावित किया है और आधुनिक अनुप्रयोगों में प्रासंगिक बने हुए हैं, पारंपरिक सारणीबद्ध डेटा से लेकर तंत्रिका नेटवर्क और बड़े भाषा मॉडल जैसे जटिल डोमेन तक।