अंग्रेज़ी से अनुवादित

बूटस्ट्रैप एग्रीगेशन (बैगिंग) मशीन लर्निंग में एक एन्सेम्बल मेटा-एल्गोरिदम है जो बूटस्ट्रैप नमूनों पर कई मॉडलों को प्रशिक्षित करके और उनकी भविष्यवाणियों को संयोजित करके स्थिरता और सटीकता में सुधार करता है।

बूटस्ट्रैप एग्रीगेशन, जिसे आमतौर पर बैगिंग कहा जाता है, Machine learning में एक एन्सेम्बल मेटा-एल्गोरिदम है जिसे वर्गीकरण और प्रतिगमन एल्गोरिदम की स्थिरता और सटीकता में सुधार करने के लिए डिज़ाइन किया गया है। यह विचरण को कम करता है और ओवरफिटिंग को कम करने में मदद करता है। हालांकि बैगिंग अक्सर निर्णय वृक्ष विधियों पर लागू होती है, इसका उपयोग किसी भी प्रकार के मॉडल के साथ किया जा सकता है। यह व्यापक एन्सेम्बल औसत दृष्टिकोण का एक विशेष मामला है, जहां एकल भविष्यवाणी उत्पन्न करने के लिए कई मॉडलों को संयोजित किया जाता है।

यह तकनीक 1990 के दशक में थॉमस डाइटेरिच द्वारा पेश की गई थी, हालांकि "बैगिंग" शब्द माइकल जॉर्डन द्वारा 1994 के एक पेपर में गढ़ा गया था। तब से बैगिंग मशीन लर्निंग में एक मौलिक उपकरण बन गया है, विशेष रूप से रैंडम फॉरेस्ट और अन्य एन्सेम्बल विधियों के विकास में।

मुख्य विचार

बैगिंग के पीछे मुख्य विचार औसत की शक्ति का लाभ उठाना है। प्रशिक्षण डेटा के थोड़े अलग उपसमुच्चय पर प्रशिक्षित व्यक्तिगत मॉडल में असंबद्ध त्रुटियां होती हैं। उनकी भविष्यवाणियों का औसत लेकर, ये त्रुटियां रद्द हो जाती हैं, जिससे एक अधिक मजबूत और सटीक अंतिम मॉडल बनता है। यह विशेष रूप से अस्थिर एल्गोरिदम के लिए फायदेमंद है, जहां प्रशिक्षण डेटा में छोटे बदलाव सीखे गए मॉडल में बड़े बदलाव ला सकते हैं।

बैगिंग एल्गोरिदम

आकार \( n \) का एक मानक प्रशिक्षण सेट \( D \) दिए जाने पर, बैगिंग \( m \) नए प्रशिक्षण सेट \( D_i \) उत्पन्न करता है, प्रत्येक आकार \( n' \) का, \( D \) से समान रूप से और प्रतिस्थापन के साथ नमूना लेकर। यह नमूनाकरण प्रक्रिया बूटस्ट्रैपिंग के रूप में जानी जाती है। जब \( n' = n \), बड़े \( n \) के लिए, प्रत्येक \( D_i \) में \( D \) से लगभग 63.2% अद्वितीय नमूने होने की उम्मीद है, बाकी डुप्लिकेट होते हैं। यह अंश सीमा \( 1 - 1/e \) से उत्पन्न होता है। प्रतिस्थापन के साथ नमूनाकरण सुनिश्चित करता है कि प्रत्येक बूटस्ट्रैप नमूना दूसरों से स्वतंत्र है, क्योंकि प्रत्येक नमूने का चयन पिछले चयनों पर निर्भर नहीं करता है।

\( m \) बूटस्ट्रैप नमूने उत्पन्न करने के बाद, \( m \) मॉडल फिट किए जाते हैं, प्रत्येक नमूने पर एक। प्रतिगमन कार्यों के लिए, अंतिम भविष्यवाणी व्यक्तिगत मॉडल आउटपुट का औसत है। वर्गीकरण कार्यों के लिए, अंतिम भविष्यवाणी मतदान द्वारा निर्धारित की जाती है, आमतौर पर बहुमत मत।

प्रमुख शर्तें: मूल, बूटस्ट्रैप और आउट-ऑफ-बैग डेटासेट

बूटस्ट्रैप एग्रीगेशन में, तीन प्रकार के डेटासेट प्रासंगिक हैं: मूल डेटासेट, बूटस्ट्रैप डेटासेट और आउट-ऑफ-बैग डेटासेट। मूल डेटासेट दिया गया प्रशिक्षण डेटा है। बूटस्ट्रैप डेटासेट मूल डेटासेट से प्रतिस्थापन के साथ यादृच्छिक रूप से नमूना लेकर बनाया जाता है, और इसका आकार मूल के समान होता है। उदाहरण के लिए, यदि मूल डेटासेट में 12 लोग शामिल हैं जिनके नाम एमिली, जेसी, जॉर्ज, कॉन्स्टेंटाइन, लेक्सी, थियोडोर, जॉन, जेम्स, रेचेल, एंथनी, एली और जमाल हैं, तो एक बूटस्ट्रैप नमूने में जेम्स, एली, कॉन्स्टेंटाइन, लेक्सी, जॉन, कॉन्स्टेंटाइन, थियोडोर, कॉन्स्टेंटाइन, एंथनी, लेक्सी, कॉन्स्टेंटाइन और थियोडोर शामिल हो सकते हैं। यहां, कॉन्स्टेंटाइन चार बार, लेक्सी दो बार और थियोडोर दो बार दिखाई देता है।

आउट-ऑफ-बैग डेटासेट में वे अवलोकन शामिल होते हैं जो बूटस्ट्रैप नमूने में चयनित नहीं किए गए थे। उदाहरण में, आउट-ऑफ-बैग सेट एमिली, जेसी, जॉर्ज, रेचेल और जमाल होगा। चूंकि सेट डुप्लिकेट को अनदेखा करते हैं, अंतर मूल सेट और बूटस्ट्रैप सेट के अद्वितीय तत्वों के बीच लिया जाता है।

निर्णय वृक्षों और रैंडम फॉरेस्ट में अनुप्रयोग

बैगिंग अक्सर निर्णय वृक्षों के साथ उपयोग की जाती है, जिससे रैंडम फॉरेस्ट का निर्माण होता है। एक रैंडम फॉरेस्ट में, प्रत्येक वृक्ष को बूटस्ट्रैप नमूने पर प्रशिक्षित किया जाता है, और इसके अतिरिक्त, प्रत्येक विभाजन पर, केवल सुविधाओं का एक छोटा यादृच्छिक उपसमुच्चय माना जाता है। यह वृक्षों के बीच और विविधता लाता है, जिससे एन्सेम्बल अधिक मजबूत बनता है।

बूटस्ट्रैप डेटासेट से निर्णय वृक्ष बनाने के लिए, एल्गोरिदम प्रत्येक सुविधा की जांच करता है और निर्धारित करता है कि यह नमूनों को सकारात्मक और नकारात्मक वर्गों में कितनी अच्छी तरह अलग करता है। यह अक्सर एक कन्फ्यूजन मैट्रिक्स का उपयोग करके किया जाता है, जो सही सकारात्मक, गलत सकारात्मक, सही नकारात्मक और गलत नकारात्मक की सूची देता है। सुविधाओं को सूचना लाभ या "अच्छाई" के माप जैसे मेट्रिक्स के आधार पर रैंक किया जाता है। शीर्ष सुविधा का उपयोग नमूनों को दो सेटों में विभाजित करने के लिए किया जाता है: वे जिनके पास सुविधा है और वे जिनके पास नहीं है। यह प्रक्रिया प्रत्येक उपसमुच्चय के लिए पुनरावर्ती रूप से तब तक दोहराई जाती है जब तक कि एक रोक मानदंड, जैसे अधिकतम गहराई, तक नहीं पहुंच जाता। पत्तियों पर, नमूनों को बहुमत वर्ग के आधार पर सकारात्मक या नकारात्मक के रूप में वर्गीकृत किया जाता है।

रैंडम फॉरेस्ट, जो बैगिंग को यादृच्छिक सुविधा चयन के साथ जोड़ते हैं, उच्च सटीकता प्राप्त करने के लिए दिखाए गए हैं और व्यवहार में व्यापक रूप से उपयोग किए जाते हैं। वन में वृक्षों की संख्या प्रदर्शन को प्रभावित करती है; उदाहरण के लिए, 50 वृक्षों वाला एक मॉडल आमतौर पर 10 वृक्षों वाले मॉडल से बेहतर प्रदर्शन करता है, क्योंकि अधिक वृक्षों के साथ सभी बूटस्ट्रैप नमूनों से बाहर छोड़े जाने वाले अवलोकन की संभावना कम हो जाती है।

विभिन्न एल्गोरिदम पर प्रभाव

बैगिंग अस्थिर प्रक्रियाओं के लिए सुधार लाता है, जिनमें कृत्रिम तंत्रिका नेटवर्क, वर्गीकरण और प्रतिगमन वृक्ष, और रैखिक प्रतिगमन में उपसमुच्चय चयन शामिल हैं। यह प्रीइमेज लर्निंग में सुधार करने के लिए भी दिखाया गया है। दूसरी ओर, बैगिंग स्थिर विधियों जैसे कि k-निकटतम पड़ोसियों के प्रदर्शन को हल्के से खराब कर सकता है, क्योंकि समान मॉडलों पर औसत लेने से विचरण में महत्वपूर्ण कमी नहीं होती है और पूर्वाग्रह पेश हो सकता है।

सैद्धांतिक अंतर्दृष्टि

बैगिंग की प्रभावशीलता विचरण में कमी पर आधारित है। उच्च विचरण वाले मॉडल के लिए, जैसे कि गहरा निर्णय वृक्ष, प्रशिक्षण डेटा में छोटे बदलाव बहुत अलग मॉडल बना सकते हैं। बूटस्ट्रैप नमूनों पर प्रशिक्षित कई मॉडलों पर औसत लेकर, अंतिम भविष्यवाणी का विचरण कम हो जाता है, अक्सर पूर्वाग्रह में महत्वपूर्ण वृद्धि के बिना। यह विशेष रूप से उच्च-आयामी सेटिंग्स में महत्वपूर्ण है, जैसे कि Deep learning और Artificial intelligence अनुप्रयोगों में सामना किया जाता है।

व्यावहारिक विचार

बैगिंग कम्प्यूटेशनल रूप से कुशल है क्योंकि प्रत्येक मॉडल को स्वतंत्र रूप से प्रशिक्षित किया जा सकता है, जिससे इसे समानांतर करना आसान हो जाता है। इसने बड़े पैमाने पर मशीन लर्निंग पाइपलाइनों में इसकी लोकप्रियता में योगदान दिया है, जिसमें Amazon Web Services और Google Cloud जैसे क्लाउड प्रदाताओं द्वारा उपयोग किए जाने वाले शामिल हैं। व्यवहार में, बूटस्ट्रैप नमूनों की संख्या \( m \) अक्सर उपलब्ध कम्प्यूटेशनल संसाधनों के आधार पर चुनी जाती है, जिसमें विशिष्ट मान 10 से लेकर कुछ सौ तक होते हैं।

अन्य एन्सेम्बल विधियों से संबंध

बैगिंग अन्य एन्सेम्बल तकनीकों, जैसे बूस्टिंग और स्टैकिंग से निकटता से संबंधित है। जबकि बूस्टिंग त्रुटियों को सुधारने के लिए अनुक्रमिक रूप से मॉडल प्रशिक्षित करने पर केंद्रित है, बैगिंग मॉडल को समानांतर में प्रशिक्षित करता है और उन्हें औसत या मतदान द्वारा जोड़ता है। यह अंतर बैगिंग को विचरण कम करने के लिए विशेष रूप से उपयुक्त बनाता है, जबकि बूस्टिंग पूर्वाग्रह कम करने में अधिक प्रभावी है। रैंडम फॉरेस्ट, निर्णय वृक्षों के साथ बैगिंग का एक विशिष्ट कार्यान्वयन, मशीन लर्निंग में सबसे व्यापक रूप से उपयोग किए जाने वाले एन्सेम्बल तरीकों में से हैं।

निष्कर्ष

बैगिंग मशीन लर्निंग में एक मौलिक तकनीक बनी हुई है, जो मॉडल स्थिरता और सटीकता में सुधार करने का एक सरल फिर भी शक्तिशाली तरीका प्रदान करती है। इसके सिद्धांतों ने अधिक उन्नत एन्सेम्बल विधियों के विकास को प्रभावित किया है और आधुनिक अनुप्रयोगों में प्रासंगिक बने हुए हैं, पारंपरिक सारणीबद्ध डेटा से लेकर तंत्रिका नेटवर्क और बड़े भाषा मॉडल जैसे जटिल डोमेन तक।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ensemble-learning·machine-learning·statistical-classification
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास