ग्रेडिएंट बूस्टिंग एक मशीन लर्निंग तकनीक है जिसका उपयोग प्रतिगमन और वर्गीकरण कार्यों के लिए किया जाता है। यह बूस्टिंग विधियों के परिवार से संबंधित है, जो कई कमजोर भविष्यवाणी मॉडलों को एक मजबूत मॉडल में संयोजित करती हैं। पारंपरिक बूस्टिंग के विपरीत, जो अवशेषों पर मॉडल फिट करती है, ग्रेडिएंट बूस्टिंग एक कार्यात्मक स्थान में काम करती है और छद्म-अवशेषों को लक्षित करती है, जिससे किसी भी अवकलनीय हानि फलन का अनुकूलन संभव होता है। जब कमजोर शिक्षार्थी निर्णय वृक्ष होते हैं, तो परिणामी एल्गोरिदम को ग्रेडिएंट-बूस्टेड वृक्ष कहा जाता है, जो आमतौर पर भविष्यवाणी सटीकता में रैंडम फॉरेस्ट से बेहतर प्रदर्शन करता है।
यह विधि कमजोर मॉडलों के समूह के रूप में एक भविष्यवाणी मॉडल उत्पन्न करती है, जो आमतौर पर सरल निर्णय वृक्ष होते हैं जो डेटा के बारे में कुछ धारणाएँ बनाते हैं। मॉडल को पुनरावृत्त रूप से बनाया जाता है, जिसमें प्रत्येक नया घटक पिछले समूह की त्रुटियों को सुधारता है। यह दृष्टिकोण पहले के बूस्टिंग एल्गोरिदम को सामान्यीकृत करता है और आधुनिक मशीन लर्निंग का एक आधारशिला बन गया है, जिसका उद्योग और अनुसंधान में व्यापक रूप से उपयोग किया जाता है।
इतिहास
ग्रेडिएंट बूस्टिंग की अवधारणात्मक नींव लियो ब्रेमैन के अवलोकन से जुड़ी है कि बूस्टिंग को लागत फलन पर एक अनुकूलन एल्गोरिदम के रूप में व्याख्यायित किया जा सकता है। स्पष्ट प्रतिगमन ग्रेडिएंट बूस्टिंग एल्गोरिदम जेरोम एच. फ्रीडमैन द्वारा 1999 में विकसित किए गए और 2001 में परिष्कृत किए गए। साथ ही, लेव मेसन, जोनाथन बैक्सटर, पीटर बार्टलेट और मार्कस फ्रीन ने एक अधिक सामान्य कार्यात्मक ग्रेडिएंट बूस्टिंग दृष्टिकोण प्रस्तुत किया। उनके कार्य ने बूस्टिंग एल्गोरिदम को पुनरावृत्त कार्यात्मक ग्रेडिएंट अवरोहण के रूप में तैयार किया, जहाँ एक लागत फलन को फलन स्थान पर कमजोर परिकल्पनाओं का चयन करके अनुकूलित किया जाता है जो नकारात्मक ग्रेडिएंट दिशा में इंगित करती हैं। इस दृष्टिकोण ने मशीन लर्निंग और सांख्यिकी के कई क्षेत्रों में बूस्टिंग विधियों के विकास को प्रेरित किया, जो प्रतिगमन और वर्गीकरण से कहीं आगे तक विस्तारित हुआ।
एल्गोरिदम अवलोकन
ग्रेडिएंट बूस्टिंग M चरणों में एक मॉडल बनाता है। प्रत्येक चरण m पर, वर्तमान मॉडल F_m में एक नया अनुमानक h_m जोड़कर सुधार किया जाता है। कम से कम वर्ग प्रतिगमन के लिए, लक्ष्य आकार n के प्रशिक्षण सेट पर माध्य वर्ग त्रुटि को न्यूनतम करना है। प्रारंभ में, F_1 केवल लक्ष्य मानों का माध्य भविष्यवाणी कर सकता है। प्रत्येक बाद के चरण में, एल्गोरिदम अवशेष की गणना करता है, जो देखे गए मान और वर्तमान भविष्यवाणी के बीच का अंतर है। फिर यह इन अवशेषों पर एक कमजोर शिक्षार्थी, आमतौर पर एक उथला निर्णय वृक्ष, फिट करता है। अद्यतन मॉडल F_{m+1}(x) = F_m(x) + h_m(x) बन जाता है। यह प्रक्रिया तब तक दोहराई जाती है जब तक वांछित संख्या में चरण पूरे नहीं हो जाते या प्रदर्शन स्थिर नहीं हो जाता।
सामान्य हानि फलनों के लिए, एल्गोरिदम छद्म-अवशेषों का उपयोग करता है, जो मॉडल की भविष्यवाणियों के संबंध में हानि फलन के नकारात्मक ग्रेडिएंट होते हैं। यह विधि को विभिन्न कार्यों को संभालने की अनुमति देता है, जिसमें लॉजिस्टिक हानि के साथ वर्गीकरण या जोड़ीवार हानियों के साथ रैंकिंग शामिल है।
ग्रेडिएंट-बूस्टेड वृक्ष
जब निर्णय वृक्षों को कमजोर शिक्षार्थियों के रूप में उपयोग किया जाता है, तो एल्गोरिदम को ग्रेडिएंट-बूस्टेड वृक्ष के रूप में जाना जाता है। प्रत्येक वृक्ष आमतौर पर छोटा होता है, अक्सर सीमित संख्या में पत्तियों के साथ, ताकि मॉडल व्याख्या योग्य रहे और अति-अनुकूलन को रोका जा सके। वृक्षों को अनुक्रमिक रूप से जोड़ा जाता है, जिसमें प्रत्येक वृक्ष पिछले समूह द्वारा छोड़ी गई त्रुटियों पर ध्यान केंद्रित करता है। यह दृष्टिकोण अक्सर सारणीबद्ध डेटा पर अत्याधुनिक परिणाम देता है, जो रैंडम फॉरेस्ट से बेहतर प्रदर्शन करता है और कभी-कभी संरचित डेटा कार्यों में गहन शिक्षण मॉडलों को भी पीछे छोड़ देता है।
मुख्य हाइपरपैरामीटर में वृक्षों की संख्या, प्रत्येक वृक्ष की अधिकतम गहराई, सीखने की दर (जो प्रत्येक वृक्ष के योगदान को कम करती है), और स्टोकेस्टिक ग्रेडिएंट बूस्टिंग के लिए उप-नमूनाकरण अनुपात शामिल हैं। नियमितीकरण तकनीकें, जैसे L1 और L2 दंड, भी आमतौर पर पत्ती भार पर लागू की जाती हैं।
अनुप्रयोग और कार्यान्वयन
ग्रेडिएंट बूस्टिंग को कई क्षेत्रों में सफलतापूर्वक लागू किया गया है, जिसमें क्रेडिट स्कोरिंग, क्लिक-थ्रू दर भविष्यवाणी, खोज रैंकिंग और बायोइन्फॉर्मेटिक्स शामिल हैं। लोकप्रिय ओपन-सोर्स लाइब्रेरी में XGBoost, LightGBM और CatBoost शामिल हैं, जो समानांतर प्रशिक्षण और GPU समर्थन के साथ अनुकूलित कार्यान्वयन प्रदान करते हैं। इन उपकरणों ने ग्रेडिएंट बूस्टिंग को चिकित्सकों के लिए सुलभ बना दिया है और प्रतियोगिताओं और उत्पादन प्रणालियों में व्यापक रूप से अपनाया गया है।
विधि की लचीलापन और मजबूत भविष्यवाणी प्रदर्शन ने इसे मशीन लर्निंग कार्यप्रवाहों में एक मानक आधार रेखा बना दिया है, जो अक्सर संरचित डेटा पर तंत्रिका नेटवर्क मॉडलों के साथ प्रतिस्पर्धा करता है।
अन्य विधियों से संबंध
ग्रेडिएंट बूस्टिंग रैंडम फॉरेस्ट और AdaBoost जैसी अन्य समूह विधियों से संबंधित है। हालाँकि, यह अपने अनुक्रमिक दृष्टिकोण और मनमाने हानि फलनों को अनुकूलित करने की क्षमता में भिन्न है। जबकि रैंडम फॉरेस्ट स्वतंत्र रूप से वृक्ष बनाते हैं और उनकी भविष्यवाणियों का औसत निकालते हैं, ग्रेडिएंट बूस्टिंग वृक्षों को अनुक्रमिक रूप से बनाता है, जिनमें से प्रत्येक पिछली त्रुटियों को सुधारता है। यह अक्सर उच्च सटीकता की ओर ले जाता है लेकिन अति-अनुकूलन से बचने के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।
कार्यात्मक ग्रेडिएंट दृष्टिकोण ग्रेडिएंट बूस्टिंग को फलन स्थान में अनुकूलन से भी जोड़ता है, एक अवधारणा जिसने कृत्रिम बुद्धिमत्ता और सांख्यिकीय शिक्षण जैसे अन्य क्षेत्रों को प्रभावित किया है। शोधकर्ताओं ने इस विचार को बहु-आउटपुट समस्याओं, उत्तरजीविता विश्लेषण और यहाँ तक कि तंत्रिका नेटवर्क प्रशिक्षण तक विस्तारित किया है, जहाँ अवशिष्ट शिक्षण में बूस्टिंग जैसे विचार दिखाई देते हैं।
सीमाएँ और विचारणीय बिंदु
अपनी ताकत के बावजूद, ग्रेडिएंट बूस्टिंग की सीमाएँ हैं। यह शोर वाले डेटा और बाहरी मानों के प्रति संवेदनशील हो सकता है, और यदि वृक्षों की संख्या बहुत अधिक है या वृक्ष बहुत गहरे हैं तो यह अति-अनुकूलन कर सकता है। प्रशिक्षण कम्प्यूटेशनल रूप से गहन हो सकता है, विशेष रूप से बड़े डेटासेट के साथ, हालाँकि आधुनिक कार्यान्वयन कुशल एल्गोरिदम और हार्डवेयर त्वरण के साथ इसे कम करते हैं। एकल निर्णय वृक्ष की तुलना में व्याख्या योग्यता कम होती है, हालाँकि फीचर महत्व माप और आंशिक निर्भरता प्लॉट अंतर्दृष्टि प्रदान कर सकते हैं।
कई मशीन लर्निंग तकनीकों की तरह, हाइपरपैरामीटर और हानि फलन का चुनाव प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है, और चिकित्सक अक्सर मॉडल को ट्यून करने के लिए क्रॉस-वैलिडेशन पर निर्भर करते हैं।