अंग्रेज़ी से अनुवादित

LightGBM माइक्रोसॉफ्ट द्वारा विकसित एक मुफ्त, ओपन-सोर्स, वितरित ग्रेडिएंट-बूस्टिंग फ्रेमवर्क है, जो लीफ-वाइज़ ट्री ग्रोथ और हिस्टोग्राम-आधारित लर्निंग का उपयोग करके अपनी उच्च दक्षता और स्केलेबिलिटी के लिए जाना जाता है।

LightGBM, जिसका पूरा नाम Light Gradient-Boosting Machine है, मशीन लर्निंग के लिए एक मुफ्त और ओपन-सोर्स वितरित ग्रेडिएंट-बूस्टिंग फ्रेमवर्क है, जिसे मूल रूप से Microsoft द्वारा विकसित किया गया था। यह डिसीज़न ट्री एल्गोरिदम पर आधारित है और रैंकिंग, वर्गीकरण और अन्य मशीन लर्निंग कार्यों के लिए उपयोग किया जाता है। यह फ्रेमवर्क उच्च प्रदर्शन और स्केलेबिलिटी के लिए डिज़ाइन किया गया है, जो इसे शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों में एक लोकप्रिय विकल्प बनाता है।

LightGBM विभिन्न प्रकार के एल्गोरिदम का समर्थन करता है, जिनमें ग्रेडिएंट बूस्टिंग ट्री (GBT), ग्रेडिएंट बूस्टिंग डिसीज़न ट्री (GBDT), ग्रेडिएंट बूस्टिंग रिग्रेशन ट्री (GBRT), ग्रेडिएंट बूस्टिंग मशीन (GBM), मल्टीपल एडिटिव रिग्रेशन ट्री (MART), और रैंडम फॉरेस्ट (RF) शामिल हैं। यह XGBoost के कई फायदों को शामिल करता है, जैसे स्पार्स ऑप्टिमाइज़ेशन, समानांतर प्रशिक्षण, कई लॉस फ़ंक्शन, रेगुलराइज़ेशन, बैगिंग, और अर्ली स्टॉपिंग। हालाँकि, मुख्य अंतर ट्री निर्माण में है: LightGBM पेड़ों को लेवल-वाइज़ के बजाय लीफ-वाइज़ बढ़ाता है, और अधिकतम डेल्टा लॉस वाले लीफ का चयन करके विस्तार करता है। यह दृष्टिकोण तेज़ अभिसरण की ओर ले जा सकता है, लेकिन ओवरफिटिंग से बचने के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।

एक और विशिष्ट विशेषता इसका अत्यधिक अनुकूलित हिस्टोग्राम-आधारित डिसीज़न ट्री लर्निंग एल्गोरिदम का उपयोग है, जो XGBoost और अन्य कार्यान्वयनों द्वारा उपयोग किए जाने वाले सॉर्टेड-आधारित दृष्टिकोण के बजाय है। यह हिस्टोग्राम-आधारित विधि प्रशिक्षण दक्षता और मेमोरी खपत दोनों में महत्वपूर्ण रूप से सुधार करती है। इसके अतिरिक्त, LightGBM दो नई तकनीकों का परिचय देता है: ग्रेडिएंट-आधारित वन-साइड सैंपलिंग (GOSS) और एक्सक्लूसिव फीचर बंडलिंग (EFB), जो एक साथ उच्च सटीकता बनाए रखते हुए तेज़ प्रशिक्षण को सक्षम बनाती हैं।

LightGBM Linux, Windows और macOS पर चलता है, और C++, Python, R और C# के लिए इंटरफेस प्रदान करता है। स्रोत कोड MIT लाइसेंस के तहत लाइसेंस प्राप्त है और GitHub पर उपलब्ध है।

ग्रेडिएंट-आधारित वन-साइड सैंपलिंग

ग्रेडिएंट-आधारित वन-साइड सैंपलिंग (GOSS) एक तकनीक है जिसे विशेष रूप से ग्रेडिएंट-बूस्टेड डिसीज़न ट्री के लिए विकसित किया गया है। पारंपरिक ग्रेडिएंट डिसेंट में, मॉडल को एक घाटी के रूप में अवधारणाबद्ध किया जाता है, जहाँ सबसे निचला बिंदु डेटा के लिए सबसे अच्छा फिट दर्शाता है। एल्गोरिदम लॉस को कम करने वाली दिशाओं में आगे बढ़कर मॉडल मापदंडों को पुनरावृत्त रूप से समायोजित करता है, प्रभावी रूप से घाटी में उतरता है। आम तौर पर, यह प्रक्रिया ग्रेडिएंट की गणना करने के लिए पूरे डेटासेट का उपयोग करती है, यह मानते हुए कि प्रत्येक डेटा बिंदु सीखने के संकेत में समान रूप से योगदान देता है।

GOSS इस धारणा को चुनौती देता है यह पहचान कर कि छोटे ग्रेडिएंट वाले डेटा बिंदु (यानी, उथले ढलान) सीखने की प्रक्रिया के लिए कम जानकारीपूर्ण होते हैं। ये बिंदु अक्सर अच्छी तरह से भविष्यवाणी किए गए उदाहरणों या शोर के अनुरूप होते हैं। GOSS इन कम-ग्रेडिएंट नमूनों के एक हिस्से को बेतरतीब ढंग से हटा देता है, जबकि बड़े ग्रेडिएंट वाले सभी नमूनों को बनाए रखता है। यह चयनात्मक सैंपलिंग प्रभावी डेटासेट आकार को कम करती है, सटीकता से महत्वपूर्ण रूप से समझौता किए बिना प्रशिक्षण को गति देती है। सबसे जानकारीपूर्ण डेटा बिंदुओं पर ध्यान केंद्रित करके, GOSS मॉडल को डेटा में अंतर्निहित संबंधों को बेहतर ढंग से पकड़ने में मदद करता है, साथ ही शोर वाले नमूनों के प्रभाव को भी कम करता है।

एक्सक्लूसिव फीचर बंडलिंग

एक्सक्लूसिव फीचर बंडलिंग (EFB) डेटासेट में प्रभावी फीचर्स की संख्या को कम करने की एक लगभग-लॉसलेस विधि है। कई वास्तविक दुनिया के अनुप्रयोगों में, विशेष रूप से स्पार्स फीचर स्पेस वाले, कई फीचर लगभग एक्सक्लूसिव होते हैं, जिसका अर्थ है कि वे शायद ही कभी एक साथ गैर-शून्य मान लेते हैं। वन-हॉट एन्कोडेड फीचर एक आदर्श उदाहरण हैं: प्रत्येक श्रेणी को एक बाइनरी फीचर द्वारा दर्शाया जाता है, और किसी भी दिए गए नमूने के लिए, उन फीचर्स में से केवल एक सक्रिय होता है। EFB इन एक्सक्लूसिव फीचर्स को एक एकल समग्र फीचर में बंडल करता है, जिससे डेटा की आयामीता कम हो जाती है। यह कमी कम मेमोरी उपयोग और तेज़ प्रशिक्षण की ओर ले जाती है, जबकि उच्च स्तर की सटीकता बनाए रखती है क्योंकि बंडलिंग प्रक्रिया के माध्यम से मूल जानकारी संरक्षित रहती है। एक्सक्लूसिव फीचर्स का एक एकल फीचर में बंडल एक्सक्लूसिव फीचर बंडल कहलाता है।

प्रदर्शन और स्केलेबिलिटी

LightGBM लाखों इंस्टेंस और फीचर्स वाले बड़े पैमाने के डेटासेट को संभालने के लिए डिज़ाइन किया गया है। इसका हिस्टोग्राम-आधारित एल्गोरिदम इष्टतम स्प्लिट पॉइंट खोजने की कम्प्यूटेशनल लागत को कम करता है, और इसकी लीफ-वाइज़ वृद्धि रणनीति गहरे पेड़ों की ओर ले जा सकती है जो जटिल पैटर्न को पकड़ते हैं। फ्रेमवर्क वितरित प्रशिक्षण का समर्थन करता है, जिससे यह कई मशीनों में स्केल कर सकता है। यह स्केलेबिलिटी LightGBM को क्लिक-थ्रू दर भविष्यवाणी, रैंकिंग और अन्य कार्यों जैसे अनुप्रयोगों के लिए उपयुक्त बनाती है जहाँ डेटा की मात्रा बड़ी होती है।

उपयोग और पारिस्थितिकी तंत्र

LightGBM लोकप्रिय मशीन लर्निंग लाइब्रेरी और प्लेटफार्मों के साथ सहजता से एकीकृत होता है। इसका व्यापक रूप से scikit-learn के साथ उपयोग किया जाता है, और यह कई ग्रेडिएंट बूस्टिंग समाधानों का एक मुख्य घटक है। फ्रेमवर्क का Python इंटरफेस विशेष रूप से लोकप्रिय है, जो डेटा वैज्ञानिकों के लिए एक परिचित API प्रदान करता है। LightGBM श्रेणीबद्ध फीचर्स के लिए मूल समर्थन भी प्रदान करता है, जो प्रीप्रोसेसिंग को सरल बनाता है। C++, R और C# के साथ इसकी संगतता विभिन्न विकास वातावरणों तक इसकी पहुँच बढ़ाती है।

अन्य फ्रेमवर्क के साथ तुलना

LightGBM की तुलना अक्सर XGBoost और CatBoost से की जाती है, जो दो अन्य प्रमुख ग्रेडिएंट बूस्टिंग फ्रेमवर्क हैं। जबकि XGBoost लेवल-वाइज़ ट्री वृद्धि और सॉर्टेड-आधारित स्प्लिट खोज का उपयोग करता है, LightGBM की लीफ-वाइज़ वृद्धि और हिस्टोग्राम-आधारित दृष्टिकोण आम तौर पर तेज़ प्रशिक्षण समय और कम मेमोरी उपयोग में परिणाम देता है। हालाँकि, लीफ-वाइज़ वृद्धि ओवरफिटिंग का कारण बन सकती है यदि ठीक से रेगुलराइज़ न किया जाए। दूसरी ओर, CatBoost श्रेणीबद्ध फीचर्स को संभालने में उत्कृष्ट है और अक्सर डिफ़ॉल्ट मापदंडों के साथ उच्च सटीकता प्राप्त करता है। इन फ्रेमवर्क के बीच चुनाव विशिष्ट डेटासेट और आवश्यकताओं पर निर्भर करता है; LightGBM को अक्सर बड़े, स्पार्स डेटासेट पर इसकी गति और दक्षता के लिए पसंद किया जाता है।

अनुप्रयोग

LightGBM को कई डोमेन में लागू किया गया है, जिनमें खोज रैंकिंग, अनुशंसा प्रणाली, धोखाधड़ी का पता लगाना और चिकित्सा निदान शामिल हैं। उच्च-आयामी स्पार्स डेटा को संभालने की इसकी क्षमता इसे ऑनलाइन विज्ञापन में क्लिक-थ्रू दर भविष्यवाणी के लिए विशेष रूप से प्रभावी बनाती है। इसके अलावा, LightGBM का उपयोग Kaggle जैसे प्लेटफार्मों पर प्रतियोगिताओं में किया जाता है, जहाँ इसके प्रदर्शन और गति ने इसे चिकित्सकों के बीच पसंदीदा बना दिया है।

विकास और समुदाय

LightGBM को पहली बार 2017 में Microsoft Research की एक टीम द्वारा पेश किया गया था, जिसका नेतृत्व Guolin Ke और अन्य ने किया था। परियोजना GitHub पर सक्रिय रूप से बनाए रखी जाती है, जिसमें दुनिया भर के डेवलपर्स के समुदाय से योगदान होता है। फ्रेमवर्क का दस्तावेज़ीकरण व्यापक है, और इसकी ओपन-सोर्स प्रकृति निरंतर सुधार को प्रोत्साहित करती है। LightGBM को कई शैक्षणिक पत्रों में उद्धृत किया गया है और यह मशीन लर्निंग चिकित्सक के टूलकिट में एक मानक उपकरण है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·gradient-boosting·open-source·microsoft
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास