LightGBM, जिसका पूरा नाम Light Gradient-Boosting Machine है, मशीन लर्निंग के लिए एक मुफ्त और ओपन-सोर्स वितरित ग्रेडिएंट-बूस्टिंग फ्रेमवर्क है, जिसे मूल रूप से Microsoft द्वारा विकसित किया गया था। यह डिसीज़न ट्री एल्गोरिदम पर आधारित है और रैंकिंग, वर्गीकरण और अन्य मशीन लर्निंग कार्यों के लिए उपयोग किया जाता है। यह फ्रेमवर्क उच्च प्रदर्शन और स्केलेबिलिटी के लिए डिज़ाइन किया गया है, जो इसे शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों में एक लोकप्रिय विकल्प बनाता है।
LightGBM विभिन्न प्रकार के एल्गोरिदम का समर्थन करता है, जिनमें ग्रेडिएंट बूस्टिंग ट्री (GBT), ग्रेडिएंट बूस्टिंग डिसीज़न ट्री (GBDT), ग्रेडिएंट बूस्टिंग रिग्रेशन ट्री (GBRT), ग्रेडिएंट बूस्टिंग मशीन (GBM), मल्टीपल एडिटिव रिग्रेशन ट्री (MART), और रैंडम फॉरेस्ट (RF) शामिल हैं। यह XGBoost के कई फायदों को शामिल करता है, जैसे स्पार्स ऑप्टिमाइज़ेशन, समानांतर प्रशिक्षण, कई लॉस फ़ंक्शन, रेगुलराइज़ेशन, बैगिंग, और अर्ली स्टॉपिंग। हालाँकि, मुख्य अंतर ट्री निर्माण में है: LightGBM पेड़ों को लेवल-वाइज़ के बजाय लीफ-वाइज़ बढ़ाता है, और अधिकतम डेल्टा लॉस वाले लीफ का चयन करके विस्तार करता है। यह दृष्टिकोण तेज़ अभिसरण की ओर ले जा सकता है, लेकिन ओवरफिटिंग से बचने के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।
एक और विशिष्ट विशेषता इसका अत्यधिक अनुकूलित हिस्टोग्राम-आधारित डिसीज़न ट्री लर्निंग एल्गोरिदम का उपयोग है, जो XGBoost और अन्य कार्यान्वयनों द्वारा उपयोग किए जाने वाले सॉर्टेड-आधारित दृष्टिकोण के बजाय है। यह हिस्टोग्राम-आधारित विधि प्रशिक्षण दक्षता और मेमोरी खपत दोनों में महत्वपूर्ण रूप से सुधार करती है। इसके अतिरिक्त, LightGBM दो नई तकनीकों का परिचय देता है: ग्रेडिएंट-आधारित वन-साइड सैंपलिंग (GOSS) और एक्सक्लूसिव फीचर बंडलिंग (EFB), जो एक साथ उच्च सटीकता बनाए रखते हुए तेज़ प्रशिक्षण को सक्षम बनाती हैं।
LightGBM Linux, Windows और macOS पर चलता है, और C++, Python, R और C# के लिए इंटरफेस प्रदान करता है। स्रोत कोड MIT लाइसेंस के तहत लाइसेंस प्राप्त है और GitHub पर उपलब्ध है।
ग्रेडिएंट-आधारित वन-साइड सैंपलिंग
ग्रेडिएंट-आधारित वन-साइड सैंपलिंग (GOSS) एक तकनीक है जिसे विशेष रूप से ग्रेडिएंट-बूस्टेड डिसीज़न ट्री के लिए विकसित किया गया है। पारंपरिक ग्रेडिएंट डिसेंट में, मॉडल को एक घाटी के रूप में अवधारणाबद्ध किया जाता है, जहाँ सबसे निचला बिंदु डेटा के लिए सबसे अच्छा फिट दर्शाता है। एल्गोरिदम लॉस को कम करने वाली दिशाओं में आगे बढ़कर मॉडल मापदंडों को पुनरावृत्त रूप से समायोजित करता है, प्रभावी रूप से घाटी में उतरता है। आम तौर पर, यह प्रक्रिया ग्रेडिएंट की गणना करने के लिए पूरे डेटासेट का उपयोग करती है, यह मानते हुए कि प्रत्येक डेटा बिंदु सीखने के संकेत में समान रूप से योगदान देता है।
GOSS इस धारणा को चुनौती देता है यह पहचान कर कि छोटे ग्रेडिएंट वाले डेटा बिंदु (यानी, उथले ढलान) सीखने की प्रक्रिया के लिए कम जानकारीपूर्ण होते हैं। ये बिंदु अक्सर अच्छी तरह से भविष्यवाणी किए गए उदाहरणों या शोर के अनुरूप होते हैं। GOSS इन कम-ग्रेडिएंट नमूनों के एक हिस्से को बेतरतीब ढंग से हटा देता है, जबकि बड़े ग्रेडिएंट वाले सभी नमूनों को बनाए रखता है। यह चयनात्मक सैंपलिंग प्रभावी डेटासेट आकार को कम करती है, सटीकता से महत्वपूर्ण रूप से समझौता किए बिना प्रशिक्षण को गति देती है। सबसे जानकारीपूर्ण डेटा बिंदुओं पर ध्यान केंद्रित करके, GOSS मॉडल को डेटा में अंतर्निहित संबंधों को बेहतर ढंग से पकड़ने में मदद करता है, साथ ही शोर वाले नमूनों के प्रभाव को भी कम करता है।
एक्सक्लूसिव फीचर बंडलिंग
एक्सक्लूसिव फीचर बंडलिंग (EFB) डेटासेट में प्रभावी फीचर्स की संख्या को कम करने की एक लगभग-लॉसलेस विधि है। कई वास्तविक दुनिया के अनुप्रयोगों में, विशेष रूप से स्पार्स फीचर स्पेस वाले, कई फीचर लगभग एक्सक्लूसिव होते हैं, जिसका अर्थ है कि वे शायद ही कभी एक साथ गैर-शून्य मान लेते हैं। वन-हॉट एन्कोडेड फीचर एक आदर्श उदाहरण हैं: प्रत्येक श्रेणी को एक बाइनरी फीचर द्वारा दर्शाया जाता है, और किसी भी दिए गए नमूने के लिए, उन फीचर्स में से केवल एक सक्रिय होता है। EFB इन एक्सक्लूसिव फीचर्स को एक एकल समग्र फीचर में बंडल करता है, जिससे डेटा की आयामीता कम हो जाती है। यह कमी कम मेमोरी उपयोग और तेज़ प्रशिक्षण की ओर ले जाती है, जबकि उच्च स्तर की सटीकता बनाए रखती है क्योंकि बंडलिंग प्रक्रिया के माध्यम से मूल जानकारी संरक्षित रहती है। एक्सक्लूसिव फीचर्स का एक एकल फीचर में बंडल एक्सक्लूसिव फीचर बंडल कहलाता है।
प्रदर्शन और स्केलेबिलिटी
LightGBM लाखों इंस्टेंस और फीचर्स वाले बड़े पैमाने के डेटासेट को संभालने के लिए डिज़ाइन किया गया है। इसका हिस्टोग्राम-आधारित एल्गोरिदम इष्टतम स्प्लिट पॉइंट खोजने की कम्प्यूटेशनल लागत को कम करता है, और इसकी लीफ-वाइज़ वृद्धि रणनीति गहरे पेड़ों की ओर ले जा सकती है जो जटिल पैटर्न को पकड़ते हैं। फ्रेमवर्क वितरित प्रशिक्षण का समर्थन करता है, जिससे यह कई मशीनों में स्केल कर सकता है। यह स्केलेबिलिटी LightGBM को क्लिक-थ्रू दर भविष्यवाणी, रैंकिंग और अन्य कार्यों जैसे अनुप्रयोगों के लिए उपयुक्त बनाती है जहाँ डेटा की मात्रा बड़ी होती है।
उपयोग और पारिस्थितिकी तंत्र
LightGBM लोकप्रिय मशीन लर्निंग लाइब्रेरी और प्लेटफार्मों के साथ सहजता से एकीकृत होता है। इसका व्यापक रूप से scikit-learn के साथ उपयोग किया जाता है, और यह कई ग्रेडिएंट बूस्टिंग समाधानों का एक मुख्य घटक है। फ्रेमवर्क का Python इंटरफेस विशेष रूप से लोकप्रिय है, जो डेटा वैज्ञानिकों के लिए एक परिचित API प्रदान करता है। LightGBM श्रेणीबद्ध फीचर्स के लिए मूल समर्थन भी प्रदान करता है, जो प्रीप्रोसेसिंग को सरल बनाता है। C++, R और C# के साथ इसकी संगतता विभिन्न विकास वातावरणों तक इसकी पहुँच बढ़ाती है।
अन्य फ्रेमवर्क के साथ तुलना
LightGBM की तुलना अक्सर XGBoost और CatBoost से की जाती है, जो दो अन्य प्रमुख ग्रेडिएंट बूस्टिंग फ्रेमवर्क हैं। जबकि XGBoost लेवल-वाइज़ ट्री वृद्धि और सॉर्टेड-आधारित स्प्लिट खोज का उपयोग करता है, LightGBM की लीफ-वाइज़ वृद्धि और हिस्टोग्राम-आधारित दृष्टिकोण आम तौर पर तेज़ प्रशिक्षण समय और कम मेमोरी उपयोग में परिणाम देता है। हालाँकि, लीफ-वाइज़ वृद्धि ओवरफिटिंग का कारण बन सकती है यदि ठीक से रेगुलराइज़ न किया जाए। दूसरी ओर, CatBoost श्रेणीबद्ध फीचर्स को संभालने में उत्कृष्ट है और अक्सर डिफ़ॉल्ट मापदंडों के साथ उच्च सटीकता प्राप्त करता है। इन फ्रेमवर्क के बीच चुनाव विशिष्ट डेटासेट और आवश्यकताओं पर निर्भर करता है; LightGBM को अक्सर बड़े, स्पार्स डेटासेट पर इसकी गति और दक्षता के लिए पसंद किया जाता है।
अनुप्रयोग
LightGBM को कई डोमेन में लागू किया गया है, जिनमें खोज रैंकिंग, अनुशंसा प्रणाली, धोखाधड़ी का पता लगाना और चिकित्सा निदान शामिल हैं। उच्च-आयामी स्पार्स डेटा को संभालने की इसकी क्षमता इसे ऑनलाइन विज्ञापन में क्लिक-थ्रू दर भविष्यवाणी के लिए विशेष रूप से प्रभावी बनाती है। इसके अलावा, LightGBM का उपयोग Kaggle जैसे प्लेटफार्मों पर प्रतियोगिताओं में किया जाता है, जहाँ इसके प्रदर्शन और गति ने इसे चिकित्सकों के बीच पसंदीदा बना दिया है।
विकास और समुदाय
LightGBM को पहली बार 2017 में Microsoft Research की एक टीम द्वारा पेश किया गया था, जिसका नेतृत्व Guolin Ke और अन्य ने किया था। परियोजना GitHub पर सक्रिय रूप से बनाए रखी जाती है, जिसमें दुनिया भर के डेवलपर्स के समुदाय से योगदान होता है। फ्रेमवर्क का दस्तावेज़ीकरण व्यापक है, और इसकी ओपन-सोर्स प्रकृति निरंतर सुधार को प्रोत्साहित करती है। LightGBM को कई शैक्षणिक पत्रों में उद्धृत किया गया है और यह मशीन लर्निंग चिकित्सक के टूलकिट में एक मानक उपकरण है।
यह भी देखें
- मशीन लर्निंग
- कृत्रिम बुद्धिमत्ता
- डीप लर्निंग
- तंत्रिका नेटवर्क
- बड़ा भाषा मॉडल
- ट्रांसफॉर्मर
- OpenAI
- Anthropic
- Google DeepMind
- जनरेटिव एआई
- AMD
- Apple
- Samsung Electronics
- Intel
- TSMC
- Broadcom
- Qualcomm
- Arm Holdings
- Amazon Web Services
- AWS Trainium
- Azure
- Google Cloud
- Oracle Cloud
- CoreWeave
- Cerebras
- Groq
- SambaNova
- Graphcore
- Nokia Bell Labs
- Open Panel
- भाभा परमाणु अनुसंधान
- Samsung Research
- Xerox PARC
- MIT CSAIL
- Stanford AI Lab
- University of Toronto
- Carnegie Mellon University
- Berkeley AI Research
- Oxford University
- शतरंज कंप्यूटर
- Sony AI
- Fujitsu
- NEC
- D-Wave
- Alibaba Damiao Academy
- Alibaba Cloud
- Amazon AI
- Halcyon
- Insta Academy
- Omniscient
- Commure
- Intuitive Surgical
- TomTom
- BigBear.ai
- AI21 Labs
- Inflection AI
- Essential AI
- Sanctuary AI
- Figure AI
- Fermata
- Neuralink
- Braina
- Cortica
- Xyber
- Cruise
- Waymo
- Tesla Autopilot
- Llion Jones
- Jakob Uszkoreit
- Lukasz Kaiser
- Niki Parmar
- Barret Zoph
- Mark Chen
- Brad Lightcap
- Jacob Steinhardt
- David Kaplan
- Ryan Lowe
- Jack Clark
- Shan Carter
- David Luan
- Chen Wu
- Ashish Kumar
- Freddie Sulit
- Karen Simonyan
- Koray Kavukcuoglu
- Thomas Dietterich
- Michael Jordan
- Daphne Koller
- Anima Anandkumar
- Samy Bengio
- Joshua Tenenbaum
- Brendan Lake
- Melanie Mitchell
- Aaron Courville
- Alan Perlis
- Aleksander Madry
- Alexei Efros
- Ali Rahimi
- Andrew Lloyd Brown
- Ani Bhattacharya
- Anna Patterson
- Anna Ritter
- Anubhav Sinha
- Arakawa Ryota
- Arka Dutta
- Arthur Franz
- Ben Goertzel
- Bernard Widrow
- Brian Cheung
- Brian Christian
- Brian Lilly White
- Calvo Rafael
- Carlos Guestrin
- Catherine Flick
- Chad Mirkin
- Chin Yen Chiu
- Chris Bishop
- Christopher Bishop
- Craig Boutilier
- Craig Ku
- Dafna Sharon
- Daphne Leon
- David Ha
- David Froitzheim
- David Martin
- David Winger
- Deepak Kumar
- Drew Puckett
- Elaine Rich
- Eilon Reshef