अंग्रेज़ी से अनुवादित

निर्णय वृक्ष (Decision Trees) पर्यवेक्षित मशीन लर्निंग मॉडल हैं जो भविष्यवाणियाँ करने के लिए फीचर मानों के आधार पर डेटा को पुनरावर्ती रूप से विभाजित करते हैं, जिससे निर्णय नियमों की एक वृक्ष-समान संरचना बनती है।

निर्णय वृक्ष (Decision trees) पर्यवेक्षित शिक्षण एल्गोरिदम का एक परिवार है जिसका उपयोग वर्गीकरण और प्रतिगमन दोनों कार्यों के लिए किया जाता है। वे निर्णयों और उनके संभावित परिणामों को एक वृक्ष संरचना के रूप में मॉडल करते हैं, जहाँ आंतरिक नोड इनपुट विशेषताओं पर परीक्षण का प्रतिनिधित्व करते हैं, शाखाएँ उन परीक्षणों के परिणामों के अनुरूप होती हैं, और पत्ती नोड अंतिम भविष्यवाणी प्रदान करते हैं। उनकी व्याख्यात्मकता और सरलता ने उन्हें मशीन लर्निंग में एक आधारभूत उपकरण बना दिया है, जो रैंडम फॉरेस्ट और ग्रेडिएंट बूस्टिंग जैसे अधिक उन्नत एन्सेम्बल विधियों के लिए निर्माण खंड के रूप में कार्य करते हैं।

मूल विचार सांख्यिकी और मनोविज्ञान में प्रारंभिक कार्य से जुड़ा है, जिसमें 1960 और 1970 के दशक में महत्वपूर्ण विकास हुए। ID3 एल्गोरिदम, जिसे रॉस क्विनलान ने 1986 में प्रस्तुत किया, ने विभाजन के लिए सूचना लाभ (information gain) के उपयोग को लोकप्रिय बनाया। क्विनलान ने बाद में C4.5 विकसित किया, जो श्रेणीबद्ध और सतत दोनों विशेषताओं को संभालता था और प्रूनिंग की शुरुआत की। उसी समय के आसपास, CART (वर्गीकरण और प्रतिगमन वृक्ष) ढांचा, जिसे लियो ब्रेमैन और सहकर्मियों ने 1984 में विकसित किया, वर्गीकरण और प्रतिगमन दोनों को संभालने की क्षमता के कारण व्यापक रूप से अपनाया गया। ये आधारभूत विधियाँ प्रभावशाली बनी हुई हैं, और scikit-learn जैसे आधुनिक कार्यान्वयन CART के अनुकूलित संस्करणों का उपयोग करते हैं।

निर्णय वृक्ष कैसे काम करते हैं

एक निर्णय वृक्ष विशेषता स्थान को पुनरावर्ती रूप से विभाजित करके बनाया जाता है। प्रत्येक नोड पर, एल्गोरिदम उस विशेषता और थ्रेशोल्ड का चयन करता है जो जिनी अशुद्धता (Gini impurity) या सूचना लाभ जैसे मानदंड के अनुसार प्रशिक्षण डेटा को सबसे अच्छा अलग करता है। वर्गीकरण के लिए, जिनी अशुद्धता उस संभावना को मापती है कि एक यादृच्छिक रूप से चुना गया तत्व गलत वर्गीकृत होगा यदि उसे उस नोड पर वर्ग वितरण के अनुसार लेबल किया जाए। एन्ट्रॉपी से व्युत्पन्न सूचना लाभ, विभाजन के बाद अनिश्चितता में कमी की मात्रा निर्धारित करता है। प्रतिगमन के लिए, विचरण में कमी आमतौर पर उपयोग की जाती है।

वृक्ष तब तक बढ़ता है जब तक कि एक रोक मानदंड पूरा न हो, जैसे अधिकतम गहराई, प्रति पत्ती न्यूनतम नमूने, या शुद्धता में कोई और सुधार न हो। ओवरफिटिंग से बचने के लिए, प्रूनिंग तकनीकें उन शाखाओं को हटा देती हैं जिनमें कम भविष्यवाणी शक्ति होती है। यह प्रक्रिया एक ऐसा मॉडल बनाती है जिसे फ्लोचार्ट के रूप में देखा जा सकता है, जिससे गैर-विशेषज्ञों को समझाना आसान हो जाता है।

लाभ और सीमाएँ

निर्णय वृक्षों की मुख्य ताकतों में से एक उनकी व्याख्यात्मकता है। तंत्रिका नेटवर्क या गहन शिक्षण मॉडल के विपरीत, निर्णय वृक्ष के निर्णयों को जड़ से पत्ती तक ट्रेस किया जा सकता है, जो प्रत्येक भविष्यवाणी के लिए स्पष्ट स्पष्टीकरण प्रदान करता है। उन्हें बहुत कम डेटा प्रीप्रोसेसिंग की आवश्यकता होती है, और वे स्केलिंग या वन-हॉट एन्कोडिंग की आवश्यकता के बिना संख्यात्मक और श्रेणीबद्ध दोनों विशेषताओं को संभालते हैं। वे गैर-रेखीय संबंधों और विशेषताओं के बीच अंतःक्रियाओं को स्वाभाविक रूप से पकड़ते हैं।

हालाँकि, निर्णय वृक्ष उच्च विचरण से ग्रस्त हैं। प्रशिक्षण डेटा में एक छोटा सा परिवर्तन पूरी तरह से अलग वृक्ष का कारण बन सकता है, जिससे वे अस्थिर हो जाते हैं। वे ठीक से प्रतिबंधित या प्रून न किए जाने पर ओवरफिट भी करते हैं। इसके अतिरिक्त, वे कई स्तरों वाली विशेषताओं के प्रति पक्षपाती हो सकते हैं, और समायोजन के बिना अत्यधिक असंतुलित डेटासेट पर अच्छा प्रदर्शन नहीं कर सकते हैं। इन सीमाओं को अक्सर एन्सेम्बल विधियों द्वारा कम किया जाता है जो कई वृक्षों को जोड़ती हैं, जैसे रैंडम फॉरेस्ट और ग्रेडिएंट बूस्टिंग।

अनुप्रयोग और विविधताएँ

निर्णय वृक्ष कई डोमेन में उपयोग किए जाते हैं, जिनमें क्रेडिट स्कोरिंग के लिए वित्त, निदान समर्थन के लिए स्वास्थ्य सेवा, और ग्राहक विभाजन के लिए विपणन शामिल हैं। उनकी व्याख्यात्मकता विशेष रूप से विनियमित उद्योगों में मूल्यवान है जहाँ मॉडल निर्णयों को समझाया जाना चाहिए। डिसीजन स्टंप (एकल विभाजन वाले वृक्ष) जैसी विविधताएँ बूस्टिंग एल्गोरिदम में उपयोग की जाती हैं, जबकि तिरछे निर्णय वृक्ष अभिव्यक्ति में सुधार के लिए प्रत्येक नोड पर विशेषताओं के रैखिक संयोजनों का उपयोग करते हैं।

आधुनिक अभ्यास में, निर्णय वृक्ष शक्तिशाली एन्सेम्बल तकनीकों के लिए आधार शिक्षार्थी के रूप में कार्य करते हैं। रैंडम फॉरेस्ट, जिसे लियो ब्रेमैन ने 2001 में प्रस्तुत किया, बूटस्ट्रैप नमूनों पर कई वृक्ष बनाता है और उनकी भविष्यवाणियों का औसत निकालता है। ग्रेडिएंट बूस्टिंग मशीनें, जैसे XGBoost और LightGBM, क्रमिक रूप से ऐसे वृक्ष जोड़ती हैं जो पिछले वृक्षों की त्रुटियों को सुधारते हैं। इन विधियों ने कई मशीन लर्निंग प्रतियोगिताओं में प्रभुत्व स्थापित किया है और उद्योग में व्यापक रूप से तैनात हैं, अक्सर सारणीबद्ध डेटा पर अधिक जटिल गहन शिक्षण मॉडल से बेहतर प्रदर्शन करते हैं।

अन्य AI दृष्टिकोणों से संबंध

निर्णय वृक्ष मशीन लर्निंग के व्यापक क्षेत्र से संबंधित हैं, जिसमें शास्त्रीय एल्गोरिदम और आधुनिक गहन शिक्षण विधियाँ दोनों शामिल हैं। जबकि तंत्रिका नेटवर्क को बड़ी मात्रा में डेटा और कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, निर्णय वृक्ष छोटे डेटासेट से सीख सकते हैं और पारदर्शी मॉडल प्रदान करते हैं। वे अक्सर कई परियोजनाओं में आधार रेखा मॉडल के रूप में उपयोग किए जाते हैं, और उनका प्रदर्शन अधिक परिष्कृत दृष्टिकोणों की तुलना में आश्चर्यजनक रूप से मजबूत हो सकता है।

कृत्रिम बुद्धिमत्ता के संदर्भ में, निर्णय वृक्षों को प्रतीकात्मक शिक्षण का एक रूप माना जाता है, क्योंकि वे स्पष्ट नियम उत्पन्न करते हैं। यह तंत्रिका नेटवर्क के उप-प्रतीकात्मक प्रतिनिधित्व के विपरीत है। शोधकर्ताओं ने निर्णय वृक्षों को तंत्रिका नेटवर्क के साथ संयोजित करने की भी खोज की है, जैसे सॉफ्ट डिसीजन वृक्ष जो विभेदनशील विभाजन फ़ंक्शन का उपयोग करते हैं, जिससे उन्हें ग्रेडिएंट डिसेंट के साथ प्रशिक्षित किया जा सकता है। इन हाइब्रिड मॉडलों का उद्देश्य गहन शिक्षण की शक्ति का लाभ उठाते हुए व्याख्यात्मकता बनाए रखना है।

निष्कर्ष

निर्णय वृक्ष अपनी सरलता, व्याख्यात्मकता और प्रभावशीलता के कारण मशीन लर्निंग का एक आधारशिला बने हुए हैं। वे न केवल स्वतंत्र मॉडल के रूप में उपयोगी हैं, बल्कि अधिक शक्तिशाली एन्सेम्बल के घटकों के रूप में भी उपयोगी हैं। जैसे-जैसे क्षेत्र विकसित होता है, निर्णय वृक्षों को नई तकनीकों के साथ अनुकूलित और एकीकृत किया जा रहा है, जिससे अनुसंधान और व्यावहारिक अनुप्रयोगों दोनों में उनकी प्रासंगिकता सुनिश्चित होती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·supervised-learning·classification·regression
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास