डिसीज़न ट्री लर्निंग Machine learning में एक पर्यवेक्षित शिक्षण विधि है, जिसका उपयोग वर्गीकरण और प्रतिगमन दोनों कार्यों के लिए किया जाता है। मॉडल एक वृक्ष संरचना है जहाँ आंतरिक नोड इनपुट विशेषताओं पर परीक्षणों का प्रतिनिधित्व करते हैं, शाखाएँ उन परीक्षणों के परिणामों का प्रतिनिधित्व करती हैं, और पत्ती नोड अंतिम अनुमानित मान या वर्ग लेबल का प्रतिनिधित्व करते हैं। लक्ष्य फीचर स्पेस को ऐसे क्षेत्रों में विभाजित करना है जो लक्ष्य चर के संबंध में यथासंभव सजातीय हों, जिससे व्याख्या करने में आसान if-then-else नियमों की एक श्रृंखला बन सके।
डिसीज़न ट्री बनाने की प्रक्रिया में चुने गए विभाजन मानदंड के अनुसार प्रशिक्षण डेटा को सबसे अच्छी तरह अलग करने वाली विशेषता का पुनरावर्ती चयन शामिल है। सामान्य मानदंडों में सूचना लाभ शामिल है, जो सूचना सिद्धांत से एन्ट्रॉपी पर आधारित है, और जिनी अशुद्धता, जो मापती है कि यदि किसी यादृच्छिक रूप से चुने गए तत्व को उपसमुच्चय में लेबल के वितरण के अनुसार यादृच्छिक रूप से लेबल किया जाए तो उसे कितनी बार गलत तरीके से लेबल किया जाएगा। वृक्ष को ऊपर से नीचे की ओर बढ़ाया जाता है, जो सभी प्रशिक्षण उदाहरणों वाले रूट नोड से शुरू होता है, और तब तक जारी रहता है जब तक कि एक रोक शर्त पूरी न हो जाए, जैसे कि अधिकतम गहराई तक पहुँचना, प्रति पत्ती न्यूनतम संख्या में नमूने होना, या जब कोई और विभाजन मानदंड में सुधार न करे।
ऐतिहासिक विकास
डिसीज़न ट्री की अवधारणा 1960 के दशक की है, जब 1963 में मॉर्गन और सोनक्विस्ट द्वारा ऑटोमैटिक इंटरेक्शन डिटेक्शन (AID) प्रणाली का विकास हुआ। इस प्रारंभिक कार्य के बाद 1970 के दशक में THAID एल्गोरिथ्म आया, जिसने एक अलग विभाजन मानदंड का उपयोग किया। 1980 के दशक में 1986 में रॉस क्विनलान द्वारा ID3 एल्गोरिथ्म की शुरुआत के साथ इस क्षेत्र को महत्वपूर्ण गति मिली, जिसने विभाजन मानदंड के रूप में सूचना लाभ का उपयोग किया। क्विनलान ने बाद में 1993 में C4.5 विकसित किया, जिसने निरंतर विशेषताओं, लापता मानों और प्रूनिंग को संभालकर ID3 में सुधार किया। लगभग उसी समय, 1984 में लियो ब्रेमैन, जेरोम फ्रीडमैन, रिचर्ड ओलशेन और चार्ल्स स्टोन द्वारा क्लासिफिकेशन एंड रिग्रेशन ट्रीज़ (CART) एल्गोरिथ्म पेश किया गया। CART ने वर्गीकरण के लिए जिनी अशुद्धता और प्रतिगमन के लिए माध्य वर्ग त्रुटि का उपयोग किया, और यह सबसे व्यापक रूप से उपयोग किए जाने वाले डिसीज़न ट्री एल्गोरिदम में से एक बन गया।
प्रमुख एल्गोरिदम और विविधताएँ
पिछले कुछ वर्षों में कई डिसीज़न ट्री एल्गोरिदम विकसित किए गए हैं, जिनमें से प्रत्येक की अपनी विशेषताएँ हैं। ID3 और इसके उत्तराधिकारी C4.5 मुख्य रूप से वर्गीकरण के लिए उपयोग किए जाते हैं और श्रेणीबद्ध और निरंतर दोनों विशेषताओं (C4.5) को संभाल सकते हैं। CART एक बहुमुखी एल्गोरिथ्म है जो वर्गीकरण और प्रतिगमन दोनों वृक्षों का समर्थन करता है, और यह बाइनरी वृक्ष उत्पन्न करता है जहाँ प्रत्येक आंतरिक नोड में ठीक दो शाखाएँ होती हैं। CHAID (ची-स्क्वेर्ड ऑटोमैटिक इंटरेक्शन डिटेक्शन) एल्गोरिथ्म, जो 1980 में पेश किया गया था, सर्वोत्तम विभाजन निर्धारित करने के लिए ची-स्क्वेयर परीक्षणों का उपयोग करता है और बहु-मार्ग विभाजन उत्पन्न कर सकता है। हाल के एल्गोरिदम में प्रतिगमन के लिए M5 एल्गोरिथ्म और रैंडम फॉरेस्ट एन्सेम्बल विधि शामिल हैं, जो डेटा के यादृच्छिक उपसमुच्चय पर कई डिसीज़न ट्री बनाती है और ओवरफिटिंग को कम करने के लिए उनकी भविष्यवाणियों का औसत निकालती है।
लाभ और सीमाएँ
डिसीज़न ट्री अपनी व्याख्यात्मकता के कारण लोकप्रिय हैं, क्योंकि सीखे गए मॉडल को एक फ्लोचार्ट के रूप में देखा जा सकता है जिसे मनुष्य आसानी से समझ सकते हैं। उन्हें सामान्यीकरण या स्केलिंग जैसे बहुत कम डेटा प्रीप्रोसेसिंग की आवश्यकता होती है, और वे संख्यात्मक और श्रेणीबद्ध दोनों डेटा को संभाल सकते हैं। हालाँकि, डिसीज़न ट्री ओवरफिटिंग के लिए प्रवण होते हैं, खासकर जब पूरी गहराई तक बढ़ाए जाते हैं, क्योंकि वे प्रशिक्षण डेटा में शोर को पकड़ सकते हैं। वे प्रशिक्षण डेटा में छोटे बदलावों के प्रति भी संवेदनशील होते हैं, जिसका अर्थ है कि थोड़ा सा परिवर्तन पूरी तरह से अलग वृक्ष का परिणाम दे सकता है। इसके अतिरिक्त, डिसीज़न ट्री कई स्तरों वाली विशेषताओं के प्रति पक्षपाती हो सकते हैं, क्योंकि ये विशेषताएँ अधिक विभाजन उत्पन्न करती हैं और अधिक जानकारीपूर्ण दिखाई देती हैं। इन मुद्दों को कम करने के लिए, प्रूनिंग, न्यूनतम पत्ती आकार निर्धारित करना, और रैंडम फॉरेस्ट और ग्रेडिएंट बूस्टिंग जैसी एन्सेम्बल विधियाँ आमतौर पर नियोजित की जाती हैं।
अनुप्रयोग और आधुनिक संदर्भ
डिसीज़न ट्री लर्निंग को कई डोमेन में लागू किया गया है, जिसमें चिकित्सा निदान, क्रेडिट जोखिम मूल्यांकन, ग्राहक मंथन भविष्यवाणी और छवि पहचान शामिल हैं। आधुनिक Artificial intelligence के संदर्भ में, डिसीज़न ट्री अक्सर एन्सेम्बल विधियों में आधार शिक्षार्थी के रूप में उपयोग किए जाते हैं, जैसे कि ग्रेडिएंट बूस्टिंग मशीन (GBMs) और XGBoost, जिन्होंने कई संरचित डेटा प्रतियोगिताओं में अत्याधुनिक परिणाम प्राप्त किए हैं। जबकि Deep learning मॉडल जैसे Neural network छवि और भाषण पहचान जैसे असंरचित डेटा कार्यों में हावी हैं, डिसीज़न ट्री अपनी दक्षता और व्याख्यात्मकता के कारण सारणीबद्ध डेटा के लिए एक मजबूत विकल्प बने हुए हैं। उनका उपयोग अन्य तकनीकों के साथ संयोजन में भी किया जाता है, जैसे कि Residual Network (ResNet) आर्किटेक्चर में, हालाँकि यह मुख्य रूप से एक डीप लर्निंग अवधारणा है। डिसीज़न ट्री की सरलता और मजबूती शैक्षणिक अनुसंधान और उद्योग अनुप्रयोगों दोनों में उनकी निरंतर प्रासंगिकता सुनिश्चित करती है।
सॉफ्टवेयर और कार्यान्वयन
कई सॉफ्टवेयर लाइब्रेरी डिसीज़न ट्री एल्गोरिदम के कार्यान्वयन प्रदान करती हैं। पायथन में scikit-learn लाइब्रेरी DecisionTreeClassifier और DecisionTreeRegressor क्लास प्रदान करती है, जो CART के अनुकूलित संस्करण पर आधारित हैं। R में पुनरावर्ती विभाजन के लिए rpart पैकेज और सशर्त अनुमान वृक्षों के लिए party पैकेज है। Weka, जो डेटा माइनिंग कार्यों के लिए मशीन लर्निंग एल्गोरिदम का एक संग्रह है, में J48 (C4.5 का एक जावा कार्यान्वयन) और REPTree के कार्यान्वयन शामिल हैं। ये उपकरण चिकित्सकों को आसानी से डिसीज़न ट्री मॉडल बनाने, देखने और मूल्यांकन करने की अनुमति देते हैं, जिससे यह तकनीक व्यापक दर्शकों के लिए सुलभ हो जाती है।