अंग्रेज़ी से अनुवादित

CN2 एल्गोरिथ्म वर्गीकरण के लिए एक नियम प्रेरण विधि है, जो डेटा से if-then नियमों का एक क्रमबद्ध या अक्रमबद्ध सेट उत्पन्न करती है। यह AQ के separate-and-conquer दृष्टिकोण को एन्ट्रॉपी-आधारित खोज के साथ जोड़ती है, और इसे 1987 में पीटर क्लार्क और टिम निब्लेट द्वारा प्रस्तुत किया गया था।

CN2 एल्गोरिथ्म एक नियम प्रेरण विधि है जिसका उपयोग मशीन लर्निंग में वर्गीकरण कार्यों के लिए किया जाता है। यह डेटासेट से if-then नियमों का एक सेट उत्पन्न करता है, जहाँ प्रत्येक नियम में विशेषता मानों पर शर्तों का एक संयोजन और एक अनुमानित वर्ग शामिल होता है। CN2 को 1987 में पीटर क्लार्क और टिम निब्लेट द्वारा ट्यूरिंग इंस्टीट्यूट में पेश किया गया था, जो मशीन-लर्निंग और कृत्रिम-बुद्धिमत्ता में पहले के काम पर आधारित था। यह एल्गोरिथ्म AQ परिवार की अलग-और-विजय खोज रणनीति को निर्णय वृक्ष प्रेरण में उपयोग किए जाने वाले सूचना-सैद्धांतिक मूल्यांकन मानदंडों, जैसे एन्ट्रॉपी, के साथ संयोजित करने के लिए उल्लेखनीय है। यह प्रतीकात्मक नियम सीखने में एक मौलिक दृष्टिकोण बना हुआ है, जो व्याख्यात्मक मॉडल प्रदान करता है जो तंत्रिका-नेटवर्क और गहन-शिक्षण विधियों की अपारदर्शी प्रकृति के विपरीत है।

एल्गोरिथ्म प्रशिक्षण उदाहरणों के एक उपसमुच्चय को कवर करने वाले सर्वोत्तम नियम की खोज करके, उन उदाहरणों को हटाकर, और शेष डेटा पर प्रक्रिया को दोहराकर पुनरावृत्त रूप से कार्य करता है। यह अलग-और-विजय रणनीति, जिसे कवरिंग के रूप में भी जाना जाता है, CN2 को निर्णय वृक्ष एल्गोरिदम से अलग करती है जो विभाजन-और-विजय दृष्टिकोण का उपयोग करते हैं। CN2 या तो एक क्रमबद्ध नियम सूची (निर्णय सूची) या नियमों का एक अक्रमबद्ध सेट उत्पन्न कर सकता है, जो संस्करण पर निर्भर करता है। मूल संस्करण एक क्रमबद्ध सूची उत्पन्न करता है, जहाँ नियम क्रम में लागू होते हैं और पहला मिलान नियम भविष्यवाणी निर्धारित करता है। बाद के विस्तार, जैसे CN2-SD (उपसमूह खोज), ने एल्गोरिथ्म को पूर्ण वर्गीकरणकर्ताओं के बजाय दिलचस्प उपसमूहों की खोज के लिए अनुकूलित किया।

खोज और मूल्यांकन

CN2 नियम शर्तों के स्थान के माध्यम से एक बीम खोज करता है। एक खाली नियम से शुरू करके, यह बार-बार ऐसी शर्तें जोड़ता है जो नियम की गुणवत्ता में सुधार करती हैं, प्रत्येक चरण में विचार किए जाने वाले उम्मीदवार नियमों की संख्या को सीमित करने के लिए बीम चौड़ाई पैरामीटर का उपयोग करता है। खोज एक मूल्यांकन फ़ंक्शन द्वारा निर्देशित होती है जो नियम की गुणवत्ता को मापता है। मूल CN2 ने एन्ट्रॉपी पर आधारित एक सूचना-सैद्धांतिक माप का उपयोग किया, जो ID3 में लाभ मानदंड के समान था। विशेष रूप से, एल्गोरिथ्म कवर किए गए उदाहरणों के बीच वर्ग वितरण की एन्ट्रॉपी का उपयोग करके नियमों का मूल्यांकन करता है, उन नियमों को प्राथमिकता देता है जो एन्ट्रॉपी को कम करते हैं। बाद के संस्करणों ने ओवरफिटिंग से बचने के लिए लाप्लास सटीकता अनुमान पेश किया, विशेष रूप से छोटे नमूनों से निपटने के दौरान। लाप्लास सुधार प्रत्येक वर्ग में एक छद्म-गणना जोड़ता है, जो नियम सटीकता का अधिक मजबूत अनुमान प्रदान करता है।

बीम खोज स्वभाव से लालची है, क्योंकि यह पीछे नहीं हटती है, लेकिन बीम चौड़ाई एक साथ कई आशाजनक पथों की खोज की अनुमति देती है। लालच और खोज के बीच यह व्यापार-बंद CN2 की एक प्रमुख विशेषता है। खोज स्थान डेटा में मौजूद विशेषता-मान जोड़े द्वारा परिभाषित किया गया है, और शर्तें आमतौर पर नाममात्र विशेषताओं के लिए attribute = value और संख्यात्मक विशेषताओं के लिए attribute <= value और attribute >= value के रूप में होती हैं, हालाँकि मूल एल्गोरिथ्म नाममात्र डेटा पर केंद्रित था।

एल्गोरिथ्म संस्करण

वर्षों में CN2 के कई संस्करण विकसित किए गए हैं। सबसे महत्वपूर्ण CN2-SD है, जिसे 1990 के दशक के अंत में नाडा लावराक और सहयोगियों द्वारा पेश किया गया था, जो लक्ष्य को वर्गीकरण से उपसमूह खोज में स्थानांतरित करता है। उपसमूह खोज में, लक्ष्य उन नियमों को खोजना है जो असामान्य वर्ग वितरण वाले दिलचस्प जनसंख्या उपसमूहों का वर्णन करते हैं, न कि पूर्ण वर्गीकरणकर्ता बनाना। CN2-SD नियमों का मूल्यांकन करने के लिए एक भारित सापेक्ष सटीकता माप का उपयोग करता है, जो नियम सामान्यता और वितरणात्मक असामान्यता को संतुलित करता है। एक अन्य संस्करण, CN2-R, नियमों के सांख्यिकीय महत्व का आकलन करने के लिए यादृच्छिकरण परीक्षणों को शामिल करता है, उन नियमों को फ़िल्टर करता है जो संयोग से उत्पन्न हो सकते थे। यह अधिक विश्वसनीय और सामान्यीकरण योग्य नियम सेट उत्पन्न करने में मदद करता है।

CN2 का अक्रमबद्ध संस्करण नियमों का एक सेट उत्पन्न करता है जहाँ प्रत्येक नियम स्वतंत्र रूप से सीखा जाता है, और भविष्यवाणी के लिए, सभी नियम लागू होते हैं और उनकी भविष्यवाणियाँ संयुक्त होती हैं, अक्सर मतदान द्वारा या उच्चतम विशिष्टता वाले नियम का चयन करके। यह दृष्टिकोण अतिव्यापी वर्ग क्षेत्रों वाले डेटासेट के लिए अधिक मजबूत हो सकता है। क्रमबद्ध और अक्रमबद्ध नियमों के बीच का चुनाव अनुप्रयोग पर निर्भर करता है; क्रमबद्ध सूचियाँ सरल और तेज़ होती हैं, जबकि अक्रमबद्ध सेट दुर्लभ वर्गों के लिए बेहतर कवरेज प्रदान कर सकते हैं।

अनुप्रयोग और प्रभाव

CN2 को विभिन्न क्षेत्रों में लागू किया गया है, जिसमें चिकित्सा निदान, दोष का पता लगाना, और पारिस्थितिक मॉडलिंग शामिल हैं। इसकी व्याख्यात्मकता इसे उन क्षेत्रों में विशेष रूप से मूल्यवान बनाती है जहाँ निर्णय प्रक्रिया को समझना महत्वपूर्ण है, जैसे स्वास्थ्य देखभाल और नियामक अनुपालन में। उदाहरण के लिए, चिकित्सा अनुप्रयोगों में, CN2 नियमों को सरल शर्तों के रूप में व्यक्त किया जा सकता है जैसे if blood_pressure > 140 and age > 60 then high_risk, जिसे चिकित्सक आसानी से सत्यापित कर सकते हैं। एल्गोरिथ्म का उपयोग मशीन-लर्निंग में प्रतीकात्मक और उप-प्रतीकात्मक दृष्टिकोणों की तुलना के लिए एक बेंचमार्क के रूप में भी किया गया है। जबकि आधुनिक विधियाँ जैसे गहन-शिक्षण अक्सर जटिल कार्यों पर उच्च सटीकता प्राप्त करती हैं, CN2 उन समस्याओं के लिए प्रासंगिक बना हुआ है जिनमें पारदर्शी मॉडल की आवश्यकता होती है या जब डेटा सीमित होता है।

एल्गोरिथ्म का प्रभाव बाद के नियम सीखने की प्रणालियों, जैसे RIPPER और PART, तक फैला हुआ है, जिन्होंने समान खोज और मूल्यांकन रणनीतियों को अपनाया। CN2 का एन्ट्रॉपी-आधारित मूल्यांकन निर्णय वृक्ष प्रेरण और फीचर चयन में उपयोग किए जाने वाले अधिक परिष्कृत सूचना-सैद्धांतिक मापों का अग्रदूत था। इसकी अलग-और-विजय रूपरेखा का सैद्धांतिक रूप से विश्लेषण किया गया है, जिसमें PAC-सीखने की रूपरेखा और नियम सीखने की जटिलता से संबंध हैं।

सीमाएँ और विस्तार

CN2 की ज्ञात सीमाएँ हैं। यह शोर डेटा के प्रति संवेदनशील है, क्योंकि लालची खोज झूठे पैटर्न पर ओवरफिट कर सकती है। बीम खोज, हालाँकि शुद्ध हिल-क्लाइम्बिंग से अधिक गहन है, फिर भी सीमित लुकहेड के कारण इष्टतम नियमों को याद कर सकती है। एल्गोरिथ्म मानता है कि विशेषताएँ स्वतंत्र हैं, जो वास्तविक दुनिया के डेटा में सत्य नहीं हो सकता है। विस्तार ने इनमें से कुछ मुद्दों को संबोधित किया है। उदाहरण के लिए, असततकरण के माध्यम से निरंतर विशेषताओं को शामिल करना, या तो प्रीप्रोसेसिंग चरण के रूप में या खोज के भीतर, CN2 को संख्यात्मक डेटा संभालने की अनुमति देता है। CN2-R में सांख्यिकीय परीक्षणों का उपयोग ओवरफिटिंग को कम करता है। हाल के काम ने CN2 को एन्सेम्बल विधियों के साथ एकीकृत किया है, जहाँ मजबूती में सुधार के लिए कई नियम सेट संयुक्त होते हैं।

आधुनिक मशीन-लर्निंग के संदर्भ में, CN2 को अक्सर तंत्रिका-नेटवर्क दृष्टिकोणों के विपरीत देखा जाता है। जबकि तंत्रिका नेटवर्क स्वचालित रूप से जटिल फीचर इंटरैक्शन सीख सकते हैं, उन्हें बड़ी मात्रा में डेटा की आवश्यकता होती है और उनकी व्याख्या करना कठिन होता है। दूसरी ओर, CN2 कॉम्पैक्ट, मानव-पठनीय नियम उत्पन्न करता है, लेकिन उच्च-आयामी या अत्यधिक गैर-रैखिक समस्याओं से जूझ सकता है। यह व्यापार-बंद संकर प्रणालियों में अनुसंधान को जारी रखता है जो प्रतीकात्मक नियमों को उप-प्रतीकात्मक सीखने के साथ जोड़ते हैं, जो न्यूरो-प्रतीकात्मक AI के व्यापक क्षेत्र में रुचि का विषय है।

कार्यान्वयन और सॉफ्टवेयर

CN2 कई मशीन लर्निंग लाइब्रेरीज़ में लागू किया गया है। लुब्लियाना विश्वविद्यालय में विकसित ऑरेंज डेटा माइनिंग सुइट में एक CN2 लर्नर शामिल है, जैसा कि वेका टूलकिट में है। ये कार्यान्वयन वास्तविक डेटासेट पर एल्गोरिथ्म लागू करने के लिए उपयोगकर्ता-अनुकूल इंटरफेस प्रदान करते हैं। एल्गोरिथ्म की सरलता इसे विभिन्न प्रोग्रामिंग भाषाओं में लागू करना आसान बनाती है, और इसे अक्सर मशीन-लर्निंग और डेटा माइनिंग पाठ्यक्रमों में शिक्षण उदाहरण के रूप में उपयोग किया जाता है। ओपन-सोर्स कार्यान्वयन की उपलब्धता ने अनुसंधान और शिक्षा में इसके निरंतर उपयोग में योगदान दिया है।

1980 के दशक के अंत में पेश किए जाने के बावजूद, CN2 मशीन लर्निंग चिकित्सकों के टूलबॉक्स में एक प्रासंगिक एल्गोरिथ्म बना हुआ है। व्याख्यात्मकता पर इसका ध्यान और इसकी कुशल खोज रणनीति AI के इतिहास में इसकी जगह सुनिश्चित करती है, साथ ही उन प्रतीकात्मक विधियों के साथ जो गहन-शिक्षण के वर्तमान प्रभुत्व से पहले की हैं। 2020 के दशक तक, CN2 अभी भी नियम सीखने और व्याख्यात्मक AI पर अनुसंधान में उद्धृत किया जाता है, और यह नई नियम प्रेरण विधियों का मूल्यांकन करने के लिए एक आधार रेखा के रूप में कार्य करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:rule-induction·machine-learning·classification-algorithms·symbolic-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास