abess (Adaptive Best Subset Selection, जिसे ABESS भी कहा जाता है) एक मशीन-लर्निंग विधि है जिसे सांख्यिकीय मॉडलिंग में सर्वोत्तम उपसमुच्चय चयन की समस्या को हल करने के लिए डिज़ाइन किया गया है। एक डेटासेट और एक भविष्यवाणी कार्य को देखते हुए, यह निर्धारित करता है कि इष्टतम मॉडल प्रदर्शन के लिए कौन सी विशेषताएं या चर महत्वपूर्ण हैं। यह विधि 2020 में झू द्वारा प्रस्तुत की गई थी और यह अनुकूली रूप से उपयुक्त मॉडल आकार का चयन करती है, जिससे नियमितीकरण मापदंडों के चयन की आवश्यकता समाप्त हो जाती है। abess विभिन्न सांख्यिकीय और मशीन-लर्निंग कार्यों में लागू है, जिसमें रैखिक प्रतिगमन, एकल-सूचकांक मॉडल, और अन्य सामान्य भविष्यवाणी मॉडल शामिल हैं, और इसे जैव-सांख्यिकी में भी लागू किया जा सकता है।
abess का मुख्य नवाचार बहुपद समय जटिलता के साथ L0 मानक बाधा के तहत सर्वोत्तम उपसमुच्चय चयन करने की क्षमता में निहित है, जबकि यह निष्पक्ष और संगत अनुमान प्रदान करता है। पारंपरिक नियमितीकरण विधियों के विपरीत, जिन्हें दंड मापदंडों के समायोजन की आवश्यकता होती है, abess एक पुनरावृत्त विनिमय एल्गोरिदम के माध्यम से समर्थन सेट के आकार को अनुकूली रूप से निर्धारित करता है, जिससे यह उच्च-आयामी डेटा विश्लेषण के लिए विशेष रूप से आकर्षक बन जाता है।
मूल रूप
abess का मूल रूप सामान्य रैखिक प्रतिगमन में इष्टतम उपसमुच्चय चयन की समस्या को संबोधित करता है। यह एक L0 विधि है जो बहुपद समय जटिलता और निष्पक्ष तथा संगत दोनों अनुमान प्रदान करने के गुण द्वारा विशेषता है। रैखिक प्रतिगमन के संदर्भ में, मान लें कि हमारे पास n स्वतंत्र नमूनों (x_i, y_i), i = 1, ..., n का ज्ञान है, जहां x_i एक p-आयामी सदिश है और y_i एक अदिश प्रतिक्रिया है। X को n बटा p डिज़ाइन मैट्रिक्स के रूप में और y को n-आयामी प्रतिक्रिया सदिश के रूप में परिभाषित करें। सामान्य रैखिक प्रतिगमन मॉडल y = Xβ + ε के रूप में व्यक्त किया जाता है, जहां β गुणांक सदिश है और ε त्रुटि पद है।
उपयुक्त पैरामीटर β प्राप्त करने के लिए, रैखिक प्रतिगमन के लिए हानि फलन पर विचार करें: L_n^LR(β; X, y) = (1/(2n)) ||y - Xβ||_2^2। abess में, प्रारंभिक ध्यान L0 बाधा के तहत इस हानि फलन को अनुकूलित करने पर है, समस्या को हल करते हुए: L_n^LR(β; X, y) को न्यूनतम करें, बशर्ते ||β||_0 ≤ s, जहां s समर्थन सेट के वांछित आकार का प्रतिनिधित्व करता है, और ||β||_0 = संकेतकों का योग (β_i ≠ 0) सदिश का L0 मानक है।
एल्गोरिदम और बलिदान अवधारणा
अनुकूलन समस्या को हल करने के लिए, abess सक्रिय सेट और निष्क्रिय सेट के बीच समान संख्या में चरों का पुनरावृत्त रूप से आदान-प्रदान करता है। प्रत्येक पुनरावृत्ति में, बलिदान की अवधारणा प्रस्तुत की जाती है। सक्रिय सेट में प्रत्येक चर j के लिए, बलिदान ξ_j को सक्रिय सेट से चर j को हटाने पर हानि फलन में वृद्धि के रूप में परिभाषित किया गया है: ξ_j = L_n^LR(β_hat_{A \ {j}}) - L_n^LR(β_hat_A), जहां A वर्तमान सक्रिय सेट है और β_hat_A, A तक सीमित अनुमानित गुणांक सदिश है।
एल्गोरिदम सक्रिय सेट में सभी चरों के लिए बलिदानों की गणना करके आगे बढ़ता है, फिर सबसे छोटे बलिदान वाले चरों की पहचान करता है (जिन्हें न्यूनतम हानि वृद्धि के साथ हटाया जा सकता है)। साथ ही, यह निष्क्रिय सेट से उम्मीदवार चरों का मूल्यांकन करता है जिन्हें जोड़ा जा सकता है। विनिमय चरण सबसे कम महत्वपूर्ण सक्रिय चरों को सबसे आशाजनक निष्क्रिय उम्मीदवारों के साथ बदल देता है, समर्थन आकार s को बनाए रखते हुए। यह प्रक्रिया अभिसरण तक जारी रहती है, जिसे आमतौर पर हानि फलन में परिवर्तन या सक्रिय सेट की स्थिरता द्वारा मापा जाता है।
अनुकूली मॉडल आकार चयन
abess की एक विशिष्ट विशेषता मॉडल आकार s का अनुकूली चयन है, जो चरों की संख्या चुनने के लिए क्रॉस-सत्यापन या सूचना मानदंड की आवश्यकता को समाप्त करता है। विधि एक छोटे समर्थन आकार के साथ शुरू होती है और हानि फलन में सुधार की निगरानी करते हुए धीरे-धीरे इसे बढ़ाती है। यह अच्छाई-की-फिट और मॉडल जटिलता के बीच व्यापार-बंद पर आधारित एक मानदंड का उपयोग करता है, जिसमें अक्सर एक संशोधित बायेसियन सूचना मानदंड (BIC) या एक समान दंड शामिल होता है जो डेटा के अनुकूल होता है।
यह अनुकूली दृष्टिकोण कम्प्यूटेशनल रूप से कुशल है क्योंकि यह s के मानों की एक श्रृंखला के लिए मॉडल फिट करने से बचता है। इसके बजाय, abess s बढ़ने पर समाधानों के पथ का लाभ उठाता है, पिछले पुनरावृत्तियों से गणनाओं का पुन: उपयोग करता है। अंतिम मॉडल आकार तब चुना जाता है जब फिट में सीमांत सुधार एक सीमा से नीचे गिर जाता है, या जब सूचना मानदंड न्यूनतम तक पहुंच जाता है।
सैद्धांतिक गुण
abess कई सैद्धांतिक गारंटी प्रदान करता है जो इसे अन्य चर चयन विधियों से अलग करती हैं। मानक नियमितता स्थितियों के तहत, विधि अनुमान संगति और चर चयन संगति प्राप्त करती है, जिसका अर्थ है कि अनुमानित गुणांक वास्तविक मानों में परिवर्तित होते हैं और चयनित समर्थन सेट नमूना आकार बढ़ने पर संभावना के साथ एक की ओर बढ़ते हुए वास्तविक सक्रिय सेट से मेल खाता है। बहुपद समय जटिलता व्यापक सर्वोत्तम उपसमुच्चय चयन पर एक महत्वपूर्ण लाभ है, जो सामान्य रूप से NP-कठिन है।
निष्पक्षता गुण इस तथ्य से उत्पन्न होता है कि L0 दंड चयनित चरों के गुणांकों को सिकोड़ता नहीं है, लैस्सो जैसी L1-आधारित विधियों के विपरीत, जो संकुचन के माध्यम से पूर्वाग्रह पेश करती हैं। यह abess को विशेष रूप से आकर्षक बनाता है जब व्याख्या या डाउनस्ट्रीम अनुमान के लिए निष्पक्ष गुणांक अनुमान महत्वपूर्ण होते हैं।
प्रतिगमन और उससे परे अनुप्रयोग
abess रैखिक प्रतिगमन से परे सांख्यिकीय मॉडल की एक विस्तृत श्रृंखला पर लागू है। एकल-सूचकांक मॉडल के संदर्भ में, abess को अज्ञात लिंक फलन का अनुमान लगाते हुए प्रासंगिक सहसंयोजकों का चयन करने के लिए बढ़ाया जा सकता है। विधि को सामान्यीकृत रैखिक मॉडलों के लिए अनुकूलित किया गया है, जिसमें लॉजिस्टिक और पॉइसन प्रतिगमन शामिल हैं, जहां हानि फलन को तदनुसार संशोधित किया जाता है। जैव-सांख्यिकी में, abess का उपयोग बायोमार्कर खोज के लिए किया गया है, जहां भविष्य कहने वाले जीन या नैदानिक चरों के एक छोटे सेट की पहचान करना महत्वपूर्ण है।
विधि उच्च-आयामी सेटिंग्स को भी संभालती है जहां भविष्यवक्ताओं की संख्या p नमूना आकार n से काफी अधिक हो सकती है। ऐसे परिदृश्यों में, अनुकूली चयन तंत्र और विनिमय एल्गोरिदम विश्वसनीय चर चयन प्रदान करते हुए कम्प्यूटेशनल व्यवहार्यता बनाए रखते हैं।
सॉफ्टवेयर कार्यान्वयन
abess विधि एक ओपन-सोर्स R पैकेज में लागू की गई है, जिसे abess भी कहा जाता है, जो रैखिक प्रतिगमन, लॉजिस्टिक प्रतिगमन और अन्य मॉडलों के लिए कार्य प्रदान करता है। पैकेज में मुख्य एल्गोरिदम के लिए कुशल C++ कोड शामिल है, जो इसे बड़े पैमाने पर डेटासेट के लिए उपयुक्त बनाता है। उपयोगकर्ता अधिकतम समर्थन आकार निर्दिष्ट कर सकते हैं या अनुकूली प्रक्रिया को इसे स्वचालित रूप से निर्धारित करने दे सकते हैं। पैकेज समाधान पथ और नैदानिक भूखंडों के लिए विज़ुअलाइज़ेशन उपकरण भी प्रदान करता है।
अन्य विधियों के साथ तुलना
लैस्सो और इलास्टिक नेट जैसे नियमितीकरण-आधारित दृष्टिकोणों की तुलना में, abess निष्पक्ष अनुमान और ट्यूनिंग मापदंडों के बिना स्वचालित मॉडल आकार चयन का लाभ प्रदान करता है। हालांकि, बहुत बड़े p के लिए यह लैस्सो की तुलना में कम्प्यूटेशनल रूप से अधिक गहन हो सकता है, हालांकि बहुपद समय जटिलता इस चिंता को कम करती है। ऑर्थोगोनल मैचिंग परस्यूट जैसे लालची एल्गोरिदम की तुलना में, abess एक अधिक सैद्धांतिक विनिमय तंत्र प्रदान करता है जो स्थानीय ऑप्टिमा से बच सकता है।
सीमाएं और विस्तार
जबकि abess शक्तिशाली है, यह मानता है कि रैखिक मॉडल या इसके विस्तार मान्य हैं और L0 बाधा समस्या के लिए उपयुक्त है। अत्यधिक अरेखीय संबंधों के लिए, आधार विस्तार या कर्नेल विधियों का उपयोग करने वाले विस्तार की आवश्यकता हो सकती है। अनुसंधान abess को अधिक जटिल मॉडलों तक विस्तारित करने पर जारी है, जिसमें गहन-शिक्षण आर्किटेक्चर और तंत्रिका-नेटवर्क सेटिंग्स शामिल हैं, जहां फीचर चयन प्रशिक्षण प्रक्रिया में एकीकृत है।
यह भी देखें
संदर्भ
झू, जे. (2020). abess: Adaptive Best Subset Selection. (मूल परिचय पत्र)
बाहरी लिंक
- CRAN पर R पैकेज abess (दिशानिर्देशों के अनुसार यहां लिंक नहीं किया गया)