इंस्टेंस चयन, जिसे डेटासेट कमी या डेटासेट संघनन के रूप में भी जाना जाता है, कई मशीन-लर्निंग और डेटा माइनिंग कार्यों में लागू एक डेटा पूर्व-प्रसंस्करण चरण है। इसका प्राथमिक उद्देश्य मूल डेटासेट को प्रबंधनीय मात्रा में कम करना है, जिससे सीखने की प्रक्रिया के लिए आवश्यक कम्प्यूटेशनल संसाधन कम हो जाते हैं। इसके अतिरिक्त, इंस्टेंस चयन एल्गोरिदम सीखने से पहले शोरग्रस्त इंस्टेंस को हटा सकते हैं, जो वर्गीकरण समस्याओं में सटीकता में सुधार कर सकता है। इष्टतम परिणाम न्यूनतम डेटा उपसमुच्चय है जो पूरे डेटासेट का उपयोग करने की तुलना में बिना किसी प्रदर्शन हानि के समान कार्य प्राप्त करता है, जिसके लिए कमी दर और वर्गीकरण गुणवत्ता के बीच एक समझौते की आवश्यकता होती है।
एल्गोरिदम श्रेणियाँ
इंस्टेंस चयन एल्गोरिदम को उनके द्वारा संरक्षित इंस्टेंस के प्रकार के आधार पर समूहीकृत किया जाता है। एक वर्ग सीमा इंस्टेंस पर केंद्रित होता है, जो वर्ग निर्णय सीमाओं के पास स्थित होते हैं। इस समूह में एल्गोरिदम में DROP3, ICF, और LSBo शामिल हैं। एक अन्य वर्ग आंतरिक इंस्टेंस को संरक्षित करता है, जो प्रत्येक वर्ग के लिए केंद्रीय होते हैं; उदाहरणों में ENN और LSSm शामिल हैं। ये आंतरिक-चयन एल्गोरिदम अक्सर हानिकारक या शोरग्रस्त इंस्टेंस को फ़िल्टर करने के लिए उपयोग किए जाते हैं, और वे सीमा-चयन विधियों के लिए पूर्व-प्रसंस्करण चरणों के रूप में काम कर सकते हैं। उदाहरण के लिए, ENN, DROP3 में पहला चरण है, और LSSm का उपयोग LSBo द्वारा किया जाता है।
तीसरी श्रेणी मनमाने पड़ोस के भीतर सबसे घने इंस्टेंस का चयन करती है, जिसमें संभावित रूप से सीमा और आंतरिक दोनों बिंदु शामिल हो सकते हैं। LDIS, CDIS, और XLDIS जैसे एल्गोरिदम यहाँ आते हैं। LDIS और CDIS सरल हैं और मूल डेटा के अत्यधिक प्रतिनिधि उपसमुच्चय उत्पन्न करते हैं। क्योंकि वे प्रत्येक वर्ग के भीतर अलग-अलग प्रतिनिधि इंस्टेंस खोजते हैं, वे DROP3 और ICF जैसे एल्गोरिदम की तुलना में समय जटिलता और प्रभावी चलने के समय में तेज़ हैं।
प्रोटोटाइप-आधारित दृष्टिकोण
कुछ एल्गोरिदम वास्तविक इंस्टेंस का चयन नहीं करते हैं बल्कि सिंथेटिक प्रोटोटाइप उत्पन्न करते हैं। PSSA, PSDSP, और PSSP समान इंस्टेंस की पहचान करने और प्रत्येक समूह के लिए एक प्रोटोटाइप निकालने के लिए स्थानिक विभाजन की अवधारणा का उपयोग करते हैं, विशेष रूप से हाइपररेक्टेंगल। ये दृष्टिकोण वास्तविक इंस्टेंस का चयन करने के लिए भी अनुकूलित किए जा सकते हैं; एल्गोरिदम ISDSP समान रणनीति का पालन करता है लेकिन प्रोटोटाइप के बजाय वास्तविक इंस्टेंस चुनता है।
अनुप्रयोग और समझौते
इंस्टेंस चयन उन परिदृश्यों में मूल्यवान है जहां बड़े डेटासेट में प्रशिक्षण समय और मेमोरी उपयोग महत्वपूर्ण चिंताएं हैं। डेटासेट को कम करके, यह तेज़ मॉडल प्रशिक्षण को सक्षम बनाता है और शोर को समाप्त करके सामान्यीकरण में सुधार कर सकता है। हालांकि, आक्रामक कमी से सूचनात्मक इंस्टेंस खोने का जोखिम होता है, जो संभावित रूप से वर्गीकरण प्रदर्शन को ख़राब कर सकता है। कमी दर और सटीकता के बीच संतुलन किसी भी इंस्टेंस चयन रणनीति का मूल्यांकन करने के लिए केंद्रीय है।
अन्य तकनीकों से संबंध
इंस्टेंस चयन डेटा-ऑग्मेंटेशन से अलग है, जो डेटासेट का विस्तार करने के लिए नए सिंथेटिक नमूने उत्पन्न करता है, और मॉडल-प्रूनिंग से, जो प्रशिक्षण के बाद मॉडल जटिलता को कम करता है। यह फीचर चयन से भी अलग है, जो इंस्टेंस के बजाय विशेषताओं की संख्या को कम करता है। व्यवहार में, इंस्टेंस चयन को अक्सर समग्र मशीन लर्निंग पाइपलाइन को अनुकूलित करने के लिए अन्य पूर्व-प्रसंस्करण चरणों के साथ जोड़ा जाता है।
मूल्यांकन और व्यावहारिक विचार
सामान्य मूल्यांकन मेट्रिक्स में कमी दर शामिल है, जो हटाए गए इंस्टेंस के अनुपात को मापता है, और एक आयोजित-आउट परीक्षण सेट पर वर्गीकरण सटीकता। एल्गोरिदम का चुनाव डेटा वितरण और विशिष्ट लक्ष्यों पर निर्भर करता है, जैसे शोर हटाने बनाम अधिकतम कमी। ENN जैसे एल्गोरिदम शोरग्रस्त डेटासेट को साफ करने के लिए प्रभावी हैं, जबकि DROP3 जैसी सीमा-आधारित विधियों का उद्देश्य महत्वपूर्ण निर्णय सीमाओं को बनाए रखना है। चयन प्रक्रिया की कम्प्यूटेशनल लागत भी एक कारक है, जिसमें बहुत बड़े डेटासेट के लिए LDIS जैसे सरल तरीकों को प्राथमिकता दी जाती है।
भविष्य की दिशाएँ
शोध अधिक कुशल और स्केलेबल इंस्टेंस चयन विधियों का पता लगाना जारी रखता है, विशेष रूप से उच्च-आयामी डेटा और डीप-लर्निंग अनुप्रयोगों के लिए। इंस्टेंस चयन को न्यूरल-नेटवर्क प्रशिक्षण पाइपलाइनों के साथ एकीकृत करने में रुचि है, जहां डेटासेट को कम करने से महत्वपूर्ण सटीकता हानि के बिना प्रशिक्षण में तेजी आ सकती है। जैसे-जैसे डेटासेट आकार और जटिलता में बढ़ते हैं, इंस्टेंस चयन कृत्रिम-बुद्धिमत्ता प्रणालियों में कम्प्यूटेशनल संसाधनों के प्रबंधन के लिए एक प्रासंगिक उपकरण बना रहता है।