डेटा विश्लेषण में, विसंगति का पता लगाना दुर्लभ वस्तुओं, घटनाओं, या अवलोकनों की पहचान है जो डेटा के बहुमत से काफी भिन्न होते हैं और सामान्य व्यवहार की एक सुस्पष्ट धारणा के अनुरूप नहीं होते हैं। ऐसे उदाहरण किसी भिन्न तंत्र द्वारा उत्पन्न होने का संदेह पैदा कर सकते हैं या डेटासेट के शेष भाग के साथ असंगत दिखाई दे सकते हैं। इस अवधारणा को आउटलायर का पता लगाना और कभी-कभी, संदर्भ और अनुप्रयोग क्षेत्र के आधार पर, नवीनता का पता लगाना भी कहा जाता है।
विसंगति का पता लगाना कई क्षेत्रों में अनुप्रयोग पाता है, जिसमें साइबर सुरक्षा, चिकित्सा, मशीन विज़न, सांख्यिकी, तंत्रिका विज्ञान, कानून प्रवर्तन, और वित्तीय धोखाधड़ी का पता लगाना शामिल है। ऐतिहासिक रूप से, विसंगतियों को पहले सांख्यिकीय विश्लेषण, जैसे माध्य या मानक विचलन की गणना, में सहायता के लिए डेटा से स्पष्ट रूप से अस्वीकार या हटाने के लिए खोजा जाता था। उन्हें रैखिक प्रतिगमन जैसे मॉडलों से भविष्यवाणियों को बेहतर बनाने के लिए भी हटाया जाता था, और हाल ही में उनका निष्कासन मशीन लर्निंग एल्गोरिदम के प्रदर्शन में सहायता करता है। हालांकि, कई अनुप्रयोगों में, विसंगतियाँ स्वयं प्राथमिक रुचि की होती हैं और पूरे डेटासेट में सबसे अधिक वांछित अवलोकन होती हैं, जिन्हें शोर या अप्रासंगिक आउटलायर से अलग करने और पहचानने की आवश्यकता होती है।
परिभाषा और शब्दावली
विसंगति का पता लगाना अवलोकनों, घटनाओं, या पैटर्न की पहचान है जो किसी विशेष सेटिंग में अपेक्षित सामान्य व्यवहार से काफी भिन्न होते हैं। कोई एकल परिचालन परिभाषा नहीं है जो सभी क्षेत्रों में सार्वभौमिक रूप से लागू होती है, क्योंकि सामान्यता की धारणा डेटा, अवलोकनों के प्रतिनिधित्व, जिस संदर्भ में वे होते हैं, और पता लगाने की विधि द्वारा बनाई गई मान्यताओं पर निर्भर करती है।
एक विसंगति आवश्यक रूप से एक डेटा त्रुटि नहीं है। अनुप्रयोग के आधार पर, यह एक माप या रिकॉर्डिंग त्रुटि, डेटा उत्पन्न करने वाली प्रक्रिया में बदलाव, एक असामान्य लेकिन मान्य अवलोकन, या रुचि की घटना जैसे धोखाधड़ी, उपकरण विफलता, या सुरक्षा घुसपैठ का प्रतिनिधित्व कर सकता है। विसंगतियों को केवल दुर्लभता या अन्य अवलोकनों से दूरी से भी परिभाषित नहीं किया जाता है; विभिन्न विधियाँ संभाव्यता वितरण, दूरियों या स्थानीय घनत्व, क्लस्टर सदस्यता, सामान्य डेटा के आसपास की सीमाओं, भविष्यवाणी त्रुटियों, पुनर्निर्माण त्रुटियों, या अन्य मॉडल-विशिष्ट मानदंडों का उपयोग करके सामान्यता को चिह्नित करती हैं।
कई विसंगति-पता लगाने की विधियाँ तत्काल श्रेणीबद्ध लेबल के बजाय एक संख्यात्मक विसंगति स्कोर लौटाती हैं। स्कोर उस डिग्री का प्रतिनिधित्व करता है जिस हद तक एक अवलोकन सामान्यता के फिट किए गए मॉडल से भिन्न होता है और एक निर्णय सीमा लागू करके द्विआधारी निर्णय में परिवर्तित किया जाता है। नतीजतन, क्या एक अवलोकन को विसंगति के रूप में लेबल किया जाता है, यह सामान्यता के मॉडल, उपलब्ध संदर्भ, और उपयोग किए गए निर्णय नियम पर निर्भर करता है।
विसंगतियों के प्रकार
एक व्यापक रूप से उपयोग किया जाने वाला वर्गीकरण तीन प्रकार की विसंगतियों को अलग करता है। एक बिंदु विसंगति एक व्यक्तिगत अवलोकन है जिसे डेटा के बाकी हिस्सों के सापेक्ष असामान्य माना जाता है - उदाहरण के लिए, डेटासेट में अन्य लेनदेन की तुलना में एक असामान्य रूप से बड़ा लेनदेन। एक प्रासंगिक विसंगति, जिसे सशर्त विसंगति भी कहा जाता है, केवल एक विशेष संदर्भ के भीतर असामान्य है - एक अवलोकन परिस्थितियों के एक सेट के तहत सामान्य हो सकता है लेकिन दूसरे के तहत असामान्य, जैसे तापमान जो गर्मियों में सामान्य है लेकिन सर्दियों में असामान्य है। संदर्भ अस्थायी, स्थानिक, जनसांख्यिकीय, या अन्यथा अनुप्रयोग द्वारा परिभाषित हो सकता है। एक सामूहिक विसंगति अवलोकनों का एक संबंधित संग्रह है जो समग्र रूप से असामान्य है, भले ही व्यक्तिगत अवलोकन स्वयं असामान्य न हों - उदाहरण के लिए, समय श्रृंखला में एक असामान्य उप-अनुक्रम या कंप्यूटर नेटवर्क में गतिविधि का एक अप्रत्याशित पैटर्न।
उपयुक्त श्रेणी आंशिक रूप से डेटा की संरचना पर निर्भर करती है। बिंदु-विसंगति विधियाँ स्वतंत्र अवलोकनों के लिए पर्याप्त हो सकती हैं, जबकि समय श्रृंखला, स्थानिक डेटा, अनुक्रम, और ग्राफ़ को अक्सर प्रासंगिक या सामूहिक संबंधों को स्पष्ट रूप से मॉडल करने की आवश्यकता होती है।
संबंधित शर्तें
विसंगति, आउटलायर, और नवीनता शब्द कभी-कभी एक दूसरे के स्थान पर उपयोग किए जाते हैं, लेकिन उनका उपयोग सांख्यिकी, Machine learning, सिग्नल प्रोसेसिंग, और व्यक्तिगत अनुप्रयोग क्षेत्रों के बीच भिन्न होता है। एक आउटलायर आमतौर पर एक अवलोकन को दर्शाता है जो डेटासेट में अन्य अवलोकनों के साथ असंगत दिखाई देता है; आउटलायर-पता लगाने की विधियाँ अक्सर ऐसे अवलोकनों को मॉडल फिट करने के लिए उपयोग किए जाने वाले डेटा में मौजूद होने की अनुमति देती हैं। नवीनता का पता लगाने में, प्रशिक्षण डेटा को आम तौर पर सामान्य व्यवहार का प्रतिनिधित्व करने के लिए माना जाता है, और पहले से न देखे गए परीक्षण अवलोकनों का मूल्यांकन सामान्यता के परिणामी मॉडल के खिलाफ किया जाता है। नवीनता का पता लगाना इसलिए अक्सर एक-श्रेणी वर्गीकरण के रूप में तैयार किया जाता है। ये भेद साहित्य में लगातार लागू नहीं होते हैं, और व्यापक शब्द विसंगति का पता लगाना अक्सर इन सभी सेटिंग्स को शामिल करता है।
तकनीकें और श्रेणियाँ
विसंगति का पता लगाने की तकनीकों की तीन व्यापक श्रेणियाँ मौजूद हैं। पर्यवेक्षित विसंगति का पता लगाने की तकनीकों के लिए "सामान्य" और "असामान्य" के रूप में लेबल किए गए डेटासेट की आवश्यकता होती है और एक क्लासिफायर को प्रशिक्षित करना शामिल होता है। हालांकि, यह दृष्टिकोण शायद ही कभी उपयोग किया जाता है क्योंकि लेबल किया गया डेटा आम तौर पर अनुपलब्ध होता है और कक्षाएं स्वाभाविक रूप से असंतुलित होती हैं। अर्ध-पर्यवेक्षित विसंगति का पता लगाने की तकनीकें मानती हैं कि डेटा का कुछ हिस्सा लेबल किया गया है - आम तौर पर सामान्य डेटा - और सामान्य व्यवहार का प्रतिनिधित्व करने वाला एक मॉडल बनाती हैं, फिर संभावना का परीक्षण करती हैं कि एक परीक्षण उदाहरण मॉडल द्वारा उत्पन्न किया गया था। अप्रशिक्षित विसंगति का पता लगाने की तकनीकें मानती हैं कि डेटा अलेबल है और उनके व्यापक और अधिक प्रासंगिक अनुप्रयोग के कारण अब तक सबसे अधिक उपयोग की जाती हैं।
सांख्यिकीय विधियाँ
सांख्यिकीय दृष्टिकोण संभाव्यता वितरण का उपयोग करके डेटा के सामान्य व्यवहार को मॉडल करते हैं। विधियों में गाऊसी मिश्रण मॉडल जैसी पैरामीट्रिक तकनीकें और हिस्टोग्राम या कर्नेल घनत्व अनुमान पर आधारित गैर-पैरामीट्रिक तकनीकें शामिल हैं। फिट किए गए मॉडल के तहत कम संभावना वाले अवलोकनों को विसंगतियों के रूप में चिह्नित किया जाता है। ये विधियाँ अक्सर अवलोकनों के बीच स्वतंत्रता मानती हैं, जिससे वे अनुकूलन के बिना जटिल संरचित डेटा के लिए कम उपयुक्त हो जाती हैं।
दूरी-आधारित और घनत्व-आधारित विधियाँ
दूरी-आधारित विधियाँ एक अवलोकन को असामान्य के रूप में चिह्नित करती हैं यदि यह अपने निकटतम पड़ोसियों से दूर है। घनत्व-आधारित विधियाँ, जैसे स्थानीय आउटलायर कारक, एक अवलोकन के आसपास के स्थानीय घनत्व की तुलना उसके पड़ोसियों से करती हैं; काफी कम घनत्व वाले क्षेत्रों में अवलोकनों को चिह्नित किया जाता है। ये विधियाँ विशेष रूप से अलग-अलग घनत्व वाले डेटासेट में बिंदु विसंगतियों की पहचान करने के लिए उपयोगी हैं और डेटा वितरण के बारे में पूर्व धारणाओं की आवश्यकता नहीं होती है।
क्लस्टरिंग-आधारित विधियाँ
क्लस्टरिंग-आधारित विसंगति का पता लगाना डेटा को क्लस्टर में समूहित करता है और विसंगतियों को उन बिंदुओं के रूप में पहचानता है जो किसी भी क्लस्टर से संबंधित नहीं हैं, क्लस्टर केंद्रों से दूर हैं, या बहुत छोटे क्लस्टर से संबंधित हैं। k-means और DBSCAN जैसे एल्गोरिदम को इस उद्देश्य के लिए अनुकूलित किया गया है। दृष्टिकोण सहज है और कुशल हो सकता है, लेकिन प्रदर्शन चुने गए क्लस्टरिंग एल्गोरिदम और उसके मापदंडों पर निर्भर करता है, और एक असामान्य क्लस्टर का गठन करने की परिभाषा अनुप्रयोग के अनुसार भिन्न होती है।
मशीन लर्निंग और डीप लर्निंग दृष्टिकोण
आधुनिक विसंगति का पता लगाना तेजी से मशीन लर्निंग और डीप लर्निंग तकनीकों पर निर्भर करता है। ऑटोएनकोडर, एक प्रकार का तंत्रिका नेटवर्क, सामान्य डेटा का पुनर्निर्माण करना सीखते हैं; उच्च पुनर्निर्माण त्रुटि एक विसंगति को इंगित करती है। वन-क्लास सपोर्ट वेक्टर मशीनें उच्च-आयामी फीचर स्थान में सामान्य डेटा के चारों ओर एक सीमा सीखती हैं। ट्रांसफॉर्मर आर्किटेक्चर और बड़े भाषा मॉडल पर आधारित विधियों का भी अनुक्रमिक डेटा, जैसे लॉग या समय श्रृंखला, में विसंगतियों का पता लगाने के लिए पता लगाया गया है, जो लंबी दूरी की निर्भरता और प्रासंगिक पैटर्न को मॉडल करने की उनकी क्षमता का लाभ उठाते हैं।
अनुप्रयोग
साइबर सुरक्षा
विसंगति का पता लगाना घुसपैठ का पता लगाने वाली प्रणालियों का एक मूलभूत घटक है। यह अवधारणा समय के साथ काफी विकसित हुई, एक मैनुअल प्रक्रिया के रूप में शुरू हुई जहां सिस्टम प्रशासक असामान्य गतिविधियों की निगरानी करते थे, जैसे छुट्टी पर गए उपयोगकर्ता के खाते तक पहुंच या अप्रत्याशित प्रिंटर गतिविधि। 1970 के दशक के अंत और 1980 के दशक की शुरुआत तक, ऑडिट लॉग और सिस्टम लॉग का विश्लेषण मुख्य रूप से घटना जांच के लिए पूर्वव्यापी था, क्योंकि डेटा की मात्रा ने वास्तविक समय की निगरानी को अव्यावहारिक बना दिया था। डिजिटल भंडारण की सामर्थ्य ने विशेष कार्यक्रमों के साथ ऑडिट लॉग के ऑनलाइन विश्लेषण को सक्षम किया, हालांकि कम्प्यूटेशनल तीव्रता के कारण ये कार्यक्रम आम तौर पर ऑफ-पीक घंटों के दौरान चलाए जाते थे। 1990 के दशक में वास्तविक समय की घुसपैठ का पता लगाने वाली प्रणालियाँ आईं जो उत्पन्न होते ही ऑडिट डेटा का विश्लेषण करने में सक्षम थीं, सक्रिय पहचान की ओर बदलाव। आधुनिक सिस्टम नेटवर्क ट्रैफ़िक, उपयोगकर्ता व्यवहार, और एंडपॉइंट गतिविधियों पर विसंगति का पता लगाने को लागू करते हैं ताकि ज़ीरो-डे अटैक, इनसाइडर खतरे, और अन्य दुर्भावनापूर्ण पैटर्न की पहचान की जा सके।
वित्तीय धोखाधड़ी का पता लगाना
वित्त में, विसंगति का पता लगाना धोखाधड़ी वाले लेनदेन की पहचान करता है, जैसे क्रेडिट कार्ड धोखाधड़ी, बीमा दावा दुरुपयोग, और मनी लॉन्ड्रिंग। लेनदेन की राशि, आवृत्ति, या भौगोलिक स्थान में असामान्य पैटर्न आगे की जांच के लिए अलर्ट ट्रिगर कर सकते हैं। यह क्षेत्र ऐतिहासिक धोखाधड़ी लेबल का उपयोग करने वाली पर्यवेक्षित विधियों और नई धोखाधड़ी योजनाओं की खोज के लिए अप्रशिक्षित विधियों दोनों से लाभान्वित होता है।
चिकित्सा और स्वास्थ्य सेवा
चिकित्सा अनुप्रयोगों में असामान्य शारीरिक संकेतों का पता लगाना, उपचारों के अप्रत्याशित प्रतिक्रियाओं की पहचान करना, और एमआरआई या सीटी स्कैन जैसी चिकित्सा छवियों में विसंगतियों को चिह्नित करना शामिल है। ये सिस्टम चिकित्सकों को स्थापित मानदंडों से विचलित होने वाले मामलों पर ध्यान केंद्रित करने में मदद करते हैं, संभावित रूप से दुर्लभ स्थितियों के निदान या उपकरण खराबी का शीघ्र पता लगाने में सुधार करते हैं।
विनिर्माण और पूर्वानुमानित रखरखाव
औद्योगिक सेटिंग्स में, विसंगति का पता लगाना उपकरणों से सेंसर रीडिंग की निगरानी करता है और विफलताओं के होने से पहले उनकी भविष्यवाणी करता है। असामान्य कंपन पैटर्न, तापमान स्पाइक्स, या ध्वनिक हस्ताक्षर आसन्न टूटने का संकेत दे सकते हैं, जिससे रखरखाव टीमों को सक्रिय रूप से हस्तक्षेप करने में सक्षम बनाया जा सकता है। यह विनिर्माण, विमानन, और ऊर्जा जैसे क्षेत्रों में डाउनटाइम और रखरखाव लागत को कम करता है।
चुनौतियाँ और सीमाएँ
विसंगति का पता लगाना कई स्थायी चुनौतियों का सामना करता है। सामान्यता की परिभाषा अक्सर समय के साथ बदलती है, जिसके लिए मॉडलों को अवधारणा बहाव के अनुकूल होने की आवश्यकता होती है। विसंगतियों की दुर्लभता लेबल किए गए डेटा को दुर्लभ बनाती है, पर्यवेक्षित दृष्टिकोणों को सीमित करती है और मूल्यांकन को जटिल बनाती है। असंतुलित डेटासेट उच्च गलत सकारात्मक दरों का कारण बन सकते हैं, जो साइबर सुरक्षा जैसे क्षेत्रों में महंगे हैं जहां विश्लेषकों को कई अलर्ट को प्राथमिकता देनी होती है। इसके अतिरिक्त, विसंगतियाँ संदर्भ-निर्भर हैं, और स्वतंत्र बिंदु अवलोकनों पर अच्छा प्रदर्शन करने वाली विधियाँ स्पष्ट प्रासंगिक मॉडलिंग के बिना ग्राफ़ या अनुक्रम जैसे संरचित डेटा पर विफल हो सकती हैं।
निर्णय सीमा का चुनाव महत्वपूर्ण है; इसे कम करने से पहचान दर बढ़ती है लेकिन गलत अलार्म भी बढ़ते हैं, जबकि इसे बढ़ाने से सूक्ष्म विसंगतियाँ छूट सकती हैं। क्षेत्रों में विसंगति का पता लगाने के तरीकों की तुलना करने के लिए कोई सार्वभौमिक रूप से स्वीकृत मीट्रिक नहीं है, क्योंकि गलत सकारात्मक और गलत नकारात्मक की सापेक्ष लागत अनुप्रयोग के अनुसार काफी भिन्न होती है।
अन्य क्षेत्रों से संबंध
विसंगति का पता लगाना कृत्रिम बुद्धिमत्ता और सांख्यिकी के कई क्षेत्रों के साथ प्रतिच्छेद करता है। जनरेटिव एआई में, ट्रांसफॉर्मर जैसे मॉडल अनुक्रमों की संभावना का अनुमान लगाने के लिए उपयोग किए जा सकते हैं, जो असामान्य इनपुट का पता लगाने के लिए एक आधार प्रदान करते हैं। एमआईटी सीएसएआईएल और स्टैनफोर्ड एआई लैब जैसे संस्थानों में शोध ने सैद्धांतिक नींव और व्यावहारिक एल्गोरिदम में योगदान दिया है। अमेज़न वेब सर्विसेज और गूगल क्लाउड जैसी कंपनियाँ अपने क्लाउड प्लेटफार्मों के हिस्से के रूप में विसंगति का पता लगाने वाली सेवाएँ प्रदान करती हैं, जो मशीन लर्निंग पाइपलाइनों के साथ एकीकृत होती हैं। यह क्षेत्र समय श्रृंखला विश्लेषण, सिग्नल प्रोसेसिंग, और मजबूत सांख्यिकी में काम से भी प्रेरणा लेता है, और यह डेटा गुणवत्ता प्रबंधन और सिस्टम निगरानी में प्रथाओं को सूचित करता है।