एक सपोर्ट वेक्टर मशीन (SVM) एक पर्यवेक्षित शिक्षण मॉडल है जिसका उपयोग वर्गीकरण, प्रतिगमन, और आउटलायर पहचान के लिए किया जाता है। यह उच्च-आयामी स्थान में विभिन्न वर्गों के डेटा बिंदुओं को अलग करने के लिए सबसे बड़े संभव मार्जिन के साथ एक हाइपरप्लेन या हाइपरप्लेनों का सेट बनाता है। एटीएंडटी बेल लेबोरेटरीज में विकसित, SVM सांख्यिकीय शिक्षण ढांचों जैसे कि VC सिद्धांत पर आधारित हैं, जिसे व्लादिमीर वैपनिक और एलेक्सी चेरवोनेन्किस ने 1970 के दशक और 1980 के दशक में प्रस्तावित किया था। वे Machine learning में सबसे अधिक अध्ययन किए गए मॉडलों में से हैं क्योंकि उनकी सैद्धांतिक सुगमता और कार्यों में लचीलापन है।
SVM रैखिक वर्गीकरण सबसे अच्छे वर्गों को अलग करने वाले अधिकतम-मार्जिन हाइपरप्लेन को खोजकर करते हैं। गैर-रैखिक समस्याओं के लिए, वे कर्नेल ट्रिक का उपयोग करते हैं, जो इनपुट को उच्च-आयामी फीचर स्थानों में अंतर्निहित रूप से मैप करता है जहां रैखिक पृथक्करण संभव हो जाता है। यह दृष्टिकोण डेटा को केवल कर्नेल फ़ंक्शन का उपयोग करके जोड़ीवार समानता तुलनाओं के माध्यम से प्रस्तुत करता है, जिससे कम्प्यूटेशनल जटिलता कम होती है। अधिकतम-मार्जिन मॉडल के रूप में, SVM शोरगुल वाले डेटा के प्रति लचीले हैं, जैसे कि गलत वर्गीकृत उदाहरण, और उन्हें एप्सिलॉन-संवेदनशील उद्देश्य के साथ प्रतिगमन कार्यों के लिए भी अनुकूलित किया जा सकता है।
प्रेरणा और मूल अवधारणाएं
डेटा का वर्गीकरण मशीन लर्निंग में एक सामान्य कार्य है। द्विआधारी वर्गीकरण समस्या में, दिए गए डेटा बिंदुओं में से प्रत्येक दो वर्गों में से एक से संबंधित होता है, लक्ष्य यह तय करना है कि एक नया डेटा बिंदु किस वर्ग में आता है। SVM में, प्रत्येक डेटा बिंदु को p-आयामी वेक्टर के रूप में देखा जाता है, और उद्देश्य एक (p-1)-आयामी हाइपरप्लेन खोजना है जो वर्गों को अलग करता है। इसे रैखिक वर्गीकरण के रूप में जाना जाता है। कई हाइपरप्लेन डेटा को वर्गीकृत कर सकते हैं, लेकिन इष्टतम विकल्प वह है जो मार्जिन को अधिकतम करता है - प्रत्येक पक्ष पर निकटतम डेटा बिंदुओं की दूरी। यह अधिकतम-मार्जिन हाइपरप्लेन एक अधिकतम-मार्जिन वर्गीकरण को परिभाषित करता है, जिसे इष्टतम स्थिरता का पर्सेप्ट्रॉन भी कहा जाता है।
औपचारिक रूप से, SVM एक उच्च या अनंत-आयामी स्थान में एक हाइपरप्लेन या हाइपरप्लेनों का सेट बनाता है। एक अच्छा पृथक्करण हाइपरप्लेन द्वारा प्राप्त किया जाता है जिसमें किसी भी वर्ग के निकटतम प्रशिक्षण-डेटा बिंदु की सबसे बड़ी दूरी होती है, क्योंकि एक बड़ा मार्जिन आम तौर पर कम सामान्यीकरण त्रुटि और कम ओवरफिटिंग की ओर ले जाता है।
कर्नेल ट्रिक
जब मूल डेटा परिमित-आयामी स्थान में रैखिक रूप से अलग करने योग्य नहीं होते हैं, SVM डेटा को बहुत उच्च-आयामी स्थान में मैप करते हैं जहां पृथक्करण आसान होता है। गणनाओं को प्रबंधनीय रखने के लिए, मैपिंग को इस तरह डिज़ाइन किया जाता है कि इनपुट वेक्टरों के जोड़ों के डॉट उत्पादों की गणना कर्नेल फ़ंक्शन k(x, y) के माध्यम से मूल स्थान में आसानी से की जा सके। उच्च-आयामी स्थान में हाइपरप्लेन बिंदुओं के एक सेट द्वारा परिभाषित होते हैं जिनका एक वेक्टर के साथ डॉट उत्पाद स्थिर होता है। ये वेक्टर डेटा से फीचर वेक्टरों के रैखिक संयोजन होते हैं, पैरामीटर alpha_i के साथ। निर्णय फ़ंक्शन कर्नेल पदों का योग बन जाता है: sum_i alpha_i k(x_i, x) = constant। यदि कर्नेल छोटा हो जाता है जैसे y, x से दूर चला जाता है, प्रत्येक पद एक परीक्षण बिंदु की एक डेटा बिंदु से निकटता को मापता है। यह उन सेटों के बीच जटिल भेदभाव की अनुमति देता है जो मूल स्थान में उत्तल नहीं हैं।
सामान्य कर्नेल फ़ंक्शनों में रैखिक, बहुपदीय, रेडियल आधार फ़ंक्शन(RBF), और सिग्मॉइड कर्नेल शामिल हैं। कर्नेल और उसके पैरामीटरों का चयन प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करता है।
अधिकतम-मार्जिन सिद्धांत और नियमितीकरण
अधिकतम-मार्जिन सिद्धांत का उद्देश्य एक हाइपरप्लेन खोजना है जो वर्गों के बीच मार्जिन को अधिकतम करता है। व्यवहार में, डेटा पूर्ण रूप से अलग करने योग्य नहीं हो सकता है, इसलिए SVM एक नरम मार्जिन पेश करते हैं जो कुछ गलत वर्गीकरणों की अनुमति देता है। इसे एक नियमितीकरण पैरामीटर द्वारा नियंत्रित किया जाता है, जिसे अक्सर C दर्शाया जाता है, जो मार्जिन अधिकतमीकरण और वर्गीकरण त्रुटि के बीच संतुलन बनाता है। एक बड़ा C गलत वर्गीकरणों को अधिक दंडित करता है, संभावित रूप से ओवरफिटिंग की ओर ले जाता है, जबकि एक छोटा C एक व्यापक मार्जिन लेकिन अधिक प्रशिक्षण त्रुटियों में परिणाम देता है। यह व्यापार-बंद सामान्यीकरण के लिए महत्वपूर्ण है।
सपोर्ट वेक्टर और द्वैत सूत्रीकरण
सपोर्ट वेक्टर वे प्रशिक्षण डेटा बिंदु हैं जो निर्णय सीमा के सबसे निकट होते हैं और हाइपरप्लेन को निर्धारित करते हैं। केवल ये बिंदु मॉडल को प्रभावित करते हैं; अन्य को समाधान को प्रभावित किए बिना हटाया जा सकता है। अनुकूलन समस्या को अक्सर इसके द्वैत रूप में हल किया जाता है, जहां उद्देश्य डेटा बिंदुओं के डॉट उत्पादों पर निर्भर करता है, जिससे कर्नेल ट्रिक लागू हो जाती है। द्वैत सूत्रीकरण उच्च-आयामी फीचर स्थानों के कुशल संचालन को भी सक्षम बनाता है।
अनुप्रयोग
SVM को कार्यों की एक विस्तृत श्रृंखला पर लागू किया गया है, जिसमें पाठ वर्गीकरण, छवि पहचान, जैव सूचना विज्ञान(जैसे, प्रोटीन वर्गीकरण),, और हस्तलिखित अंक पहचान शामिल हैं। वे संरचित भविष्यवाणी समस्याओं में भी उपयोग किए जाते हैं। उनकी लोकप्रियता उनकी सैद्धांतिक नींव और लचीलेपन से उपजती है। हालांकि, यह स्पष्ट नहीं है कि SVM की अन्य रैखिक मॉडलों जैसे कि लॉजिस्टिक प्रतिगमन या रैखिक प्रतिगमन की तुलना में बेहतर भविष्यवाणी प्रदर्शन है; उनका लाभ अक्सर कर्नेल के साथ गैर-रैखिक सीमाओं को संभालने में होता है।
विस्तार और प्रकार
कई विस्तार मौजूद हैं, जिसमें प्रतिगमन कार्यों के लिए सपोर्ट वेक्टर प्रतिगमन(SVR) शामिल है, जहां उद्देश्य एप्सिलॉन-संवेदनशील है। सपोर्ट वेक्टर क्लस्टरिंग, जिसे हावा सीगेलमैन और व्लादिमीर वैपनिक द्वारा बनाया गया, अवरक्षित शिक्षण में सपोर्ट वेक्टर सांख्यिकी लागू करता है, अलेबल किए गए डेटा को प्राकृतिक क्लस्टरों में वर्गीकृत करता है। SVM को अन्य तकनीकों के साथ भी जोड़ा गया है, जैसे कि Neural network समूह, प्रदर्शन को बेहतर बनाने के लिए।
अन्य मॉडलों से संबंध
SVM अन्य पर्यवेक्षित शिक्षण विधियों से संबंधित हैं, जिसमें लॉजिस्टिक प्रतिगमन और Neural network मॉडल शामिल हैं। जबकि लॉजिस्टिक प्रतिगमन सीधे संभावनाओं को मॉडल करता है, SVM मार्जिन अधिकतमीकरण पर ध्यान केंद्रित करते हैं। उच्च-आयामी स्थानों में, SVM अधिक प्रभावी हो सकते हैं जब फीचरों की संख्या नमूनों की संख्या से अधिक होती है। हालांकि, Deep learning के उदय के साथ, SVM छवि और वाक् पहचान जैसे कार्यों में कुछ हद तक ग्रहण किए गए हैं, जहां तंत्रिका नेटवर्क उत्कृष्ट प्रदर्शन करते हैं। फिर भी, SVM मशीन लर्निंग टूलबॉक्स में एक मौलिक उपकरण बने हुए हैं, विशेष रूप से छोटे से मध्यम आकार के डेटासेट और उन समस्याओं के लिए जहां व्याख्यात्मकता और सैद्धांतिक गारंटी को महत्व दिया जाता है।
सैद्धांतिक नींव
SVM सांख्यिकीय शिक्षण सिद्धांत पर आधारित हैं, विशेष रूप से VC सिद्धांत, जो सामान्यीकरण त्रुटि पर सीमाएं प्रदान करता है। VC आयाम एक मॉडल की क्षमता को मापता है, और SVM का उद्देश्य ओवरफिटिंग से बचने के लिए इस क्षमता को नियंत्रित करना है। 1990 के दशक में SVM का विकास, विशेष रूप से वैपनिक और एटीएंडटी बेल लेबोरेटरीज में सहयोगियों द्वारा, मशीन लर्निंग में एक महत्वपूर्ण प्रगति को चिह्नित करता है। कर्नेल ट्रिक, मूल रूप से 1960 के दशक में प्रस्तावित, को शक्तिशाली गैर-रैखिक वर्गीकरण बनाने के लिए SVM में एकीकृत किया गया।
व्यावहारिक विचार
SVM का उपयोग करते समय, चिकित्सकों को एक उपयुक्त कर्नेल चुनना चाहिए और हाइपरपैरामीटरों जैसे कि C और कर्नेल-विशिष्ट पैरामीटरों(जैसे, RBF के लिए gamma) को ट्यून करना चाहिए। फीचरों की स्केलिंग अक्सर आवश्यक होती है ताकि मार्जिन सार्थक हो। SVM बड़े डेटासेट के लिए कम्प्यूटेशनल रूप से गहन हैं, लेकिन अनुक्रमिक न्यूनतम अनुकूलन(SMO) जैसी तकनीकों ने प्रशिक्षण को संभव बना दिया है। LIBSVM और scikit-learn जैसी लाइब्रेरी कुशल कार्यान्वयन प्रदान करती हैं।
सीमाएं और वर्तमान स्थिति
SVM की सीमाएं हैं, जिसमें कर्नेल चयन और पैरामीटर ट्यूनिंग के प्रति संवेदनशीलता, और बहुत बड़े डेटासेट में स्केलिंग में कठिनाई शामिल है। Deep learning के युग में, SVM कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण जैसे क्षेत्रों में कम प्रभावी हैं, जहां Neural network मॉडल ने अत्याधुनिक परिणाम प्राप्त किए हैं। हालांकि, SVM कई अनुप्रयोगों के लिए प्रासंगिक बने हुए हैं, विशेष रूप से जहां डेटा सीमित है या जहां सैद्धांतिक गारंटी वांछित हैं। वे हाइब्रिड मॉडलों में घटकों के रूप में भी उपयोग किए जाते हैं, जैसे कि गहन फीचर निष्कर्षण के साथ SVM।
निष्कर्ष
सपोर्ट वेक्टर मशीन शास्त्रीय मशीन लर्निंग की एक आधारशिला हैं, जो अधिकतम-मार्जिन अनुकूलन और कर्नेल ट्रिक के माध्यम से मजबूत वर्गीकरण और प्रतिगमन प्रदान करती हैं। उनकी सैद्धांतिक नींव और लचीलापन ने उन्हें एक स्थायी उपकरण बना दिया है, यहां तक कि Deep learning जैसे नए मॉडल उभर आए हैं। SVM को समझना Machine learning और इसके अनुप्रयोगों का अध्ययन करने वाले किसी भी व्यक्ति के लिए आवश्यक है।