अंग्रेज़ी से अनुवादित

प्रतिकूल उदाहरण ऐसे इनपुट होते हैं जो जानबूझकर मशीन लर्निंग मॉडल को गलत भविष्यवाणियाँ करने के लिए धोखा देने के लिए तैयार किए जाते हैं, जो अक्सर मनुष्यों के लिए अदृश्य होते हैं। वे प्रतिकूल मशीन लर्निंग अनुसंधान का एक मुख्य फोकस हैं।

प्रतिकूल उदाहरण (Adversarial examples) मशीन लर्निंग मॉडल के लिए ऐसे इनपुट होते हैं जिन्हें जानबूझकर मॉडल से गलती करवाने के लिए डिज़ाइन किया गया होता है। ये इनपुट आमतौर पर वैध डेटा में छोटे, अक्सर अदृश्य, परिवर्तन लागू करके बनाए जाते हैं, जैसे किसी छवि में शोर जोड़ना या पाठ में कुछ शब्द बदलना। प्रतिकूल उदाहरणों का अस्तित्व कई मशीन लर्निंग प्रणालियों में एक मौलिक कमजोरी को उजागर करता है, जो अक्सर यह मानती हैं कि प्रशिक्षण और परीक्षण डेटा एक ही सांख्यिकीय वितरण से आते हैं। व्यवहार में, हालांकि, उपयोगकर्ता या हमलावर गढ़ा हुआ डेटा प्रदान कर सकते हैं जो इस धारणा का उल्लंघन करता है, जिससे सुरक्षा, स्वायत्त ड्राइविंग और बायोमेट्रिक पहचान जैसे उच्च-दांव वाले अनुप्रयोगों में गलत भविष्यवाणियाँ होती हैं।

इन हमलों और उनके खिलाफ बचाव का अध्ययन प्रतिकूल मशीन लर्निंग (adversarial machine learning) के क्षेत्र में आता है। यह क्षेत्र जाँच करता है कि मॉडलों को कैसे धोखा दिया जा सकता है और उन्हें अधिक मजबूत कैसे बनाया जाए। प्रतिकूल उदाहरण अन्य प्रकार की मॉडल विफलताओं से भिन्न होते हैं क्योंकि वे यादृच्छिक शोर या खराब सामान्यीकरण से उत्पन्न होने के बजाय, किसी मॉडल की निर्णय सीमा में विशिष्ट कमजोरियों का फायदा उठाने के लिए जानबूझकर अनुकूलित किए जाते हैं।

इतिहास

प्रतिकूल उदाहरणों की अवधारणा स्पैम फ़िल्टरिंग पर प्रारंभिक कार्य से उभरी। जनवरी 2004 में MIT स्पैम सम्मेलन में, जॉन ग्राहम-कमिंग ने प्रदर्शित किया कि एक मशीन-लर्निंग स्पैम फ़िल्टर का उपयोग किसी अन्य ऐसे फ़िल्टर को हराने के लिए किया जा सकता है, जिसमें स्वचालित रूप से यह सीखा जाता है कि स्पैम ईमेल को गैर-स्पैम के रूप में वर्गीकृत करने के लिए उसमें कौन से शब्द जोड़ने चाहिए। उसी वर्ष, नीलेश दलवी और सहकर्मियों ने नोट किया कि स्पैम फ़िल्टर में उपयोग किए जाने वाले रैखिक क्लासिफायर सरल चोरी हमलों (evasion attacks) से पराजित हो सकते हैं, जहाँ स्पैमर्स अपने ईमेल में अच्छे शब्द डालते थे। लगभग 2007 में, कुछ स्पैमर्स ने OCR-आधारित फ़िल्टर को हराने के लिए छवि स्पैम के भीतर शब्दों को बदलने हेतु यादृच्छिक शोर जोड़ा।

2006 में, मार्को बैरेनो और अन्य ने "Can Machine Learning Be Secure?" प्रकाशित किया, जिसमें हमलों की एक व्यापक वर्गीकरण प्रणाली (taxonomy) रेखांकित की गई। 2013 तक, कई शोधकर्ताओं को उम्मीद थी कि सपोर्ट वेक्टर मशीन और तंत्रिका नेटवर्क जैसे गैर-रैखिक क्लासिफायर प्रतिकूल हमलों के प्रति मजबूत हो सकते हैं। यह उम्मीद तब टूट गई जब बत्तीस्टा बिगियो और अन्य ने 2012-2013 में ऐसे मॉडलों पर पहले ग्रेडिएंट-आधारित हमलों का प्रदर्शन किया। 2014 में, क्रिश्चियन सेगेडी और सहकर्मियों ने दिखाया कि गहरे तंत्रिका नेटवर्क को प्रतिकूल हमलों से मूर्ख बनाया जा सकता है, जिसमें ग्रेडिएंट-आधारित विधियों का उपयोग करके प्रतिकूल गड़बड़ी (perturbations) तैयार की गईं। इस कार्य ने हमलों और बचाव दोनों पर शोध की बाढ़ ला दी।

आगे के शोध से पता चला कि अनियंत्रित वातावरण में प्रतिकूल हमले पैदा करना कठिन है, क्योंकि छोटे घुमाव या रोशनी में बदलाव प्रतिकूल प्रभाव को नष्ट कर सकते हैं। Google Brain के निक फ्रॉस्ट जैसे शोधकर्ताओं ने नोट किया कि स्वायत्त ड्राइविंग कार के लिए विश्वसनीय प्रतिकूल उदाहरण बनाने की तुलना में स्टॉप साइन को भौतिक रूप से हटाना अक्सर आसान होता है। फ्रॉस्ट ने यह भी तर्क दिया कि समुदाय गलत तरीके से मानता है कि एक डेटा वितरण पर प्रशिक्षित मॉडल एक अलग वितरण पर अच्छा प्रदर्शन करेगा, और मानव धारणा की नकल करने वाले नए दृष्टिकोणों की आवश्यकता का सुझाव दिया। जबकि यह क्षेत्र शैक्षणिक जगत में निहित है, Google, Microsoft और IBM जैसी बड़ी तकनीकी कंपनियों ने मॉडल मजबूती का आकलन करने और हमले के जोखिम को कम करने के लिए दस्तावेज़ीकरण और ओपन-सोर्स कोड बेस तैयार करना शुरू कर दिया है।

हमलों के प्रकार

प्रतिकूल मशीन लर्निंग में कई सामान्य हमले श्रेणियाँ शामिल हैं। चोरी हमले (Evasion attacks) परीक्षण के समय होते हैं, जहाँ एक हमलावर किसी इनपुट को गलत वर्गीकृत करने के लिए संशोधित करता है, जैसे स्टॉप साइन की छवि में शोर जोड़ना ताकि इसे गति सीमा संकेत के रूप में पहचाना जाए। डेटा विषाक्तता हमले (Data poisoning attacks) प्रशिक्षण के दौरान होते हैं, जहाँ एक हमलावर मॉडल के व्यवहार को भ्रष्ट करने के लिए प्रशिक्षण सेट में दुर्भावनापूर्ण डेटा इंजेक्ट करता है। बाइज़ेंटाइन हमले (Byzantine attacks) वितरित प्रशिक्षण प्रणालियों को लक्षित करते हैं, जहाँ समझौता किए गए नोड गलत अपडेट भेजते हैं। मॉडल निष्कर्षण हमले (Model extraction attacks) का उद्देश्य किसी मॉडल की कार्यक्षमता को क्वेरी करके और एक प्रतिस्थापन मॉडल प्रशिक्षित करके चुराना है।

मैलवेयर डिटेक्शन के संदर्भ में, शोधकर्ताओं ने प्रतिकूल मैलवेयर निर्माण के तरीके प्रस्तावित किए हैं जो स्वचालित रूप से लर्निंग-आधारित डिटेक्टरों से बचने के लिए बाइनरी तैयार करते हैं, साथ ही दुर्भावनापूर्ण कार्यक्षमता को संरक्षित रखते हैं। GAMMA जैसे अनुकूलन-आधारित हमले विंडोज़ एक्ज़ीक्यूटेबल्स में पैडिंग या नए PE अनुभाग जैसी हानिरहित सामग्री इंजेक्ट करने के लिए आनुवंशिक एल्गोरिदम का उपयोग करते हैं। यह दृष्टिकोण चोरी को एक बाधित अनुकूलन समस्या के रूप में तैयार करता है जो गलत वर्गीकरण सफलता को पेलोड आकार के साथ संतुलित करता है और वाणिज्यिक एंटीवायरस उत्पादों में स्थानांतरणीयता (transferability) दिखाता है। पूरक कार्य मैलवेयर को हानिरहित के रूप में वर्गीकृत करने के लिए फीचर-स्पेस गड़बड़ी सीखने हेतु जनरेटिव एडवरसैरियल नेटवर्क (GANs) का उपयोग करता है; उदाहरण के लिए, Mal-LSGAN, प्रशिक्षण स्थिरता में सुधार और कई डिटेक्टरों में सही सकारात्मक दरों को कम करने के लिए मानक GAN हानि को न्यूनतम-वर्ग उद्देश्य (least-squares objective) से बदल देता है।

वास्तविक-विश्व उदाहरण

प्रतिकूल उदाहरण कई डोमेन में प्रदर्शित किए गए हैं। शोधकर्ताओं ने दिखाया कि केवल एक पिक्सेल बदलने से गहन शिक्षण एल्गोरिदम को मूर्ख बनाया जा सकता है। अन्य ने एक खिलौना कछुआ 3-डी प्रिंट किया, जिसकी बनावट इस तरह से इंजीनियर की गई थी कि Google की ऑब्जेक्ट डिटेक्शन AI इसे देखने के कोण की परवाह किए बिना राइफल के रूप में वर्गीकृत करे, और इसमें केवल कम लागत वाली व्यावसायिक रूप से उपलब्ध 3-डी प्रिंटिंग तकनीक का उपयोग किया गया। एक मशीन-समायोजित कुत्ते की छवि कंप्यूटर और मनुष्यों दोनों को बिल्ली की तरह दिखाई दी। 2019 के एक अध्ययन ने बताया कि मनुष्य अनुमान लगा सकते हैं कि मशीनें प्रतिकूल छवियों को कैसे वर्गीकृत करेंगी।

स्वायत्त ड्राइविंग में, शोधकर्ताओं ने स्टॉप साइन की उपस्थिति को बदलने के तरीके खोजे ताकि एक वाहन इसे मर्ज या गति सीमा संकेत के रूप में वर्गीकृत करे। McAfee ने Tesla के पूर्व Mobileye सिस्टम पर हमला किया, जिसमें स्पीड लिमिट साइन पर दो इंच की काली टेप की पट्टी जोड़कर इसे गति सीमा से 50 मील प्रति घंटे अधिक ड्राइव करने के लिए मूर्ख बनाया गया। चश्मे या कपड़ों पर प्रतिकूल पैटर्न जो चेहरे की पहचान प्रणालियों या लाइसेंस प्लेट रीडर को धोखा देने के लिए डिज़ाइन किए गए हैं, ने स्टील्थ स्ट्रीटवियर (stealth streetwear) के एक विशिष्ट उद्योग को जन्म दिया है।

प्रतिकूल ऑडियो इनपुट हानिरहित प्रतीत होने वाले ऑडियो में बुद्धिमान सहायकों को आदेश छिपा सकते हैं। बायोमेट्रिक पहचान में, नकली विशेषताएँ वैध उपयोगकर्ताओं की नकल कर सकती हैं या टेम्पलेट गैलरी से समझौता कर सकती हैं। उभरते हमले निगरानी और स्वायत्त वाहनों के लिए उपयोग की जाने वाली मानव-क्रिया पहचान प्रणालियों में भी प्रभावी हैं, जहाँ हमलावर सिस्टम को मूर्ख बनाने के लिए मानव फीचर प्रतिनिधित्व में शोर पेश करते हैं, अक्सर पहचान प्रणाली तक पहुँच की आवश्यकता के बिना।

बचाव और शमन

प्रतिकूल उदाहरणों के खिलाफ बचाव में प्रतिकूल प्रशिक्षण (adversarial training) शामिल है, जहाँ मॉडल को मजबूती में सुधार के लिए प्रतिकूल उदाहरणों पर प्रशिक्षित किया जाता है; इनपुट प्रीप्रोसेसिंग, जैसे डीनॉइज़िंग या फीचर स्क्वीज़िंग; और संदिग्ध इनपुट को चिह्नित करने वाली पहचान विधियाँ। हालांकि, कोई सार्वभौमिक बचाव मौजूद नहीं है, और हमलावर लगातार नई तकनीकें विकसित करते रहते हैं। शिकागो विश्वविद्यालय के शोधकर्ताओं द्वारा 2023 में जारी नाइटशेड (Nightshade) डेटा विषाक्तता फ़िल्टर, दृश्य कलाकारों को बिना सहमति के डेटा स्क्रैप करने वाले टेक्स्ट-टू-इमेज मॉडल के डेटासेट को भ्रष्ट करने की अनुमति देता है, जो दर्शाता है कि विषाक्तता का उपयोग रक्षात्मक रूप से कैसे किया जा सकता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:adversarial-machine-learning·machine-learning-security·artificial-intelligence·cybersecurity
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास