अंग्रेज़ी से अनुवादित

प्रतिकूल उदाहरण ऐसे इनपुट होते हैं जो जानबूझकर मशीन लर्निंग मॉडल को गलत भविष्यवाणियाँ करने के लिए धोखा देने हेतु तैयार किए जाते हैं, अक्सर वैध डेटा में अगोचर गड़बड़ियाँ जोड़कर। वे प्रतिकूल मशीन लर्निंग अनुसंधान का केंद्रीय फोकस हैं।

प्रतिकूल उदाहरण (Adversarial examples) ऐसे इनपुट होते हैं जिन्हें AI मॉडल को धोखा देने के लिए डिज़ाइन किया जाता है, आमतौर पर वैध डेटा में छोटे, अक्सर अदृश्य गड़बड़ियाँ (perturbations) जोड़कर जो मशीन-लर्निंग मॉडल को गलत वर्गीकरण करने या गलत व्यवहार करने का कारण बनती हैं। ये इनपुट अधिकांश सीखने के एल्गोरिदम के अंतर्निहित सांख्यिकीय मान्यताओं का फायदा उठाते हैं, जो आम तौर पर प्रशिक्षण और परीक्षण डेटा को समान वितरण से लिए जाने की अपेक्षा करते हैं। व्यवहार में, विरोधी जानबूझकर गढ़ा गया डेटा प्रदान कर सकते हैं जो इस मान्यता का उल्लंघन करता है, जिससे स्पैम फ़िल्टरिंग, कंप्यूटर सुरक्षा, बायोमेट्रिक पहचान और स्वायत्त ड्राइविंग जैसे उच्च-जोखिम वाले अनुप्रयोगों में विफलताएँ होती हैं।

प्रतिकूल उदाहरणों का अध्ययन प्रतिकूल मशीन लर्निंग के व्यापक क्षेत्र के अंतर्गत आता है, जो मशीन लर्निंग एल्गोरिदम पर हमलों और ऐसे हमलों के खिलाफ बचाव दोनों की जाँच करता है। सामान्य हमले की श्रेणियों में चोरी के हमले (evasion attacks) शामिल हैं, जहाँ पता लगाने से बचने के लिए अनुमान समय पर इनपुट संशोधित किए जाते हैं; डेटा विषाक्तता हमले (data poisoning attacks), जहाँ प्रशिक्षण डेटा दूषित किया जाता है; बाइज़ेंटाइन हमले (Byzantine attacks), जो वितरित सीखने की प्रणालियों को लक्षित करते हैं; और मॉडल निष्कर्षण (model extraction), जहाँ एक हमलावर किसी मॉडल की कार्यक्षमता को चुराने या दोहराने का प्रयास करता है।

ऐतिहासिक विकास

प्रतिकूल उदाहरणों में रुचि स्पैम फ़िल्टरिंग पर प्रारंभिक कार्य से उभरी। जनवरी 2004 में MIT स्पैम सम्मेलन में, जॉन ग्राहम-कमिंग ने प्रदर्शित किया कि एक मशीन-लर्निंग स्पैम फ़िल्टर का उपयोग दूसरे ऐसे फ़िल्टर को हराने के लिए किया जा सकता है, यह स्वचालित रूप से सीखकर कि स्पैम ईमेल में कौन से शब्द जोड़ने हैं ताकि इसे स्पैम नहीं के रूप में वर्गीकृत किया जाए। उसी वर्ष बाद में, नीलेश दलवी और सहयोगियों ने नोट किया कि स्पैम फ़िल्टर में उपयोग किए जाने वाले रैखिक वर्गीकरणकर्ताओं को सरल चोरी के हमलों से हराया जा सकता है, क्योंकि स्पैमर्स अपने ईमेल में "अच्छे शब्द" डालते थे। लगभग 2007 में, कुछ स्पैमर्स ने OCR-आधारित फ़िल्टर को हराने के लिए छवि स्पैम के भीतर शब्दों को धुंधला करने के लिए यादृच्छिक शोर जोड़ा।

2006 में, मार्को बैरेनो और अन्य ने "क्या मशीन लर्निंग सुरक्षित हो सकती है?" प्रकाशित किया, जिसमें हमलों की एक व्यापक वर्गीकरण प्रणाली (taxonomy) की रूपरेखा दी गई। 2013 तक, कई शोधकर्ताओं को उम्मीद थी कि सपोर्ट वेक्टर मशीन और तंत्रिका नेटवर्क जैसे गैर-रेखीय वर्गीकरणकर्ता विरोधियों के प्रति मजबूत हो सकते हैं। वह उम्मीद कम हो गई जब बैटिस्टा बिगियो और अन्य ने 2012 और 2013 में ऐसे मॉडलों पर पहले ग्रेडिएंट-आधारित हमले प्रदर्शित किए। 2014 से शुरू करके, क्रिश्चियन सेगेडी और अन्य ने दिखाया कि गहरे तंत्रिका नेटवर्क को विरोधियों द्वारा धोखा दिया जा सकता है, फिर से प्रतिकूल गड़बड़ियाँ बनाने के लिए ग्रेडिएंट-आधारित विधियों का उपयोग करते हुए।

तंत्र और गुण

प्रतिकूल उदाहरण आम तौर पर इनपुट में एक छोटी, सावधानीपूर्वक गणना की गई गड़बड़ी जोड़कर उत्पन्न किए जाते हैं। छवि वर्गीकरणकर्ताओं के लिए, इसमें अक्सर पिक्सेल मानों को इस तरह से संशोधित करना शामिल होता है जो मनुष्यों के लिए अदृश्य हो लेकिन मॉडल को उच्च आत्मविश्वास के साथ एक अलग वर्ग आउटपुट करने का कारण बनता है। ग्रेडिएंट-आधारित विधियाँ, जैसे कि फास्ट ग्रेडिएंट साइन विधि, अधिकतम वर्गीकरण त्रुटि उत्पन्न करने वाली गड़बड़ी की दिशा निर्धारित करने के लिए मॉडल के नुकसान फलन (loss function) का उपयोग करती हैं।

आगे के शोध से पता चला कि प्रतिकूल उदाहरण अनियंत्रित वातावरण में उत्पन्न करना कठिन होते हैं, क्योंकि छोटे घुमाव या मामूली रोशनी परिवर्तन जैसी पर्यावरणीय बाधाएँ शोर के प्रभाव को रद्द कर सकती हैं। उदाहरण के लिए, एक प्रतिकूल छवि जो प्रयोगशाला स्थितियों के तहत एक मॉडल को धोखा देती है, वह विभिन्न कोण से या अलग रोशनी में देखे जाने पर अपनी प्रतिकूलता खो सकती है। इस अवलोकन का वास्तविक-विश्व हमलों पर प्रभाव पड़ता है, जहाँ भौतिक स्थितियाँ परिवर्तनशीलता पेश करती हैं।

Google Brain के शोधकर्ताओं, जिनमें निक फ्रॉस्ट भी शामिल हैं, ने बताया है कि प्रतिकूल उदाहरण बनाने के बजाय स्टॉप साइन को शारीरिक रूप से हटाकर स्वायत्त कारों को स्टॉप साइन से चूकना आसान होता है। फ्रॉस्ट ने यह भी तर्क दिया कि प्रतिकूल मशीन लर्निंग समुदाय गलत तरीके से मानता है कि एक निश्चित डेटा वितरण पर प्रशिक्षित मॉडल पूरी तरह से अलग वितरण पर अच्छा प्रदर्शन करेंगे। उन्होंने मशीन लर्निंग के लिए नए दृष्टिकोण तलाशने का सुझाव दिया जो मानव धारणा के समान विशेषताओं को शामिल करते हैं।

उल्लेखनीय प्रदर्शन

कई उच्च-प्रोफ़ाइल प्रदर्शनों ने प्रतिकूल उदाहरणों की शक्ति को चित्रित किया है। शोधकर्ताओं ने दिखाया कि एक छवि में केवल एक पिक्सेल बदलने से गहरे सीखने के एल्गोरिदम को धोखा दिया जा सकता है। एक अन्य मामले में, Google के ऑब्जेक्ट डिटेक्शन AI को राइफल के रूप में वर्गीकृत करने के लिए इंजीनियर की गई बनावट वाला एक 3-D मुद्रित खिलौना कछुआ बनाया गया, चाहे कछुए को किसी भी कोण से देखा जाए। कछुए को बनाने के लिए केवल कम लागत वाली व्यावसायिक रूप से उपलब्ध 3-D मुद्रण तकनीक की आवश्यकता थी।

एक मशीन-समायोजित कुत्ते की छवि कंप्यूटर और मनुष्यों दोनों को बिल्ली जैसी दिखाई दी, और 2019 के एक अध्ययन ने बताया कि मनुष्य अनुमान लगा सकते हैं कि मशीनें प्रतिकूल छवियों को कैसे वर्गीकृत करेंगी। शोधकर्ताओं ने स्टॉप साइन की उपस्थिति को इस तरह से बदलने के तरीके भी खोजे कि एक स्वायत्त वाहन इसे एक विलय या गति सीमा संकेत के रूप में वर्गीकृत करे। एक अलग घटना में, मैक्एफी ने टेस्ला की पूर्व Mobileye प्रणाली पर हमला किया, इसे गति सीमा संकेत पर दो इंच की काली टेप पट्टी जोड़कर 50 मील प्रति घंटे की गति सीमा से अधिक गाड़ी चलाने के लिए धोखा दिया।

चेहरे की पहचान प्रणालियों या लाइसेंस प्लेट रीडरों को धोखा देने के लिए डिज़ाइन किए गए चश्मे या कपड़ों पर प्रतिकूल पैटर्न "स्टील्थ स्ट्रीटवियर" के एक विशिष्ट उद्योग को जन्म दिया है। ये भौतिक प्रतिकूल उदाहरण दर्शाते हैं कि घटना डिजिटल इनपुट से परे फैली हुई है।

सुरक्षा और मैलवेयर में अनुप्रयोग

प्रतिकूल उदाहरणों का कंप्यूटर सुरक्षा के लिए महत्वपूर्ण प्रभाव है। मैलवेयर डिटेक्शन में, शोधकर्ताओं ने प्रतिकूल मैलवेयर जनरेशन के तरीकों का प्रस्ताव किया है जो स्वचालित रूप से दुर्भावनापूर्ण कार्यक्षमता को संरक्षित करते हुए लर्निंग-आधारित डिटेक्टरों से बचने के लिए बाइनरी बनाते हैं। GAMMA जैसे अनुकूलन-आधारित हमले विंडोज़ एक्ज़ीक्यूटेबल्स में पैडिंग या नए PE अनुभाग जैसी हानिरहित सामग्री इंजेक्ट करने के लिए आनुवंशिक एल्गोरिदम का उपयोग करते हैं। यह दृष्टिकोण चोरी को एक बाध्य अनुकूलन समस्या के रूप में तैयार करता है जो गलत वर्गीकरण की सफलता को इंजेक्ट किए गए पेलोड के आकार के साथ संतुलित करता है, और यह वाणिज्यिक एंटीवायरस उत्पादों में स्थानांतरणीयता (transferability) दिखाता है।

पूरक कार्य मैलवेयर को हानिरहित के रूप में वर्गीकृत करने के लिए फीचर-स्पेस गड़बड़ियाँ सीखने के लिए जनरेटिव एडवर्सेरियल नेटवर्क (GANs) का उपयोग करता है। Mal-LSGAN, उदाहरण के लिए, प्रशिक्षण स्थिरता में सुधार के लिए मानक GAN नुकसान को कम से कम वर्गों के उद्देश्य (least-squares objective) और संशोधित सक्रियण कार्यों के साथ बदल देता है। यह विधि प्रतिकूल मैलवेयर उदाहरण उत्पन्न करती है जो कई डिटेक्टरों में सही सकारात्मक दरों को काफी कम कर देती है।

क्लस्टरिंग एल्गोरिदम, जो सुरक्षा अनुप्रयोगों में मैलवेयर और कंप्यूटर वायरस विश्लेषण के लिए उपयोग किए जाते हैं, भी कमजोर हैं। ये एल्गोरिदम मैलवेयर परिवारों की पहचान करने और विशिष्ट डिटेक्शन सिग्नेचर उत्पन्न करने का लक्ष्य रखते हैं, लेकिन विरोधी क्लस्टरिंग से बचने या परिणामी सिग्नेचर को गुमराह करने के लिए इनपुट में हेरफेर कर सकते हैं।

ऑडियो और भौतिक हमले

प्रतिकूल हमले छवियों तक सीमित नहीं हैं। शोधकर्ताओं ने प्रतिकूल ऑडियो इनपुट बनाए हैं जो बुद्धिमान सहायकों को हानिरहित प्रतीत होने वाले ऑडियो में कमांड छिपाते हैं। इन हमलों का उपयोग लक्षित प्रणाली में एल्गोरिदम इंजेक्ट करने या अनपेक्षित क्रियाओं को ट्रिगर करने के लिए किया जा सकता है। एक समानांतर साहित्य ऐसे उत्तेजनाओं की मानवीय धारणा की पड़ताल करता है, यह जाँच करता है कि क्या लोग छिपे हुए कमांडों का पता लगा सकते हैं या समझ सकते हैं।

मानव-क्रिया पहचान के क्षेत्र में, उभरते प्रतिकूल हमले अत्यधिक प्रभावी हैं। ये प्रणालियाँ निगरानी, स्वायत्त वाहनों और घर के भीतर निगरानी के लिए नियोजित हैं। हमलावर पहचान प्रणालियों को धोखा देने के लिए मानवीय विशेषताओं के प्रतिनिधित्व में शोर पेश करते हैं। उल्लेखनीय रूप से, इन हमलों को आवश्यक रूप से पहचान प्रणालियों तक पहुंच की आवश्यकता नहीं होती है, और वे मानव उपयोगकर्ताओं के लिए अदृश्य हो सकते हैं।

बचाव और शमन

प्रतिकूल उदाहरणों के खिलाफ बचाव एक खुली चुनौती बनी हुई है। प्रतिकूल प्रशिक्षण (adversarial training) जैसी तकनीकें, जहाँ मॉडल को मजबूती में सुधार के लिए प्रतिकूल उदाहरणों पर प्रशिक्षित किया जाता है, कुछ वादा दिखाती हैं लेकिन अक्सर साफ इनपुट पर सटीकता कम कर देती हैं। अन्य दृष्टिकोणों में इनपुट प्रीप्रोसेसिंग, प्रतिकूल इनपुट का पता लगाना, और प्रमाणित बचाव (certified defenses) शामिल हैं जो औपचारिक गारंटी प्रदान करते हैं।

जबकि प्रतिकूल मशीन लर्निंग अभी भी भारी रूप से शिक्षा जगत में निहित है, Google, Microsoft और IBM जैसी बड़ी तकनीकी कंपनियों ने दस्तावेज और ओपन सोर्स कोड बेस तैयार करना शुरू कर दिया है ताकि दूसरे मशीन लर्निंग मॉडल की मजबूती का ठोस आकलन कर सकें और प्रतिकूल हमलों के जोखिम को कम कर सकें। ये संसाधन मूल्यांकन विधियों को मानकीकृत करने और अधिक लचीली प्रणालियों के विकास को प्रोत्साहित करने का लक्ष्य रखते हैं।

डेटा विषाक्तता और रचनात्मक सुरक्षा

एक संबंधित खतरा डेटा विषाक्तता है, जहाँ हमलावर मॉडल व्यवहार को प्रभावित करने के लिए प्रशिक्षण डेटा को दूषित करते हैं। 2023 में, शिकागो विश्वविद्यालय के शोधकर्ताओं ने नाइटशेड (Nightshade) नामक डेटा विषाक्तता फ़िल्टर जारी किया। इसे दृश्य कलाकारों द्वारा अपनी कलाकृति पर लगाने के लिए बनाया गया था ताकि टेक्स्ट-टू-इमेज मॉडल के डेटा सेट को दूषित किया जा सके, जो आम तौर पर छवि निर्माता की सहमति के बिना इंटरनेट से अपना डेटा एकत्र करते हैं। यह उपकरण प्रतिकूल तकनीकों के एक रक्षात्मक उपयोग का प्रतिनिधित्व करता है, जो व्यक्तियों को जनरेटिव AI मॉडल में अनधिकृत उपयोग से अपनी बौद्धिक संपदा की रक्षा करने की अनुमति देता है।

चल रहे शोध और भविष्य की दिशाएँ

प्रतिकूल उदाहरणों का क्षेत्र विकसित होता जा रहा है, शोधकर्ता नए हमले वैक्टर और अधिक मजबूत रक्षा तंत्र दोनों की खोज कर रहे हैं। यह धारणा कि एक निश्चित डेटा वितरण पर प्रशिक्षित मॉडल पूरी तरह से अलग वितरण पर अच्छा प्रदर्शन करेंगे, तेजी से सवाल किया जा रहा है। कुछ शोधकर्ता मशीन लर्निंग के लिए एक नए दृष्टिकोण की वकालत करते हैं जो मानव धारणा की बेहतर नकल करता है, जो आम तौर पर छोटी गड़बड़ियों के प्रति अधिक मजबूत होती है।

जैसे-जैसे गहरे सीखने के मॉडल अधिक महत्वपूर्ण अनुप्रयोगों में तैनात किए जाते हैं, प्रतिकूल उदाहरणों को समझना और कम करना तेजी से महत्वपूर्ण हो जाता है। हमले और बचाव के बीच परस्पर क्रिया चल रहे शोध को प्रेरित करती है, प्रत्येक नया बचाव अक्सर अधिक परिष्कृत हमलों को प्रेरित करता है। अंतिम लक्ष्य ऐसी मशीन लर्निंग प्रणालियाँ बनाना है जो न केवल साफ डेटा पर सटीक हों बल्कि विरोधियों की उपस्थिति में भी विश्वसनीय हों।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:adversarial-machine-learning·machine-learning-security·ai-safety·robustness
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास