डेटा पॉइज़निंग मशीन-लर्निंग प्रणालियों के विरुद्ध एक प्रकार का प्रतिकूल हमला है, जिसमें हमलावर जानबूझकर मॉडल बनाने के लिए उपयोग किए जाने वाले प्रशिक्षण डेटा में हेरफेर करता है। चोरी-छिपे हमलों के विपरीत, जो अनुमान के समय एक प्रशिक्षित मॉडल का शोषण करते हैं, पॉइज़निंग हमले सीखने के चरण के दौरान होते हैं, जिसका उद्देश्य समग्र मॉडल प्रदर्शन को खराब करना, विशिष्ट गलत वर्गीकरण पेश करना, या छिपे हुए बैकडोर प्रत्यारोपित करना होता है जो विशेष परिस्थितियों में सक्रिय होते हैं। यह हमला उच्च-जोखिम वाले अनुप्रयोगों में विशेष रूप से खतरनाक है, जहां प्रशिक्षण डेटा अविश्वसनीय योगदानकर्ताओं से प्राप्त किया जा सकता है या कठोर सत्यापन के बिना सार्वजनिक रिपॉजिटरी से स्क्रैप किया जा सकता है।
अधिकांश मशीन-लर्निंग एल्गोरिदम के अंतर्निहित मूलभूत धारणा यह है कि प्रशिक्षण और परीक्षण डेटा एक ही सांख्यिकीय वितरण (स्वतंत्र और समान रूप से वितरित, या IID) से लिए गए हैं। डेटा पॉइज़निंग जानबूझकर निर्मित नमूने इंजेक्ट करके इस धारणा का उल्लंघन करती है जो सीखी गई निर्णय सीमा को स्थानांतरित करते हैं। यह प्रतिकूल हेरफेर सूक्ष्म हो सकता है, अक्सर हमलावर के उद्देश्य को प्राप्त करने के लिए केवल थोड़ी मात्रा में दूषित उदाहरणों की आवश्यकता होती है। ऐसे हमलों और उनके बचावों का अध्ययन प्रतिकूल मशीन-लर्निंग के व्यापक क्षेत्र के अंतर्गत आता है, जिसमें चोरी-छिपे हमले, बीजान्टिन हमले, और मॉडल निष्कर्षण भी शामिल हैं।
ऐतिहासिक विकास
डेटा पॉइज़निंग के शुरुआती प्रदर्शन स्पैम फ़िल्टरिंग के संदर्भ में उभरे। जनवरी 2004 में MIT स्पैम सम्मेलन में, जॉन ग्राहम-कमिंग ने दिखाया कि एक मशीन-लर्निंग स्पैम फ़िल्टर का उपयोग दूसरे को हराने के लिए किया जा सकता है, स्वचालित रूप से यह सीखकर कि स्पैम ईमेल में कौन से शब्द जोड़ने हैं ताकि इसे स्पैम नहीं के रूप में वर्गीकृत किया जा सके। उसी वर्ष, नीलेश दलवी और सहयोगियों ने नोट किया कि स्पैम फ़िल्टर में उपयोग किए जाने वाले रैखिक क्लासिफायर सरल चोरी-छिपे हमलों से पराजित हो सकते हैं, जहां स्पैमर्स अपने ईमेल में "अच्छे शब्द" डालते थे। लगभग 2007 में, कुछ स्पैमर्स ने OCR-आधारित फ़िल्टर को हराने के लिए इमेज स्पैम के भीतर शब्दों को फ़ज़ करने के लिए यादृच्छिक शोर जोड़ा।
2006 में, मार्को बैरेनो और अन्य ने "क्या मशीन लर्निंग सुरक्षित हो सकती है?" प्रकाशित किया, जिसमें सीखने की प्रणालियों के विरुद्ध हमलों की एक व्यापक वर्गीकरण रूपरेखा प्रस्तुत की गई। 2013 तक, कई शोधकर्ताओं ने आशा की कि सपोर्ट वेक्टर मशीन और तंत्रिका नेटवर्क जैसे गैर-रैखिक क्लासिफायर स्वाभाविक रूप से प्रतिकूल परिस्थितियों के प्रति मजबूत हो सकते हैं। यह आशा तब कम हुई जब बत्तीस्टा बिगियो और अन्य ने 2012 और 2013 के बीच ऐसे मॉडलों पर पहले ग्रेडिएंट-आधारित हमलों का प्रदर्शन किया। 2014 से शुरू करके, क्रिश्चियन सेगेडी और अन्य ने दिखाया कि गहरे तंत्रिका नेटवर्क को प्रतिकूल परेशानियों को तैयार करने के लिए ग्रेडिएंट-आधारित तरीकों का उपयोग करके प्रतिकूल परिस्थितियों द्वारा मूर्ख बनाया जा सकता है, यह खोज क्षेत्र में तेजी से विकास के लिए उत्प्रेरक बनी।
हमले के तंत्र और प्रकार
डेटा पॉइज़निंग हमले हमलावर के लक्ष्यों और पहुंच के आधार पर कई रूप ले सकते हैं। एक सामान्य प्रकार बैकडोर हमला है, जहां एक हमलावर एक विशिष्ट ट्रिगर पैटर्न (जैसे एक छोटा पैच या एक विशेष पिक्सेल व्यवस्था) वाले प्रशिक्षण नमूने इंजेक्ट करता है, जिन्हें लक्ष्य वर्ग के साथ लेबल किया जाता है। प्रशिक्षण के बाद, मॉडल साफ इनपुट पर सामान्य रूप से व्यवहार करता है लेकिन ट्रिगर वाले किसी भी इनपुट को गलत वर्गीकृत करता है। एक अन्य प्रकार उपलब्धता पॉइज़निंग है, जिसका उद्देश्य वैध डेटा पर मॉडल की समग्र सटीकता को खराब करना है, अक्सर आउटलायर या गलत लेबल वाले उदाहरणों को इंजेक्ट करके जो सीखने के एल्गोरिदम को भ्रमित करते हैं।
अनुकूलन-आधारित दृष्टिकोण विकसित किए गए हैं जो प्रशिक्षित मॉडल पर प्रभाव को अधिकतम करने वाले पॉइज़निंग नमूने तैयार करते हैं। उदाहरण के लिए, मैलवेयर डिटेक्शन में, शोधकर्ताओं ने प्रतिकूल मैलवेयर जनरेशन के तरीके प्रस्तावित किए हैं जो स्वचालित रूप से बाइनरी तैयार करते हैं ताकि सीखने-आधारित डिटेक्टरों को चकमा दिया जा सके जबकि दुर्भावनापूर्ण कार्यक्षमता को संरक्षित किया जा सके। GAMMA फ्रेमवर्क आनुवंशिक एल्गोरिदम का उपयोग करके विंडोज़ निष्पादन योग्य में पैडिंग या नए PE अनुभाग जैसी हानिरहित सामग्री इंजेक्ट करता है, चोरी-छिपे को एक बाधित अनुकूलन समस्या के रूप में तैयार करता है जो गलत वर्गीकरण सफलता और इंजेक्ट किए गए पेलोड के आकार के बीच संतुलन बनाता है। पूरक कार्य जनरेटिव एडवरसैरियल नेटवर्क (GAN) का उपयोग करके फीचर-स्पेस परेशानियों को सीखता है जो मैलवेयर को हानिरहित के रूप में वर्गीकृत करने का कारण बनती हैं; Mal-LSGAN, उदाहरण के लिए, मानक GAN हानि को कम-वर्ग उद्देश्य और संशोधित सक्रियण कार्यों के साथ बदलता है ताकि प्रशिक्षण स्थिरता में सुधार हो और प्रतिकूल मैलवेयर उदाहरण उत्पन्न हों जो कई डिटेक्टरों में सही सकारात्मक दरों को काफी कम करते हैं।
कंप्यूटर विज़न के क्षेत्र में, शोधकर्ताओं ने दिखाया है कि केवल एक पिक्सेल बदलने से गहरे सीखने के एल्गोरिदम मूर्ख बन सकते हैं। अन्य ने एक खिलौना कछुआ 3-डी प्रिंट किया जिसकी बनावट इस तरह से इंजीनियर की गई थी कि Google की वस्तु पहचान AI इसे देखने के कोण की परवाह किए बिना राइफल के रूप में वर्गीकृत करे। कछुआ बनाने के लिए केवल कम लागत वाली व्यावसायिक रूप से उपलब्ध 3-डी प्रिंटिंग तकनीक की आवश्यकता थी। एक मशीन-समायोजित कुत्ते की छवि कंप्यूटर और मनुष्यों दोनों को बिल्ली की तरह दिखती थी, और 2019 के एक अध्ययन ने बताया कि मनुष्य अनुमान लगा सकते हैं कि मशीनें प्रतिकूल छवियों को कैसे वर्गीकृत करेंगी।
वास्तविक-विश्व उदाहरण
डेटा पॉइज़निंग और संबंधित प्रतिकूल हमलों को कई व्यावहारिक सेटिंग्स में प्रदर्शित किया गया है। स्पैम फ़िल्टरिंग में, हमलों में "बुरे" शब्दों की गलत वर्तनी या "अच्छे" शब्दों के सम्मिलन के माध्यम से संदेशों को अस्पष्ट करना शामिल है। कंप्यूटर सुरक्षा में, हमलावर नेटवर्क पैकेट के भीतर मैलवेयर कोड को अस्पष्ट करते हैं या घुसपैठ का पता लगाने वाली प्रणालियों को गुमराह करने के लिए नेटवर्क प्रवाह विशेषताओं को संशोधित करते हैं। बायोमेट्रिक पहचान में, नकली बायोमेट्रिक लक्षणों का उपयोग एक वैध उपयोगकर्ता के रूप में प्रतिरूपण करने के लिए किया जा सकता है, या उपयोगकर्ताओं के टेम्पलेट गैलरी से समझौता करने के लिए किया जा सकता है जो समय के साथ अद्यतन लक्षणों के अनुकूल होते हैं।
एक उल्लेखनीय उदाहरण में McAfee ने टेस्ला की पूर्व Mobileye प्रणाली पर हमला किया, इसे गति सीमा संकेत पर दो इंच की काली टेप की पट्टी जोड़कर गति सीमा से 50 मील प्रति घंटे अधिक ड्राइव करने के लिए मूर्ख बनाया। शोधकर्ताओं ने एक स्टॉप साइन की उपस्थिति को परेशान करने के तरीके भी खोजे ताकि एक स्वायत्त वाहन इसे मर्ज या गति सीमा संकेत के रूप में वर्गीकृत करे। चश्मे या कपड़ों पर प्रतिकूल पैटर्न जो चेहरे-पहचान प्रणालियों या लाइसेंस-प्लेट रीडर को धोखा देने के लिए डिज़ाइन किए गए हैं, ने "स्टील्थ स्ट्रीटवियर" के एक विशेष उद्योग को जन्म दिया है।
2023 में, शिकागो विश्वविद्यालय के शोधकर्ताओं ने नाइटशेड नामक एक डेटा पॉइज़निंग फ़िल्टर जारी किया, जो दृश्य कलाकारों द्वारा अपने कलाकृति पर लगाने के लिए बनाया गया था ताकि टेक्स्ट-टू-इमेज मॉडल के डेटासेट को दूषित किया जा सके, जो आमतौर पर छवि निर्माता की सहमति के बिना इंटरनेट से डेटा स्क्रैप करते हैं। एक तंत्रिका नेटवर्क पर एक प्रतिकूल हमला एक हमलावर को लक्ष्य प्रणाली में एल्गोरिदम इंजेक्ट करने की भी अनुमति दे सकता है। शोधकर्ताओं ने हानिरहित-प्रतीत होने वाले ऑडियो में बुद्धिमान सहायकों को आदेश छिपाने के लिए प्रतिकूल ऑडियो इनपुट बनाए हैं; एक समानांतर साहित्य ऐसे उत्तेजनाओं की मानवीय धारणा की खोज करता है।
वास्तविक-विश्व सेटिंग्स में चुनौतियाँ
आगे के काम ने दिखाया है कि प्रतिकूल हमले अनियंत्रित वातावरण में उत्पन्न करना कठिन होते हैं क्योंकि विभिन्न पर्यावरणीय बाधाएं शोर के प्रभाव को रद्द कर देती हैं। उदाहरण के लिए, एक प्रतिकूल छवि पर कोई भी छोटा घुमाव या हल्की रोशनी प्रतिकूलता को नष्ट कर सकती है। Google Brain के निक फ्रॉस्ट जैसे शोधकर्ता बताते हैं कि प्रतिकूल उदाहरण बनाने की तुलना में स्टॉप साइन को शारीरिक रूप से हटाकर स्व-ड्राइविंग कारों को स्टॉप साइन से चूकना आसान है। फ्रॉस्ट यह भी मानते हैं कि प्रतिकूल मशीन-लर्निंग समुदाय गलत तरीके से मानता है कि एक निश्चित डेटा वितरण पर प्रशिक्षित मॉडल पूरी तरह से अलग वितरण पर अच्छा प्रदर्शन करेंगे। उनका सुझाव है कि मशीन-लर्निंग के लिए एक नया दृष्टिकोण खोजा जाना चाहिए और वर्तमान में वे एक अद्वितीय तंत्रिका नेटवर्क पर काम कर रहे हैं जिसकी विशेषताएं अत्याधुनिक दृष्टिकोणों की तुलना में मानवीय धारणा के अधिक समान हैं।
उभरते प्रतिकूल हमले मानव-क्रिया पहचान प्रणालियों में भी अत्यधिक प्रभावी हैं, जो निगरानी, स्वायत्त वाहनों और घर-में निगरानी जैसे वास्तविक-विश्व अनुप्रयोगों के लिए व्यापक रूप से उपयोग किए जाते हैं। इन हमलों में, हमलावर पहचान प्रणालियों को मूर्ख बनाने के लिए मानवीय विशेषताओं के प्रतिनिधित्व में शोर पेश करते हैं। इन हमलों के लिए आवश्यक रूप से पहचान प्रणालियों तक पहुंच की आवश्यकता नहीं होती है, और वे ऐसी प्रणालियों के मानव उपयोगकर्ताओं के लिए अगोचर हो सकते हैं।
बचाव और शमन
डेटा पॉइज़निंग के विरुद्ध बचाव आम तौर पर कई श्रेणियों में आते हैं। डेटा सैनिटाइज़ेशन में प्रशिक्षण से पहले विसंगतिपूर्ण या संदिग्ध नमूनों को हटाने के लिए प्रशिक्षण डेटा को फ़िल्टर करना शामिल है। मजबूत एकत्रीकरण विधियां, जैसे ट्रिम किया गया माध्य या माध्यिका-आधारित दृष्टिकोण, वितरित प्रशिक्षण के दौरान आउटलायर ग्रेडिएंट्स के प्रभाव को कम करती हैं। विसंगति का पता लगाने की तकनीकें आने वाले डेटा के सांख्यिकीय गुणों की निगरानी करके पॉइज़निंग प्रयासों की पहचान कर सकती हैं। विभेदक गोपनीयता एक औपचारिक गारंटी प्रदान करती है कि किसी भी एकल प्रशिक्षण उदाहरण का प्रभाव सीमित है, जिससे पॉइज़निंग का प्रभाव सीमित हो जाता है।
सुरक्षा अनुप्रयोगों में उपयोग किए जाने वाले क्लस्टरिंग एल्गोरिदम के संदर्भ में, जैसे मैलवेयर और कंप्यूटर वायरस विश्लेषण में मैलवेयर परिवारों की पहचान करने और विशिष्ट पहचान हस्ताक्षर उत्पन्न करने के लिए, बचाव को इस संभावना को ध्यान में रखना चाहिए कि हमलावर क्लस्टरिंग प्रक्रिया को गुमराह करने के लिए डिज़ाइन किए गए नमूने इंजेक्ट कर सकते हैं। जबकि प्रतिकूल मशीन-लर्निंग अभी भी भारी रूप से शिक्षा जगत में निहित है, Google, Microsoft, और IBM जैसी बड़ी तकनीकी कंपनियों ने दस्तावेज़ीकरण और ओपन सोर्स कोड बेस तैयार करना शुरू कर दिया है ताकि दूसरों को मशीन-लर्निंग मॉडल की मजबूती का ठोस आकलन करने और प्रतिकूल हमलों के जोखिम को कम करने की अनुमति मिल सके।
व्यापक निहितार्थ
डेटा पॉइज़निंग का अध्ययन मशीन-लर्निंग पाइपलाइन में मौलिक कमजोरियों को उजागर करता है। जैसे-जैसे कृत्रिम-बुद्धिमत्ता प्रणालियां स्वायत्त ड्राइविंग, स्वास्थ्य देखभाल, और सुरक्षा जैसे महत्वपूर्ण क्षेत्रों में तेजी से तैनात की जा रही हैं, प्रशिक्षण डेटा की अखंडता सर्वोपरि हो जाती है। जनरेटिव-एआई और बड़े-भाषा-मॉडल प्रणालियों का उदय, जो अक्सर इंटरनेट से स्क्रैप किए गए विशाल डेटासेट पर प्रशिक्षित होते हैं, हमले की सतह को काफी बढ़ा देता है। पॉइज़निंग हमले इन मॉडलों की प्राथमिकताओं या सुरक्षा संरेखण को लक्षित कर सकते हैं, संभावित रूप से उन्हें हानिकारक या पक्षपाती आउटपुट उत्पन्न करने का कारण बन सकते हैं।
शोधकर्ता हमले और बचाव दोनों पद्धतियों का पता लगाना जारी रखते हैं, जिसमें प्रतिकूल परिस्थितियों और रक्षकों के बीच एक चल रही हथियारों की दौड़ होती है। यह क्षेत्र गहरे-सीखने, तंत्रिका-नेटवर्क सिद्धांत, और अनुकूलन से अंतर्दृष्टि प्राप्त करता है। वर्तमान मॉडलों की सीमाओं को समझना, विशेष रूप से वितरणीय बदलावों और प्रतिकूल परेशानियों के प्रति उनकी संवेदनशीलता, अधिक मजबूत और भरोसेमंद AI प्रणालियों के निर्माण के लिए आवश्यक है।
भविष्य की दिशाएँ
डेटा पॉइज़निंग में भविष्य के शोध में सिद्ध बचाव विकसित करने, पॉइज़निंग प्रतिरोध की सैद्धांतिक सीमाओं को समझने, और मजबूती का मूल्यांकन करने के लिए मानकीकृत बेंचमार्क बनाने पर ध्यान केंद्रित करने की संभावना है। फ्रॉस्ट द्वारा सुझाए गए मानवीय धारणा अनुसंधान का एकीकरण, ऐसी वास्तुकलाओं को जन्म दे सकता है जो स्वाभाविक रूप से प्रतिकूल हेरफेर के प्रति अधिक प्रतिरोधी हों। इसके अतिरिक्त, जैसे-जैसे डेटा गोपनीयता और सहमति के आसपास के नियम विकसित होते हैं, नाइटशेड जैसे उपकरणों द्वारा उदाहरणित विरोध या सुरक्षा के रूप में डेटा पॉइज़निंग के नैतिक निहितार्थों पर बहस जारी रहेगी।