अंग्रेज़ी से अनुवादित

मॉडल स्टीलिंग एक हमला है जिसमें एक प्रतिद्वंद्वी बार-बार क्वेरी करके मशीन लर्निंग मॉडल के पैरामीटर या कार्यक्षमता को निकाल लेता है, जिससे मालिकाना प्रशिक्षण डेटा या आर्किटेक्चर तक पहुंच के बिना प्रतिकृति बनाना संभव हो जाता है।

मॉडल स्टीलिंग तैनात मशीन लर्निंग सिस्टम के विरुद्ध हमलों का एक वर्ग है, जिसमें एक प्रतिद्वंद्वी सावधानीपूर्वक तैयार किए गए क्वेरी सबमिट करके और आउटपुट का अवलोकन करके एक मालिकाना मॉडल के आंतरिक पैरामीटर, आर्किटेक्चर, या कार्यात्मक व्यवहार को पुनर्प्राप्त करने का प्रयास करता है। लक्ष्य एक विकल्प मॉडल बनाना है जो मूल की बारीकी से नकल करता है, जिससे मॉडल के मालिक की बौद्धिक संपदा सुरक्षा और कम्प्यूटेशनल निवेश को दरकिनार किया जा सके। यह खतरा वाणिज्यिक Artificial intelligence सेवाओं, विशेष रूप से OpenAI, Anthropic, और Google DeepMind जैसी कंपनियों द्वारा पेश किए गए Large language model API के प्रसार के साथ महत्वपूर्ण रूप से बढ़ गया है, जहां पहुंच भुगतान किए गए इंटरफेस के पीछे गेटेड है लेकिन अंतर्निहित वज़न गुप्त रहते हैं।

यह हमला इस तथ्य का फायदा उठाता है कि एक मॉडल का इनपुट-आउटपुट व्यवहार इसकी आंतरिक निर्णय सीमाओं के बारे में जानकारी का एक समृद्ध स्रोत है। पर्याप्त संख्या में लेबल किए गए उदाहरण एकत्र करके - जहां लेबल मॉडल की भविष्यवाणियां हैं - एक हमलावर एक सरोगेट मॉडल को प्रशिक्षित कर सकता है जो उच्च निष्ठा के साथ मूल का अनुमान लगाता है। इस दृष्टिकोण की व्यवहार्यता मॉडल की जटिलता, उपलब्ध क्वेरी बजट, और API द्वारा उजागर आउटपुट विवरण की डिग्री पर निर्भर करती है। प्रारंभिक प्रदर्शन सरल क्लासिफायर पर केंद्रित थे, लेकिन तकनीक को गहरे तंत्रिका नेटवर्क और जनरेटिव मॉडल तक बढ़ा दिया गया है, जिससे पर्याप्त सुरक्षा उपायों के बिना मॉडल एक्सेस बेचने की आर्थिक व्यवहार्यता के बारे में चिंताएं बढ़ गई हैं।

ऐतिहासिक संदर्भ

मॉडल स्टीलिंग की अवधारणा 2010 के दशक के मध्य में मशीन लर्निंग के एक सेवा के रूप में व्यावसायीकरण के साथ उभरी। 2016 में, University of Toronto और cornell-university के शोधकर्ताओं ने मौलिक कार्य प्रकाशित किया जिसमें दिखाया गया कि लॉजिस्टिक रिग्रेशन और डिसीजन ट्री मॉडल को केवल भविष्यवाणी क्वेरी का उपयोग करके उच्च सटीकता के साथ निकाला जा सकता है। फ्लोरियन ट्रैमर और सहयोगियों के नेतृत्व में यह कार्य, प्रदर्शित करता है कि छिपे हुए आर्किटेक्चर वाले मॉडल भी सावधानीपूर्वक क्वेरी चयन के माध्यम से रिवर्स-इंजीनियर किए जा सकते हैं। हमले को बौद्धिक संपदा खतरे के रूप में तैयार किया गया था, जो सॉफ्टवेयर पायरेसी के अनुरूप था लेकिन सीखी गई प्रणालियों पर लागू होता था।

बाद के शोध ने दायरे का विस्तार किया। 2017 में, Carnegie Mellon University की एक टीम ने दिखाया कि छवि डेटासेट पर प्रशिक्षित तंत्रिका नेटवर्क क्लासिफायर को दसियों हजारों की क्वेरी बजट के साथ चुराया जा सकता है। 2019 तक, अध्ययनों ने तकनीक को Transformer (architecture)-आधारित भाषा मॉडल तक बढ़ा दिया था, जहां उच्च-आयामी आउटपुट स्पेस ने निष्कर्षण को अधिक चुनौतीपूर्ण बना दिया लेकिन फिर भी संभव बना दिया। 2020 के दशक की शुरुआत में API-आधारित Generative AI सेवाओं के उदय ने रुचि तेज कर दी, क्योंकि ये मॉडल प्रशिक्षण लागत में अरबों डॉलर का प्रतिनिधित्व करते हैं और लाखों उपयोगकर्ताओं द्वारा दूरस्थ रूप से एक्सेस किए जाते हैं।

हमले के वेक्टर

मॉडल स्टीलिंग हमले कई अलग-अलग वेक्टरों के माध्यम से काम करते हैं, प्रत्येक मॉडल के इंटरफेस के विभिन्न पहलुओं का शोषण करता है। सबसे सीधा दृष्टिकोण कार्यात्मक निष्कर्षण है, जहां हमलावर विविध इनपुट के सेट के साथ मॉडल को क्वेरी करता है और आउटपुट रिकॉर्ड करता है, फिर इस डेटासेट पर एक सरोगेट मॉडल को प्रशिक्षित करता है। इस विधि की सफलता क्वेरी सेट की विविधता और कवरेज पर निर्भर करती है; यदि हमलावर इनपुट स्पेस को पर्याप्त रूप से नमूना कर सकता है, तो सरोगेट मूल की निर्णय सीमाओं का अनुमान लगा सकता है।

दूसरा वेक्टर पैरामीटर निष्कर्षण है, जिसका उद्देश्य मॉडल के वज़न के सटीक संख्यात्मक मानों को पुनर्प्राप्त करना है। यह कार्यात्मक निष्कर्षण की तुलना में काफी कठिन है और आमतौर पर अतिरिक्त जानकारी की आवश्यकता होती है, जैसे मॉडल का आर्किटेक्चर और सक्रियण फ़ंक्शन। कुछ मामलों में, साइड-चैनल हमलों - समय या मेमोरी उपयोग पैटर्न का शोषण - का उपयोग आर्किटेक्चरल विवरणों का अनुमान लगाने के लिए किया गया है। उदाहरण के लिए, एक 2020 अध्ययन ने प्रदर्शित किया कि API प्रतिक्रियाओं की विलंबता से एक तंत्रिका नेटवर्क की गहराई और चौड़ाई का अनुमान लगाया जा सकता है, जिससे अधिक लक्षित पैरामीटर पुनर्प्राप्ति संभव हो जाती है।

तीसरा वेक्टर कई API द्वारा लौटाए गए कॉन्फिडेंस स्कोर का शोषण करता है। जब एक मॉडल कक्षाओं पर एक संभाव्यता वितरण आउटपुट करता है, तो हमलावर को एक ही हार्ड लेबल की तुलना में अधिक समृद्ध जानकारी मिलती है। यह अधिक कुशल निष्कर्षण की अनुमति देता है, क्योंकि सरोगेट को सॉफ्ट लेबल का उपयोग करके प्रशिक्षित किया जा सकता है जो मॉडल की आंतरिक निश्चितता को एन्कोड करते हैं। कुछ API ने केवल शीर्ष-k भविष्यवाणियां लौटाकर या आउटपुट में शोर जोड़कर इसे कम किया है, लेकिन ये सुरक्षा उपाय हमेशा प्रभावी नहीं होते हैं।

गणितीय आधार

मॉडल स्टीलिंग का सैद्धांतिक आधार सक्रिय शिक्षण और क्वेरी जटिलता की अवधारणा में निहित है। एक हमलावर दी गई निष्ठा स्तर प्राप्त करने के लिए आवश्यक क्वेरी की संख्या को कम करना चाहता है। रैखिक मॉडल के लिए, क्वेरी जटिलता पैरामीटर की संख्या के आनुपातिक है, क्योंकि प्रत्येक क्वेरी वज़न वेक्टर पर एक रैखिक बाधा प्रदान करती है। गहरे नेटवर्क के लिए, संबंध अधिक जटिल है, लेकिन शोधकर्ताओं ने दिखाया है कि कार्यात्मक निष्कर्षण की नमूना जटिलता मॉडल के VC आयाम या Rademacher जटिलता के साथ स्केल करती है।

2016 के कार्य से एक प्रमुख परिणाम यह है कि समीकरण-समाधान हमले टुकड़े-टुकड़े रैखिक सक्रियण फ़ंक्शन वाले मॉडल के लिए सटीक पैरामीटर पुनर्प्राप्त कर सकते हैं, जैसे ReLU इकाइयों वाले Neural network। निर्णय सीमाओं पर स्थित इनपुट तैयार करके, हमलावर रैखिक समीकरण प्राप्त कर सकता है जो वज़न को बाधित करते हैं। इस दृष्टिकोण के लिए इनपुट पर सटीक नियंत्रण और निरंतर आउटपुट तक पहुंच की आवश्यकता होती है, जो अक्सर वाणिज्यिक API में उपलब्ध नहीं होती है जो भविष्यवाणियों को असतत करते हैं।

अधिक हालिया सैद्धांतिक कार्य ने निष्कर्षण की सूचना-सैद्धांतिक सीमाओं की जांच की है। N पैरामीटर वाले मॉडल के लिए, एक हमलावर को फ़ंक्शन को बिल्कुल पुनर्प्राप्त करने के लिए कम से कम O(N) क्वेरी की आवश्यकता होती है, लेकिन कार्यात्मक अनुमान के लिए बहुत कम की आवश्यकता हो सकती है। यह विषमता - जहां एक सरोगेट प्रशिक्षण वितरण पर उच्च सटीकता प्राप्त कर सकता है बिना वितरण से बाहर के इनपुट पर मूल के व्यवहार से मेल खाए - रक्षकों के लिए एक केंद्रीय चुनौती है।

रक्षात्मक रणनीतियाँ

रक्षकों ने कई प्रकार के प्रतिवाद विकसित किए हैं, जिन्हें मोटे तौर पर पहचान, दर सीमा, और आउटपुट गड़बड़ी में वर्गीकृत किया गया है। पहचान विधियों का उद्देश्य दुर्भावनापूर्ण क्वेरी पैटर्न की पहचान करना है, जैसे एक ही IP पते से बार-बार क्वेरी या निर्णय सीमाओं की जांच करने वाली क्वेरी। दर सीमा एक समय विंडो के भीतर एक उपयोगकर्ता द्वारा की जा सकने वाली क्वेरी की संख्या को प्रतिबंधित करती है, जिससे निष्कर्षण की लागत बढ़ जाती है। आउटपुट गड़बड़ी भविष्यवाणियों में शोर जोड़ती है, सरोगेट की गुणवत्ता को कम करती है लेकिन वैध उपयोगकर्ताओं के लिए उपयोगिता भी कम करती है।

एक अधिक परिष्कृत रक्षा वॉटरमार्किंग है, जहां मॉडल को अपने आउटपुट में एक छिपा हुआ पैटर्न एम्बेड करने के लिए प्रशिक्षित किया जाता है जिसका उपयोग स्वामित्व साबित करने के लिए किया जा सकता है। यदि कोई हमलावर मॉडल चुराता है और उसे तैनात करता है, तो वॉटरमार्क को सरोगेट के व्यवहार में पहचाना जा सकता है। यह दृष्टिकोण Deep learning मॉडल के लिए खोजा गया है, लेकिन यह अचूक नहीं है, क्योंकि हमलावर फाइन-ट्यूनिंग या डिस्टिलेशन के माध्यम से वॉटरमार्क को हटाने का प्रयास कर सकते हैं।

रक्षा की एक और पंक्ति में विभेदक गोपनीयता शामिल है, जो मॉडल के आउटपुट पर किसी एकल क्वेरी के प्रभाव को सीमित करती है। भविष्यवाणियों में कैलिब्रेटेड शोर जोड़कर, मॉडल मालिक गारंटी दे सकता है कि एक हमलावर प्रशिक्षण डेटा या पैरामीटर के बारे में सटीक जानकारी नहीं निकाल सकता है। हालांकि, यह कम सटीकता की कीमत पर आता है, जिससे यह उच्च-दांव वाले अनुप्रयोगों के लिए कम आकर्षक हो जाता है।

केस स्टडीज और वास्तविक दुनिया की घटनाएं

कई हाई-प्रोफाइल घटनाओं ने मॉडल स्टीलिंग के व्यावहारिक खतरे को उजागर किया है। 2021 में, BAIR (Berkeley AI Research) के शोधकर्ताओं ने प्रदर्शित किया कि वे केवल 10,000 क्वेरी का उपयोग करके एक वाणिज्यिक छवि क्लासिफायर की कार्यात्मक प्रतिलिपि निकाल सकते हैं, एक परीक्षण सेट पर 98% सहमति प्राप्त कर सकते हैं। हमले ने Amazon Web Services पर होस्ट किए गए एक मॉडल को लक्षित किया और आर्किटेक्चर के पूर्व ज्ञान की आवश्यकता नहीं थी।

भाषा डोमेन में, एक 2023 अध्ययन ने दिखाया कि एक Large language model को केवल API आउटपुट का उपयोग करके, सामान्य बेंचमार्क पर तुलनीय प्रदर्शन के साथ एक छोटे सरोगेट में डिस्टिल किया जा सकता है। इसने मालिकाना मॉडल तक पहुंच बेचने के आर्थिक मॉडल के बारे में चिंताएं बढ़ाईं, क्योंकि प्रतियोगी प्रशिक्षण लागत के एक अंश पर कार्यक्षमता को दोहरा सकते हैं। अध्ययन ने नोट किया कि सरोगेट ने दुर्लभ या प्रतिकूल इनपुट पर खराब प्रदर्शन किया, लेकिन यह हमले को रोकने के लिए पर्याप्त नहीं था।

एक उल्लेखनीय कानूनी मामले में एक स्टार्टअप शामिल था जिस पर एक प्रतियोगी के अनुशंसा एल्गोरिदम को दोहराने के लिए मॉडल स्टीलिंग का उपयोग करने का आरोप लगाया गया था। मामला अदालत के बाहर सुलझाया गया था, लेकिन इसने मॉडल बौद्धिक संपदा के आसपास स्पष्ट कानूनी ढांचे की आवश्यकता को रेखांकित किया। 2024 तक, किसी भी प्रमुख क्षेत्राधिकार ने मॉडल चोरी के लिए विशिष्ट क़ानून स्थापित नहीं किए हैं, जिससे कंपनियों को व्यापार रहस्य सुरक्षा और सेवा की शर्तों के समझौतों पर निर्भर रहना पड़ता है।

नैतिक और कानूनी निहितार्थ

मॉडल स्टीलिंग की नैतिकता विवादित है। समर्थकों का तर्क है कि सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित मॉडल विशेष स्वामित्व के अधीन नहीं होने चाहिए, और निष्कर्षण अनुसंधान और प्रतिस्पर्धा को सक्षम बनाता है। आलोचकों का प्रतिवाद है कि प्रशिक्षण के लिए आवश्यक विशाल कम्प्यूटेशनल संसाधन - जिसमें अक्सर AWS Trainium या Google Cloud जैसे विशेष हार्डवेयर पर हजारों GPU (in AI)-घंटे शामिल होते हैं - एक महत्वपूर्ण निवेश का गठन करते हैं जो सुरक्षा के योग्य है।

कानूनी दृष्टिकोण से, मॉडल स्टीलिंग व्यापार रहस्य कानून, कॉपीराइट और अनुबंध कानून के साथ प्रतिच्छेद करती है। संयुक्त राज्य अमेरिका में, डिफेंड ट्रेड सीक्रेट्स एक्ट 2016 दुरुपयोग के लिए एक संघीय कार्रवाई का कारण प्रदान करता है, लेकिन इसे मशीन लर्निंग मॉडल पर लागू करना यह साबित करने की कठिनाई से जटिल है कि विशिष्ट पैरामीटर एक व्यापार रहस्य का गठन करते हैं। कुछ कंपनियों ने मॉडल आर्किटेक्चर का पेटेंट कराने का सहारा लिया है, लेकिन यह सार्वभौमिक रूप से लागू नहीं है और महंगा हो सकता है।

बहस ओपन-सोर्स आंदोलन से और जटिल है, जो AI विकास में पारदर्शिता की वकालत करता है। कई शोधकर्ताओं का तर्क है कि मॉडल वज़न को सार्वजनिक रूप से जारी किया जाना चाहिए ताकि जांच और प्रतिलिपि प्रस्तुत करने योग्यता सक्षम हो सके, जो चोरी को अप्रासंगिक बना देगा। हालांकि, वाणिज्यिक दबाव और दुरुपयोग के बारे में चिंताओं ने बंद मॉडल की प्रवृत्ति को जन्म दिया है, विशेष रूप से बड़ी तकनीकी फर्मों के बीच।

भविष्य की दिशाएं

जैसे-जैसे मॉडल बड़े और अधिक सक्षम होते जाते हैं, मॉडल स्टीलिंग का खतरा विकसित होने की संभावना है। एक उभरता हुआ क्षेत्र जनरेटिव मॉडल निष्कर्षण है, जहां हमलावर Stable Diffusion या GPT-4 जैसे मॉडल के आउटपुट वितरण को दोहराने का लक्ष्य रखते हैं। यह अधिक चुनौतीपूर्ण है क्योंकि आउटपुट स्पेस उच्च-आयामी और निरंतर है, लेकिन हाल के कार्य ने दिखाया है कि डिस्टिलेशन तकनीक समान नमूने उत्पन्न करने वाले सरोगेट उत्पन्न कर सकती है।

एक और दिशा प्रतिकूल क्वेरी जनरेशन है, जहां हमलावर प्रति क्वेरी प्राप्त जानकारी को अधिकतम करने वाले इनपुट खोजने के लिए अनुकूलन का उपयोग करते हैं। यह निष्कर्षण के लिए आवश्यक क्वेरी बजट को परिमाण के आदेशों से कम कर सकता है। रक्षक अधिक परिष्कृत विसंगति पहचान और अनुकूली दर सीमा के साथ जवाब दे रहे हैं, लेकिन हथियारों की दौड़ जारी है।

अनुसंधान हार्डवेयर-आधारित सुरक्षा के उपयोग की भी खोज कर रहा है, जैसे कि विश्वसनीय निष्पादन वातावरण जो मॉडल वज़न तक सीधी पहुंच को रोकते हैं। हालांकि, ये दृष्टिकोण अभी तक बड़े पैमाने पर तैनाती के लिए व्यावहारिक नहीं हैं, और वे कार्यात्मक निष्कर्षण को संबोधित नहीं करते हैं, जिसके लिए केवल इनपुट-आउटपुट पहुंच की आवश्यकता होती है। 2025 तक, मॉडल स्टीलिंग एक खुली समस्या बनी हुई है, जिसका क्षितिज पर कोई निश्चित समाधान नहीं है।

यह भी देखें

संदर्भ

Tramèr, F., Zhang, F., Juels, A., Reiter, M. K., & Ristenpart, T. (2016). Stealing machine learning models via prediction APIs. USENIX Security Symposium.

Jagielski, M., Carlini, N., Berthelot, D., Kurakin, A., & Papernot, N. (2020). High accuracy and high fidelity extraction of neural networks. USENIX Security Symposium.

Orekondy, T., Schiele, B., & Fritz, M. (2019). Knockoff nets: Stealing functionality of black-box models. CVPR.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning-security·adversarial-attacks·intellectual-property·ai-safety
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास