प्रतिकूल स्टाइलोमेट्री (Adversarial stylometry) लेखन शैली को बदलने की प्रथा है ताकि स्टाइलोमेट्री द्वारा लेखक की पहचान या उनकी विशेषताओं का पता लगाने की संभावना को कम किया जा सके। इस कार्य को लेखकत्व अस्पष्टीकरण (authorship obfuscation) या लेखकत्व अनामीकरण (authorship anonymisation) के रूप में भी जाना जाता है। स्टाइलोमेट्री गुमनाम लेखकों को उजागर करने या छद्म नामों को लेखक की अन्य पहचानों से जोड़ने की अपनी क्षमता में एक महत्वपूर्ण गोपनीयता चुनौती पेश करती है, जो, उदाहरण के लिए, भ्रष्टाचार उजागर करने वालों (whistleblowers), कार्यकर्ताओं, और धोखेबाजों तथा जालसाजों के लिए कठिनाइयाँ पैदा करती है। मशीन लर्निंग तकनीकों और पाठ-संग्रह (text corpora) के विकास के साथ गोपनीयता जोखिम बढ़ने की उम्मीद है।
सभी प्रतिकूल स्टाइलोमेट्री में मूल विचार स्रोत पाठ का विश्वसनीय रूप से पुनर्कथन (paraphrasing) करना है ताकि अर्थ अपरिवर्तित रहे लेकिन शैलीगत संकेत अस्पष्ट हो जाएँ। ऐसा विश्वसनीय पुनर्कथन एक स्टाइलोमेट्रिक क्लासिफायर के लिए एक प्रतिकूल उदाहरण (adversarial example) है। इसके लिए कई व्यापक दृष्टिकोण मौजूद हैं, जिनमें कुछ अतिव्यापन है: अनुकरण (imitation), लेखक की अपनी शैली को किसी अन्य की शैली से बदलना; अनुवाद (translation), मशीन अनुवाद लागू करना इस उम्मीद के साथ कि यह स्रोत पाठ में विशिष्ट शैली को समाप्त कर देगा; और अस्पष्टीकरण (obfuscation), किसी पाठ की शैली को जानबूझकर संशोधित करना ताकि वह लेखक की अपनी शैली से मिलता-जुलता न हो।
शैली को मैन्युअल रूप से अस्पष्ट करना संभव है, लेकिन श्रमसाध्य है; कुछ परिस्थितियों में, यह बेहतर या आवश्यक है। स्वचालित उपकरण, या तो अर्ध- या पूर्णतः स्वचालित, किसी लेखक की सहायता कर सकते हैं। इस कार्य को सर्वोत्तम तरीके से कैसे करना है और ऐसे उपकरणों का डिज़ाइन एक खुला शोध प्रश्न है। जबकि कुछ दृष्टिकोण विशेष स्टाइलोमेट्रिक विश्लेषणों को हराने में सक्षम साबित हुए हैं, विशेष रूप से वे जो प्रतिकूलता की संभावना को ध्यान में नहीं रखते हैं, अज्ञात विश्लेषणों के सामने सुरक्षा स्थापित करना एक मुद्दा है। पुनर्कथन की विश्वसनीयता सुनिश्चित करना स्वचालित उपकरणों के लिए एक महत्वपूर्ण चुनौती है।
यह अनिश्चित है कि प्रतिकूल स्टाइलोमेट्री की प्रथा स्वयं में पता लगाने योग्य है या नहीं। कुछ अध्ययनों ने पाया है कि विशेष विधियों ने आउटपुट पाठ में संकेत उत्पन्न किए, लेकिन एक स्टाइलोमेट्रिस्ट जो अनिश्चित है कि किन विधियों का उपयोग किया गया हो सकता है, वह उन्हें विश्वसनीय रूप से पहचानने में सक्षम नहीं हो सकता है।
इतिहास
राव और रोहतगी (2000), प्रतिकूल स्टाइलोमेट्री में एक प्रारंभिक कार्य, ने मशीन अनुवाद को एक संभावना के रूप में पहचाना, लेकिन नोट किया कि उस समय उपलब्ध अनुवादकों की गुणवत्ता गंभीर चुनौतियाँ पेश करती थी। कैकमार्सिक और गैमन (2006) एक और प्रारंभिक कार्य है। ब्रेनन, अफरोज़ और ग्रीनस्टेड (2012) ने वास्तविक पाठों पर प्रतिकूल स्टाइलोमेट्रिक विधियों का पहला मूल्यांकन किया।
ब्रेनन और ग्रीनस्टेड (2009) ने स्टाइलोमेट्रिक विधियों के मूल्यांकन के लिए विशेष रूप से प्रतिकूल रूप से लिखे गए पाठों का पहला संग्रह (corpus) पेश किया; अन्य संग्रहों में अंतर्राष्ट्रीय अनुकरण हेमिंग्वे प्रतियोगिता, नकली फॉकनर प्रतियोगिता, और धोखा ब्लॉग 'अ गर्ल इन डैमस्कस' शामिल हैं।
प्रेरणाएँ
राव और रोहतगी (2000) सुझाव देते हैं कि छोटे, बिना श्रेय वाले दस्तावेज़ (यानी, अनाम पोस्ट) स्टाइलोमेट्रिक पहचान के जोखिम में नहीं हैं, लेकिन छद्म नाम वाले लेखक जिन्होंने हजारों शब्दों के संग्रह बनाने में प्रतिकूल स्टाइलोमेट्री का अभ्यास नहीं किया है, वे कमजोर हो सकते हैं। नारायणन एट अल. (2012) ने 100,000 ब्लॉग लेखकों के बड़े पैमाने पर डी-अनामीकरण का प्रयास किया जिसके मिश्रित परिणाम रहे: पहचानें संयोग से काफी बेहतर थीं, लेकिन केवल पाँचवें समय में ब्लॉग और लेखक का सटीक मिलान किया; संग्रह में लेखक द्वारा लिखे गए पोस्ट की संख्या के साथ पहचान में सुधार हुआ। भले ही किसी लेखक की पहचान न हो, फिर भी उनकी कुछ विशेषताओं का स्टाइलोमेट्रिक रूप से अनुमान लगाया जा सकता है, या स्टाइलोमेट्री संभावित लेखकों के अनाम सेट को पर्याप्त रूप से संकीर्ण कर सकती है ताकि अन्य जानकारी पहचान को पूरा कर सके। लेखक की विशेषताओं (जैसे, लिंग या आयु) का पता लगाना अक्सर बड़े, संभवतः खुले, उम्मीदवारों के सेट से लेखक की पहचान करने की तुलना में सरल होता है।
आधुनिक मशीन लर्निंग तकनीकें पहचान के लिए शक्तिशाली उपकरण प्रदान करती हैं; संग्रहों और कम्प्यूटेशनल स्टाइलोमेट्रिक तकनीकों का आगे विकास गोपनीयता के और मुद्दे उठाने की संभावना है। ग्रोनडाहल और असोकन (2020ए) कहते हैं कि स्टाइलोमेट्री के अंतर्निहित परिकल्पना की सामान्य वैधता - कि लेखकों के पास अपरिवर्तनीय, सामग्री-स्वतंत्र 'शैली फिंगरप्रिंट' होते हैं - अनिश्चित है, लेकिन "डी-अनामीकरण हमला एक वास्तविक गोपनीयता चिंता है"।
प्रतिकूल स्टाइलोमेट्री और शैलीगत धोखे का अभ्यास करने में रुचि रखने वालों में प्रतिशोध से बचने वाले भ्रष्टाचार उजागर करने वाले; पत्रकार और कार्यकर्ता; धोखाधड़ी और झांसे के अपराधी; नकली समीक्षाओं के लेखक; साहित्यिक जालसाज; जांचकर्ताओं से अपनी पहचान छिपाने वाले अपराधी; और, सामान्य तौर पर, गुमनामी या छद्म नाम की इच्छा रखने वाला कोई भी व्यक्ति शामिल हैं। लेखक, या लेखकों की ओर से कार्य करने वाले एजेंट, लेखक की विशेषताओं (जैसे, जाति या लिंग) के शैलीगत सुरागों को हटाने का प्रयास भी कर सकते हैं ताकि उन विशेषताओं के ज्ञान का उपयोग भेदभाव के लिए नहीं किया जा सके (जैसे, एल्गोरिथमिक पूर्वाग्रह के माध्यम से)। प्रतिकूल स्टाइलोमेट्री का एक और संभावित उपयोग स्वचालित रूप से उत्पन्न पाठ को मानव-लेखित के रूप में छिपाना है।
विधियाँ
अनुकरण के साथ, लेखक अपनी शैली को किसी अन्य लेखक की शैली से मिलाकर स्टाइलोमेट्री को गुमराह करने का प्रयास करता है। एक अधूरा अनुकरण, जहाँ सच्चे लेखक की कुछ अद्वितीय विशेषताएँ अनुकरण किए गए लेखक की विशेषताओं के साथ दिखाई देती हैं, प्रतिकूल स्टाइलोमेट्री के उपयोग के लिए एक पता लगाने योग्य संकेत हो सकता है। अनुकरण शैली-स्थानांतरण (style transfer) प्रणालियों के साथ स्वचालित रूप से किया जा सकता है, हालाँकि इसके लिए आमतौर पर सिस्टम को सीखने के लिए लक्ष्य शैली में एक बड़े संग्रह की आवश्यकता होती है।
एक अन्य दृष्टिकोण अनुवाद है, जो विशिष्ट शैली को समाप्त करने के लिए स्रोत पाठ के मशीन अनुवाद का उपयोग करता है, अक्सर एक राउंड-ट्रिप अनुवाद उत्पन्न करने के लिए क्रम में कई अनुवादकों के माध्यम से। ऐसा श्रृंखलित अनुवाद पाठों को काफी हद तक बदल सकता है, यहाँ तक कि समझ से बाहर होने की स्थिति तक; बेहतर अनुवाद उपकरण इस जोखिम को कम करते हैं। अधिक सरल रूप से संरचित पाठ मूल अर्थ खोए बिना मशीन अनुवाद करना आसान हो सकता है। मशीन अनुवाद स्वचालित शैली-स्थानांतरण के माध्यम से प्राप्त प्रत्यक्ष शैलीगत अनुकरण या अस्पष्टीकरण में विलीन हो जाता है, जिसे इनपुट और आउटपुट के रूप में एक ही भाषा के साथ एक "अनुवाद" के रूप में देखा जा सकता है। कम गुणवत्ता वाले अनुवाद उपकरणों के साथ, एक लेखक को शैलीगत विशेषताओं को फिर से पेश करने के खतरे से बचते हुए प्रमुख अनुवाद त्रुटियों को मैन्युअल रूप से ठीक करने की आवश्यकता हो सकती है। वांग, जुओला और रिडेल (2022) ने पाया कि गूगल ट्रांसलेट द्वारा पेश की गई गंभीर त्रुटियाँ दुर्लभ थीं, लेकिन कई मध्यवर्ती अनुवादों के साथ अधिक सामान्य थीं - हालाँकि, स्रोत पाठ में कभी-कभी सरल या छोटे वाक्य और वर्तनी की गलतियाँ आउटपुट में शब्दशः दिखाई दीं, जो संभावित रूप से एक पहचान संकेत प्रदान करती हैं। श्रृंखला अनुवाद एक दस्तावेज़ में इसके अनुप्रयोग के विशिष्ट निशान छोड़ सकता है, जो उपयोग की गई मध्यवर्ती भाषाओं और किए गए अनुवाद चरणों की संख्या के पुनर्निर्माण की अनुमति दे सकता है।
अस्पष्टीकरण में किसी पाठ की शैली को जानबूझकर बदलना शामिल है ताकि किसी मीट्रिक द्वारा अन्य पाठों से इसकी समानता कम हो सके; यह लेखन के समय सचेत संशोधन द्वारा किया जा सकता है, या लक्षित मीट्रिक से फीडबैक के साथ संशोधन प्रक्रिया के भाग के रूप में यह निर्धारित करने के लिए कि पाठ पर्याप्त रूप से अस्पष्ट किया गया है या नहीं।
स्वचालित उपकरण और अनुसंधान
प्रतिकूल स्टाइलोमेट्री के लिए अर्ध-स्वचालित और पूर्णतः स्वचालित उपकरण अनुसंधान का एक सक्रिय क्षेत्र हैं। ऐसे उपकरणों के डिज़ाइन को शैली को अस्पष्ट करने की आवश्यकता को अर्थ को संरक्षित करने की आवश्यकता के साथ संतुलित करना चाहिए। कुछ दृष्टिकोण विशेष स्टाइलोमेट्रिक विश्लेषणों को हराने के लिए दिखाए गए हैं, विशेष रूप से वे जो प्रतिकूलता की संभावना को ध्यान में नहीं रखते हैं। हालाँकि, अज्ञात भविष्य के विश्लेषणों के खिलाफ सुरक्षा स्थापित करना एक चुनौती बनी हुई है। पुनर्कथन की विश्वसनीयता एक महत्वपूर्ण मुद्दा है; स्वचालित प्रणालियाँ ऐसे पाठ उत्पन्न कर सकती हैं जो व्याकरणिक रूप से सही हैं लेकिन मूल अर्थ को सूक्ष्म रूप से बदल देते हैं।
Large language model और Generative AI में हालिया प्रगति ने शैली-स्थानांतरण और पुनर्कथन पीढ़ी के लिए नई संभावनाएँ खोली हैं। इन मॉडलों का उपयोग सामग्री को बनाए रखते हुए पाठ को एक अलग शैली में फिर से लिखने के लिए किया जा सकता है, लेकिन वे पता लगाने योग्य कलाकृतियों के जोखिम भी पेश करते हैं। अनुसंधान जारी है कि ऐसी प्रणालियों को अधिक मजबूत और कम पता लगाने योग्य कैसे बनाया जाए।
पता लगाना और प्रतिवाद
यह पता लगाना कि क्या किसी पाठ को प्रतिकूल रूप से शैलीबद्ध किया गया है, स्वयं एक कठिन समस्या है। कुछ अध्ययनों ने विशेष विधियों द्वारा छोड़े गए संकेतों की पहचान की है, जैसे अनुवाद त्रुटियों या असामान्य शब्द विकल्पों की उपस्थिति। हालाँकि, यदि स्टाइलोमेट्रिस्ट को नहीं पता कि किस विधि का उपयोग किया गया था, तो विश्वसनीय पता लगाना असंभव हो सकता है। यह उन लोगों के बीच एक हथियारों की दौड़ बनाता है जो पाठ को अनाम करना चाहते हैं और उन लोगों के बीच जो लेखकों को उजागर करना चाहते हैं।
नैतिक और कानूनी विचार
प्रतिकूल स्टाइलोमेट्री का उपयोग नैतिक प्रश्न उठाता है। जबकि यह गोपनीयता की रक्षा कर सकता है और स्वतंत्र भाषण को सक्षम कर सकता है, इसका उपयोग दुर्भावनापूर्ण उद्देश्यों के लिए भी किया जा सकता है, जैसे धोखाधड़ी या गलत सूचना फैलाना। कानूनी ढाँचे क्षेत्राधिकार के अनुसार भिन्न होते हैं, और यह प्रथा कुछ संदर्भों में विनियमित हो सकती है। कई गोपनीयता-बढ़ाने वाली तकनीकों के साथ, प्रतिकूल स्टाइलोमेट्री की दोहरे-उपयोग प्रकृति इसे चल रही बहस का विषय बनाती है।
यह भी देखें
संदर्भ
- ब्रेनन, एम., और ग्रीनस्टेड, आर. (2009). लेखकत्व पहचान तकनीकों के खिलाफ व्यावहारिक हमले।
- ब्रेनन, एम., अफरोज़, एस., और ग्रीनस्टेड, आर. (2012). प्रतिकूल स्टाइलोमेट्री: गोपनीयता और गुमनामी को संरक्षित करने के लिए लेखकत्व पहचान को दरकिनार करना।
- ग्रोनडाहल, टी., और असोकन, एन. (2020). प्रतिकूल सेटिंग्स में पाठ विश्लेषण।
- कैकमार्सिक, जी., और गैमन, एम. (2006). लेखक की गुमनामी को संरक्षित करने के लिए दस्तावेज़ स्टाइलोमेट्री को अस्पष्ट करना।
- नारायणन, ए., एट अल. (2012). इंटरनेट-पैमाने पर लेखक पहचान की व्यवहार्यता पर।
- राव, जे. आर., और रोहतगी, पी. (2000). क्या छद्म नाम वास्तव में गोपनीयता की गारंटी दे सकते हैं?
- वांग, वाई., जुओला, पी., और रिडेल, ए. (2022). लेखकत्व अस्पष्टीकरण के साधन के रूप में अनुवाद।