AI वॉटरमार्किंग से तात्पर्य किसी AI प्रणाली द्वारा उत्पन्न सामग्री, जैसे पाठ, चित्र, ऑडियो या वीडियो, में एक पता लगाने योग्य संकेत अंतर्निहित करने की तकनीकों से है, ताकि बाद में उस सामग्री को मशीन-जनित के रूप में पहचाना जा सके। किसी छवि पर दिखाई देने वाले वॉटरमार्क के विपरीत, अधिकांश AI वॉटरमार्किंग योजनाएँ मनुष्यों के लिए अदृश्य रहने के लिए डिज़ाइन की जाती हैं, जबकि एक मिलान एल्गोरिदम द्वारा सांख्यिकीय रूप से पता लगाने योग्य होती हैं, और कुछ डिज़ाइनों में, क्रॉपिंग, संपीड़न या पैराफ्रेज़िंग जैसे सामान्य संपादनों के प्रति मजबूत होती हैं।
AI वॉटरमार्किंग में रुचि 2022 से जनरेटिव AI उछाल के साथ तेजी से बढ़ी, जो इंटरनेट पर बाढ़ लाते निम्न-गुणवत्ता वाले सिंथेटिक कंटेंट, चुनाव-संबंधी डीपफेक, और शैक्षणिक तथा पत्रकारिता अखंडता की चिंताओं से प्रेरित थी, और इसे 2023 के व्हाइट हाउस स्वैच्छिक AI प्रतिबद्धताओं और EU AI अधिनियम की सिंथेटिक सामग्री के लिए पारदर्शिता आवश्यकताओं सहित नीति चर्चाओं में संदर्भित किया गया था।
तकनीकें
पाठ के लिए, वॉटरमार्किंग योजनाएँ आमतौर पर बड़े भाषा मॉडल के अगले-टोकन नमूनाकरण को सूक्ष्म रूप से पक्षपाती बनाकर काम करती हैं, उदाहरण के लिए प्रत्येक जनन चरण पर समान रूप से संभावित टोकन के एक छद्म-यादृच्छिक रूप से चयनित उपसमूह को दूसरे पर पसंद करना, एक पैटर्न में जो पाठक के लिए अदृश्य होता है लेकिन जनन के दौरान उपयोग की गई उसी छद्म-यादृच्छिक कुंजी के साथ सांख्यिकीय रूप से पता लगाने योग्य होता है। टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो मॉडल जैसी प्रणालियों द्वारा उत्पन्न चित्रों और वीडियो के लिए, 2023 में लॉन्च किया गया गूगल डीपमाइंड का SynthID, जनन के दौरान या बाद में सीधे पिक्सेल मानों में एक संकेत अंतर्निहित करता है जो रीसाइज़िंग या संपीड़न जैसे सामान्य परिवर्तनों से बच जाता है, बिना छवि को स्पष्ट रूप से बदले। ऑडियो वॉटरमार्किंग इसी तरह सामान्य मानवीय धारणा से बाहर की आवृत्ति श्रेणियों में संकेत अंतर्निहित करती है।
सीमाएँ
वॉटरमार्किंग को महत्वपूर्ण तकनीकी और अपनाने की चुनौतियों का सामना करना पड़ता है। पाठ वॉटरमार्क को अक्सर पैराफ्रेज़िंग, अनुवाद, या किसी अन्य मॉडल से सामग्री को फिर से लिखने के लिए कहकर हटाया जा सकता है, और पता लगाने से मानव-लिखित पाठ पर गलत सकारात्मक परिणाम उत्पन्न हो सकते हैं जो संयोग से सांख्यिकीय पैटर्न से मेल खाता है। वॉटरमार्क केवल तभी उपयोगी होते हैं जब जनन प्रणाली उन्हें लागू करना चुनती है, जिसका अर्थ है कि ओपन-सोर्स या संशोधित मॉडल आसानी से वॉटरमार्किंग चरण को छोड़ सकते हैं, और कोई भी योजना एक दृढ़ प्रतिद्वंद्वी के खिलाफ मजबूती प्रदर्शित नहीं करती है जो विशेष रूप से इसे हटाने का प्रयास करता है। 2025 तक, वॉटरमार्किंग अपनाना प्रदाताओं के बीच असंगत बना रहा, जिसमें गूगल और मेटा सहित कुछ ने अपने स्वयं के छवि और वीडियो जनरेटर के लिए इसे तैनात किया, जबकि उद्योग में व्यापक अंतर-संचालन योग्य मानक अभी भी उभर रहे थे।
संबंधित दृष्टिकोण
AI वॉटरमार्किंग पर अक्सर सामग्री उत्पत्ति मानकों, जैसे C2PA ढांचे, के साथ चर्चा की जाती है और कभी-कभी भ्रमित किया जाता है, जो इसके बजाय किसी छवि के संपादन इतिहास का वर्णन करने वाले क्रिप्टोग्राफिक रूप से हस्ताक्षरित मेटाडेटा संलग्न करता है, एक पूरक बजाय प्रतिस्पर्धी दृष्टिकोण, क्योंकि मेटाडेटा को फ़ाइल को फिर से सहेजकर हटाया जा सकता है, जबकि एक मजबूत पिक्सेल-स्तरीय वॉटरमार्क बच सकता है। जैसे-जैसे मॉडल तेजी से वेब से स्क्रैप किए गए डेटा पर आंशिक रूप से प्रशिक्षित होते हैं, वास्तविक प्रशिक्षण डेटा को सिंथेटिक AI आउटपुट से अलग करना भविष्य के मॉडलों के क्षरण को रोकने के लिए भी महत्वपूर्ण हो गया है, जो गलत सूचना की चिंताओं से परे उत्पत्ति और वॉटरमार्किंग प्रयासों के लिए एक अतिरिक्त प्रेरणा है।