डिफरेंशियल प्राइवेसी (DP) डेटासेट के बारे में सांख्यिकीय जानकारी जारी करने के लिए एक गणितीय रूप से कठोर ढांचा है, जबकि व्यक्तिगत डेटा विषयों की गोपनीयता की रक्षा करता है। यह डेटा धारक को समूह के समग्र पैटर्न साझा करने में सक्षम बनाता है, जबकि उस जानकारी को सीमित करता है जो विशिष्ट व्यक्तियों को अलग करती है। यह सांख्यिकीय गणनाओं में सावधानीपूर्वक कैलिब्रेटेड शोर इंजेक्ट करके किया जाता है, ताकि आँकड़ों की उपयोगिता संरक्षित रहे, जबकि डेटासेट में किसी भी व्यक्ति के बारे में अनुमान लगाने की क्षमता को प्रमाणित रूप से सीमित किया जा सके।
डिफरेंशियल प्राइवेसी का वर्णन करने का एक और तरीका यह है कि इसे सांख्यिकीय डेटाबेस के बारे में समग्र जानकारी प्रकाशित करने के लिए उपयोग किए जाने वाले एल्गोरिदम पर एक बाधा के रूप में देखा जाए, जो डेटाबेस में रिकॉर्ड की निजी जानकारी के प्रकटीकरण को सीमित करता है। उदाहरण के लिए, कुछ सरकारी एजेंसियाँ सर्वेक्षण प्रतिक्रियाओं की गोपनीयता सुनिश्चित करते हुए जनसांख्यिकीय जानकारी या अन्य सांख्यिकीय समुच्चय प्रकाशित करने के लिए डिफरेंशियल प्राइवेट एल्गोरिदम का उपयोग करती हैं, और कंपनियाँ उपयोगकर्ता व्यवहार के बारे में जानकारी एकत्र करने के लिए, जबकि आंतरिक विश्लेषकों को भी दिखाई देने वाली चीज़ों को नियंत्रित करती हैं।
मोटे तौर पर, एक एल्गोरिदम डिफरेंशियल प्राइवेट है यदि उसका आउटपुट देखने वाला पर्यवेक्षक यह नहीं बता सकता कि किसी विशेष व्यक्ति की जानकारी गणना में उपयोग की गई थी या नहीं। डिफरेंशियल प्राइवेसी पर अक्सर उन व्यक्तियों की पहचान के संदर्भ में चर्चा की जाती है जिनकी जानकारी डेटाबेस में हो सकती है। हालाँकि यह सीधे तौर पर पहचान और पुनः-पहचान हमलों को संदर्भित नहीं करता है, डिफरेंशियल प्राइवेट एल्गोरिदम प्रमाणित रूप से ऐसे हमलों का प्रतिरोध करते हैं।
उत्पत्ति और औपचारिकीकरण
डिफरेंशियल प्राइवेसी की अवधारणा 2006 में सिंथिया ड्वोर्क, फ्रैंक मैकशेरी, कोब्बी निसिम और एडम डी. स्मिथ द्वारा उनके पेपर "कैलिब्रेटिंग नॉइज़ टू सेंसिटिविटी इन प्राइवेट डेटा एनालिसिस" में पेश की गई थी। इस कार्य ने सांख्यिकीय डेटाबेस से लिए गए किसी भी डेटा रिलीज़ से जुड़े गोपनीयता नुकसान के लिए एक गणितीय परिभाषा प्रदान की। यहाँ, सांख्यिकीय डेटाबेस शब्द का अर्थ है गोपनीयता के वचन के तहत एकत्र किया गया डेटा का एक सेट, जो आँकड़े उत्पन्न करने के उद्देश्य से होता है, जो अपने उत्पादन से उन व्यक्तियों की गोपनीयता से समझौता नहीं करते जिन्होंने डेटा प्रदान किया।
डिफरेंशियल प्राइवेसी की प्रमुख अंतर्दृष्टि यह है कि जैसे-जैसे कम और कम लोगों के डेटा पर क्वेरी की जाती है, समान मात्रा में गोपनीयता उत्पन्न करने के लिए क्वेरी परिणाम में अधिक शोर जोड़ने की आवश्यकता होती है। यदि किसी डेटाबेस में एक ही व्यक्ति का डेटा है, तो उस व्यक्ति का डेटा किसी भी क्वेरी परिणाम में 100% योगदान देता है। यदि इसमें सौ लोगों का डेटा है, तो प्रत्येक व्यक्ति का डेटा केवल 1% योगदान देता है। 2006 के पेपर ने औपचारिक रूप से बताया कि क्वेरी की संवेदनशीलता के अनुसार शोर को कैसे कैलिब्रेट किया जाए, जो मापता है कि एक व्यक्ति का डेटा बदलने पर आउटपुट कितना बदल सकता है।
ε-डिफरेंशियल प्राइवेसी की परिभाषा
मान लीजिए ε एक धनात्मक वास्तविक संख्या है और A एक यादृच्छिक एल्गोरिदम है जो डेटासेट को इनपुट के रूप में लेता है (डेटा रखने वाले विश्वसनीय पक्ष के कार्यों का प्रतिनिधित्व करता है)। मान लीजिए im A, A की छवि को दर्शाता है। एल्गोरिदम A को (ε, δ)-डिफरेंशियल प्राइवेसी प्रदान करने वाला कहा जाता है यदि, सभी डेटासेट D1 और D2 के लिए जो एक ही तत्व पर भिन्न होते हैं (अर्थात, एक व्यक्ति का डेटा), और im A के सभी उपसमुच्चय S के लिए:
Pr[A(D1) ∈ S] ≤ e^ε * Pr[A(D2) ∈ S] + δ
जहाँ संभावना एल्गोरिदम द्वारा उपयोग की जाने वाली यादृच्छिकता पर ली जाती है। इस परिभाषा को कभी-कभी "अनुमानित डिफरेंशियल प्राइवेसी" कहा जाता है, जिसमें "शुद्ध डिफरेंशियल प्राइवेसी" δ = 0 होने पर एक विशेष मामला है। बाद के मामले में, एल्गोरिदम को आमतौर पर ε-डिफरेंशियल प्राइवेसी को संतुष्ट करने वाला कहा जाता है (अर्थात, δ = 0 को छोड़कर)।
इस परिभाषा के पीछे अंतर्ज्ञान यह है कि किसी व्यक्ति की गोपनीयता सांख्यिकीय रिलीज़ से समझौता नहीं हो सकती यदि उनका डेटा डेटाबेस में नहीं है। डिफरेंशियल प्राइवेसी में, प्रत्येक व्यक्ति को लगभग वही गोपनीयता दी जाती है जो उनके डेटा को हटाने से होती। अर्थात, डेटाबेस पर चलाए जाने वाले सांख्यिकीय कार्य डेटा में किसी भी व्यक्ति को हटाने, जोड़ने या बदलने से काफी प्रभावित नहीं होने चाहिए।
गुण और गारंटी
डिफरेंशियल प्राइवेसी मजबूत और स्थिर गारंटी प्रदान करती है जो डिफरेंशियल प्राइवेट तंत्रों के मॉड्यूलर डिज़ाइन और विश्लेषण को सुविधाजनक बनाती है। एक प्रमुख गुण संयोजनीयता है: यदि एक ही डेटासेट पर कई डिफरेंशियल प्राइवेट तंत्र चलाए जाते हैं, तो संयुक्त गोपनीयता हानि को सीमित किया जा सकता है। यह जटिल विश्लेषणों को सरल डिफरेंशियल प्राइवेट बिल्डिंग ब्लॉक्स से बनाने की अनुमति देता है, जबकि समग्र गोपनीयता गारंटी बनाए रखता है।
एक और महत्वपूर्ण गुण पोस्ट-प्रोसेसिंग के प्रति मजबूती है। यदि कोई एल्गोरिदम डिफरेंशियल प्राइवेट है, तो उसके आउटपुट पर लागू कोई भी फ़ंक्शन (मूल डेटा तक पहुँच के बिना) डिफरेंशियल प्राइवेट रहता है। इसका मतलब है कि एक प्रतिद्वंद्वी जारी किए गए आँकड़ों को बदलकर गोपनीयता गारंटी को कमजोर नहीं कर सकता।
डिफरेंशियल प्राइवेसी सहसंबंधित डेटा की उपस्थिति में भी सुचारू रूप से क्षीण होती है। भले ही डेटा में व्यक्तियों के बीच सहसंबंध हों, गोपनीयता गारंटी अभी भी बनी रहती है, हालाँकि प्रभावी गोपनीयता हानि बढ़ सकती है। यह इसे कुछ अन्य गोपनीयता मॉडलों की तुलना में अधिक मजबूत बनाता है जो डेटा स्वतंत्र न होने पर विफल हो जाते हैं।
डिफरेंशियल प्राइवेसी प्राप्त करने के तंत्र
डिफरेंशियल प्राइवेसी प्राप्त करने के लिए सबसे आम तंत्र लाप्लास तंत्र और गाऊसी तंत्र हैं। लाप्लास तंत्र क्वेरी के परिणाम में लाप्लास वितरण से लिया गया शोर जोड़ता है, जिसमें शोर का पैमाना क्वेरी की संवेदनशीलता को ε से विभाजित करके कैलिब्रेट किया जाता है। यह शुद्ध ε-डिफरेंशियल प्राइवेसी प्रदान करता है। गाऊसी तंत्र गाऊसी वितरण से लिया गया शोर जोड़ता है और (ε, δ)-डिफरेंशियल प्राइवेसी प्रदान करता है, जो उच्च-आयामी या पुनरावृत्त गणनाओं के लिए अक्सर अधिक सुविधाजनक होता है।
एक और महत्वपूर्ण तंत्र घातीय तंत्र है, जिसका उपयोग गोपनीयता बनाए रखते हुए विकल्पों के एक सीमित सेट से सर्वोत्तम उत्तर चुनने के लिए किया जाता है। यह एक उपयोगिता फ़ंक्शन के आधार पर प्रत्येक विकल्प को संभावनाएँ प्रदान करता है, जिसमें उच्च उपयोगिता वाले विकल्पों को उच्च संभावना मिलती है, लेकिन डिफरेंशियल प्राइवेसी सुनिश्चित करने के लिए संभावनाओं को सावधानीपूर्वक कैलिब्रेट किया जाता है।
मशीन लर्निंग में अनुप्रयोग
डिफरेंशियल प्राइवेसी मशीन लर्निंग में तेजी से महत्वपूर्ण हो गई है, विशेष रूप से संवेदनशील डेटा पर मॉडल प्रशिक्षण में। सबसे व्यापक रूप से उपयोग की जाने वाली तकनीक डिफरेंशियल प्राइवेट स्टोकेस्टिक ग्रेडिएंट डिसेंट (DP-SGD) है, जो मानक स्टोकेस्टिक ग्रेडिएंट डिसेंट अनुकूलन एल्गोरिदम को संशोधित करती है। DP-SGD में, ग्रेडिएंट्स को उनकी संवेदनशीलता को सीमित करने के लिए अधिकतम मानक तक क्लिप किया जाता है, और मॉडल पैरामीटर अपडेट करने से पहले औसत ग्रेडिएंट्स में शोर जोड़ा जाता है। यह सुनिश्चित करता है कि प्रशिक्षित मॉडल किसी भी व्यक्तिगत प्रशिक्षण उदाहरण के बारे में बहुत अधिक प्रकट न करे।
DP-SGD को बड़े भाषा मॉडल और अन्य गहन शिक्षण प्रणालियों के प्रशिक्षण में लागू किया गया है। उदाहरण के लिए, शोध समूहों ने ट्रांसफॉर्मर मॉडल के डिफरेंशियल प्राइवेट प्रशिक्षण का पता लगाया है, हालाँकि गोपनीयता-उपयोगिता व्यापार-बंद एक चुनौती बनी हुई है। यह तकनीक जनरेटिव AI प्रणालियों के लिए भी प्रासंगिक है, जहाँ प्रशिक्षण डेटा की गोपनीयता की रक्षा करना एक बढ़ती चिंता है।
कई प्रौद्योगिकी कंपनियों ने अपने उत्पादों में डिफरेंशियल प्राइवेसी को शामिल किया है। Apple iOS और macOS में उपयोगकर्ता व्यवहार आँकड़े एकत्र करने के लिए डिफरेंशियल प्राइवेट तंत्र का उपयोग करता है, जैसे लोकप्रिय इमोजी और नए शब्द सीखना, जबकि व्यक्तिगत उपयोगकर्ता गोपनीयता की रक्षा करता है। Google DeepMind और अन्य Google टीमों ने फेडरेटेड लर्निंग और एनालिटिक्स सहित विभिन्न अनुप्रयोगों के लिए डिफरेंशियल प्राइवेसी का पता लगाया है। OpenAI ने भी अपने मॉडलों के लिए डिफरेंशियल प्राइवेट प्रशिक्षण पर शोध किया है।
चुनौतियाँ और व्यापार-बंद
डिफरेंशियल प्राइवेसी में प्राथमिक चुनौती गोपनीयता और उपयोगिता के बीच व्यापार-बंद है। अधिक शोर जोड़ने से मजबूत गोपनीयता गारंटी मिलती है लेकिन सांख्यिकीय परिणामों की सटीकता कम हो जाती है। पैरामीटर ε इस व्यापार-बंद को नियंत्रित करता है: छोटे ε मान मजबूत गोपनीयता प्रदान करते हैं लेकिन अधिक शोर की आवश्यकता होती है, जबकि बड़े ε मान अधिक सटीक परिणामों की अनुमति देते हैं लेकिन कमजोर गोपनीयता गारंटी देते हैं। स्वीकार्य ε मान क्या है, इसके लिए कोई सार्वभौमिक रूप से स्वीकृत मानक नहीं है, और यह अक्सर विशिष्ट अनुप्रयोग और डेटा की संवेदनशीलता पर निर्भर करता है।
एक और चुनौती कई क्वेरीज़ की संरचना है। जबकि डिफरेंशियल प्राइवेसी संयोजित होती है, प्रत्येक अतिरिक्त क्वेरी के साथ गोपनीयता हानि जमा होती है। कई क्वेरीज़ के बाद, कुल गोपनीयता हानि सार्थक सुरक्षा प्रदान करने के लिए बहुत बड़ी हो सकती है। उन्नत संरचना प्रमेय कुल हानि को अधिक कसकर सीमित करने में मदद कर सकते हैं, लेकिन मूल मुद्दा बना रहता है।
मशीन लर्निंग में, डिफरेंशियल प्राइवेट प्रशिक्षण अक्सर गैर-प्राइवेट प्रशिक्षण की तुलना में कम मॉडल सटीकता में परिणाम देता है, विशेष रूप से तंत्रिका नेटवर्क जैसे जटिल मॉडलों के लिए। प्रशिक्षण के दौरान जोड़ा गया शोर अभिसरण को धीमा कर सकता है और अंतिम प्रदर्शन को ख़राब कर सकता है। शोधकर्ता गोपनीयता-उपयोगिता व्यापार-बंद को बेहतर बनाने के लिए तकनीक विकसित करना जारी रखते हैं, जैसे बेहतर शोर अनुसूचियाँ, अनुकूली क्लिपिंग, और डिफरेंशियल प्राइवेट फाइन-ट्यूनिंग से पहले मॉडल को प्रीट्रेन करने के लिए सार्वजनिक डेटा का उपयोग।
व्यापक प्रभाव और भविष्य की दिशाएँ
डिफरेंशियल प्राइवेसी गोपनीयता टूलबॉक्स में एक मानक उपकरण बन गई है, जिसका उपयोग सरकारी एजेंसियों और कंपनियों दोनों द्वारा किया जाता है। यू.एस. जनगणना ब्यूरो ने उत्तरदाताओं की गोपनीयता की रक्षा करते हुए जनसांख्यिकीय आँकड़े प्रकाशित करने के लिए 2020 की जनगणना में डिफरेंशियल प्राइवेसी का उपयोग किया। इसने प्रौद्योगिकी की एक महत्वपूर्ण वास्तविक दुनिया तैनाती को चिह्नित किया।
कृत्रिम बुद्धिमत्ता के क्षेत्र में, डिफरेंशियल प्राइवेसी को विश्वसनीय प्रणालियों के निर्माण के लिए एक महत्वपूर्ण घटक के रूप में देखा जाता है। जैसे-जैसे मशीन लर्निंग मॉडल तेजी से बड़े और संवेदनशील डेटासेट पर प्रशिक्षित होते हैं, औपचारिक गोपनीयता गारंटी प्रदान करने की क्षमता अधिक महत्वपूर्ण हो जाती है। बड़े मॉडलों और डेटासेट तक स्केल कर सकने वाले डिफरेंशियल प्राइवेट एल्गोरिदम का विकास अनुसंधान का एक सक्रिय क्षेत्र है।
भविष्य की दिशाओं में डिफरेंशियल प्राइवेट प्रशिक्षण की दक्षता में सुधार, उच्च-आयामी डेटा के लिए बेहतर तंत्र विकसित करना, और फेडरेटेड लर्निंग और सुरक्षित बहु-पक्षीय गणना जैसी अन्य गोपनीयता-बढ़ाने वाली तकनीकों के साथ डिफरेंशियल प्राइवेसी को एकीकृत करना शामिल है। यह क्षेत्र विकसित होता रहता है, नए सैद्धांतिक परिणाम और व्यावहारिक कार्यान्वयन नियमित रूप से सामने आते हैं।