एक जनरेटिव एडवर्सेरियल नेटवर्क (GAN) मशीन लर्निंग फ्रेमवर्क का एक वर्ग है और जनरेटिव एआई तक पहुंचने के लिए एक प्रमुख फ्रेमवर्क है। यह अवधारणा मूल रूप से जून 2014 में इयान गुडफेलो और उनके सहयोगियों द्वारा विकसित की गई थी। एक GAN में, दो न्यूरल नेटवर्क एक शून्य-योग खेल के रूप में एक दूसरे के साथ प्रतिस्पर्धा करते हैं, जहां एक एजेंट का लाभ दूसरे एजेंट की हानि होती है।
एक प्रशिक्षण सेट दिए जाने पर, यह तकनीक प्रशिक्षण सेट के समान आँकड़ों के साथ नया डेटा उत्पन्न करना सीखती है। उदाहरण के लिए, तस्वीरों पर प्रशिक्षित एक GAN नई तस्वीरें उत्पन्न कर सकता है जो मानव पर्यवेक्षकों को कम से कम सतही रूप से प्रामाणिक लगती हैं, जिनमें कई यथार्थवादी विशेषताएं होती हैं। हालांकि मूल रूप से अनसुपरवाइज्ड लर्निंग के लिए जनरेटिव मॉडल के रूप में प्रस्तावित, GANs सेमी-सुपरवाइज्ड लर्निंग, पूर्ण रूप से सुपरवाइज्ड लर्निंग और रीइन्फोर्समेंट लर्निंग के लिए भी उपयोगी साबित हुए हैं।
GAN का मूल विचार डिस्क्रिमिनेटर के माध्यम से "अप्रत्यक्ष" प्रशिक्षण पर आधारित है, जो एक और न्यूरल नेटवर्क है जो बता सकता है कि इनपुट कितना "यथार्थवादी" लगता है, और जो स्वयं भी गतिशील रूप से अद्यतन किया जा रहा है। इसका मतलब है कि जनरेटर को किसी विशिष्ट छवि की दूरी को कम करने के लिए प्रशिक्षित नहीं किया जाता है, बल्कि डिस्क्रिमिनेटर को धोखा देने के लिए प्रशिक्षित किया जाता है। यह मॉडल को अनसुपरवाइज्ड तरीके से सीखने में सक्षम बनाता है।
GANs विकासवादी जीव विज्ञान में नकल के समान हैं, जिसमें दोनों नेटवर्कों के बीच एक विकासवादी हथियारों की दौड़ होती है।
गणितीय परिभाषा
मूल GAN को एक खेल के रूप में परिभाषित किया गया है। प्रत्येक प्रायिकता स्थान \((\Omega, \mu_{\text{ref}})\) एक GAN खेल को परिभाषित करता है। दो खिलाड़ी हैं: जनरेटर और डिस्क्रिमिनेटर। जनरेटर की रणनीति सेट \(\mathcal{P}(\Omega)\) है, जो \(\Omega\) पर सभी प्रायिकता मापों \(\mu_G\) का समुच्चय है। डिस्क्रिमिनेटर की रणनीति सेट मार्कोव कर्नेल \(\mu_D: \Omega \to \mathcal{P}[0,1]\) का समुच्चय है, जहां \(\mathcal{P}[0,1]\) \([0,1]\) पर प्रायिकता मापों का समुच्चय है।
GAN खेल एक शून्य-योग खेल है, जिसमें उद्देश्य फलन है:
\[ L(\mu_G, \mu_D) := \mathbb{E}_{x \sim \mu_{\text{ref}}, y \sim \mu_D(x)}[\ln y] + \mathbb{E}_{x \sim \mu_G, y \sim \mu_D(x)}[\ln(1-y)]. \]
जनरेटर का लक्ष्य उद्देश्य को कम करना है, और डिस्क्रिमिनेटर का लक्ष्य उद्देश्य को अधिकतम करना है। जनरेटर का कार्य \(\mu_G \approx \mu_{\text{ref}}\) तक पहुंचना है, अपने आउटपुट वितरण को संदर्भ वितरण के जितना संभव हो उतना करीब मिलाना है। डिस्क्रिमिनेटर का कार्य इनपुट के संदर्भ वितरण से प्रतीत होने पर 1 के करीब मान आउटपुट करना है, और इनपुट के जनरेटर वितरण से आने पर 0 के करीब मान आउटपुट करना है।
व्यवहार में
जनरेटिव नेटवर्क उम्मीदवार उत्पन्न करता है जबकि डिस्क्रिमिनेटिव नेटवर्क उनका मूल्यांकन करता है। यह डेटा वितरणों पर आधारित एक प्रतियोगिता बनाता है, जहां जनरेटर एक अव्यक्त स्थान से वास्तविक डेटा वितरण तक मैप करना सीखता है, जिसका उद्देश्य ऐसे उम्मीदवार उत्पन्न करना है जिन्हें डिस्क्रिमिनेटर वास्तविक डेटा से अलग नहीं कर सकता। डिस्क्रिमिनेटर का लक्ष्य इन उम्मीदवारों को सही ढंग से पहचानना है, लेकिन जैसे-जैसे जनरेटर में सुधार होता है, उसका कार्य अधिक चुनौतीपूर्ण हो जाता है, जिससे डिस्क्रिमिनेटर की त्रुटि दर बढ़ जाती है।
एक ज्ञात डेटासेट डिस्क्रिमिनेटर के लिए प्रारंभिक प्रशिक्षण डेटा के रूप में कार्य करता है। प्रशिक्षण में इसे प्रशिक्षण डेटासेट से नमूने प्रस्तुत करना शामिल है जब तक कि यह स्वीकार्य सटीकता प्राप्त न कर ले। जनरेटर को इस आधार पर प्रशिक्षित किया जाता है कि क्या यह डिस्क्रिमिनेटर को धोखा देने में सफल होता है। आमतौर पर, जनरेटर को पूर्व-परिभाषित अव्यक्त स्थान (जैसे, एक बहुभिन्नरूपी सामान्य वितरण) से नमूना किए गए यादृच्छिक इनपुट के साथ बीजित किया जाता है। उसके बाद, जनरेटर द्वारा संश्लेषित उम्मीदवारों का मूल्यांकन डिस्क्रिमिनेटर द्वारा किया जाता है। दोनों नेटवर्कों पर स्वतंत्र बैकप्रोपेगेशन प्रक्रियाएं लागू की जाती हैं ताकि जनरेटर बेहतर नमूने उत्पन्न करे, जबकि डिस्क्रिमिनेटर सिंथेटिक नमूनों को चिह्नित करने में अधिक कुशल हो जाता है। जब छवि निर्माण के लिए उपयोग किया जाता है, तो जनरेटर आमतौर पर एक डीकनवोल्यूशनल न्यूरल नेटवर्क होता है, और डिस्क्रिमिनेटर एक कन्वोल्यूशनल न्यूरल नेटवर्क होता है।
अन्य सांख्यिकीय मशीन लर्निंग विधियों से संबंध
GANs अंतर्निहित जनरेटिव मॉडल हैं, जिसका अर्थ है कि वे संभावना फलन को स्पष्ट रूप से मॉडल नहीं करते हैं और न ही किसी दिए गए नमूने के अनुरूप अव्यक्त चर खोजने का साधन प्रदान करते हैं, जैसा कि फ्लो-आधारित जनरेटिव मॉडल जैसे विकल्पों के विपरीत है।
वेवनेट और पिक्सेलआरएनएन जैसे पूर्ण रूप से दृश्यमान विश्वास नेटवर्क और सामान्य रूप से ऑटोरेग्रेसिव मॉडल की तुलना में, GANs नेटवर्क के माध्यम से कई पास के बजाय एक ही पास में एक पूर्ण नमूना उत्पन्न कर सकते हैं। बोल्ट्ज़मैन मशीनों और रैखिक ICA की तुलना में, नेटवर्क द्वारा उपयोग किए जाने वाले फलन के प्रकार पर कोई प्रतिबंध नहीं है।
चूंकि न्यूरल नेटवर्क सार्वभौमिक अनुमानक हैं, GANs स्पर्शोन्मुख रूप से सुसंगत हैं। 2026 तक, वैरिएशनल ऑटोएन्कोडर सार्वभौमिक अनुमानक साबित हुए हैं, लेकिन GANs मशीन लर्निंग और डीप लर्निंग के क्षेत्र में एक विशिष्ट और प्रभावशाली दृष्टिकोण बने हुए हैं। इस फ्रेमवर्क ने कई विविधताओं और अनुप्रयोगों को प्रेरित किया है, जो कृत्रिम बुद्धिमत्ता और न्यूरल नेटवर्क के व्यापक विकास में योगदान दे रहा है।