एक जनरेटिव एडवरसैरियल नेटवर्क (GAN) मशीन लर्निंग फ्रेमवर्क का एक वर्ग है और जनरेटिव एआई तक पहुंचने के लिए एक प्रमुख फ्रेमवर्क है। यह अवधारणा मूल रूप से इयान गुडफेलो और उनके सहयोगियों द्वारा जून 2014 में विकसित की गई थी। एक GAN में, दो न्यूरल नेटवर्क एक शून्य-योग खेल के रूप में एक दूसरे के साथ प्रतिस्पर्धा करते हैं, जहां एक एजेंट का लाभ दूसरे एजेंट की हानि होती है।
एक प्रशिक्षण सेट दिए जाने पर, यह तकनीक प्रशिक्षण सेट के समान आँकड़ों के साथ नया डेटा उत्पन्न करना सीखती है। उदाहरण के लिए, तस्वीरों पर प्रशिक्षित एक GAN नई तस्वीरें उत्पन्न कर सकता है जो मानव पर्यवेक्षकों को कम से कम सतही रूप से प्रामाणिक लगती हैं, जिनमें कई यथार्थवादी विशेषताएं होती हैं। हालांकि मूल रूप से अनसुपरवाइज्ड लर्निंग के लिए जनरेटिव मॉडल के रूप में प्रस्तावित, GANs अर्ध-पर्यवेक्षित शिक्षण, पूर्ण रूप से पर्यवेक्षित शिक्षण और सुदृढीकरण शिक्षण के लिए भी उपयोगी साबित हुए हैं।
GAN का मूल विचार डिस्क्रिमिनेटर के माध्यम से "अप्रत्यक्ष" प्रशिक्षण पर आधारित है, जो एक और न्यूरल नेटवर्क है जो बता सकता है कि इनपुट कितना "यथार्थवादी" लगता है, और यह स्वयं भी गतिशील रूप से अद्यतन किया जा रहा है। इसका मतलब है कि जनरेटर को किसी विशिष्ट छवि की दूरी को कम करने के लिए प्रशिक्षित नहीं किया जाता है, बल्कि डिस्क्रिमिनेटर को धोखा देने के लिए प्रशिक्षित किया जाता है। यह मॉडल को अनसुपरवाइज्ड तरीके से सीखने में सक्षम बनाता है। GANs विकासवादी जीव विज्ञान में नकल के समान हैं, जिसमें दोनों नेटवर्कों के बीच एक विकासवादी हथियारों की दौड़ होती है।
आर्किटेक्चर और प्रशिक्षण
एक GAN में दो मुख्य घटक होते हैं: एक जनरेटर और एक डिस्क्रिमिनेटर। जनरेटर एक न्यूरल नेटवर्क है जो एक अव्यक्त स्थान (अक्सर एक बहुभिन्नरूपी सामान्य वितरण) से यादृच्छिक शोर लेता है और इसे एक डेटा नमूने, जैसे कि एक छवि, में मैप करता है। डिस्क्रिमिनेटर एक और न्यूरल नेटवर्क है जो प्रशिक्षण डेटासेट से वास्तविक नमूने और जनरेटर से सिंथेटिक नमूने दोनों प्राप्त करता है, और संभावना आउटपुट करता है कि दिया गया इनपुट वास्तविक है बनाम उत्पन्न किया गया है।
प्रशिक्षण एक पुनरावृत्त खेल के रूप में आगे बढ़ता है। डिस्क्रिमिनेटर को पहले एक ज्ञात डेटासेट पर प्रशिक्षित किया जाता है ताकि वह स्वीकार्य सटीकता के साथ वास्तविक और नकली के बीच अंतर कर सके। फिर, जनरेटर को इस आधार पर प्रशिक्षित किया जाता है कि वह डिस्क्रिमिनेटर को धोखा देने में सफल होता है या नहीं। दोनों नेटवर्कों पर स्वतंत्र बैकप्रोपेगेशन प्रक्रियाएं लागू की जाती हैं: जनरेटर अधिक ठोस नमूने उत्पन्न करने के लिए अपने वज़न को समायोजित करता है, जबकि डिस्क्रिमिनेटर सिंथेटिक इनपुट को फ्लैग करने की अपनी क्षमता में सुधार करता है। जब छवि निर्माण के लिए उपयोग किया जाता है, तो जनरेटर आमतौर पर एक डिकनवोल्यूशनल न्यूरल नेटवर्क होता है, और डिस्क्रिमिनेटर एक कन्वोल्यूशनल न्यूरल नेटवर्क होता है।
मूल GAN खेल के लिए उद्देश्य फ़ंक्शन संदर्भ वितरण (वास्तविक डेटा) और जनरेटर वितरण पर परिभाषित किया गया है। डिस्क्रिमिनेटर का लक्ष्य वास्तविक और नकली इनपुट को सही ढंग से वर्गीकृत करने की लॉग-संभावना को अधिकतम करना है, जबकि जनरेटर का लक्ष्य उसी उद्देश्य को कम करना है, प्रभावी रूप से डिस्क्रिमिनेटर को उत्पन्न नमूनों के लिए 1 आउटपुट करने का प्रयास करना है। यह शून्य-योग सूत्रीकरण दोनों नेटवर्कों को तब तक सुधारने के लिए प्रेरित करता है जब तक कि जनरेटर का वितरण संदर्भ वितरण से निकटता से मेल नहीं खाता।
गणितीय सूत्रीकरण
औपचारिक रूप से, GAN खेल एक संभावना स्थान (Ω, μ_ref) पर परिभाषित किया गया है। जनरेटर की रणनीति सेट Ω पर सभी संभावना मापों μ_G का सेट है, जबकि डिस्क्रिमिनेटर की रणनीति सेट Ω से [0,1] पर संभावना मापों के लिए मार्कोव कर्नेल से मिलकर बनता है। उद्देश्य फ़ंक्शन है:
L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]
जनरेटर का लक्ष्य इस उद्देश्य को कम करना है, μ_G ≈ μ_ref के करीब पहुंचना, जबकि डिस्क्रिमिनेटर का लक्ष्य इसे अधिकतम करना है, वास्तविक डेटा के लिए 1 के करीब और उत्पन्न डेटा के लिए 0 के करीब मान आउटपुट करना है। इस मिनिमैक्स खेल में एक सैद्धांतिक संतुलन है जहां जनरेटर संदर्भ वितरण को पूरी तरह से दोहराता है और डिस्क्रिमिनेटर यादृच्छिक अनुमान से बेहतर नहीं कर सकता है।
अन्य जनरेटिव मॉडल से संबंध
GANs अंतर्निहित जनरेटिव मॉडल हैं, जिसका अर्थ है कि वे संभावना फ़ंक्शन को स्पष्ट रूप से मॉडल नहीं करते हैं और न ही किसी दिए गए नमूने के अनुरूप अव्यक्त चर खोजने का साधन प्रदान करते हैं, फ्लो-आधारित जनरेटिव मॉडल जैसे विकल्पों के विपरीत। वेवनेट और पिक्सेलआरएनएन जैसे पूर्ण रूप से दृश्यमान विश्वास नेटवर्क और सामान्य रूप से ऑटोरेग्रेसिव मॉडल की तुलना में, GANs एक ही पास में एक पूर्ण नमूना उत्पन्न कर सकते हैं, बजाय नेटवर्क के माध्यम से कई पास की आवश्यकता के।
बोल्ट्ज़मैन मशीनों और रैखिक ICA के विपरीत, GANs नेटवर्क द्वारा उपयोग किए जाने वाले फ़ंक्शन के प्रकार पर कोई प्रतिबंध नहीं लगाते हैं। चूंकि न्यूरल नेटवर्क सार्वभौमिक अनुमानक हैं, GANs स्पर्शोन्मुख रूप से सुसंगत हैं। 2026 तक, वैरिएशनल ऑटोएनकोडर भी सार्वभौमिक अनुमानक साबित हुए हैं, लेकिन GANs अपने एडवरसैरियल प्रशिक्षण प्रतिमान में विशिष्ट बने हुए हैं। यह दृष्टिकोण GANs को छवि संश्लेषण, शैली स्थानांतरण और डेटा वृद्धि जैसे कार्यों के लिए विशेष रूप से प्रभावी बनाता है, जहां यथार्थवादी उच्च-आयामी नमूने उत्पन्न करना महत्वपूर्ण है।
अनुप्रयोग और प्रभाव
GANs ने डीप लर्निंग और मशीन लर्निंग अनुप्रयोगों में महत्वपूर्ण प्रगति को बढ़ावा दिया है। उनका व्यापक रूप से यथार्थवादी छवियों को उत्पन्न करने के लिए उपयोग किया गया है, जिसमें चेहरे, परिदृश्य और चिकित्सा छवियां शामिल हैं। आर्टिफिशियल इंटेलिजेंस अनुसंधान में, GANs ने अर्ध-पर्यवेक्षित शिक्षण में प्रगति को सक्षम किया है, जहां लेबल किया गया डेटा दुर्लभ है, और सुदृढीकरण शिक्षण में, जहां वे वातावरण को मॉडल कर सकते हैं या प्रशिक्षण अनुभव उत्पन्न कर सकते हैं।
एडवरसैरियल प्रशिक्षण अवधारणा ने अन्य क्षेत्रों को भी प्रभावित किया है, जैसे ट्रांसफॉर्मर और बड़े भाषा मॉडल, हालांकि उन आर्किटेक्चर में विभिन्न प्रशिक्षण उद्देश्यों का उपयोग किया जाता है। GANs जनरेटिव मॉडलिंग में एक मौलिक फ्रेमवर्क बने हुए हैं, जिसमें चल रहे शोध प्रशिक्षण अस्थिरता और मोड पतन जैसी चुनौतियों का समाधान करते हैं, जहां जनरेटर सीमित विविधता उत्पन्न करता है। उनकी विकासवादी हथियारों की दौड़ सादृश्य शिक्षा और उद्योग दोनों में नए तरीकों को प्रेरित करना जारी रखता है।
सीमाएं और चुनौतियां
अपनी शक्ति के बावजूद, GANs को कई ज्ञात कठिनाइयों का सामना करना पड़ता है। प्रशिक्षण अस्थिर हो सकता है, क्योंकि दोनों नेटवर्कों को संतुलन में रखा जाना चाहिए; यदि डिस्क्रिमिनेटर बहुत मजबूत हो जाता है, तो जनरेटर को लुप्त होते ग्रेडिएंट प्राप्त होते हैं, और यदि यह बहुत कमजोर हो जाता है, तो जनरेटर प्रभावी ढंग से नहीं सीख सकता है। मोड पतन एक और आम मुद्दा है, जहां जनरेटर संभावित आउटपुट का केवल एक छोटा सा उपसमुच्चय उत्पन्न करता है, प्रशिक्षण डेटा की पूर्ण विविधता को पकड़ने में विफल रहता है।
GAN प्रदर्शन का मूल्यांकन करना भी गैर-तुच्छ है, क्योंकि मापने के लिए कोई स्पष्ट संभावना नहीं है। शोधकर्ता अक्सर इंसेप्शन स्कोर या फ्रेचेट इंसेप्शन दूरी जैसे मेट्रिक्स का उपयोग करते हैं, लेकिन इनकी सीमाएं हैं। 2020 के दशक के मध्य तक, डिफ्यूजन मॉडल सहित नए जनरेटिव मॉडल ने कुछ कार्यों के लिए लोकप्रियता हासिल की है, लेकिन GANs अनुसंधान का एक सक्रिय क्षेत्र बने हुए हैं, विशेष रूप से वास्तविक समय के अनुप्रयोगों और उन सेटिंग्स के लिए जहां एकल-पास पीढ़ी महत्वपूर्ण है।