एक जनरेटिव एडवरसैरियल नेटवर्क (GAN) मशीन लर्निंग ढांचे का एक वर्ग है और जनरेटिव एआई के लिए एक प्रमुख दृष्टिकोण है। यह अवधारणा शुरू में जून 2014 में इयान गुडफेलो और उनके सहयोगियों द्वारा विकसित की गई थी। एक GAN में, दो तंत्रिका नेटवर्क एक शून्य-योग खेल में प्रतिस्पर्धा करते हैं, जहां एक एजेंट का लाभ दूसरे एजेंट की हानि होती है। एक प्रशिक्षण सेट दिए जाने पर, तकनीक प्रशिक्षण सेट के समान आँकड़ों के साथ नया डेटा उत्पन्न करना सीखती है। उदाहरण के लिए, तस्वीरों पर प्रशिक्षित एक GAN नई तस्वीरें उत्पन्न कर सकता है जो मानव पर्यवेक्षकों को कम से कम सतही रूप से प्रामाणिक लगती हैं। हालाँकि मूल रूप से अनुपयोगी सीखने के लिए एक जनरेटिव मॉडल के रूप में प्रस्तावित किया गया था, GAN अर्ध-पर्यवेक्षित सीखने, पूरी तरह से पर्यवेक्षित सीखने और सुदृढीकरण सीखने के लिए भी उपयोगी साबित हुए हैं।
GAN का मूल विचार एक विवेचक के माध्यम से अप्रत्यक्ष प्रशिक्षण पर आधारित है, जो एक और तंत्रिका नेटवर्क है जो मूल्यांकन करता है कि एक इनपुट कितना यथार्थवादी लगता है, और जो स्वयं गतिशील रूप से अद्यतन होता है। जनरेटर को किसी विशिष्ट छवि की दूरी को कम करने के लिए प्रशिक्षित नहीं किया जाता है, बल्कि विवेचक को मूर्ख बनाने के लिए प्रशिक्षित किया जाता है, जिससे मॉडल अनुपयोगी तरीके से सीख सके। GAN विकासवादी जीव विज्ञान में नकल के समान हैं, जिसमें दोनों नेटवर्कों के बीच एक विकासवादी हथियारों की दौड़ होती है।
परिभाषा
मूल GAN को दो खिलाड़ियों के बीच एक खेल के रूप में परिभाषित किया गया है: जनरेटर और विवेचक। जनरेटर की रणनीति सेट किसी दिए गए स्थान पर सभी संभाव्यता मापों का सेट है, जबकि विवेचक की रणनीति सेट मार्कोव कर्नेल का सेट है जो इनपुट को संभावनाओं में मैप करता है। उद्देश्य फलन एक शून्य-योग खेल है: जनरेटर इसे कम करने का लक्ष्य रखता है, और विवेचक इसे अधिकतम करने का लक्ष्य रखता है। जनरेटर का कार्य अपने आउटपुट वितरण को संदर्भ वितरण के जितना संभव हो उतना करीब से मिलान करना है, जबकि विवेचक का कार्य वास्तविक डेटा के लिए 1 के करीब और उत्पन्न डेटा के लिए 0 के करीब मान आउटपुट करना है।
व्यवहार में, जनरेटिव नेटवर्क उम्मीदवार उत्पन्न करता है जबकि विवेचक नेटवर्क उनका मूल्यांकन करता है। यह डेटा वितरण पर आधारित एक प्रतियोगिता बनाता है। जनरेटर एक अव्यक्त स्थान से वास्तविक डेटा वितरण तक मैप करना सीखता है, जिसका उद्देश्य ऐसे उम्मीदवार तैयार करना है जिन्हें विवेचक वास्तविक डेटा से अलग नहीं कर सके। विवेचक का लक्ष्य इन उम्मीदवारों को सही ढंग से पहचानना है, लेकिन जैसे-जैसे जनरेटर में सुधार होता है, विवेचक का कार्य अधिक चुनौतीपूर्ण हो जाता है, जिससे उसकी त्रुटि दर बढ़ जाती है।
एक ज्ञात डेटासेट विवेचक के लिए प्रारंभिक प्रशिक्षण डेटा के रूप में कार्य करता है। प्रशिक्षण में तब तक प्रशिक्षण डेटासेट से नमूने प्रस्तुत करना शामिल है जब तक कि विवेचक स्वीकार्य सटीकता प्राप्त नहीं कर लेता। जनरेटर को इस आधार पर प्रशिक्षित किया जाता है कि वह विवेचक को मूर्ख बनाने में सफल होता है या नहीं। आम तौर पर, जनरेटर को पूर्व-परिभाषित अव्यक्त स्थान, जैसे कि बहुभिन्नरूपी सामान्य वितरण, से लिए गए यादृच्छिक इनपुट के साथ बीजित किया जाता है। उसके बाद, जनरेटर द्वारा संश्लेषित उम्मीदवारों का मूल्यांकन विवेचक द्वारा किया जाता है। दोनों नेटवर्कों पर स्वतंत्र बैकप्रोपेगेशन प्रक्रियाएँ लागू की जाती हैं ताकि जनरेटर बेहतर नमूने तैयार कर सके, जबकि विवेचक सिंथेटिक नमूनों को चिह्नित करने में अधिक कुशल हो जाता है। जब छवि निर्माण के लिए उपयोग किया जाता है, तो जनरेटर आम तौर पर एक डीकनवोल्यूशनल तंत्रिका नेटवर्क होता है, और विवेचक एक कनवोल्यूशनल तंत्रिका नेटवर्क होता है।
अन्य सांख्यिकीय मशीन लर्निंग विधियों से संबंध
GAN अंतर्निहित जनरेटिव मॉडल हैं, जिसका अर्थ है कि वे संभावना फलन को स्पष्ट रूप से मॉडल नहीं करते हैं और न ही किसी दिए गए नमूने के अनुरूप अव्यक्त चर खोजने का साधन प्रदान करते हैं, जैसा कि फ्लो-आधारित जनरेटिव मॉडल जैसे विकल्पों के विपरीत है। वेवनेट और पिक्सेलआरएनएन जैसे पूरी तरह से दृश्यमान विश्वास नेटवर्क और सामान्य रूप से ऑटोरेग्रेसिव मॉडल की तुलना में, GAN एक पास में एक पूर्ण नमूना उत्पन्न कर सकते हैं, न कि नेटवर्क के माध्यम से कई पासों में। बोल्ट्ज़मैन मशीनों और रैखिक आईसीए की तुलना में, नेटवर्क द्वारा उपयोग किए जाने वाले फ़ंक्शन के प्रकार पर कोई प्रतिबंध नहीं है। चूंकि तंत्रिका नेटवर्क सार्वभौमिक अनुमानक हैं, GAN स्पर्शोन्मुख रूप से सुसंगत हैं। 2026 तक, वैरिएशनल ऑटोएनकोडर भी सार्वभौमिक अनुमानक साबित हुए हैं, लेकिन GAN अपने प्रतिकूल प्रशिक्षण प्रतिमान में विशिष्ट बने हुए हैं।
प्रशिक्षण गतिशीलता और चुनौतियाँ
GAN को प्रशिक्षित करने में एक नाजुक संतुलन शामिल है। जनरेटर और विवेचक को बारी-बारी से प्रशिक्षित किया जाता है, जिससे अक्सर मोड पतन जैसी समस्याएं उत्पन्न होती हैं, जहां जनरेटर सीमित विविधता के आउटपुट उत्पन्न करता है, या गैर-अभिसरण, जहां दोनों नेटवर्क संतुलन तक पहुंचने के बिना दोलन करते हैं। प्रशिक्षण को स्थिर करने के लिए विभिन्न तकनीकें विकसित की गई हैं, जिनमें संशोधित उद्देश्य फलन, वास्तुशिल्प परिवर्तन और नियमितीकरण विधियाँ शामिल हैं। GAN की प्रतिकूल प्रकृति उन्हें हाइपरपैरामीटर के प्रति संवेदनशील बनाती है, और प्रशिक्षण के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।
अनुप्रयोग
GAN को छवि निर्माण, शैली स्थानांतरण, डेटा संवर्धन और सुपर-रिज़ॉल्यूशन में व्यापक रूप से लागू किया गया है। उनका उपयोग अन्य मॉडलों को प्रशिक्षित करने के लिए यथार्थवादी सिंथेटिक डेटा उत्पन्न करने, चिकित्सा इमेजिंग में और कला और संगीत निर्माण जैसे रचनात्मक क्षेत्रों में भी किया जाता है। GAN को Deep learning अनुसंधान में नियोजित किया गया है, और उनके सिद्धांतों ने Generative AI के अन्य क्षेत्रों को प्रभावित किया है।
प्रभाव और भविष्य की दिशाएँ
GAN की शुरूआत का Machine learning और Artificial intelligence पर गहरा प्रभाव पड़ा है। उन्होंने कई विविधताओं और सुधारों को प्रेरित किया है, जैसे कि सशर्त GAN, चक्र-सुसंगत GAN और प्रगतिशील GAN। अनुसंधान प्रशिक्षण स्थिरता और मूल्यांकन मैट्रिक्स जैसी चुनौतियों का समाधान करना जारी रखता है। GAN जनरेटिव एआई टूलकिट में एक मौलिक उपकरण बने हुए हैं, साथ ही Large language model और Transformer (architecture) जैसे अन्य मॉडलों के साथ, हालांकि वे अपने प्रतिकूल ढांचे में विशिष्ट हैं।