जून 2014 में इयान गुडफेलो और उनके सहयोगियों द्वारा जारी GAN पेपर ने जनरेटिव एडवर्सेरियल नेटवर्क (GANs) की अवधारणा पेश की, जो Machine learning ढाँचों का एक वर्ग है जो Generative AI के लिए केंद्रीय बन गया। पेपर ने एक नई वास्तुकला प्रस्तावित की जिसमें दो तंत्रिका नेटवर्क एक शून्य-योग खेल में संलग्न होते हैं, जिसमें एक नेटवर्क सिंथेटिक डेटा उत्पन्न करता है और दूसरा उसकी प्रामाणिकता का मूल्यांकन करता है। यह प्रतिस्पर्धा सिस्टम को प्रशिक्षण डेटासेट के अंतर्निहित वितरण को सीखने और उससे मिलते-जुलते नए नमूने उत्पन्न करने में सक्षम बनाती है, जैसे कि तस्वीरें जो मानव पर्यवेक्षकों को यथार्थवादी लगती हैं। मूल रूप से अप्रशिक्षित शिक्षण के एक रूप के रूप में तैयार किया गया, यह ढाँचा बाद में अर्ध-पर्यवेक्षित, पूर्ण रूप से पर्यवेक्षित, और Reinforcement learning कार्यों के लिए अनुकूलनीय साबित हुआ।
GAN पेपर का मुख्य नवाचार इसके अप्रत्यक्ष प्रशिक्षण तंत्र में निहित है। जनरेटर नेटवर्क विशिष्ट उदाहरणों के लिए प्रत्यक्ष दूरी को कम नहीं करता; इसके बजाय, यह डिस्क्रिमिनेटर को मूर्ख बनाना सीखता है, जो एक दूसरा नेटवर्क है जो वास्तविक और सिंथेटिक इनपुट के बीच अंतर करने की अपनी क्षमता को गतिशील रूप से अद्यतन करता है। यह प्रतिकूल प्रक्रिया मॉडल को स्पष्ट संभावना मॉडलिंग के बिना जटिल सांख्यिकीय पैटर्न को पकड़ने की अनुमति देती है। पेपर ने विकासवादी जीव विज्ञान में नकल के साथ एक सादृश्य बनाया, एक हथियारों की दौड़ का वर्णन करते हुए जहां प्रत्येक नेटवर्क दूसरे के जवाब में लगातार सुधार करता है।
गणितीय सूत्रीकरण
मूल GAN को संभाव्यता स्थानों पर एक खेल के रूप में औपचारिक रूप दिया गया है। एक स्थान Ω पर एक संदर्भ वितरण μ_ref दिया गया है, जनरेटर Ω पर सभी संभाव्यता मापों के सेट से एक संभाव्यता माप μ_G का चयन करता है, जबकि डिस्क्रिमिनेटर एक मार्कोव कर्नेल μ_D का चयन करता है जो प्रत्येक बिंदु को [0,1] पर एक संभाव्यता वितरण में मैप करता है। उद्देश्य फलन को वास्तविक नमूनों के लिए डिस्क्रिमिनेटर के आउटपुट की अपेक्षित लॉग-संभावना और उत्पन्न नमूनों के लिए एक माइनस उस आउटपुट की अपेक्षित लॉग-संभावना के रूप में परिभाषित किया गया है। जनरेटर इस उद्देश्य को कम करता है, जबकि डिस्क्रिमिनेटर इसे अधिकतम करता है, एक मिनिमैक्स खेल बनाता है। जनरेटर का लक्ष्य μ_G को μ_ref के करीब बनाना है, जबकि डिस्क्रिमिनेटर का लक्ष्य संदर्भ डेटा के लिए 1 के करीब और उत्पन्न डेटा के लिए 0 के करीब मान आउटपुट करना है।
व्यावहारिक प्रशिक्षण प्रक्रिया
व्यवहार में, जनरेटर एक अव्यक्त स्थान से उम्मीदवार नमूने उत्पन्न करता है, आमतौर पर बहुभिन्नरूपी सामान्य वितरण से यादृच्छिक शोर के साथ बीजित। डिस्क्रिमिनेटर इन उम्मीदवारों का मूल्यांकन एक ज्ञात प्रशिक्षण डेटासेट के खिलाफ करता है, शुरू में वास्तविक नमूनों पर प्रशिक्षित होता है जब तक कि यह स्वीकार्य सटीकता प्राप्त नहीं कर लेता। दोनों नेटवर्क स्वतंत्र बैकप्रोपेगेशन प्रक्रियाओं के माध्यम से अद्यतन किए जाते हैं: जनरेटर सम्मोहक नमूने उत्पन्न करने की अपनी क्षमता में सुधार करता है, जबकि डिस्क्रिमिनेटर सिंथेटिक नमूनों को चिह्नित करने में अधिक कुशल बन जाता है। छवि निर्माण कार्यों के लिए, जनरेटर अक्सर एक डीकनवोल्यूशनल वास्तुकला का उपयोग करता है, जबकि डिस्क्रिमिनेटर एक कनवोल्यूशनल संरचना का उपयोग करता है, Deep learning में प्रगति का लाभ उठाते हुए।
अन्य विधियों के साथ तुलना
GANs अंतर्निहित जनरेटिव मॉडल के वर्ग से संबंधित हैं, जिसका अर्थ है कि वे स्पष्ट रूप से संभावना फलन का मॉडल नहीं करते या नमूनों से अव्यक्त चर के लिए एक सीधा मैपिंग प्रदान नहीं करते, फ्लो-आधारित जनरेटिव मॉडल के विपरीत। WaveNet या PixelRNN जैसे ऑटोरेग्रेसिव मॉडल की तुलना में, GANs एक ही पास में एक पूर्ण नमूना उत्पन्न कर सकते हैं, बजाय कई अनुक्रमिक पास की आवश्यकता के। वे नेटवर्क के कार्यात्मक रूप पर कोई प्रतिबंध भी नहीं लगाते, बोल्ट्ज़मैन मशीनों या रैखिक ICA के विपरीत। क्योंकि तंत्रिका नेटवर्क सार्वभौमिक अनुमानक हैं, GANs स्पर्शोन्मुख रूप से सुसंगत हैं, हालांकि यह गुण अन्य जनरेटिव दृष्टिकोणों के साथ साझा किया जाता है।
प्रभाव और विरासत
GAN पेपर ने एक मौलिक ढाँचा स्थापित किया जिसने Artificial intelligence अनुसंधान में बाद के विकास को प्रभावित किया। इसके प्रतिकूल प्रशिक्षण प्रतिमान ने कई विविधताओं और अनुप्रयोगों को प्रेरित किया, छवि संश्लेषण से लेकर डेटा वृद्धि तक। इस अवधारणा ने Generative AI के व्यापक क्षेत्र में भी योगदान दिया, जो बाद में Transformer (architecture)-आधारित वास्तुकला जैसे मॉडल के साथ विस्तारित हुआ। नेटवर्क के बीच प्रतिस्पर्धा पर पेपर का जोर अप्रशिक्षित शिक्षण पर एक नया दृष्टिकोण प्रदान करता है, और इसका विकासवादी सादृश्य अनुकूली प्रणालियों का अध्ययन करने वाले शोधकर्ताओं के साथ प्रतिध्वनित हुआ। 2026 तक, GANs एक व्यापक रूप से अध्ययन किया जाने वाला दृष्टिकोण बना हुआ है, हालांकि तेजी से विकसित हो रहे जनरेटिव AI परिदृश्य में नई विधियाँ उभरी हैं।