पेपर "जनरेटिव एडवर्सेरियल नेटवर्क्स" जून 2014 में इयान गुडफेलो और उनके सहयोगियों द्वारा प्रकाशित किया गया था। इसने मशीन लर्निंग फ्रेमवर्क के एक नए वर्ग की शुरुआत की, जिसे जनरेटिव एडवर्सेरियल नेटवर्क्स (GANs) कहा जाता है, जो तब से जनरेटिव आर्टिफिशियल इंटेलिजेंस के लिए एक प्रमुख दृष्टिकोण बन गया है। मूल विचार में दो तंत्रिका नेटवर्क शामिल हैं, एक जनरेटर और एक डिस्क्रिमिनेटर, जो एक शून्य-योग खेल में प्रतिस्पर्धा करते हैं, जहां एक एजेंट का लाभ दूसरे का नुकसान होता है। एक प्रशिक्षण सेट दिए जाने पर, एक GAN प्रशिक्षण सेट के समान आँकड़ों के साथ नया डेटा उत्पन्न करना सीखता है। उदाहरण के लिए, तस्वीरों पर प्रशिक्षित एक GAN नई तस्वीरें उत्पन्न कर सकता है जो मानव पर्यवेक्षकों को प्रामाणिक लगती हैं। हालांकि मूल रूप से अनपर्यवेक्षित शिक्षण के लिए एक जनरेटिव मॉडल के रूप में प्रस्तावित, GANs अर्ध-पर्यवेक्षित शिक्षण, पूर्ण पर्यवेक्षित शिक्षण, और सुदृढीकरण शिक्षण के लिए भी उपयोगी साबित हुए हैं।
यह अवधारणा विकासवादी जीव विज्ञान में नकल के अनुरूपता को आकर्षित करती है, जो दो नेटवर्कों के बीच एक विकासवादी हथियारों की दौड़ का वर्णन करती है। जनरेटर का कार्य ऐसे नमूने उत्पन्न करना है जो वास्तविक डेटा से अप्रभेद्य हों, जबकि डिस्क्रिमिनेटर का कार्य वास्तविक और उत्पन्न नमूनों के बीच अंतर करना है। यह गतिशीलता मॉडल को अनपर्यवेक्षित तरीके से सीखने में सक्षम बनाती है, क्योंकि जनरेटर को किसी विशिष्ट छवि के लिए एक निश्चित दूरी को कम करने के लिए प्रशिक्षित नहीं किया जाता है, बल्कि डिस्क्रिमिनेटर को मूर्ख बनाने के लिए।
गणितीय ढांचा
मूल GAN को दो खिलाड़ियों के बीच एक खेल के रूप में परिभाषित किया गया है। प्रत्येक संभाव्यता स्थान (Ω, μ_ref) एक GAN खेल को परिभाषित करता है। जनरेटर की रणनीति सेट Ω पर सभी संभाव्यता मापों μ_G का सेट है, जबकि डिस्क्रिमिनेटर की रणनीति सेट मार्कोव कर्नेल μ_D: Ω → P[0,1] का सेट है, जहां P[0,1] [0,1] पर संभाव्यता मापों का सेट है। GAN खेल शून्य-योग है, जिसमें एक उद्देश्य फलन L(μ_G, μ_D) = E_{x∼μ_ref, y∼μ_D(x)}[ln y] + E_{x∼μ_G, y∼μ_D(x)}[ln(1-y)] है। जनरेटर का लक्ष्य इस उद्देश्य को कम करना है, जबकि डिस्क्रिमिनेटर का लक्ष्य इसे अधिकतम करना है। जनरेटर का लक्ष्य μ_ref का अनुमान लगाना है, अपने आउटपुट वितरण को संदर्भ वितरण से मिलाना है। डिस्क्रिमिनेटर संदर्भ वितरण से इनपुट के लिए 1 के करीब और जनरेटर से इनपुट के लिए 0 के करीब मान आउटपुट करता है।
प्रशिक्षण प्रक्रिया
व्यवहार में, जनरेटिव नेटवर्क उम्मीदवार उत्पन्न करता है जबकि डिस्क्रिमिनेटिव नेटवर्क उनका मूल्यांकन करता है। यह डेटा वितरण पर आधारित एक प्रतियोगिता बनाता है। जनरेटर एक अव्यक्त स्थान से वास्तविक डेटा वितरण तक मैप करना सीखता है, जिसका उद्देश्य ऐसे उम्मीदवार उत्पन्न करना है जिन्हें डिस्क्रिमिनेटर वास्तविक डेटा से अलग नहीं कर सकता। डिस्क्रिमिनेटर का लक्ष्य इन उम्मीदवारों को सही ढंग से पहचानना है, लेकिन जैसे-जैसे जनरेटर में सुधार होता है, डिस्क्रिमिनेटर का कार्य अधिक चुनौतीपूर्ण हो जाता है, जिससे इसकी त्रुटि दर बढ़ जाती है।
एक ज्ञात डेटासेट डिस्क्रिमिनेटर के लिए प्रारंभिक प्रशिक्षण डेटा के रूप में कार्य करता है। प्रशिक्षण में इसे तब तक प्रशिक्षण डेटासेट से नमूने प्रस्तुत करना शामिल है जब तक यह स्वीकार्य सटीकता प्राप्त नहीं कर लेता। जनरेटर को इस आधार पर प्रशिक्षित किया जाता है कि यह डिस्क्रिमिनेटर को मूर्ख बनाने में सफल होता है या नहीं। आमतौर पर, जनरेटर को पूर्व-परिभाषित अव्यक्त स्थान, जैसे कि बहुभिन्नरूपी सामान्य वितरण, से यादृच्छिक इनपुट के साथ बीजित किया जाता है। उसके बाद, जनरेटर द्वारा संश्लेषित उम्मीदवारों का मूल्यांकन डिस्क्रिमिनेटर द्वारा किया जाता है। दोनों नेटवर्कों पर स्वतंत्र बैकप्रोपेगेशन प्रक्रियाएं लागू की जाती हैं, इसलिए जनरेटर बेहतर नमूने उत्पन्न करता है जबकि डिस्क्रिमिनेटर सिंथेटिक नमूनों को चिह्नित करने में अधिक कुशल हो जाता है। जब छवि निर्माण के लिए उपयोग किया जाता है, तो जनरेटर आमतौर पर एक डीकनवोल्यूशनल तंत्रिका नेटवर्क होता है, और डिस्क्रिमिनेटर एक कनवोल्यूशनल तंत्रिका नेटवर्क होता है।
अन्य विधियों से संबंध
GANs अंतर्निहित जनरेटिव मॉडल हैं, जिसका अर्थ है कि वे संभावना फलन को स्पष्ट रूप से मॉडल नहीं करते हैं और न ही किसी दिए गए नमूने के अनुरूप अव्यक्त चर खोजने का साधन प्रदान करते हैं, जैसा कि फ्लो-आधारित जनरेटिव मॉडल जैसे विकल्पों के विपरीत है। वेवनेट और पिक्सेलआरएनएन जैसे पूर्ण रूप से दृश्यमान बेलिफ नेटवर्क और सामान्य रूप से ऑटोरिग्रेसिव मॉडल की तुलना में, GANs नेटवर्क के माध्यम से कई पास के बजाय एक ही पास में एक पूर्ण नमूना उत्पन्न कर सकते हैं। बोल्ट्ज़मैन मशीनों और रैखिक आईसीए की तुलना में, नेटवर्क द्वारा उपयोग किए जाने वाले फलन के प्रकार पर कोई प्रतिबंध नहीं है। चूंकि तंत्रिका नेटवर्क सार्वभौमिक अनुमानक हैं, GANs स्पर्शोन्मुख रूप से सुसंगत हैं। 2026 तक, वैरिएशनल ऑटोएनकोडर सार्वभौमिक अनुमानक साबित हुए हैं, लेकिन GANs एक विशिष्ट और प्रभावशाली ढांचा बने हुए हैं।
प्रभाव और विरासत
2014 के पेपर ने डीप लर्निंग और मशीन लर्निंग में अनुसंधान और अनुप्रयोगों के एक विशाल निकाय की नींव रखी। GANs का उपयोग छवि निर्माण, शैली स्थानांतरण, डेटा संवर्धन, और अधिक के लिए किया गया है। एडवर्सेरियल प्रशिक्षण प्रतिमान ने अन्य क्षेत्रों को प्रभावित किया है, जिसमें एडवर्सेरियल मजबूती और एआई फीडबैक से सुदृढीकरण शिक्षण शामिल है। पेपर के लेखक, जिनमें इयान गुडफेलो, योशुआ बेंगियो, और आरोन कौरविले शामिल हैं, उस समय टोरंटो विश्वविद्यालय से संबद्ध थे। इस कार्य को दसियों हज़ार बार उद्धृत किया गया है और इसे आर्टिफिशियल इंटेलिजेंस में एक महत्वपूर्ण योगदान माना जाता है।
चुनौतियाँ और विकास
प्रारंभिक GANs को प्रशिक्षण अस्थिरता और मोड पतन जैसी चुनौतियों का सामना करना पड़ा, जहां जनरेटर सीमित विविधता उत्पन्न करता है। बाद के शोध ने इन मुद्दों को कम करने के लिए बैच सामान्यीकरण, ड्रॉपआउट, और बेहतर हानि फलन जैसी तकनीकें पेश कीं। DCGAN, StyleGAN, और CycleGAN जैसे वेरिएंट ने क्षेत्र को आगे बढ़ाया है। एडवर्सेरियल सिद्धांत को छवि निर्माण से परे भी लागू किया गया है, जिसमें बड़े भाषा मॉडल और अन्य तंत्रिका नेटवर्क आर्किटेक्चर शामिल हैं। पेपर का प्रभाव उद्योग तक फैला हुआ है, जिसमें OpenAI और Google DeepMind जैसी कंपनियां अपने जनरेटिव एआई अनुसंधान में GAN-संबंधित विचारों पर निर्माण कर रही हैं।