अभिजनक प्रतिद्वंद्वी नेटवर्क (Generative adversarial network)

अंग्रेज़ी से अनुवादित

जनरेटिव एडवरसैरियल नेटवर्क (GAN) एक जनरेटर और एक डिस्क्रिमिनेटर न्यूरल नेटवर्क को प्रतिकूल प्रशिक्षण में जोड़ता है, जिससे एक जनरेटर बनता है जो छवियों जैसे यथार्थवादी सिंथेटिक डेटा बनाने में सक्षम है।

एक जनरेटिव एडवरसैरियल नेटवर्क, या GAN, मशीन-लर्निंग मॉडल का एक वर्ग है जिसमें दो न्यूरल-नेटवर्क, एक जनरेटर और एक डिस्क्रिमिनेटर, को एक-दूसरे के विरोध में एक साथ प्रशिक्षित किया जाता है: जनरेटर डिस्क्रिमिनेटर को धोखा देने के लिए पर्याप्त यथार्थवादी सिंथेटिक डेटा बनाने की कोशिश करता है, जबकि डिस्क्रिमिनेटर जनरेटर के नकली आउटपुट को वास्तविक उदाहरणों से सही ढंग से अलग करने की कोशिश करता है। प्रशिक्षण एक एडवरसैरियल खेल के रूप में आगे बढ़ता है जिसमें एक नेटवर्क में सुधार दूसरे को बदले में सुधारने के लिए प्रेरित करता है, आदर्श रूप से एक ऐसे जनरेटर पर अभिसरण करता है जो अत्यधिक यथार्थवादी सिंथेटिक डेटा बनाने में सक्षम हो।

इतिहास

GANs को 2014 में इयान-गुडफेलो और मॉन्ट्रियल विश्वविद्यालय के सहयोगियों द्वारा एक पेपर में पेश किया गया था, जिसकी कल्पना कथित तौर पर जनरेटिव मॉडलिंग के बारे में देर रात की बहस के बाद हुई थी। मूल सूत्रीकरण ने सरल छवि डेटासेट पर अपेक्षाकृत छोटे नेटवर्क को प्रशिक्षित किया, लेकिन वास्तुकला तेजी से सुधरी: 2015 में DCGAN ने छवि निर्माण के लिए स्थिर कन्वोल्यूशनल आर्किटेक्चर स्थापित किए, और 2017 में प्रोग्रेसिव GAN और 2018 में NVIDIA शोधकर्ताओं द्वारा जारी किया गया StyleGAN, जिसे StyleGAN2 और StyleGAN3 के माध्यम से परिष्कृत किया गया, ने फोटोरियलिस्टिक मानव चेहरे बनाए जो इतने सम्मोहक थे कि सार्वजनिक "यह व्यक्ति मौजूद नहीं है" प्रदर्शनों और बाद में डीपफेक मीडिया के लिए उपयोग की जाने वाली अधिकांश तकनीक को शक्ति प्रदान कर सकें।

प्रशिक्षण कैसे काम करता है

जनरेटर इनपुट के रूप में यादृच्छिक शोर लेता है और इसे एक सिंथेटिक नमूने में बदल देता है, जबकि डिस्क्रिमिनेटर, एक मानक क्लासिफायर, को वास्तविक और उत्पन्न नमूनों का मिश्रण दिया जाता है और प्रत्येक को सही ढंग से लेबल करने के लिए प्रशिक्षित किया जाता है। जनरेटर का लॉस-फंक्शन इसे उन आउटपुट के लिए पुरस्कृत करता है जिन्हें डिस्क्रिमिनेटर वास्तविक के रूप में गलत वर्गीकृत करता है, और दोनों नेटवर्क को वैकल्पिक चरणों में ग्रेडिएंट-डिसेंट के माध्यम से अद्यतन किया जाता है। सिद्धांत रूप में यह एडवरसैरियल प्रक्रिया जनरेटर के आउटपुट वितरण को वास्तविक डेटा वितरण से मेल खाने की ओर ले जाती है, लेकिन व्यवहार में GAN प्रशिक्षण कुख्यात रूप से अस्थिर है और मोड कोलैप्स से ग्रस्त है, जहां जनरेटर वास्तविक डेटा की पूर्ण विविधता के बजाय केवल संकीर्ण सीमा के सम्मोहक आउटपुट बनाना सीखता है, एक समस्या जिसने वर्षों के आर्किटेक्चरल और लॉस-फंक्शन अनुसंधान को प्रेरित किया।

अनुप्रयोग

फोटोरियलिस्टिक चेहरे और छवि संश्लेषण के अलावा, GANs का उपयोग छवि-से-छवि अनुवाद के लिए किया गया है, जैसे स्केच को फोटो में बदलना या दिन के समय की तस्वीरों को रात के समय में बदलना, सुपर-रिज़ॉल्यूशन अपस्केलिंग, अन्य मॉडलों को प्रशिक्षित करने के लिए डेटा वृद्धि, और आवाज रूपांतरण। वे व्यावहारिक टेक्स्ट-टू-इमेज सिस्टम के पीछे एक प्रारंभिक आर्किटेक्चर भी थे, इससे पहले कि वे बड़े पैमाने पर डिफ्यूजन-मॉडल द्वारा पीछे छोड़ दिए जाते। GAN-आधारित संश्लेषण डीपफेक मीडिया के बारे में चिंताओं के केंद्र में है, क्योंकि वही जनरेटर तकनीक जो सम्मोहक सिंथेटिक चेहरे बनाती है, उसे फोटो और वीडियो में वास्तविक लोगों की नकल करने के लिए लक्षित किया जा सकता है, जिससे GAN-आउटपुट पहचान और एआई-वॉटरमार्किंग पर शोध को बढ़ावा मिलता है।

डिफ्यूजन मॉडल के सापेक्ष गिरावट

लगभग 2021 से, डिफ्यूजन-मॉडल ने उच्च-गुणवत्ता वाली छवि और वीडियो निर्माण के लिए प्रमुख दृष्टिकोण के रूप में GANs को विस्थापित कर दिया है, जिसमें डैल-ई, स्टेबल-डिफ्यूजन, और मिडजर्नी जैसी प्रणालियाँ शामिल हैं, क्योंकि डिफ्यूजन प्रशिक्षण आम तौर पर अधिक स्थिर है, मोड कोलैप्स से बचता है, और अधिक आउटपुट विविधता पैदा करता है, भले ही GANs आम तौर पर एक डिफ्यूजन मॉडल के कई पुनरावृत्त डीनोइज़िंग चरणों की तुलना में एक ही तेज़ फॉरवर्ड पास में एक नमूना उत्पन्न करते हैं। GANs सक्रिय उपयोग में बने हुए हैं जहां यह अनुमान गति लाभ मायने रखता है, और उनका मूल एडवरसैरियल प्रशिक्षण सिद्धांत शुद्ध छवि निर्माण से परे लॉस-फंक्शन डिजाइन को प्रभावित करना जारी रखता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·generative-ai·computer-vision
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास