अंग्रेज़ी से अनुवादित

सेल्फ-अटेंशन GAN (SAGAN) एक जनरेटिव एडवर्सेरियल नेटवर्क आर्किटेक्चर है जो छवि निर्माण में अटेंशन तंत्र को एकीकृत करता है, जिससे मॉडल लंबी दूरी की निर्भरताओं को पकड़ सकता है और वैश्विक रूप से सुसंगत छवियां उत्पन्न कर सकता है।

Self-Attention GAN (SAGAN) एक जनरेटिव एडवर्सेरियल नेटवर्क आर्किटेक्चर है, जिसे 2018 में हान झांग, इयान गुडफेलो, डिमिट्रिस मेटाक्सस और ऑगस्टस ओडेना द्वारा प्रस्तुत किया गया था। यह मानक GAN ढांचे को स्व-ध्यान तंत्र (self-attention mechanisms) को शामिल करके बेहतर बनाता है, जो जनरेटर और डिस्क्रिमिनेटर को छवि के दूरस्थ क्षेत्रों के बीच संबंधों को मॉडल करने में सक्षम बनाता है। कन्वोल्यूशनल परतों के विपरीत, जो स्थानीय पड़ोस को संसाधित करती हैं, SAGAN के ध्यान मॉड्यूल पूरे स्थानिक विस्तार में विशेषताओं के भारित योग के रूप में प्रतिक्रियाओं की गणना करते हैं, जो छवि संश्लेषण जैसे कार्यों में दीर्घ-सीमा निर्भरताओं को पकड़ने में कन्वोल्यूशनल GAN की सीमा को संबोधित करते हैं।

यह आर्किटेक्चर transformers और Multi-Head Attention पर पूर्व कार्य पर आधारित है, इन तंत्रों को छवि निर्माण के लिए अनुकूलित करता है। SAGAN ने 128x128 रिज़ॉल्यूशन पर ImageNet डेटासेट पर अत्याधुनिक परिणाम प्रदर्शित किए, जिसमें इंसेप्शन स्कोर 52.52 और फ्रेचेट इंसेप्शन दूरी 18.65 प्राप्त हुई। मॉडल ने जनरेटर और डिस्क्रिमिनेटर दोनों में स्पेक्ट्रल नॉर्मलाइज़ेशन भी पेश किया, जिससे प्रशिक्षण स्थिरता में सुधार हुआ, और एडवर्सेरियल प्रशिक्षण के लिए हिंज लॉस उद्देश्य का उपयोग किया।

छवि निर्माण में ध्यान तंत्र

SAGAN का मुख्य नवाचार छवि विशेषताओं पर स्व-ध्यान का अनुप्रयोग है। यह तकनीक Multi-Head Attention से प्रेरित थी, जो अनुक्रम मॉडलिंग के लिए neural networks में उपयोग की जाती है, लेकिन द्वि-आयामी स्थानिक डेटा के लिए अनुकूलित की गई। जनरेटर में, ध्यान मॉड्यूल कुछ कन्वोल्यूशनल ब्लॉकों के बाद रखे जाते हैं, जिससे मॉडल वैश्विक संबंधों को सीख सकता है, जैसे चेहरे में आँखों का संरेखण या दृश्य में बनावट की सुसंगतता। ध्यान आउटपुट की गणना फीचर मानों के भारित औसत के रूप में की जाती है, जहाँ भार क्वेरी और कुंजी फीचर वैक्टर के बीच डॉट उत्पादों से प्राप्त होते हैं, जो एक सीखने योग्य पैरामीटर द्वारा स्केल किए जाते हैं।

लेखकों ने प्रदर्शित किया कि ध्यान परतें विशुद्ध रूप से कन्वोल्यूशनल आर्किटेक्चर की तुलना में उत्पन्न नमूनों की निष्ठा और विविधता दोनों में सुधार करती हैं। उन्होंने ध्यान नियमितीकरण (Attention Regularization) नामक एक तकनीक भी प्रस्तावित की, जो ध्यान मानचित्रों को चैनलों में विविध होने के लिए प्रोत्साहित करती है, जिससे मॉडल को तुच्छ पैटर्न में ढहने से रोका जा सके।

प्रशिक्षण स्थिरता और स्पेक्ट्रल नॉर्मलाइज़ेशन

मॉडल जनरेटर में Batch Normalization और डिस्क्रिमिनेटर में Layer Normalization शामिल करता है, लेकिन अधिक महत्वपूर्ण रूप से, यह दोनों नेटवर्क की हर परत पर स्पेक्ट्रल नॉर्मलाइज़ेशन लागू करता है। स्पेक्ट्रल नॉर्मलाइज़ेशन, जो पहले 2018 में टेकरू मियातो एट अल. द्वारा GAN के लिए पेश किया गया था, प्रत्येक भार मैट्रिक्स के स्पेक्ट्रल मानदंड को सामान्य करके नेटवर्क के लिप्सचिट्ज़ स्थिरांक को सीमित करता है। यह स्थिरीकरण तकनीक SAGAN को उच्च सीखने की दरों और मोड पतन के कम उदाहरणों के साथ प्रशिक्षित करने की अनुमति देती है, जो GAN में एक सामान्य विफलता मोड है।

लेखकों ने डिस्क्रिमिनेटर के लिए हिंज लॉस और Adam ऑप्टिमाइज़र के लिए दो-टाइमस्केल अपडेट नियम (TTUR) का भी उपयोग किया, जिसमें जनरेटर और डिस्क्रिमिनेटर के लिए सीखने की दरों को अलग-अलग मानों पर सेट किया गया। इन विकल्पों ने तेज़ अभिसरण और बेहतर नमूना गुणवत्ता में योगदान दिया।

ImageNet पर प्रदर्शन और तुलनाएँ

SAGAN का मूल्यांकन ImageNet डेटासेट पर 128x128 और 256x256 रिज़ॉल्यूशन पर किया गया, जिससे विविध वर्गों में दृश्य रूप से प्रशंसनीय नमूने तैयार हुए। 128x128 पर, इसने इंसेप्शन स्कोर 52.52 प्राप्त किया, जो पिछले अत्याधुनिक मॉडलों जैसे प्रोग्रेसिव GAN (43.20) और स्पेक्ट्रल नॉर्मलाइज़ेशन GAN (48.62) की तुलना में महत्वपूर्ण सुधार है। मॉडल ने बेसलाइन की तुलना में कम FID भी दिखाया, जो वास्तविक छवियों के साथ बेहतर वितरणात्मक समानता का संकेत देता है।

ध्यान की प्रभावशीलता नियंत्रित प्रयोगों के माध्यम से प्रदर्शित की गई, जहाँ ध्यान परतों के बिना मॉडलों ने कम सुसंगत छवियाँ उत्पन्न कीं, विशेष रूप से पक्षियों और कुत्तों जैसे जटिल स्थानिक संरचनाओं वाली श्रेणियों में। परिणामों ने सुझाव दिया कि यथार्थवादी बनावट और वस्तु मुद्राएँ उत्पन्न करने के लिए स्व-ध्यान महत्वपूर्ण है।

प्रभाव और अनुवर्ती कार्य

SAGAN ने Generative AI और छवि संश्लेषण में बाद के कार्यों को प्रभावित किया है। इसका ध्यान तंत्र BigGAN में अपनाया गया था, जिसने और भी उच्च छवि गुणवत्ता प्राप्त करने के लिए SAGAN के आर्किटेक्चर को बड़े बैच आकारों और वर्ग-सशर्त प्रशिक्षण के साथ जोड़ा। जनरेटर में ध्यान का उपयोग करने का विचार diffusion models पर बाद के शोध को भी सूचित करता है, जहाँ ध्यान परतें आधुनिक डीनॉइज़िंग नेटवर्क में मानक हैं।

यह पेपर 2019 में इंटरनेशनल कॉन्फ्रेंस ऑन मशीन लर्निंग (ICML) में प्रस्तुत किया गया था और व्यापक रूप से उद्धृत किया गया है। इसने व्यापक समझ में योगदान दिया कि ध्यान तंत्र, जो मूल रूप से Sequence-to-Sequence (Seq2Seq) कार्यों के लिए विकसित किए गए थे, स्थानिक डोमेन में प्रभावी रूप से स्थानांतरित किए जा सकते हैं।

सीमाएँ और कम्प्यूटेशनल विचार

स्व-ध्यान परतों में स्थानिक रिज़ॉल्यूशन के संबंध में द्विघात कम्प्यूटेशनल जटिलता होती है, जिससे उच्च-रिज़ॉल्यूशन छवियों के लिए वे महंगी हो जाती हैं। SAGAN के प्रयोग मेमोरी बाधाओं के कारण 256x256 रिज़ॉल्यूशन तक सीमित थे। बाद के कार्यों ने इस स्केलेबिलिटी मुद्दे को संबोधित करने के लिए कुशल ध्यान वेरिएंट, जैसे स्पार्स या फैक्टराइज़्ड ध्यान, प्रस्तावित किए। इसके अतिरिक्त, जबकि SAGAN ने वैश्विक सुसंगतता में सुधार किया, यह जटिल दृश्यों में बारीक विवरणों के साथ अभी भी संघर्ष करता था, एक सीमा जिसे नए आर्किटेक्चर ने आंशिक रूप से दूर किया है।

इन चुनौतियों के बावजूद, SAGAN दृष्टि के लिए Deep learning के क्षेत्र में एक मौलिक योगदान बना हुआ है, यह प्रदर्शित करता है कि ध्यान कन्वोल्यूशनल संचालन को पूरक कर सकता है ताकि मजबूत जनरेटिव मॉडल प्राप्त किए जा सकें।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·deep-learning·computer-vision·gan
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास