अंग्रेज़ी से अनुवादित

CycleGAN एक गहन शिक्षण मॉडल है जो अयुग्मित छवि-से-छवि अनुवाद के लिए है, जो चक्र स्थिरता का उपयोग करके युग्मित उदाहरणों के बिना डोमेन के बीच मैपिंग सीखता है। 2017 में पेश किया गया, यह शैली स्थानांतरण, वस्तु परिवर्तन और डोमेन अनुकूलन को सक्षम बनाता है।

CycleGAN एक गहन-अधिगम वास्तुकला है जो छवि-से-छवि अनुवाद के लिए है, जो बिना युग्मित प्रशिक्षण उदाहरणों की आवश्यकता के एक डोमेन से दूसरे डोमेन में छवियों को परिवर्तित करना सीखती है। बर्कले एआई अनुसंधान प्रयोगशाला में विकसित और 2017 के एक पेपर में जून-यान झू, ताएसुंग पार्क, फिलिप इसोला और एलेक्सी एफ्रोस द्वारा प्रस्तुत, यह मॉडल चक्र स्थिरता हानि का उपयोग करता है ताकि यह सुनिश्चित किया जा सके कि लक्ष्य डोमेन में अनुवादित और मूल डोमेन में वापस लाई गई छवि अपरिवर्तित रहे। यह दृष्टिकोण तस्वीरों को चित्रों में बदलने, पशु प्रजातियों को बदलने या मौसमी रूपों को बदलने जैसे अनुप्रयोगों की अनुमति देता है, जहाँ पूरी तरह से मेल खाने वाले इनपुट-आउटपुट जोड़े प्राप्त करना अव्यावहारिक है।

CycleGAN की मुख्य नवीनता अयुग्मित डेटासेट का उपयोग करके दो दृश्य डोमेन के बीच मानचित्रण सीखने की क्षमता में निहित है। पहले के मॉडलों के विपरीत जिन्हें संरेखित छवि जोड़े की आवश्यकता होती थी, CycleGAN एक साथ दो जनरेटर नेटवर्क और दो डिस्क्रिमिनेटर नेटवर्क प्रशिक्षित करता है। एक जनरेटर डोमेन X से डोमेन Y तक छवियों का मानचित्रण करता है, जबकि दूसरा Y से X तक वापस मानचित्रण करता है। चक्र स्थिरता हानि यह सुनिश्चित करती है कि राउंड-ट्रिप अनुवाद मूल छवि सामग्री को संरक्षित करता है, जिससे मॉडल को संरचनात्मक जानकारी खोने वाले मनमाने परिवर्तन करने से रोका जा सके।

Architecture and Training

CycleGAN जनरेटिव एआई के जनरेटिव एडवर्सेरियल नेटवर्क के ढांचे पर आधारित है, जो डाउनसैंपलिंग और अपसैंपलिंग परतों के साथ एक अवशिष्ट नेटवर्क वास्तुकला पर आधारित जनरेटर का उपयोग करता है। डिस्क्रिमिनेटर पैच-आधारित क्लासिफायर हैं जो पूरी छवि के बजाय स्थानीय छवि क्षेत्रों का मूल्यांकन करते हैं, जो प्रशिक्षण स्थिरता और विवरण संरक्षण में सुधार करता है। कुल हानि फ़ंक्शन प्रत्येक मानचित्रण दिशा के लिए एडवर्सेरियल हानियों को चक्र स्थिरता हानि के साथ जोड़ता है, जिसे आमतौर पर 10 पर सेट किए गए हाइपरपैरामीटर द्वारा भारित किया जाता है।

प्रशिक्षण प्रक्रिया मानक बाइनरी क्रॉस-एन्ट्रॉपी के बजाय न्यूनतम-वर्ग एडवर्सेरियल हानि का उपयोग करती है, जो अधिक स्थिर प्रशिक्षण और उच्च गुणवत्ता वाले आउटपुट उत्पन्न करने के लिए पाई गई। मॉडल कुछ कार्यान्वयनों में एक पहचान मानचित्रण हानि भी शामिल करता है, जो जनरेटर को रंग और बनावट संरक्षित करने के लिए प्रोत्साहित करता है जब इनपुट पहले से ही लक्ष्य डोमेन से संबंधित होता है। प्रशिक्षण के लिए आमतौर पर उच्च-स्तरीय GPU पर कई दिनों की आवश्यकता होती है, मूल प्रयोग एक एकल NVIDIA Tesla K80 पर किए गए थे।

Applications and Impact

मॉडल ने विविध कार्यों में प्रभावशाली परिणाम प्रदर्शित किए। कलात्मक शैली स्थानांतरण में, CycleGAN ने वास्तविक तस्वीरों को मोनेट, वैन गॉग और सेज़ेन जैसे चित्रकारों की शैलियों में परिवर्तित किया, जिसमें परिदृश्य तस्वीरों और चित्रों के संग्रह का उपयोग किया गया जो युग्मित नहीं थे। वस्तु परिवर्तन के लिए, इसने घोड़ों को ज़ेब्रा में, सेब को संतरे में परिवर्तित किया और गर्मियों के परिदृश्य को सर्दियों के दृश्यों में बदल दिया। मॉडल मशीन-अधिगम अनुसंधान में डोमेन अनुकूलन के लिए भी उपयोगी साबित हुआ, जैसे कि सिंथेटिक छवियों पर प्रशिक्षित सिमेंटिक विभाजन मॉडल को वास्तविक तस्वीरों पर काम करने के लिए सुधारना।

CycleGAN का ओपन-सोर्स सॉफ्टवेयर के रूप में PyTorch कार्यान्वयन के साथ जारी होना इसे व्यापक रूप से सुलभ बनाता है, जिससे कई व्युत्पन्न कार्य और विस्तार हुए। इसने अयुग्मित अनुवाद में बाद के शोध को प्रभावित किया, जिसमें UNIT, MUNIT और StarGAN जैसे मॉडल शामिल हैं, जिन्होंने बहु-डोमेन अनुवाद के लिए दृष्टिकोण का विस्तार किया और आउटपुट शैलियों पर नियंत्रण में सुधार किया। चक्र स्थिरता की अवधारणा को छवियों से परे भी लागू किया गया है, जिसमें तंत्रिका-नेटवर्क मॉडल शामिल हैं जो पाठ शैली स्थानांतरण और ऑडियो प्रसंस्करण के लिए हैं।

Limitations and Criticisms

अपनी सफलताओं के बावजूद, CycleGAN की उल्लेखनीय सीमाएँ हैं। मॉडल कलाकृतियाँ उत्पन्न कर सकता है, विशेष रूप से महत्वपूर्ण ज्यामितीय अंतर वाले डोमेन के बीच अनुवाद करते समय, जैसे कि वस्तुओं के आकार को बदलना। यह बड़े संरचनात्मक परिवर्तनों से जूझता है और जटिल दृश्यों में बारीक विवरण संरक्षित करने में विफल हो सकता है। प्रशिक्षण प्रक्रिया हाइपरपैरामीटर विकल्पों के प्रति संवेदनशील है, और चक्र स्थिरता हानि कभी-कभी अत्यधिक रूढ़िवादी अनुवादों की ओर ले जा सकती है जो सार्थक परिवर्तनों से बचती हैं।

शोधकर्ताओं ने यह भी नोट किया है कि CycleGAN इनपुट और आउटपुट के बीच सिमेंटिक पत्राचार की गारंटी नहीं देता है, जिसका अर्थ है कि मॉडल उन तत्वों को बदल सकता है जिन्हें एक मानव महत्वपूर्ण मानेगा। उदाहरण के लिए, ज़ेबरा की तस्वीर को घोड़े में अनुवाद करने से पृष्ठभूमि या प्रकाश व्यवस्था अनपेक्षित तरीकों से बदल सकती है। इन मुद्दों ने अनुवाद निष्ठा में सुधार के लिए ध्यान तंत्र और सिमेंटिक बाधाओं पर बाद के काम को प्रेरित किया है।

CycleGAN को अयुग्मित छवि अनुवाद के क्षेत्र में एक मौलिक योगदान माना जाता है, जो कृत्रिम-बुद्धिमत्ता अनुसंधान और व्यावहारिक रचनात्मक उपकरणों के बीच की खाई को पाटता है। इसका दृष्टिकोण फोटो संपादन और कलात्मक फिल्टर के लिए व्यावसायिक सॉफ्टवेयर में एकीकृत किया गया है। मॉडल की सफलता ने अयुग्मित डेटा के साथ सीखने के लिए एक सामान्य सिद्धांत के रूप में चक्र स्थिरता में रुचि भी बढ़ाई, जिसने वीडियो अनुवाद और 3D आकार निर्माण जैसे अन्य डोमेन में काम को प्रभावित किया।

मूल पेपर को हजारों बार उद्धृत किया गया है और यह कंप्यूटर विज़न पाठ्यक्रमों में एक मानक संदर्भ बना हुआ है। कोडबेस को बनाए रखा जा रहा है और शोध परियोजनाओं में उपयोग किया जा रहा है, और मॉडल की वास्तुकला को हल्के वेरिएंट के माध्यम से वास्तविक समय के अनुप्रयोगों के लिए अनुकूलित किया गया है। अयुग्मित डेटा से सीखने पर CycleGAN का जोर आधुनिक गहन-अधिगम अनुसंधान में एक प्रमुख प्रतिमान बन गया है, विशेष रूप से क्योंकि कई कार्यों के लिए डेटासेट अयुग्मित या संरेखित करने में कठिन बने हुए हैं।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-adversarial-networks·image-to-image-translation·deep-learning·computer-vision
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास