अंग्रेज़ी से अनुवादित

डिनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) जनरेटिव मॉडल का एक वर्ग है जो डेटा बनाने के लिए क्रमिक नॉइज़िंग प्रक्रिया को उलटना सीखते हैं, जो छवि निर्माण के लिए व्यापक रूप से उपयोग किए जाते हैं। 2020 में पेश किए गए, इन्होंने वैरिएशनल इन्फ्रेंस के माध्यम से पहले के डिफ्यूज़न तरीकों में सुधार किया।

डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) जनरेटिव मॉडल की एक श्रेणी हैं, जो मशीन लर्निंग में एक क्रमिक नॉइज़िंग प्रक्रिया को उलटना सीखकर डेटा उत्पन्न करते हैं। वे डिफ्यूज़न मॉडल के व्यापक परिवार से संबंधित हैं, जो डेटा को उच्च-आयामी स्थान में बहाव के साथ एक यादृच्छिक चाल से गुजरने के रूप में मॉडल करते हैं। DDPM को 2020 के एक पेपर में पेश किया गया था, जिसने वैरिएशनल इन्फ्रेंस का उपयोग करके पहले के डिफ्यूज़न-आधारित दृष्टिकोणों में सुधार किया, और वे कई आधुनिक छवि निर्माण प्रणालियों की नींव बन गए।

DDPM में, फॉरवर्ड प्रक्रिया समय-चरणों के अनुक्रम में एक छवि में गाऊसी शोर जोड़ती है, धीरे-धीरे इसे शुद्ध शोर में बदल देती है। मॉडल को इस प्रक्रिया को उलटने के लिए प्रशिक्षित किया जाता है, जो यादृच्छिक शोर से शुरू होकर यथार्थवादी छवि उत्पन्न करने के लिए पुनरावृत्त रूप से डीनॉइज़ करता है। यह दृष्टिकोण छवि निर्माण, इनपेंटिंग और सुपर-रिज़ॉल्यूशन जैसे कार्यों के लिए अत्यधिक प्रभावी साबित हुआ है, और यह स्टेबल डिफ्यूज़न और DALL-E जैसी वाणिज्यिक प्रणालियों को रेखांकित करता है।

मुख्य तंत्र

DDPM ढांचा शोर स्तरों की एक निश्चित अनुसूची के साथ एक फॉरवर्ड डिफ्यूज़न प्रक्रिया को परिभाषित करता है। किसी दी गई छवि के लिए, प्रत्येक समय-चरण पर एक वेरिएंस अनुसूची के अनुसार शोर जोड़ा जाता है, जिससे तेजी से शोर वाले संस्करणों का अनुक्रम उत्पन्न होता है। रिवर्स प्रक्रिया एक तंत्रिका नेटवर्क द्वारा सीखी जाती है, आमतौर पर एक U-Net या एक ट्रांसफॉर्मर, जो प्रत्येक चरण पर शोर घटक की भविष्यवाणी करता है। प्रशिक्षण पूर्वानुमानित और वास्तविक शोर के बीच एक सरल माध्य-वर्ग त्रुटि को कम करता है, जो वैरिएशनल इन्फ्रेंस के एक रूप के बराबर है।

गणितीय रूप से, फॉरवर्ड प्रक्रिया (0,1) में स्थिरांक \(\beta_1, \dots, \beta_T\) का उपयोग करती है, जिसमें \(\alpha_t = 1 - \beta_t\) और \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\) होता है। समय-चरण \(t\) पर शोर वाली छवि मूल छवि और गाऊसी शोर का एक रैखिक संयोजन है, जिसमें वेरिएंस \(\sigma_t^2 = 1 - \bar{\alpha}_t\) होता है। रिवर्स प्रक्रिया एक तंत्रिका नेटवर्क द्वारा पैरामीटराइज़ की जाती है जो डीनॉइज़िंग वितरण का माध्य आउटपुट करता है।

प्रशिक्षण और सैंपलिंग

DDPM को प्रशिक्षित करने में एक यादृच्छिक समय-चरण का नमूना लेना, छवि में संबंधित शोर जोड़ना और नेटवर्क को उस शोर की भविष्यवाणी करने के लिए प्रशिक्षित करना शामिल है। लॉस फ़ंक्शन \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\) है, जहां \(\epsilon\) शोर है और \(\epsilon_\theta\) नेटवर्क की भविष्यवाणी है। यह उद्देश्य लॉग-लाइक्लिहुड पर एक वैरिएशनल बाउंड से लिया गया है।

सैंपलिंग के समय, मॉडल शुद्ध गाऊसी शोर से शुरू होता है और रिवर्स प्रक्रिया को \(T\) चरणों के लिए पुनरावृत्त रूप से लागू करता है, हर बार शोर का एक हिस्सा हटाता है। चरणों की संख्या को डीनॉइज़िंग डिफ्यूज़न इम्प्लिसिट मॉडल (DDIM) जैसी तकनीकों का उपयोग करके या शोर अनुसूची सीखकर कम किया जा सकता है, जिससे तेज़ निर्माण संभव होता है।

ऐतिहासिक संदर्भ

डिफ्यूज़न मॉडल पहली बार 2015 में जैस्चा सोहल-डिकस्टीन और सहयोगियों सहित शोधकर्ताओं द्वारा प्रस्तावित किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स के सिद्धांतों का उपयोग करते थे। उन्होंने दिखाया कि एक जटिल डेटा वितरण को धीरे-धीरे एक सरल गाऊसी वितरण में विसरित किया जा सकता है, और इस प्रक्रिया को उलटना सीखने से नए नमूने उत्पन्न हो सकते हैं। हालांकि, शुरुआती तरीके कम्प्यूटेशनल रूप से महंगे थे और उस समय GAN की तुलना में कम प्रभावी थे।

2020 का DDPM पेपर, जो जोनाथन हो, अजय जैन और पीटर एबील द्वारा लिखा गया था, ने प्रदर्शित किया कि सावधानीपूर्वक चुनी गई शोर अनुसूची और U-Net बैकबोन के साथ, डिफ्यूज़न मॉडल अत्याधुनिक छवि निर्माण गुणवत्ता प्राप्त कर सकते हैं। इसने अनुसंधान और अनुप्रयोगों के तेजी से विस्तार को प्रेरित किया।

अनुप्रयोग और प्रभाव

2024 तक, DDPM और उनके वेरिएंट कंप्यूटर विज़न में छवि डीनॉइज़िंग, इनपेंटिंग, सुपर-रिज़ॉल्यूशन और टेक्स्ट-टू-इमेज निर्माण जैसे कार्यों के लिए व्यापक रूप से उपयोग किए जाते हैं। वे प्राकृतिक भाषा प्रसंस्करण में पाठ निर्माण और सारांशीकरण के लिए, और ऑडियो निर्माण में भी लागू होते हैं। स्टेबल डिफ्यूज़न और DALL-E जैसे वाणिज्यिक उत्पाद DDPM को टेक्स्ट एनकोडर और क्रॉस-अटेंशन मॉड्यूल के साथ जोड़ते हैं ताकि टेक्स्ट-कंडीशन्ड निर्माण सक्षम हो सके, जिससे वे व्यापक दर्शकों के लिए सुलभ हो जाते हैं।

DDPM ने सुदृढीकरण सीखने और वैज्ञानिक सिमुलेशन सहित अन्य क्षेत्रों को भी प्रभावित किया है, जहां उनका उपयोग जटिल वितरणों को मॉडल करने के लिए किया जाता है। उच्च-गुणवत्ता वाले नमूने उत्पन्न करने की उनकी क्षमता ने उन्हें आधुनिक कृत्रिम बुद्धिमत्ता अनुसंधान की आधारशिला बना दिया है।

सीमाएं और भविष्य की दिशाएं

अपनी सफलता के बावजूद, DDPM की सीमाएं हैं। पुनरावृत्त डीनॉइज़िंग प्रक्रिया के कारण सैंपलिंग आमतौर पर GAN की तुलना में धीमी होती है, हालांकि त्वरित विधियां विकसित की गई हैं। उन्हें प्रशिक्षण के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है, जिसने कुशल आर्किटेक्चर और AWS Trainium और Google Cloud TPU जैसे हार्डवेयर में रुचि बढ़ाई है। चल रहे शोध नमूना गुणवत्ता में सुधार, अनुमान समय कम करने और DDPM को नए मोडैलिटी तक विस्तारित करने पर केंद्रित है।

2025 तक, डिफ्यूज़न मॉडल अध्ययन का एक सक्रिय क्षेत्र बना हुआ है, जिसमें बैकबोन आर्किटेक्चर, शोर अनुसूचियों और कंडीशनिंग तंत्र में नवाचार जनरेटिव मॉडलिंग में संभव की सीमाओं को आगे बढ़ा रहे हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·machine-learning·computer-vision·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास