अंग्रेज़ी से अनुवादित

डिफ्यूज़न मॉडल जनरेटिव मॉडल का एक वर्ग है जो नॉइज़िंग प्रक्रिया को उलटना सीखते हैं, जिससे नए डेटा नमूनों का निर्माण संभव होता है। इनका व्यापक रूप से छवि और वीडियो निर्माण के लिए उपयोग किया जाता है, अक्सर टेक्स्ट-कंडीशन्ड आउटपुट के लिए टेक्स्ट एनकोडर के साथ संयुक्त रूप से।

डिफ्यूज़न मॉडल, जिन्हें डिफ्यूज़न-आधारित जनरेटिव मॉडल या स्कोर-आधारित जनरेटिव मॉडल के रूप में भी जाना जाता है, मशीन-लर्निंग में लैटेंट वेरिएबल जनरेटिव मॉडल का एक वर्ग हैं। इनमें दो मुख्य घटक होते हैं: एक फॉरवर्ड डिफ्यूज़न प्रक्रिया जो धीरे-धीरे डेटा में शोर जोड़ती है, और एक रिवर्स सैंपलिंग प्रक्रिया जो डीनॉइज़ करना सीखती है। लक्ष्य किसी दिए गए डेटासेट के लिए एक डिफ्यूज़न प्रक्रिया सीखना है ताकि नए तत्व उत्पन्न किए जा सकें जो मूल डेटा के समान वितरित हों। एक प्रशिक्षित डिफ्यूज़न मॉडल को विभिन्न तरीकों से सैंपल किया जा सकता है, जिसमें दक्षता और गुणवत्ता में अलग-अलग समझौते होते हैं।

डिफ्यूज़न मॉडल 2015 में पेश किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स की तकनीकों पर आधारित थे। मूल विचार डेटा के वितरण को उच्च-आयामी स्थान में एक "बादल" के रूप में मॉडल करना है। बार-बार शोर जोड़कर, यह बादल बाहर की ओर फैलता है जब तक कि यह गाऊसी वितरण से लगभग अप्रभेद्य न हो जाए। एक मॉडल जो इस डिफ्यूज़न को लगभग पूर्ववत करना सीखता है, वह यादृच्छिक शोर से शुरू करके और पुनरावृत्त रूप से डीनॉइज़ करके मूल वितरण से नए नमूने उत्पन्न कर सकता है।

फॉर्मलिज़्म और प्रशिक्षण

डिफ्यूज़न मॉडल के लिए कई समकक्ष फॉर्मलिज़्म हैं, जिनमें मार्कोव चेन, डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM), शोर-कंडीशन्ड स्कोर नेटवर्क, और स्टोकेस्टिक डिफरेंशियल समीकरण शामिल हैं। इन्हें आमतौर पर वैरिएशनल इन्फ्रेंस का उपयोग करके प्रशिक्षित किया जाता है। डीनॉइज़िंग के लिए जिम्मेदार मॉडल को "बैकबोन" कहा जाता है, जो कोई भी आर्किटेक्चर हो सकता है लेकिन आमतौर पर यह U-Net या ट्रांसफॉर्मर होता है। 2020 का DDPM पेपर डिफ्यूज़न प्रक्रिया पर वैरिएशनल इन्फ्रेंस लागू करके पहले के तरीकों में सुधार किया।

कंप्यूटर विज़न में अनुप्रयोग

2024 तक, डिफ्यूज़न मॉडल मुख्य रूप से कंप्यूटर विज़न कार्यों के लिए उपयोग किए जाते हैं, जिनमें इमेज डीनॉइज़िंग, इनपेंटिंग, सुपर-रिज़ॉल्यूशन, इमेज जनरेशन, और वीडियो जनरेशन शामिल हैं। इन कार्यों में आमतौर पर एक तंत्रिका नेटवर्क को गाऊसी शोर से धुंधली छवियों को क्रमिक रूप से डीनॉइज़ करने के लिए प्रशिक्षित करना शामिल होता है। अभिसरण के लिए प्रशिक्षण के बाद, मॉडल यादृच्छिक शोर से शुरू करके और शोर को हटाने के लिए नेटवर्क को पुनरावृत्त रूप से लागू करके छवियां उत्पन्न कर सकता है। डिफ्यूज़न-आधारित इमेज जनरेटर ने व्यापक व्यावसायिक रुचि देखी है, जिसमें स्टेबल डिफ्यूज़न और DALL-E जैसे उल्लेखनीय उदाहरण शामिल हैं। ये सिस्टम अक्सर टेक्स्ट-कंडीशन्ड जनरेशन को सक्षम करने के लिए डिफ्यूज़न मॉडल को टेक्स्ट एनकोडर और क्रॉस-अटेंशन मॉड्यूल के साथ जोड़ते हैं।

अन्य डोमेन

कंप्यूटर विज़न से परे, डिफ्यूज़न मॉडल ने प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग पाए हैं, जैसे टेक्स्ट जनरेशन और सारांशीकरण, साथ ही ध्वनि जनरेशन और रीइन्फोर्समेंट लर्निंग में भी। उनकी बहुमुखी प्रतिभा ने उन्हें जनरेटिव-एआई में अनुसंधान का एक प्रमुख क्षेत्र बना दिया है।

अन्य जनरेटिव मॉडल से संबंध

डिफ्यूज़न मॉडल जनरेटिव मॉडल के व्यापक परिदृश्य का हिस्सा हैं, जिसमें बड़े-भाषा-मॉडल और अन्य दृष्टिकोण भी शामिल हैं। जबकि बड़े भाषा मॉडल आमतौर पर ऑटोरेग्रेसिव या ट्रांसफॉर्मर-आधारित आर्किटेक्चर पर निर्भर करते हैं, डिफ्यूज़न मॉडल एक वैकल्पिक प्रतिमान प्रदान करते हैं जो छवियों और ऑडियो जैसे सतत डेटा के लिए विशेष रूप से प्रभावी है। बैकबोन का चुनाव, चाहे U-Net हो या ट्रांसफॉर्मर, डिफ्यूज़न मॉडल को डीप-लर्निंग और न्यूरल-नेटवर्क अनुसंधान में प्रगति का लाभ उठाने की अनुमति देता है।

भविष्य की दिशाएँ

अनुसंधान डिफ्यूज़न मॉडल की दक्षता और गुणवत्ता में सुधार जारी रखता है, नए सैंपलिंग तरीकों, बैकबोन आर्किटेक्चर और अनुप्रयोगों की खोज करता है। डिफ्यूज़न मॉडल का अन्य AI प्रणालियों के साथ एकीकरण, जैसे कि ओपनएआई, गूगल-डीपमाइंड, और एंथ्रोपिक द्वारा विकसित, कृत्रिम-बुद्धिमत्ता में आगे नवाचार को बढ़ावा देने की संभावना है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·machine-learning·deep-learning·computer-vision
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास