डिफ्यूज़न मॉडल, जिन्हें डिफ्यूज़न-आधारित जनरेटिव मॉडल या स्कोर-आधारित जनरेटिव मॉडल के रूप में भी जाना जाता है, मशीन-लर्निंग में लैटेंट वेरिएबल जनरेटिव मॉडल का एक वर्ग हैं। इनमें दो मुख्य घटक होते हैं: एक फॉरवर्ड डिफ्यूज़न प्रक्रिया जो धीरे-धीरे डेटा में शोर जोड़ती है, और एक रिवर्स सैंपलिंग प्रक्रिया जो डीनॉइज़ करना सीखती है। लक्ष्य किसी दिए गए डेटासेट के लिए एक डिफ्यूज़न प्रक्रिया सीखना है ताकि नए तत्व उत्पन्न किए जा सकें जो मूल डेटा के समान वितरित हों। एक प्रशिक्षित डिफ्यूज़न मॉडल को विभिन्न तरीकों से सैंपल किया जा सकता है, जिसमें दक्षता और गुणवत्ता में अलग-अलग समझौते होते हैं।
डिफ्यूज़न मॉडल 2015 में पेश किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स की तकनीकों पर आधारित थे। मूल विचार डेटा के वितरण को उच्च-आयामी स्थान में एक "बादल" के रूप में मॉडल करना है। बार-बार शोर जोड़कर, यह बादल बाहर की ओर फैलता है जब तक कि यह गाऊसी वितरण से लगभग अप्रभेद्य न हो जाए। एक मॉडल जो इस डिफ्यूज़न को लगभग पूर्ववत करना सीखता है, वह यादृच्छिक शोर से शुरू करके और पुनरावृत्त रूप से डीनॉइज़ करके मूल वितरण से नए नमूने उत्पन्न कर सकता है।
फॉर्मलिज़्म और प्रशिक्षण
डिफ्यूज़न मॉडल के लिए कई समकक्ष फॉर्मलिज़्म हैं, जिनमें मार्कोव चेन, डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM), शोर-कंडीशन्ड स्कोर नेटवर्क, और स्टोकेस्टिक डिफरेंशियल समीकरण शामिल हैं। इन्हें आमतौर पर वैरिएशनल इन्फ्रेंस का उपयोग करके प्रशिक्षित किया जाता है। डीनॉइज़िंग के लिए जिम्मेदार मॉडल को "बैकबोन" कहा जाता है, जो कोई भी आर्किटेक्चर हो सकता है लेकिन आमतौर पर यह U-Net या ट्रांसफॉर्मर होता है। 2020 का DDPM पेपर डिफ्यूज़न प्रक्रिया पर वैरिएशनल इन्फ्रेंस लागू करके पहले के तरीकों में सुधार किया।
कंप्यूटर विज़न में अनुप्रयोग
2024 तक, डिफ्यूज़न मॉडल मुख्य रूप से कंप्यूटर विज़न कार्यों के लिए उपयोग किए जाते हैं, जिनमें इमेज डीनॉइज़िंग, इनपेंटिंग, सुपर-रिज़ॉल्यूशन, इमेज जनरेशन, और वीडियो जनरेशन शामिल हैं। इन कार्यों में आमतौर पर एक तंत्रिका नेटवर्क को गाऊसी शोर से धुंधली छवियों को क्रमिक रूप से डीनॉइज़ करने के लिए प्रशिक्षित करना शामिल होता है। अभिसरण के लिए प्रशिक्षण के बाद, मॉडल यादृच्छिक शोर से शुरू करके और शोर को हटाने के लिए नेटवर्क को पुनरावृत्त रूप से लागू करके छवियां उत्पन्न कर सकता है। डिफ्यूज़न-आधारित इमेज जनरेटर ने व्यापक व्यावसायिक रुचि देखी है, जिसमें स्टेबल डिफ्यूज़न और DALL-E जैसे उल्लेखनीय उदाहरण शामिल हैं। ये सिस्टम अक्सर टेक्स्ट-कंडीशन्ड जनरेशन को सक्षम करने के लिए डिफ्यूज़न मॉडल को टेक्स्ट एनकोडर और क्रॉस-अटेंशन मॉड्यूल के साथ जोड़ते हैं।
अन्य डोमेन
कंप्यूटर विज़न से परे, डिफ्यूज़न मॉडल ने प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग पाए हैं, जैसे टेक्स्ट जनरेशन और सारांशीकरण, साथ ही ध्वनि जनरेशन और रीइन्फोर्समेंट लर्निंग में भी। उनकी बहुमुखी प्रतिभा ने उन्हें जनरेटिव-एआई में अनुसंधान का एक प्रमुख क्षेत्र बना दिया है।
अन्य जनरेटिव मॉडल से संबंध
डिफ्यूज़न मॉडल जनरेटिव मॉडल के व्यापक परिदृश्य का हिस्सा हैं, जिसमें बड़े-भाषा-मॉडल और अन्य दृष्टिकोण भी शामिल हैं। जबकि बड़े भाषा मॉडल आमतौर पर ऑटोरेग्रेसिव या ट्रांसफॉर्मर-आधारित आर्किटेक्चर पर निर्भर करते हैं, डिफ्यूज़न मॉडल एक वैकल्पिक प्रतिमान प्रदान करते हैं जो छवियों और ऑडियो जैसे सतत डेटा के लिए विशेष रूप से प्रभावी है। बैकबोन का चुनाव, चाहे U-Net हो या ट्रांसफॉर्मर, डिफ्यूज़न मॉडल को डीप-लर्निंग और न्यूरल-नेटवर्क अनुसंधान में प्रगति का लाभ उठाने की अनुमति देता है।
भविष्य की दिशाएँ
अनुसंधान डिफ्यूज़न मॉडल की दक्षता और गुणवत्ता में सुधार जारी रखता है, नए सैंपलिंग तरीकों, बैकबोन आर्किटेक्चर और अनुप्रयोगों की खोज करता है। डिफ्यूज़न मॉडल का अन्य AI प्रणालियों के साथ एकीकरण, जैसे कि ओपनएआई, गूगल-डीपमाइंड, और एंथ्रोपिक द्वारा विकसित, कृत्रिम-बुद्धिमत्ता में आगे नवाचार को बढ़ावा देने की संभावना है।