फ्लो-आधारित जनरेटिव मॉडल मशीन-लर्निंग में जनरेटिव मॉडल का एक वर्ग है जो एक सरल आधार वितरण, जैसे कि मानक सामान्य वितरण, पर व्युत्क्रमणीय परिवर्तनों की एक श्रृंखला लागू करके जटिल संभाव्यता वितरण का निर्माण करते हैं। अन्य जनरेटिव दृष्टिकोणों के विपरीत जो संभावनाओं का अप्रत्यक्ष रूप से अनुमान लगाते हैं, फ्लो-आधारित मॉडल एक द्विआधारी फलन के माध्यम से डेटा स्थान और एक अव्यक्त स्थान के बीच मैपिंग को स्पष्ट रूप से सीखते हैं। यह व्युत्क्रमणीयता सटीक संभावना गणना और कुशल जनन दोनों की अनुमति देती है, जो उन्हें अवशिष्ट नेटवर्क या यू-नेट जैसे मॉडलों से अलग बनाती है जो स्वाभाविक रूप से व्युत्क्रमणीय नहीं होते हैं।
मूल सिद्धांत चर-परिवर्तन सूत्र पर निर्भर करता है, जो परिवर्तित डेटा की संभाव्यता घनत्व को आधार वितरण और परिवर्तन के जैकोबियन निर्धारक से संबंधित करता है। सुगम जैकोबियन वाले परिवर्तनों को डिज़ाइन करके, मॉडल को अधिकतम संभावना अनुमान के माध्यम से प्रशिक्षित किया जा सकता है। इस गुण ने फ्लो-आधारित मॉडल को डीप-लर्निंग में एक मौलिक उपकरण के रूप में स्थापित किया है, विशेष रूप से सटीक घनत्व अनुमान की आवश्यकता वाले कार्यों के लिए, जैसे कि विसंगति का पता लगाना और छवि जनन।
ऐतिहासिक विकास
फ्लो-आधारित मॉडल की अवधारणात्मक नींव 1990 के दशक में नॉर्मलाइज़िंग फ्लो पर पहले के काम से जुड़ी है, लेकिन व्यावहारिक डीप-लर्निंग कार्यान्वयन 2010 के दशक में उभरे। एक प्रमुख मील का पत्थर 2016 में RealNVP आर्किटेक्चर की शुरुआत थी, जिसने त्रिकोणीय जैकोबियन के साथ व्युत्क्रमणीय परिवर्तन बनाने के लिए एफ़िन कपलिंग परतों का उपयोग किया। इसके बाद 2018 में Glow आया, जिसने व्युत्क्रमणीय 1x1 कनवल्शन और बहु-स्तरीय आर्किटेक्चर के साथ दृष्टिकोण का विस्तार किया, जिससे उच्च-रिज़ॉल्यूशन छवि संश्लेषण संभव हुआ।
टोरंटो विश्वविद्यालय और स्टैनफोर्ड एआई लैब जैसे संस्थानों के शोधकर्ताओं ने सैद्धांतिक प्रगति में महत्वपूर्ण योगदान दिया, जबकि गूगल डीपमाइंड और ओपनएआई जैसी औद्योगिक प्रयोगशालाओं ने घनत्व अनुमान और प्रतिनिधित्व सीखने में अनुप्रयोगों की खोज की। इस क्षेत्र को तंत्रिका नेटवर्क और एडम ऑप्टिमाइज़र और बैच-नॉर्मलाइज़ेशन जैसी अनुकूलन तकनीकों पर समानांतर काम से भी लाभ हुआ, जिसने प्रशिक्षण स्थिरता में सुधार किया।
गणितीय सूत्रीकरण
एक फ्लो-आधारित मॉडल एक परिवर्तन f: X -> Z परिभाषित करता है, जहाँ X डेटा स्थान है और Z एक सरल वितरण के साथ अव्यक्त स्थान है, आमतौर पर एक मानक गाऊसी। परिवर्तन K व्युत्क्रमणीय फलनों से बना है, f = f_K ∘ ... ∘ f_1, प्रत्येक में सुगम जैकोबियन है। डेटा बिंदु x की लॉग-संभावना की गणना log p_X(x) = log p_Z(f(x)) + log |det J_f(x)| के रूप में की जाती है, जहाँ J_f, f का जैकोबियन मैट्रिक्स है।
RealNVP में उपयोग किए गए कपलिंग परतों का डिज़ाइन इनपुट को दो भागों में विभाजित करता है, एक को अपरिवर्तित छोड़ता है और दूसरे को पहले से प्राप्त स्केल और शिफ्ट मापदंडों के आधार पर परिवर्तित करता है। यह व्युत्क्रमणीयता और एक निचला-त्रिकोणीय जैकोबियन सुनिश्चित करता है, जिससे निर्धारक गणना कुशल हो जाती है। लेयर-नॉर्मलाइज़ेशन या ड्रॉपआउट का उपयोग करने वाले अधिक उन्नत आर्किटेक्चर को व्युत्क्रमणीयता बनाए रखते हुए सामान्यीकरण में सुधार के लिए अनुकूलित किया गया है।
अनुप्रयोग और उपयोग के मामले
फ्लो-आधारित मॉडल ने कई डोमेन में अनुप्रयोग पाए हैं। छवि जनन में, वे सटीक संभावना स्कोर के साथ उच्च-गुणवत्ता वाले नमूने उत्पन्न करते हैं, जिससे मॉडल प्रदर्शन की सीधी तुलना संभव होती है। घनत्व अनुमान के लिए, उनका उपयोग आउटलायर का पता लगाने और अनिश्चितता मात्रा निर्धारण में किया जाता है, जहाँ सटीक संभावनाएँ महत्वपूर्ण होती हैं। कृत्रिम-बुद्धिमत्ता अनुसंधान में, वे हाइब्रिड मॉडल में घटकों के रूप में कार्य करते हैं, जैसे कि समृद्ध पोस्टीरियर के लिए नॉर्मलाइज़िंग फ्लो वाले वैरिएशनल ऑटोएनकोडर।
ऑडियो डोमेन में, फ्लो-आधारित मॉडल को वाक् संश्लेषण और आवाज़ रूपांतरण पर लागू किया गया है, जो अनुक्रमिक निर्भरताओं को मॉडल करने की उनकी क्षमता का लाभ उठाते हैं। अनुक्रम-से-अनुक्रम ढांचे को टेक्स्ट-टू-स्पीच सिस्टम के लिए फ्लो के साथ जोड़ा गया है। इसके अतिरिक्त, फ्लो-आधारित मॉडल को डेटा-ऑग्मेंटेशन के लिए खोजा गया है, जहाँ नियंत्रित गुणों के साथ सिंथेटिक डेटा उत्पन्न करना फायदेमंद होता है।
अन्य जनरेटिव मॉडल के साथ तुलना
फ्लो-आधारित मॉडल बड़े भाषा मॉडल और ट्रांसफॉर्मर से मौलिक रूप से भिन्न हैं, जो ऑटोरेग्रेसिव हैं और निरंतर डेटा के लिए सटीक संभावनाएँ प्रदान नहीं करते हैं। वे जनरेटिव एडवर्सेरियल नेटवर्क (GAN) से भी भिन्न हैं, जो एडवर्सेरियल प्रशिक्षण का उपयोग करते हैं और सुगम संभावना की कमी रखते हैं। छवि जनन के लिए प्रमुखता प्राप्त करने वाले डिफ्यूज़न मॉडल की तुलना में, फ्लो-आधारित मॉडल अपनी एकल-पास व्युत्क्रमणीयता के कारण तेज़ सैंपलिंग प्रदान करते हैं, हालाँकि तुलनीय अभिव्यक्ति प्राप्त करने के लिए उन्हें अक्सर अधिक मापदंडों की आवश्यकता होती है।
हाल के शोध ने फ्लो और डिफ्यूज़न मॉडल के बीच संबंधों की खोज की है, कुछ ढांचे उन्हें एक सतत-समय परिप्रेक्ष्य के तहत एकीकृत करते हैं। इससे बेहतर प्रशिक्षण तकनीकें और सैद्धांतिक अंतर्दृष्टि प्राप्त हुई हैं, जैसा कि अनिमा आनंदकुमार और सैमी बेंगियो जैसे शोधकर्ताओं ने चर्चा की है। इन मॉडलों के बीच चुनाव सैंपलिंग गति, संभावना सटीकता और आर्किटेक्चरल लचीलेपन के बीच व्यापार-बंद पर निर्भर करता है।
सीमाएँ और भविष्य की दिशाएँ
फ्लो-आधारित मॉडल की एक प्राथमिक सीमा व्युत्क्रमणीयता की बाधा है, जो आर्किटेक्चर को प्रतिबंधित करती है और उच्च-आयामी डेटा के लिए उच्च कम्प्यूटेशनल लागत का कारण बन सकती है। जैकोबियन निर्धारक गणना, हालांकि कपलिंग परतों के लिए कुशल है, फिर भी सरल मॉडल की तुलना में अतिरिक्त ओवरहेड जोड़ती है। इसके अतिरिक्त, फ्लो की अभिव्यक्ति परिवर्तनों की गहराई और चौड़ाई से सीमित है, जिसके लिए जटिल निर्भरताओं को पकड़ने के लिए सावधानीपूर्वक डिज़ाइन की आवश्यकता होती है।
भविष्य की दिशाओं में अधिक लचीली व्युत्क्रमणीय परतें विकसित करना शामिल है, जैसे कि मल्टी-हेड-अटेंशन तंत्र पर आधारित, और अभिसरण में सुधार के लिए फ्लो को पाठ्यक्रम-सीखने रणनीतियों के साथ एकीकृत करना। मॉडल-प्रूनिंग और एडब्ल्यूएस ट्रेनियम और ग्रॉक जैसे विशेष हार्डवेयर पर कुशल कार्यान्वयन पर शोध भी जारी है। जैसे-जैसे क्षेत्र परिपक्व होता है, फ्लो-आधारित मॉडल जनरेटिव मॉडलिंग टूलकिट में एक प्रमुख घटक बने रहने की संभावना है, जो जनरेटिव-एआई अनुप्रयोगों में अन्य दृष्टिकोणों का पूरक होगा।
यह भी देखें
संदर्भ
- Dinh, L., Sohl-Dickstein, J., & Bengio, S. (2016). Density estimation using Real NVP.
- Kingma, D. P., & Dhariwal, P. (2018). Glow: Generative flow with invertible 1x1 convolutions.
- Rezende, D. J., & Mohamed, S. (2015). Variational inference with normalizing flows.