Muse एक टेक्स्ट-टू-इमेज जनरेटिव मॉडल है जिसे Google द्वारा विकसित किया गया है, जिसकी घोषणा पहली बार जनवरी 2023 में एक शोध पत्र में की गई थी। यह ट्रांसफॉर्मर-आधारित मॉडलों के परिवार से संबंधित है और इसे पाठ्य विवरणों से उच्च-रिज़ॉल्यूशन वाली छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया है। स्टेबल डिफ्यूज़न या DALL-E जैसे डिफ्यूज़न-आधारित मॉडलों के विपरीत, Muse संपीड़ित छवि स्थान में असतत टोकन पर काम करता है, जो बड़े भाषा मॉडल में मास्क्ड भाषा मॉडलिंग से प्रेरित एक मास्क्ड जनरेटिव दृष्टिकोण का उपयोग करता है।
यह मॉडल Google और Google DeepMind के शोधकर्ताओं द्वारा विकसित किया गया था, जो वेक्टर क्वांटाइज़ेशन और ट्रांसफॉर्मर आर्किटेक्चर में पिछले कार्यों पर आधारित था। इसे "Muse: Text-To-Image Generation via Masked Generative Transformers" नामक पेपर में सार्वजनिक रूप से विस्तृत किया गया था, जिसने MS-COCO जैसे बेंचमार्क पर अत्याधुनिक परिणाम और शून्य-शॉट जनरेशन क्षमताओं का प्रदर्शन किया। Google ने Muse को डिफ्यूज़न मॉडलों के अधिक कुशल विकल्प के रूप में प्रस्तुत किया, जिसमें प्रतिस्पर्धी छवि गुणवत्ता बनाए रखते हुए तेज़ अनुमान समय का दावा किया गया।
आर्किटेक्चर
Muse दो-चरणीय पाइपलाइन का उपयोग करता है। पहले, एक पूर्व-प्रशिक्षित वैरिएशनल ऑटोएनकोडर (VAE) छवियों को एक असतत टोकन ग्रिड में संपीड़ित करता है, जो VQGAN या VQ-VAE में उपयोग किए गए दृष्टिकोण के समान है। दूसरे, एक ट्रांसफॉर्मर मॉडल को इस ग्रिड में मास्क्ड टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जो एक फ्रोज़न बड़े भाषा मॉडल (विशेष रूप से T5) द्वारा उत्पन्न टेक्स्ट एम्बेडिंग पर आधारित होता है। जनरेशन के दौरान, मॉडल सभी टोकन मास्क्ड के साथ शुरू होता है और कई चरणों में सबसे अधिक आत्मविश्वास वाले टोकन की भविष्यवाणी करता है, बाकी को भरता जाता है। यह मास्क्ड मॉडलिंग तकनीक समानांतर डिकोडिंग की अनुमति देती है, जो ऑटोरेग्रेसिव मॉडलों की तुलना में जनरेशन को तेज़ करती है।
टेक्स्ट एनकोडर एक फ्रोज़न T5-XXL मॉडल है, जो समृद्ध शब्दार्थ प्रतिनिधित्व प्रदान करता है। इमेज टोकनाइज़र एक VAE है जो छवियों के एक बड़े डेटासेट पर प्रशिक्षित है, जो कॉन्फ़िगरेशन के आधार पर 256x256 या 512x512 टोकन ग्रिड उत्पन्न करता है। ट्रांसफॉर्मर स्वयं एक मानक एनकोडर-डिकोडर आर्किटेक्चर है, जिसमें टेक्स्ट एम्बेडिंग एनकोडर इनपुट के रूप में और मास्क्ड इमेज टोकन डिकोडर इनपुट के रूप में होते हैं।
प्रशिक्षण और डेटा
Muse को छवि-टेक्स्ट जोड़ों के एक बड़े कॉर्पस पर प्रशिक्षित किया गया था, जिसमें सार्वजनिक रूप से उपलब्ध LAION-5B डेटासेट और आंतरिक Google डेटासेट शामिल हैं। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: पहले, VAE को केवल छवियों पर अलग से प्रशिक्षित किया गया था; फिर, ट्रांसफॉर्मर को टेक्स्ट और अनमास्क्ड संदर्भ दिए जाने पर मास्क्ड टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था। मॉडल को TPU v4 पॉड्स पर प्रशिक्षित किया गया था, जिसमें सबसे बड़े वेरिएंट में 3 बिलियन पैरामीटर थे। पेपर ने बताया कि Muse ने MS-COCO पर 7.9 का शून्य-शॉट FID स्कोर हासिल किया, जो उस समय GLIDE और DALL-E 2 जैसे पहले के डिफ्यूज़न मॉडलों से बेहतर प्रदर्शन करता था।
क्षमताएँ
यह मॉडल टेक्स्ट-टू-इमेज जनरेशन से परे कई कार्यों का समर्थन करता है। यह एक इनपुट छवि को आंशिक रूप से मास्क करके और एक टेक्स्ट प्रॉम्प्ट प्रदान करके छवि संपादन कर सकता है, जिससे स्थानीयकृत परिवर्तन संभव होते हैं। यह आउटपेंटिंग (किसी छवि को उसकी सीमाओं से परे विस्तारित करना) और इनपेंटिंग (लापता क्षेत्रों को भरना) का भी समर्थन करता है। इसके अतिरिक्त, Muse परिवर्तनीय पहलू अनुपात वाली छवियाँ उत्पन्न कर सकता है और विशिष्ट शैलियों या डोमेन के लिए फाइन-ट्यून किया जा सकता है। पेपर ने प्रदर्शित किया कि Muse एक एकल TPU पर लगभग 1.5 सेकंड में उच्च-गुणवत्ता वाली 512x512 छवियाँ उत्पन्न कर सकता है, जो कई डीनॉइज़िंग चरणों की आवश्यकता वाले डिफ्यूज़न मॉडलों की तुलना में काफी तेज़ है।
अन्य मॉडलों के साथ तुलना
Muse की तुलना अक्सर DALL-E 2 और Imagen से की जाती है, जो दोनों डिफ्यूज़न प्रक्रियाओं का उपयोग करते हैं। डिफ्यूज़न मॉडल धीरे-धीरे शोर जोड़ते और हटाते हैं, जिसके लिए सैकड़ों चरणों की आवश्यकता होती है। इसके विपरीत, Muse एक असतत टोकन दृष्टिकोण का उपयोग करता है जिसमें पुनरावृत्त अनमास्किंग होती है, जिसके लिए आमतौर पर केवल 10-20 चरणों की आवश्यकता होती है। यह इसे अनुमान के दौरान अधिक कम्प्यूटेशनल रूप से कुशल बनाता है। हालाँकि, डिफ्यूज़न मॉडल उत्पादन प्रणालियों में अधिक व्यापक रूप से अपनाए गए हैं, आंशिक रूप से उनकी सरलता और मजबूती के कारण। असतत टोकन स्थान पर Muse की निर्भरता कभी-कभी कलाकृतियों का कारण बन सकती है, विशेष रूप से जटिल बनावट या बारीक विवरण के साथ।
स्वागत और प्रभाव
Muse को शोध समुदाय में छवि डोमेन में मास्क्ड मॉडलिंग के अभिनव उपयोग के लिए अच्छी तरह से प्राप्त किया गया था। इसने असतत डिफ्यूज़न और टोकन-आधारित जनरेशन पर बाद के कार्यों को प्रभावित किया। हालाँकि, Google ने Muse को सार्वजनिक उत्पाद या API के रूप में जारी नहीं किया, जैसा कि इसके बाद के मॉडलों जैसे Imagen या Gemini के साथ किया गया। कोड और वेट्स को ओपन-सोर्स नहीं किया गया था, जिससे पुनरुत्पादकता सीमित हो गई। फिर भी, Muse के विचारों को बाद के Google मॉडलों में शामिल किया गया है और Parti और MuseGAN जैसे ओपन-सोर्स प्रयासों को प्रेरित किया है।
यह भी देखें
संदर्भ
- Chang, H., et al. (2023). "Muse: Text-To-Image Generation via Masked Generative Transformers." arXiv:2301.00704.
- Google AI Blog. (2023). "Muse: A New Text-to-Image Model."