पार्टी एक स्वत:प्रतिगामी (autoregressive) टेक्स्ट-टू-इमेज मॉडल है, जिसे गूगल डीपमाइंड द्वारा विकसित किया गया है। यह छवि निर्माण को अनुक्रम-से-अनुक्रम (sequence-to-sequence) समस्या के रूप में मानकर पाठ्य विवरणों से छवियाँ उत्पन्न करता है, ठीक उसी तरह जैसे बड़े भाषा मॉडल पाठ उत्पन्न करते हैं। पार्टी को 2022 में पेश किया गया था और यह जटिल प्रॉम्प्ट, जिनमें कई वस्तुओं और विशिष्ट विशेषताओं वाले दृश्य शामिल हैं, से उच्च-गुणवत्ता वाली, फोटोयथार्थवादी छवियाँ बनाने की क्षमता के लिए उल्लेखनीय है।
मॉडल पहले एक एनकोडर का उपयोग करके इनपुट टेक्स्ट प्रॉम्प्ट को टोकनों के अनुक्रम में परिवर्तित करता है, और फिर स्वत:प्रतिगामी रूप से छवि टोकनों के अनुक्रम की भविष्यवाणी करता है। ये छवि टोकन एक असतत दृश्य कोडबुक से प्राप्त होते हैं, जिसे अलग से सीखा जाता है। यह दृष्टिकोण पार्टी को मॉडल आकार और प्रशिक्षण डेटा के साथ प्रभावी रूप से स्केल करने की अनुमति देता है, जिससे छवि गुणवत्ता और अर्थगत संरेखण में सुधार होता है।
आर्किटेक्चर
पार्टी की आर्किटेक्चर ट्रांसफॉर्मर मॉडल पर आधारित है। यह एक एनकोडर-डिकोडर संरचना का उपयोग करता है, जहाँ एनकोडर टेक्स्ट प्रॉम्प्ट को संसाधित करता है, और डिकोडर छवि टोकन अनुक्रम उत्पन्न करता है। दृश्य टोकन एक पूर्व-प्रशिक्षित विज़न ट्रांसफॉर्मर (ViT) मॉडल से प्राप्त होते हैं, जो एक टोकनाइज़र के रूप में कार्य करता है। डिकोडर को टेक्स्ट और पहले उत्पन्न टोकनों को देखते हुए अगले छवि टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जो मशीन लर्निंग अनुक्रम मॉडलिंग के अनुरूप है।
मॉडल को 350 मिलियन से 20 बिलियन पैरामीटर तक विभिन्न आकारों में प्रशिक्षित किया गया था। सबसे बड़ा संस्करण, पार्टी-20B, MS-COCO और लोकलाइज़्ड नैरेटिव्स जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्रदर्शित करता है, उच्च FID (फ्रेचेट इंसेप्शन डिस्टेंस) स्कोर प्राप्त करता है, जो उत्पन्न और वास्तविक छवि वितरणों के बीच समानता को मापता है।
प्रशिक्षण और डेटा
पार्टी को छवि-पाठ जोड़ों के एक बड़े डेटासेट पर प्रशिक्षित किया गया था, जिसमें सार्वजनिक रूप से उपलब्ध वेब डेटा और स्वामित्व डेटासेट शामिल थे। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: पहला, ViT-आधारित टोकनाइज़र का उपयोग करके दृश्य कोडबुक सीखना, और दूसरा, पाठ से छवि टोकनों की भविष्यवाणी करने के लिए स्वत:प्रतिगामी ट्रांसफॉर्मर को प्रशिक्षित करना। मॉडल को असतत छवि टोकनों पर मानक क्रॉस-एंट्रॉपी हानि का उपयोग करके अनुकूलित किया गया था।
गूगल ने बताया कि मॉडल आकार और प्रशिक्षण डेटा को बढ़ाने से छवि गुणवत्ता में लगातार सुधार हुआ, विशेष रूप से जटिल प्रॉम्प्ट के लिए जिन्हें रचनात्मक तर्क की आवश्यकता होती है। मॉडल ने कई वस्तुओं, स्थानिक संबंधों और शैलीगत विशेषताओं वाले प्रॉम्प्ट को संभालने की क्षमता भी दिखाई।
क्षमताएँ और सीमाएँ
पार्टी उच्च निष्ठा और अर्थगत सटीकता के साथ छवियाँ उत्पन्न करने में उत्कृष्ट है। यह ऐसे प्रॉम्प्ट से छवियाँ बना सकता है जो विशिष्ट दृश्यों का वर्णन करते हैं, जैसे "एक बिल्ली की तस्वीर जिसने टोपी पहनी है" या "सूर्यास्त के समय एक भविष्यवादी शहर की पेंटिंग।" मॉडल पाठ प्रतिपादन का भी समर्थन करता है, जो कई छवि निर्माण मॉडल के लिए एक चुनौतीपूर्ण कार्य है। हालाँकि, पार्टी की सीमाएँ हैं, जिनमें बारीक विवरणों में कभी-कभी त्रुटियाँ शामिल हैं, जैसे गलत वस्तु गणना या मामूली विशेषता बेमेल। इसके लिए प्रशिक्षण और अनुमान के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है।
अन्य मॉडलों के साथ तुलना
पार्टी को DALL-E 2 और Imagen जैसे अन्य टेक्स्ट-टू-इमेज मॉडलों के साथ समवर्ती रूप से विकसित किया गया था। जबकि Imagen एक प्रसार-आधारित दृष्टिकोण का उपयोग करता है, पार्टी स्वत:प्रतिगामी है, जो इसे अनुक्रम मॉडलिंग में प्रगति का लाभ उठाने की अनुमति देता है। मूल्यांकनों में, पार्टी-20B ने MS-COCO जैसे बेंचमार्क पर DALL-E 2 और Imagen की तुलना में प्रतिस्पर्धात्मक या बेहतर परिणाम प्राप्त किए, विशेष रूप से FID स्कोर और मानव मूल्यांकन के संदर्भ में। हालाँकि, Imagen जैसे प्रसार मॉडल कुछ सौंदर्य गुणों पर मजबूत प्रदर्शन के लिए जाने गए, जबकि पार्टी अर्थगत संरेखण और जटिल तर्क में उत्कृष्ट था।
प्रभाव और विरासत
पार्टी ने छवि संश्लेषण में जनरेटिव एआई के तेजी से विकास में योगदान दिया। इसके स्वत:प्रतिगामी दृष्टिकोण ने एकीकृत मल्टीमॉडल मॉडलों में बाद के शोध को प्रभावित किया, जहाँ पाठ और छवियों को एक साझा टोकन स्थान में संसाधित किया जाता है। पार्टी की कोडबुक और स्केलिंग अंतर्दृष्टि को बाद में गूगल के अन्य मॉडलों, जैसे जेमिनी परिवार, में शामिल किया गया, जो पाठ, छवि और ऑडियो निर्माण को एकीकृत करते हैं। मॉडल ने दृष्टि-भाषा कार्यों में स्केलिंग कानूनों के महत्व को भी उजागर किया, जो डीप लर्निंग अनुसंधान में निष्कर्षों के साथ संरेखित है।