अंग्रेज़ी से अनुवादित

पार्टी एक ऑटोरेग्रेसिव टेक्स्ट-टू-इमेज मॉडल है जिसे Google द्वारा विकसित किया गया है, जो पाठ्य विवरणों से उच्च-गुणवत्ता वाली छवियाँ उत्पन्न करता है। यह छवियों को दृश्य टोकनों के अनुक्रम के रूप में उत्पन्न करने के लिए ट्रांसफॉर्मर-आधारित अनुक्रम-से-अनुक्रम दृष्टिकोण का उपयोग करता है।

पार्टी एक स्वत:प्रतिगामी (autoregressive) टेक्स्ट-टू-इमेज मॉडल है, जिसे गूगल डीपमाइंड द्वारा विकसित किया गया है। यह छवि निर्माण को अनुक्रम-से-अनुक्रम (sequence-to-sequence) समस्या के रूप में मानकर पाठ्य विवरणों से छवियाँ उत्पन्न करता है, ठीक उसी तरह जैसे बड़े भाषा मॉडल पाठ उत्पन्न करते हैं। पार्टी को 2022 में पेश किया गया था और यह जटिल प्रॉम्प्ट, जिनमें कई वस्तुओं और विशिष्ट विशेषताओं वाले दृश्य शामिल हैं, से उच्च-गुणवत्ता वाली, फोटोयथार्थवादी छवियाँ बनाने की क्षमता के लिए उल्लेखनीय है।

मॉडल पहले एक एनकोडर का उपयोग करके इनपुट टेक्स्ट प्रॉम्प्ट को टोकनों के अनुक्रम में परिवर्तित करता है, और फिर स्वत:प्रतिगामी रूप से छवि टोकनों के अनुक्रम की भविष्यवाणी करता है। ये छवि टोकन एक असतत दृश्य कोडबुक से प्राप्त होते हैं, जिसे अलग से सीखा जाता है। यह दृष्टिकोण पार्टी को मॉडल आकार और प्रशिक्षण डेटा के साथ प्रभावी रूप से स्केल करने की अनुमति देता है, जिससे छवि गुणवत्ता और अर्थगत संरेखण में सुधार होता है।

आर्किटेक्चर

पार्टी की आर्किटेक्चर ट्रांसफॉर्मर मॉडल पर आधारित है। यह एक एनकोडर-डिकोडर संरचना का उपयोग करता है, जहाँ एनकोडर टेक्स्ट प्रॉम्प्ट को संसाधित करता है, और डिकोडर छवि टोकन अनुक्रम उत्पन्न करता है। दृश्य टोकन एक पूर्व-प्रशिक्षित विज़न ट्रांसफॉर्मर (ViT) मॉडल से प्राप्त होते हैं, जो एक टोकनाइज़र के रूप में कार्य करता है। डिकोडर को टेक्स्ट और पहले उत्पन्न टोकनों को देखते हुए अगले छवि टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जो मशीन लर्निंग अनुक्रम मॉडलिंग के अनुरूप है।

मॉडल को 350 मिलियन से 20 बिलियन पैरामीटर तक विभिन्न आकारों में प्रशिक्षित किया गया था। सबसे बड़ा संस्करण, पार्टी-20B, MS-COCO और लोकलाइज़्ड नैरेटिव्स जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्रदर्शित करता है, उच्च FID (फ्रेचेट इंसेप्शन डिस्टेंस) स्कोर प्राप्त करता है, जो उत्पन्न और वास्तविक छवि वितरणों के बीच समानता को मापता है।

प्रशिक्षण और डेटा

पार्टी को छवि-पाठ जोड़ों के एक बड़े डेटासेट पर प्रशिक्षित किया गया था, जिसमें सार्वजनिक रूप से उपलब्ध वेब डेटा और स्वामित्व डेटासेट शामिल थे। प्रशिक्षण प्रक्रिया में दो चरण शामिल थे: पहला, ViT-आधारित टोकनाइज़र का उपयोग करके दृश्य कोडबुक सीखना, और दूसरा, पाठ से छवि टोकनों की भविष्यवाणी करने के लिए स्वत:प्रतिगामी ट्रांसफॉर्मर को प्रशिक्षित करना। मॉडल को असतत छवि टोकनों पर मानक क्रॉस-एंट्रॉपी हानि का उपयोग करके अनुकूलित किया गया था।

गूगल ने बताया कि मॉडल आकार और प्रशिक्षण डेटा को बढ़ाने से छवि गुणवत्ता में लगातार सुधार हुआ, विशेष रूप से जटिल प्रॉम्प्ट के लिए जिन्हें रचनात्मक तर्क की आवश्यकता होती है। मॉडल ने कई वस्तुओं, स्थानिक संबंधों और शैलीगत विशेषताओं वाले प्रॉम्प्ट को संभालने की क्षमता भी दिखाई।

क्षमताएँ और सीमाएँ

पार्टी उच्च निष्ठा और अर्थगत सटीकता के साथ छवियाँ उत्पन्न करने में उत्कृष्ट है। यह ऐसे प्रॉम्प्ट से छवियाँ बना सकता है जो विशिष्ट दृश्यों का वर्णन करते हैं, जैसे "एक बिल्ली की तस्वीर जिसने टोपी पहनी है" या "सूर्यास्त के समय एक भविष्यवादी शहर की पेंटिंग।" मॉडल पाठ प्रतिपादन का भी समर्थन करता है, जो कई छवि निर्माण मॉडल के लिए एक चुनौतीपूर्ण कार्य है। हालाँकि, पार्टी की सीमाएँ हैं, जिनमें बारीक विवरणों में कभी-कभी त्रुटियाँ शामिल हैं, जैसे गलत वस्तु गणना या मामूली विशेषता बेमेल। इसके लिए प्रशिक्षण और अनुमान के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है।

अन्य मॉडलों के साथ तुलना

पार्टी को DALL-E 2 और Imagen जैसे अन्य टेक्स्ट-टू-इमेज मॉडलों के साथ समवर्ती रूप से विकसित किया गया था। जबकि Imagen एक प्रसार-आधारित दृष्टिकोण का उपयोग करता है, पार्टी स्वत:प्रतिगामी है, जो इसे अनुक्रम मॉडलिंग में प्रगति का लाभ उठाने की अनुमति देता है। मूल्यांकनों में, पार्टी-20B ने MS-COCO जैसे बेंचमार्क पर DALL-E 2 और Imagen की तुलना में प्रतिस्पर्धात्मक या बेहतर परिणाम प्राप्त किए, विशेष रूप से FID स्कोर और मानव मूल्यांकन के संदर्भ में। हालाँकि, Imagen जैसे प्रसार मॉडल कुछ सौंदर्य गुणों पर मजबूत प्रदर्शन के लिए जाने गए, जबकि पार्टी अर्थगत संरेखण और जटिल तर्क में उत्कृष्ट था।

प्रभाव और विरासत

पार्टी ने छवि संश्लेषण में जनरेटिव एआई के तेजी से विकास में योगदान दिया। इसके स्वत:प्रतिगामी दृष्टिकोण ने एकीकृत मल्टीमॉडल मॉडलों में बाद के शोध को प्रभावित किया, जहाँ पाठ और छवियों को एक साझा टोकन स्थान में संसाधित किया जाता है। पार्टी की कोडबुक और स्केलिंग अंतर्दृष्टि को बाद में गूगल के अन्य मॉडलों, जैसे जेमिनी परिवार, में शामिल किया गया, जो पाठ, छवि और ऑडियो निर्माण को एकीकृत करते हैं। मॉडल ने दृष्टि-भाषा कार्यों में स्केलिंग कानूनों के महत्व को भी उजागर किया, जो डीप लर्निंग अनुसंधान में निष्कर्षों के साथ संरेखित है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:text-to-image·google-deepmind·autoregressive-model·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास