अंग्रेज़ी से अनुवादित

Parti-20B एक 20-अरब-पैरामीटर वाला ऑटोरेग्रेसिव टेक्स्ट-टू-इमेज मॉडल है, जिसे Google द्वारा विकसित किया गया है, जो अनुक्रम-से-अनुक्रम ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके पाठ्य विवरणों से उच्च-निष्ठा वाली छवियाँ उत्पन्न करता है।

Parti-20B एक 20-अरब-पैरामीटर वाला AI मॉडल है जो पाठ-से-छवि निर्माण के लिए है, जिसे Google Research द्वारा विकसित किया गया है। यह Parti परिवार से संबंधित है, जो छवि निर्माण को एक अनुक्रम-से-अनुक्रम समस्या के रूप में मानता है, जहाँ एक ट्रांसफॉर्मर एनकोडर पाठ को संसाधित करता है और एक डिकोडर दृश्य टोकन की भविष्यवाणी करता है। Parti-20B इस श्रृंखला का सबसे बड़ा प्रकार है, जिसे जटिल प्रॉम्प्ट से अत्यधिक विस्तृत और शब्दार्थ-संरेखित छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया है।

यह मॉडल अनुक्रम-से-अनुक्रम सीखने की अवधारणा पर आधारित है, जो एक तंत्रिका नेटवर्क वास्तुकला का उपयोग करता है जो पाठ्य इनपुट को छवि टोकन के एक ग्रिड में मैप करता है। विसरण-आधारित दृष्टिकोणों के विपरीत, Parti-20B एक ऑटोरेग्रेसिव डिकोडर का उपयोग करता है, जो छवि पैच को क्रमिक रूप से उत्पन्न करता है। यह डिज़ाइन इसे मॉडल आकार के साथ प्रभावी ढंग से स्केल करने, निष्ठा और रचना-संबंधी समझ में सुधार करने की अनुमति देता है।

आर्किटेक्चर और प्रशिक्षण

Parti-20B एक एनकोडर-डिकोडर ट्रांसफॉर्मर का उपयोग करता है, जहाँ एनकोडर मल्टी-हेड अटेंशन और स्थितीय एनकोडिंग का उपयोग करके पाठ प्रॉम्प्ट को संसाधित करता है। फिर डिकोडर असतत दृश्य टोकन के एक अनुक्रम की भविष्यवाणी करता है, जिन्हें एक सीखे गए कोडबुक के माध्यम से पिक्सेल में मैप किया जाता है। प्रशिक्षण में छवि-पाठ जोड़ों का एक बड़ा डेटासेट शामिल होता है, जिसमें एडम ऑप्टिमाइज़र और एक सीखने-दर अनुसूची के साथ अनुकूलन किया जाता है। मॉडल स्थिरता के लिए लेयर नॉर्मलाइज़ेशन और ड्रॉपआउट का उपयोग करता है, और बड़े पैमाने पर प्रशिक्षण को संभालने के लिए ग्रेडिएंट क्लिपिंग का उपयोग करता है।

ऑटोरेग्रेसिव उत्पादन प्रक्रिया बीम-सर्च या टॉप-क सैंपलिंग और टॉप-पी सैंपलिंग जैसी सैंपलिंग रणनीतियों पर निर्भर करती है, जिसमें विविधता को नियंत्रित करने के लिए तापमान स्केलिंग शामिल है। Parti-20B का पैमाना इसे बारीक विवरण, जैसे बनावट और स्थानिक संबंधों को पकड़ने में सक्षम बनाता है, जो छोटे मॉडल चूक जाते हैं।

क्षमताएँ और प्रदर्शन

Parti-20B जटिल प्रॉम्प्ट का पालन करने में उत्कृष्ट है, जिसमें कई वस्तुएँ, विशेषताएँ और स्थानिक बाधाएँ शामिल हैं। यह फोटो-यथार्थवादी छवियाँ, कलात्मक शैलियाँ और नवीन रचनाएँ उत्पन्न कर सकता है। पहले के मॉडलों की तुलना में, यह शून्य-शॉट सामान्यीकरण में महत्वपूर्ण सुधार दिखाता है, जिसका अर्थ है कि यह फाइन-ट्यूनिंग के बिना अदृश्य प्रॉम्प्ट को संभाल सकता है। मॉडल मजबूती बढ़ाने के लिए प्रशिक्षण के दौरान डेटा-संवर्धन का भी समर्थन करता है।

बेंचमार्क मूल्यांकनों में, Parti-20B ने पाठ-से-छवि कार्यों पर अत्याधुनिक परिणाम प्राप्त किए, FID (फ़्रेचेट इंसेप्शन दूरी) और मानव वरीयता स्कोर के संदर्भ में कई समकालीन मॉडलों को पीछे छोड़ दिया। इसके 20B पैरामीटर इसे दृश्य अवधारणाओं की एक व्यापक श्रेणी का प्रतिनिधित्व करने की अनुमति देते हैं, हालाँकि इसके लिए अनुमान के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की आवश्यकता होती है।

अन्य मॉडलों से संबंध

Parti-20B जनरेटिव-एआई में एक व्यापक प्रवृत्ति का हिस्सा है, जो DALL-E और स्टेबल डिफ्यूज़न जैसे मॉडलों के साथ है। यह ऑटोरेग्रेसिव दृष्टिकोण का उपयोग करके विसरण मॉडल से भिन्न है, जो कुछ शोधकर्ताओं का तर्क है कि बेहतर नियंत्रणीयता प्रदान करता है। यह मॉडल बड़े-भाषा-मॉडल तकनीकों से संबंधित है, क्योंकि यह ट्रांसफॉर्मर बैकबोन और छवियों के लिए अनुकूलित प्रशिक्षण लक्ष्यों को साझा करता है। यह मशीन-लर्निंग स्केलिंग कानूनों पर शोध से भी जुड़ता है, जहाँ बड़े मॉडल लगातार प्रदर्शन में सुधार करते हैं।

Google ने Parti-20B को सार्वजनिक रूप से जारी नहीं किया है, जिससे पहुँच आंतरिक शोध और चुनिंदा भागीदारों तक सीमित है। यह ओपन-सोर्स प्रयासों के विपरीत है, लेकिन स्वामित्व एआई प्रणाली विकसित करने की कंपनी की रणनीति के साथ संरेखित है। मॉडल की वास्तुकला ने बाद के पाठ-से-छवि निर्माण कार्य को प्रभावित किया है, जिसमें टोकनाइज़ेशन और डिकोडिंग दक्षता में सुधार शामिल है।

सीमाएँ और नैतिक विचार

कई पाठ-से-छवि मॉडल की तरह, Parti-20B पक्षपाती या हानिकारक आउटपुट उत्पन्न कर सकता है यदि इसे अप्रशिक्षित इंटरनेट डेटा पर प्रशिक्षित किया जाए। यह दुर्लभ अवधारणाओं या अस्पष्ट प्रॉम्प्ट के साथ भी संघर्ष कर सकता है, कभी-कभी अर्थहीन परिणाम उत्पन्न करता है। 20B पैरामीटर मॉडल चलाने की कम्प्यूटेशनल लागत अधिक है, जिसके लिए गूगल क्लाउड TPUs या GPU जैसे विशेष हार्डवेयर की आवश्यकता होती है, जो पहुँच को सीमित करता है।

शोधकर्ताओं ने सुरक्षा उपायों की आवश्यकता पर प्रकाश डाला है, जैसे प्रॉम्प्ट फ़िल्टरिंग और आउटपुट मॉडरेशन। Parti-20B का विकास कॉपीराइट और भ्रामक इमेजरी बनाने में दुरुपयोग की संभावना के बारे में भी प्रश्न उठाता है। 2023 तक, ये चिंताएँ एआई समुदाय में सक्रिय हैं, जो जिम्मेदार तैनाती के आह्वान को प्रेरित करती हैं।

विरासत और प्रभाव

Parti-20B ने प्रदर्शित किया कि छवि निर्माण के लिए ऑटोरेग्रेसिव मॉडल को दसियों अरब पैरामीटर तक स्केल करना व्यवहार्य है, जिससे Imagen और Gemini जैसे बाद के मॉडलों का मार्ग प्रशस्त हुआ। इसकी सफलता ने गहन-लर्निंग में मॉडल पैमाने के महत्व को मजबूत किया और कुशल ट्रांसफॉर्मर में आगे के शोध को प्रेरित किया। हालाँकि यह सार्वजनिक रूप से उपलब्ध नहीं है, इसके तकनीकी योगदान को शोध पत्रों में दस्तावेज़ित किया गया है, जो शैक्षणिक और औद्योगिक प्रयासों दोनों को प्रभावित करता है।

छवियों को अनुक्रम के रूप में मानने वाला मॉडल का दृष्टिकोण अन्य क्षेत्रों, जैसे वीडियो उत्पादन और 3D दृश्य संश्लेषण पर भी लागू किया गया है। Parti-20B ऑटोरेग्रेसिव और विसरण-आधारित जनरेटिव मॉडल के बीच व्यापार-नापसंद को समझने के लिए एक संदर्भ बिंदु बना हुआ है, और इसके निष्कर्ष अगली पीढ़ी की प्रणालियों के डिज़ाइन को सूचित करते रहते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·transformer·google-deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास