अंग्रेज़ी से अनुवादित

Imagen, Google DeepMind द्वारा विकसित टेक्स्ट-टू-इमेज मॉडल की एक श्रृंखला है, जो प्राकृतिक भाषा प्रॉम्प्ट से उच्च-गुणवत्ता वाली छवियाँ उत्पन्न करने के लिए जानी जाती है। यह Google Brain अनुसंधान से विकसित हुई है और Gemini तथा Vertex AI जैसी Google सेवाओं में एकीकृत है।

Imagen Google DeepMind द्वारा विकसित टेक्स्ट-टू-इमेज मॉडलों की एक श्रृंखला है, जिसे प्राकृतिक भाषा टेक्स्ट प्रॉम्प्ट से उच्च-गुणवत्ता वाली छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया है। ये मॉडल ट्रांसफॉर्मर-आधारित भाषा समझ और डिफ्यूज़न मॉडल छवि निर्माण के संयोजन का उपयोग करते हैं, जो उन्हें DALL-E और स्टेबल डिफ्यूज़न जैसे प्रमुख जनरेटिव AI टूलों के बीच स्थान देता है। Imagen विभिन्न Google सेवाओं, जिनमें जेमिनी और Vertex AI शामिल हैं, के माध्यम से सुलभ है, और इसकी शुरुआत के बाद से इसके कई प्रमुख संस्करण जारी किए जा चुके हैं।

मूल Imagen मॉडल पहली बार मई 2022 में प्रकाशित एक शोध पत्र में प्रस्तुत किया गया था, जिसे अप्रैल 2023 में DeepMind के साथ विलय से पहले Google Brain टीम द्वारा विकसित किया गया था। बाद के संस्करण, Imagen 2 और Imagen 3, क्रमशः दिसंबर 2023 और अगस्त 2024 में जारी किए गए, जिनमें प्रत्येक पुनरावृत्ति ने छवि गुणवत्ता, टेक्स्ट रेंडरिंग और उपयोगकर्ता नियंत्रण में सुधार किया। मई 2025 में, Google ने अपने वार्षिक Google I/O सम्मेलन में Imagen 4 की घोषणा की, जिससे मॉडल की क्षमताओं को और आगे बढ़ाया गया।

तकनीक

Imagen की वास्तुकला दो प्रमुख तकनीकों पर निर्भर करती है: टेक्स्ट एन्कोडिंग के लिए एक फ्रोज़न बड़ा भाषा मॉडल (LLM) और छवि निर्माण के लिए एक कैस्केडेड डिफ्यूज़न मॉडल। T5 ट्रांसफॉर्मर परिवार पर आधारित टेक्स्ट एन्कोडर, इनपुट प्रॉम्प्ट को सिमेंटिक एम्बेडिंग में परिवर्तित करता है जो छवि संश्लेषण प्रक्रिया का मार्गदर्शन करता है। फिर डिफ्यूज़न मॉडल चरणों की एक श्रृंखला में काम करता है, जो कम-रिज़ॉल्यूशन वाली छवि (64×64 पिक्सेल) से शुरू होकर धीरे-धीरे इसे उच्च रिज़ॉल्यूशन तक बढ़ाता है, अंततः पहले के संस्करणों में 1024×1024 पिक्सेल तक पहुँचता है। Imagen 4 इस क्षमता को 2K रिज़ॉल्यूशन तक छवियाँ उत्पन्न करने के लिए विस्तारित करता है, जिससे विवरण और दृश्य निष्ठा में वृद्धि होती है।

कैस्केडेड डिज़ाइन मॉडल को छवियों को क्रमिक रूप से परिष्कृत करने की अनुमति देता है, जिससे टेक्स्ट प्रॉम्प्ट के साथ सुसंगतता और संरेखण में सुधार होता है। यह दृष्टिकोण एकल-चरण मॉडलों के विपरीत है, जो अधिक कुशल प्रशिक्षण और उच्च-गुणवत्ता वाले आउटपुट को सक्षम बनाता है। फ्रोज़न LLM का उपयोग प्राकृतिक भाषा प्रसंस्करण में प्रगति का लाभ भी उठाता है, जिससे Imagen जटिल प्रॉम्प्ट, जिनमें अमूर्त अवधारणाएँ और शैलीगत निर्देश शामिल हैं, को समझने में सक्षम होता है।

क्षमताएँ

Imagen टेक्स्ट विवरणों से फोटोरियलिस्टिक छवियाँ उत्पन्न करने में उत्कृष्ट है, लेकिन यह सिनेमाई, 35mm फिल्म, चित्रण और अतियथार्थवादी सौंदर्यशास्त्र सहित कलात्मक शैलियों की एक विस्तृत श्रृंखला का भी समर्थन करता है। यह बहुमुखी प्रतिभा इसे डिजिटल कला, विज्ञापन और अवधारणा डिज़ाइन जैसे रचनात्मक अनुप्रयोगों के लिए उपयुक्त बनाती है। मॉडल कई पहलू अनुपातों में छवियाँ उत्पन्न कर सकता है, जिनमें 9:16, 3:4, 1:1, 4:3 और 16:9 शामिल हैं, जो विभिन्न प्रदर्शन प्रारूपों और उपयोग मामलों को समायोजित करता है।

प्रारंभिक निर्माण के अलावा, Imagen संपादन क्षमताएँ प्रदान करता है, जिससे उपयोगकर्ता नए टेक्स्ट प्रॉम्प्ट प्रदान करके मौजूदा छवियों को परिष्कृत कर सकते हैं। यह सुविधा पुनरावृत्त रचनात्मक वर्कफ़्लो को सक्षम बनाती है, जहाँ उपयोगकर्ता पूरी छवि को पुनः उत्पन्न किए बिना संरचना, शैली या विशिष्ट तत्वों को समायोजित कर सकते हैं। हालाँकि, अन्य टेक्स्ट-टू-इमेज मॉडलों की तरह, Imagen की सीमाएँ हैं, जिनमें मानव उंगलियों, टेक्स्ट, एम्बिग्राम और अन्य जटिल टाइपोग्राफी को सटीक रूप से रेंडर करने में कठिनाई शामिल है। ये चुनौतियाँ इस क्षेत्र में आम हैं और चल रहे शोध के क्षेत्र हैं।

यह भी देखें

संदर्भ

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·google-deepmind·diffusion-models
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास