अंग्रेज़ी से अनुवादित

पाठ-से-छवि निर्माण एक प्राकृतिक-भाषा विवरण से छवि उत्पन्न करने का कार्य है, एक क्षमता जो 2021 और 2023 के बीच शोध की जिज्ञासा से मुख्यधारा के रचनात्मक उपकरण में स्थानांतरित हो गई।

टेक्स्ट-टू-इमेज जनरेशन उन AI प्रणालियों को संदर्भित करता है जो एक प्राकृतिक-भाषा विवरण, या प्रॉम्प्ट, लेती हैं और एक संबंधित छवि उत्पन्न करती हैं। यह कार्य पाठ की व्याख्या करने के लिए प्राकृतिक-भाषा प्रसंस्करण को कंप्यूटर विज़न और पिक्सेल प्रस्तुत करने के लिए जनरेटिव मॉडलिंग के साथ जोड़ता है, और यह जनरेटिव-एडवर्सेरियल-नेटवर्क और बाद में डिफ्यूज़न-मॉडल के सबसे दृश्यमान अनुप्रयोगों में से एक बन गया।

इतिहास

2010 के दशक में शुरुआती प्रयासों ने टेक्स्ट एम्बेडिंग पर आधारित GAN का उपयोग किया, जिससे छोटी, धुंधली छवियाँ उत्पन्न हुईं जो पक्षियों या फूलों जैसे सीमित डोमेन तक सीमित थीं। यह क्षेत्र जनवरी 2021 में OpenAI के DALL-E के साथ बदल गया, जिसने छवि टोकन पर ऑटोरेग्रेसिव रूप से प्रशिक्षित एक ट्रांसफॉर्मर लागू किया, और उसी वर्ष बाद में CLIP के साथ, जिसने शोधकर्ताओं को यह स्कोर करने का एक तरीका दिया कि एक छवि कैप्शन से कितनी अच्छी तरह मेल खाती है और उस दिशा में जनरेशन को मार्गदर्शित किया। असली सफलता डिफ्यूज़न की ओर बदलाव थी: DALL-E 2 (2022), Google का Imagen, और विशेष रूप से अगस्त 2022 में Stable Diffusion का ओपन-सोर्स रिलीज़, जिसने उच्च-गुणवत्ता वाली जनरेशन को तेज़ बना दिया और, स्टेबल डिफ्यूज़न के मामले में, उपभोक्ता GPU पर चलाने योग्य बना दिया। Midjourney, जो Discord के माध्यम से सुलभ था, ने उन्हीं मूल तकनीकों के आसपास एक विशिष्ट सौंदर्य-प्रथम उत्पाद बनाया, जबकि FLUX, जिसे 2024 में Black Forest Labs द्वारा जारी किया गया, एक नया ओपन-वेट मानक बन गया।

यह कैसे काम करता है

अधिकांश आधुनिक प्रणालियाँ एक लेटेंट डिफ्यूज़न मॉडल के आसपास बनाई गई हैं: एक छवि को एक ऑटोएनकोडर द्वारा एक संक्षिप्त लेटेंट-स्पेस में संपीड़ित किया जाता है, एक टेक्स्ट एनकोडर प्रॉम्प्ट को एक एम्बेडिंग में परिवर्तित करता है, और एक डीनॉइज़िंग नेटवर्क धीरे-धीरे उस एम्बेडिंग द्वारा निर्देशित यादृच्छिक शोर को एक लेटेंट छवि में बदल देता है, जिसे फिर पिक्सेल में डिकोड किया जाता है। क्लासिफायर-फ्री गाइडेंस जैसी तकनीकें उपयोगकर्ताओं को प्रॉम्प्ट के प्रति निष्ठा और छवि विविधता के बीच व्यापार करने की अनुमति देती हैं। ControlNet, जिसे 2023 में पेश किया गया, ने पाठ के अलावा एक स्केच, पोज़, या डेप्थ मैप पर जनरेशन को कंडीशन करने की क्षमता जोड़ी, जिससे रचना पर अधिक सूक्ष्म नियंत्रण मिला।

प्रॉम्प्ट संस्कृति और उपकरण

क्योंकि आउटपुट गुणवत्ता शब्दों के प्रति संवेदनशील है, प्रभावी प्रॉम्प्ट लिखने के आसपास अनौपचारिक कौशल का एक निकाय विकसित हुआ, जिसमें विषय विवरण, कलात्मक शैली, कैमरा और प्रकाश शर्तें, और अवांछित तत्वों को बाहर करने के लिए नकारात्मक प्रॉम्प्टिंग शामिल है, जो बाद में प्रॉम्प्ट-इंजीनियरिंग कहलाने वाली चीज़ का एक प्रारंभिक उदाहरण था। Discord और Reddit पर समुदायों ने प्रॉम्प्ट सूत्र साझा किए, और अपस्केलिंग, इनपेंटिंग और आउटपुट संयोजन के लिए द्वितीयक उपकरण उभरे। LoRA एडेप्टर ने एक विशिष्ट चरित्र, शैली, या वस्तु पर एक आधार मॉडल को कम संख्या में उदाहरण छवियों और मामूली कंप्यूट संसाधनों के साथ फाइन-ट्यून करना व्यावहारिक बना दिया।

स्वागत और आलोचना

टेक्स्ट-टू-इमेज उपकरणों ने विज्ञापन, कॉन्सेप्ट आर्ट और गेम डिज़ाइन में तेज़ी से व्यावसायिक अपनाने को देखा, साथ ही निरंतर विवाद भी। कलाकारों ने बिना सहमति या मुआवजे के स्क्रैप की गई छवियों पर प्रशिक्षित मॉडलों पर आपत्ति जताई, जो व्यापक एआई-कॉपीराइट विवादों और कई छवि-जनरेशन कंपनियों के खिलाफ मुकदमों में योगदान देता है। आलोचकों ने डीपफेक, गैर-सहमति वाली कल्पना, और स्टॉक-इमेज और सोशल प्लेटफार्मों पर कम-प्रयास वाले सिंथेटिक आउटपुट की बाढ़ के बारे में भी चिंताएँ उठाईं, एक घटना जिसे बाद में एआई स्लॉप लेबल किया गया। प्रयोगशालाओं ने सामग्री फ़िल्टर, प्रोवेंस मेटाडेटा, और कुछ मामलों में, एआई वॉटरमार्किंग सिस्टम के साथ प्रतिक्रिया दी, हालांकि पारिस्थितिकी तंत्र में प्रवर्तन असंगत बना हुआ है।

बाद के विकास

2025 तक, अग्रणी मॉडल लंबे, अधिक रचनात्मक प्रॉम्प्ट का पालन कर सकते थे, छवियों के भीतर पठनीय पाठ प्रस्तुत कर सकते थे, और प्राकृतिक-भाषा निर्देशों के माध्यम से मौजूदा तस्वीरों को संपादित कर सकते थे, जिससे टेक्स्ट-टू-इमेज जनरेशन और सामान्य-उद्देश्य छवि संपादन के बीच की खाई कम हो गई।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·image-generation
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास