अंग्रेज़ी से अनुवादित

ओपनएआई द्वारा 2021 और 2023 के बीच विकसित टेक्स्ट-टू-इमेज जनरेशन मॉडलों की एक श्रृंखला, जिसने एआई-जनित इमेजरी को मुख्यधारा के सार्वजनिक उपयोग में लाने में मदद की।

DALL-E एक Text-to-image generation पीढ़ी मॉडल की श्रृंखला है जिसे OpenAI द्वारा विकसित किया गया है, जिसका नाम कलाकार साल्वाडोर डाली और पिक्सर रोबोट चरित्र WALL-E के नामों के मिश्रण से रखा गया है। मूल DALL-E की घोषणा जनवरी 2021 में एक 12-बिलियन-पैरामीटर Transformer (architecture) मॉडल के रूप में की गई थी, जो GPT-3 के समान वास्तुकला परिवार पर आधारित था, और इसे पाठ विवरणों से छवियाँ उत्पन्न करने के लिए प्रशिक्षित किया गया था, जिसमें छवि पीढ़ी को असतत छवि टोकनों पर अनुक्रम भविष्यवाणी समस्या के रूप में माना गया था, न कि उन diffusion तकनीकों का उपयोग करके जो बाद में इस क्षेत्र पर हावी हो जाएँगी।

संस्करणों में विकास

DALL-E 2, जो अप्रैल 2022 में जारी किया गया था, ने मूल असतत-टोकन दृष्टिकोण को CLIP द्वारा निर्देशित एक diffusion-आधारित वास्तुकला से बदल दिया, जो OpenAI का संयुक्त छवि-पाठ Embedding मॉडल है, जिससे काफी उच्च-रिज़ॉल्यूशन और अधिक फोटोयथार्थवादी छवियाँ उत्पन्न हुईं और पाठ विवरण से मौजूदा छवियों के हिस्सों को संपादित करने के लिए एक "इनपेंटिंग" सुविधा पेश की गई। DALL-E 2 का सार्वजनिक बीटा, जिसके बाद 2022 में सामान्य उपलब्धता आई, ने मुख्यधारा के मीडिया का महत्वपूर्ण ध्यान आकर्षित किया और इसे Midjourney और Stable Diffusion जैसे समकालीन रिलीज़ों के साथ, पहली बार AI-जनित इमेजरी को मुख्यधारा की जन जागरूकता में लाने का श्रेय व्यापक रूप से दिया जाता है। DALL-E 3, जो 2023 में जारी किया गया और सीधे ग्राहकों के लिए ChatGPT में एकीकृत किया गया, ने छवियों के भीतर प्रॉम्प्ट अनुपालन और पाठ प्रतिपादन में सुधार किया, और छवि मॉडल को पास करने से पहले छोटे उपयोगकर्ता प्रॉम्प्ट को विस्तारित और परिष्कृत करने के लिए स्वयं ChatGPT का उपयोग किया।

स्वागत और प्रभाव

DALL-E के रिलीज़ों ने दृश्य रचनात्मक कार्य के भविष्य के बारे में महत्वपूर्ण सार्वजनिक बहस छेड़ दी, जिससे AI-सहायता प्राप्त कला और डिज़ाइन के साथ प्रयोग करने वाले उपयोगकर्ताओं से उत्साह और पेशेवर चित्रकारों और फोटोग्राफरों से विस्थापन और सहमति के बिना प्रशिक्षण डेटा में कॉपीराइट छवियों के उपयोग के बारे में चिंता दोनों उत्पन्न हुई, एक विवाद जो जनरेटिव AI उद्योग में व्यापक AI and copyright मुकदमेबाजी में योगदान देता है। इस प्रणाली ने गलत सूचना और गैर-सहमति वाली इमेजरी उत्पन्न करने की क्षमता पर भी जांच आकर्षित की, जिससे OpenAI को सामग्री फ़िल्टर लागू करने और कुछ समय के लिए सार्वजनिक हस्तियों के पहचानने योग्य चेहरे उत्पन्न करने पर प्रतिबंध लगाने के लिए प्रेरित किया।

विरासत

DALL-E को आम तौर पर उन मॉडलों में से एक माना जाता है, जो GANs पर पहले के शैक्षणिक कार्य और बाद के खुले प्रतिस्पर्धियों के साथ, text-to-image पीढ़ी को एक शोध जिज्ञासा के बजाय एक मुख्यधारा उपभोक्ता और वाणिज्यिक तकनीक के रूप में स्थापित करने का श्रेय देता है। इसकी सफलता ने OpenAI की व्यापक मल्टीमॉडल रणनीति में सीधे योगदान दिया, जिससे बाद में GPT-4 और उसके बाद के मॉडलों में एकीकृत छवि-समझ और छवि-पीढ़ी क्षमताओं को सूचित किया गया, और प्रॉम्प्ट-लेखन को एक ऐसे कौशल के रूप में लोकप्रिय बनाने में मदद की जो दृश्य, न केवल पाठ्य, जनरेटिव AI प्रणालियों के लिए प्रासंगिक है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·image-generation·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास