अंग्रेज़ी से अनुवादित

DALL-E 1 एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा डीप लर्निंग का उपयोग करके प्राकृतिक भाषा प्रॉम्प्ट से डिजिटल छवियाँ उत्पन्न करने के लिए विकसित किया गया है। जनवरी 2021 में घोषित, यह संशोधित GPT-3 आर्किटेक्चर का उपयोग करता है और जनरेटिव AI में एक मील का पत्थर था।

DALL-E 1, जिसे शैलीगत रूप से DALL·E के रूप में लिखा जाता है, एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा गहन शिक्षण पद्धति का उपयोग करके विकसित किया गया है। यह प्राकृतिक भाषा विवरणों से डिजिटल छवियाँ उत्पन्न करता है, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है। DALL-E का पहला संस्करण जनवरी 2021 में घोषित किया गया था, जिससे यह बड़े भाषा मॉडल को छवि निर्माण के साथ संयोजित करने वाले पहले प्रमुख मॉडलों में से एक बन गया। सॉफ्टवेयर का नाम एनिमेटेड रोबोट WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली के नामों का एक मिश्रित शब्द है।

इसका उत्तराधिकारी, DALL-E 2, अप्रैल 2022 में जारी किया गया था, जिसका सार्वजनिक बीटा जुलाई 2022 में आया। DALL-E 3, जो अक्टूबर 2023 में जारी हुआ, को ChatGPT में प्लस और एंटरप्राइज़ ग्राहकों के लिए मूल रूप से एकीकृत किया गया था। DALL-E 3 को बाद में मार्च 2025 में ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित कर दिया गया।

इतिहास और पृष्ठभूमि

DALL-E को OpenAI द्वारा 5 जनवरी 2021 को एक ब्लॉग पोस्ट में प्रकट किया गया था। मॉडल ने छवियों के लिए gpt-partnr? का एक संस्करण उपयोग किया, लेकिन छवि निर्माण के लिए अनुकूलित एक Transformer (architecture) वास्तुकला का उपयोग किया। उस समय, OpenAI बड़े भाषा मॉडल जैसे GPT-3 के लिए जाना जाता था, लेकिन DALL-E ने बहुविध कृत्रिम बुद्धिमत्ता - पाठ और छवि दोनों डोमेन को संभालने - में एक बदलाव को चिह्नित किया। मॉडल का नाम OpenAI की नामकरण में आम चंचल संक्षिप्ताक्षरों और श्लेषों की प्रवृत्ति का पालन करता था।

फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्किंग जोड़ना शुरू किया, जिसमें C2PA (सामग्री उत्पत्ति और प्रामाणिकता के लिए गठबंधन) मानक में मेटाडेटा शामिल था, जिसे सामग्री प्रामाणिकता पहल द्वारा बढ़ावा दिया गया, ताकि छवि उत्पत्ति का पता लगाने में मदद मिल सके।

प्रौद्योगिकी

पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल शुरू में OpenAI द्वारा 2018 में विकसित किया गया था, जिसमें एक Transformer (architecture) वास्तुकला का उपयोग किया गया था। पहला पुनरावृत्ति, GPT-1, को 2019 में GPT-2 उत्पन्न करने के लिए बढ़ाया गया था; 2020 में, इसे फिर से बढ़ाकर GPT-3 बनाया गया, जिसमें 175 बिलियन पैरामीटर थे। DALL-E GPT-3 का एक विशिष्ट संस्करण है, जिसे छवियाँ उत्पन्न करने के लिए संशोधित किया गया है।

DALL-E 1

DALL-E में तीन घटक हैं: एक असतत वैरिएशनल-एनकोडर?, एक ऑटोरेग्रेसिव डिकोडर-केवल Transformer (architecture) मॉडल (12 बिलियन पैरामीटर) जो GPT-3 के समान है, और एक CLIP जोड़ी जिसमें छवि एनकोडर और पाठ एनकोडर शामिल हैं।

असतत वैरिएशनल ऑटोएनकोडर (VAE) एक छवि को टोकन के अनुक्रम में परिवर्तित करता है, और इसके विपरीत, टोकन के अनुक्रम को वापस छवि में परिवर्तित करता है। यह आवश्यक है क्योंकि ट्रांसफॉर्मर मॉडल सीधे छवि डेटा संसाधित नहीं करता है। ट्रांसफॉर्मर का इनपुट टोकनयुक्त छवि कैप्शन का एक अनुक्रम है जिसके बाद टोकनयुक्त छवि पैच होते हैं। कैप्शन अंग्रेजी में है, जिसे बाइट-पेयर-एनकोडिंग (शब्दावली आकार 16384) द्वारा टोकनयुक्त किया जाता है, और यह 256 टोकन तक लंबा हो सकता है। प्रत्येक छवि एक 256x256 RGB छवि है, जिसे 32x32 पैच में विभाजित किया गया है, प्रत्येक पैच 4x4 का है। फिर प्रत्येक पैच को एक असतत VAE द्वारा एक टोकन (शब्दावली आकार 8192) में परिवर्तित किया जाता है।

DALL-E को CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) के साथ संयोजन में विकसित और जारी किया गया है। CLIP एक अलग मॉडल है जो कंट्रास्टिव लर्निंग पर आधारित है, जिसे इंटरनेट से स्क्रैप किए गए पाठ कैप्शन के साथ 400 मिलियन छवियों के जोड़े पर प्रशिक्षित किया गया है। इसकी भूमिका DALL-E के आउटपुट को समझना और रैंक करना है, यह भविष्यवाणी करके कि 32,768 यादृच्छिक रूप से चयनित कैप्शन (जिनमें से एक सही है) की सूची से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है। एक प्रशिक्षित CLIP जोड़ी DALL-E द्वारा उत्पन्न छवियों की एक बड़ी प्रारंभिक सूची को फ़िल्टर करती है ताकि पाठ प्रॉम्प्ट के सबसे करीब की छवि का चयन किया जा सके।

उत्तराधिकारी

DALL-E 2 में 3.5 बिलियन पैरामीटर हैं, जो इसके पूर्ववर्ती से कम संख्या है। एक ऑटोरेग्रेसिव ट्रांसफॉर्मर के बजाय, यह CLIP छवि एम्बेडिंग पर सशर्त एक Diffusion model का उपयोग करता है, जो अनुमान के दौरान, एक पूर्व मॉडल द्वारा CLIP पाठ एम्बेडिंग से उत्पन्न होते हैं। यह वही वास्तुकला है जो स्टेबल-डिफ्यूजन की है, जो कुछ महीने बाद जारी किया गया था।

DALL-E 3, जो सितंबर 2023 में जारी हुआ, पिछले पुनरावृत्तियों की तुलना में जटिल प्रॉम्प्ट का अधिक सटीकता और विवरण के साथ पालन करता है, और अधिक सुसंगत पाठ उत्पन्न कर सकता है। हालाँकि इसके लिए एक तकनीकी रिपोर्ट लिखी गई थी, रिपोर्ट में प्रशिक्षण या कार्यान्वयन विवरण शामिल नहीं है, जो बेहतर प्रॉम्प्ट अनुसरण पर केंद्रित है।

क्षमताएँ

DALL-E कई शैलियों में इमेजरी उत्पन्न कर सकता है, जिसमें फोटोरियलिस्टिक इमेजरी, पेंटिंग और इमोजी शामिल हैं। यह अपनी छवियों में वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है, और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। यह रचनात्मक-तर्क क्षमताओं का प्रदर्शन करता है, जैसे कि प्रॉम्प्ट के लिए प्रशंसनीय विवरण भरना - उदाहरण के लिए, उत्सव से जुड़े प्रॉम्प्ट में क्रिसमस इमेजरी जोड़ना, या उल्लेख न होने पर भी उचित रूप से रखी गई छायाएँ। DALL-E दृश्य डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता है।

DALL-E विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता है, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरएक्टिव कंप्यूटिंग के एसोसिएट प्रोफेसर मार्क रीडल ने पाया कि DALL-E अवधारणाओं को मिश्रित कर सकता है, जो मानव रचनात्मकता का एक प्रमुख तत्व है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर बुद्धिमत्ता को मापने के लिए प्रशासित दृश्य परीक्षण होते हैं।

छवि संशोधन

किसी मौजूदा छवि को देखते हुए, DALL-E 2 और DALL-E 3 छवि के विविधताएँ उत्पन्न कर सकते हैं, और दृश्य को संशोधित या विस्तारित करने के लिए इसे संपादित कर सकते हैं। इन मॉडलों की इनपेंटिंग और आउटपेंटिंग क्षमताएँ छवि से संदर्भ का उपयोग करके लापता क्षेत्रों को मूल के अनुरूप शैली के साथ भरती हैं, दिए गए प्रॉम्प्ट का पालन करते हुए। इसका उपयोग एक नया विषय डालने या छवि को उसकी सीमाओं से परे विस्तारित करने के लिए किया जा सकता है। OpenAI के अनुसार, आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों, जिसमें छायाएँ, प्रतिबिंब और बनावट शामिल हैं, को ध्यान में रखता है।

अनुप्रयोग और प्रभाव

DALL-E 1 ने जनरेटिव AI छवि निर्माण का एक नया युग खोला, और बाद के मॉडलों और अनुप्रयोगों को प्रभावित किया। इसका उत्तराधिकारी DALL-E 2 नवंबर 2022 में एक API के माध्यम से उपलब्ध कराया गया था, जिससे डेवलपर्स मॉडल को अनुप्रयोगों में एकीकृत कर सकते थे, प्रति-छवि लागत मूल्य निर्धारण के साथ। Microsoft ने DALL-E 2 को अपने डिज़ाइनर ऐप और Bing और Edge में इमेज क्रिएटर टूल में शामिल किया। DALL-E 3 को अक्टूबर 2023 में प्लस और एंटरप्राइज़ ग्राहकों के लिए ChatGPT में एकीकृत किया गया था, नवंबर में API और Labs उपलब्धता के साथ। फरवरी 2024 में, OpenAI ने C2PA मानक का पालन करते हुए DALL-E छवियों में वॉटरमार्क जोड़े।

संदर्भ

यह लेख सार्वजनिक रिपोर्टों और OpenAI के स्वयं के प्रकाशनों से जानकारी पर आधारित है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-art·openai·text-to-image·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास