अंग्रेज़ी से अनुवादित

DALL-E 3, जिसे OpenAI ने अक्टूबर 2023 में जारी किया, एक टेक्स्ट-टू-इमेज मॉडल है जो ChatGPT में Plus और Enterprise उपयोगकर्ताओं के लिए एकीकृत है, जो उन्नत प्रॉम्प्ट अनुसरण और छवि निर्माण क्षमताएँ प्रदान करता है।

DALL-E 3 ओपनएआई द्वारा विकसित एक टेक्स्ट-टू-इमेज मॉडल है, जिसे अक्टूबर 2023 में DALL-E श्रृंखला के तीसरे संस्करण के रूप में जारी किया गया था। इसे ChatGPT Plus और ChatGPT Enterprise ग्राहकों के लिए ChatGPT के भीतर मूल रूप से उपलब्ध कराया गया था, और नवंबर 2023 की शुरुआत में OpenAI के API और Labs प्लेटफ़ॉर्म के माध्यम से व्यापक पहुँच प्रदान की गई। यह मॉडल अपने पूर्ववर्तियों, DALL-E और DALL-E 2 की नींव पर आधारित है, जो प्राकृतिक भाषा संकेतों से डिजिटल छवियाँ उत्पन्न करने के लिए गहन शिक्षण का उपयोग करता है।

नाम DALL-E पिक्सर रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक संयोजन है। पहला संस्करण जनवरी 2021 में घोषित किया गया था, उसके बाद अप्रैल 2022 में DALL-E 2 आया। DALL-E 3 संकेतों में सूक्ष्मता और विवरण को समझने में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है, और इसे Microsoft के Bing Image Creator टूल में एकीकृत किया गया था, जिसमें Microsoft Copilot इस मॉडल पर चल रहा था।

इतिहास और पृष्ठभूमि

OpenAI ने पहली बार DALL-E को 5 जनवरी 2021 को एक ब्लॉग पोस्ट में प्रकट किया, जिसमें छवियाँ उत्पन्न करने के लिए GPT-3 के एक संशोधित संस्करण का उपयोग किया गया था। DALL-E 2 की घोषणा 6 अप्रैल 2022 को की गई थी, जिसे उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी छवियाँ उत्पन्न करने और अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने के लिए डिज़ाइन किया गया था। यह 20 जुलाई 2022 को बीटा में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए, और 28 सितंबर 2022 को सभी के लिए खोल दिया गया।

सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जो पिछले संस्करणों की तुलना में काफी अधिक सूक्ष्मता और विवरण को समझने में सक्षम है। यह मॉडल अक्टूबर 2023 में Plus और Enterprise ग्राहकों के लिए ChatGPT में मूल रूप से जारी किया गया था। नवंबर 2023 की शुरुआत में OpenAI API और Labs प्लेटफ़ॉर्म के माध्यम से उपलब्धता देखी गई। Microsoft ने इस मॉडल को Bing के Image Creator टूल में लागू किया और अपने Designer ऐप में एकीकरण की योजना बनाई।

फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (Coalition for Content Provenance and Authenticity) मानक में मेटाडेटा शामिल था, जिसे Content Authenticity Initiative द्वारा प्रचारित किया गया था। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया।

प्रौद्योगिकी

पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल 2018 में OpenAI द्वारा एक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके विकसित किया गया था। GPT-1 को 2019 में GPT-2 उत्पन्न करने के लिए बढ़ाया गया था, और 2020 में 175 बिलियन पैरामीटर के साथ GPT-3। DALL-E 3 गहन शिक्षण पद्धतियों का उपयोग करता है, हालाँकि DALL-E 3 के लिए OpenAI की तकनीकी रिपोर्ट में प्रशिक्षण या कार्यान्वयन विवरण शामिल नहीं है, जो बेहतर संकेत-अनुसरण क्षमताओं पर केंद्रित है।

DALL-E आर्किटेक्चर

मूल DALL-E में तीन घटक थे: एक असतत VAE, GPT-3 के समान 12 बिलियन पैरामीटर वाला एक ऑटोरेग्रेसिव डिकोडर-केवल ट्रांसफॉर्मर मॉडल, और एक CLIP जोड़ी जिसमें छवि एन्कोडर और टेक्स्ट एन्कोडर शामिल थे। असतत VAE छवियों को टोकन के अनुक्रमों में और वापस परिवर्तित करता है, जो आवश्यक है क्योंकि ट्रांसफॉर्मर सीधे छवि डेटा को संसाधित नहीं करता है।

ट्रांसफॉर्मर इनपुट टोकनित छवि कैप्शन का एक अनुक्रम है जिसके बाद टोकनित छवि पैच होते हैं। कैप्शन अंग्रेजी में हैं, जो 16384 की शब्दावली आकार के साथ बाइट पेयर एन्कोडिंग द्वारा टोकनित किए जाते हैं, अधिकतम 256 टोकन लंबे होते हैं। प्रत्येक छवि 256×256 RGB है, जो 32×32 पैच में विभाजित है, प्रत्येक 4×4 का है, और प्रत्येक पैच को एक असतत वैरिएशनल ऑटोएन्कोडर द्वारा 8192 की शब्दावली आकार वाले टोकन में परिवर्तित किया जाता है।

CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) को DALL-E के साथ विकसित किया गया था, जिसे टेक्स्ट कैप्शन के साथ 400 मिलियन छवि जोड़ों पर प्रशिक्षित किया गया था। यह DALL-E के आउटपुट को यह भविष्यवाणी करके रैंक करता है कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है, और निकटतम मिलान का चयन करने के लिए एक बड़ी प्रारंभिक सूची को फ़िल्टर करता है।

DALL-E 2 और DALL-E 3 आर्किटेक्चर

DALL-E 2 3.5 बिलियन पैरामीटर का उपयोग करता है, जो अपने पूर्ववर्ती से कम है, और CLIP छवि एम्बेडिंग पर आधारित एक प्रसार मॉडल का उपयोग करता है, जिसमें एक पूर्व मॉडल अनुमान के दौरान CLIP टेक्स्ट एम्बेडिंग से इन एम्बेडिंग को उत्पन्न करता है। यह आर्किटेक्चर कुछ महीने बाद जारी स्टेबल डिफ्यूज़न के समान है।

DALL-E 3 इस प्रसार-आधारित दृष्टिकोण को जारी रखता है, लेकिन बेहतर संकेत-अनुसरण के साथ। हालाँकि कोई सार्वजनिक तकनीकी विवरण उपलब्ध नहीं है, यह मॉडल जटिल संकेतों का पालन करने और छवियों के भीतर सुसंगत टेक्स्ट उत्पन्न करने में बेहतर सटीकता प्रदर्शित करता है।

क्षमताएँ

DALL-E कई शैलियों में इमेजरी उत्पन्न कर सकता है, जिसमें फोटोरियलिस्टिक इमेजरी, पेंटिंग और इमोजी शामिल हैं। यह वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है, और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। उदाहरण के लिए, जब एक डाइकॉन मूली को अपनी नाक बहाते हुए, लट्टे पीते हुए, या यूनीसाइकिल चलाते हुए चित्रित करने के लिए कहा जाता है, तो DALL-E अक्सर रूमाल, हाथ और पैर को उचित स्थानों पर खींचता है।

मॉडल विशिष्ट संकेतों के बिना उपयुक्त विवरण का अनुमान लगाने के लिए रिक्त स्थान भर सकता है, जैसे कि उत्सव से जुड़े संकेतों में क्रिसमस इमेजरी जोड़ना, और उन छवियों में छाया को उचित रूप से रखना जो उनका उल्लेख नहीं करती हैं। DALL-E दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता है, और विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता है, जिसमें केवल दुर्लभ विफलताएँ होती हैं।

जॉर्जिया टेक स्कूल ऑफ़ इंटरएक्टिव कंप्यूटिंग के एसोसिएट प्रोफेसर मार्क रिडल ने पाया कि DALL-E अवधारणाओं को मिश्रित कर सकता है, जिसे मानव रचनात्मकता का एक प्रमुख तत्व बताया गया है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर बुद्धि मापने के लिए मनुष्यों को दिए जाने वाले दृश्य परीक्षण हैं।

DALL-E 3 अपने पूर्ववर्तियों की तुलना में जटिल संकेतों का अधिक सटीकता और विवरण के साथ पालन करता है, और छवियों के भीतर अधिक सुसंगत और सटीक टेक्स्ट उत्पन्न कर सकता है। यह ChatGPT Plus में एकीकृत है, जिससे उपयोगकर्ता संवादी संकेतों के माध्यम से छवियाँ उत्पन्न कर सकते हैं।

छवि संशोधन

किसी मौजूदा छवि को देखते हुए, DALL-E 2 और DALL-E 3 मूल के आधार पर व्यक्तिगत आउटपुट के रूप में छवि के विविधताएँ उत्पन्न कर सकते हैं, साथ ही छवि को संशोधित या विस्तारित करने के लिए संपादित भी कर सकते हैं। इनपेंटिंग और आउटपेंटिंग क्षमताएँ किसी छवि से संदर्भ का उपयोग करके मूल के अनुरूप माध्यम का उपयोग करके लापता क्षेत्रों को भरती हैं, दिए गए संकेत का पालन करते हुए।

उदाहरण के लिए, इसका उपयोग किसी छवि में एक नया विषय सम्मिलित करने या छवि को उसकी मूल सीमाओं से परे विस्तारित करने के लिए किया जा सकता है। OpenAI के अनुसार, आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों, जैसे छाया, प्रतिबिंब और बनावट को ध्यान में रखती है, ताकि स्थिरता बनाए रखी जा सके।

एकीकरण और उपलब्धता

DALL-E 3 को अक्टूबर 2023 में ChatGPT Plus और ChatGPT Enterprise ग्राहकों के लिए ChatGPT में मूल रूप से जारी किया गया था। OpenAI के API और Labs प्लेटफ़ॉर्म के माध्यम से उपलब्धता नवंबर 2023 की शुरुआत में हुई। Microsoft ने इस मॉडल को Bing के Image Creator टूल में लागू किया, जिसमें Microsoft Copilot DALL-E 3 पर चल रहा था, और अपने Designer ऐप में एकीकरण की योजना बनाई।

API प्रति-छवि लागत के आधार पर संचालित होता है, जिसमें कीमतें छवि रिज़ॉल्यूशन के आधार पर भिन्न होती हैं। OpenAI की एंटरप्राइज़ टीम के साथ काम करने वाली कंपनियों के लिए वॉल्यूम छूट उपलब्ध है। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया।

सुरक्षा और उत्पत्ति

OpenAI ने DALL-E मॉडलों के साथ सुरक्षा चिंताओं को संबोधित किया है, जिसमें हानिकारक सामग्री पर प्रतिबंध और वॉटरमार्क का जोड़ शामिल है। फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA मानक में मेटाडेटा शामिल था, जिसे Content Authenticity Initiative द्वारा प्रचारित किया गया था। यह AI-उत्पन्न छवियों की उत्पत्ति को सत्यापित करने में मदद करता है।

विरासत

DALL-E 3 Generative AI और Text-to-image generation प्रौद्योगिकी में एक मील का पत्थर है, जो Deep learning और Neural network मॉडलों में पहले के काम पर आधारित है। Large language model प्रणालियों जैसे ChatGPT के साथ इसका एकीकरण भाषा और छवि निर्माण के अभिसरण को प्रदर्शित करता है। मॉडल की क्षमताओं ने क्षेत्र में बाद के विकास को प्रभावित किया है, जिसमें GPT Image और अन्य छवि निर्माण प्रणालियाँ शामिल हैं।

अक्टूबर 2023 में DALL-E 3 का जारी होना अधिक सुलभ और सूक्ष्म AI छवि निर्माण की ओर एक बदलाव को चिह्नित करता है, जिसके रचनात्मक उद्योगों, सामग्री निर्माण और डिजिटल कला के लिए निहितार्थ हैं। Microsoft Copilot और Bing Image Creator में इसका उपयोग व्यापक दर्शकों तक इसकी पहुँच का विस्तार करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:openai·text-to-image·generative-ai·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास