DALL-E 3 एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, और अक्टूबर 2023 में जारी किया गया। यह DALL-E श्रृंखला में तीसरा संस्करण है, जो DALL-E और DALL-E 2 के बाद आता है। DALL-E 3 प्राकृतिक भाषा विवरणों से डिजिटल छवियाँ उत्पन्न करने के लिए गहन शिक्षण पद्धतियों का उपयोग करता है, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है, और अपने पूर्ववर्तियों की तुलना में "काफी अधिक बारीकियों और विवरण" को समझने पर ध्यान केंद्रित करता है। यह मॉडल ChatGPT Plus और ChatGPT Enterprise ग्राहकों के लिए ChatGPT में मूल रूप से एकीकृत किया गया था, और बाद में OpenAI के API और Labs प्लेटफ़ॉर्म के माध्यम से उपलब्ध कराया गया। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित कर दिया गया।
इतिहास और पृष्ठभूमि
DALL-E की घोषणा पहली बार OpenAI द्वारा 5 जनवरी 2021 को की गई थी, जिसमें छवियाँ उत्पन्न करने के लिए GPT-3 का एक संशोधित संस्करण उपयोग किया गया था। DALL-E 2 ने 6 अप्रैल 2022 को अनुसरण किया, जो उच्च रिज़ॉल्यूशन और अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने की क्षमता प्रदान करता है। जुलाई 2022 में बीटा चरण और सितंबर 2022 में सार्वजनिक रिलीज़ के बाद, DALL-E 2 को नवंबर 2022 में API के माध्यम से उपलब्ध कराया गया। सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जिसे अक्टूबर 2023 में जारी किया गया। माइक्रोसॉफ्ट ने Bing के Image Creator टूल में DALL-E 3 को लागू किया, और Microsoft Copilot DALL-E 3 पर चलता है। "DALL-E" नाम पिक्सर रोबोट WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है। फरवरी 2024 में, OpenAI ने C2PA मानक में मेटाडेटा का उपयोग करते हुए, DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया।
तकनीक
DALL-E 3, OpenAI के GPT मॉडल में उपयोग किए जाने वाले ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है। हालाँकि DALL-E 3 के लिए एक तकनीकी रिपोर्ट लिखी गई थी, इसमें प्रशिक्षण या कार्यान्वयन विवरण शामिल नहीं हैं, बल्कि बेहतर प्रॉम्प्ट अनुसरण पर ध्यान केंद्रित किया गया है। मॉडल को अधिक सटीकता और विवरण के साथ जटिल प्रॉम्प्ट की व्याख्या करने के लिए डिज़ाइन किया गया है, और पहले के संस्करणों की तुलना में छवियों के भीतर अधिक सुसंगत और सटीक पाठ उत्पन्न कर सकता है।
DALL-E और DALL-E 2
मूल DALL-E ने एक असतत VAE, 12 बिलियन मापदंडों वाला एक ऑटोरेग्रेसिव डिकोडर-केवल ट्रांसफॉर्मर, और आउटपुट को रैंक करने के लिए एक CLIP मॉडल का उपयोग किया। DALL-E 2, 3.5 बिलियन मापदंडों के साथ, CLIP छवि एम्बेडिंग पर आधारित एक प्रसार मॉडल में स्थानांतरित हो गया, जो बाद में स्टेबल डिफ्यूज़न में उपयोग किए गए आर्किटेक्चर के समान है।
क्षमताएँ
DALL-E 3 कई शैलियों में कल्पना उत्पन्न कर सकता है, जिसमें फोटोरियलिस्टिक छवियाँ, पेंटिंग और इमोजी शामिल हैं। यह वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है, और नई रचनाओं में डिज़ाइन तत्व रख सकता है। यह अपने पूर्ववर्तियों की तुलना में अधिक सटीकता और विवरण के साथ जटिल प्रॉम्प्ट का पालन करता है, और छवियों के भीतर सुसंगत पाठ उत्पन्न कर सकता है। DALL-E 3 को ChatGPT Plus में एकीकृत किया गया है, जिससे उपयोगकर्ता सीधे वार्तालापों में छवियाँ उत्पन्न कर सकते हैं।
छवि संशोधन
DALL-E 2 और DALL-E 3 मौजूदा छवियों के विविधताएँ उत्पन्न कर सकते हैं और उन्हें संपादित कर सकते हैं, जिसमें इनपेंटिंग और आउटपेंटिंग शामिल है। ये सुविधाएँ लापता क्षेत्रों को भरने या सीमाओं से परे विस्तार करने के लिए मूल छवि के संदर्भ का उपयोग करती हैं, जो छाया, प्रतिबिंब और बनावट के साथ स्थिरता बनाए रखती हैं।
स्वागत और प्रभाव
DALL-E 3 को इसके बेहतर प्रॉम्प्ट अनुसरण और ChatGPT के साथ एकीकरण के लिए जाना जाता है, जिससे यह व्यापक दर्शकों के लिए सुलभ हो गया है। माइक्रोसॉफ्ट के Bing Image Creator और Copilot में इसका उपयोग इसकी पहुँच को बढ़ाता है। जटिल प्रॉम्प्ट से विस्तृत और सटीक छवियाँ उत्पन्न करने की मॉडल की क्षमता ने जनरेटिव एआई के क्षेत्र को प्रभावित किया है, हालाँकि नैतिकता और सुरक्षा के बारे में चिंताएँ उठाई गई हैं, जिससे वॉटरमार्क जैसे उपाय किए गए हैं।