DALL-E एक टेक्स्ट-से-छवि मॉडलों की श्रृंखला है जिसे OpenAI द्वारा विकसित किया गया है, जो प्राकृतिक भाषा विवरणों से डिजिटल छवियाँ उत्पन्न करती है, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है। पहला संस्करण जनवरी 2021 में घोषित किया गया था, उसके बाद 2022 में DALL-E 2 और 2023 में DALL-E 3 आया। यह नाम एनिमेटेड रोबोट WALL-E और अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।
इतिहास और पृष्ठभूमि
OpenAI ने 5 जनवरी 2021 को एक ब्लॉग पोस्ट में DALL-E का खुलासा किया, जिसमें छवियाँ उत्पन्न करने के लिए अपने GPT-3 मॉडल का एक संशोधित संस्करण उपयोग किया गया। 6 अप्रैल 2022 को, कंपनी ने DALL-E 2 की घोषणा की, जो उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी छवियाँ उत्पन्न करने और अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने के लिए डिज़ाइन किया गया एक उत्तराधिकारी था। नैतिक और सुरक्षा चिंताओं के कारण पहुँच शुरू में पूर्व-चयनित उपयोगकर्ताओं तक एक शोध पूर्वावलोकन के लिए प्रतिबंधित थी। 20 जुलाई 2022 को, DALL-E 2 बीटा में प्रवेश किया, जिसमें दस लाख प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए; उपयोगकर्ता हर महीने सीमित संख्या में छवियाँ मुफ्त उत्पन्न कर सकते थे और अधिक खरीद सकते थे। 28 सितंबर 2022 को, प्रतीक्षा सूची हटा दी गई और मॉडल सभी के लिए उपलब्ध हो गया।
सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जो पिछले संस्करणों की तुलना में काफी अधिक सूक्ष्मता और विवरण को समझ सकता था। इसे अक्टूबर 2023 में प्लस और एंटरप्राइज़ ग्राहकों के लिए ChatGPT में मूल रूप से जारी किया गया, जिसमें नवंबर की शुरुआत में API और Labs उपलब्धता थी। Microsoft ने DALL-E 3 को Bing के Image Creator और अपने Designer ऐप में एकीकृत किया, और Microsoft Copilot DALL-E 3 पर चलता है। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया।
फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (Coalition for Content Provenance and Authenticity) मानक में मेटाडेटा एम्बेड किया गया, जिसे Content Authenticity Initiative द्वारा प्रचारित किया गया।
प्रौद्योगिकी
पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल 2018 में OpenAI द्वारा विकसित किया गया था, जिसमें Transformer (architecture) आर्किटेक्चर का उपयोग किया गया था। इसे 2019 में GPT-2 तक और 2020 में GPT-3 तक बढ़ाया गया, जिसमें 175 बिलियन पैरामीटर थे।
DALL-E
DALL-E में तीन घटक शामिल हैं: एक असतत वैरिएशनल ऑटोएन्कोडर (VAE), एक ऑटोरेग्रेसिव डिकोडर-ओनली ट्रांसफॉर्मर मॉडल जिसमें GPT-3 के समान 12 बिलियन पैरामीटर हैं, और एक CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) छवि और टेक्स्ट एन्कोडर की जोड़ी। असतत VAE एक छवि को टोकनों के अनुक्रम में और वापस परिवर्तित करता है, जिससे ट्रांसफॉर्मर को छवि डेटा संसाधित करने की अनुमति मिलती है। ट्रांसफॉर्मर टोकनाइज़्ड छवि कैप्शन के अनुक्रम के बाद टोकनाइज़्ड छवि पैच प्राप्त करता है। कैप्शन अंग्रेजी में हैं, जो 16,384 की शब्दावली आकार के साथ बाइट पेयर एन्कोडिंग द्वारा टोकनाइज़ किए गए हैं, और 256 टोकन तक लंबे हो सकते हैं। प्रत्येक छवि 256×256 RGB है, जो 4×4 पिक्सेल के 32×32 पैच में विभाजित है, प्रत्येक VAE द्वारा 8,192 की शब्दावली से एक टोकन में परिवर्तित किया गया है।
CLIP, DALL-E के साथ विकसित, कंट्रास्टिव लर्निंग पर आधारित एक अलग मॉडल है, जो इंटरनेट से स्क्रैप किए गए 400 मिलियन छवि-टेक्स्ट जोड़ों पर प्रशिक्षित है। यह DALL-E के आउटपुट को यह भविष्यवाणी करके रैंक करता है कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है। एक प्रशिक्षित CLIP जोड़ी उत्पन्न छवियों की एक बड़ी प्रारंभिक सूची को फ़िल्टर करके प्रॉम्प्ट के सबसे करीब वाली छवि का चयन करती है।
DALL-E 2
DALL-E 2 में 3.5 बिलियन पैरामीटर हैं, जो अपने पूर्ववर्ती से कम हैं। एक ऑटोरेग्रेसिव ट्रांसफॉर्मर के बजाय, यह CLIP छवि एम्बेडिंग पर आधारित एक डिफ्यूज़न मॉडल का उपयोग करता है, जो अनुमान के दौरान एक पूर्व मॉडल द्वारा CLIP टेक्स्ट एम्बेडिंग से उत्पन्न होते हैं। यह आर्किटेक्चर स्टेबल डिफ्यूज़न के समान है, जो कुछ महीने बाद जारी किया गया था।
DALL-E 3
OpenAI ने DALL-E 3 के लिए एक तकनीकी रिपोर्ट प्रकाशित की, लेकिन इसमें प्रशिक्षण या कार्यान्वयन विवरण शामिल नहीं है, जो बेहतर प्रॉम्प्ट-अनुसरण क्षमताओं पर केंद्रित है।
क्षमताएँ
DALL-E कई शैलियों में इमेजरी उत्पन्न कर सकता है, जिसमें फोटोरियलिस्टिक छवियाँ, पेंटिंग और इमोजी शामिल हैं। यह छवियों में वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। उदाहरण के लिए, जब एक मूली को अपनी नाक बहाते, लट्टे पीते, या यूनीसाइकिल चलाते हुए चित्रित करने के लिए कहा जाता है, तो DALL-E अक्सर रूमाल, हाथ और पैर को उचित स्थानों पर चित्रित करता है। यह प्रॉम्प्ट में उल्लिखित नहीं उपयुक्त विवरणों का अनुमान लगा सकता है, जैसे छुट्टी से संबंधित प्रॉम्प्ट में क्रिसमस इमेजरी जोड़ना या छायाओं को उचित रूप से रखना। DALL-E दृश्य और डिज़ाइन रुझानों की व्यापक समझ भी प्रदर्शित करता है।
DALL-E विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता है, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरैक्टिव कंप्यूटिंग के एसोसिएट प्रोफेसर मार्क रिडल ने पाया कि DALL-E अवधारणाओं को मिश्रित कर सकता है, जिसे उन्होंने मानव रचनात्मकता का एक प्रमुख तत्व बताया। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर मानव बुद्धि को मापने के लिए उपयोग किए जाने वाले दृश्य परीक्षण हैं।
DALL-E 3 अपने पूर्ववर्तियों की तुलना में जटिल प्रॉम्प्ट का अधिक सटीकता और विवरण के साथ पालन करता है और अधिक सुसंगत और सटीक टेक्स्ट उत्पन्न कर सकता है। यह ChatGPT Plus में एकीकृत है।
छवि संशोधन
DALL-E 2 और DALL-E 3 मौजूदा छवियों के विविधताएँ उत्पन्न कर सकते हैं और उन्हें संशोधित या विस्तारित करने के लिए संपादित कर सकते हैं। इनपेंटिंग और आउटपेंटिंग क्षमताएँ किसी छवि से संदर्भ का उपयोग करके दिए गए प्रॉम्प्ट के अनुसार मूल के अनुरूप शैली में लापता क्षेत्रों को भरती हैं। यह किसी छवि में एक नया विषय सम्मिलित कर सकता है या इसे अपनी मूल सीमाओं से परे विस्तारित कर सकता है। OpenAI के अनुसार, आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों, जिसमें छायाएँ, प्रतिबिंब और बनावट शामिल हैं, को ध्यान में रखता है।