DALL-E, DALL-E 2, और DALL-E 3 (शैलीबद्ध रूप में DALL·E) OpenAI द्वारा विकसित टेक्स्ट-टू-इमेज मॉडल हैं, जो प्राकृतिक भाषा विवरणों (जिन्हें प्रॉम्प्ट कहा जाता है) से डिजिटल छवियाँ उत्पन्न करने के लिए डीप लर्निंग पद्धतियों का उपयोग करते हैं। पहला संस्करण जनवरी 2021 में घोषित किया गया था, और बाद के संस्करणों ने यथार्थवाद, रिज़ॉल्यूशन और प्रॉम्प्ट अनुसरण में क्षमताओं का विस्तार किया। यह नाम पिक्सर के रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक मिश्रित शब्द है।
इतिहास और पृष्ठभूमि
OpenAI ने 5 जनवरी 2021 को एक ब्लॉग पोस्ट में DALL-E का अनावरण किया, जिसमें छवियाँ उत्पन्न करने के लिए GPT-3 का एक संशोधित संस्करण उपयोग किया गया। 6 अप्रैल 2022 को, कंपनी ने DALL-E 2 की घोषणा की, जो उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया उत्तराधिकारी था और जो "अवधारणाओं, विशेषताओं और शैलियों को संयोजित" कर सकता था। नैतिक और सुरक्षा चिंताओं के कारण DALL-E 2 तक पहुँच शुरू में केवल पूर्व-चयनित उपयोगकर्ताओं के लिए एक शोध पूर्वावलोकन के रूप में प्रतिबंधित रही। 20 जुलाई 2022 को, मॉडल बीटा चरण में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए, जिससे मासिक रूप से एक निश्चित संख्या में मुफ्त जनरेशन की अनुमति मिली और अधिक खरीदने के विकल्प भी उपलब्ध थे। 28 सितंबर 2022 को प्रतीक्षा सूची की आवश्यकता हटा दी गई, जिससे यह उपकरण सभी के लिए खुल गया।
सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जो पिछले संस्करणों की तुलना में "काफी अधिक सूक्ष्मता और विवरण" को समझने में सक्षम था। इसे अक्टूबर 2023 में ChatGPT में Plus और Enterprise ग्राहकों के लिए मूल रूप से जारी किया गया, और नवंबर की शुरुआत में API और एक "Labs" प्लेटफ़ॉर्म के माध्यम से उपलब्ध कराया गया। Microsoft ने इस मॉडल को Bing के Image Creator टूल और अपने Designer ऐप में लागू किया, जिसमें Microsoft Copilot DALL-E 3 पर चल रहा था। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया। फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (Coalition for Content Provenance and Authenticity) मानक में मेटाडेटा शामिल था।
प्रौद्योगिकी
पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल 2018 में OpenAI द्वारा ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके विकसित किया गया था। स्केलिंग पुनरावृत्तियों ने 2019 में GPT-2 और 2020 में GPT-3 का उत्पादन किया, बाद वाले में 175 बिलियन पैरामीटर थे। DALL-E ने विभिन्न संस्करणों में विशिष्ट आर्किटेक्चर के साथ इस नींव पर निर्माण किया।
DALL-E
मूल DALL-E में तीन घटक शामिल थे: एक असतत वैरिएशनल ऑटोएनकोडर (VAE), GPT-3 के समान 12 बिलियन पैरामीटर वाला एक ऑटोरेग्रेसिव डिकोडर-ओनली ट्रांसफॉर्मर मॉडल, और छवि और टेक्स्ट एनकोडर की एक CLIP जोड़ी। असतत VAE ने छवियों को टोकन के अनुक्रमों में और वापस परिवर्तित किया, जो आवश्यक था क्योंकि ट्रांसफॉर्मर सीधे छवि डेटा को संसाधित नहीं करता है। इनपुट में एक टोकनयुक्त अंग्रेजी कैप्शन (अधिकतम 256 टोकन, शब्दावली आकार 16,384) के बाद टोकनयुक्त छवि पैच शामिल थे। प्रत्येक 256×256 RGB छवि को 4×4 पिक्सेल के 32×32 पैच में विभाजित किया गया था, जिसमें प्रत्येक पैच को 8,192 की शब्दावली का उपयोग करके एक टोकन में परिवर्तित किया गया था।
CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग), जिसे DALL-E के साथ विकसित और घोषित किया गया था, कंट्रास्टिव लर्निंग पर आधारित एक अलग मॉडल था जिसे इंटरनेट से स्क्रैप किए गए 400 मिलियन छवि-टेक्स्ट जोड़ों पर प्रशिक्षित किया गया था। इसने DALL-E के आउटपुट को यह भविष्यवाणी करके रैंक किया कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची से कौन सा कैप्शन एक छवि के लिए सबसे उपयुक्त था, और प्रॉम्प्ट के सबसे करीबी मिलान का चयन करने के लिए एक बड़ी प्रारंभिक सूची को फ़िल्टर किया।
DALL-E 2
DALL-E 2 ने 3.5 बिलियन पैरामीटर का उपयोग किया, जो अपने पूर्ववर्ती से कम थे, और ऑटोरेग्रेसिव ट्रांसफॉर्मर को CLIP छवि एम्बेडिंग पर सशर्त डिफ्यूज़न मॉडल से बदल दिया। अनुमान के दौरान, ये एम्बेडिंग एक पूर्व मॉडल द्वारा CLIP टेक्स्ट एम्बेडिंग से उत्पन्न की गई थीं। यह आर्किटेक्चर कुछ महीनों बाद जारी Stable Diffusion के समान था।
DALL-E 3
OpenAI ने DALL-E 3 के लिए एक तकनीकी रिपोर्ट प्रकाशित की, लेकिन इसमें प्रशिक्षण और कार्यान्वयन विवरण छोड़ दिए गए, इसके बजाय बेहतर प्रॉम्प्ट-अनुसरण क्षमताओं पर ध्यान केंद्रित किया गया। मॉडल को ChatGPT Plus में एकीकृत किया गया, जिससे उत्पन्न छवियों के संवादात्मक शोधन की अनुमति मिली।
क्षमताएँ
DALL-E कई शैलियों में इमेजरी उत्पन्न कर सकता था, जिसमें फोटोरियलिस्टिक छवियाँ, पेंटिंग और इमोजी शामिल थे। यह वस्तुओं को "हेरफेर और पुनर्व्यवस्थित" कर सकता था और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्व रख सकता था। BoingBoing के लिए लिखते हुए थॉम डन ने नोट किया कि जब एक मूली को नाक बहते हुए, लट्टे पीते हुए, या यूनीसाइकिल चलाते हुए बनाने के लिए कहा गया, तो DALL-E अक्सर रूमाल, हाथ और पैर को उचित स्थानों पर बनाता था। मॉडल "रिक्त स्थान भर सकता था", संबंधित प्रॉम्प्ट के लिए क्रिसमस इमेजरी या टेक्स्ट में उल्लिखित नहीं छाया जैसे उपयुक्त विवरणों का अनुमान लगा सकता था, और दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता था।
DALL-E विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता था, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरएक्टिव कंप्यूटिंग के एसोसिएट प्रोफेसर मार्क रीडल ने पाया कि DALL-E अवधारणाओं को मिश्रित कर सकता था, जो मानव रचनात्मकता का एक प्रमुख तत्व है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त थी, जो अक्सर मानव बुद्धि को मापने के लिए प्रशासित दृश्य परीक्षण होते हैं।
DALL-E 3 ने पूर्ववर्तियों की तुलना में जटिल प्रॉम्प्ट का अधिक सटीकता और विवरण के साथ पालन किया और छवियों के भीतर अधिक सुसंगत और सटीक टेक्स्ट उत्पन्न किया।
छवि संशोधन
किसी मौजूदा छवि को देखते हुए, DALL-E 2 और DALL-E 3 मूल के आधार पर व्यक्तिगत आउटपुट के रूप में "विविधताएँ" उत्पन्न कर सकते थे, साथ ही छवि को संशोधित या विस्तारित करने के लिए संपादित भी कर सकते थे। "इनपेंटिंग" और "आउटपेंटिंग" क्षमताओं ने छवि के संदर्भ का उपयोग करके मूल के अनुरूप माध्यम में लापता क्षेत्रों को भर दिया, दिए गए प्रॉम्प्ट का पालन करते हुए। उदाहरण के लिए, इसने एक छवि में एक नया विषय डालने या उसकी मूल सीमाओं से परे विस्तार करने की अनुमति दी। OpenAI के अनुसार, "आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों - जिसमें छाया, प्रतिबिंब और बनावट शामिल हैं - को ध्यान में रखता है ताकि" निर्बाध विस्तार उत्पन्न किया जा सके।