DALL-E एक टेक्स्ट-टू-इमेज मॉडलों की श्रृंखला है जिसे OpenAI द्वारा डीप लर्निंग पद्धतियों का उपयोग करके विकसित किया गया है, जो प्राकृतिक भाषा विवरणों (जिन्हें प्रॉम्प्ट कहा जाता है) से डिजिटल चित्र उत्पन्न करती है। पहला संस्करण जनवरी 2021 में घोषित किया गया था, उसके बाद 2022 में DALL-E 2 और 2023 में DALL-E 3 आया। यह नाम पिक्सर के रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।
ये मॉडल जनरेटिव आर्टिफिशियल इंटेलिजेंस के व्यापक क्षेत्र का हिस्सा हैं, जो चित्र, पाठ या ऑडियो जैसी नई सामग्री बनाने पर केंद्रित है। DALL-E की क्षमताओं ने टेक्स्ट-टू-इमेज जनरेशन में बाद के विकासों को प्रभावित किया है और इसे विभिन्न वाणिज्यिक उत्पादों में एकीकृत किया गया है।
इतिहास और पृष्ठभूमि
OpenAI ने 5 जनवरी 2021 को एक ब्लॉग पोस्ट में DALL-E का खुलासा किया, जिसमें अपने GPT-3 मॉडल के एक संशोधित संस्करण का उपयोग करके चित्र उत्पन्न किए गए। 6 अप्रैल 2022 को, कंपनी ने DALL-E 2 की घोषणा की, जो उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी चित्र बनाने और अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने के लिए डिज़ाइन किया गया एक उत्तराधिकारी था। नैतिक और सुरक्षा चिंताओं के कारण DALL-E 2 तक पहुंच शुरू में एक शोध पूर्वावलोकन के लिए पूर्व-चयनित उपयोगकर्ताओं तक सीमित थी। 20 जुलाई 2022 को, मॉडल एक बीटा चरण में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए, जिससे प्रति माह एक निश्चित संख्या में मुफ्त चित्र मिल सकते थे और अधिक खरीदने के विकल्प उपलब्ध थे। 28 सितंबर 2022 को प्रतीक्षा सूची की आवश्यकता हटा दी गई, जिससे मॉडल सभी के लिए खुल गया।
सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जो पिछले संस्करणों की तुलना में काफी अधिक सूक्ष्मता और विवरण को समझ सकता था। इसे अक्टूबर 2023 में ChatGPT Plus और ChatGPT Enterprise ग्राहकों के लिए मूल रूप से ChatGPT में जारी किया गया, और उसी वर्ष नवंबर की शुरुआत में OpenAI के API और Labs प्लेटफ़ॉर्म के माध्यम से उपलब्ध कराया गया। Microsoft ने Bing के Image Creator टूल में DALL-E 3 को लागू किया और अपने Designer ऐप में इसका उपयोग करने की योजना बनाई, जिसमें Microsoft Copilot DALL-E 3 पर चल रहा था। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT Image की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित कर दिया गया।
फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न चित्रों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (Coalition for Content Provenance and Authenticity) मानक में मेटाडेटा शामिल था, जिसे Content Authenticity Initiative द्वारा प्रचारित किया गया।
प्रौद्योगिकी
पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल 2018 में OpenAI द्वारा ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके विकसित किया गया था। इसे 2019 में GPT-2 और 2020 में GPT-3 तक बढ़ाया गया, जिसमें 175 बिलियन पैरामीटर थे। DALL-E इसी आधार पर बनाया गया है।
DALL-E
मूल DALL-E में तीन घटक हैं: एक डिस्क्रीट वेरिएशनल ऑटोएन्कोडर (VAE), एक ऑटोरेग्रेसिव डिकोडर-ओनली ट्रांसफॉर्मर मॉडल जिसमें GPT-3 के समान 12 बिलियन पैरामीटर हैं, और एक CLIP जोड़ी जिसमें छवि और पाठ एन्कोडर शामिल हैं। डिस्क्रीट VAE एक छवि को टोकन के अनुक्रम में और वापस परिवर्तित करता है, क्योंकि ट्रांसफॉर्मर छवि डेटा को सीधे संसाधित नहीं करता है। इनपुट टोकनाइज़्ड छवि कैप्शन का एक अनुक्रम है जिसके बाद टोकनाइज़्ड छवि पैच होते हैं। कैप्शन अंग्रेजी में होते हैं, जिन्हें बाइट पेयर एन्कोडिंग द्वारा 16,384 की शब्दावली आकार के साथ टोकनाइज़ किया जाता है, और 256 टोकन तक लंबे हो सकते हैं। प्रत्येक छवि 256 बाय 256 RGB होती है, जिसे 32 बाय 32 पैच में विभाजित किया जाता है, प्रत्येक पैच 4 बाय 4 पिक्सेल का होता है, और प्रत्येक पैच को VAE द्वारा 8,192 की शब्दावली से एक टोकन में परिवर्तित किया जाता है।
DALL-E को CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) के साथ विकसित किया गया था, जो कंट्रास्टिव लर्निंग पर आधारित एक अलग मॉडल है जिसे इंटरनेट से स्क्रैप किए गए 400 मिलियन छवियों और पाठ कैप्शन के जोड़े पर प्रशिक्षित किया गया था। CLIP DALL-E के आउटपुट को यह भविष्यवाणी करके रैंक करता है कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची में से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है। एक प्रशिक्षित CLIP जोड़ी बड़ी प्रारंभिक छवियों की सूची को फ़िल्टर करके उस छवि का चयन करती है जो पाठ प्रॉम्प्ट के सबसे करीब होती है।
DALL-E 2
DALL-E 2 में 3.5 बिलियन पैरामीटर हैं, जो अपने पूर्ववर्ती से कम हैं। ऑटोरेग्रेसिव ट्रांसफॉर्मर के बजाय, यह CLIP छवि एम्बेडिंग पर आधारित एक डिफ्यूजन मॉडल का उपयोग करता है, जो अनुमान के दौरान एक पूर्व मॉडल द्वारा CLIP पाठ एम्बेडिंग से उत्पन्न होते हैं। यह आर्किटेक्चर स्टेबल डिफ्यूजन के समान है, जो कुछ महीनों बाद जारी किया गया था।
DALL-E 3
DALL-E 3 के लिए एक तकनीकी रिपोर्ट लिखी गई थी, लेकिन इसमें प्रशिक्षण या कार्यान्वयन विवरण शामिल नहीं हैं, बल्कि बेहतर प्रॉम्प्ट अनुसरण क्षमताओं पर ध्यान केंद्रित किया गया है।
क्षमताएँ
DALL-E कई शैलियों में चित्र उत्पन्न कर सकता है, जिसमें फोटोयथार्थवादी चित्र, पेंटिंग और इमोजी शामिल हैं। यह छवियों में वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। उदाहरण के लिए, जब एक डाइकॉन मूली को अपनी नाक बहाते हुए, लट्टे पीते हुए, या यूनीसाइकिल चलाते हुए बनाने के लिए कहा जाता है, तो DALL-E अक्सर रूमाल, हाथ और पैर को उचित स्थानों पर बनाता है। यह विशिष्ट प्रॉम्प्ट के बिना उपयुक्त विवरण का अनुमान लगा सकता है, जैसे कि उत्सव से जुड़े प्रॉम्प्ट में क्रिसमस की कल्पना जोड़ना या छायाओं को उचित रूप से रखना। DALL-E दृश्य और डिज़ाइन रुझानों की व्यापक समझ भी प्रदर्शित करता है।
मॉडल विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए चित्र उत्पन्न कर सकता है, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरएक्टिव कंप्यूटिंग के एसोसिएट प्रोफेसर मार्क रिडल ने पाया कि DALL-E अवधारणाओं को मिश्रित कर सकता है, जिसे मानव रचनात्मकता का एक प्रमुख तत्व माना जाता है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर मनुष्यों को बुद्धि मापने के लिए दिए जाने वाले दृश्य परीक्षण हैं।
DALL-E 3 अपने पूर्ववर्तियों की तुलना में जटिल प्रॉम्प्ट का अधिक सटीकता और विवरण के साथ अनुसरण करता है और अधिक सुसंगत और सटीक पाठ उत्पन्न कर सकता है। यह ChatGPT Plus में एकीकृत है।
छवि संशोधन
किसी मौजूदा छवि को देखते हुए, DALL-E 2 और DALL-E 3 मूल के आधार पर व्यक्तिगत आउटपुट के रूप में छवि के विविधताएं उत्पन्न कर सकते हैं, साथ ही छवि को संशोधित या विस्तारित करने के लिए संपादित भी कर सकते हैं। इन मॉडलों की इनपेंटिंग और आउटपेंटिंग क्षमताएं किसी छवि से संदर्भ का उपयोग करके लापता क्षेत्रों को मूल के अनुरूप माध्यम से भरती हैं, दिए गए प्रॉम्प्ट का अनुसरण करते हुए। उदाहरण के लिए, इसका उपयोग किसी छवि में एक नया विषय डालने या छवि को उसकी मूल सीमाओं से परे विस्तारित करने के लिए किया जा सकता है। OpenAI के अनुसार, आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों, जैसे छाया, प्रतिबिंब और बनावट को ध्यान में रखती है।
प्रभाव और अपनाना
DALL-E को वाणिज्यिक उपकरणों में व्यापक रूप से अपनाया गया है। Microsoft ने अपने Designer ऐप और Bing तथा Microsoft Edge में शामिल Image Creator टूल में DALL-E 2 को लागू किया। API प्रति-छवि लागत के आधार पर संचालित होता है, जिसमें कीमतें छवि रिज़ॉल्यूशन के अनुसार भिन्न होती हैं, और OpenAI की उद्यम टीम के साथ काम करने वाली कंपनियों के लिए वॉल्यूम छूट उपलब्ध है। मॉडल का प्रभाव अन्य टेक्स्ट-टू-इमेज सिस्टम तक फैला हुआ है और इसने आर्टिफिशियल इंटेलिजेंस सुरक्षा, कॉपीराइट और सामग्री उत्पत्ति के बारे में चर्चाओं में योगदान दिया है।