DALL-E 2 ओपनएआई द्वारा विकसित एक टेक्स्ट-टू-इमेज मॉडल है, जिसे 6 अप्रैल 2022 को मूल DALL-E के उत्तराधिकारी के रूप में घोषित किया गया था। यह प्राकृतिक भाषा विवरणों, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है, से डिजिटल छवियाँ उत्पन्न करने के लिए गहन शिक्षण पद्धतियों का उपयोग करता है। मॉडल को अपने पूर्ववर्ती की तुलना में उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया था, साथ ही अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने की क्षमता भी रखता है। इसका नाम पिक्सर रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।
इतिहास और पृष्ठभूमि
मूल DALL-E को ओपनएआई द्वारा 5 जनवरी 2021 को एक ब्लॉग पोस्ट में प्रकट किया गया था, जिसमें छवियाँ उत्पन्न करने के लिए GPT-3 का एक संशोधित संस्करण उपयोग किया गया था। DALL-E 2 की घोषणा 6 अप्रैल 2022 को की गई थी, और यह 20 जुलाई 2022 को बीटा चरण में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए थे। इस चरण के दौरान, उपयोगकर्ता हर महीने एक निश्चित संख्या में छवियाँ मुफ्त में उत्पन्न कर सकते थे और अधिक खरीद सकते थे। नैतिकता और सुरक्षा के बारे में चिंताओं के कारण पहले से चयनित उपयोगकर्ताओं के लिए अनुसंधान पूर्वावलोकन के रूप में पहुँच प्रतिबंधित थी। 28 सितंबर 2022 को, DALL-E 2 को सभी के लिए खोल दिया गया, और प्रतीक्षा सूची की आवश्यकता हटा दी गई। नवंबर 2022 की शुरुआत में, ओपनएआई ने DALL-E 2 को एक API के रूप में जारी किया, जिससे डेवलपर्स को मॉडल को अपने स्वयं के अनुप्रयोगों में एकीकृत करने की अनुमति मिली। माइक्रोसॉफ्ट ने बाद में अपने डिज़ाइनर ऐप और बिंग और माइक्रोसॉफ्ट एज में शामिल इमेज क्रिएटर टूल में DALL-E 2 को लागू किया। API प्रति-छवि लागत के आधार पर संचालित होता है, जिसमें कीमतें छवि रिज़ॉल्यूशन के अनुसार भिन्न होती हैं और उद्यम ग्राहकों के लिए वॉल्यूम छूट उपलब्ध होती है। फरवरी 2024 में, ओपनएआई ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (सामग्री उत्पत्ति और प्रामाणिकता के लिए गठबंधन) मानक में मेटाडेटा शामिल था, जिसे सामग्री प्रामाणिकता पहल द्वारा बढ़ावा दिया गया था।
प्रौद्योगिकी
DALL-E 2 3.5 बिलियन पैरामीटर का उपयोग करता है, जो इसके पूर्ववर्ती से कम संख्या है। एक ऑटोरेग्रेसिव ट्रांसफॉर्मर के बजाय, यह CLIP छवि एम्बेडिंग पर आधारित एक प्रसार मॉडल नियोजित करता है। अनुमान के दौरान, ये छवि एम्बेडिंग एक पूर्व मॉडल द्वारा CLIP टेक्स्ट एम्बेडिंग से उत्पन्न होती हैं। यह वास्तुकला स्टेबल डिफ्यूज़न के समान है, जो कुछ महीनों बाद जारी किया गया था। मॉडल Generative AI और Deep learning में पहले के काम पर आधारित है, विशेष रूप से ओपनएआई और अन्य द्वारा Transformer (architecture) वास्तुकला के विकास पर। पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) मॉडल 2018 में ओपनएआई द्वारा विकसित किया गया था, जिसे 2019 में GPT-2 और 2020 में GPT-3 तक बढ़ाया गया, जिसमें 175 बिलियन पैरामीटर थे। DALL-E 2 की प्रसार दृष्टिकोण मूल DALL-E की ऑटोरेग्रेसिव विधि से भिन्न है, जिसने एक असतत VAE और 12 बिलियन पैरामीटर वाले डिकोडर-केवल ट्रांसफॉर्मर मॉडल का उपयोग किया था।
क्षमताएँ
DALL-E 2 कई शैलियों में चित्र उत्पन्न कर सकता है, जिसमें फोटोयथार्थवादी चित्र, पेंटिंग और इमोजी शामिल हैं। यह अपनी छवियों में वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है और स्पष्ट निर्देश के बिना नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। मॉडल दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता है, और दुर्लभ विफलताओं के साथ विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर मनुष्यों को बुद्धि मापने के लिए दिए जाने वाले दृश्य परीक्षण हैं। DALL-E 2 छवि संशोधन का भी समर्थन करता है, जिसमें मौजूदा छवियों के विविधताएँ उत्पन्न करना और इनपेंटिंग और आउटपेंटिंग के माध्यम से उन्हें संपादित करना शामिल है। ये क्षमताएँ किसी छवि से संदर्भ का उपयोग करके दिए गए प्रॉम्प्ट का पालन करते हुए मूल के अनुरूप माध्यम से लापता क्षेत्रों को भरती हैं। उदाहरण के लिए, आउटपेंटिंग किसी छवि को उसकी मूल सीमाओं से परे विस्तारित कर सकती है, जिसमें छाया, प्रतिबिंब और बनावट जैसे मौजूदा दृश्य तत्वों को ध्यान में रखा जाता है।
प्रभाव और विरासत
DALL-E 2 ने टेक्स्ट-टू-इमेज उत्पादन में एक महत्वपूर्ण प्रगति को चिह्नित किया, जिससे खुले बीटा और अंततः प्रतीक्षा सूची को हटाने के माध्यम से तकनीक को व्यापक जनता तक पहुँचाया गया। इसकी रिलीज़ ने Generative AI में रुचि को बढ़ावा दिया और क्षेत्र में बाद के विकासों को प्रभावित किया, जिसमें अक्टूबर 2023 में प्लस और एंटरप्राइज़ ग्राहकों के लिए ChatGPT में मूल रूप से जारी DALL-E 3 शामिल है। DALL-E 3 को बाद में माइक्रोसॉफ्ट के बिंग इमेज क्रिएटर और कोपायलट में एकीकृत किया गया, और मार्च 2025 में ChatGPT में GPT इमेज की मूल छवि-उत्पादन क्षमताओं द्वारा प्रतिस्थापित किया गया। मॉडल की प्रसार-आधारित वास्तुकला ने स्टेबल डिफ्यूज़न जैसी अन्य प्रणालियों को भी प्रभावित किया, और रचनात्मक कार्यों के लिए Machine learning अनुप्रयोगों के तेजी से विकास में योगदान दिया। DALL-E 2 की सुरक्षा के प्रति दृष्टिकोण, जिसमें अनुसंधान पूर्वावलोकन के दौरान प्रतिबंधित पहुँच और बाद में वॉटरमार्किंग शामिल है, ने जनरेटिव मॉडल के जिम्मेदार परिनियोजन के लिए मिसालें स्थापित कीं।
स्वागत और चिंताएँ
DALL-E 2 की रिलीज़ ने काफी सार्वजनिक और शैक्षणिक ध्यान आकर्षित किया, जिसमें AI-उत्पन्न चित्रों की रचनात्मक क्षमता और नैतिक चुनौतियों दोनों पर प्रकाश डाला गया। चिंताओं में भ्रामक सामग्री बनाने के लिए दुरुपयोग की संभावना, कॉपीराइट मुद्दे और कलाकारों और डिजाइनरों पर प्रभाव शामिल थे। ओपनएआई का चरणबद्ध रोलआउट, प्रारंभिक प्रतिबंधों और एक प्रतीक्षा सूची के साथ, इन चिंताओं को दर्शाता है। टेक्स्ट प्रॉम्प्ट से यथार्थवादी छवियाँ उत्पन्न करने की मॉडल की क्षमता ने उत्पत्ति और प्रामाणिकता के बारे में भी प्रश्न उठाए, जिससे 2024 में C2PA वॉटरमार्क को अपनाया गया। इन चुनौतियों के बावजूद, DALL-E 2 को इसकी तकनीकी उपलब्धियों और उपयोगकर्ता-अनुकूल इंटरफ़ेस के लिए व्यापक रूप से सराहा गया, जिससे गैर-विशेषज्ञों के बीच टेक्स्ट-टू-इमेज उत्पादन को लोकप्रिय बनाने में मदद मिली।