DALL-E 1, जिसे DALL·E के रूप में शैलीबद्ध किया गया है, OpenAI द्वारा विकसित टेक्स्ट-टू-इमेज मॉडल का पहला संस्करण है। जनवरी 2021 में घोषित, यह प्राकृतिक भाषा विवरणों, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है, से डिजिटल छवियाँ उत्पन्न करने के लिए गहन शिक्षण पद्धतियों का उपयोग करता है। यह नाम पिक्सर रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।
DALL-E 1 जनरेटिव आर्टिफिशियल इंटेलिजेंस में एक मील का पत्थर था, जिसने प्रदर्शित किया कि एक ट्रांसफॉर्मर-आधारित मॉडल पाठ्य विवरणों से सुसंगत और विविध छवियाँ उत्पन्न कर सकता है। इसके बाद 2022 में DALL-E 2 और 2023 में DALL-E 3 आए, जिनमें से प्रत्येक ने यथार्थवाद, रिज़ॉल्यूशन और प्रॉम्प्ट समझ में सुधार किया।
इतिहास और पृष्ठभूमि
OpenAI ने 5 जनवरी 2021 को एक ब्लॉग पोस्ट में DALL-E 1 का खुलासा किया। इसने GPT-3 का एक संशोधित संस्करण उपयोग किया, जो 175 बिलियन पैरामीटर वाला एक बड़ा भाषा मॉडल है, छवियाँ उत्पन्न करने के लिए। मॉडल को CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) के साथ विकसित किया गया था, जो इंटरनेट से स्क्रैप किए गए 400 मिलियन इमेज-टेक्स्ट जोड़ों पर प्रशिक्षित एक अलग मॉडल है। CLIP की भूमिका DALL-E के आउटपुट को रैंक करना था, यह भविष्यवाणी करके कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची में से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है, जिससे सर्वोत्तम परिणामों को फ़िल्टर करने में मदद मिलती है।
DALL-E 1 की रिलीज़ ने जनरेटिव AI की क्षमताओं और निहितार्थों के बारे में महत्वपूर्ण सार्वजनिक रुचि और चर्चा उत्पन्न की। इसे तुरंत व्यापक रूप से उपलब्ध नहीं कराया गया था; नैतिक और सुरक्षा चिंताओं के कारण शुरू में पहुँच अनुसंधान पूर्वावलोकन के लिए प्रतिबंधित थी। उत्तराधिकारी DALL-E 2 जुलाई 2022 में बीटा में आया और सितंबर 2022 में सभी के लिए खोल दिया गया।
तकनीक
DALL-E 1 के तीन घटक थे: एक असतत वैरिएशनल ऑटोएन्कोडर (VAE), 12 बिलियन पैरामीटर वाला एक ऑटोरेग्रेसिव डिकोडर-केवल ट्रांसफॉर्मर मॉडल, और छवि और टेक्स्ट एन्कोडर की एक CLIP जोड़ी। असतत VAE ने छवियों को टोकन के अनुक्रमों में और वापस परिवर्तित किया, क्योंकि ट्रांसफॉर्मर छवि डेटा को सीधे संसाधित नहीं करता था।
ट्रांसफॉर्मर का इनपुट टोकनयुक्त छवि कैप्शन के बाद टोकनयुक्त छवि पैच का एक अनुक्रम था। कैप्शन अंग्रेजी में थे, बाइट पेयर एन्कोडिंग द्वारा 16,384 की शब्दावली आकार के साथ टोकनयुक्त, और 256 टोकन तक लंबे हो सकते थे। प्रत्येक छवि एक 256×256 RGB छवि थी जो 4×4 पिक्सेल के 32×32 पैच में विभाजित थी। प्रत्येक पैच को असतत VAE द्वारा 8,192 की शब्दावली से एक टोकन में परिवर्तित किया गया था।
यह वास्तुकला GPT-3 के समान थी लेकिन छवि निर्माण के लिए अनुकूलित थी। ऑटोरेग्रेसिव मॉडल ने पाठ्य कैप्शन पर सशर्त, क्रमिक रूप से छवि टोकन की भविष्यवाणी की। कंट्रास्टिव लर्निंग पर आधारित CLIP का उपयोग मॉडल द्वारा उत्पन्न बड़े सेट से सर्वोत्तम छवि को रैंक करने और चुनने के लिए किया गया था।
क्षमताएँ
DALL-E 1 कई शैलियों में कल्पना उत्पन्न कर सकता था, जिसमें फोटोयथार्थवादी छवियाँ, पेंटिंग और इमोजी शामिल हैं। यह अपनी छवियों में वस्तुओं को "हेरफेर और पुनर्व्यवस्थित" कर सकता था और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता था। उदाहरण के लिए, जब एक डाइकॉन मूली को अपनी नाक फूंकते हुए, लट्टे की चुस्की लेते हुए, या यूनीसाइकिल चलाते हुए बनाने के लिए कहा गया, तो यह अक्सर रूमाल, हाथ और पैर को प्रशंसनीय स्थानों पर खींचता था।
मॉडल ने "रिक्त स्थान भरने" की क्षमता दिखाई, बिना विशिष्ट प्रॉम्प्ट के उचित विवरण का अनुमान लगाते हुए, जैसे कि छुट्टी से जुड़े प्रॉम्प्ट में क्रिसमस कल्पना जोड़ना और छाया को उचित रूप से रखना। इसने दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित की।
DALL-E 1 विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता था, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरएक्टिव कंप्यूटिंग के एक एसोसिएट प्रोफेसर मार्क रीडल ने पाया कि यह अवधारणाओं को मिश्रित कर सकता है, जो मानव रचनात्मकता का एक प्रमुख तत्व है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त थी, जो अक्सर मानव बुद्धि को मापने के लिए उपयोग किए जाने वाले दृश्य परीक्षण हैं।
प्रभाव और विरासत
DALL-E 1 ने टेक्स्ट-टू-इमेज निर्माण को लोकप्रिय बनाने में मदद की और जनरेटिव AI में आगे के अनुसंधान को प्रेरित किया। इसके बाद DALL-E 2 आया, जिसने 3.5 बिलियन पैरामीटर वाले एक डिफ्यूजन मॉडल का उपयोग किया, और DALL-E 3, जिसे अक्टूबर 2023 में ChatGPT में एकीकृत किया गया। Microsoft ने Bing के इमेज क्रिएटर और डिज़ाइनर ऐप में DALL-E 3 को लागू किया, और Copilot इस पर चलता है। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT इमेज की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया था।
OpenAI ने फरवरी 2024 में DALL-E उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, C2PA (कोएलिशन फॉर कंटेंट प्रोवेनेंस एंड ऑथेंटिसिटी) मानक में मेटाडेटा का उपयोग करते हुए। DALL-E 1 की रिलीज़ ने आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग के विकास में एक महत्वपूर्ण कदम चिह्नित किया, जिसने बाद के मॉडलों और अनुप्रयोगों को प्रभावित किया।