DALL-E 2 एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा विकसित किया गया है, जो प्राकृतिक भाषा विवरणों, जिन्हें प्रॉम्प्ट कहा जाता है, से डिजिटल चित्र उत्पन्न करता है। 6 अप्रैल 2022 को घोषित, यह मूल DALL-E मॉडल का उत्तराधिकारी था और इसे उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी चित्र उत्पन्न करने के लिए डिज़ाइन किया गया था, जिसमें अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने की क्षमता थी। यह मॉडल गहन शिक्षण पद्धतियों का उपयोग करता है, विशेष रूप से CLIP छवि एम्बेडिंग पर आधारित एक प्रसार मॉडल, और इसे 2022 के दौरान चरणों में जनता के लिए जारी किया गया था।
नाम DALL-E एनिमेटेड रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है। मॉडल का विकास जनरेटिव आर्टिफिशियल इंटेलिजेंस में एक महत्वपूर्ण कदम था, जो मशीन लर्निंग और तंत्रिका नेटवर्क में पहले के अग्रिमों पर आधारित था।
इतिहास और पृष्ठभूमि
DALL-E का पहला संस्करण जनवरी 2021 में OpenAI द्वारा घोषित किया गया था, जो चित्र उत्पन्न करने के लिए GPT-3 के संशोधित संस्करण का उपयोग करता था। 6 अप्रैल 2022 को, OpenAI ने DALL-E 2 को उत्तराधिकारी के रूप में घोषित किया, जिसमें बेहतर यथार्थवाद और रिज़ॉल्यूशन पर जोर दिया गया। नैतिक और सुरक्षा चिंताओं के कारण पहुंच शुरू में पूर्व-चयनित उपयोगकर्ताओं तक अनुसंधान पूर्वावलोकन के लिए प्रतिबंधित थी। 20 जुलाई 2022 को, मॉडल बीटा चरण में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को निमंत्रण भेजे गए, जो हर महीने एक निश्चित संख्या में चित्र मुफ्त उत्पन्न कर सकते थे और अतिरिक्त क्रेडिट खरीद सकते थे। 28 सितंबर 2022 को प्रतीक्षा सूची की आवश्यकता हटा दी गई, जिससे DALL-E 2 सभी के लिए खुल गया।
नवंबर 2022 की शुरुआत में, OpenAI ने DALL-E 2 को एक API के रूप में जारी किया, जिससे डेवलपर्स को मॉडल को अपने अनुप्रयोगों में एकीकृत करने की अनुमति मिली। API प्रति-छवि लागत के आधार पर संचालित होता है, जिसमें कीमतें रिज़ॉल्यूशन के अनुसार भिन्न होती हैं और उद्यम ग्राहकों के लिए वॉल्यूम छूट उपलब्ध होती है। माइक्रोसॉफ्ट ने बाद में DALL-E 2 को अपने डिज़ाइनर ऐप और Bing तथा Microsoft Edge के भीतर इमेज क्रिएटर टूल में लागू किया। सितंबर 2023 में, OpenAI ने DALL-E 3 की घोषणा की, जिसे अक्टूबर 2023 में Plus और Enterprise ग्राहकों के लिए ChatGPT में एकीकृत किया गया और बाद में मार्च 2025 में GPT Image द्वारा प्रतिस्थापित किया गया।
प्रौद्योगिकी
DALL-E 2 3.5 बिलियन पैरामीटर का उपयोग करता है, जो इसके पूर्ववर्ती के 12 बिलियन से कम है। एक ऑटोरेग्रेसिव ट्रांसफॉर्मर मॉडल के बजाय, यह CLIP छवि एम्बेडिंग पर आधारित एक प्रसार मॉडल का उपयोग करता है। अनुमान के दौरान, एक पूर्व मॉडल CLIP टेक्स्ट एम्बेडिंग से इन छवि एम्बेडिंग को उत्पन्न करता है। यह वास्तुकला स्टेबल डिफ्यूज़न के समान है, जो कुछ महीने बाद जारी किया गया था। मूल DALL-E ने छवियों को टोकन में बदलने के लिए एक असतत वैरिएशनल ऑटोएनकोडर का उपयोग किया, जिसे एक ऑटोरेग्रेसिव डिकोडर-केवल ट्रांसफॉर्मर द्वारा संसाधित किया गया, जिसमें आउटपुट को रैंक करने के लिए छवि और टेक्स्ट एनकोडर की एक CLIP जोड़ी थी।
DALL-E 2 की प्रसार प्रक्रिया पाठ-व्युत्पन्न एम्बेडिंग द्वारा निर्देशित, शोर को पुनरावृत्त रूप से एक छवि में परिष्कृत करती है, जिससे उच्च-रिज़ॉल्यूशन आउटपुट और सुसंगत वस्तु स्थान सक्षम होते हैं। मॉडल के प्रशिक्षण में छवि-पाठ जोड़ों के बड़े डेटासेट शामिल थे, हालांकि विशिष्ट विवरण पूरी तरह से प्रकट नहीं किए गए थे।
क्षमताएँ
DALL-E 2 कई शैलियों में चित्र उत्पन्न कर सकता है, जिसमें फोटोयथार्थवादी छवियां, पेंटिंग और इमोजी शामिल हैं। यह वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है, और स्पष्ट निर्देश के बिना नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। उदाहरण के लिए, जब एक मूली को अपनी नाक बहाते हुए, लैटे पीते हुए, या यूनीसाइकिल चलाते हुए चित्रित करने के लिए कहा जाता है, तो मॉडल अक्सर रूमाल, हाथ और पैर को प्रशंसनीय स्थानों पर चित्रित करता है। यह रिक्त स्थान भर सकता है, जैसे कि उत्सव से जुड़े प्रॉम्प्ट में क्रिसमस चित्र या उन छवियों में उपयुक्त छायाएं जो उनका उल्लेख नहीं करती हैं।
मॉडल दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता है, और अवधारणाओं को मिश्रित कर सकता है, जो मानव रचनात्मकता का एक प्रमुख तत्व है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर बुद्धि मापने के लिए मनुष्यों को दिए जाने वाले दृश्य परीक्षण हैं। DALL-E 2 विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए चित्र उत्पन्न कर सकता है, केवल दुर्लभ विफलताओं के साथ।
छवि संशोधन
किसी मौजूदा छवि को देखते हुए, DALL-E 2 मूल के आधार पर व्यक्तिगत आउटपुट के रूप में विविधताएं उत्पन्न कर सकता है, साथ ही छवि को संशोधित या विस्तारित करने के लिए संपादित भी कर सकता है। इनपेंटिंग और आउटपेंटिंग क्षमताएं दिए गए प्रॉम्प्ट का पालन करते हुए, लापता क्षेत्रों को भरने के लिए छवि के संदर्भ का उपयोग करती हैं। उदाहरण के लिए, यह एक छवि में एक नया विषय सम्मिलित कर सकता है या इसे अपनी मूल सीमाओं से परे विस्तारित कर सकता है। OpenAI ने नोट किया कि आउटपेंटिंग छवि के मौजूदा दृश्य तत्वों, जैसे छाया, प्रतिबिंब और बनावट को ध्यान में रखती है।
सुरक्षा और नैतिकता
अपने अनुसंधान पूर्वावलोकन के दौरान, OpenAI ने दुरुपयोग की चिंताओं, जैसे भ्रामक या हानिकारक सामग्री उत्पन्न करने के कारण DALL-E 2 तक पहुंच प्रतिबंधित की। कंपनी ने हिंसक, वयस्क या राजनीतिक सामग्री को अवरुद्ध करने के लिए फिल्टर लागू किए, और फरवरी 2024 में उत्पन्न छवियों में वॉटरमार्क जोड़े, जिसमें कंटेंट ऑथेंटिसिटी इनिशिएटिव द्वारा प्रचारित C2PA मानक में मेटाडेटा शामिल था। इन उपायों का उद्देश्य डीपफेक और गलत सूचना के आसपास के नैतिक मुद्दों को संबोधित करना था।
विरासत और प्रभाव
DALL-E 2 ने बाद के टेक्स्ट-टू-इमेज मॉडल और व्यापक आर्टिफिशियल इंटेलिजेंस अनुसंधान को प्रभावित किया। इसकी प्रसार-आधारित दृष्टिकोण को अन्य प्रणालियों द्वारा अपनाया गया, और बिंग इमेज क्रिएटर जैसे उत्पादों में इसका एकीकरण जनरेटिव चित्रों तक सार्वजनिक पहुंच का विस्तार किया। मॉडल की सफलता ने गहन शिक्षण और ध्यान तंत्र में विकास के साथ, क्षेत्र में OpenAI की प्रमुखता में योगदान दिया।