DALL-E एक Text-to-image generation पीढ़ी मॉडल की श्रृंखला है जिसे OpenAI द्वारा विकसित किया गया है, जिसका नाम कलाकार साल्वाडोर डाली और पिक्सर रोबोट चरित्र WALL-E के नामों के मिश्रण से रखा गया है। मूल DALL-E की घोषणा जनवरी 2021 में एक 12-बिलियन-पैरामीटर Transformer (architecture) मॉडल के रूप में की गई थी, जो GPT-3 के समान वास्तुकला परिवार पर आधारित था, और इसे पाठ विवरणों से छवियाँ उत्पन्न करने के लिए प्रशिक्षित किया गया था, जिसमें छवि पीढ़ी को असतत छवि टोकनों पर अनुक्रम भविष्यवाणी समस्या के रूप में माना गया था, न कि उन diffusion तकनीकों का उपयोग करके जो बाद में इस क्षेत्र पर हावी हो जाएँगी।
संस्करणों में विकास
DALL-E 2, जो अप्रैल 2022 में जारी किया गया था, ने मूल असतत-टोकन दृष्टिकोण को CLIP द्वारा निर्देशित एक diffusion-आधारित वास्तुकला से बदल दिया, जो OpenAI का संयुक्त छवि-पाठ Embedding मॉडल है, जिससे काफी उच्च-रिज़ॉल्यूशन और अधिक फोटोयथार्थवादी छवियाँ उत्पन्न हुईं और पाठ विवरण से मौजूदा छवियों के हिस्सों को संपादित करने के लिए एक "इनपेंटिंग" सुविधा पेश की गई। DALL-E 2 का सार्वजनिक बीटा, जिसके बाद 2022 में सामान्य उपलब्धता आई, ने मुख्यधारा के मीडिया का महत्वपूर्ण ध्यान आकर्षित किया और इसे Midjourney और Stable Diffusion जैसे समकालीन रिलीज़ों के साथ, पहली बार AI-जनित इमेजरी को मुख्यधारा की जन जागरूकता में लाने का श्रेय व्यापक रूप से दिया जाता है। DALL-E 3, जो 2023 में जारी किया गया और सीधे ग्राहकों के लिए ChatGPT में एकीकृत किया गया, ने छवियों के भीतर प्रॉम्प्ट अनुपालन और पाठ प्रतिपादन में सुधार किया, और छवि मॉडल को पास करने से पहले छोटे उपयोगकर्ता प्रॉम्प्ट को विस्तारित और परिष्कृत करने के लिए स्वयं ChatGPT का उपयोग किया।
स्वागत और प्रभाव
DALL-E के रिलीज़ों ने दृश्य रचनात्मक कार्य के भविष्य के बारे में महत्वपूर्ण सार्वजनिक बहस छेड़ दी, जिससे AI-सहायता प्राप्त कला और डिज़ाइन के साथ प्रयोग करने वाले उपयोगकर्ताओं से उत्साह और पेशेवर चित्रकारों और फोटोग्राफरों से विस्थापन और सहमति के बिना प्रशिक्षण डेटा में कॉपीराइट छवियों के उपयोग के बारे में चिंता दोनों उत्पन्न हुई, एक विवाद जो जनरेटिव AI उद्योग में व्यापक AI and copyright मुकदमेबाजी में योगदान देता है। इस प्रणाली ने गलत सूचना और गैर-सहमति वाली इमेजरी उत्पन्न करने की क्षमता पर भी जांच आकर्षित की, जिससे OpenAI को सामग्री फ़िल्टर लागू करने और कुछ समय के लिए सार्वजनिक हस्तियों के पहचानने योग्य चेहरे उत्पन्न करने पर प्रतिबंध लगाने के लिए प्रेरित किया।
विरासत
DALL-E को आम तौर पर उन मॉडलों में से एक माना जाता है, जो GANs पर पहले के शैक्षणिक कार्य और बाद के खुले प्रतिस्पर्धियों के साथ, text-to-image पीढ़ी को एक शोध जिज्ञासा के बजाय एक मुख्यधारा उपभोक्ता और वाणिज्यिक तकनीक के रूप में स्थापित करने का श्रेय देता है। इसकी सफलता ने OpenAI की व्यापक मल्टीमॉडल रणनीति में सीधे योगदान दिया, जिससे बाद में GPT-4 और उसके बाद के मॉडलों में एकीकृत छवि-समझ और छवि-पीढ़ी क्षमताओं को सूचित किया गया, और प्रॉम्प्ट-लेखन को एक ऐसे कौशल के रूप में लोकप्रिय बनाने में मदद की जो दृश्य, न केवल पाठ्य, जनरेटिव AI प्रणालियों के लिए प्रासंगिक है।