अंग्रेज़ी से अनुवादित

DALL-E 1, जनवरी 2021 में OpenAI द्वारा घोषित, टेक्स्ट-टू-इमेज मॉडल का पहला संस्करण था, जो डीप लर्निंग का उपयोग करके प्राकृतिक भाषा प्रॉम्प्ट से डिजिटल छवियाँ उत्पन्न करता है।

DALL-E 1, जिसे DALL·E के रूप में शैलीबद्ध किया गया है, OpenAI द्वारा विकसित टेक्स्ट-टू-इमेज मॉडल का पहला संस्करण है। जनवरी 2021 में घोषित, यह प्राकृतिक भाषा विवरणों, जिन्हें प्रॉम्प्ट के रूप में जाना जाता है, से डिजिटल छवियाँ उत्पन्न करने के लिए गहन शिक्षण पद्धतियों का उपयोग करता है। यह नाम पिक्सर रोबोट चरित्र WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।

DALL-E 1 जनरेटिव आर्टिफिशियल इंटेलिजेंस में एक मील का पत्थर था, जिसने प्रदर्शित किया कि एक ट्रांसफॉर्मर-आधारित मॉडल पाठ्य विवरणों से सुसंगत और विविध छवियाँ उत्पन्न कर सकता है। इसके बाद 2022 में DALL-E 2 और 2023 में DALL-E 3 आए, जिनमें से प्रत्येक ने यथार्थवाद, रिज़ॉल्यूशन और प्रॉम्प्ट समझ में सुधार किया।

इतिहास और पृष्ठभूमि

OpenAI ने 5 जनवरी 2021 को एक ब्लॉग पोस्ट में DALL-E 1 का खुलासा किया। इसने GPT-3 का एक संशोधित संस्करण उपयोग किया, जो 175 बिलियन पैरामीटर वाला एक बड़ा भाषा मॉडल है, छवियाँ उत्पन्न करने के लिए। मॉडल को CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) के साथ विकसित किया गया था, जो इंटरनेट से स्क्रैप किए गए 400 मिलियन इमेज-टेक्स्ट जोड़ों पर प्रशिक्षित एक अलग मॉडल है। CLIP की भूमिका DALL-E के आउटपुट को रैंक करना था, यह भविष्यवाणी करके कि 32,768 यादृच्छिक रूप से चयनित कैप्शन की सूची में से कौन सा कैप्शन किसी छवि के लिए सबसे उपयुक्त है, जिससे सर्वोत्तम परिणामों को फ़िल्टर करने में मदद मिलती है।

DALL-E 1 की रिलीज़ ने जनरेटिव AI की क्षमताओं और निहितार्थों के बारे में महत्वपूर्ण सार्वजनिक रुचि और चर्चा उत्पन्न की। इसे तुरंत व्यापक रूप से उपलब्ध नहीं कराया गया था; नैतिक और सुरक्षा चिंताओं के कारण शुरू में पहुँच अनुसंधान पूर्वावलोकन के लिए प्रतिबंधित थी। उत्तराधिकारी DALL-E 2 जुलाई 2022 में बीटा में आया और सितंबर 2022 में सभी के लिए खोल दिया गया।

तकनीक

DALL-E 1 के तीन घटक थे: एक असतत वैरिएशनल ऑटोएन्कोडर (VAE), 12 बिलियन पैरामीटर वाला एक ऑटोरेग्रेसिव डिकोडर-केवल ट्रांसफॉर्मर मॉडल, और छवि और टेक्स्ट एन्कोडर की एक CLIP जोड़ी। असतत VAE ने छवियों को टोकन के अनुक्रमों में और वापस परिवर्तित किया, क्योंकि ट्रांसफॉर्मर छवि डेटा को सीधे संसाधित नहीं करता था।

ट्रांसफॉर्मर का इनपुट टोकनयुक्त छवि कैप्शन के बाद टोकनयुक्त छवि पैच का एक अनुक्रम था। कैप्शन अंग्रेजी में थे, बाइट पेयर एन्कोडिंग द्वारा 16,384 की शब्दावली आकार के साथ टोकनयुक्त, और 256 टोकन तक लंबे हो सकते थे। प्रत्येक छवि एक 256×256 RGB छवि थी जो 4×4 पिक्सेल के 32×32 पैच में विभाजित थी। प्रत्येक पैच को असतत VAE द्वारा 8,192 की शब्दावली से एक टोकन में परिवर्तित किया गया था।

यह वास्तुकला GPT-3 के समान थी लेकिन छवि निर्माण के लिए अनुकूलित थी। ऑटोरेग्रेसिव मॉडल ने पाठ्य कैप्शन पर सशर्त, क्रमिक रूप से छवि टोकन की भविष्यवाणी की। कंट्रास्टिव लर्निंग पर आधारित CLIP का उपयोग मॉडल द्वारा उत्पन्न बड़े सेट से सर्वोत्तम छवि को रैंक करने और चुनने के लिए किया गया था।

क्षमताएँ

DALL-E 1 कई शैलियों में कल्पना उत्पन्न कर सकता था, जिसमें फोटोयथार्थवादी छवियाँ, पेंटिंग और इमोजी शामिल हैं। यह अपनी छवियों में वस्तुओं को "हेरफेर और पुनर्व्यवस्थित" कर सकता था और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता था। उदाहरण के लिए, जब एक डाइकॉन मूली को अपनी नाक फूंकते हुए, लट्टे की चुस्की लेते हुए, या यूनीसाइकिल चलाते हुए बनाने के लिए कहा गया, तो यह अक्सर रूमाल, हाथ और पैर को प्रशंसनीय स्थानों पर खींचता था।

मॉडल ने "रिक्त स्थान भरने" की क्षमता दिखाई, बिना विशिष्ट प्रॉम्प्ट के उचित विवरण का अनुमान लगाते हुए, जैसे कि छुट्टी से जुड़े प्रॉम्प्ट में क्रिसमस कल्पना जोड़ना और छाया को उचित रूप से रखना। इसने दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित की।

DALL-E 1 विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता था, केवल दुर्लभ विफलताओं के साथ। जॉर्जिया टेक स्कूल ऑफ इंटरएक्टिव कंप्यूटिंग के एक एसोसिएट प्रोफेसर मार्क रीडल ने पाया कि यह अवधारणाओं को मिश्रित कर सकता है, जो मानव रचनात्मकता का एक प्रमुख तत्व है। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त थी, जो अक्सर मानव बुद्धि को मापने के लिए उपयोग किए जाने वाले दृश्य परीक्षण हैं।

प्रभाव और विरासत

DALL-E 1 ने टेक्स्ट-टू-इमेज निर्माण को लोकप्रिय बनाने में मदद की और जनरेटिव AI में आगे के अनुसंधान को प्रेरित किया। इसके बाद DALL-E 2 आया, जिसने 3.5 बिलियन पैरामीटर वाले एक डिफ्यूजन मॉडल का उपयोग किया, और DALL-E 3, जिसे अक्टूबर 2023 में ChatGPT में एकीकृत किया गया। Microsoft ने Bing के इमेज क्रिएटर और डिज़ाइनर ऐप में DALL-E 3 को लागू किया, और Copilot इस पर चलता है। मार्च 2025 में, DALL-E 3 को ChatGPT में GPT इमेज की मूल छवि-निर्माण क्षमताओं द्वारा प्रतिस्थापित किया गया था।

OpenAI ने फरवरी 2024 में DALL-E उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, C2PA (कोएलिशन फॉर कंटेंट प्रोवेनेंस एंड ऑथेंटिसिटी) मानक में मेटाडेटा का उपयोग करते हुए। DALL-E 1 की रिलीज़ ने आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग के विकास में एक महत्वपूर्ण कदम चिह्नित किया, जिसने बाद के मॉडलों और अनुप्रयोगों को प्रभावित किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·openai·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास