अंग्रेज़ी से अनुवादित

DALL-E 2 एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा विकसित किया गया था, जिसे 2022 में जारी किया गया था, जो डिफ्यूज़न और CLIP एम्बेडिंग का उपयोग करके प्राकृतिक भाषा प्रॉम्प्ट से यथार्थवादी चित्र उत्पन्न करता है।

DALL-E 2 एक टेक्स्ट-टू-इमेज मॉडल है जिसे OpenAI द्वारा विकसित किया गया था और 2022 में जारी किया गया था। यह प्राकृतिक भाषा विवरणों, जिन्हें प्रॉम्प्ट कहा जाता है, से डिजिटल छवियाँ उत्पन्न करता है, जिसमें डीप लर्निंग पद्धतियों का उपयोग किया जाता है। यह मॉडल मूल DALL-E का उत्तराधिकारी है और इसे उच्च रिज़ॉल्यूशन पर अधिक यथार्थवादी छवियाँ उत्पन्न करने के लिए डिज़ाइन किया गया था, जिसमें अवधारणाओं, विशेषताओं और शैलियों को संयोजित करने की क्षमता है।

DALL-E 2 जनरेटिव आर्टिफिशियल इंटेलिजेंस के व्यापक क्षेत्र का हिस्सा है, जो नई सामग्री बनाने पर केंद्रित है। यह एक डिफ्यूज़न-आधारित आर्किटेक्चर का उपयोग करता है, जो अपने पूर्ववर्ती के ऑटोरेग्रेसिव दृष्टिकोण से एक बदलाव है। यह नाम पिक्सर रोबोट WALL-E और स्पेनिश अतियथार्थवादी कलाकार साल्वाडोर डाली का एक पोर्टमैंटू है।

इतिहास और पृष्ठभूमि

मूल DALL-E को OpenAI द्वारा 5 जनवरी 2021 को एक ब्लॉग पोस्ट में घोषित किया गया था, जिसमें छवियाँ उत्पन्न करने के लिए GPT-3 का एक संशोधित संस्करण उपयोग किया गया था। 6 अप्रैल 2022 को, OpenAI ने DALL-E 2 को उत्तराधिकारी के रूप में घोषित किया, जिसमें अधिक यथार्थवादी इमेजरी उत्पन्न करने और अवधारणाओं को संयोजित करने की क्षमता पर जोर दिया गया। शुरुआत में, नैतिक और सुरक्षा चिंताओं के कारण पहुंच पूर्व-चयनित उपयोगकर्ताओं तक सीमित थी, जो एक शोध पूर्वावलोकन के लिए थी। 20 जुलाई 2022 को, DALL-E 2 बीटा चरण में प्रवेश किया, जिसमें 1 मिलियन प्रतीक्षा सूची वाले व्यक्तियों को आमंत्रित किया गया; उपयोगकर्ता हर महीने सीमित संख्या में छवियाँ मुफ्त में उत्पन्न कर सकते थे और अतिरिक्त क्रेडिट खरीद सकते थे। 28 सितंबर 2022 को प्रतीक्षा सूची की आवश्यकता हटा दी गई, जिससे मॉडल आम जनता के लिए खुल गया।

नवंबर 2022 की शुरुआत में, OpenAI ने DALL-E 2 को एक API के रूप में जारी किया, जिससे डेवलपर्स को मॉडल को अनुप्रयोगों में एकीकृत करने की अनुमति मिली। API प्रति-छवि लागत के आधार पर काम करता है, जिसमें कीमतें रिज़ॉल्यूशन के अनुसार भिन्न होती हैं और एंटरप्राइज़ ग्राहकों के लिए वॉल्यूम छूट होती है। Microsoft ने DALL-E 2 को अपने Designer ऐप और Bing तथा Microsoft Edge में Image Creator टूल में एकीकृत किया। फरवरी 2024 में, OpenAI ने DALL-E द्वारा उत्पन्न छवियों में वॉटरमार्क जोड़ना शुरू किया, जिसमें C2PA (Coalition for Content Provenance and Authenticity) मानक का उपयोग करके मेटाडेटा एम्बेड किया गया।

प्रौद्योगिकी

DALL-E 2 3.5 बिलियन पैरामीटर का उपयोग करता है, जो अपने पूर्ववर्ती के 12 बिलियन से कम है। एक ऑटोरेग्रेसिव ट्रांसफॉर्मर के बजाय, यह CLIP इमेज एम्बेडिंग पर सशर्त एक डिफ्यूज़न मॉडल नियोजित करता है। अनुमान के दौरान, एक पूर्व मॉडल CLIP टेक्स्ट एम्बेडिंग से ये इमेज एम्बेडिंग उत्पन्न करता है। यह आर्किटेक्चर स्टेबल डिफ्यूज़न के समान है, जो कुछ महीने बाद जारी किया गया था। मॉडल तंत्रिका नेटवर्क और मशीन लर्निंग तकनीकों का लाभ उठाता है, जो आर्टिफिशियल इंटेलिजेंस अनुसंधान में प्रगति पर आधारित है।

CLIP (Contrastive Language-Image Pre-training) एक अलग मॉडल है जो इंटरनेट से 400 मिलियन इमेज-टेक्स्ट जोड़ों पर प्रशिक्षित है। यह DALL-E 2 के आउटपुट को समझने और रैंक करने में महत्वपूर्ण भूमिका निभाता है, उस छवि का चयन करता है जो प्रॉम्प्ट से सबसे अच्छी तरह मेल खाती है। डिफ्यूज़न प्रक्रिया यादृच्छिक शोर को एक सुसंगत छवि में पुनरावृत्त रूप से परिष्कृत करती है, जो CLIP एम्बेडिंग द्वारा निर्देशित होती है।

क्षमताएँ

DALL-E 2 कई शैलियों में इमेजरी उत्पन्न कर सकता है, जिसमें फोटोरियलिस्टिक छवियाँ, पेंटिंग और इमोजी शामिल हैं। यह वस्तुओं को हेरफेर और पुनर्व्यवस्थित कर सकता है, और बिना स्पष्ट निर्देश के नई रचनाओं में डिज़ाइन तत्वों को सही ढंग से रख सकता है। उदाहरण के लिए, जब एक डाइकॉन मूली को अपनी नाक बहाते हुए, लट्टे पीते हुए, या यूनीसाइकिल चलाते हुए चित्रित करने के लिए कहा जाता है, तो मॉडल अक्सर रूमाल, हाथ और पैर को प्रशंसनीय स्थानों पर रखता है। यह उपयुक्त विवरणों का अनुमान भी लगा सकता है, जैसे छुट्टी से जुड़े प्रॉम्प्ट में क्रिसमस इमेजरी जोड़ना या उल्लेखित नहीं किए गए छायाओं को प्रस्तुत करना।

मॉडल दृश्य और डिज़ाइन रुझानों की व्यापक समझ प्रदर्शित करता है, और विभिन्न दृष्टिकोणों से विभिन्न प्रकार के मनमाने विवरणों के लिए छवियाँ उत्पन्न कर सकता है, जिसमें केवल दुर्लभ विफलताएँ होती हैं। इसकी दृश्य तर्क क्षमता रेवेन के मैट्रिसेस को हल करने के लिए पर्याप्त है, जो अक्सर मानव बुद्धि को मापने के लिए उपयोग किया जाने वाला परीक्षण है।

छवि संशोधन

DALL-E 2 मौजूदा छवियों के विविधताएँ उत्पन्न कर सकता है, साथ ही छवियों को संशोधित या विस्तारित करने के लिए संपादित भी कर सकता है। इनपेंटिंग और आउटपेंटिंग क्षमताएँ मूल छवि से संदर्भ का उपयोग करके दिए गए प्रॉम्प्ट के अनुसार लापता क्षेत्रों को एक सुसंगत माध्यम में भरती हैं। उदाहरण के लिए, उपयोगकर्ता एक छवि में नए विषय सम्मिलित कर सकते हैं या इसे अपनी मूल सीमाओं से परे विस्तारित कर सकते हैं। OpenAI के अनुसार, आउटपेंटिंग मौजूदा दृश्य तत्वों जैसे छाया, प्रतिबिंब और बनावट पर विचार करती है।

प्रभाव और विरासत

DALL-E 2 ने टेक्स्ट-टू-इमेज जनरेशन में बाद के विकासों को प्रभावित किया, जिसमें DALL-E 3 शामिल है, जो अक्टूबर 2023 में जारी हुआ था, जिसे ChatGPT में एकीकृत किया गया और बाद में मार्च 2025 में GPT Image द्वारा प्रतिस्थापित किया गया। मॉडल ने जनरेटिव AI की क्षमताओं और नैतिक निहितार्थों के बारे में व्यापक चर्चाओं में भी योगदान दिया, जिसमें दुरुपयोग की चिंताएँ और वॉटरमार्किंग जैसे प्रोवेनेंस उपायों की आवश्यकता शामिल है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:text-to-image·generative-ai·openai·diffusion-models
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास