अंग्रेज़ी से अनुवादित

Sora एक टेक्स्ट-टू-वीडियो मॉडल और सोशल मीडिया ऐप था, जिसे OpenAI द्वारा विकसित किया गया था, और फरवरी 2024 में इसका पूर्वावलोकन किया गया था। यह टेक्स्ट प्रॉम्प्ट से छोटे वीडियो क्लिप उत्पन्न करता था, लेकिन लागत और कम उपयोग के कारण अप्रैल 2026 तक इसे बंद कर दिया गया।

सोरा OpenAI द्वारा विकसित एक टेक्स्ट-टू-वीडियो मॉडल और सोशल मीडिया ऐप था। कृत्रिम बुद्धिमत्ता का उपयोग करते हुए, यह मॉडल प्रॉम्प्ट के आधार पर छोटे वीडियो क्लिप उत्पन्न करता था, और मौजूदा छोटे वीडियो को विस्तारित भी कर सकता था। फरवरी 2024 में, OpenAI ने अपने आउटपुट के उदाहरण जनता को दिखाए, और सोरा की पहली पीढ़ी दिसंबर 2024 में संयुक्त राज्य अमेरिका और कनाडा में ChatGPT Plus और ChatGPT Pro उपयोगकर्ताओं के लिए सार्वजनिक रूप से जारी की गई।

सोरा की दूसरी पीढ़ी सितंबर 2025 के अंत में अमेरिका और कनाडा के चुनिंदा उपयोगकर्ताओं के लिए जारी की गई। सोरा 2 ने ऐप में सोशल मीडिया सुविधाओं को एकीकृत किया। यह ऐप 26 अप्रैल 2026 को बंद कर दिया गया और एप्लिकेशन प्रोग्रामिंग इंटरफेस (API) को 24 सितंबर 2026 को बंद करने की योजना है, जो सोरा AI ब्रांड के समग्र रूप से अंत को चिह्नित करता है।

पृष्ठभूमि

सोरा से पहले टेक्स्ट से वीडियो उत्पन्न करने में सक्षम कई अन्य मॉडल बनाए गए थे, जिनमें मेटा का मेक-ए-वीडियो, रनवे का जेन-2 और गूगल वीओ शामिल हैं। OpenAI, जो सोरा के पीछे की कंपनी है, ने सितंबर 2023 में अपने DALL-E टेक्स्ट-टू-इमेज मॉडल के तीसरे संस्करण, DALL-E 3 को जारी किया था। इन प्रारंभिक प्रणालियों ने सोरा के लिए तकनीकी नींव स्थापित की, जिसने वीडियो डेटा को संभालने के लिए डिफ्यूजन मॉडल और ट्रांसफॉर्मर आर्किटेक्चर में प्रगति का लाभ उठाया।

प्रारंभिक रिलीज़

सोरा विकसित करने वाली टीम ने इसका नाम जापानी शब्द 'आकाश' के नाम पर रखा ताकि इसकी "असीम रचनात्मक क्षमता" का संकेत दिया जा सके। 15 फरवरी 2024 को, OpenAI ने पहली बार सोरा का पूर्वावलोकन करते हुए कई हाई-डेफिनिशन वीडियो क्लिप जारी किए जो इसने बनाए थे, जिनमें एक पहाड़ी सड़क पर चलती एसयूवी, एक मोमबत्ती के पास "छोटा रोएँदार राक्षस" का एनीमेशन, बर्फ में टोक्यो से गुजरते दो लोग, और कैलिफोर्निया गोल्ड रश की नकली ऐतिहासिक फुटेज शामिल थे। OpenAI ने कहा कि यह एक मिनट तक लंबे वीडियो उत्पन्न करने में सक्षम था। कंपनी ने फिर एक तकनीकी रिपोर्ट साझा की जिसमें मॉडल को प्रशिक्षित करने के लिए उपयोग की जाने वाली विधियों पर प्रकाश डाला गया। OpenAI के सीईओ सैम ऑल्टमैन ने भी ट्विटर उपयोगकर्ताओं के प्रॉम्प्ट पर सोरा-जनित वीडियो के साथ जवाब देते हुए ट्वीट्स की एक श्रृंखला पोस्ट की।

9 दिसंबर 2024 तक, OpenAI ने धीरे-धीरे सोरा को अमेरिका और कनाडा में ChatGPT Pro और ChatGPT Plus उपयोगकर्ताओं के लिए सार्वजनिक रूप से उपलब्ध कराया। इससे पहले, कंपनी ने गलत सूचना और पूर्वाग्रह के विशेषज्ञों सहित एक छोटे "रेड टीम" को सीमित पहुँच प्रदान की थी, ताकि मॉडल पर प्रतिकूल परीक्षण किया जा सके। कंपनी ने सोरा को रचनात्मक क्षेत्रों में इसकी उपयोगिता पर प्रतिक्रिया लेने के लिए वीडियो निर्माताओं और कलाकारों सहित रचनात्मक पेशेवरों के एक छोटे समूह के साथ भी साझा किया। फरवरी 2025 में, OpenAI ने उपयोगकर्ताओं को चैटबॉट से सोरा वीडियो उत्पन्न करने की अनुमति देकर सोरा को ChatGPT में एकीकृत करने की योजना की घोषणा की।

सोरा 2

सोरा 2 का अनावरण 30 सितंबर 2025 को किया गया, साथ ही एक iOS ऐप भी जारी किया गया, और दो महीने बाद एक Android ऐप भी। मॉडल द्वारा उत्पन्न सभी वीडियो में उपकरण के दुरुपयोग को रोकने के लिए एक दृश्यमान, गतिशील वॉटरमार्क होता है। सोरा के पिछले संस्करण ने दर्शकों को वास्तविक और काल्पनिक सामग्री के बीच अंतर करने की अनुमति देने के लिए एक सुरक्षा वॉटरमार्क भी जोड़ा था। 7 अक्टूबर को, 404 मीडिया ने बताया कि सोरा 2 वीडियो से वॉटरमार्क हटा सकने वाले तृतीय-पक्ष कार्यक्रम प्रचलित हो गए थे। वायर्ड पत्रिका जैसे कई आउटलेट्स ने नोट किया है कि सोरा 2 ऐप शैली और सुविधाओं में स्पष्ट रूप से टिकटॉक के समान है।

बंद करना

24 मार्च 2026 को, OpenAI ने X पर घोषणा की कि वह मोबाइल ऐप और API दोनों में सोरा को बंद कर रहा है। सोरा ऐप 26 अप्रैल 2026 को बंद कर दिया गया, जबकि API को 24 सितंबर 2026 को बंद करने की योजना है। OpenAI की डिज्नी के साथ साझेदारी, जिसमें एक लाइसेंसिंग समझौता शामिल था जो सोरा के भीतर डिज्नी पात्रों के उपयोग की अनुमति देता था, भी समाप्त हो रही थी। इस निर्णय ने ब्रिटिश प्रौद्योगिकी समाचार वेबसाइट द रजिस्टर को OpenAI को "प्रोडक्ट-किलर" करार देने के लिए प्रेरित किया, जो गूगल, अमेज़न वेब सर्विसेज, ब्रॉडकॉम, क्लाउड सॉफ्टवेयर ग्रुप और नेटस्केप जैसी अन्य प्रौद्योगिकी कंपनियों के नक्शेकदम पर चल रहा है।

OpenAI ने अपनी शटडाउन सूचना में सोरा को बंद करने का कोई विशिष्ट कारण नहीं बताया। इस अस्थायी समाप्ति के संबंध में उभरने वाली रिपोर्टों ने इस निर्णय को कंप्यूटेशन की कमी, लागत दबाव और मुख्य उद्यम उत्पादों की ओर व्यापक बदलाव से जोड़ा। अपने सार्वजनिक लॉन्च के बाद, सोरा के दुनिया भर के उपयोगकर्ता लगभग दस लाख तक पहुँच गए, इससे पहले कि वे 500,000 से कम हो गए, जबकि वीडियो उत्पादन की कम्प्यूटेशनल माँगों के कारण सेवा की लागत लगभग $1 मिलियन प्रति दिन थी।

कानूनी विनियमन

नवंबर 2024 में, परीक्षकों के एक समूह द्वारा हगिंग फेस पर सोरा पहुँच के लिए एक API कुंजी लीक की गई थी, जिन्होंने एक घोषणापत्र पोस्ट किया था जिसमें कहा गया था कि वे इस बात का विरोध कर रहे हैं कि सोरा का उपयोग "आर्ट वॉशिंग" के लिए किया जा रहा है। OpenAI ने लीक को सार्वजनिक होने के तीन घंटे बाद सभी पहुँच रद्द कर दी और कहा कि "सैकड़ों कलाकारों" ने विकास को आकार दिया है और "भागीदारी स्वैच्छिक है"।

अपने लॉन्च के समय, सोरा 2 ने डिफ़ॉल्ट रूप से कॉपीराइट सामग्री की अनुमति दी, जब तक कि कॉपीराइट धारकों ने प्लेटफ़ॉर्म पर अपनी सामग्री के उत्पादन को प्रतिबंधित करने के लिए OpenAI से संपर्क नहीं किया। 3 अक्टूबर 2025 को, OpenAI ने कहा कि सोरा 2 का एक भविष्य का अपडेट कॉपीराइट धारकों को कॉपीराइट सामग्री के उत्पादन पर "अधिक सूक्ष्म नियंत्रण" देगा, लेकिन कंपनी ने यह नहीं बताया कि मौजूदा सामग्री हटाई जाएगी या नहीं। 6 अक्टूबर को, एमपीए के अध्यक्ष ने सोरा 2 के साथ कॉपीराइट के प्रति OpenAI के दृष्टिकोण की आलोचना की।

11 दिसंबर 2025 को, वॉल्ट डिज़नी कंपनी ने घोषणा की कि वह तीन साल के लाइसेंसिंग सौदे में OpenAI में $1 बिलियन का निवेश करेगी, ताकि Disney+ पर उपयोगकर्ता सोरा 2 पर अपने 200 से अधिक कॉपीराइट पात्र उत्पन्न कर सकें। इन पात्रों में डिज़नी एनीमेशन, पिक्सार, मार्वल स्टूडियो और स्टार वार्स के पात्र शामिल हैं।

क्षमताएँ और सीमाएँ

सोरा के पीछे की तकनीक DALL-E 3 के पीछे की तकनीक का एक अनुकूलन है। OpenAI के अनुसार, सोरा एक डिफ्यूजन ट्रांसफॉर्मर है, एक डिनॉइज़िंग लेटेंट डिफ्यूजन मॉडल जिसमें एक ट्रांसफॉर्मर इसके डिनॉइज़र के रूप में होता है। एक वीडियो लेटेंट स्पेस में 3D "पैचेस" को डिनॉइज़ करके उत्पन्न होता है, फिर एक वीडियो डीकंप्रेसर द्वारा मानक स्पेस में बदल दिया जाता है। वीडियो के लिए विस्तृत कैप्शन बनाने के लिए एक वीडियो-टू-टेक्स्ट मॉडल का उपयोग करके प्रशिक्षण डेटा को बढ़ाने के लिए रिकैप्शनिंग को नियोजित किया जाता है।

OpenAI ने मॉडल को सार्वजनिक रूप से उपलब्ध वीडियो के साथ-साथ इस उद्देश्य के लिए लाइसेंस प्राप्त कॉपीराइट वीडियो का उपयोग करके प्रशिक्षित किया, लेकिन वीडियो की संख्या या सटीक स्रोत का खुलासा नहीं किया। अपनी रिलीज़ पर, OpenAI ने सोरा की कुछ कमियों को स्वीकार किया, जिसमें जटिल भौतिकी का अनुकरण करने, कारणता को समझने और बाएँ से दाएँ अंतर करने की सीमित क्षमता शामिल है। OpenAI ने यह भी कहा कि कंपनी की मौजूदा सुरक्षा प्रथाओं का पालन करते हुए, सोरा यौन, हिंसक, घृणास्पद या सेलिब्रिटी कल्पना के साथ-साथ मौजूदा बौद्धिक संपदा वाली सामग्री के लिए टेक्स्ट प्रॉम्प्ट को प्रतिबंधित करेगा।

सोरा शोधकर्ता टिम ब्रूक्स ने कहा कि मॉडल ने अपने डेटासेट से अकेले 3D ग्राफिक्स बनाना सीखा, जबकि साथी सोरा शोधकर्ता बिल पीबल्स ने कहा कि मॉडल स्पष्ट प्रोग्रामिंग के बिना भौतिक दुनिया के कुछ पहलुओं का अनुकरण कर सकता है। प्रणाली गहन शिक्षण तकनीकों पर निर्भर थी, जिसमें तंत्रिका नेटवर्क परतें और मल्टी-हेड अटेंशन तंत्र शामिल थे जो इसे वीडियो फ्रेम्स में अस्थायी और स्थानिक जानकारी संसाधित करने की अनुमति देते थे।

तकनीकी दृष्टिकोण

सोरा की वास्तुकला लेटेंट डिफ्यूजन मॉडल ढांचे पर बनाई गई थी, जो डिनॉइज़िंग चरणों को लागू करने से पहले वीडियो डेटा को निचले-आयामी लेटेंट स्पेस में संपीड़ित करती है। मॉडल ने ट्रांसफॉर्मर-आधारित डिनॉइज़र के लिए टोकन के रूप में 3D पैचेस का उपयोग किया, जो वीडियो डेटा के स्पेटिओटेम्पोरल ब्लॉक हैं। यह दृष्टिकोण पारंपरिक वीडियो उत्पादन मॉडल से भिन्न था जो अक्सर यू-नेट आर्किटेक्चर का उपयोग करते थे, क्योंकि ट्रांसफॉर्मर बैकबोन मॉडल आकार और प्रशिक्षण डेटा के साथ बेहतर स्केलिंग सक्षम करता था।

प्रशिक्षण प्रक्रिया में वीडियो और छवि जोड़े के बड़े-पैमाने के डेटासेट शामिल थे, हालाँकि विशिष्ट विवरणों का खुलासा नहीं किया गया था। रिकैप्शनिंग तकनीक ने प्रशिक्षण वीडियो के विस्तृत पाठ्य विवरण उत्पन्न करने के लिए एक वीडियो-टू-टेक्स्ट मॉडल का उपयोग किया, जिससे मॉडल को प्रॉम्प्ट और दृश्य सामग्री के बीच बेहतर संबंध सीखने में मदद मिली। ये विधियाँ अनुक्रम-से-अनुक्रम मॉडल और क्रॉस-अटेंशन तंत्र में पूर्व कार्य से ली गई थीं जो बड़े भाषा मॉडल अनुसंधान में विकसित की गई थीं।

सांस्कृतिक और नैतिक प्रभाव

फरवरी 2024 में सोरा के अनावरण ने रचनात्मक उद्योगों, पत्रकारिता और गलत सूचना का पता लगाने के लिए टेक्स्ट-टू-वीडियो उत्पादन के निहितार्थों पर व्यापक चर्चा छेड़ दी। यथार्थवादी, हाई-डेफिनिशन क्लिप उत्पन्न करने की मॉडल की क्षमता ने नकली समाचार फुटेज या भ्रामक सामग्री उत्पन्न करने की संभावना के बारे में चिंताएँ बढ़ाईं। यह प्रारंभिक पूर्वावलोकन में शामिल नकली कैलिफोर्निया गोल्ड रश फुटेज द्वारा रेखांकित किया गया था, जिसने प्रशंसनीय ऐतिहासिक कल्पना बनाने की मॉडल की क्षमता का प्रदर्शन किया।

कानूनी विशेषज्ञों और मीडिया संगठनों ने उत्पन्न वीडियो में कॉपीराइट सामग्री के डिफ़ॉल्ट उपयोग के आसपास कॉपीराइट मुद्दों पर बहस की। दृश्यमान गतिशील वॉटरमार्क एक तकनीकी सुरक्षा उपाय के रूप में पेश किया गया था, लेकिन सोरा 2 की रिलीज़ के एक सप्ताह के भीतर तृतीय-पक्ष उपकरणों द्वारा इसका निष्कासन सामग्री प्रमाणीकरण की चुनौतियों को उजागर करता है। कॉपीराइट प्रशिक्षण डेटा का मॉडल का उपयोग भी AI उद्योग में चल रहे मुकदमों और नियामक जांच में योगदान देता है, हालाँकि OpenAI ने सोरा से संबंधित विशिष्ट कानूनी कार्यों का खुलासा नहीं किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-video·openai·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास