Sora एक Text-to-video generation पीढ़ी प्रणाली है जिसे OpenAI द्वारा विकसित किया गया है, जो प्राकृतिक-भाषा विवरणों को छोटे वीडियो क्लिप में परिवर्तित करती है। OpenAI ने पहली बार फरवरी 2024 में अत्यधिक पॉलिश किए गए नमूना वीडियो के एक सेट के साथ इस मॉडल का पूर्वावलोकन किया, इसे केवल एक रचनात्मक उपकरण के रूप में नहीं, बल्कि एक सामान्य-उद्देश्य "विश्व सिम्युलेटर" की दिशा में एक प्रारंभिक कदम के रूप में प्रस्तुत किया, जो समय के साथ भौतिक अंतःक्रियाओं, कैमरा गति और वस्तु स्थिरता को मॉडल करने में सक्षम हो। यह मॉडल दिसंबर 2024 में भुगतान करने वाले ChatGPT ग्राहकों के लिए एक स्टैंडअलोन ऐप, Sora के माध्यम से जनता के लिए उपलब्ध कराया गया, इससे पहले 2025 में व्यापक रोलआउट हुआ।
आर्किटेक्चर
Sora डिफ्यूजन मॉडल और Transformer (architecture) आर्किटेक्चर के विचारों को जोड़ता है। निश्चित-रिज़ॉल्यूशन पिक्सेल ग्रिड पर काम करने के बजाय, OpenAI ने Sora को वीडियो को स्पेसटाइम "पैच" के अनुक्रम के रूप में मानने के रूप में वर्णित किया, एक प्रतिनिधित्व जिसका उद्देश्य मॉडल को एक ही प्रणाली के भीतर विभिन्न अवधियों, रिज़ॉल्यूशन और पहलू अनुपातों को संभालने देना था। प्रशिक्षण में कथित तौर पर बड़ी मात्रा में वीडियो डेटा का उपयोग किया गया, हालांकि OpenAI ने सटीक डेटासेट संरचना या आकार का खुलासा नहीं किया, जो कंपनी द्वारा पहले के सिस्टम के लिए प्रकाशित अधिक विस्तृत तकनीकी रिपोर्टों से एक विचलन है।
क्षमताएं और सीमाएं
लॉन्च के समय, Sora एक टेक्स्ट Prompt से लगभग एक मिनट तक के क्लिप उत्पन्न कर सकता था, और बाद के संस्करणों ने इमेज-टू-वीडियो और वीडियो-टू-वीडियो संपादन जोड़ा, जिससे उपयोगकर्ता मौजूदा फुटेज को विस्तारित, रीमिक्स या मिश्रित कर सकते थे। प्रदर्शन वीडियो ने सुसंगत बहु-दृश्य अनुक्रम, अनुकरणित कैमरा गति और फ्रेमों में सुसंगत चरित्र उपस्थिति दिखाई, जो पहले के Text-to-video generation सिस्टम से कहीं आगे की क्षमताएं थीं। OpenAI ने लगातार कमजोरियों को भी स्वीकार किया: मॉडल सटीक भौतिकी (वस्तुओं का एक-दूसरे से गुजरना, असंगत कार्य-कारण), सूक्ष्म स्थानिक तर्क, और विशिष्ट खेल आंदोलनों जैसे जटिल कार्यों के सटीक चित्रण के साथ संघर्ष करता था।
स्वागत और ऐप युग
Sora एक तेजी से प्रतिस्पर्धी वीडियो-पीढ़ी क्षेत्र में Google DeepMind के Veo, Kuaishou के Kling, और ByteDance के Seedance के साथ आया, जिनमें से प्रत्येक 2024 और 2025 के दौरान तेजी से पुनरावृत्ति कर रहा था। वीडियो मॉडल को रैंक करने वाले अखाड़ों पर स्वतंत्र बेंचमार्किंग और समुदाय तुलना ने Sora को अग्रणी प्रणालियों के बीच रखा, बिना किसी स्पष्ट, स्थिर बढ़त के, क्योंकि प्रतिद्वंद्वियों ने समान समय-सीमा पर अपडेट जारी किए। Runway, एक पहले का वीडियो-पीढ़ी अग्रणी, को एक बार प्रमुख प्रयोगशालाओं ने सीधे क्षेत्र में प्रवेश किया तो तीव्र प्रतिस्पर्धा का सामना करना पड़ा।
Sora ऐप स्वयं AI-जनित क्लिप के सामाजिक, TikTok-जैसे फ़ीड के लिए उल्लेखनीय था, जिसमें एक रीमिक्स सुविधा थी, एक डिज़ाइन विकल्प जिसने जुड़ाव और आलोचना दोनों को आकर्षित किया। टिप्पणीकारों और अधिकार धारकों ने कॉपीराइट पात्रों और सार्वजनिक हस्तियों को चित्रित करने वाले वीडियो उत्पन्न करने की आसानी के बारे में चिंताएं उठाईं, जिससे OpenAI को शुरुआती शिकायतों के बाद अधिकार धारकों के लिए ऑप्ट-आउट तंत्र और नामित व्यक्तियों के लिए समानता नियंत्रण जोड़ने के लिए प्रेरित किया, जिसमें प्रतिभा एजेंसियों से भी शामिल थे। व्यापक बहस ने पाठ और छवि पीढ़ी में एआई और कॉपीराइट पर पहले से चल रहे विवादों को प्रतिध्वनित किया, और डीपफेक और सिंथेटिक मीडिया के बारे में चिंताओं में एक वीडियो-विशिष्ट आयाम जोड़ा, क्योंकि तकनीक की वास्तविक दिखने वाले लोगों और घटनाओं को चित्रित करने की क्षमता थी जो कभी हुई नहीं थीं।
Sora की रिलीज़ ने उच्च-निष्ठा जनरेटिव वीडियो के श्रम और रचनात्मक-उद्योग निहितार्थों के बारे में सार्वजनिक बहस को भी तेज किया, विशेष रूप से फिल्म, विज्ञापन और सोशल मीडिया सामग्री उत्पादन में, जहां उपकरण तक पहुंच रखने वाले किसी भी व्यक्ति के लिए छोटी वीडियो सामग्री बनाने की लागत तेजी से गिर गई। Sam Altman, OpenAI के मुख्य कार्यकारी अधिकारी, ने Sora और इसके उत्तराधिकारियों को अधिक सामान्य वीडियो-आधारित विश्व मॉडलिंग की दिशा में कदम के रूप में स्थापित किया, एक ढांचा जो अधिक सक्षम एआई प्रणालियों की दिशा में एक मार्ग के रूप में विश्व मॉडल में व्यापक शोध रुचि से जुड़ा था, हालांकि शोधकर्ताओं के बीच यह विवादित रहा कि Sora वास्तविक भौतिक समझ का गठन करता है या परिष्कृत पैटर्न पुनरुत्पादन।