Something-Something एक बड़े पैमाने का वीडियो डेटासेट है जो सूक्ष्म क्रिया पहचान (fine-grained action recognition) के लिए बनाया गया है। इसे 2017 में एंटवर्प विश्वविद्यालय और फ्लेमिश सुपरकंप्यूटर सेंटर (VSC) के शोधकर्ताओं की एक टीम ने, Something, Inc. कंपनी के सहयोग से पेश किया था। यह डेटासेट पहले के क्रिया पहचान डेटासेट्स की एक प्रमुख सीमा को दूर करने के लिए बनाया गया था: स्थिर दृश्य संकेतों, जैसे वस्तुओं और दृश्यों, पर निर्भर रहने की प्रवृत्ति, न कि क्रिया की अस्थायी गतिशीलता पर। Something-Something उन बुनियादी, रोज़मर्रा की क्रियाओं पर केंद्रित है जो उनकी गति और अभिनेता तथा शामिल वस्तुओं के बीच कारणात्मक संबंध से परिभाषित होती हैं, जिससे यह उन मॉडलों के लिए एक चुनौतीपूर्ण बेंचमार्क बन जाता है जिन्हें यह समझना होता है कि क्रियाएँ समय के साथ कैसे विकसित होती हैं।
डेटासेट में 100,000 से अधिक वीडियो शामिल हैं, जिनमें से प्रत्येक में एक व्यक्ति 174 अलग-अलग क्रिया श्रेणियों में से एक का प्रदर्शन करता है। ये श्रेणियाँ जानबूझकर सरल और अमूर्त हैं, जैसे 'किसी चीज़ को बाएँ से दाएँ धकेलना', 'किसी चीज़ को उठाना', या 'किसी चीज़ को उल्टा करना'। क्रियाएँ विभिन्न प्रकार की रोज़मर्रा की वस्तुओं, जैसे कप, किताबें और उपकरण, के साथ की जाती हैं, जो वीडियो के बीच निश्चित नहीं हैं। यह डिज़ाइन मॉडलों को वस्तु की पहचान के बजाय गति और अंतःक्रिया पैटर्न पर ध्यान केंद्रित करने के लिए मजबूर करता है। वीडियो वैश्विक योगदानकर्ताओं के समूह से क्राउड-सोर्स किए गए थे, जिसके परिणामस्वरूप विविध पृष्ठभूमि, प्रकाश स्थितियाँ और कैमरा परिप्रेक्ष्य प्राप्त हुए। प्रत्येक वीडियो एक छोटा क्लिप है, जो आमतौर पर 2 से 5 सेकंड तक चलता है, और एक ही क्रिया श्रेणी के साथ लेबल किया जाता है।
प्रेरणा और डिज़ाइन
Something-Something का निर्माण इस अवलोकन से प्रेरित था कि कई लोकप्रिय क्रिया पहचान डेटासेट्स, जैसे UCF-101 और HMDB-51, में ऐसे वीडियो शामिल थे जहाँ क्रिया को एक ही फ्रेम से अनुमानित किया जा सकता था। उदाहरण के लिए, 'गिटार बजाना' लेबल वाला वीडियो केवल गिटार की उपस्थिति से पहचाना जा सकता था। इसने मॉडलों को वास्तव में गति को समझे बिना, स्थिर दृश्य पूर्वाग्रहों का शोषण करके उच्च सटीकता प्राप्त करने की अनुमति दी। Something-Something को इन शॉर्टकट्स को समाप्त करने के लिए डिज़ाइन किया गया था। डेटासेट में, एक ही वस्तु कई अलग-अलग क्रियाओं में दिखाई दे सकती है, और एक ही क्रिया कई अलग-अलग वस्तुओं पर की जा सकती है। इसलिए, एक मॉडल को क्रिया की सही पहचान करने के लिए फ्रेम के अस्थायी अनुक्रम का विश्लेषण करना चाहिए, जिससे यह अस्थायी तर्क का अधिक सटीक परीक्षण बन जाता है।
बेंचमार्क और मूल्यांकन
इस डेटासेट का उपयोग आमतौर पर वीडियो समझ मॉडलों, विशेष रूप से डीप लर्निंग और न्यूरल नेटवर्क पर आधारित, के प्रदर्शन का मूल्यांकन करने के लिए किया जाता है। मानक मूल्यांकन प्रोटोकॉल में प्रदान किए गए प्रशिक्षण विभाजन पर प्रशिक्षण और एक सत्यापन सेट पर शीर्ष-1 और शीर्ष-5 सटीकता की रिपोर्टिंग शामिल है। अपनी रिलीज़ के बाद से, Something-Something क्षेत्र में एक मानक बेंचमार्क बन गया है, साथ ही किनेटिक्स और मोमेंट्स इन टाइम जैसे अन्य डेटासेट्स के साथ। यह विशेष रूप से कठिन होने के लिए जाना जाता है: यहाँ तक कि अत्याधुनिक मॉडल, जिनमें ट्रांसफॉर्मर और अवशिष्ट नेटवर्क का उपयोग करने वाले शामिल हैं, इस डेटासेट पर उपस्थिति-भारी डेटासेट्स की तुलना में काफी कम सटीकता प्राप्त करते हैं। इसने अस्थायी गतिशीलता को बेहतर ढंग से पकड़ने वाले आर्किटेक्चर, जैसे 3D कन्वोल्यूशनल नेटवर्क और वीडियो ट्रांसफॉर्मर, पर शोध को बढ़ावा दिया है।
प्रभाव और सीमाएँ
Something-Something ने कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र पर महत्वपूर्ण प्रभाव डाला है, समुदाय को अधिक मजबूत अस्थायी मॉडलिंग की ओर धकेला है। इसका उपयोग वीडियो के लिए डेटा वृद्धि और पाठ्यक्रम शिक्षण पर शोध में भी किया गया है। हालाँकि, डेटासेट सीमाओं से रहित नहीं है। क्रिया श्रेणियाँ अत्यधिक अमूर्त हैं, और वीडियो की क्राउड-सोर्स प्रकृति लेबल शोर और परिवर्तनशीलता लाती है। कुछ शोधकर्ताओं ने नोट किया है कि क्रियाएँ अक्सर एक स्क्रिप्टेड तरीके से की जाती हैं, जो प्राकृतिक मानव व्यवहार से भिन्न हो सकती हैं। इसके अतिरिक्त, डेटासेट हाल के बड़े पैमाने के वीडियो डेटासेट्स की तुलना में अपेक्षाकृत छोटा है, जो बड़े भाषा मॉडल और अन्य डेटा-भूखे दृष्टिकोणों की प्रभावशीलता को सीमित कर सकता है जब सीधे प्रीट्रेनिंग के लिए उपयोग किया जाता है।
संबंधित कार्य और विस्तार
कई अनुवर्ती डेटासेट Something-Something से प्रेरित हुए हैं, जिनमें Something-Else शामिल है, जो संरचनात्मक क्रिया पहचान पर केंद्रित है, और Something-Something V2, जो अधिक वीडियो और बेहतर एनोटेशन के साथ एक बड़ा संस्करण है। ये डेटासेट AI हार्डवेयर में प्रगति के साथ, जैसे AWS Trainium और Google Cloud TPU, का उपयोग करके तेजी से जटिल मॉडलों को प्रशिक्षित करने के लिए संयोजन में उपयोग किए जाते रहे हैं। Something-Something द्वारा उत्पन्न चुनौती शोध का एक सक्रिय क्षेत्र बनी हुई है, जिसमें ऐसे आर्किटेक्चर विकसित करने के चल रहे प्रयास हैं जो क्रियाओं की कारणात्मक और अस्थायी संरचना के बारे में तर्क कर सकें, एक ऐसी क्षमता जो रोबोटिक्स, स्वायत्त ड्राइविंग और मानव-कंप्यूटर अंतःक्रिया में अनुप्रयोगों के लिए आवश्यक है।