UCF101 एक वीडियो एक्शन पहचान के लिए डेटासेट है, जिसमें 101 एक्शन श्रेणियाँ और 13,320 वीडियो क्लिप शामिल हैं। वीडियो YouTube से प्राप्त होते हैं और यथार्थवादी, अप्रतिबंधित गतिविधियों को दर्शाते हैं, जिनमें "बास्केटबॉल" और "स्केटबोर्डिंग" जैसे खेलों से लेकर "गिटार बजाना" और "आई मेकअप लगाना" जैसी मानव-वस्तु अंतःक्रियाएँ शामिल हैं। 2012 में सेंट्रल फ्लोरिडा विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तुत, यह डेटासेट कैमरा गति, प्रकाश और पृष्ठभूमि की अव्यवस्था में वास्तविक-विश्व परिवर्तनशीलता को दर्शाने वाले वीडियो का एक बड़ा, विविध संग्रह प्रदान करके गतिविधि पहचान में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया था।
डेटासेट को 101 वर्गों में व्यवस्थित किया गया है, जिनमें प्रत्येक में 100 से 150 क्लिप हैं, जिनकी कुल अवधि 27 घंटे से अधिक है। वीडियो को तीन प्रशिक्षण और परीक्षण विभाजनों में विभाजित किया गया है, जिनमें प्रत्येक में लगभग 9,500 प्रशिक्षण और 3,700 परीक्षण क्लिप हैं। यह विभाजन संरचना विभिन्न मॉडलों में सुसंगत मूल्यांकन की अनुमति देती है। UCF101 पहले के UCF50 डेटासेट का विस्तार है, जिसमें 50 एक्शन श्रेणियाँ थीं, और इसमें अतिरिक्त वर्ग और अधिक चुनौतीपूर्ण परिदृश्य शामिल हैं।
डेटासेट संरचना और विशेषताएँ
UCF101 में प्रत्येक वीडियो एक छोटी क्लिप है, जो आमतौर पर कुछ सेकंड तक चलती है, और 320x240 पिक्सेल के रिज़ॉल्यूशन पर 25 फ्रेम प्रति सेकंड की फ्रेम दर के साथ कैप्चर की जाती है। एक्शन को पाँच व्यापक प्रकारों में समूहीकृत किया गया है: मानव-वस्तु अंतःक्रिया, केवल शारीरिक गति, मानव-मानव अंतःक्रिया, संगीत वाद्ययंत्र बजाना, और खेल। यह वर्गीकरण शोधकर्ताओं को विभिन्न एक्शन जटिलताओं में मॉडल प्रदर्शन का विश्लेषण करने में मदद करता है। वीडियो असंपादित हैं और इनमें कैमरा हिलना, अवरोधन और आंशिक दृश्य जैसे प्राकृतिक बदलाव शामिल हैं, जो डेटासेट को वास्तविक-विश्व अनुप्रयोगों के लिए एक यथार्थवादी बेंचमार्क बनाते हैं।
डीप लर्निंग अनुसंधान में भूमिका
UCF101 Deep learning समुदाय में एक मानक बेंचमार्क बन गया, विशेष रूप से वीडियो समझ के लिए डिज़ाइन किए गए Neural network आर्किटेक्चर का मूल्यांकन करने के लिए। प्रारंभिक दृष्टिकोणों में हाथ से बनाई गई विशेषताओं का उपयोग किया गया था, लेकिन कन्वोल्यूशनल न्यूरल नेटवर्क के आगमन के साथ डेटासेट ने प्रमुखता प्राप्त की। 2014 में, शोधकर्ताओं ने प्रदर्शित किया कि Deep learning मॉडल UCF101 पर उच्च सटीकता प्राप्त कर सकते हैं, पारंपरिक तरीकों को पीछे छोड़ते हुए। डेटासेट का उपयोग दो-स्ट्रीम नेटवर्क जैसे आर्किटेक्चर की तुलना करने के लिए किया गया है, जो स्थानिक और लौकिक जानकारी को अलग-अलग संसाधित करते हैं, और 3D कन्वोल्यूशनल नेटवर्क जो सीधे स्पेटियोटेम्पोरल विशेषताओं को सीखते हैं। यह Data Augmentation तकनीकों के लिए एक परीक्षण मंच के रूप में भी कार्य करता है, जैसे कि यादृच्छिक क्रॉपिंग और लौकिक जिटरिंग, जो मॉडल सामान्यीकरण में सुधार करते हैं।
मूल्यांकन और मेट्रिक्स
UCF101 पर मानक मूल्यांकन तीन पूर्वनिर्धारित विभाजनों पर औसत वर्गीकरण सटीकता की रिपोर्ट करता है। एक मॉडल को प्रत्येक विभाजन के प्रशिक्षण सेट पर प्रशिक्षित किया जाता है और संबंधित परीक्षण सेट पर परीक्षण किया जाता है। अंतिम मेट्रिक विभाजनों में औसत सटीकता है। यह प्रोटोकॉल विभिन्न विधियों के बीच उचित तुलना सुनिश्चित करता है। वर्षों से, अत्याधुनिक सटीकता 2014 में लगभग 70% से बढ़कर 2020 तक 97% से अधिक हो गई है, जो अवशिष्ट नेटवर्क और ध्यान तंत्र जैसे आर्किटेक्चर में प्रगति से प्रेरित है। डेटासेट को अक्सर HMDB51 के साथ जोड़ा जाता है, जो एक और एक्शन पहचान डेटासेट है, ताकि अधिक व्यापक मूल्यांकन प्रदान किया जा सके।
प्रभाव और सीमाएँ
UCF101 ने वीडियो समझ मॉडल के विकास को प्रभावित किया है और निगरानी, मानव-कंप्यूटर अंतःक्रिया और सामग्री-आधारित वीडियो पुनर्प्राप्ति जैसे अनुप्रयोगों में उपयोग किया गया है। हालाँकि, इसकी सीमाओं में Kinetics-400 जैसे नए डेटासेट की तुलना में अपेक्षाकृत कम संख्या में वर्ग शामिल हैं, जिसमें 400 वर्ग और 300,000 से अधिक क्लिप हैं। UCF101 में वीडियो भी छोटे हैं और दीर्घकालिक लौकिक निर्भरता को पकड़ नहीं सकते हैं। इन बाधाओं के बावजूद, UCF101 त्वरित प्रोटोटाइपिंग और Machine learning पाठ्यक्रमों में शैक्षिक उद्देश्यों के लिए एक मूल्यवान संसाधन बना हुआ है। इसकी यथार्थवादी प्रकृति और मध्यम आकार इसे सीमित कम्प्यूटेशनल संसाधनों वाले शोधकर्ताओं के लिए सुलभ बनाते हैं।
संबंधित बेंचमार्क और विकास
UCF101 की सफलता ने बड़े और अधिक जटिल डेटासेट के निर्माण को प्रेरित किया। 2017 में Kinetics-400 की शुरुआत ने बड़े पैमाने पर प्रशिक्षण पर ध्यान केंद्रित किया, जिससे अधिक शक्तिशाली मॉडल के विकास को सक्षम किया गया। फिर भी, UCF101 अभी भी सामान्यीकरण और अति-फिटिंग का परीक्षण करने के लिए एक द्वितीयक बेंचमार्क के रूप में उपयोग किया जाता है। यह स्थानांतरण सीखने के लिए एक आधार के रूप में भी कार्य करता है, जहाँ बड़े डेटासेट पर पूर्व-प्रशिक्षित मॉडल को विशिष्ट कार्यों के लिए UCF101 पर ठीक-ट्यून किया जाता है। डेटासेट की स्थायी प्रासंगिकता अनुसंधान पत्रों में इसके निरंतर उद्धरण और लोकप्रिय डीप लर्निंग फ्रेमवर्क में वीडियो वर्गीकरण के लिए एक मानक उदाहरण के रूप में इसके समावेश से स्पष्ट है।
निष्कर्ष
UCF101 ने वीडियो एक्शन पहचान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसके यथार्थवादी वीडियो, स्पष्ट मूल्यांकन प्रोटोकॉल और प्रबंधनीय आकार ने इसे कंप्यूटर विज़न समुदाय में एक प्रमुख उपकरण बना दिया है। जबकि नए डेटासेट अधिक पैमाने और विविधता प्रदान करते हैं, UCF101 बेंचमार्किंग और Artificial intelligence में स्पेटियोटेम्पोरल मॉडलिंग की मूल बातें समझने के लिए एक आवश्यक उपकरण बना हुआ है।