ActivityNet एक बड़े पैमाने का वीडियो डेटासेट है जिसे अस्थायी क्रिया स्थानीयकरण (temporal action localization) और क्रिया पहचान (action recognition) में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है। यह घनी रूप से एनोटेट किए गए वीडियो खंड प्रदान करता है, जिससे मॉडल न केवल यह पहचान सकते हैं कि कौन सी क्रियाएं होती हैं, बल्कि यह भी कि वे किसी वीडियो के भीतर कब होती हैं। अपनी शुरुआत के बाद से, यह वीडियो समझ में एल्गोरिदम का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन गया है, विशेष रूप से उन कार्यों के लिए जिनमें असंपादित (untrimmed) वीडियो शामिल होते हैं जहां क्रियाएं लंबे अनुक्रमों में अंतर्निहित होती हैं।
यह डेटासेट पहली बार 2015 में मिशिगन विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा जारी किया गया था, जिसका नेतृत्व फैबियन काबा हेइलब्रॉन, विक्टर एस्कोर्सिया, बर्नार्ड घनेम और जुआन कार्लोस नीबल्स ने किया था। प्रारंभिक संस्करण, ActivityNet-200, में 200 क्रिया वर्ग और 28,000 से अधिक वीडियो शामिल हैं, जिनमें कुल 648,000 से अधिक अस्थायी एनोटेशन हैं। वीडियो यूट्यूब जैसे सार्वजनिक प्लेटफार्मों से प्राप्त होते हैं, जो खेल, घरेलू काम और सामाजिक संपर्क जैसी विविध गतिविधियों को कवर करते हैं। प्रत्येक वीडियो में कई क्रिया उदाहरणों को एनोटेट किया गया है, जिनमें से प्रत्येक की शुरुआत और समाप्ति समय होता है, जो अस्थायी स्थानीयकरण के लिए समृद्ध ग्राउंड ट्रुथ प्रदान करता है।
संरचना और एनोटेशन
ActivityNet को तीन भागों में व्यवस्थित किया गया है: प्रशिक्षण, सत्यापन और परीक्षण, जिनका वितरण लगभग 50/25/25 है। एनोटेशन JSON प्रारूप में प्रदान किए जाते हैं, जिनमें वीडियो URL, क्रिया लेबल और अस्थायी सीमाएं शामिल होती हैं। प्रत्येक क्रिया उदाहरण के लिए, डेटासेट में एनोटेशन गुणवत्ता के लिए एक विश्वास स्कोर भी शामिल होता है। क्रिया वर्ग पदानुक्रमित रूप से श्रेणियों में व्यवस्थित होते हैं, जैसे "खेल," "घरेलू," और "व्यक्तिगत देखभाल," जो विभिन्न स्तरों पर मॉडल का मूल्यांकन करने में मदद करता है।
ActivityNet की एक प्रमुख विशेषता असंपादित वीडियो पर इसका ध्यान केंद्रित करना है, जो UCF101 या HMDB51 जैसे पहले के डेटासेट के विपरीत है जिनमें काटे गए क्लिप शामिल थे। यह डिज़ाइन मॉडल को पूर्ण अस्थायी संदर्भ को संभालने के लिए मजबूर करता है, जिससे कार्य अधिक यथार्थवादी बन जाता है। डेटासेट में उन खंडों के लिए एक "पृष्ठभूमि" वर्ग भी शामिल है जो 200 क्रियाओं में से किसी से मेल नहीं खाते, जो स्थानीयकरण मॉडल को प्रशिक्षित करने के लिए महत्वपूर्ण है।
बेंचमार्क कार्य
ActivityNet से जुड़े प्राथमिक कार्य अस्थायी क्रिया स्थानीयकरण और क्रिया पहचान हैं। अस्थायी क्रिया स्थानीयकरण में, एक मॉडल को असंपादित वीडियो में प्रत्येक क्रिया उदाहरण के शुरुआत और समाप्ति समय के साथ-साथ क्रिया लेबल की भविष्यवाणी करनी होती है। इसका मूल्यांकन अक्सर विभिन्न अस्थायी इंटरसेक्शन ओवर यूनियन (IoU) थ्रेसहोल्ड, जैसे 0.5 और 0.75, पर माध्य औसत परिशुद्धता (mAP) का उपयोग करके किया जाता है। दूसरी ओर, क्रिया पहचान में वीडियो में प्रमुख क्रिया का वर्गीकरण शामिल होता है, जिसका मूल्यांकन आमतौर पर शीर्ष-1 और शीर्ष-5 सटीकता के साथ किया जाता है।
ActivityNet एक वार्षिक चुनौती भी आयोजित करता है, जिसे ActivityNet लार्ज-स्केल एक्टिविटी रिकग्निशन चैलेंज कहा जाता है, जो CVPR और ICCV जैसे प्रमुख कंप्यूटर विज़न सम्मेलनों के साथ आयोजित किया गया है। इस चुनौती ने शैक्षणिक और औद्योगिक अनुसंधान समूहों से कई प्रस्तुतियां आकर्षित की हैं, जिससे क्षेत्र में प्रगति हुई है। वर्षों से, डेटासेट को अतिरिक्त एनोटेशन के साथ विस्तारित किया गया है, जैसे ActivityNet कैप्शन उपसमुच्चय, जो वीडियो खंडों के लिए प्राकृतिक भाषा विवरण प्रदान करता है, जिससे वीडियो कैप्शनिंग और घने वीडियो कैप्शनिंग में अनुसंधान संभव होता है।
कंप्यूटर विज़न पर प्रभाव
ActivityNet ने वीडियो समझ मॉडल के विकास को महत्वपूर्ण रूप से प्रभावित किया है। इसका उपयोग पारंपरिक हस्त-निर्मित फीचर-आधारित विधियों से लेकर आधुनिक Deep learning दृष्टिकोणों तक विभिन्न आर्किटेक्चर को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है। अस्थायी क्रिया स्थानीयकरण के लिए कई अत्याधुनिक मॉडल, जैसे बाउंड्री मैचिंग नेटवर्क (BMN) और एक्शनफॉर्मर, ने ActivityNet पर परिणाम रिपोर्ट किए हैं। डेटासेट ने कमजोर-पर्यवेक्षित स्थानीयकरण में अनुसंधान को भी प्रेरित किया है, जहां मॉडल केवल वीडियो-स्तरीय लेबल का उपयोग करके प्रशिक्षित होते हैं, और डेटा के बड़े पैमाने को देखते हुए कुशल वीडियो प्रोसेसिंग में भी।
डेटासेट का अस्थायी संरचना पर जोर Artificial intelligence के व्यापक क्षेत्र में योगदान दिया है, विशेष रूप से निगरानी के लिए गतिविधि पहचान, मानव-कंप्यूटर संपर्क और स्वायत्त ड्राइविंग जैसे क्षेत्रों में। इसका उपयोग अन्य डेटासेट, जैसे kinetics (हालांकि प्रदान की गई सूची में नहीं है, यह एक ज्ञात संबंधित डेटासेट है) और Something-Something (सूची में भी नहीं है) के साथ संयोजन में भी किया गया है, ताकि अधिक व्यापक बेंचमार्क बनाए जा सकें।
सीमाएं और भविष्य की दिशाएं
अपनी सफलता के बावजूद, ActivityNet की सीमाएं हैं। वीडियो यूट्यूब से प्राप्त होते हैं, जो सामग्री और गुणवत्ता के संदर्भ में पूर्वाग्रह पेश कर सकते हैं। क्रिया वर्ग पूर्वनिर्धारित हैं, जो सभी संभावित मानव गतिविधियों को कवर नहीं कर सकते। इसके अतिरिक्त, अस्थायी एनोटेशन मैन्युअल रूप से बनाए जाते हैं, जो समय लेने वाला है और इसमें असंगतताएं हो सकती हैं। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने ActivityNet-1.3 जैसे विस्तार प्रस्तावित किए हैं, जिसमें अधिक वीडियो और परिष्कृत एनोटेशन शामिल हैं, और मॉडल मजबूती में सुधार के लिए Data Augmentation तकनीकों का उपयोग करने की खोज की है।
भविष्य के कार्य में ActivityNet को अन्य मोडैलिटी, जैसे ऑडियो या टेक्स्ट, के साथ एकीकृत करना शामिल हो सकता है, ताकि बहु-मोडल बेंचमार्क बनाए जा सकें। Large language model और Transformer (architecture)-आधारित आर्किटेक्चर के उदय ने वीडियो समझ के लिए नए रास्ते खोले हैं, और ActivityNet इन उभरती विधियों के लिए एक प्रासंगिक परीक्षण मंच बना हुआ है। जैसे-जैसे क्षेत्र वीडियो प्रश्न उत्तर और दीर्घकालिक वीडियो समझ जैसे अधिक जटिल कार्यों की ओर बढ़ता है, ActivityNet जैसे डेटासेट संभवतः इन चुनौतियों को पूरा करने के लिए विकसित होंगे।
निष्कर्ष
ActivityNet कंप्यूटर विज़न में एक मौलिक संसाधन के रूप में खड़ा है, जो अस्थायी क्रिया स्थानीयकरण के लिए एक कठोर बेंचमार्क प्रदान करता है। इसके घने एनोटेशन और यथार्थवादी असंपादित वीडियो ने इसे वीडियो समझ एल्गोरिदम का मूल्यांकन करने के लिए एक मानक बना दिया है। सटीक अस्थायी मॉडलिंग को सक्षम करके, इसने स्वचालित वीडियो विश्लेषण में संभव की सीमाओं को आगे बढ़ाया है, जिसके कई वास्तविक-विश्व अनुप्रयोगों के लिए निहितार्थ हैं।