Kinetics-400 वीडियो एक्शन पहचान के लिए एक बड़े पैमाने का डेटासेट है, जिसमें लगभग 306,245 वीडियो क्लिप शामिल हैं जो 400 मानव क्रिया वर्गों को कवर करते हैं। इसे 2017 में DeepMind के शोधकर्ताओं द्वारा पेश किया गया था और तब से यह मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में वीडियो समझ मॉडलों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है। यह डेटासेट मानव क्रियाओं पर केंद्रित है, जिसमें 'गिटार बजाना' और 'गले लगाना' जैसी रोजमर्रा की गतिविधियों से लेकर खेल और वस्तुओं के साथ अंतःक्रियाएं शामिल हैं, जो दृश्य और गति पैटर्न का एक विविध सेट प्रदान करता है।
Kinetics-400 का प्राथमिक उद्देश्य उन मॉडलों के प्रशिक्षण और मूल्यांकन को सक्षम करना है जो बिना काटे गए वीडियो अनुक्रमों में क्रियाओं को स्वचालित रूप से पहचान सकते हैं। ImageNet जैसे छवि डेटासेट के विपरीत, Kinetics-400 अस्थायी गतिशीलता को पकड़ता है, जिससे यह उन एल्गोरिदम को विकसित करने के लिए आवश्यक हो जाता है जो समय के साथ गति और संदर्भ को समझते हैं। इसका पैमाना और विविधता इसे वीडियो वर्गीकरण, स्थानिक-अस्थायी फीचर लर्निंग और एक्शन लोकलाइजेशन में अनुसंधान के लिए एक मूलभूत संसाधन बनाती है।
डेटासेट निर्माण
Kinetics-400 को YouTube से वीडियो एकत्र करके बनाया गया था, जिसमें प्रत्येक क्लिप लगभग 10 सेकंड की होती है। डेटासेट को स्वचालित खोज और मानव एनोटेशन के संयोजन के माध्यम से बनाया गया था। प्रारंभ में, प्रत्येक 400 क्रिया वर्गों के लिए क्वेरी का उपयोग करके उम्मीदवार वीडियो प्राप्त किए गए थे, फिर मानव एनोटेटरों ने सटीकता सुनिश्चित करने के लिए क्लिप को सत्यापित और लेबल किया। प्रत्येक वर्ग में 400 से 1,150 क्लिप होते हैं, जिसमें पूरे डेटासेट में कुल लगभग 306,245 क्लिप होते हैं।
क्रियाएं व्यापक श्रेणियों को कवर करती हैं, जिनमें 'ड्रम बजाना', 'स्केटबोर्डिंग', 'सब्जियां काटना' और 'हाथ मिलाना' शामिल हैं। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट के लेबल मूल्यांकन उद्देश्यों के लिए छिपाए गए हैं। पुनरुत्पादन का समर्थन करने के लिए, डेटासेट को क्रिएटिव कॉमन्स लाइसेंस के तहत जारी किया गया है, जिससे शोधकर्ताओं को इसे शैक्षणिक और व्यावसायिक उद्देश्यों के लिए उपयोग करने की अनुमति मिलती है।
वीडियो समझ पर प्रभाव
Kinetics-400 ने वीडियो एक्शन पहचान के क्षेत्र को महत्वपूर्ण रूप से प्रभावित किया है। इसके जारी होने से पहले, UCF-101 और HMDB-51 जैसे डेटासेट छोटे और कम विविध थे, जिससे मॉडलों की सामान्यीकरण क्षमता सीमित थी। Kinetics-400 ने क्रियाओं का एक बड़ा और अधिक विविध सेट प्रदान किया, जिससे गहरे और अधिक जटिल आर्किटेक्चर के विकास को सक्षम किया गया। इसका उपयोग उन मॉडलों को पूर्व-प्रशिक्षित करने के लिए किया गया है जिन्हें बाद में छोटे डेटासेट पर फाइन-ट्यून किया जाता है, एक अभ्यास जो वीडियो विश्लेषण में मानक बन गया है।
डेटासेट ने मॉडल डिजाइन में नवाचारों को भी प्रेरित किया है। उदाहरण के लिए, I3D (Inflated 3D ConvNet) जैसे 3D कन्वोल्यूशनल नेटवर्क की शुरुआत सीधे तौर पर Kinetics-400 के पैमाने को संभालने की आवश्यकता से प्रेरित थी। I3D, जो 2D ResNet आर्किटेक्चर को 3D में फुलाता है, ने Kinetics-400 पर अत्याधुनिक परिणाम प्राप्त किए और क्षेत्र के लिए एक नया बेंचमार्क स्थापित किया। SlowFast और X3D सहित बाद के मॉडलों ने इस डेटासेट पर प्रदर्शन में और सुधार किया है, जो आर्किटेक्चरल प्रगति के चालक के रूप में इसकी भूमिका को प्रदर्शित करता है।
विस्तार और विविधताएं
Kinetics-400 की सफलता के बाद, DeepMind की उसी टीम ने विस्तारित संस्करण जारी किए: Kinetics-600 और Kinetics-700, जिनमें क्रमशः 600 और 700 क्रिया वर्ग हैं। ये बड़े डेटासेट और भी अधिक विविधता प्रदान करते हैं और उच्च सटीकता वाले मॉडलों को प्रशिक्षित करने के लिए उपयोग किए गए हैं। इसके अतिरिक्त, Kinetics-400 को अस्थायी एक्शन लोकलाइजेशन और वीडियो कैप्शनिंग जैसे अन्य कार्यों के लिए अनुकूलित किया गया है, जिसमें एनोटेशन जोड़ना या मूल्यांकन प्रोटोकॉल को संशोधित करना शामिल है।
Kinetics-400 को व्यापक बेंचमार्क में भी शामिल किया गया है। उदाहरण के लिए, Something-Something डेटासेट, जो बारीक मानव-वस्तु अंतःक्रियाओं पर केंद्रित है, Kinetics-400 के पूरक के रूप में बनाया गया था, और दोनों का उपयोग अक्सर मॉडल सामान्यीकरण का मूल्यांकन करने के लिए एक साथ किया जाता है। डेटासेट का प्रभाव शिक्षा से परे फैला हुआ है, जिसमें OpenAI और Anthropic जैसी उद्योग प्रयोगशालाएं अपने वीडियो मॉडलों को बेंचमार्क करने के लिए इसका उपयोग करती हैं, हालांकि वे आमतौर पर अपने सटीक प्रशिक्षण विवरण जारी नहीं करते हैं।
सीमाएं और विचार
इसकी उपयोगिता के बावजूद, Kinetics-400 की ज्ञात सीमाएं हैं। वीडियो YouTube से प्राप्त होते हैं, जो सामग्री, संस्कृति और जनसांख्यिकी के संदर्भ में पूर्वाग्रह पेश करते हैं। क्रियाएं अक्सर पश्चिमी सेटिंग्स में व्यक्तियों द्वारा की जाती हैं, जो मॉडल की अन्य संदर्भों में सामान्यीकरण करने की क्षमता को सीमित कर सकती हैं। इसके अतिरिक्त, 10-सेकंड की क्लिप लंबाई लंबी अवधि की अस्थायी निर्भरता को पकड़ नहीं सकती है, और एनोटेशन प्रक्रिया, हालांकि कठोर है, फिर भी त्रुटियां हो सकती हैं।
एक और चिंता गोपनीयता और नैतिक मुद्दों की संभावना है, क्योंकि डेटासेट में अनुसंधान उपयोग के लिए स्पष्ट सहमति के बिना लोगों के वीडियो शामिल हैं। शोधकर्ताओं ने जिम्मेदार उपयोग के लिए दिशानिर्देश विकसित करके इसे संबोधित किया है, लेकिन डेटासेट बहस का विषय बना हुआ है। 2025 तक, Something-Something-v2 और Ego4D जैसे नए डेटासेट इनमें से कुछ अंतरालों को संबोधित करने का लक्ष्य रखते हैं, लेकिन Kinetics-400 क्षेत्र में व्यापक रूप से उपयोग किया और उद्धृत किया जाने वाला संसाधन बना हुआ है।
यह भी देखें
संदर्भ
- Kay, W., et al. (2017). The Kinetics Human Action Video Dataset. arXiv preprint.
- Carreira, J., & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR.
- Feichtenhofer, C., et al. (2019). SlowFast Networks for Video Recognition. ICCV.