Kinetics-600 वीडियो एक्शन पहचान के लिए एक बड़े पैमाने का डेटासेट है, जिसमें लगभग 480,000 वीडियो क्लिप शामिल हैं जो 600 मानव क्रिया वर्गों को कवर करते हैं। इसे 2018 में DeepMind (अब Google DeepMind का हिस्सा) और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जो पहले के Kinetics-400 डेटासेट पर आधारित था। यह डेटासेट वीडियो समझ कार्यों में डीप लर्निंग मॉडल के प्रशिक्षण और मूल्यांकन के लिए एक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया जाता है।
क्लिप YouTube से प्राप्त की जाती हैं और मानव गतिविधियों की एक विस्तृत श्रृंखला को दर्शाती हैं, जैसे 'दांत ब्रश करना' जैसी रोजमर्रा की क्रियाओं से लेकर खेल और वस्तुओं के साथ बातचीत तक। प्रत्येक क्लिप लगभग 10 सेकंड की होती है और एक एकल क्रिया वर्ग के साथ लेबल की जाती है। डेटासेट को वास्तविक दुनिया की मानव गति की विविधता और जटिलता को पकड़ने के लिए डिज़ाइन किया गया है, जो इसे एक्शन पहचान एल्गोरिदम के लिए एक चुनौतीपूर्ण परीक्षण मंच बनाता है।
डेटासेट निर्माण
Kinetics-600 डेटासेट एक अर्ध-स्वचालित पाइपलाइन के माध्यम से बनाया गया था। प्रत्येक क्रिया वर्ग के लिए खोज क्वेरी का उपयोग करके उम्मीदवार वीडियो URL एकत्र किए गए थे, और फिर मानव एनोटेटरों ने क्लिप को सत्यापित किया ताकि यह सुनिश्चित हो सके कि वे इच्छित क्रिया को सही ढंग से दर्शाती हैं। एनोटेशन प्रक्रिया में गुणवत्ता नियंत्रण के कई चरण शामिल थे, जिसमें लेबल शुद्धता की जांच और अस्पष्ट या निम्न-गुणवत्ता वाली क्लिप को हटाना शामिल था। अंतिम डेटासेट में 600 वर्ग हैं, प्रत्येक वर्ग में कम से कम 600 क्लिप हैं, जो श्रेणियों में संतुलित वितरण सुनिश्चित करता है। कुल क्लिप की संख्या लगभग 480,000 है, जिसमें ट्रेन/वैलिडेशन/टेस्ट विभाजन लगभग 70/10/20 प्रतिशत है।
Kinetics-400 और Kinetics-700 से संबंध
Kinetics-600 मूल Kinetics-400 (400 वर्ग, 2017 में पेश किया गया) और बाद के Kinetics-700 (700 वर्ग, 2019 में जारी) के बीच एक मध्यवर्ती संस्करण है। Kinetics-400 की तुलना में, Kinetics-600 में 200 नए क्रिया वर्ग जोड़े गए हैं, जिनमें अधिक सूक्ष्म गतिविधियाँ और बातचीत शामिल हैं। डेटासेट ने एक अधिक कठोर सत्यापन प्रोटोकॉल भी पेश किया, जिसमें मॉडलों के बीच निष्पक्ष तुलना की सुविधा के लिए सत्यापन क्लिप का एक निश्चित सेट शामिल था। Kinetics-700 ने वर्ग संख्या को और बढ़ाया और अनदेखे समय अवधि के लिए सामान्यीकरण का मूल्यांकन करने के लिए एक अस्थायी विभाजन पेश किया।
वीडियो समझ पर प्रभाव
Kinetics-600 वीडियो एक्शन पहचान के लिए एक मानक बेंचमार्क बन गया है, जो 3D कन्वोल्यूशनल नेटवर्क और वीडियो ट्रांसफॉर्मर जैसे आर्किटेक्चर में प्रगति को बढ़ावा देता है। Kinetics-600 पर पूर्व-प्रशिक्षित मॉडल अक्सर वीडियो कैप्शनिंग और स्पेटियो-टेम्पोरल एक्शन डिटेक्शन जैसे डाउनस्ट्रीम कार्यों के लिए फीचर एक्सट्रैक्टर के रूप में काम करते हैं। डेटासेट की विविधता ने उन तरीकों के विकास को प्रोत्साहित किया है जो उपस्थिति और गति दोनों संकेतों को पकड़ते हैं, जिससे सटीकता और मजबूती में सुधार होता है। 2025 तक, अत्याधुनिक मॉडल सत्यापन सेट पर 90% से अधिक शीर्ष-1 सटीकता प्राप्त करते हैं, जो प्रारंभिक आधार रेखाओं से एक महत्वपूर्ण सुधार है।
सीमाएँ और आलोचनाएँ
अपनी सफलता के बावजूद, Kinetics-600 को YouTube-स्रोत डेटा में निहित संभावित पूर्वाग्रहों के लिए आलोचना की गई है, जैसे भौगोलिक और सांस्कृतिक झुकाव। क्रिया वर्ग मुख्य रूप से पश्चिमी-केंद्रित हैं, जो इस पर प्रशिक्षित मॉडलों के अन्य क्षेत्रों में सामान्यीकरण को सीमित कर सकते हैं। इसके अतिरिक्त, डेटासेट छोटे, एकल-क्रिया क्लिप पर केंद्रित है, जो दीर्घकालिक गतिविधियों या बहु-लेबल परिदृश्यों की जटिलता को पूरी तरह से कैप्चर नहीं करता है। शोधकर्ताओं ने इनमें से कुछ अंतरालों को संबोधित करने के लिए Something-Something और Moments in Time जैसे पूरक डेटासेट प्रस्तावित किए हैं।