Kinetics-700 बड़े पैमाने पर वीडियो क्रिया पहचान के लिए एक डेटासेट है, जिसमें 700 मानव क्रिया वर्ग और लगभग 650,000 वीडियो क्लिप शामिल हैं। इसे 2019 में DeepMind (अब Google DeepMind का हिस्सा) के शोधकर्ताओं द्वारा पहले के Kinetics-400 और Kinetics-600 डेटासेट के उत्तराधिकारी के रूप में पेश किया गया था। यह डेटासेट वीडियो समझ कार्यों, जैसे क्रिया वर्गीकरण और अस्थायी स्थानीयकरण में गहन शिक्षण मॉडल को प्रशिक्षित करने और मूल्यांकन करने के लिए एक मानक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया जाता है।
Kinetics-700 में वीडियो सार्वजनिक रूप से उपलब्ध YouTube क्लिप से प्राप्त होते हैं, जिनमें से प्रत्येक को 10 सेकंड की निश्चित अवधि में काटा गया है। क्रिया वर्ग रोजमर्रा की मानव गतिविधियों की एक विस्तृत श्रृंखला को कवर करते हैं, जिसमें खेल, खाना पकाना, व्यक्तिगत देखभाल और सामाजिक संपर्क शामिल हैं। प्रत्येक वर्ग में 600 से 1,000 वीडियो क्लिप होते हैं, जो श्रेणियों में संतुलित वितरण सुनिश्चित करते हैं। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है, जिसमें आधिकारिक मूल्यांकन के लिए परीक्षण सेट लेबल वापस ले लिए गए हैं।
निर्माण और एनोटेशन
Kinetics-700 का निर्माण एक अर्ध-स्वचालित पाइपलाइन के माध्यम से किया गया था। उम्मीदवार वीडियो शुरू में प्रत्येक क्रिया वर्ग के लिए खोज क्वेरी का उपयोग करके प्राप्त किए गए थे, फिर स्वचालित जांच और मानव एनोटेशन के संयोजन के माध्यम से फ़िल्टर किए गए थे। एनोटेटर्स ने सत्यापित किया कि प्रत्येक क्लिप सही ढंग से लक्षित क्रिया को दर्शाती है, और अस्पष्ट या निम्न-गुणवत्ता वाले क्लिप को हटा दिया गया था। अंतिम डेटासेट को अस्थायी स्थिरता सुनिश्चित करने के लिए क्यूरेट किया गया था, जिसमें प्रत्येक क्लिप में एकल, स्पष्ट रूप से पहचान योग्य क्रिया शामिल थी।
अपने पूर्ववर्तियों की तुलना में, Kinetics-700 ने अधिक विविध क्रिया वर्गों को पेश किया, जिसमें सूक्ष्म अंतर जैसे "अकॉर्डियन बजाना" बनाम "हारमोनिका बजाना" शामिल हैं। यह बढ़ी हुई ग्रैन्युलैरिटी मॉडल के लिए एक बड़ी चुनौती पेश करती है, जिसके लिए उन्हें सूक्ष्म गति और संदर्भ संकेतों को पकड़ने की आवश्यकता होती है।
वीडियो पहचान अनुसंधान पर प्रभाव
Kinetics-700 वीडियो क्रिया पहचान के क्षेत्र में एक मानक बेंचमार्क बन गया है। इसका उपयोग आमतौर पर डाउनस्ट्रीम कार्यों, जैसे स्पेटियोटेम्पोरल क्रिया स्थानीयकरण या वीडियो कैप्शनिंग पर फाइन-ट्यूनिंग से पहले बड़े पैमाने पर वीडियो डेटा पर मॉडल को पूर्व-प्रशिक्षित करने के लिए किया जाता है। डेटासेट ने 3D अवशिष्ट नेटवर्क और वीडियो ट्रांसफार्मर जैसे आर्किटेक्चर में प्रगति को बढ़ावा दिया है, जिन्होंने इसके सत्यापन सेट पर अत्याधुनिक परिणाम प्राप्त किए हैं।
शोधकर्ताओं ने विभिन्न डोमेन में वीडियो मॉडल के सामान्यीकरण का अध्ययन करने के लिए भी Kinetics-700 का उपयोग किया है। उदाहरण के लिए, Kinetics-700 पर प्रशिक्षित मॉडल को उचित रूप से फाइन-ट्यून करने पर Something-Something और UCF101 जैसे अन्य वीडियो डेटासेट में अच्छी तरह से स्थानांतरित होते दिखाया गया है। डेटासेट का पैमाना और विविधता इसे वीडियो समझ के लिए मशीन लर्निंग दृष्टिकोण को आगे बढ़ाने के लिए एक महत्वपूर्ण संसाधन बनाती है।
मूल्यांकन और मेट्रिक्स
Kinetics-700 पर मानक मूल्यांकन सत्यापन सेट पर शीर्ष-1 और शीर्ष-5 सटीकता का उपयोग करता है। चूंकि परीक्षण सेट लेबल सार्वजनिक रूप से जारी नहीं किए जाते हैं, अधिकांश प्रकाशित परिणाम सत्यापन सटीकता की रिपोर्ट करते हैं। आधिकारिक मूल्यांकन प्रोटोकॉल के लिए मॉडल को अस्थायी स्थानीयकरण के बिना प्रत्येक 10-सेकंड क्लिप के लिए एकल क्रिया लेबल की भविष्यवाणी करने की आवश्यकता होती है। यह सेटअप छोटे, छंटे हुए वीडियो खंडों से क्रियाओं को पहचानने की क्षमता पर जोर देता है।
व्यवहार में, कई मॉडल Kinetics-700 पर 70-80% की सीमा में शीर्ष-1 सटीकता प्राप्त करते हैं, जिसमें सर्वश्रेष्ठ प्रदर्शन करने वाले आर्किटेक्चर बहु-पैमाने अस्थायी मॉडलिंग और ध्यान तंत्र को शामिल करते हैं। डेटासेट वीडियो प्रतिनिधित्व सीखने के मूल्यांकन का भी समर्थन करता है, जहां मॉडल को Kinetics-700 पर पूर्व-प्रशिक्षित किया जाता है और फिर रैखिक जांच या फाइन-ट्यूनिंग के माध्यम से अन्य कार्यों पर मूल्यांकन किया जाता है।
सीमाएं और विचार
इसकी उपयोगिता के बावजूद, Kinetics-700 में ज्ञात सीमाएं हैं। डेटासेट उन क्रियाओं की ओर पक्षपाती है जो YouTube पर अच्छी तरह से प्रतिनिधित्व करती हैं, जो वास्तविक दुनिया की सेटिंग्स में मानव गतिविधियों की पूर्ण विविधता को प्रतिबिंबित नहीं कर सकती हैं। इसके अतिरिक्त, 10-सेकंड क्लिप की लंबाई उन क्रियाओं के लिए अपर्याप्त हो सकती है जो लंबे समय के पैमाने पर सामने आती हैं, जैसे भोजन पकाना या फर्नीचर जोड़ना। शोधकर्ताओं ने नोट किया है कि डेटासेट का वर्ग वितरण ऐसे मॉडल को जन्म दे सकता है जो क्रिया के बजाय पृष्ठभूमि संदर्भ के प्रति अत्यधिक संवेदनशील होते हैं।
सार्वजनिक रूप से उपलब्ध YouTube वीडियो के उपयोग से गोपनीयता और नैतिक चिंताएं भी उत्पन्न होती हैं, क्योंकि व्यक्ति स्पष्ट सहमति के बिना दिखाई दे सकते हैं। डेटासेट शोध उद्देश्यों के लिए है, और उपयोगकर्ताओं को इस पर प्रशिक्षित मॉडल तैनात करते समय इन मुद्दों पर विचार करने के लिए प्रोत्साहित किया जाता है।
संबंधित डेटासेट और विस्तार
Kinetics-700 Kinetics डेटासेट के व्यापक परिवार का हिस्सा है, जिसमें Kinetics-400, Kinetics-600 और अधिक हालिया Kinetics-700-2020 शामिल हैं, जिसने वर्ग सूची को अद्यतन किया और नए क्लिप जोड़े। Something-Something और ActivityNet जैसे अन्य संबंधित बेंचमार्क वीडियो समझ के विभिन्न पहलुओं पर ध्यान केंद्रित करते हैं, जैसे सूक्ष्म वस्तु इंटरैक्शन या अस्थायी गतिविधि पहचान। Kinetics-700 के लिए विकसित डेटा संवर्धन तकनीकों ने अन्य वीडियो डेटासेट और मॉडल प्रशिक्षण पाइपलाइनों को भी प्रभावित किया है।