अंग्रेज़ी से अनुवादित

Kinetics-600 एक बड़े पैमाने का वीडियो एक्शन पहचान डेटासेट है, जिसमें 600 एक्शन वर्ग शामिल हैं, और इसे 2018 में Kinetics-400 के विस्तार के रूप में पेश किया गया था। यह वीडियो समझ मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए विविध YouTube क्लिप प्रदान करता है।

Kinetics-600 वीडियो एक्शन पहचान के लिए एक बड़े पैमाने का डेटासेट है, जिसमें लगभग 480,000 वीडियो क्लिप शामिल हैं जो 600 मानव क्रिया वर्गों को कवर करते हैं। इसे 2018 में DeepMind (अब Google DeepMind का हिस्सा) और ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जो पहले के Kinetics-400 डेटासेट पर आधारित था। यह डेटासेट वीडियो समझ कार्यों में डीप लर्निंग मॉडल के प्रशिक्षण और मूल्यांकन के लिए एक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया जाता है।

क्लिप YouTube से प्राप्त की जाती हैं और मानव गतिविधियों की एक विस्तृत श्रृंखला को दर्शाती हैं, जैसे 'दांत ब्रश करना' जैसी रोजमर्रा की क्रियाओं से लेकर खेल और वस्तुओं के साथ बातचीत तक। प्रत्येक क्लिप लगभग 10 सेकंड की होती है और एक एकल क्रिया वर्ग के साथ लेबल की जाती है। डेटासेट को वास्तविक दुनिया की मानव गति की विविधता और जटिलता को पकड़ने के लिए डिज़ाइन किया गया है, जो इसे एक्शन पहचान एल्गोरिदम के लिए एक चुनौतीपूर्ण परीक्षण मंच बनाता है।

डेटासेट निर्माण

Kinetics-600 डेटासेट एक अर्ध-स्वचालित पाइपलाइन के माध्यम से बनाया गया था। प्रत्येक क्रिया वर्ग के लिए खोज क्वेरी का उपयोग करके उम्मीदवार वीडियो URL एकत्र किए गए थे, और फिर मानव एनोटेटरों ने क्लिप को सत्यापित किया ताकि यह सुनिश्चित हो सके कि वे इच्छित क्रिया को सही ढंग से दर्शाती हैं। एनोटेशन प्रक्रिया में गुणवत्ता नियंत्रण के कई चरण शामिल थे, जिसमें लेबल शुद्धता की जांच और अस्पष्ट या निम्न-गुणवत्ता वाली क्लिप को हटाना शामिल था। अंतिम डेटासेट में 600 वर्ग हैं, प्रत्येक वर्ग में कम से कम 600 क्लिप हैं, जो श्रेणियों में संतुलित वितरण सुनिश्चित करता है। कुल क्लिप की संख्या लगभग 480,000 है, जिसमें ट्रेन/वैलिडेशन/टेस्ट विभाजन लगभग 70/10/20 प्रतिशत है।

Kinetics-400 और Kinetics-700 से संबंध

Kinetics-600 मूल Kinetics-400 (400 वर्ग, 2017 में पेश किया गया) और बाद के Kinetics-700 (700 वर्ग, 2019 में जारी) के बीच एक मध्यवर्ती संस्करण है। Kinetics-400 की तुलना में, Kinetics-600 में 200 नए क्रिया वर्ग जोड़े गए हैं, जिनमें अधिक सूक्ष्म गतिविधियाँ और बातचीत शामिल हैं। डेटासेट ने एक अधिक कठोर सत्यापन प्रोटोकॉल भी पेश किया, जिसमें मॉडलों के बीच निष्पक्ष तुलना की सुविधा के लिए सत्यापन क्लिप का एक निश्चित सेट शामिल था। Kinetics-700 ने वर्ग संख्या को और बढ़ाया और अनदेखे समय अवधि के लिए सामान्यीकरण का मूल्यांकन करने के लिए एक अस्थायी विभाजन पेश किया।

वीडियो समझ पर प्रभाव

Kinetics-600 वीडियो एक्शन पहचान के लिए एक मानक बेंचमार्क बन गया है, जो 3D कन्वोल्यूशनल नेटवर्क और वीडियो ट्रांसफॉर्मर जैसे आर्किटेक्चर में प्रगति को बढ़ावा देता है। Kinetics-600 पर पूर्व-प्रशिक्षित मॉडल अक्सर वीडियो कैप्शनिंग और स्पेटियो-टेम्पोरल एक्शन डिटेक्शन जैसे डाउनस्ट्रीम कार्यों के लिए फीचर एक्सट्रैक्टर के रूप में काम करते हैं। डेटासेट की विविधता ने उन तरीकों के विकास को प्रोत्साहित किया है जो उपस्थिति और गति दोनों संकेतों को पकड़ते हैं, जिससे सटीकता और मजबूती में सुधार होता है। 2025 तक, अत्याधुनिक मॉडल सत्यापन सेट पर 90% से अधिक शीर्ष-1 सटीकता प्राप्त करते हैं, जो प्रारंभिक आधार रेखाओं से एक महत्वपूर्ण सुधार है।

सीमाएँ और आलोचनाएँ

अपनी सफलता के बावजूद, Kinetics-600 को YouTube-स्रोत डेटा में निहित संभावित पूर्वाग्रहों के लिए आलोचना की गई है, जैसे भौगोलिक और सांस्कृतिक झुकाव। क्रिया वर्ग मुख्य रूप से पश्चिमी-केंद्रित हैं, जो इस पर प्रशिक्षित मॉडलों के अन्य क्षेत्रों में सामान्यीकरण को सीमित कर सकते हैं। इसके अतिरिक्त, डेटासेट छोटे, एकल-क्रिया क्लिप पर केंद्रित है, जो दीर्घकालिक गतिविधियों या बहु-लेबल परिदृश्यों की जटिलता को पूरी तरह से कैप्चर नहीं करता है। शोधकर्ताओं ने इनमें से कुछ अंतरालों को संबोधित करने के लिए Something-Something और Moments in Time जैसे पूरक डेटासेट प्रस्तावित किए हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:video-dataset·action-recognition·computer-vision·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास