MS-Celeb-1M एक बड़े पैमाने का चेहरा पहचान डेटासेट है जिसे माइक्रोसॉफ्ट द्वारा 2016 में पेश किया गया था। इसमें 100,000 मशहूर हस्तियों की लगभग 10 मिलियन छवियां शामिल हैं, जिनमें प्रत्येक पहचान के लिए लगभग 100 छवियां हैं। डेटासेट को चेहरा पहचान अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया था, विशेष रूप से बड़े पैमाने पर पहचान और सत्यापन की चुनौतियों को संबोधित करने के लिए। इसे चेहरा पहचान एल्गोरिदम का मूल्यांकन करने के लिए एक बेंचमार्क के रूप में व्यापक रूप से उपयोग किया गया है, विशेष रूप से गहन शिक्षण के संदर्भ में।
डेटासेट को खोज इंजनों का उपयोग करके वेब से छवियों को स्वचालित रूप से एकत्र करके बनाया गया था, फिर चेहरों को निकालने के लिए चेहरा पहचान और संरेखण तकनीकों को लागू किया गया। पहचान मशहूर हस्तियों से मेल खाती हैं, जो विभिन्न प्रकार के पोज़, अभिव्यक्तियाँ, रोशनी और अवरोध प्रदान करती हैं। MS-Celeb-1M में प्रशिक्षण और परीक्षण दोनों विभाजन शामिल हैं, जिसमें परीक्षण सेट में 1,000 पहचान शामिल हैं जो प्रशिक्षण सेट में मौजूद नहीं हैं, जिससे सामान्यीकरण का मूल्यांकन संभव होता है।
निर्माण और एनोटेशन
MS-Celeb-1M के निर्माण में कई चरण शामिल थे। पहले, विकिपीडिया और मनोरंजन डेटाबेस सहित विभिन्न स्रोतों से 100,000 मशहूर हस्तियों के नामों की एक सूची संकलित की गई थी। प्रत्येक नाम के लिए, बिंग और गूगल जैसे खोज इंजनों से छवियां प्राप्त की गईं। एक वाणिज्यिक चेहरा डिटेक्टर का उपयोग करके चेहरा पहचान की गई, और पहचाने गए चेहरों को एक विहित मुद्रा में संरेखित किया गया। फिर छवियों को मैन्युअल रूप से सत्यापित किया गया ताकि यह सुनिश्चित हो सके कि वे सही पहचान से मेल खाते हैं, और डुप्लिकेट और निम्न-गुणवत्ता वाली छवियों को हटाने के लिए एक अंतिम सफाई चरण के साथ।
एनोटेशन मुख्य रूप से स्वचालित था, लेकिन मानव एनोटेटरों का उपयोग डेटा के एक उपसमुच्चय के लिए पहचान लेबल को सत्यापित करने के लिए किया गया था। डेटासेट प्रत्येक चेहरे के लिए बाउंडिंग बॉक्स और चेहरे के लैंडमार्क प्रदान करता है, जिससे चेहरा संरेखण और क्रॉपिंग जैसे कार्यों में सुविधा होती है। अंतिम डेटासेट में 10 मिलियन छवियां हैं, जिनमें प्रत्येक पहचान के लिए औसतन 100 छवियां हैं, हालांकि वितरण लंबी-पूंछ वाला है जिसमें कुछ पहचानों में दूसरों की तुलना में कई अधिक छवियां हैं।
चेहरा पहचान अनुसंधान पर प्रभाव
MS-Celeb-1M का चेहरा पहचान के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा है। इसने एक बड़े पैमाने पर प्रशिक्षण संसाधन प्रदान किया जिसने बेहतर सटीकता के साथ गहन शिक्षण मॉडल के विकास को सक्षम किया। इसके जारी होने से पहले, चेहरा पहचान डेटासेट अपेक्षाकृत छोटे थे, जिससे तंत्रिका नेटवर्क की क्षमता सीमित थी। MS-Celeb-1M के पैमाने ने शोधकर्ताओं को लाखों मापदंडों के साथ गहरे कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) को प्रशिक्षित करने की अनुमति दी, जिससे LFW (लेबल्ड फेसेस इन द वाइल्ड) जैसे बेंचमार्क पर सटीकता में सफलताएं मिलीं।
डेटासेट ने बड़े पैमाने पर चेहरा पहचान की चुनौती भी पेश की, जहां गैलरी का आकार एक मिलियन पहचानों तक हो सकता है। इसने कुशल अनुक्रमण और पुनर्प्राप्ति विधियों के साथ-साथ ओपन-सेट पहचान के लिए डिज़ाइन किए गए नुकसान कार्यों पर अनुसंधान को प्रेरित किया। कई अत्याधुनिक चेहरा पहचान प्रणालियाँ, जिनमें ResNet आर्किटेक्चर और मार्जिन-आधारित नुकसान जैसे ArcFace पर आधारित हैं, को MS-Celeb-1M पर प्रशिक्षित या मूल्यांकन किया गया था।
चुनौतियाँ और विवाद
अपनी सफलता के बावजूद, MS-Celeb-1M को चुनौतियों और विवादों का सामना करना पड़ा है। एक प्रमुख मुद्दा पूर्वाग्रहों की उपस्थिति है, क्योंकि डेटासेट मुख्य रूप से पश्चिमी देशों की मशहूर हस्तियों से बना है, जिससे अन्य जातियों और लिंगों का कम प्रतिनिधित्व होता है। इसके परिणामस्वरूप चेहरा पहचान प्रणालियाँ कम प्रतिनिधित्व वाले समूहों पर खराब प्रदर्शन कर सकती हैं, जिससे निष्पक्षता और पूर्वाग्रह के बारे में नैतिक चिंताएँ उठती हैं।
एक और विवाद में गोपनीयता और सहमति शामिल है। छवियों को व्यक्तियों से स्पष्ट सहमति के बिना वेब से स्क्रैप किया गया था, जिनमें से कई सार्वजनिक हस्तियाँ हैं लेकिन फिर भी उनकी छवि पर अधिकार हैं। 2019 में, माइक्रोसॉफ्ट ने गोपनीयता और दुरुपयोग की संभावना के बारे में चिंताओं का हवाला देते हुए डेटासेट को सार्वजनिक पहुंच से हटा दिया। इससे AI अनुसंधान में बड़े पैमाने पर वेब-स्क्रैप्ड डेटासेट के नैतिक उपयोग के बारे में चर्चाएँ हुईं।
विरासत और विकल्प
इसके हटाने के बावजूद, MS-Celeb-1M ने एक स्थायी विरासत छोड़ी है। कई व्युत्पन्न डेटासेट, जैसे MS1MV2 और MS1MV3, मूल डेटा को साफ करके और पुनः-एनोटेट करके बनाए गए थे, और ये अनुसंधान में उपयोग किए जाते रहते हैं। डेटासेट ने अन्य बड़े पैमाने के चेहरा डेटासेट, जैसे VGGFace2 और WebFace260M, के निर्माण को भी प्रेरित किया, जिनका उद्देश्य MS-Celeb-1M की कुछ सीमाओं, जिसमें विविधता और सहमति शामिल है, को संबोधित करना है।
मशीन लर्निंग के व्यापक संदर्भ में, MS-Celeb-1M गहरे मॉडलों को प्रशिक्षित करने के लिए बड़े पैमाने पर डेटासेट की प्रवृत्ति का उदाहरण है। यह डेटासेट निर्माण में नैतिक विचारों के महत्व को भी उजागर करता है, एक विषय जो जनरेटिव AI और गहन शिक्षण समुदायों के लिए केंद्रीय बन गया है। शोधकर्ता अब अक्सर उचित सहमति और संतुलित प्रतिनिधित्व वाले डेटासेट की तलाश करते हैं, और अधिक नैतिक चेहरा पहचान बेंचमार्क बनाने के लिए कई पहल शुरू की गई हैं।