VGGFace2 ऑक्सफोर्ड विश्वविद्यालय के विज़ुअल ज्योमेट्री ग्रुप द्वारा विकसित एक बड़े पैमाने का चेहरा पहचान डेटासेट है। इसमें 9,000 से अधिक पहचानों की 3.31 मिलियन से अधिक छवियाँ शामिल हैं, जो इसे चेहरा पहचान कार्यों में गहरे तंत्रिका नेटवर्क को प्रशिक्षित करने और मूल्यांकन करने के लिए सबसे व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में से एक बनाती है। यह डेटासेट 2017 में पेश किया गया था और तब से यह कंप्यूटर विज़न और Deep learning के क्षेत्र में एक मानक संसाधन बन गया है।
यह डेटासेट LFW और MegaFace जैसे पहले के चेहरा डेटासेट की सीमाओं को दूर करने के लिए बनाया गया था, जिसमें मुद्रा, आयु, रोशनी और जातीयता में भिन्नता वाली बड़ी और अधिक विविध छवियाँ प्रदान की गईं। VGGFace2 की छवियाँ Google Image Search से ली गई हैं और केवल मशहूर हस्तियों के चेहरों तक सीमित नहीं हैं, जिससे पहचानों की विविधता बढ़ती है। प्रत्येक पहचान में औसतन 362 छवियाँ हैं, जिसमें प्रति व्यक्ति न्यूनतम 80 और अधिकतम 843 छवियाँ हैं।
डेटा संग्रह और एनोटेशन
संग्रह प्रक्रिया में स्वचालित वेब स्क्रैपिंग और फिर सटीकता सुनिश्चित करने के लिए मैन्युअल फ़िल्टरिंग शामिल थी। डेटासेट में प्रशिक्षण और परीक्षण दोनों विभाजन शामिल हैं, जिसमें परीक्षण सेट में 500 पहचानें शामिल हैं जो प्रशिक्षण सेट में मौजूद नहीं हैं। एनोटेशन में पहचान लेबल, चेहरों के लिए बाउंडिंग बॉक्स और प्रमुख चेहरे के लैंडमार्क शामिल हैं। डेटासेट को केवल शोध-उपयोग लाइसेंस के तहत जारी किया गया था, और इसके उपयोग के लिए उन शर्तों से सहमत होना आवश्यक है जो व्यावसायिक पुनर्वितरण को प्रतिबंधित करती हैं।
आर्किटेक्चर और प्रशिक्षण उपयोग
VGGFace2 मुख्य रूप से चेहरा पहचान के लिए कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) को प्रशिक्षित करने के लिए उपयोग किया जाता है। बेसलाइन मॉडल, जिसे अक्सर VGGFace2 नेटवर्क कहा जाता है, एक गहरा CNN है जिसमें ResNet-50 या ResNet-50 जैसी आर्किटेक्चर है, जिसे बड़े मार्जिन के साथ सॉफ्टमैक्स लॉस का उपयोग करके प्रशिक्षित किया जाता है। प्रशिक्षण प्रक्रिया में आमतौर पर यादृच्छिक क्रॉपिंग, क्षैतिज फ़्लिपिंग और रंग जिटरिंग जैसी डेटा वृद्धि तकनीकों का उपयोग किया जाता है ताकि सामान्यीकरण में सुधार हो सके। यह डेटासेट MegaFace चैलेंज और IJB-C प्रोटोकॉल जैसे बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करने में सहायक रहा है।
चेहरा पहचान अनुसंधान पर प्रभाव
VGGFace2 ने एक बड़े पैमाने का, विविध डेटासेट प्रदान करके चेहरा पहचान के क्षेत्र को काफी उन्नत किया है जो विभिन्न जनसांख्यिकी में उच्च सटीकता वाले मॉडल के प्रशिक्षण को सक्षम बनाता है। इसका उपयोग कई शोध पत्रों और व्यावसायिक प्रणालियों में किया गया है, जिसमें Google DeepMind और Samsung Research जैसी कंपनियाँ शामिल हैं। डेटासेट के डिज़ाइन ने बाद के डेटासेट, जैसे MS-Celeb-1M और WebFace260M को प्रभावित किया है, जिनका उद्देश्य पहचानों और छवियों की संख्या को और बढ़ाना है।
सीमाएँ और नैतिक विचार
अपनी उपयोगिता के बावजूद, VGGFace2 की सीमाएँ हैं। छवियाँ व्यक्तियों की स्पष्ट सहमति के बिना वेब से एकत्र की जाती हैं, जिससे गोपनीयता संबंधी चिंताएँ उत्पन्न होती हैं। डेटासेट में पूर्वाग्रह भी प्रदर्शित होते हैं, क्योंकि पहचानों का वितरण वैश्विक जनसांख्यिकी को पूरी तरह से प्रतिनिधित्व नहीं कर सकता है, जिससे विभिन्न जातीय समूहों में प्रदर्शन असमानताएँ हो सकती हैं। शोधकर्ताओं ने अधिक नैतिक रूप से प्राप्त डेटासेट और पूर्वाग्रह को कम करने के लिए चेहरा पहचान प्रणालियों के सावधानीपूर्वक मूल्यांकन का आह्वान किया है।
संबंधित कार्य और विस्तार
विज़ुअल ज्योमेट्री ग्रुप ने VGGFace भी जारी किया है, जो एक पहले का और छोटा डेटासेट है, और दोनों के लिए पूर्व-प्रशिक्षित मॉडल प्रदान किए हैं। VGGFace2 के विस्तार में VGGFace2-HQ डेटासेट शामिल है, जिसमें छवियों के उच्च-रिज़ॉल्यूशन संस्करण शामिल हैं। डेटासेट का उपयोग अक्सर Residual Network आर्किटेक्चर और Batch Normalization तकनीकों जैसे अन्य संसाधनों के साथ किया जाता है ताकि प्रशिक्षण स्थिरता और प्रदर्शन में सुधार हो सके।
यह भी देखें
- चेहरा पहचान
- Convolutional neural network
- विज़ुअल ज्योमेट्री ग्रुप
- MegaFace
- IJB-C