IMDB-WIKI चेहरे की आयु और लिंग अनुमान के लिए एक बड़े पैमाने का डेटासेट है, जिसमें इंटरनेट मूवी डेटाबेस (IMDB) और विकिपीडिया से एकत्रित 523,051 चेहरे की छवियाँ शामिल हैं। प्रत्येक छवि पर एक लिंग लेबल और एक आयु मान अंकित होता है, जो संबंधित मेटाडेटा, जैसे फिल्म रिलीज़ तिथियाँ या जीवनी संबंधी जानकारी से प्राप्त होता है। यह डेटासेट 2015 में ज्यूरिख के ETH में शोधकर्ताओं रासमस रोथे, राडु टिमोफ्ते और लुक वान गूल द्वारा पेश किया गया था, और यह जनसांख्यिकीय विशेषता पहचान में कंप्यूटर विज़न मॉडल के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है।
यह डेटासेट अपने आकार और वास्तविक-दुनिया की विविधता के लिए उल्लेखनीय है, क्योंकि छवियाँ सेलिब्रिटी तस्वीरों और जीवनी संबंधी चित्रों से ली गई हैं। हालाँकि, आयु लेबल शोर-युक्त हैं क्योंकि उनका अनुमान छवि कैप्चर तिथि और विषय की जन्म तिथि के बीच के अंतर से लगाया जाता है, जो पुरानी तस्वीरों या जब कैप्चर तिथि अज्ञात हो तो गलत हो सकता है। इसके बावजूद, IMDB-WIKI ने आयु अनुमान के लिए गहन शिक्षण दृष्टिकोणों को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है, और अक्सर स्वच्छ डेटासेट पर फाइन-ट्यूनिंग से पहले प्री-ट्रेनिंग कॉर्पस के रूप में कार्य करता है।
निर्माण और एनोटेशन
IMDB-WIKI डेटासेट IMDB और विकिपीडिया से छवियों को स्वचालित रूप से क्रॉल करके बनाया गया था। IMDB के लिए, छवियाँ अभिनेताओं और अभिनेत्रियों से जुड़ी थीं, और आयु की गणना फिल्म रिलीज़ वर्ष और अभिनेता के जन्म वर्ष के बीच के अंतर के रूप में की गई थी। विकिपीडिया के लिए, छवियाँ जीवनी संबंधी पृष्ठों से जुड़ी थीं, और आयु पृष्ठ के अंतिम संशोधन तिथि या विषय की जन्म तिथि से प्राप्त की गई थी। लिंग विषय के ज्ञात लिंग के आधार पर निर्धारित किया गया था। अंतिम डेटासेट में IMDB से 460,723 और विकिपीडिया से 62,328 छवियाँ शामिल हैं, जो कुल 523,051 छवियाँ बनाती हैं। चेहरे का पता लगाने के लिए एक चेहरा डिटेक्टर का उपयोग किया गया था, और प्रत्येक छवि को चेहरे के क्षेत्र में क्रॉप किया गया था, हालाँकि कुछ क्रॉप में त्रुटियाँ या कई चेहरे हो सकते हैं।
गहन शिक्षण में उपयोग
IMDB-WIKI का व्यापक रूप से Deep learning समुदाय में आयु और लिंग वर्गीकरण कार्यों पर न्यूरल नेटवर्क के प्रशिक्षण और मूल्यांकन के लिए उपयोग किया जाता है। कई अत्याधुनिक मॉडल, जिनमें अवशिष्ट नेटवर्क और अन्य कन्वोल्यूशनल आर्किटेक्चर पर आधारित मॉडल शामिल हैं, IMDB-WIKI पर प्री-ट्रेन किए गए हैं। डेटासेट का बड़ा पैमाना मॉडल को चेहरे की उपस्थिति के लिए मजबूत विशेषताएँ सीखने में मदद करता है, लेकिन इसके लेबल शोर के लिए अक्सर मजबूत लॉस फ़ंक्शन या डेटा सफाई रणनीतियों की आवश्यकता होती है। शोधकर्ताओं ने आयु अनुमान त्रुटियों, डोमेन शिफ्ट और जनसांख्यिकीय समूहों में निष्पक्षता के प्रभावों का अध्ययन करने के लिए भी IMDB-WIKI का उपयोग किया है।
बेंचमार्क और मूल्यांकन
IMDB-WIKI आयु अनुमान के लिए एक बेंचमार्क के रूप में आमतौर पर उपयोग किया जाता है, जिसमें माध्य निरपेक्ष त्रुटि (MAE) और संचयी स्कोर जैसे मेट्रिक्स शामिल हैं। डेटासेट को प्रशिक्षण और परीक्षण सेटों में विभाजित किया गया है, हालाँकि आधिकारिक विभाजन अध्ययनों में हमेशा सुसंगत नहीं होता है। कई पेपर Adience या UTKFace जैसे स्वच्छ डेटासेट पर फाइन-ट्यूनिंग के बाद IMDB-WIKI परीक्षण सेट पर परिणाम रिपोर्ट करते हैं। शोर-युक्त लेबल इसे एक चुनौतीपूर्ण बेंचमार्क बनाते हैं, और जो मॉडल IMDB-WIKI पर कम MAE प्राप्त करते हैं वे अक्सर अन्य आयु अनुमान कार्यों में अच्छी तरह से सामान्यीकृत होते हैं। IMDB-WIKI पर लिंग वर्गीकरण सटीकता भी रिपोर्ट की जाती है, जो आधुनिक मॉडलों के लिए आमतौर पर 95% से अधिक होती है।
सीमाएँ और नैतिक विचार
डेटासेट की कई सीमाएँ हैं। आयु लेबल शोर-युक्त हैं और सेलिब्रिटी की ओर पक्षपाती हैं, जिनके पास पेशेवर तस्वीरें और मेकअप हो सकते हैं जो सामान्य आबादी से भिन्न होते हैं। लिंग लेबल द्विआधारी हैं और गैर-द्विआधारी पहचानों को ध्यान में नहीं रखते हैं। इसके अतिरिक्त, डेटासेट व्यक्तियों से स्पष्ट सहमति के बिना एकत्र किया गया था, जिससे गोपनीयता संबंधी चिंताएँ उठती हैं। IMDB-WIKI का उपयोग करने वाले शोधकर्ताओं को इन मुद्दों के बारे में पता होना चाहिए और इस पर प्रशिक्षित मॉडलों को तैनात करने के नैतिक निहितार्थों पर विचार करना चाहिए, विशेष रूप से निगरानी या जनसांख्यिकीय प्रोफाइलिंग जैसे संवेदनशील अनुप्रयोगों में। डेटासेट शोध उद्देश्यों के लिए उपलब्ध है, लेकिन वाणिज्यिक उत्पादों में इसका उपयोग अतिरिक्त जाँच की मांग कर सकता है।
संबंधित डेटासेट और प्रभाव
IMDB-WIKI ने कई अनुवर्ती डेटासेटों को प्रेरित किया है, जैसे कि IMDB-Clean और Wiki-Clean संस्करण जो शोर-युक्त लेबलों को फ़िल्टर करते हैं, और इसकी तुलना अक्सर Adience डेटासेट से की जाती है, जिसमें अधिक सटीक आयु समूह होते हैं लेकिन कम छवियाँ होती हैं। डेटासेट का उपयोग आयु अनुमान सटीकता में सुधार के लिए Data Augmentation और Curriculum Learning पर अध्ययनों में भी किया गया है। इसका प्रभाव कंप्यूटर विज़न से परे है, क्योंकि इसका उपयोग चेहरे के विश्लेषण में निष्पक्षता और पूर्वाग्रह पर Artificial intelligence अनुसंधान में किया गया है। अपनी ज्ञात सीमाओं के बावजूद, यह डेटासेट जनसांख्यिकीय विशेषता पहचान पर काम करने वाले शोधकर्ताओं के लिए एक प्रमुख संसाधन बना हुआ है।
यह भी देखें
- मशीन लर्निंग
- कंप्यूटर विज़न
- facial-recognition
संदर्भ
- Rothe, R., Timofte, R., & Van Gool, L. (2015). DEX: Deep EXpectation of apparent age from a single image. In Proceedings of the IEEE International Conference on Computer Vision Workshops.
- Rothe, R., Timofte, R., & Van Gool, L. (2016). Deep expectation of real and apparent age from a single image without facial landmarks. International Journal of Computer Vision.