FaceNet एक Deep learning मॉडल है जो चेहरे की पहचान और सत्यापन के लिए उपयोग किया जाता है, जिसे Google के शोधकर्ताओं द्वारा विकसित किया गया है। यह चेहरे की छवियों को एक संक्षिप्त 128-आयामी यूक्लिडियन स्थान में मैप करता है, जहाँ एम्बेडिंग के बीच की वर्गित L2 दूरी सीधे चेहरे की समानता से मेल खाती है। यह मॉडल 2015 के एक पेपर "FaceNet: A Unified Embedding for Face Recognition and Clustering" में प्रस्तुत किया गया था, जिसे Florian Schroff, Dmitry Kalenichenko, और James Philbin द्वारा लिखा गया था।
पिछले चेहरे पहचान प्रणालियों के विपरीत, जो वर्गीकरण नेटवर्क से मध्यवर्ती बॉटलनेक परत प्रतिनिधित्व का उपयोग करती थीं, FaceNet को एक नए ट्रिपलेट लॉस फ़ंक्शन का उपयोग करके एंड-टू-एंड प्रशिक्षित किया गया था। यह लॉस फ़ंक्शन सुनिश्चित करता है कि एक ही व्यक्ति की एम्बेडिंग के बीच की दूरी, विभिन्न लोगों की एम्बेडिंग के बीच की दूरी से एक निर्दिष्ट मार्जिन द्वारा छोटी हो। इस दृष्टिकोण ने FaceNet को उस समय कई बेंचमार्क डेटासेट पर उच्च सटीकता प्राप्त करने में सक्षम बनाया, जिसमें Labeled Faces in the Wild (LFW) डेटासेट पर 99.63% और YouTube Faces DB पर 95.12% शामिल हैं।
Architecture and Training
FaceNet एक गहरे कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) आर्किटेक्चर का उपयोग करता है, जिसमें दो मुख्य वेरिएंट हैं: Zeiler-Fergus (ZF) नेटवर्क और Inception (GoogLeNet) नेटवर्क। Inception-आधारित मॉडल, जो बाद के संस्करणों में Batch Normalization और residual connections का उपयोग करता है, ने सर्वोत्तम प्रदर्शन प्राप्त किया। नेटवर्क 96x96 या 224x224 पिक्सेल के संरेखित चेहरे के क्रॉप्स को संसाधित करता है, जिससे 128-आयामी एम्बेडिंग वेक्टर उत्पन्न होता है।
प्रशिक्षण स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) का उपयोग करके किया गया था, कुछ कॉन्फ़िगरेशन में Adam ऑप्टिमाइज़र के साथ। ट्रिपलेट लॉस को एक ट्रिपलेट माइनिंग रणनीति का उपयोग करके अनुकूलित किया गया था, जो प्रत्येक मिनी-बैच के भीतर कठिन सकारात्मक और कठिन नकारात्मक उदाहरणों का चयन करती है। यह माइनिंग तकनीक अभिसरण के लिए महत्वपूर्ण थी, क्योंकि यादृच्छिक ट्रिपलेट चयन अक्सर धीमी प्रशिक्षण की ओर ले जाता था। मॉडल को लगभग 200 मिलियन चेहरे की छवियों के एक बड़े डेटासेट पर प्रशिक्षित किया गया था, जो लगभग 8 मिलियन अद्वितीय पहचानों से लिया गया था, जो वेब छवियों से स्रोतित था।
Triplet Loss
FaceNet की मुख्य नवीनता ट्रिपलेट लॉस फ़ंक्शन है। प्रत्येक प्रशिक्षण नमूने के लिए, एक ट्रिपलेट में एक एंकर छवि, एक सकारात्मक छवि (एंकर के समान पहचान), और एक नकारात्मक छवि (विभिन्न पहचान) शामिल होती है। लॉस एंकर और सकारात्मक के बीच एम्बेडिंग दूरी को एंकर और नकारात्मक के बीच की दूरी से कम से कम एक मार्जिन α (आमतौर पर 0.2 पर सेट) द्वारा छोटा होने के लिए प्रोत्साहित करता है। लॉस को L = max(0, d(a,p) - d(a,n) + α) के रूप में परिभाषित किया गया है, जहाँ d यूक्लिडियन दूरी को दर्शाता है।
प्रशिक्षण को कुशल बनाने के लिए, लेखकों ने दो ट्रिपलेट चयन रणनीतियाँ प्रस्तावित कीं: बैच-हार्ड माइनिंग (एक बैच के भीतर सबसे कठिन सकारात्मक और सबसे कठिन नकारात्मक का चयन) और बैच-ऑल माइनिंग (एक बैच में सभी मान्य ट्रिपलेट्स का उपयोग)। बैच-हार्ड रणनीति सबसे प्रभावी साबित हुई, जिससे तेज़ अभिसरण और बेहतर अंतिम सटीकता प्राप्त हुई।
Applications and Impact
FaceNet की एम्बेडिंग को चेहरे के सत्यापन, चेहरे की पहचान, और चेहरे के क्लस्टरिंग कार्यों के लिए व्यापक रूप से अपनाया गया है। मॉडल की संक्षिप्त, विभेदक एम्बेडिंग उत्पन्न करने की क्षमता ने निकटतम पड़ोसी एल्गोरिदम का उपयोग करके कुशल समानता खोज को सक्षम किया। इसने मीट्रिक-लर्निंग में बाद के कार्यों को प्रभावित किया और विभिन्न वाणिज्यिक प्रणालियों में एकीकृत किया गया, जिसमें Google Photos की चेहरे समूहीकरण सुविधा शामिल है।
यह दृष्टिकोण चेहरे की पहचान से परे अनुसंधान को भी प्रेरित करता है, जिसमें व्यक्ति पुनः-पहचान, छवि पुनर्प्राप्ति, और एक-शॉट लर्निंग शामिल हैं। ट्रिपलेट लॉस अवधारणा को बाद में भाषा मॉडल और अनुशंसा प्रणालियों जैसे अन्य डोमेन के लिए अनुकूलित किया गया।
Limitations and Subsequent Work
FaceNet को सावधानीपूर्वक संरेखित चेहरे के क्रॉप्स की आवश्यकता थी, और इसका प्रदर्शन मुद्रा, प्रकाश, और अवरोधन भिन्नताओं के साथ घट गया। मॉडल को गोपनीयता और पूर्वाग्रह के संबंध में आलोचना का भी सामना करना पड़ा, क्योंकि चेहरे की पहचान प्रणालियाँ जनसांख्यिकीय असमानताएँ प्रदर्शित कर सकती हैं। बाद के मॉडल, जैसे ArcFace और CosFace, ने यूक्लिडियन मार्जिन के बजाय कोणीय मार्जिन लॉस का उपयोग करके FaceNet में सुधार किया, जिससे चुनौतीपूर्ण बेंचमार्क पर बेहतर प्रदर्शन प्राप्त हुआ।
इन प्रगतियों के बावजूद, FaceNet चेहरे की पहचान के क्षेत्र में एक मौलिक संदर्भ बिंदु बना हुआ है, और इसका ट्रिपलेट लॉस सूत्रीकरण अभी भी कई Machine learning पाठ्यक्रमों में पढ़ाया जाता है। मूल पेपर को 10,000 से अधिक बार उद्धृत किया गया है, जो कंप्यूटर विज़न अनुसंधान पर इसके स्थायी प्रभाव को दर्शाता है।