फ़्रेचेट इन्सेप्शन दूरी (FID) एक मीट्रिक है जिसका उपयोग जनरेटिव मॉडल, जैसे कि जनरेटिव एडवर्सेरियल नेटवर्क (GAN) या डिफ्यूज़न मॉडल, द्वारा निर्मित छवियों की गुणवत्ता का आकलन करने के लिए किया जाता है। 2017 में पेश किया गया, FID 2024 तक सिंथेटिक छवि जनरेटर के मूल्यांकन के लिए मानक मीट्रिक बन गया है। यह गहरे तंत्रिका नेटवर्क से निकाले गए उनके फीचर आँकड़ों के बीच की दूरी को मापकर उत्पन्न छवियों के वितरण की तुलना वास्तविक छवियों के एक सेट, जिसे ग्राउंड ट्रुथ सेट के रूप में जाना जाता है, के वितरण से करता है। कम FID स्कोर इंगित करता है कि उत्पन्न छवियाँ गुणवत्ता और विविधता में वास्तविक संदर्भ छवियों के अधिक समान हैं, जिसमें 0 का स्कोर एक आदर्श मिलान का प्रतिनिधित्व करता है।
FID मीट्रिक पहले के इन्सेप्शन स्कोर (IS) से प्रेरित था, लेकिन यह एक प्रमुख सीमा को संबोधित करता है: IS केवल उत्पन्न छवियों के वितरण का मूल्यांकन करता है बिना वास्तविक डेटा से तुलना किए। इसके विपरीत, FID उत्पन्न और वास्तविक वितरणों के बीच समानता को मापता है, जो एक अधिक व्यापक मूल्यांकन प्रदान करता है। इसे StyleGAN1, StyleGAN2, और विभिन्न डिफ्यूज़न मॉडल जैसे मॉडलों को बेंचमार्क करने के लिए व्यापक रूप से अपनाया गया है, और यह जनरेटिव मॉडल के मूल्यांकन में एक आधारशिला बना हुआ है।
अवलोकन
FID स्कोर का उद्देश्य एक संदर्भ डेटासेट के सापेक्ष जनरेटिव मॉडल द्वारा निर्मित छवियों की विविधता और निष्ठा को मापना है। संदर्भ डेटासेट ImageNet या COCO-2014 हो सकता है, और इसे उन छवियों की पूर्ण विविधता का प्रतिनिधित्व करना चाहिए जिन्हें मॉडल उत्पन्न करने का लक्ष्य रखता है। चूँकि जनरेटिव मॉडल नई छवियाँ उत्पन्न करते हैं जो किसी भी प्रशिक्षण उदाहरण से भिन्न होती हैं, गुणवत्ता का आकलन पिक्सेल-वार तुलना द्वारा नहीं किया जा सकता, जैसा कि L2 नॉर्म के साथ किया जाता है।
इसके बजाय, FID दो छवि सेटों को मॉडल करता है जैसे कि वे दो बहुआयामी गाऊसी वितरणों से खींचे गए हों, जिन्हें वास्तविक छवियों के लिए \(\mathcal{N}(\mu, \Sigma)\) और उत्पन्न छवियों के लिए \(\mathcal{N}(\mu', \Sigma')\) के रूप में दर्शाया गया है। इन वितरणों के बीच की दूरी की गणना 2-वासेरस्टीन दूरी के रूप में की जाती है, जो माध्य और सहप्रसरण दोनों अंतरों को ध्यान में रखती है। यह दृष्टिकोण न केवल यह दर्शाता है कि व्यक्तिगत छवियाँ यथार्थवादी दिखती हैं या नहीं, बल्कि यह भी कि उत्पन्न सेट वास्तविक सेट के समान परिवर्तन की सीमा को कवर करता है या नहीं।
पिक्सेल स्पेस में छवियों की सीधे तुलना करने के बजाय, FID उच्च-स्तरीय फीचर निकालने के लिए एक कन्वोल्यूशनल तंत्रिका नेटवर्क, विशेष रूप से एक Inception v3 आर्किटेक्चर का उपयोग करता है। सबसे गहरी परत, अंतिम पूलिंग परत से एक 2048-आयामी सक्रियण वेक्टर, प्रत्येक छवि का प्रतिनिधित्व करने के लिए उपयोग की जाती है। ये फीचर वास्तविक दुनिया की वस्तुओं, जैसे कुत्तों की नस्लें या हवाई जहाज, के अनुरूप होते हैं, जिससे तुलना कच्चे पिक्सेल की तुलना में अधिक अर्थपूर्ण रूप से सार्थक होती है।
सभी छवियों को Inception नेटवर्क के माध्यम से संसाधित करने के बाद, सक्रियण वैक्टर के माध्य और सहप्रसरण की गणना वास्तविक और उत्पन्न दोनों सेटों के लिए की जाती है। FID दूरी तब सूत्र द्वारा दी जाती है:
\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma'))^2 = \lVert \mu - \mu' \rVert_2^2 + \operatorname{tr}\left(\Sigma + \Sigma' - 2(\Sigma \Sigma')^{1/2}\right) \]
उच्च दूरी एक खराब जनरेटिव मॉडल का संकेत देती है, जबकि 0 का स्कोर एक आदर्श मॉडल को इंगित करता है जो वास्तविक वितरण को बिल्कुल दोहराता है।
औपचारिक परिभाषा
\(\mathbb{R}^n\) पर सीमित माध्य और प्रसरण वाले किन्हीं दो संभाव्यता वितरणों \(\mu\) और \(\nu\) के लिए, फ़्रेचेट दूरी को इस प्रकार परिभाषित किया गया है:
\[ d_F(\mu, \nu) := \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \lVert x - y \rVert^2 \, d\gamma(x, y) \right)^{1/2} \]
जहाँ \(\Gamma(\mu, \nu)\) सभी युग्मन (संयुक्त वितरण) का सेट है जिसमें सीमांत \(\mu\) और \(\nu\) हैं। यह 2-वासेरस्टीन दूरी है, जिसका एक बंद-रूप समाधान होता है जब दोनों वितरण गाऊसी होते हैं। FID के संदर्भ में, वितरणों को फीचर वैक्टर के अनुभवजन्य माध्य और सहप्रसरण का उपयोग करके गाऊसी के रूप में अनुमानित किया जाता है, जिससे गणना संभव हो जाती है।
कुल्बैक-लेइब्लर विचलन जैसे सरल मीट्रिक के बजाय फ़्रेचेट दूरी का उपयोग FID को माध्य बदलाव और सहप्रसरण बेमेल दोनों को पकड़ने की अनुमति देता है, जो वितरणीय समानता का अधिक सूक्ष्म माप प्रदान करता है।
इन्सेप्शन स्कोर के साथ तुलना
FID मीट्रिक इन्सेप्शन स्कोर (IS) को प्रतिस्थापित नहीं करता है; बल्कि, यह इसे पूरक करता है। सबसे अच्छा (सबसे कम) FID स्कोर प्राप्त करने वाले वर्गीकरणकर्ताओं में अधिक नमूना विविधता होती है, जबकि सबसे अच्छा (उच्चतम) IS स्कोर प्राप्त करने वाले वर्गीकरणकर्ताओं में व्यक्तिगत छवियों के भीतर बेहतर गुणवत्ता होती है। यह अंतर इसलिए उत्पन्न होता है क्योंकि IS केवल उत्पन्न छवियों का मूल्यांकन करता है, उन मॉडलों को पुरस्कृत करता है जो आत्मविश्वासपूर्ण, विविध वर्ग भविष्यवाणियाँ उत्पन्न करते हैं, लेकिन यह उन मॉडलों को दंडित नहीं करता है जो लक्ष्य वितरण के बाहर छवियाँ उत्पन्न करते हैं। FID, वास्तविक संदर्भ सेट से तुलना करके, निष्ठा की कमी और विविधता की कमी दोनों को दंडित करता है।
व्यवहार में, शोधकर्ता अक्सर मॉडल प्रदर्शन की अधिक पूर्ण तस्वीर प्रदान करने के लिए FID और IS दोनों की रिपोर्ट करते हैं। हालाँकि, FID हाल के कई अध्ययनों में पसंदीदा मीट्रिक बन गया है क्योंकि इसका छवि गुणवत्ता की मानवीय धारणा के साथ मजबूत संबंध है।
जनरेटिव मॉडल मूल्यांकन में उपयोग
FID का उपयोग हाल के कई मॉडलों की गुणवत्ता को मापने के लिए किया गया है, जिसमें उच्च-रिज़ॉल्यूशन StyleGAN1 और StyleGAN2 नेटवर्क, और डिफ्यूज़न मॉडल शामिल हैं। उदाहरण के लिए, StyleGAN2 ने FFHQ और LSUN जैसे डेटासेट पर अत्याधुनिक FID स्कोर प्राप्त किए, जो विविध और यथार्थवादी छवियाँ उत्पन्न करने की इसकी क्षमता को प्रदर्शित करता है। DDPM और स्कोर-आधारित मॉडल जैसे डिफ्यूज़न मॉडल का भी FID का उपयोग करके मूल्यांकन किया गया है, जो अक्सर GAN की तुलना में प्रतिस्पर्धी या बेहतर स्कोर प्राप्त करते हैं।
यह मीट्रिक विशेष रूप से एक ही डेटासेट पर प्रशिक्षित मॉडलों की तुलना करने के लिए मूल्यवान है, क्योंकि यह प्रगति को मापने का एक मानकीकृत तरीका प्रदान करता है। हालाँकि, FID संदर्भ डेटासेट की पसंद और उपयोग किए गए नमूनों की संख्या के प्रति संवेदनशील है; बहुत कम नमूनों का उपयोग करने से अस्थिर अनुमान हो सकते हैं। शोधकर्ता आमतौर पर विश्वसनीय FID स्कोर की गणना करने के लिए हजारों छवियों का उपयोग करते हैं।
सीमाएँ और आलोचनाएँ
इसके व्यापक उपयोग के बावजूद, FID की सीमाएँ हैं। यह मानता है कि फीचर वितरण गाऊसी हैं, जो व्यवहार में सत्य नहीं हो सकता है, जिससे संभावित अशुद्धियाँ हो सकती हैं। इसके अतिरिक्त, FID की गणना एक निश्चित Inception नेटवर्क का उपयोग करके की जाती है, जो छवि गुणवत्ता के सभी पहलुओं को पकड़ नहीं सकता है, विशेष रूप से प्राकृतिक छवियों के बाहर के डोमेन (जैसे, चिकित्सा या उपग्रह इमेजरी) के लिए। यह मीट्रिक नमूनों की संख्या से भी पक्षपाती हो सकता है, और यह प्रति-छवि गुणवत्ता आकलन प्रदान नहीं करता है।
हाल के कार्यों ने विकल्प प्रस्तावित किए हैं, जैसे कि Inception फीचर के बजाय CLIP एम्बेडिंग का उपयोग करना, ताकि अर्थपूर्ण समानता के साथ बेहतर संरेखण हो सके। ये दृष्टिकोण FID की कुछ कमियों को संबोधित करने का लक्ष्य रखते हैं, लेकिन FID क्षेत्र में वास्तविक मानक बना हुआ है।
कार्यान्वयन और गणना
FID की गणना में कई चरण शामिल हैं। पहले, वास्तविक छवियों का एक संदर्भ डेटासेट चुना जाता है, और सभी छवियों को 2048-आयामी फीचर वैक्टर निकालने के लिए एक पूर्व-प्रशिक्षित Inception v3 नेटवर्क के माध्यम से पारित किया जाता है। उत्पन्न छवियों के लिए भी ऐसा ही किया जाता है। फीचर वैक्टर के माध्य और सहप्रसरण की गणना तब दोनों सेटों के लिए की जाती है। अंत में, फ़्रेचेट दूरी की गणना उपरोक्त सूत्र का उपयोग करके की जाती है।
व्यवहार में, सहप्रसरण मैट्रिक्स को अक्सर संख्यात्मक स्थिरता सुनिश्चित करने के लिए नियमित किया जाता है, विशेष रूप से जब नमूनों की संख्या फीचर आयाम से छोटी होती है। PyTorch और TensorFlow जैसी लाइब्रेरी में ओपन-सोर्स कार्यान्वयन उपलब्ध हैं, जिससे शोधकर्ताओं और चिकित्सकों के लिए FID की गणना करना आसान हो जाता है।
भविष्य की दिशाएँ
जैसे-जैसे जनरेटिव मॉडल विकसित होते रहते हैं, मूल्यांकन मीट्रिक को भी अनुकूलित करना चाहिए। जबकि FID क्षेत्र को आगे बढ़ाने में सहायक रहा है, अधिक मजबूत और व्याख्या योग्य मीट्रिक में चल रहे शोध हैं। जैसा कि उल्लेख किया गया है, CLIP एम्बेडिंग का उपयोग ऐसी ही एक दिशा है। इसके अतिरिक्त, अन्य पहलुओं, जैसे निष्पक्षता या मजबूती, का मूल्यांकन करने वाले मीट्रिक की खोज की जा रही है। फिर भी, FID जनरेटिव मॉडल के आकलन के लिए मशीन-लर्निंग टूलबॉक्स में एक प्रमुख उपकरण बना हुआ है।
आगे पढ़ने के लिए, इन्सेप्शन-स्कोर, जनरेटिव-एडवर्सेरियल-नेटवर्क, डिफ्यूज़न-मॉडल, और स्टाइलगैन जैसी संबंधित अवधारणाएँ देखें। FID का विकास गहन-शिक्षण और कंप्यूटर-विज़न में प्रगति से भी जुड़ा हुआ है।