अंग्रेज़ी से अनुवादित

फ्रेचेट इन्सेप्शन दूरी (FID) एक मापदंड है जो जनरेटिव मॉडल द्वारा उत्पन्न छवियों की गुणवत्ता का मूल्यांकन करता है, जो इन्सेप्शन नेटवर्क का उपयोग करके वास्तविक और उत्पन्न छवियों से निकाले गए विशेषताओं के सांख्यिकीय वितरणों की तुलना करके करता है।

फ़्रीशे इन्सेप्शन दूरी (FID) एक मीट्रिक है जिसका उपयोग किसी जनरेटिव मॉडल, जैसे कि जनरेटिव एडवरसैरियल नेटवर्क (GAN) या डिफ्यूज़न मॉडल द्वारा निर्मित छवियों की गुणवत्ता का आकलन करने के लिए किया जाता है। यह वास्तविक छवियों के एक सेट से निकाली गई विशेषताओं के वितरण और उत्पन्न छवियों के एक सेट की विशेषताओं के वितरण के बीच समानता को मापता है। FID को 2017 में पेश किया गया था और यह छवि निर्माण मॉडल, जिसमें StyleGAN जैसे उच्च-रिज़ॉल्यूशन मॉडल और विभिन्न डिफ्यूज़न मॉडल शामिल हैं, के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है।

FID पहले के इन्सेप्शन स्कोर (IS) से प्रेरित है, जो केवल उत्पन्न छवियों की विविधता और स्पष्टता का मूल्यांकन करता है। हालाँकि, FID उत्पन्न छवियाँ वास्तविक डेटा वितरण से कितनी अच्छी तरह मेल खाती हैं, इस पर भी विचार करके एक अधिक व्यापक तुलना प्रदान करता है। कम FID इंगित करता है कि उत्पन्न छवियाँ फीचर आँकड़ों के संदर्भ में वास्तविक छवियों के अधिक समान हैं, जबकि उच्च FID खराब गुणवत्ता या कम विविधता का सुझाव देता है।

अवलोकन

FID का उद्देश्य किसी संदर्भ डेटासेट, जैसे कि ImageNet या COCO-2014, के सापेक्ष किसी जनरेटिव मॉडल द्वारा निर्मित छवियों की विविधता और निष्ठा को मापना है। एक बड़े और विविध संदर्भ सेट का उपयोग करना महत्वपूर्ण है क्योंकि यह उन छवियों की पूरी श्रृंखला का प्रतिनिधित्व करता है जिन्हें मॉडल उत्पन्न करने का लक्ष्य रखता है। जनरेटिव मॉडल नई छवियाँ उत्पन्न करते हैं जो प्रशिक्षण सेट के साथ विशेषताएँ साझा करती हैं लेकिन किसी एक छवि के समान नहीं होती हैं, इसलिए पिक्सेल-दर-पिक्सेल तुलना (जैसे, L2 नॉर्म का उपयोग करके) अपर्याप्त है।

इसके बजाय, FID दोनों छवि सेटों को इस प्रकार मॉडल करता है जैसे कि वे दो बहुआयामी गाऊसी वितरणों से लिए गए हों। विशेषताएँ Inception v3 नेटवर्क की अंतिम पूलिंग परत से निकाली जाती हैं, जो वस्तुओं और दृश्यों के बारे में उच्च-स्तरीय अर्थ संबंधी जानकारी को पकड़ती है। इन दो गाऊसी वितरणों के बीच की दूरी की गणना फ़्रीशे दूरी का उपयोग करके की जाती है, जिसे 2-वासेरस्टीन दूरी के रूप में भी जाना जाता है।

गणितीय परिभाषा

\(\mathbb{R}^n\) पर परिमित माध्य और सहप्रसरण वाले दो संभाव्यता वितरणों \(\mu\) और \(\nu\) के लिए, फ़्रीशे दूरी को इस प्रकार परिभाषित किया गया है:

\[ d_F(\mu, \nu) = \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \|x - y\|^2 \, d\gamma(x, y) \right)^{1/2} \]

जहाँ \(\Gamma(\mu, \nu)\) सीमांत \(\mu\) और \(\nu\) वाले सभी युग्मन (संयुक्त वितरण) का समुच्चय है। जब दोनों वितरण गाऊसी होते हैं, तो यह सरल हो जाता है:

\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma')) = \|\mu - \mu'\|_2^2 + \operatorname{tr}\left( \Sigma + \Sigma' - 2 (\Sigma \Sigma')^{1/2} \right) \]

व्यवहार में, FID की गणना वास्तविक और उत्पन्न दोनों छवि सेटों के लिए Inception v3 की अंतिम पूलिंग परत से 2048-आयामी फीचर वैक्टर निकालकर की जाती है। इन विशेषताओं के नमूना माध्य और सहप्रसरण को फिर उपरोक्त सूत्र में डाला जाता है। एक आदर्श मॉडल में समान फीचर वितरण होगा, जिससे FID 0 प्राप्त होगा।

अनुप्रयोग और सीमाएँ

FID का व्यापक रूप से जनरेटिव मॉडल की तुलना करने, हाइपरपैरामीटर ट्यून करने और प्रशिक्षण प्रगति की निगरानी के लिए उपयोग किया जाता है। यह कई मामलों में छवि गुणवत्ता की मानवीय धारणा के साथ अच्छी तरह से मेल खाता है, लेकिन इसकी सीमाएँ हैं। मीट्रिक Inception नेटवर्क की विशेषताओं पर निर्भर करता है, जो दृश्य गुणवत्ता के सभी पहलुओं को पकड़ नहीं सकता है, और यह गाऊसी वितरण मानता है, जो जटिल वास्तविक दुनिया के डेटा के लिए सही नहीं हो सकता है। इसके अतिरिक्त, FID मूल्यांकन के लिए उपयोग किए जाने वाले नमूनों की संख्या के प्रति संवेदनशील हो सकता है, इसलिए स्थिरता के लिए इसकी गणना आमतौर पर एक बड़े सेट (जैसे, 10,000 या अधिक छवियों) पर की जाती है।

संबंधित मीट्रिक

FID जनरेटिव मॉडल के लिए वितरण-आधारित मीट्रिक के परिवार का हिस्सा है। इन्सेप्शन स्कोर उत्पन्न छवियों के लिए वर्ग भविष्यवाणियों की एन्ट्रापी पर केंद्रित है, जबकि कर्नेल इन्सेप्शन दूरी (KID) अधिकतम माध्य विचलन दृष्टिकोण का उपयोग करता है। हाल के कार्यों ने अर्थ संबंधी समानता के साथ बेहतर संरेखण के लिए Inception सुविधाओं के बजाय CLIP एम्बेडिंग का उपयोग करने का पता लगाया है। अपनी सीमाओं के बावजूद, FID जनरेटिव मॉडलिंग के क्षेत्र में एक मानक उपकरण बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·computer-vision·evaluation-metrics
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास