इन्सेप्शन स्कोर (IS) एक एल्गोरिदम है जिसका उपयोग जनरेटिव इमेज मॉडल जैसे कि जनरेटिव एडवर्सेरियल नेटवर्क (GAN) द्वारा बनाई गई छवियों की गुणवत्ता का आकलन करने के लिए किया जाता है। इसे 2016 में टिम सैलिमैन्स और उनके सहयोगियों द्वारा GAN को प्रशिक्षित करने की बेहतर तकनीकों पर एक पेपर में पेश किया गया था। स्कोर की गणना जनरेटिव मॉडल द्वारा उत्पन्न छवियों के एक नमूने (आमतौर पर लगभग 30,000) पर लागू एक अलग, पूर्व-प्रशिक्षित इन्सेप्शन v3 इमेज क्लासिफिकेशन मॉडल के आउटपुट के आधार पर की जाती है। इन्सेप्शन स्कोर अधिकतम तब होता है जब निम्नलिखित स्थितियाँ सत्य होती हैं: जनरेट की गई छवियों के लिए इन्सेप्शन v3 मॉडल द्वारा भविष्यवाणी किए गए लेबल के वितरण की एन्ट्रॉपी न्यूनतम होती है (वर्गीकरण मॉडल प्रत्येक छवि के लिए आत्मविश्वास से एक ही लेबल की भविष्यवाणी करता है, जो छवियों के 'तीक्ष्ण' या 'विशिष्ट' होने के अनुरूप है), और वर्गीकरण मॉडल की भविष्यवाणियाँ सभी संभावित लेबलों में समान रूप से वितरित होती हैं (आउटपुट के 'विविध' होने के अनुरूप)। इसे कुछ हद तक संबंधित फ्रेचेट इन्सेप्शन दूरी (FID) द्वारा प्रतिस्थापित कर दिया गया है। जबकि इन्सेप्शन स्कोर केवल जनरेट की गई छवियों के वितरण का मूल्यांकन करता है, FID जनरेट की गई छवियों के वितरण की तुलना वास्तविक छवियों ('ग्राउंड ट्रुथ') के एक सेट के वितरण से करता है।
इन्सेप्शन स्कोर Generative AI के क्षेत्र में एक व्यापक रूप से उपयोग किया जाने वाला मीट्रिक है, विशेष रूप से GAN और अन्य जनरेटिव मॉडल के प्रदर्शन का मूल्यांकन करने के लिए। यह एक एकल अदिश मान प्रदान करता है जिसका उद्देश्य जनरेट की गई छवियों की गुणवत्ता और विविधता दोनों को पकड़ना है, जिससे विभिन्न मॉडलों या प्रशिक्षण रनों की तुलना करना सुविधाजनक हो जाता है। हालाँकि, इसकी ज्ञात सीमाएँ हैं, जिनमें पूर्व-प्रशिक्षित क्लासिफायर की पसंद के प्रति संवेदनशीलता और वास्तविक छवियों से तुलना की कमी शामिल है, जिसे FID संबोधित करता है।
परिभाषा
मान लीजिए कि दो स्थान हैं, छवियों का स्थान \(\Omega_X\) और लेबल का स्थान \(\Omega_Y\)। लेबल का स्थान परिमित है। मान लीजिए \(p_{gen}\) \(\Omega_X\) पर एक प्रायिकता वितरण है जिसका हम मूल्यांकन करना चाहते हैं। मान लीजिए एक विभेदक \(p_{dis}:\Omega_X \to M(\Omega_Y)\) प्रकार का एक फलन है, जहाँ \(M(\Omega_Y)\) \(\Omega_Y\) पर सभी प्रायिकता वितरणों का समुच्चय है। किसी भी छवि \(x\) और किसी भी लेबल \(y\) के लिए, मान लीजिए \(p_{dis}(y|x)\) वह प्रायिकता है कि विभेदक के अनुसार छवि \(x\) का लेबल \(y\) है। इसे आमतौर पर ImageNet पर प्रशिक्षित इन्सेप्शन-v3 नेटवर्क के रूप में लागू किया जाता है।
\(p_{dis}\) के सापेक्ष \(p_{gen}\) का इन्सेप्शन स्कोर इस प्रकार परिभाषित किया गया है:
\[ IS(p_{gen},p_{dis}) := \exp\left(\mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\int p_{dis}(\cdot|x)p_{gen}(x)dx\right)\right]\right) \]
समतुल्य पुनर्लेखन में शामिल हैं:
\[ \ln IS(p_{gen},p_{dis}) := \mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\right)\right] \]
व्यवहार में, \(p_{gen}\) पर अपेक्षा का अनुमान जनरेट की गई छवियों का एक परिमित नमूना लेकर लगाया जाता है, और लेबल के सीमांत वितरण का अनुमान उस नमूने से लगाया जाता है।
अंतर्ज्ञान और व्याख्या
इन्सेप्शन स्कोर को जनरेट की गई छवियों के दो गुणों को पुरस्कृत करने के लिए डिज़ाइन किया गया है: स्पष्टता और विविधता। स्पष्टता को क्लासिफायर के आत्मविश्वास से मापा जाता है: यदि क्लासिफायर प्रत्येक छवि के लिए एक ही लेबल को उच्च प्रायिकता प्रदान करता है, तो सशर्त लेबल वितरण \(p_{dis}(\cdot|x)\) में कम एन्ट्रॉपी होती है, जो KL विचलन को बढ़ाती है। विविधता को सीमांत लेबल वितरण की एकरूपता से मापा जाता है: यदि जनरेट की गई छवियाँ कई वर्गों में फैली हुई हैं, तो सीमांत वितरण एकसमान के करीब होता है, जो KL विचलन को भी बढ़ाता है। स्कोर को समझने में आसान बनाने के लिए घातांकीय फलन लागू किया जाता है, जिसमें उच्च मान बेहतर गुणवत्ता का संकेत देता है।
स्कोर का नाम इन्सेप्शन v3 मॉडल के नाम पर रखा गया है, जो Google द्वारा इमेज क्लासिफिकेशन के लिए विकसित एक गहरा कन्वोल्यूशनल न्यूरल नेटवर्क है। मॉडल का उपयोग एक निश्चित फीचर एक्सट्रैक्टर के रूप में किया जाता है, और इसकी भविष्यवाणियाँ छवि सामग्री की मानवीय धारणा के लिए एक प्रॉक्सी के रूप में काम करती हैं।
जनरेटिव मॉडल मूल्यांकन में उपयोग
इन्सेप्शन स्कोर GAN और अन्य जनरेटिव मॉडल के मूल्यांकन में एक मानक मीट्रिक बन गया, विशेष रूप से 2016 से 2018 की अवधि में। इसका उपयोग कई प्रभावशाली पेपरों में किया गया था, जिनमें प्रोग्रेसिव GAN, StyleGAN और अन्य आर्किटेक्चर शामिल हैं। शोधकर्ता पिछले काम पर सुधार प्रदर्शित करने के लिए CIFAR-10 और ImageNet जैसे बेंचमार्क डेटासेट पर IS मानों की रिपोर्ट करते थे।
हालाँकि, स्कोर की कई कारणों से आलोचना की गई है। पहला, यह जनरेट की गई छवियों की तुलना वास्तविक छवियों से नहीं करता है, इसलिए एक मॉडल जो विविध लेकिन अवास्तविक छवियों का उत्पादन करता है, वह उच्च स्कोर प्राप्त कर सकता है। दूसरा, स्कोर उपयोग किए गए विशिष्ट पूर्व-प्रशिक्षित क्लासिफायर के प्रति संवेदनशील है; इन्सेप्शन v3 के विभिन्न संस्करण या विभिन्न प्रशिक्षण प्रक्रियाएँ अलग-अलग स्कोर दे सकती हैं। तीसरा, स्कोर को उन मॉडलों द्वारा धोखा दिया जा सकता है जो कुछ ऐसी कलाकृतियों वाली छवियाँ उत्पन्न करते हैं जिन्हें क्लासिफायर वास्तविक वस्तुओं के लिए गलती करता है।
फ्रेचेट इन्सेप्शन दूरी से संबंध
फ्रेचेट इन्सेप्शन दूरी (FID), जिसे 2017 में मार्टिन ह्यूसेल और उनके सहयोगियों द्वारा पेश किया गया था, इन्सेप्शन स्कोर की कुछ सीमाओं को संबोधित करने के लिए विकसित किया गया था। FID, इन्सेप्शन v3 नेटवर्क की अंतिम परत को फीचर एक्सट्रैक्टर के रूप में उपयोग करते हुए, जनरेट की गई और वास्तविक छवियों के फीचर वितरण के बीच फ्रेचेट दूरी की गणना करता है। IS के विपरीत, FID जनरेट किए गए वितरण की तुलना वास्तविक छवियों के संदर्भ वितरण से करता है, जो गुणवत्ता और विविधता का अधिक व्यापक माप प्रदान करता है।
व्यवहार में, FID ने कई शोध सेटिंग्स में पसंदीदा मीट्रिक के रूप में IS को काफी हद तक बदल दिया है, क्योंकि यह मानव निर्णय के साथ बेहतर सहसंबंध रखता है और धोखा देने की संभावना कम है। फिर भी, IS उपयोग में बना हुआ है, विशेष रूप से उन संदर्भों में जहाँ संदर्भ डेटासेट उपलब्ध नहीं है या जब एक त्वरित, सरल मीट्रिक वांछित है।
सीमाएँ और आलोचनाएँ
कई अध्ययनों ने इन्सेप्शन स्कोर की सीमाओं पर प्रकाश डाला है। उदाहरण के लिए, स्कोर मोड कोलैप्स को दंडित नहीं करता है, जो GAN की एक सामान्य विफलता मोड है जहाँ मॉडल केवल कुछ अलग छवियाँ उत्पन्न करता है। यदि जनरेट की गई छवियाँ तीक्ष्ण हैं लेकिन विविध नहीं हैं, तो सीमांत लेबल वितरण कुछ हद तक एकसमान हो सकता है यदि संकुचित मोड कई वर्गों में फैलते हैं, लेकिन व्यवहार में मोड कोलैप्स अक्सर विविधता को कम करता है और इस प्रकार स्कोर को कम करता है। हालाँकि, स्कोर उस मॉडल के बीच अंतर नहीं कर सकता है जो सभी वर्गों का एक समान वितरण उत्पन्न करता है और एक जो पूर्ण तीक्ष्णता के साथ प्रति वर्ग एक छवि उत्पन्न करता है।
एक और आलोचना यह है कि इन्सेप्शन स्कोर क्लासिफायर की पसंद के प्रति अपरिवर्तनीय नहीं है। विभिन्न डेटासेट पर प्रशिक्षित विभिन्न क्लासिफायर समान जनरेट की गई छवियों के लिए अलग-अलग स्कोर उत्पन्न कर सकते हैं। यह विभिन्न पेपरों में स्कोर की तुलना करना मुश्किल बनाता है जब तक कि ठीक उसी क्लासिफायर का उपयोग न किया जाए।
कार्यान्वयन विवरण
इन्सेप्शन स्कोर की गणना करने के लिए, आमतौर पर TensorFlow या PyTorch जैसी लाइब्रेरी में उपलब्ध पूर्व-प्रशिक्षित इन्सेप्शन v3 मॉडल का उपयोग किया जाता है। मॉडल को जनरेट की गई छवियों के नमूने पर लागू किया जाता है, और सॉफ्टमैक्स आउटपुट एकत्र किए जाते हैं। फिर सशर्त लेबल वितरण का उपयोग सीमांत वितरण के साथ KL विचलन की गणना करने के लिए किया जाता है, और माध्य का घातांक लिया जाता है। नमूना आकार अक्सर 30,000 छवियों पर सेट किया जाता है, जैसा कि मूल पेपर में अनुशंसित है, विचरण को कम करने के लिए।
व्यवहार में, स्कोर की गणना मेमोरी समस्याओं से बचने के लिए बैचों में की जाती है, और सीमांत वितरण का अनुमान पूरे नमूने से लगाया जाता है। गणना अपेक्षाकृत तेज़ है, जिससे यह प्रशिक्षण प्रगति की निगरानी के लिए उपयुक्त है।
अनुप्रयोग और विस्तार
इन्सेप्शन स्कोर को GAN से परे अन्य जनरेटिव मॉडल, जैसे कि वैरिएशनल ऑटोएन्कोडर और डिफ्यूजन मॉडल पर लागू किया गया है, हालाँकि FID के उदय के साथ इसका उपयोग कम हो गया है। इसे विभिन्न तरीकों से भी बढ़ाया गया है, जैसे कि कुछ कार्यों में उपयोग किया जाने वाला संशोधित इन्सेप्शन स्कोर (mIS), जो वर्गों की संख्या के लिए समायोजित करता है या एक अलग क्लासिफायर का उपयोग करता है।
Machine learning और Deep learning के व्यापक संदर्भ में, इन्सेप्शन स्कोर जनरेटिव मॉडल की गुणवत्ता को मापने के शुरुआती प्रयास का प्रतिनिधित्व करता है, जो एक खुली चुनौती बनी हुई है। जनरेटिव मॉडल के लिए सटीकता और रिकॉल जैसे अन्य मीट्रिक, अधिक सूक्ष्म जानकारी प्रदान करने के लिए प्रस्तावित किए गए हैं।
ऐतिहासिक संदर्भ
इन्सेप्शन स्कोर को 2016 में प्रकाशित टिम सैलिमैन्स, इयान गुडफेलो, वोज्शिएक ज़रेम्बा, विकी चेउंग, एलेक रैडफोर्ड और शी चेन द्वारा 'इम्प्रूव्ड टेक्नीक्स फॉर ट्रेनिंग GAN' पेपर में पेश किया गया था। पेपर ने फीचर मैचिंग और मिनीबैच भेदभाव जैसी अन्य तकनीकों को भी पेश किया। स्कोर ने अपनी सादगी और उस समय वैकल्पिक मीट्रिक की कमी के कारण तेजी से लोकप्रियता हासिल की।
तब से, जनरेटिव मॉडलिंग का क्षेत्र काफी विकसित हुआ है, जिसमें अधिक परिष्कृत मॉडल और मूल्यांकन विधियों का विकास हुआ है। इन्सेप्शन स्कोर एक ऐतिहासिक मील का पत्थर बना हुआ है और जनरेटिव मॉडल पर कई पाठ्यपुस्तकों और ट्यूटोरियल में अभी भी संदर्भित है।