फ्रेचे वीडियो दूरी (FVD) एक मात्रात्मक मीट्रिक है जिसका उपयोग जनरेटिव मॉडल द्वारा निर्मित वीडियो की गुणवत्ता का मूल्यांकन करने के लिए किया जाता है, विशेष रूप से Generative AI के क्षेत्र में। यह वास्तविक वीडियो के एक सेट और जनरेट किए गए वीडियो के एक सेट की फीचर वितरण के बीच की दूरी की गणना करता है, जो स्थानिक गुणवत्ता (व्यक्तिगत फ्रेम) और लौकिक सुसंगतता (गति गतिशीलता) दोनों को पकड़ता है। FVD को 2019 में Google DeepMind के शोधकर्ताओं द्वारा फ्रेचे इंसेप्शन दूरी (FID) के विस्तार के रूप में पेश किया गया था, जो स्थिर छवियों के लिए व्यापक रूप से उपयोग किया जाता है। लौकिक जानकारी को शामिल करके, FVD वीडियो डेटा पर लागू होने पर FID की एक प्रमुख सीमा को संबोधित करता है, जिससे यह टेक्स्ट-टू-वीडियो निर्माण और वीडियो भविष्यवाणी जैसे कार्यों के लिए एक मानक बेंचमार्क बन जाता है।
यह मीट्रिक वीडियो क्लिप को पहले से प्रशिक्षित तंत्रिका नेटवर्क, आमतौर पर I3D (इन्फ्लेटेड 3D कॉन्वनेट) जैसे 3D कन्वोल्यूशनल नेटवर्क के माध्यम से फीड करके उच्च-स्तरीय विशेषताओं को निकालकर संचालित होता है। इन विशेषताओं को फिर बहुभिन्नरूपी गाऊसी वितरण के रूप में मॉडल किया जाता है, और वास्तविक और जनरेट किए गए वितरणों के बीच फ्रेचे दूरी की गणना की जाती है। कम FVD स्कोर इंगित करता है कि जनरेट किए गए वीडियो उपस्थिति और गति दोनों के संदर्भ में वास्तविक वीडियो के समान हैं। FVD को शैक्षणिक अनुसंधान और उद्योग मूल्यांकन में व्यापक रूप से अपनाया जाता है, जिसमें OpenAI, Anthropic, और अन्य प्रयोगशालाओं के मॉडल सार्वजनिक बेंचमार्क जैसे UCF-101 और Kinetics-400 पर FVD स्कोर की रिपोर्ट करते हैं।
गणितीय आधार
FVD फ्रेचे दूरी में निहित है, जो दो संभाव्यता वितरणों के बीच समानता का एक माप है। दो बहुभिन्नरूपी गाऊसी वितरणों के लिए जिनके माध्य μ₁, μ₂ और सहप्रसरण मैट्रिक्स Σ₁, Σ₂ हैं, फ्रेचे दूरी को इस प्रकार परिभाषित किया गया है:
FVD = ||μ₁ - μ₂||² + Tr(Σ₁ + Σ₂ - 2(Σ₁Σ₂)^(1/2))
व्यवहार में, विशेषताओं को एक वीडियो एनकोडर से निकाला जाता है, और माध्य और सहप्रसरण का अनुमान क्लिप के एक बड़े नमूने से लगाया जाता है। एनकोडर का चुनाव महत्वपूर्ण है; I3D, जो Kinetics-400 क्रिया पहचान डेटासेट पर पहले से प्रशिक्षित है, सबसे आम है, क्योंकि यह स्थानिक और लौकिक दोनों पैटर्न को पकड़ता है। पीक सिग्नल-टू-नॉइज़ अनुपात (PSNR) या संरचनात्मक समानता सूचकांक (SSIM) जैसे सरल मीट्रिक के विपरीत, FVD को संदर्भ वीडियो की फ्रेम-दर-फ्रेम आवश्यकता नहीं होती है, जिससे यह बिना शर्त निर्माण कार्यों के लिए उपयुक्त हो जाता है।
अन्य मीट्रिक के साथ तुलना
FVD की तुलना अक्सर FID से की जाती है, जो व्यक्तिगत फ्रेम का स्वतंत्र रूप से मूल्यांकन करता है और लौकिक गतिशीलता को अनदेखा करता है। जबकि FID को फ्रेम-स्तरीय स्कोर औसत करके वीडियो पर लागू किया जा सकता है, यह झिलमिलाहट, झटकेदारी, या अवास्तविक गति को दंडित करने में विफल रहता है। FVD समय के पार विशेषताओं के संयुक्त वितरण पर विचार करके इसे संबोधित करता है। हालांकि, FVD की सीमाएं हैं: यह फीचर निकालने वाले के चयन और नमूनों की संख्या के प्रति संवेदनशील है, और यह शब्दार्थ शुद्धता या टेक्स्ट-वीडियो संरेखण को पूरी तरह से पकड़ नहीं सकता है। अन्य मीट्रिक, जैसे टेक्स्ट-वीडियो समानता के लिए CLIP-आधारित स्कोर, कभी-कभी अधिक समग्र मूल्यांकन प्रदान करने के लिए FVD के साथ उपयोग किए जाते हैं। व्यवहार में, शोधकर्ता FVD और IS (इंसेप्शन स्कोर) या उपयोगकर्ता अध्ययन जैसे अतिरिक्त मीट्रिक दोनों की रिपोर्ट करते हैं।
वीडियो निर्माण में अनुप्रयोग
FVD वीडियो निर्माण मॉडल के मूल्यांकन में एक वास्तविक मानक बन गया है, जिसमें Google DeepMind, OpenAI, और Meta AI द्वारा विकसित मॉडल शामिल हैं। उदाहरण के लिए, टेक्स्ट-टू-वीडियो सिस्टम के विकास में, FVD का उपयोग UCF-101 (101 क्रिया वर्ग) और बड़े Kinetics-600 जैसे डेटासेट पर मॉडल वेरिएंट की तुलना करने के लिए किया जाता है। यह वीडियो भविष्यवाणी कार्यों में भी नियोजित होता है, जहां मॉडल पिछले फ्रेम से भविष्य के फ्रेम की भविष्यवाणी करते हैं। मीट्रिक ने लौकिक कलाकृतियों को कम करने में प्रगति को बढ़ावा दिया है, क्योंकि कम FVD स्कोर चिकनी और अधिक यथार्थवादी गति के साथ सहसंबंधित होते हैं। 2023 और 2024 में, Runway और Stability AI जैसे कई वाणिज्यिक और ओपन-सोर्स मॉडल ने FVD सुधारों को एक प्रमुख विक्रय बिंदु के रूप में रिपोर्ट किया, हालांकि मीट्रिक इसकी कम्प्यूटेशनल लागत और एनकोडर के प्रशिक्षण डेटा के प्रति संभावित पूर्वाग्रह के लिए आलोचना के बिना नहीं है।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, FVD में कई ज्ञात मुद्दे हैं। पहला, I3D एनकोडर को क्रिया पहचान पर प्रशिक्षित किया गया था, इसलिए यह सूक्ष्म-विस्तृत दृश्य विवरण या गैर-क्रिया सामग्री के प्रति कम संवेदनशील हो सकता है। दूसरा, FVD को स्थिर अनुमानों के लिए बड़ी संख्या में नमूनों (आमतौर पर हजारों) की आवश्यकता होती है, जो कम्प्यूटेशनल रूप से महंगा हो सकता है। तीसरा, यह टेक्स्ट प्रॉम्प्ट के साथ शब्दार्थ संरेखण को नहीं मापता है, इसलिए उच्च FVD गुणवत्ता वाला वीडियो अभी भी विषय से भटक सकता है। शोधकर्ताओं ने वेरिएंट प्रस्तावित किए हैं, जैसे कि एक अलग बैकबोन (जैसे, वीडियो ट्रांसफॉर्मर का उपयोग) के साथ फ्रेचे वीडियो दूरी, लेकिन कोई सर्वसम्मति उभरकर सामने नहीं आई है। इसके अतिरिक्त, FVD स्कोर विभिन्न डेटासेट या एनकोडर में सीधे तुलनीय नहीं हैं, जिससे प्रकाशित परिणामों में संभावित गलत व्याख्या हो सकती है।
भविष्य की दिशाएं
जैसे-जैसे वीडियो निर्माण आगे बढ़ता है, FVD को मानवीय धारणा या भाषा आधारण को शामिल करने वाले मीट्रिक द्वारा पूरक या प्रतिस्थापित किया जा सकता है। Large language model-आधारित मूल्यांकनकर्ताओं के उपयोग जैसे कुछ प्रयासों का उद्देश्य वीडियो को अधिक समग्र रूप से आंकना है। हालांकि, FVD स्वचालित मूल्यांकन के लिए एक मजबूत, पुनरुत्पादनीय आधार रेखा बना हुआ है। अनुसंधान समुदाय इसे परिष्कृत करना जारी रखता है, हाल के कार्यों में अनुकूली नमूना आकार और बेहतर फीचर निकालने वाले की खोज की जा रही है। अभी के लिए, FVD वीडियो संश्लेषण पर काम करने वाले Machine learning चिकित्सकों के टूलकिट में एक आवश्यक उपकरण है, साथ ही अन्य मूल्यांकन ढांचे भी।