WaveGlow एक प्रवाह-आधारित जनरेटिव मॉडल है जो वाक् संश्लेषण के लिए है, जिसे NVIDIA के शोधकर्ताओं द्वारा विकसित किया गया था और अक्टूबर 2018 में पेश किया गया था। यह वाक् के मेल-स्पेक्ट्रोग्राम प्रस्तुतियों को व्युत्क्रमणीय परिवर्तनों के अनुक्रम का उपयोग करके कच्चे ऑडियो तरंगरूपों में परिवर्तित करता है, जिससे उच्च-गुणवत्ता वाले ध्वनि आउटपुट की समानांतर पीढ़ी संभव होती है। WaveNet जैसे पहले के ऑटोरेग्रेसिव मॉडल के विपरीत, WaveGlow नमूनों को अनुक्रमिक रूप से उत्पन्न नहीं करता है, जिससे संश्लेषण समय काफी कम हो जाता है जबकि तुलनीय निष्ठा बनाए रखी जाती है।
मॉडल को NVIDIA में ऑडियो और डीप लर्निंग टीमों के बीच सहयोग के रूप में डिज़ाइन किया गया था, जिसमें झिन वांग, सर्कन आरिक और अन्य सहित शोधकर्ताओं का प्रमुख योगदान था। इसकी वास्तुकला ग्लो (Glow) के तत्वों को जोड़ती है, जो छवियों के लिए एक प्रवाह-आधारित जनरेटिव मॉडल है, और WaveNet के विस्तारित कन्वोल्यूशन, जिसके परिणामस्वरूप एक एकल तंत्रिका नेटवर्क होता है जो युग्मित ऑडियो और स्पेक्ट्रोग्राम डेटा पर अंत-से-अंत प्रशिक्षित होता है। मूल कार्यान्वयन BSD-3-clause लाइसेंस के तहत जारी किया गया था, जिससे यह शैक्षणिक और वाणिज्यिक उपयोग के लिए व्यापक रूप से सुलभ हो गया।
वास्तुकला और प्रशिक्षण
WaveGlow 12 कपलिंग परतों के स्टैक का उपयोग करता है, जिनमें से प्रत्येक में व्युत्क्रमणीय 1x1 कन्वोल्यूशन और एफ़िन परिवर्तनों की श्रृंखला होती है। नेटवर्क एक मेल स्पेक्ट्रोग्राम और यादृच्छिक गॉसियन शोर लेता है, फिर इन परतों के माध्यम से शोर को बदलकर एक तरंगरूप उत्पन्न करता है। परिवर्तनों को व्युत्क्रमणीय होने के लिए डिज़ाइन किया गया है, जिससे ऑडियो नमूनों पर सीधे अधिकतम-संभावना प्रशिक्षण संभव होता है।
प्रशिक्षण असंपीड़ित ऑडियो क्लिपों के डेटासेट का उपयोग करता है, जिन्हें 22.05 kHz पर डाउनसैंपल किया जाता है, स्पेक्ट्रोग्राम 1024-बिंदु शॉर्ट-टाइम फूरियर ट्रांसफॉर्म का उपयोग करके गणना किए जाते हैं। हानि फ़ंक्शन आउटपुट की लॉग-संभावना को वर्णक्रमीय कंट्रास्ट बाधा के साथ जोड़ता है, जो कलाकृतियों को कम करता है। 24 अनुक्रमों का एक बैच आकार, प्रत्येक 16,000 नमूने लंबा, आमतौर पर उपयोग किया जाता है। मॉडल, लगभग 87.9 मिलियन पैरामीटरों के साथ, एक एकल NVIDIA V100 GPU पर 50 मिलीसेकंड में 1.5 सेकंड का ऑडियो संश्लेषित कर सकता है, जो वास्तविक समय से 150x की गति है।
नेटवर्क की व्युत्क्रमणीय प्रकृति समान पैरामीटरों को संश्लेषण और विश्लेषण दोनों के लिए उपयोग करने की अनुमति देती है, हालांकि प्राथमिक अनुप्रयोग टेक्स्ट-टू-स्पीच है। जनरेटिव एआई जैसे GAN मॉडल के विपरीत, प्रवाह-आधारित दृष्टिकोण डेटा संभावना की सटीक गणना की गारंटी देता है, जिससे प्रशिक्षण स्थिर होता है।
पूर्व कार्य से संबंध
WaveGlow ने WaveNet और Deep Voice जैसे तंत्रिका-नेटवर्क ऑडियो मॉडलों में सुधार किया, जो प्रति सेकंड उप-नमूनों की दरों पर तरंगरूप उत्पन्न करते थे। WaveNet, गूगल डीपमाइंड का एक पहला मॉडल, उच्च-निष्ठा वाक् उत्पन्न करता था लेकिन वास्तविक समय अनुमान के लिए एक दूसरे मॉडल की आवश्यकता होती थी। WaveGlow ने सभी नमूनों को समानांतर में उत्पन्न करके इस बाधा को हटा दिया।
NVIDIA से स्वतंत्र रूप से, माइक्रोसॉफ्ट ने 2018 का फ्लो प्रस्तुत किया जो समान विचार का उपयोग करता है लेकिन अनुकूलन को एक अलग दृष्टिकोण से संबोधित करता है। WaveGlow की प्रमुख भिन्नता परिवर्तनशीलता और व्युत्क्रमणीयता में सुधार थी, जिससे सरल और अधिक स्थिर प्रशिक्षण हुआ।
अनुप्रयोग और तैनाती
WaveGlow को NeMo, NVIDIA के संवादात्मक AI टूलकिट में एकीकृत किया गया था, और टैक्ट्रोन-आधारित टेक्स्ट-टू-स्पीच सिस्टम में मेल स्पेक्ट्रोग्राम को ऑडियो में बदलने के लिए उपयोग किया गया था। मॉडल की गति ने समर्पित हार्डवेयर त्वरण के बिना इंटरैक्टिव अनुप्रयोगों, जैसे वर्चुअल असिस्टेंट और ऑडियोबुक निर्माण को सक्षम बनाया। 2020 तक, यह तंत्रिका वोकोडर के लिए एक मानक आधार रेखा थी, जिसमें HiFi-GAN जैसे बाद के दृष्टिकोणों से कई तुलनाएं थीं।
क्लाउड सेटिंग्स में, एडब्ल्यूएस ट्रेनियम और अन्य त्वरक ने बाद में ऐसे मॉडल के लिए अनुमान को अनुकूलित किया। हालांकि, मॉडल की मेमोरी फुटप्रिंट (लगभग 24 MB) मामूली बनी हुई है, जिससे एम्बेडेड डिवाइसों पर तैनाती संभव होती है।
विरासत और प्रभाव
WaveGlow की रिलीज़ ने ऑडियो में प्रवाह-आधारित जनरेटिव मॉडल पर तुलनीय शोध की सुविधा प्रदान की, जिसमें पैरेलल वेवनेट और ग्रेविटी जैसे समानांतर वोकोडर शामिल हैं। इसका डिज़ाइन सिद्धांत, व्युत्क्रमणीयता का एकीकरण, बाद की वास्तुकलाओं जैसे स्क्वीज़वेव और सैनिटी-आधारित मॉडल द्वारा अपनाया गया था। जबकि मेलगैन और वेवगैन जैसे बाद के जीपीयू-वोकोडर ने कम कम्प्यूटेशनल लागत के साथ तुलनीय गुणवत्ता हासिल की, WaveGlow ऑटोरेग्रेसिव बाधा को तोड़ने में एक ऐतिहासिक मील का पत्थर बना हुआ है।
2025 तक, मूल रिपॉजिटरी को एक शोध संग्रह में संग्रहीत किया गया है, जिसे अधिक कुशल मॉडल द्वारा प्रतिस्थापित किया गया है। हालांकि, इसका योगदान अभी भी नए काम का मार्गदर्शन करता है।
तकनीकी विवरण
इनपुट मेल स्पेक्ट्रोग्राम S और शून्य-माध्य गॉसियन शोर z के लिए, WaveGlow आउटपुट x = f(z, S) की गणना करता है, जहां f व्युत्क्रमणीय कार्यों की एक संरचना है। मॉडल आयामों (n_samples, 1) का एक तरंगरूप आउटपुट करता है। प्रत्येक चरण में, नेटवर्क एक मानदंड (लाभ स्केलिंग), एक व्युत्क्रमणीय कन्वोल्यूशन, और एक एफ़िन कपलिंग परत लागू करता है, जो इनपुट को दो भागों में विभाजित करता है और एक को तंत्रिका नेटवर्क (गैर-व्युत्क्रमणीय) के साथ अपडेट करता है जबकि दूसरे को अपरिवर्तित छोड़ देता है। अंतिम परिणाम 22.05 kHz पर सैंपल किया जाता है।
प्रशिक्षण 256 क्लिपों का एक बैच, प्रत्येक 1.6 सेकंड लंबा, 200 युगों के लिए उपयोग करता है। सीखने की दर 5e-4 पर शुरू होती है और हर 40 युगों में आधी कर दी जाती है। मूल वर्णन के अनुसार, वज़न सामान्यीकरण और परत सामान्यीकरण लागू किए जाते हैं। लक्षित स्पेक्ट्रोग्राम ऑडियो से 50% ओवरलैप के साथ हैनिंग विंडो का उपयोग करके गणना किए जाते हैं।
आलोचना और सुधार का दायरा
इसकी गति के बावजूद, WaveGlow को कुछ आलोचनाओं का सामना करना पड़ा जैसे कि दक्षता के मामले में: इसके आउटपुट गैर-अंग्रेजी भाषाओं या शोर वाले इनपुट के लिए कलाकृतियां प्रदर्शित कर सकते हैं। तुलनात्मक रूप से, GAN-आधारित वोकोडर अक्सर कम पैरामीटरों के साथ अवधारणात्मक रूप से साफ़ ऑडियो उत्पन्न करते हैं। व्युत्क्रमणीयता की आवश्यकता परिवर्ती नमूना दरों वाले डेटासेट पर लागू नहीं होती है। बाद के शोध ने दिखाया कि एक बड़े ट्रांसफॉर्मर-आधारित एनकोडर का उपयोग निष्ठा में सुधार कर सकता है, लेकिन यह मूल का हिस्सा नहीं था।
फिर भी, प्रशिक्षण में आसानी, मजबूती और पारदर्शी संभावना-आधारित समझ के लिए WaveGlow का व्यापक रूप से अपनाया जाना वर्तमान डीप-लर्निंग परिदृश्य में तंत्रिका वोकोडर के विकास में इसकी भूमिका को सुदृढ़ करता है।