WaveNet एक गहरा तंत्रिका नेटवर्क है जो कच्चे ऑडियो उत्पन्न करने के लिए उपयोग किया जाता है। इसे लंदन स्थित एआई फर्म DeepMind के शोधकर्ताओं द्वारा बनाया गया था। सितंबर 2016 में एक पेपर में उल्लिखित यह तकनीक, वास्तविक भाषण की रिकॉर्डिंग के साथ प्रशिक्षित एक तंत्रिका नेटवर्क विधि का उपयोग करके तरंगरूपों को सीधे मॉडल करके अपेक्षाकृत यथार्थवादी मानव-समान आवाज़ें उत्पन्न करने में सक्षम है। अमेरिकी अंग्रेजी और मंदारिन के परीक्षणों ने कथित तौर पर दिखाया कि यह प्रणाली Google के सर्वश्रेष्ठ मौजूदा टेक्स्ट-टू-स्पीच (TTS) सिस्टम से बेहतर प्रदर्शन करती है, हालांकि 2016 तक इसका टेक्स्ट-टू-स्पीच संश्लेषण अभी भी वास्तविक मानव भाषण की तुलना में कम सम्मोहक था। WaveNet की कच्चे तरंगरूप उत्पन्न करने की क्षमता का मतलब है कि यह किसी भी प्रकार के ऑडियो को मॉडल कर सकता है, जिसमें संगीत भी शामिल है।
इतिहास
पाठ से भाषण उत्पन्न करना एक तेजी से सामान्य कार्य है, जो Apple के Siri, Microsoft के Cortana, Amazon Alexa और Google Assistant जैसे सॉफ्टवेयर की लोकप्रियता के कारण है। ऐसी अधिकांश प्रणालियाँ एक तकनीक के भिन्न रूप का उपयोग करती हैं जिसमें पहचानने योग्य ध्वनियाँ और शब्द बनाने के लिए ध्वनि खंडों को एक साथ जोड़ा जाता है। इनमें से सबसे आम को कंकैटेनेटिव TTS कहा जाता है। इसमें एक एकल वक्ता से रिकॉर्ड किए गए भाषण खंडों की एक बड़ी लाइब्रेरी होती है, जिन्हें फिर पूर्ण शब्द और ध्वनियाँ उत्पन्न करने के लिए जोड़ा जाता है। परिणाम अप्राकृतिक लगता है, जिसमें अजीब लय और स्वर होता है। रिकॉर्ड की गई लाइब्रेरी पर निर्भरता आवाज़ को संशोधित या बदलना भी कठिन बनाती है।
एक अन्य तकनीक, जिसे पैरामीट्रिक TTS के रूप में जाना जाता है, ध्वनियों को फिर से बनाने के लिए गणितीय मॉडल का उपयोग करती है जिन्हें फिर शब्दों और वाक्यों में इकट्ठा किया जाता है। ध्वनियाँ उत्पन्न करने के लिए आवश्यक जानकारी मॉडल के मापदंडों में संग्रहीत होती है। आउटपुट भाषण की विशेषताओं को मॉडल के इनपुट के माध्यम से नियंत्रित किया जाता है, जबकि भाषण आमतौर पर वोकोडर नामक एक आवाज़ संश्लेषक का उपयोग करके बनाया जाता है। यह भी अप्राकृतिक ध्वनि वाला ऑडियो उत्पन्न कर सकता है।
डिज़ाइन और चल रहे शोध
पृष्ठभूमि
WaveNet एक प्रकार का फीडफॉरवर्ड तंत्रिका नेटवर्क है जिसे गहरे कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) के रूप में जाना जाता है। WaveNet में, CNN एक कच्चा संकेत इनपुट के रूप में लेता है और एक समय में एक नमूना आउटपुट संश्लेषित करता है। यह एक सिग्नल मान के सॉफ्टमैक्स (यानी श्रेणीबद्ध) वितरण से नमूना लेकर ऐसा करता है, जिसे μ-लॉ कंपैंडिंग परिवर्तन का उपयोग करके एन्कोड किया जाता है और 256 संभावित मानों में परिमाणित किया जाता है। यह दृष्टिकोण Deep learning सिद्धांतों में निहित है, जहां नेटवर्क इनपुट डेटा के पदानुक्रमित प्रतिनिधित्व सीखता है।
प्रारंभिक अवधारणा और परिणाम
मूल सितंबर 2016 DeepMind शोध पेपर WaveNet: A Generative Model for Raw Audio के अनुसार, नेटवर्क को अंग्रेजी और मंदारिन में भाषण के वास्तविक तरंगरूप खिलाए गए थे। जैसे ही ये नेटवर्क से गुजरते हैं, यह यह वर्णन करने के लिए नियमों का एक सेट सीखता है कि ऑडियो तरंगरूप समय के साथ कैसे विकसित होता है। प्रशिक्षित नेटवर्क का उपयोग फिर 16,000 नमूने प्रति सेकंड पर नए भाषण-समान तरंगरूप बनाने के लिए किया जा सकता है। इन तरंगरूपों में यथार्थवादी साँसें और होंठों की आवाज़ें शामिल हैं - लेकिन ये किसी भी भाषा के अनुरूप नहीं होते हैं।
WaveNet विभिन्न आवाज़ों को सटीक रूप से मॉडल करने में सक्षम है, जिसमें इनपुट का उच्चारण और स्वर आउटपुट के साथ सहसंबंधित होता है। उदाहरण के लिए, यदि इसे जर्मन के साथ प्रशिक्षित किया जाता है, तो यह जर्मन भाषण उत्पन्न करता है। यह क्षमता यह भी मतलब रखती है कि यदि WaveNet को अन्य इनपुट - जैसे संगीत - खिलाए जाते हैं, तो इसका आउटपुट संगीतमय होगा। अपनी रिलीज़ के समय, DeepMind ने दिखाया कि WaveNet ऐसे तरंगरूप उत्पन्न कर सकता है जो शास्त्रीय संगीत की तरह लगते हैं। यह बहुमुखी प्रतिभा भाषण में पारंपरिक Machine learning अनुप्रयोगों से परे इसकी क्षमता को उजागर करती है।
सामग्री (आवाज़) स्वैपिंग
जून 2018 के पेपर Disentangled Sequential Autoencoder के अनुसार, DeepMind ने ऑडियो और आवाज़ "सामग्री स्वैपिंग" के लिए WaveNet का सफलतापूर्वक उपयोग किया है: नेटवर्क एक ऑडियो रिकॉर्डिंग पर आवाज़ को दूसरी, पहले से मौजूद आवाज़ में बदल सकता है, जबकि मूल रिकॉर्डिंग से पाठ और अन्य विशेषताओं को बनाए रखता है। "हम ऑडियो अनुक्रम डेटा पर भी प्रयोग करते हैं। हमारा अलग किया गया प्रतिनिधित्व हमें भाषण की सामग्री पर स्थिति बनाते हुए वक्ता पहचान को एक दूसरे में परिवर्तित करने की अनुमति देता है।" (पृ. 5) "ऑडियो के लिए, यह हमें एक पुरुष वक्ता को महिला वक्ता में और इसके विपरीत परिवर्तित करने की अनुमति देता है [...]।" (पृ. 1) पेपर के अनुसार, स्रोत और लक्ष्य दोनों आवाज़ों की पहले से मौजूद भाषण रिकॉर्डिंग के न्यूनतम दो अंकों की घंटों की मात्रा (लगभग 50 घंटे) को WaveNet में खिलाने की आवश्यकता होती है ताकि प्रोग्राम संतोषजनक गुणवत्ता पर एक आवाज़ से दूसरी आवाज़ में रूपांतरण करने से पहले उनकी व्यक्तिगत विशेषताओं को सीख सके। लेखक इस बात पर जोर देते हैं कि "[मॉडल का एक लाभ यह है कि यह गतिशील और स्थिर विशेषताओं को अलग करता है [...]।" (पृ. 8), यानी WaveNet एक ओर बोले गए पाठ और वितरण के तरीकों (मॉड्यूलेशन, गति, पिच, मनोदशा, आदि) के बीच अंतर करने में सक्षम है जिन्हें एक आवाज़ से दूसरी आवाज़ में रूपांतरण के दौरान बनाए रखना है, और दूसरी ओर स्रोत और लक्ष्य दोनों आवाज़ों की बुनियादी विशेषताओं के बीच जिन्हें इसे स्वैप करना आवश्यक है।
जनवरी 2019 का अनुवर्ती पेपर Unsupervised speech representation learning using WaveNet autoencoders "सामग्री स्वैपिंग" के लिए गतिशील और स्थिर विशेषताओं की उचित स्वचालित पहचान और भेदभाव को बढ़ाने के लिए एक विधि का विवरण देता है, विशेष रूप से मौजूदा ऑडियो रिकॉर्डिंग पर आवाज़ें स्वैप करना शामिल है, ताकि इसे अधिक विश्वसनीय बनाया जा सके। एक और अनुवर्ती पेपर, Sample Efficient Adaptive Text-to-Speech, दिनांकित सितंबर 2018 (नवीनतम संशोधन जनवरी 2019), बताता है कि DeepMind ने उच्च-गुणवत्ता वाले परिणाम बनाए रखते हुए WaveNet के माध्यम से मौजूदा आवाज़ का नमूना लेने के लिए आवश्यक वास्तविक जीवन रिकॉर्डिंग की न्यूनतम मात्रा को "केवल कुछ मिनटों के ऑडियो डेटा" तक सफलतापूर्वक कम कर दिया है।
आवाज़ों की नकल करने की इसकी क्षमता ने WaveNet की जीवित और मृत व्यक्तियों की आवाज़ों की नकल करने की क्षमता के बारे में नैतिक चिंताएँ उठाई हैं। 2016 के एक BBC लेख के अनुसार, समान आवाज़-क्लोनिंग तकनीकों (जैसे Adobe Voco) पर काम करने वाली कंपनियाँ जालसाजी को रोकने के लिए मनुष्यों के लिए अश्रव्य वॉटरमार्किंग डालने का इरादा रखती हैं, जबकि यह बनाए रखती हैं कि मनोरंजन-उद्योग के उद्देश्यों की जरूरतों को पूरा करने वाली आवाज़ क्लोनिंग फोरेंसिक साक्ष्य विधियों और इलेक्ट्रॉनिक ID उपकरणों को मूर्ख बनाने के लिए आवश्यक की तुलना में कहीं कम जटिल होगी और विभिन्न तरीकों का उपयोग करेगी, ताकि प्राकृतिक आवाज़ें और मनोरंजन-उद्योग के उद्देश्यों के लिए क्लोन की गई आवाज़ें तकनीकी विश्लेषण द्वारा आसानी से अलग की जा सकें।
अनुप्रयोग
अपनी रिलीज़ के समय, DeepMind ने कहा कि WaveNet को वास्तविक दुनिया के अनुप्रयोगों में उपयोग करने के लिए बहुत अधिक कम्प्यूटेशनल प्रोसेसिंग शक्ति की आवश्यकता थी। अक्टूबर 2017 तक, Google ने बेहतर आवाज़ गुणवत्ता के साथ 1,000 गुना प्रदर्शन सुधार की घोषणा की। WaveNet का उपयोग फिर सभी Google प्लेटफार्मों पर अमेरिकी अंग्रेजी और जापानी के लिए Google Assistant आवाज़ें उत्पन्न करने के लिए किया गया। नवंबर 2017 में, DeepMind शोधकर्ताओं ने "Probability Density Distillation" नामक "वास्तविक समय से 20 गुना से अधिक तेजी से उच्च-निष्ठा भाषण नमूने उत्पन्न करने" की एक प्रस्तावित विधि का विवरण देने वाला एक शोध पेपर जारी किया। मई 2018 में वार्षिक I/O डेवलपर सम्मेलन में, यह घोषणा की गई कि नई Google Assistant आवाज़ें उपलब्ध थीं और WaveNet द्वारा संभव बनाई गई थीं; WaveNet ने आवाज़ अभिनेता के नमूनों के कच्चे ऑडियो को मॉडल करके आवाज़ मॉडल बनाने के लिए आवश्यक ऑडियो रिकॉर्डिंग की संख्या को बहुत कम कर दिया। यह उन्नति WaveNet को ऑडियो के लिए Generative AI में एक प्रमुख नवाचार के रूप में स्थापित करती है, जिसने Neural network आधारित संश्लेषण में बाद के काम को प्रभावित किया।