Tacotron 2 एक Deep learning-आधारित टेक्स्ट-टू-स्पीच प्रणाली है जिसे Google AI द्वारा विकसित किया गया था और 2018 में जारी किया गया था। इसने तंत्रिका भाषण संश्लेषण में एक महत्वपूर्ण प्रगति को चिह्नित किया, यह प्रदर्शित करके कि एक एंड-टू-एंड तंत्रिका-नेटवर्क वास्तुकला लिखित पाठ से अत्यधिक प्राकृतिक ध्वनि वाला भाषण उत्पन्न कर सकती है। इस प्रणाली में दो मुख्य घटक शामिल हैं: एक आवर्ती अनुक्रम-से-अनुक्रम विशेषता भविष्यवाणी नेटवर्क जो इनपुट पाठ से मेल-स्पेक्ट्रोग्राम उत्पन्न करता है, और एक संशोधित WaveNet वोकोडर जो उन स्पेक्ट्रोग्राम को कच्चे ऑडियो तरंगों में परिवर्तित करता है। इस दो-चरणीय दृष्टिकोण ने Tacotron 2 को अपने आउटपुट में लगभग मानवीय स्वाभाविकता प्राप्त करने की अनुमति दी, हालांकि स्वीकार्य गुणवत्ता तक पहुंचने के लिए इसे पर्याप्त प्रशिक्षण डेटा की आवश्यकता थी - आमतौर पर दर्ज भाषण के दसियों घंटे।
Tacotron 2 का विकास गहन शिक्षण भाषण संश्लेषण में पहले के काम पर आधारित था। सितंबर 2016 में, DeepMind ने WaveNet जारी किया, जिसने पहली बार प्रदर्शित किया कि गहन शिक्षण मॉडल कच्चे तरंगों को मॉडल कर सकते हैं और स्पेक्ट्रोग्राम या मेल-स्पेक्ट्रोग्राम जैसी ध्वनिक विशेषताओं से भाषण उत्पन्न कर सकते हैं। WaveNet शुरू में कम्प्यूटेशनल रूप से महंगा और धीमा था, लेकिन एक साल बाद DeepMind ने Parallel WaveNet का अनावरण किया, जो मूल से लगभग 1,000 गुना तेज एक उत्पादन मॉडल था। Tacotron 2 ने इन प्रगतियों को एक ध्यान-आधारित अनुक्रम-से-अनुक्रम मॉडल के साथ एकीकृत किया, जिससे सिस्टम को स्पष्ट संरेखण जानकारी की आवश्यकता के बिना इनपुट पाठ को आउटपुट भाषण विशेषताओं के साथ संरेखित करने की अनुमति मिली।
Architecture
Tacotron 2 की वास्तुकला एक ऑटोएन्कोडर है जिसमें ध्यान तंत्र हैं जो इनपुट पाठ को वर्ण दर वर्ण संसाधित करते हैं। एन्कोडर वर्ण अनुक्रम को एक छिपे हुए प्रतिनिधित्व में परिवर्तित करता है, जिसे एक ध्यान मॉड्यूल फिर आउटपुट मेल-स्पेक्ट्रोग्राम के फ्रेम के साथ संरेखित करता है। डिकोडर मेल-स्पेक्ट्रोग्राम फ्रेम को स्वप्रतिगामी रूप से उत्पन्न करता है, प्रत्येक फ्रेम की भविष्यवाणी पहले उत्पन्न फ्रेम और ध्यानित एन्कोडर अवस्थाओं के आधार पर करता है। प्रशिक्षण के लिए हानि फलन आमतौर पर L1 (माध्य निरपेक्ष त्रुटि) या L2 (माध्य वर्ग त्रुटि) हानियों का उपयोग करता है, जो बाधाएं लगाती हैं कि आउटपुट ध्वनिक विशेषता वितरण गाऊसी या लाप्लासियन होना चाहिए। व्यवहार में, हानि फलन को मानव आवाज बैंड, लगभग 300 से 4000 हर्ट्ज, पर अधिक दंड लगाने के लिए डिज़ाइन किया गया है, जो मानव बैंड और अन्य आवृत्तियों के लिए हानियों के भारित संयोजन का उपयोग करता है।
Tacotron 2 द्वारा उपयोग की जाने वाली ध्वनिक विशेषताएं मेल-स्पेक्ट्रोग्राम हैं, जो भाषण संकेत के समय-आवृत्ति संबंध को पकड़ती हैं। ये विशेषताएं बोधगम्य आउटपुट उत्पन्न करने के लिए पर्याप्त हैं, भाषण पहचान में उपयोग किए जाने वाले मेल-आवृत्ति सेप्स्ट्रल गुणांक के विपरीत, जो संश्लेषण उद्देश्यों के लिए बहुत अधिक जानकारी कम कर देते हैं। अंतिम तरंग WaveNet वोकोडर द्वारा निर्मित होती है, जो एक तरंग की संयुक्त संभावना को सशर्त संभावनाओं के उत्पाद में विभाजित करता है, जिससे उच्च-गुणवत्ता वाली ऑडियो पीढ़ी सक्षम होती है।
Training Data Requirements
Tacotron 2 के विकास से प्रमुख निष्कर्षों में से एक प्रशिक्षण डेटा की मात्रा के प्रति इसकी संवेदनशीलता थी। जब दसियों घंटे के ऑडियो पर प्रशिक्षित किया गया, तो सिस्टम ने अत्यधिक प्राकृतिक भाषण संश्लेषण प्राप्त किया। हालांकि, छोटे डेटासेट के साथ, आउटपुट गुणवत्ता में उल्लेखनीय रूप से गिरावट आई। लगभग 2 घंटे के भाषण के साथ, Tacotron 2 ने बोधगम्य भाषण बनाए रखा लेकिन कम स्वाभाविकता के साथ। केवल 24 मिनट के प्रशिक्षण डेटा के साथ, सिस्टम पूरी तरह से बोधगम्य भाषण उत्पन्न करने में विफल रहा। यह डेटा आवश्यकता बाद की प्रणालियों के विपरीत थी; मार्च 2020 में, मुफ्त टेक्स्ट-टू-स्पीच वेबसाइट 15.ai लॉन्च हुई, और इसके निर्माता ने दावा किया कि किसी व्यक्ति की आवाज को क्लोन करने के लिए 15 सेकंड का प्रशिक्षण डेटा पर्याप्त था। इस दावे की बाद में 2024 में OpenAI द्वारा पुष्टि की गई, जो Tacotron 2 की आवश्यकताओं से एक महत्वपूर्ण कमी का प्रतिनिधित्व करती है।
Influence and Successors
Tacotron 2 की गति और डेटा दक्षता में सीमाओं ने बाद के शोध को प्रेरित किया। 2019 में, Microsoft Research ने FastSpeech पेश किया, जिसने Tacotron 2 जैसे स्वप्रतिगामी मॉडल की गति सीमाओं को संबोधित किया। FastSpeech ने एक फीडफॉरवर्ड ट्रांसफॉर्मर नेटवर्क और लंबाई विनियमन के साथ एक गैर-स्वप्रतिगामी वास्तुकला का उपयोग किया, जिससे समानांतर अनुक्रम पीढ़ी और पूर्ण मेल-स्पेक्ट्रोग्राम अनुक्रम की एक-शॉट भविष्यवाणी सक्षम हुई। इसने ऑडियो गुणवत्ता बनाए रखते हुए अनुमान समय को काफी कम कर दिया। उसी वर्ष HiFi-GAN की रिलीज़ देखी गई, जो एक जनरेटिव प्रतिकूल नेटवर्क-आधारित वोकोडर है जिसने उच्च-निष्ठा भाषण उत्पन्न करते हुए तरंग पीढ़ी दक्षता में सुधार किया। 2020 में, Glow-TTS ने तेज अनुमान और आवाज शैली स्थानांतरण की अनुमति देने वाला एक प्रवाह-आधारित दृष्टिकोण पेश किया।
Tacotron 2 ने शून्य-शॉट वक्ता अनुकूलन में भी शोध को प्रभावित किया। जून 2018 में, Google ने वक्ता एम्बेडिंग निकालने के लिए पूर्व-प्रशिक्षित वक्ता सत्यापन मॉडल को वक्ता एन्कोडर के रूप में उपयोग करने का प्रस्ताव दिया। ये एन्कोडर तंत्रिका टेक्स्ट-टू-स्पीच मॉडल का हिस्सा बन गए, जिससे एक एकल मॉडल प्रत्येक वक्ता के लिए पुनः प्रशिक्षण के बिना विभिन्न वक्ता शैलियों और विशेषताओं के साथ भाषण उत्पन्न करने में सक्षम हो गया।
Legacy
Tacotron 2 को तंत्रिका टेक्स्ट-टू-स्पीच के इतिहास में एक ऐतिहासिक मॉडल के रूप में व्यापक रूप से माना जाता है। इसने प्रदर्शित किया कि एंड-टू-एंड गहन शिक्षण दृष्टिकोण स्वाभाविकता में पारंपरिक संयोजनात्मक और पैरामीट्रिक संश्लेषण विधियों का मुकाबला कर सकते हैं। इसका दो-चरणीय डिज़ाइन - ध्वनिक विशेषता पीढ़ी के बाद तंत्रिका वोकोडिंग - बाद की प्रणालियों में एक सामान्य प्रतिमान बन गया। जबकि बाद के मॉडलों ने गति और डेटा दक्षता में सुधार किया, भाषण के लिए ध्यान-आधारित अनुक्रम-से-अनुक्रम मॉडलिंग में Tacotron 2 के योगदान और तंत्रिका वोकोडर के साथ इसका एकीकरण मशीन लर्निंग और जनरेटिव एआई के क्षेत्र में प्रभावशाली बना हुआ है।