अंग्रेज़ी से अनुवादित

Tacotron 2 एक तंत्रिका टेक्स्ट-टू-स्पीच प्रणाली है जिसे 2018 में Google AI द्वारा विकसित किया गया था, जो पाठ को मेल-स्पेक्ट्रोग्राम में परिवर्तित करती है और भाषण तरंगों को उत्पन्न करने के लिए एक तंत्रिका वोकोडर का उपयोग करती है। इसने अत्यधिक प्राकृतिक भाषण संश्लेषण प्रदर्शित किया, लेकिन स्वीकार्य गुणवत्ता के लिए दसियों घंटे के प्रशिक्षण डेटा की आवश्यकता होती थी।

Tacotron 2 एक Deep learning-आधारित टेक्स्ट-टू-स्पीच प्रणाली है जिसे Google AI द्वारा विकसित किया गया था और 2018 में जारी किया गया था। इसने तंत्रिका भाषण संश्लेषण में एक महत्वपूर्ण प्रगति को चिह्नित किया, यह प्रदर्शित करके कि एक एंड-टू-एंड तंत्रिका-नेटवर्क वास्तुकला लिखित पाठ से अत्यधिक प्राकृतिक ध्वनि वाला भाषण उत्पन्न कर सकती है। इस प्रणाली में दो मुख्य घटक शामिल हैं: एक आवर्ती अनुक्रम-से-अनुक्रम विशेषता भविष्यवाणी नेटवर्क जो इनपुट पाठ से मेल-स्पेक्ट्रोग्राम उत्पन्न करता है, और एक संशोधित WaveNet वोकोडर जो उन स्पेक्ट्रोग्राम को कच्चे ऑडियो तरंगों में परिवर्तित करता है। इस दो-चरणीय दृष्टिकोण ने Tacotron 2 को अपने आउटपुट में लगभग मानवीय स्वाभाविकता प्राप्त करने की अनुमति दी, हालांकि स्वीकार्य गुणवत्ता तक पहुंचने के लिए इसे पर्याप्त प्रशिक्षण डेटा की आवश्यकता थी - आमतौर पर दर्ज भाषण के दसियों घंटे।

Tacotron 2 का विकास गहन शिक्षण भाषण संश्लेषण में पहले के काम पर आधारित था। सितंबर 2016 में, DeepMind ने WaveNet जारी किया, जिसने पहली बार प्रदर्शित किया कि गहन शिक्षण मॉडल कच्चे तरंगों को मॉडल कर सकते हैं और स्पेक्ट्रोग्राम या मेल-स्पेक्ट्रोग्राम जैसी ध्वनिक विशेषताओं से भाषण उत्पन्न कर सकते हैं। WaveNet शुरू में कम्प्यूटेशनल रूप से महंगा और धीमा था, लेकिन एक साल बाद DeepMind ने Parallel WaveNet का अनावरण किया, जो मूल से लगभग 1,000 गुना तेज एक उत्पादन मॉडल था। Tacotron 2 ने इन प्रगतियों को एक ध्यान-आधारित अनुक्रम-से-अनुक्रम मॉडल के साथ एकीकृत किया, जिससे सिस्टम को स्पष्ट संरेखण जानकारी की आवश्यकता के बिना इनपुट पाठ को आउटपुट भाषण विशेषताओं के साथ संरेखित करने की अनुमति मिली।

Architecture

Tacotron 2 की वास्तुकला एक ऑटोएन्कोडर है जिसमें ध्यान तंत्र हैं जो इनपुट पाठ को वर्ण दर वर्ण संसाधित करते हैं। एन्कोडर वर्ण अनुक्रम को एक छिपे हुए प्रतिनिधित्व में परिवर्तित करता है, जिसे एक ध्यान मॉड्यूल फिर आउटपुट मेल-स्पेक्ट्रोग्राम के फ्रेम के साथ संरेखित करता है। डिकोडर मेल-स्पेक्ट्रोग्राम फ्रेम को स्वप्रतिगामी रूप से उत्पन्न करता है, प्रत्येक फ्रेम की भविष्यवाणी पहले उत्पन्न फ्रेम और ध्यानित एन्कोडर अवस्थाओं के आधार पर करता है। प्रशिक्षण के लिए हानि फलन आमतौर पर L1 (माध्य निरपेक्ष त्रुटि) या L2 (माध्य वर्ग त्रुटि) हानियों का उपयोग करता है, जो बाधाएं लगाती हैं कि आउटपुट ध्वनिक विशेषता वितरण गाऊसी या लाप्लासियन होना चाहिए। व्यवहार में, हानि फलन को मानव आवाज बैंड, लगभग 300 से 4000 हर्ट्ज, पर अधिक दंड लगाने के लिए डिज़ाइन किया गया है, जो मानव बैंड और अन्य आवृत्तियों के लिए हानियों के भारित संयोजन का उपयोग करता है।

Tacotron 2 द्वारा उपयोग की जाने वाली ध्वनिक विशेषताएं मेल-स्पेक्ट्रोग्राम हैं, जो भाषण संकेत के समय-आवृत्ति संबंध को पकड़ती हैं। ये विशेषताएं बोधगम्य आउटपुट उत्पन्न करने के लिए पर्याप्त हैं, भाषण पहचान में उपयोग किए जाने वाले मेल-आवृत्ति सेप्स्ट्रल गुणांक के विपरीत, जो संश्लेषण उद्देश्यों के लिए बहुत अधिक जानकारी कम कर देते हैं। अंतिम तरंग WaveNet वोकोडर द्वारा निर्मित होती है, जो एक तरंग की संयुक्त संभावना को सशर्त संभावनाओं के उत्पाद में विभाजित करता है, जिससे उच्च-गुणवत्ता वाली ऑडियो पीढ़ी सक्षम होती है।

Training Data Requirements

Tacotron 2 के विकास से प्रमुख निष्कर्षों में से एक प्रशिक्षण डेटा की मात्रा के प्रति इसकी संवेदनशीलता थी। जब दसियों घंटे के ऑडियो पर प्रशिक्षित किया गया, तो सिस्टम ने अत्यधिक प्राकृतिक भाषण संश्लेषण प्राप्त किया। हालांकि, छोटे डेटासेट के साथ, आउटपुट गुणवत्ता में उल्लेखनीय रूप से गिरावट आई। लगभग 2 घंटे के भाषण के साथ, Tacotron 2 ने बोधगम्य भाषण बनाए रखा लेकिन कम स्वाभाविकता के साथ। केवल 24 मिनट के प्रशिक्षण डेटा के साथ, सिस्टम पूरी तरह से बोधगम्य भाषण उत्पन्न करने में विफल रहा। यह डेटा आवश्यकता बाद की प्रणालियों के विपरीत थी; मार्च 2020 में, मुफ्त टेक्स्ट-टू-स्पीच वेबसाइट 15.ai लॉन्च हुई, और इसके निर्माता ने दावा किया कि किसी व्यक्ति की आवाज को क्लोन करने के लिए 15 सेकंड का प्रशिक्षण डेटा पर्याप्त था। इस दावे की बाद में 2024 में OpenAI द्वारा पुष्टि की गई, जो Tacotron 2 की आवश्यकताओं से एक महत्वपूर्ण कमी का प्रतिनिधित्व करती है।

Influence and Successors

Tacotron 2 की गति और डेटा दक्षता में सीमाओं ने बाद के शोध को प्रेरित किया। 2019 में, Microsoft Research ने FastSpeech पेश किया, जिसने Tacotron 2 जैसे स्वप्रतिगामी मॉडल की गति सीमाओं को संबोधित किया। FastSpeech ने एक फीडफॉरवर्ड ट्रांसफॉर्मर नेटवर्क और लंबाई विनियमन के साथ एक गैर-स्वप्रतिगामी वास्तुकला का उपयोग किया, जिससे समानांतर अनुक्रम पीढ़ी और पूर्ण मेल-स्पेक्ट्रोग्राम अनुक्रम की एक-शॉट भविष्यवाणी सक्षम हुई। इसने ऑडियो गुणवत्ता बनाए रखते हुए अनुमान समय को काफी कम कर दिया। उसी वर्ष HiFi-GAN की रिलीज़ देखी गई, जो एक जनरेटिव प्रतिकूल नेटवर्क-आधारित वोकोडर है जिसने उच्च-निष्ठा भाषण उत्पन्न करते हुए तरंग पीढ़ी दक्षता में सुधार किया। 2020 में, Glow-TTS ने तेज अनुमान और आवाज शैली स्थानांतरण की अनुमति देने वाला एक प्रवाह-आधारित दृष्टिकोण पेश किया।

Tacotron 2 ने शून्य-शॉट वक्ता अनुकूलन में भी शोध को प्रभावित किया। जून 2018 में, Google ने वक्ता एम्बेडिंग निकालने के लिए पूर्व-प्रशिक्षित वक्ता सत्यापन मॉडल को वक्ता एन्कोडर के रूप में उपयोग करने का प्रस्ताव दिया। ये एन्कोडर तंत्रिका टेक्स्ट-टू-स्पीच मॉडल का हिस्सा बन गए, जिससे एक एकल मॉडल प्रत्येक वक्ता के लिए पुनः प्रशिक्षण के बिना विभिन्न वक्ता शैलियों और विशेषताओं के साथ भाषण उत्पन्न करने में सक्षम हो गया।

Legacy

Tacotron 2 को तंत्रिका टेक्स्ट-टू-स्पीच के इतिहास में एक ऐतिहासिक मॉडल के रूप में व्यापक रूप से माना जाता है। इसने प्रदर्शित किया कि एंड-टू-एंड गहन शिक्षण दृष्टिकोण स्वाभाविकता में पारंपरिक संयोजनात्मक और पैरामीट्रिक संश्लेषण विधियों का मुकाबला कर सकते हैं। इसका दो-चरणीय डिज़ाइन - ध्वनिक विशेषता पीढ़ी के बाद तंत्रिका वोकोडिंग - बाद की प्रणालियों में एक सामान्य प्रतिमान बन गया। जबकि बाद के मॉडलों ने गति और डेटा दक्षता में सुधार किया, भाषण के लिए ध्यान-आधारित अनुक्रम-से-अनुक्रम मॉडलिंग में Tacotron 2 के योगदान और तंत्रिका वोकोडर के साथ इसका एकीकरण मशीन लर्निंग और जनरेटिव एआई के क्षेत्र में प्रभावशाली बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:text-to-speech·deep-learning·neural-network·google-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास