टेक्स्ट-टू-स्पीच, या TTS, लिखित पाठ को बोले गए ऑडियो में परिवर्तित करता है। यह Conversational AI प्रणालियों के भीतर वाक् पहचान का आउटपुट-उन्मुख समकक्ष है, और 2020 के दशक में मुख्यधारा की जनरेटिव-AI एप्लिकेशन बनने से पहले दशकों से एक्सेसिबिलिटी टूल, फोन सिस्टम और नेविगेशन डिवाइस में उपयोग किया जा रहा है।
इतिहास
प्रारंभिक TTS प्रणालियाँ कंकैटेनेटिव संश्लेषण पर निर्भर थीं, जो मानव भाषण के छोटे पूर्व-रिकॉर्ड किए गए खंडों को जोड़ती थीं, या फॉर्मेंट संश्लेषण, जो वोकल-ट्रैक्ट ध्वनिकी का वर्णन करने वाले नियमों से भाषण उत्पन्न करता था; दोनों ने स्पष्ट रूप से रोबोटिक आउटपुट उत्पन्न किया। एक बड़ा बदलाव ऑडियो जनरेशन में गहन शिक्षण के अनुप्रयोग के साथ आया: डीपमाइंड का वेवनेट, 2016 में प्रकाशित, ने कन्वोल्यूशनल आर्किटेक्चर का उपयोग करके नमूना-दर-नमूना कच्चे ऑडियो तरंगरूप उत्पन्न किए और पिछले तरीकों की तुलना में काफी अधिक प्राकृतिक भाषण उत्पन्न किया, हालांकि उच्च कम्प्यूटेशनल लागत पर। टैक्ट्रोन और बाद के ट्रांसफॉर्मर-आधारित मॉडल जैसी बाद की प्रणालियों ने प्राकृतिकता के लाभ को बनाए रखते हुए जनरेशन को तेज किया, और 2020 के दशक की शुरुआत तक न्यूरल TTS उद्योग भर में डिफ़ॉल्ट दृष्टिकोण बन गया था।
आधुनिक प्रणालियाँ
समकालीन TTS मॉडल आमतौर पर कार्य को दो भागों में विभाजित करते हैं: पाठ से एक मध्यवर्ती ध्वनिक प्रतिनिधित्व की भविष्यवाणी करना और फिर उस प्रतिनिधित्व को वोकोडर के साथ तरंगरूप में परिवर्तित करना, हालांकि नए एंड-टू-एंड सिस्टम तेजी से इसे एक ही मॉडल में समेट रहे हैं, जो अक्सर डिफ्यूजन-मॉडल या ऑटोरेग्रेसिव ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित होते हैं। ElevenLabs जैसी कंपनियों ने कंटेंट क्रिएटर्स, ऑडियोबुक नैरेशन और डबिंग के उद्देश्य से अत्यधिक अभिव्यंजक, कम-विलंबता TTS को लोकप्रिय बनाया, जो भावना, गति और उच्चारण पर नियंत्रण प्रदान करता है। TTS वॉयस असिस्टेंट, रीयल-टाइम अनुवाद टूल और दृष्टिबाधित उपयोगकर्ताओं के लिए एक्सेसिबिलिटी सॉफ्टवेयर का एक मुख्य घटक भी है, और यह NotebookLM के पॉडकास्ट-शैली सारांश जैसी AI-जनित ऑडियो सुविधाओं को रेखांकित करता है।
वॉयस क्लोनिंग और गुणवत्ता
सबसे महत्वपूर्ण हालिया प्रगति फ्यू-शॉट वॉयस क्लोनिंग है, जहां एक मॉडल एक छोटी संदर्भ रिकॉर्डिंग से किसी विशिष्ट व्यक्ति की आवाज को पुन: उत्पन्न करता है, न कि एक सामान्य सिंथेटिक आवाज। जैसे-जैसे संश्लेषित आवाजें मानव अप्रभेद्यता के करीब पहुंचीं, मूल्यांकन सरल बोधगम्यता परीक्षणों से अवधारणात्मक स्वाभाविकता स्कोर की ओर और तेजी से, यह पता लगाने की क्षमता की ओर स्थानांतरित हो गया कि ऑडियो बिल्कुल सिंथेटिक है, एक चिंता जो व्यापक डीपफेक साहित्य के साथ साझा की जाती है।
अनुप्रयोग और चिंताएँ
TTS का उपयोग ऑडियोबुक, ग्राहक-सेवा फोन सिस्टम, वीडियो नैरेशन, गेमिंग और सहायक तकनीक में किया जाता है, और यह बड़े मल्टीमॉडल-एआई सिस्टम का एक निर्माण खंड बन गया है जो सुन और बोल दोनों सकते हैं। इसके तीव्र सुधार ने वॉयस-आधारित धोखाधड़ी, राजनीतिक गलत सूचना में प्रतिरूपण और वॉयस-एक्टिंग कार्य के विस्थापन के बारे में भी चिंताएं बढ़ाई हैं, जिससे कुछ कंपनियों को सिंथेटिक ऑडियो के लिए एआई-वॉटरमार्किंग या प्रोवेंस लेबलिंग अपनाने और कुछ न्यायक्षेत्रों को सहमति के बिना किसी व्यक्ति की आवाज के उपयोग को विनियमित करने के लिए प्रेरित किया है।