अंग्रेज़ी से अनुवादित

वाक् संश्लेषण कंप्यूटर प्रणालियों द्वारा मानव वाणी का कृत्रिम उत्पादन है, जो पाठ या भाषाई प्रतिनिधित्व को श्रव्य आवाज़ में परिवर्तित करता है। यह अभिगम्यता उपकरणों, आवाज़ सहायकों और संचार सहायताओं को सक्षम बनाता है, जिसकी गुणवत्ता सुगमता और स्वाभाविकता से आंकी जाती है।

वाक् संश्लेषण मानव वाणी का कृत्रिम उत्पादन है। इस उद्देश्य के लिए उपयोग किया जाने वाला कंप्यूटर सिस्टम वाक् संश्लेषक कहलाता है, और इसे सॉफ्टवेयर या हार्डवेयर उत्पादों में लागू किया जा सकता है। एक टेक्स्ट-टू-स्पीच (TTS) प्रणाली सामान्य भाषा के पाठ को वाणी में परिवर्तित करती है; अन्य प्रणालियाँ ध्वन्यात्मक प्रतिलेखन जैसे प्रतीकात्मक भाषाई निरूपण को वाणी में प्रस्तुत करती हैं। विपरीत प्रक्रिया वाक् पहचान है।

संश्लेषित वाणी को डेटाबेस में संग्रहीत रिकॉर्ड की गई वाणी के टुकड़ों को जोड़कर बनाया जा सकता है। प्रणालियाँ संग्रहीत वाणी इकाइयों के आकार में भिन्न होती हैं; एक प्रणाली जो फोन या डाइफोन संग्रहीत करती है, सबसे बड़ी आउटपुट सीमा प्रदान करती है, लेकिन इसमें स्पष्टता की कमी हो सकती है। विशिष्ट उपयोग डोमेन के लिए, पूरे शब्दों या वाक्यों का संग्रहण उच्च-गुणवत्ता वाला आउटपुट सक्षम बनाता है। वैकल्पिक रूप से, एक संश्लेषक वोकल ट्रैक्ट और अन्य मानव आवाज विशेषताओं का एक मॉडल शामिल कर सकता है ताकि पूरी तरह से "सिंथेटिक" आवाज आउटपुट बनाया जा सके।

वाक् संश्लेषक की गुणवत्ता को मानव आवाज से इसकी समानता और स्पष्ट रूप से समझे जाने की क्षमता से आंका जाता है। एक समझने योग्य टेक्स्ट-टू-स्पीच प्रोग्राम दृष्टिबाधित या पढ़ने में अक्षम लोगों को घरेलू कंप्यूटर पर लिखित शब्दों को सुनने की अनुमति देता है। 1974 में यूनिक्स पहला कंप्यूटर ऑपरेटिंग सिस्टम था जिसमें वाक् संश्लेषक शामिल था, जो यूनिक्स स्पीक उपयोगिता के माध्यम से था। 2000 में, माइक्रोसॉफ्ट सैम डिफ़ॉल्ट टेक्स्ट-टू-स्पीच आवाज संश्लेषक था जिसका उपयोग नैरेटर एक्सेसिबिलिटी फीचर द्वारा किया गया था, जो सभी विंडोज 2000 ऑपरेटिंग सिस्टम और बाद के विंडोज एक्सपी सिस्टम के साथ शामिल था।

टेक्स्ट-टू-स्पीच प्रणाली की वास्तुकला

एक टेक्स्ट-टू-स्पीच प्रणाली (या "इंजन") दो भागों से बनी होती है: एक फ्रंट-एंड और एक बैक-एंड। फ्रंट-एंड के दो प्रमुख कार्य होते हैं। पहला, यह संख्याओं और संक्षिप्ताक्षरों जैसे प्रतीकों वाले कच्चे पाठ को लिखित शब्दों के समकक्ष में परिवर्तित करता है। इस प्रक्रिया को अक्सर पाठ सामान्यीकरण, पूर्व-प्रसंस्करण, या टोकनाइजेशन कहा जाता है। फ्रंट-एंड फिर प्रत्येक शब्द को ध्वन्यात्मक प्रतिलेखन सौंपता है, और पाठ को प्रोसोडिक इकाइयों, जैसे वाक्यांश, उपवाक्य और वाक्य, में विभाजित और चिह्नित करता है। शब्दों को ध्वन्यात्मक प्रतिलेखन सौंपने की प्रक्रिया को टेक्स्ट-टू-फोनीम या ग्राफीम-टू-फोनीम रूपांतरण कहा जाता है। ध्वन्यात्मक प्रतिलेखन और प्रोसोडी जानकारी मिलकर प्रतीकात्मक भाषाई निरूपण बनाते हैं जो फ्रंट-एंड द्वारा आउटपुट होता है।

बैक-एंड, जिसे अक्सर संश्लेषक कहा जाता है, फिर प्रतीकात्मक भाषाई निरूपण को ध्वनि में परिवर्तित करता है। कुछ प्रणालियों में, इस भाग में लक्ष्य प्रोसोडी (पिच कंटूर, फोनीम अवधि) की गणना शामिल होती है, जिसे फिर आउटपुट वाणी पर लागू किया जाता है। यह दो-चरणीय डिज़ाइन मॉड्यूलर विकास की अनुमति देता है, जहाँ भाषाई विश्लेषण को ध्वनिक उत्पादन से स्वतंत्र रूप से सुधारा जा सकता है।

ऐतिहासिक विकास

इलेक्ट्रॉनिक सिग्नल प्रोसेसिंग के आविष्कार से बहुत पहले, कुछ लोगों ने मानव वाणी की नकल करने के लिए मशीनें बनाने की कोशिश की। "कांस्य सिर" के अस्तित्व की किंवदंतियाँ भी थीं, जैसे कि पोप सिल्वेस्टर II (मृत्यु 1003 ई.), अल्बर्टस मैग्नस (1198–1280), और रोजर बेकन (1214–1294) से जुड़ी।

1779 में, जर्मन-डेनिश वैज्ञानिक क्रिश्चियन गोटलिब क्रैट्ज़ेंस्टीन ने रूसी शाही विज्ञान और कला अकादमी द्वारा घोषित एक प्रतियोगिता में पहला पुरस्कार जीता, जो उनके द्वारा बनाए गए मानव वोकल ट्रैक्ट के मॉडल के लिए था जो पाँच लंबे स्वर ध्वनियाँ (अंतर्राष्ट्रीय ध्वन्यात्मक वर्णमाला संकेतन में: [aː], [eː], [iː], [oː] और [uː]) उत्पन्न कर सकते थे। इसके बाद हंगरी के प्रेस्बर्ग के वोल्फगैंग वॉन केम्पेलेन का धौंकनी-संचालित "ध्वनिक-यांत्रिक वाक् मशीन" आया, जिसे 1791 के एक पेपर में वर्णित किया गया था। इस मशीन में जीभ और होंठ के मॉडल जोड़े गए, जिससे यह स्वरों के साथ-साथ व्यंजन भी उत्पन्न कर सकी। 1837 में, चार्ल्स व्हीटस्टोन ने वॉन केम्पेलेन के डिज़ाइन पर आधारित एक "बोलने वाली मशीन" बनाई, और 1846 में, जोसेफ फेबर ने "यूफोनिया" प्रदर्शित किया। 1923 में, पैगेट ने व्हीटस्टोन के डिज़ाइन को पुनर्जीवित किया।

1930 के दशक में, बेल लैब्स ने वोकोडर विकसित किया, जो स्वचालित रूप से वाणी को उसके मौलिक स्वरों और अनुनादों में विश्लेषित करता था। वोकोडर पर अपने काम से, होमर डुडले ने एक कीबोर्ड-संचालित आवाज-संश्लेषक बनाया जिसे द वोडर (वॉयस डेमोंस्ट्रेटर) कहा जाता था, जिसे उन्होंने 1939 के न्यूयॉर्क विश्व मेले में प्रदर्शित किया।

फ्रैंकलिन एस. कूपर और हास्किन्स लेबोरेटरीज में उनके सहयोगियों ने 1940 के दशक के अंत में पैटर्न प्लेबैक बनाया और 1950 में इसे पूरा किया। इस हार्डवेयर डिवाइस के कई अलग-अलग संस्करण थे; वर्तमान में केवल एक ही बचा है। यह मशीन स्पेक्ट्रोग्राम के रूप में वाणी के ध्वनिक पैटर्न की तस्वीरों को वापस ध्वनि में परिवर्तित करती है। इस डिवाइस का उपयोग करके, एल्विन लिबरमैन और सहयोगियों ने ध्वन्यात्मक खंडों (व्यंजन और स्वर) की धारणा के लिए ध्वनिक संकेतों की खोज की।

इलेक्ट्रॉनिक और कंप्यूटर-आधारित प्रणालियाँ

पहली कंप्यूटर-आधारित वाक् संश्लेषण प्रणालियाँ 1950 के दशक के अंत में उत्पन्न हुईं। नोरिको उमेदा एट अल. ने 1968 में जापान के इलेक्ट्रोटेक्निकल लेबोरेटरी में पहली सामान्य अंग्रेजी टेक्स्ट-टू-स्पीच प्रणाली विकसित की। 1961 में, भौतिक विज्ञानी जॉन लैरी केली जूनियर और उनके सहयोगी लुई गेर्स्टमैन ने एक IBM 7090 कंप्यूटर का उपयोग करके वाणी को संश्लेषित किया, जो बेल लैब्स के इतिहास में सबसे प्रमुख घटनाओं में से एक थी। केली के आवाज रिकॉर्डर संश्लेषक (वोकोडर) ने मैक्स मैथ्यूज के संगीत संगत के साथ गीत "डेज़ी बेल" को फिर से बनाया। संयोगवश, आर्थर सी. क्लार्क अपने मित्र और सहयोगी जॉन पियर्स से मिलने बेल लैब्स मरे हिल सुविधा में जा रहे थे। क्लार्क प्रदर्शन से इतने प्रभावित हुए कि उन्होंने इसे अपने उपन्यास 2001: ए स्पेस ओडिसी के पटकथा के चरम दृश्य में उपयोग किया, जहाँ HAL 9000 कंप्यूटर वही गीत गाता है जब अंतरिक्ष यात्री डेव बोमन इसे बंद कर देता है। विशुद्ध रूप से इलेक्ट्रॉनिक वाक् संश्लेषण की सफलता के बावजूद, यांत्रिक वाक् संश्लेषकों पर शोध जारी है।

लीनियर प्रेडिक्टिव कोडिंग (LPC), वाक् कोडिंग का एक रूप, 1966 में नागोया विश्वविद्यालय के फुमितादा इटाकुरा और निप्पॉन टेलीग्राफ एंड टेलीफोन (NTT) के शुज़ो सैटो के काम से विकसित होना शुरू हुआ। LPC प्रौद्योगिकी में आगे के विकास 1970 के दशक के दौरान बेल लैब्स में बिश्नु एस. अतल और मैनफ्रेड आर. श्रोएडर द्वारा किए गए। LPC बाद में प्रारंभिक वाक् संश्लेषक चिप्स का आधार बना, जैसे कि टेक्सास इंस्ट्रूमेंट्स LPC स्पीच चिप्स जो 1978 से स्पीक एंड स्पेल खिलौनों में उपयोग किए गए।

1975 में, फुमितादा इटाकुरा ने NTT में रहते हुए उच्च-संपीड़न वाक् कोडिंग के लिए लाइन स्पेक्ट्रल पेयर्स (LSP) विधि विकसित की। 1975 से 1981 तक, इटाकुरा ने LSP विधि पर आधारित वाक् विश्लेषण और संश्लेषण की समस्याओं का अध्ययन किया। 1980 में, उनकी टीम ने LSP-आधारित वाक् संश्लेषक चिप विकसित की। LSP वाक् संश्लेषण और कोडिंग के लिए एक महत्वपूर्ण प्रौद्योगिकी है, और 1990 के दशक में इसे लगभग सभी अंतर्राष्ट्रीय वाक् कोडिंग मानकों द्वारा एक आवश्यक घटक के रूप में अपनाया गया, जिससे मोबाइल चैनलों और इंटरनेट पर डिजिटल वाक् संचार के संवर्धन में योगदान मिला।

1975 में, MUSA जारी किया गया था, और यह पहली वाक् संश्लेषण प्रणालियों में से एक थी। इसमें एक स्टैंड-अलोन कंप्यूटर हार्डवेयर और एक विशेष सॉफ्टवेयर शामिल था जो इसे इतालवी पढ़ने में सक्षम बनाता था। 1978 में जारी एक दूसरा संस्करण, "ए कैपेला" शैली में इतालवी गाने में भी सक्षम था।

1980 और 1990 के दशक में प्रमुख प्रणालियाँ DECtalk प्रणाली थीं, जो मुख्य रूप से MIT में डेनिस क्लैट के काम पर आधारित थी, और बेल लैब्स प्रणाली; बाद वाली पहली बहुभाषी भाषा-स्वतंत्र प्रणालियों में से एक थी, जिसमें प्राकृतिक भाषा प्रसंस्करण तकनीकों का व्यापक उपयोग किया गया।

आधुनिक दृष्टिकोण और अनुप्रयोग

मशीन लर्निंग और डीप लर्निंग के उदय के साथ, वाक् संश्लेषण तंत्रिका-आधारित विधियों की ओर स्थानांतरित हो गया है। तंत्रिका नेटवर्क पाठ से वाणी तक के जटिल मानचित्रण को सीधे मॉडल कर सकते हैं, जो अक्सर पहले के संयोजनात्मक या फॉर्मेंट-आधारित प्रणालियों की तुलना में अधिक प्राकृतिक-ध्वनि वाला आउटपुट उत्पन्न करते हैं। ये आधुनिक प्रणालियाँ अक्सर ट्रांसफॉर्मर आर्किटेक्चर का लाभ उठाती हैं, जो बड़े भाषा मॉडल के लिए भी मौलिक हैं, ताकि भाषा और प्रोसोडी में दीर्घकालिक निर्भरता को पकड़ा जा सके।

समकालीन टेक्स्ट-टू-स्पीच इंजन उपभोक्ता उपकरणों, नेविगेशन प्रणालियों और आभासी सहायकों में व्यापक रूप से तैनात हैं। एप्पल, सैमसंग, और गूगल डीपमाइंड जैसी कंपनियों ने अपने उत्पादों में उन्नत संश्लेषण को एकीकृत किया है। यह प्रौद्योगिकी ऑपरेटिंग सिस्टम में एक्सेसिबिलिटी सुविधाओं का भी समर्थन करती है, जिससे दृष्टिबाधित उपयोगकर्ताओं के लिए स्क्रीन रीडर सक्षम होते हैं। 2020 के दशक तक, शोध भावनात्मक अभिव्यक्ति, आवाज क्लोनिंग, और इंटरैक्टिव अनुप्रयोगों के लिए वास्तविक समय संश्लेषण में सुधार पर केंद्रित है।

मूल्यांकन और चुनौतियाँ

वाक् संश्लेषकों का मूल्यांकन करने में व्यक्तिपरक श्रवण परीक्षण और वस्तुनिष्ठ मेट्रिक्स दोनों शामिल हैं। व्यक्तिपरक परीक्षण स्वाभाविकता और सुगमता को मापते हैं, अक्सर माध्य राय स्कोर का उपयोग करते हुए। वस्तुनिष्ठ उपाय ध्वनिक विशेषताओं की तुलना कर सकते हैं या स्पष्टता का आकलन करने के लिए स्वचालित वाक् पहचान का उपयोग कर सकते हैं। विविध भाषाओं, बोलियों और बोलने की शैलियों को संभालने के साथ-साथ ऑन-डिवाइस तैनाती के लिए कम्प्यूटेशनल लागत को कम करने में चुनौतियाँ बनी हुई हैं। आवाज स्पूफिंग और क्लोन की गई आवाजों के दुरुपयोग की संभावना के साथ नैतिक विचार भी उठते हैं, जिससे जनरेटिव एआई समुदाय में चल रही चर्चा होती है।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:speech-synthesis·text-to-speech·computer-speech·accessibility-technology
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास