CMU उच्चारण शब्दकोश (जिसे cmudict भी कहा जाता है) उत्तर अमेरिकी अंग्रेजी के लिए एक मशीन-पठनीय उच्चारण शब्दकोश है। इसे Carnegie Mellon University में बनाया गया था और विश्वविद्यालय के भाषण समूह द्वारा अनुरक्षित किया जाता है। यह शब्दकोश शब्दों से उनके ध्वन्यात्मक प्रतिलेखन तक मानचित्रण प्रदान करता है, जिसमें 39 स्वनिम (तनाव चिह्नकों सहित) का समुच्चय उपयोग होता है। इसे सार्वजनिक डोमेन में जारी किया गया है, जिससे यह भाषण प्रौद्योगिकी और कम्प्यूटेशनल भाषाविज्ञान के लिए एक आधारभूत संसाधन बन गया है।
शब्दकोश की उत्पत्ति 1980 के दशक में हुई, जिसे कार्नेगी मेलन में भाषण पहचान अनुसंधान के लिए विकसित किया गया था। इसका पहला सार्वजनिक संस्करण 1993 में जारी हुआ, और तब से इसे लगातार अद्यतन किया जा रहा है। वर्तमान संस्करण (0.7b) में 134,000 से अधिक प्रविष्टियाँ हैं, जिनमें सामान्य शब्द, व्यक्तिवाचक संज्ञाएँ और संक्षिप्ताक्षर शामिल हैं। प्रत्येक प्रविष्टि में शब्द को लोअरकेस में सूचीबद्ध किया जाता है, उसके बाद स्वरों के बाद तनाव संकेतक (0, 1, या 2) के साथ उसका स्वनिम अनुक्रम दिया जाता है।
स्वनिम समुच्चय और प्रतिलेखन प्रारूप
CMU उच्चारण शब्दकोश ARPABET प्रणाली पर आधारित एक स्वनिम समुच्चय का उपयोग करता है, जिसे मूल रूप से ARPA भाषण समझ अनुसंधान परियोजना के लिए विकसित किया गया था। इस समुच्चय में 39 स्वनिम शामिल हैं, जैसे स्वर (उदाहरण के लिए, AA, IY, UW) और व्यंजन (उदाहरण के लिए, K, S, T)। तनाव को अंकों से चिह्नित किया जाता है: 0 का अर्थ कोई तनाव नहीं, 1 का अर्थ प्राथमिक तनाव, और 2 का अर्थ द्वितीयक तनाव। उदाहरण के लिए, "hello" शब्द का प्रतिलेखन "HH AH0 L OW1" है। यह प्रारूप सरल, ASCII-आधारित है, और सॉफ्टवेयर द्वारा आसानी से पार्स किया जा सकता है।
शब्दकोश में कई शब्दों के लिए एकाधिक उच्चारण भी शामिल हैं, जिन्हें कोष्ठकीय संख्याओं (उदाहरण के लिए, "the(1)" और "the(2)") द्वारा दर्शाया जाता है। ये प्रकार क्षेत्रीय या सन्दर्भगत अंतरों को दर्शाते हैं, जैसे "the" में श्वा बनाम तनावग्रस्त स्वर। इसके अतिरिक्त, इसमें विभक्ति रूपों, समासों, और अंग्रेजी में सामान्यतः प्रयुक्त कुछ विदेशी शब्दों की प्रविष्टियाँ भी हैं।
भाषण प्रौद्योगिकी में अनुप्रयोग
यह शब्दकोश Artificial intelligence और Machine learning पाइपलाइनों में भाषण प्रसंस्करण के लिए एक मानक संसाधन है। इसे स्वचालित भाषण पहचान (ASR) प्रणालियों में उच्चारण शब्दावली के रूप में उपयोग किया जाता है, जिससे मॉडल ध्वनिक संकेतों को शब्द अनुक्रमों से मानचित्रित कर सकते हैं। पाठ-से-भाषण (TTS) संश्लेषण में, यह प्राकृतिक-ध्वनि वाला भाषण उत्पन्न करने के लिए आवश्यक ध्वन्यात्मक इनपुट प्रदान करता है। कई ओपन-सोर्स टूलकिट, जैसे कि Kaldi और ESPnet, cmudict को डिफ़ॉल्ट शब्दावली के रूप में शामिल करते हैं।
ASR और TTS के अलावा, यह शब्दकोश Natural language processing कार्यों जैसे कि ग्राफीम-से-स्वनिम रूपांतरण में उपयोग होता है, जहाँ मॉडल अनदेखे शब्दों के लिए उच्चारण की भविष्यवाणी करना सीखते हैं। यह उच्चारण भविष्यवाणी एल्गोरिदम के मूल्यांकन के लिए एक बेंचमार्क के रूप में भी कार्य करता है। Stanford AI Lab और MIT CSAIL जैसे संस्थानों के शोधकर्ताओं ने ध्वन्यात्मक संरेखण और भाषण संश्लेषण पर अध्ययनों में cmudict का उपयोग किया है।
प्रारूप और वितरण
शब्दकोश को एक सादे पाठ फ़ाइल के रूप में वितरित किया जाता है, जिसमें प्रति पंक्ति एक प्रविष्टि होती है। प्रारूप है: शब्द, उसके बाद एक या अधिक स्थान, फिर स्वनिम अनुक्रम। टिप्पणियाँ और मेटाडेटा न्यूनतम हैं, जिससे फ़ाइल कॉम्पैक्ट रहती है। इसे कार्नेगी मेलन भाषण समूह की वेबसाइट से डाउनलोड किया जा सकता है और कई ओपन-सोर्स रिपॉजिटरीज़ पर मिरर किया गया है। सार्वजनिक-डोमेन स्थिति अप्रतिबंधित उपयोग, संशोधन और पुनर्वितरण की अनुमति देती है, जिससे यह वाणिज्यिक और शैक्षणिक परियोजनाओं के लिए एक पसंदीदा विकल्प बन जाता है।
वर्षों में, cmudict से कई व्युत्पन्न संसाधन बनाए गए हैं, जिनमें अन्य भाषाओं के लिए उच्चारण शब्दकोश (अनुवाद के माध्यम से) और अक्षर सीमाओं या शब्द-भेद टैग वाली शब्दावलियाँ शामिल हैं। ये व्युत्पन्न संसाधन अक्सर Deep learning भाषण और भाषा मॉडलों में उपयोग होते हैं, जहाँ वे अंत-से-अंत प्रणालियों के लिए पर्यवेक्षण संकेत प्रदान करते हैं।
सीमाएँ और विस्तार
व्यापक होने के बावजूद, शब्दकोश की ज्ञात सीमाएँ हैं। यह केवल उत्तर अमेरिकी अंग्रेजी को कवर करता है, और इसका स्वनिम समुच्चय सभी बोलीगत विविधताओं को पकड़ नहीं पाता। कुछ प्रविष्टियाँ पुरानी हो सकती हैं या हाल के व्यक्तिवाचक संज्ञाओं और तकनीकी शब्दों को लुप्त कर सकती हैं। इसे संबोधित करने के लिए, सामुदायिक प्रयासों ने विस्तारित संस्करण उत्पन्न किए हैं, जैसे कि Wiktionary से जोड़े गए शब्दों वाला cmudict या तनाव और अक्षर एनोटेशन वाला CMUdict। ये विस्तार आधुनिक Transformer (architecture)-आधारित TTS प्रणालियों में अक्सर उपयोग होते हैं, जिन्हें बड़ी, विविध शब्दावलियों की आवश्यकता होती है।
इन सीमाओं के बावजूद, CMU उच्चारण शब्दकोश भाषण अनुसंधान का एक आधारस्तंभ बना हुआ है। इसकी सरलता, विश्वसनीयता और खुला लाइसेंस तीन दशकों से अधिक समय तक इसकी निरंतर प्रासंगिकता सुनिश्चित कर चुके हैं, प्रारंभिक नियम-आधारित प्रणालियों से लेकर समकालीन Neural network दृष्टिकोणों तक।
यह भी देखें
- Sequence-to-Sequence (Seq2Seq) उन मॉडलों के लिए जो उच्चारण शब्दावलियों का उपयोग करते हैं
- Data Augmentation उन तकनीकों के लिए जो सिंथेटिक भाषण डेटा उत्पन्न करती हैं
- Carnegie Mellon University मूल संस्थान के रूप में