LJSpeech एक व्यापक रूप से उपयोग किया जाने वाला भाषण डेटासेट है जिसमें एक महिला वक्ता द्वारा सात गैर-काल्पनिक पुस्तकों के अंश पढ़ने के 13,100 लघु ऑडियो क्लिप शामिल हैं। क्लिप कुल मिलाकर लगभग 24 घंटे के भाषण का प्रतिनिधित्व करती हैं और ये लिब्रीवॉक्स (LibriVox) की सार्वजनिक डोमेन ऑडियोबुक रिकॉर्डिंग से ली गई हैं। प्रत्येक क्लिप के साथ एक पाठ प्रतिलेख (transcript) जुड़ा होता है, जिससे यह डेटासेट टेक्स्ट-टू-स्पीच (TTS) प्रणालियों और अन्य भाषण प्रसंस्करण मॉडलों के पर्यवेक्षित प्रशिक्षण के लिए उपयुक्त बनता है। यह डेटासेट कीथ इटो (Keith Ito) द्वारा बनाया गया था और 2017 में सार्वजनिक डोमेन समर्पण के तहत जारी किया गया था, जिसने शैक्षणिक अनुसंधान और वाणिज्यिक अनुप्रयोगों दोनों में इसकी लोकप्रियता में योगदान दिया है।
वक्ता की पहचान केवल अमेरिकी अंग्रेजी उच्चारण वाली महिला के रूप में की गई है, और रिकॉर्डिंग मूल रूप से 1984 में बनाई गई थीं। ऑडियो को 22050 हर्ट्ज की नमूना दर और 16 बिट की बिट गहराई पर नमूना किया गया है, और क्लिप की अवधि लगभग 1 से 10 सेकंड तक होती है। यह डेटासेट अक्सर एकल-वक्ता TTS के लिए एक बेंचमार्क के रूप में उपयोग किया जाता है, और कई आधुनिक तंत्रिका TTS आर्किटेक्चर, जैसे कि Tacotron 2 और FastSpeech, का मूल्यांकन इस पर किया गया है। इसकी स्वच्छ रिकॉर्डिंग और सुसंगत वक्ता पहचान के कारण, LJSpeech मॉडल प्रदर्शन की तुलना के लिए एक मानक संदर्भ बिंदु के रूप में कार्य करता है।
डेटासेट संरचना और सामग्री
डेटासेट को एक एकल संग्रह के रूप में वितरित किया जाता है जिसमें तीन फ़ाइलें होती हैं: एक मेटाडेटा CSV, WAV ऑडियो फ़ाइलों का एक फ़ोल्डर, और एक README। मेटाडेटा फ़ाइल प्रत्येक क्लिप की ID, प्रतिलेखित पाठ, और मूल पुस्तक और अध्याय को सूचीबद्ध करती है जिससे अंश लिया गया था। पुस्तकों में A History of England और The Scientific American जैसे शीर्षक शामिल हैं, और अंश विभिन्न विषयों को कवर करते हैं, जो विविध ध्वन्यात्मक सामग्री प्रदान करते हैं। प्रतिलेख मूल विराम चिह्न और पूंजीकरण को संरक्षित करते हैं, जो उन मॉडलों के प्रशिक्षण में सहायता करता है जो स्वर-विज्ञान (prosody) और विराम चिह्न को संभालते हैं। ऑडियो फ़ाइलों के नाम क्रमिक संख्याओं के साथ होते हैं, और डेटासेट में README में एक प्रशिक्षण/सत्यापन विभाजन सुझाव शामिल है, हालांकि कोई आधिकारिक विभाजन लागू नहीं किया गया है।
भाषण संश्लेषण में अनुप्रयोग
LJSpeech मुख्य रूप से एआई मॉडलों को प्रशिक्षित करने के लिए उपयोग किया जाता है जो पाठ को बोले गए ऑडियो में परिवर्तित करते हैं। यह गहन शिक्षण आधारित TTS प्रणालियों के विकास के लिए एक प्रमुख संसाधन रहा है, जिसमें तंत्रिका नेटवर्क और ट्रांसफॉर्मर आर्किटेक्चर पर आधारित प्रणालियाँ शामिल हैं। उदाहरण के लिए, Google DeepMind और Google के शोधकर्ताओं द्वारा विकसित Tacotron 2 मॉडल ने प्रशिक्षण और मूल्यांकन के लिए LJSpeech का उपयोग किया। इसी तरह, माइक्रोसॉफ्ट के FastSpeech और FastSpeech 2 मॉडल ने इस डेटासेट का उपयोग किया। डेटासेट की एकल-वक्ता प्रकृति शोधकर्ताओं को बहु-वक्ता परिवर्तनशीलता की अतिरिक्त जटिलता के बिना स्वर-विज्ञान और उच्चारण की चुनौतियों को अलग करने की अनुमति देती है। इसका उपयोग आवाज़ रूपांतरण और जनरेटिव एआई अनुसंधान में भी किया जाता है, जहां मॉडल उसी आवाज़ में भाषण संश्लेषित करना सीखते हैं।
लाइसेंसिंग और उपलब्धता
डेटासेट को क्रिएटिव कॉमन्स CC0 1.0 यूनिवर्सल पब्लिक डोमेन समर्पण के तहत जारी किया गया है, जिसका अर्थ है कि इसका उपयोग बिना किसी श्रेय के किसी भी उद्देश्य के लिए किया जा सकता है। इस अनुमोदक लाइसेंस ने इसे ओपन-सोर्स भाषण परियोजनाओं और वाणिज्यिक उत्पादों दोनों में एक प्रमुख बना दिया है। यह लिब्रीवॉक्स वेबसाइट पर होस्ट किया गया है और कागल (Kaggle) और हगिंग फेस (Hugging Face) जैसे प्लेटफार्मों पर भी मिरर किया गया है। मूल रिकॉर्डिंग लिब्रीवॉक्स से हैं, जो स्वयं स्वयंसेवकों द्वारा पढ़ी गई सार्वजनिक डोमेन ऑडियोबुक प्रदान करता है। वक्ता की पहचान का खुलासा नहीं किया गया है, जो प्रशिक्षण के लिए एक सुसंगत आवाज़ प्रदान करते हुए गोपनीयता की रक्षा करता है।
सीमाएँ और विकल्प
अपनी लोकप्रियता के बावजूद, LJSpeech की सीमाएँ हैं। इसमें केवल एक वक्ता शामिल है, जो बहु-वक्ता TTS या वक्ता अनुकूलन अनुसंधान के लिए इसके उपयोग को प्रतिबंधित करता है। रिकॉर्डिंग 1984 की हैं, इसलिए ऑडियो गुणवत्ता, हालांकि स्वच्छ है, आधुनिक रिकॉर्डिंग मानकों को प्रतिबिंबित नहीं कर सकती है। शब्दावली पुस्तकों की सामग्री तक सीमित है, जो सभी संवादात्मक या तकनीकी शब्दों को कवर नहीं कर सकती है। व्यापक कवरेज के लिए, शोधकर्ता अक्सर लिब्रीटीटीएस (LibriTTS), वीसीटीके (VCTK), या कॉमन वॉइस (Common Voice) कोष जैसे डेटासेट की ओर रुख करते हैं, जिनमें कई वक्ता और अधिक विविध सामग्री शामिल होती है। हालांकि, LJSpeech अपनी सरलता और विश्वसनीयता के कारण प्रोटोटाइपिंग और बेंचमार्किंग के लिए एक मानक पहली पसंद बना हुआ है।
प्रभाव और विरासत
अपनी रिलीज़ के बाद से, LJSpeech को सैकड़ों शोध पत्रों में उद्धृत किया गया है और यह भाषण संश्लेषण समुदाय में एक डी-फैक्टो मानक बन गया है। इसकी सफलता ने नैन्सी कोर्पस (Nancy Corpus) और ब्लिज़ार्ड चैलेंज डेटा जैसे समान एकल-वक्ता डेटासेट को प्रेरित किया है। डेटासेट की सार्वजनिक डोमेन स्थिति ने प्रतिलिपि योग्य अनुसंधान की सुविधा भी प्रदान की है, क्योंकि कोई भी बिना कानूनी बाधाओं के इसे डाउनलोड और उपयोग कर सकता है। 2020 के दशक के मध्य तक, यह सक्रिय रूप से उपयोग किया जा रहा है, भले ही अधिक डेटा और उच्च गुणवत्ता वाले नए डेटासेट उभर रहे हों। इसकी विरासत तंत्रिका TTS के तेजी से विकास से जुड़ी हुई है, जो संयोजनात्मक (concatenative) और पैरामीट्रिक तरीकों से एंड-टू-एंड गहन शिक्षण की ओर बढ़ा, जो मुख्य रूप से इस तरह के सुलभ डेटासेट द्वारा सक्षम किया गया।