LibriSpeech अंग्रेजी भाषण का एक बड़े पैमाने का कोर्पस है, जो ऑडियोबुक से लिया गया है, जिसे वासिल पानायोटोव और जॉन्स हॉपकिन्स विश्वविद्यालय के सहयोगियों ने बनाया और 2015 में जारी किया। यह स्वचालित भाषण पहचान (ASR) और टेक्स्ट-टू-स्पीच (TTS) प्रणालियों के प्रशिक्षण और मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है। इस कोर्पस में लगभग 1,000 घंटे का पठित भाषण शामिल है, जिसे 16 kHz पर नमूना लिया गया है, और इसे मॉडल प्रशिक्षण और परीक्षण के लिए अलग-अलग कठिनाई वाले उपसमूहों में व्यवस्थित किया गया है।
यह डेटासेट LibriVox परियोजना से सार्वजनिक-डोमेन ऑडियोबुक की ऑडियो रिकॉर्डिंग से बनाया गया था, जिसे प्रोजेक्ट गुटेनबर्ग के संबंधित पाठ के साथ जोड़ा गया। निर्माताओं ने सटीक प्रतिलेखन और ऑडियो गुणवत्ता सुनिश्चित करने के लिए एक कठोर संरेखण और फ़िल्टरिंग पाइपलाइन लागू की। LibriSpeech अपने आकार, वक्ताओं की विविधता (2,400 से अधिक वक्ता), और पठित भाषण की प्राकृतिक लय के लिए उल्लेखनीय है, जो इसे भाषण प्रसंस्करण में मशीन-लर्निंग और डीप-लर्निंग अनुसंधान को आगे बढ़ाने के लिए एक मूल्यवान संसाधन बनाता है।
कोर्पस संरचना और उपसमूह
LibriSpeech को कई उपसमूहों में विभाजित किया गया है: train-clean-100, train-clean-360, train-other-500, dev-clean, dev-other, test-clean, और test-other। 'clean' उपसमूहों में न्यूनतम पृष्ठभूमि शोर और स्पष्ट उच्चारण वाले वक्ताओं की रिकॉर्डिंग होती है, जबकि 'other' उपसमूहों में अधिक चुनौतीपूर्ण स्थितियाँ शामिल होती हैं, जैसे अलग-अलग उच्चारण या हल्का शोर। प्रशिक्षण उपसमूहों में कुल लगभग 960 घंटे हैं, जबकि विकास और परीक्षण सेट में प्रत्येक में लगभग 5 घंटे हैं। यह संरचना शोधकर्ताओं को स्वच्छ डेटा पर मॉडल प्रशिक्षित करने और कठिन परिस्थितियों पर मजबूती का मूल्यांकन करने की अनुमति देती है।
प्रत्येक उच्चारण को एक FLAC ऑडियो फ़ाइल और एक पाठ प्रतिलेख के साथ प्रदान किया जाता है। कोर्पस में वक्ता आईडी और अध्याय जानकारी भी शामिल है, जो वक्ता-निर्भर या बहु-वक्ता प्रयोगों को सक्षम बनाती है। 'other' उपसमूह यथार्थवादी परिवर्तनशीलता के तहत ASR प्रणालियों का तनाव-परीक्षण करने के लिए विशेष रूप से उपयोगी हैं।
भाषण पहचान अनुसंधान में भूमिका
LibriSpeech ASR के लिए वास्तविक मानक बेंचमार्क बन गया है। कई महत्वपूर्ण मॉडल, जिनमें न्यूरल-नेटवर्क आर्किटेक्चर पर आधारित मॉडल शामिल हैं, LibriSpeech परीक्षण सेटों पर प्रदर्शन की रिपोर्ट करते हैं। उदाहरण के लिए, ट्रांसफॉर्मर-आधारित मॉडल और लार्ज-लैंग्वेज-मॉडल-एकीकृत भाषण प्रणालियाँ अक्सर test-clean और test-other पर शब्द त्रुटि दर (WER) को प्रमुख मीट्रिक के रूप में उद्धृत करती हैं। कोर्पस का आकार और खुली उपलब्धता ने पारंपरिक छिपे हुए मार्कोव मॉडल से लेकर आधुनिक एंड-टू-एंड प्रणालियों तक विभिन्न दृष्टिकोणों में प्रतिलिपि प्रस्तुत करने योग्य तुलना सक्षम की है।
शोधकर्ताओं ने ट्रांसफर लर्निंग और प्री-ट्रेनिंग के लिए भी LibriSpeech का उपयोग किया है। wav2vec 2.0 और HuBERT जैसे मॉडल LibriSpeech या इसके बड़े संस्करणों पर प्री-ट्रेन किए गए थे, जो सरल पर्यवेक्षित प्रशिक्षण से परे कोर्पस की उपयोगिता को प्रदर्शित करता है। संरेखित पाठ की उपलब्धता ने बलपूर्वक संरेखण और उच्चारण मॉडलिंग में अनुसंधान की भी सुविधा प्रदान की है।
विस्तार और विविधताएँ
विशिष्ट अनुसंधान आवश्यकताओं को संबोधित करने के लिए LibriSpeech के कई विस्तार जारी किए गए हैं। LibriSpeech-100 और LibriSpeech-360 मूल प्रशिक्षण डेटा के उपसमूह हैं। LibriTTS, LibriSpeech से व्युत्पन्न, 24 kHz पर उच्च-गुणवत्ता वाला ऑडियो प्रदान करता है जिसमें वाक्य-स्तरीय विभाजन होता है, जिसे TTS अनुसंधान के लिए डिज़ाइन किया गया है। Libri-Light एक बहुत बड़ा अलेबल कोर्पस है (60,000 घंटे से अधिक) जो उसी ऑडियोबुक स्रोत से निकाला गया है, जो स्व-पर्यवेक्षित लर्निंग के लिए है। इन विविधताओं ने विभिन्न भाषण कार्यों में मूल कोर्पस के प्रभाव का विस्तार किया है।
इसके अतिरिक्त, LibriSpeech का उपयोग मजबूत ASR अध्ययनों के लिए शोर या प्रतिध्वनि वाले संस्करण बनाने में किया गया है, जैसे MUSAN कोर्पस से जोड़ा गया पृष्ठभूमि शोर वाला LibriSpeech। ये अनुकूलन शोधकर्ताओं को नया डेटा एकत्र किए बिना प्रतिकूल परिस्थितियों में मॉडल प्रदर्शन का मूल्यांकन करने की अनुमति देते हैं।
प्रभाव और सीमाएँ
LibriSpeech ने एक बड़ा, मुफ्त और अच्छी तरह से प्रलेखित संसाधन प्रदान करके भाषण प्रौद्योगिकी में प्रगति को काफी तेज किया है। इसकी सफलता ने अन्य भाषाओं और डोमेन में समान कोर्पस को प्रेरित किया है। हालाँकि, कोर्पस की सीमाएँ हैं: इसमें केवल ऑडियोबुक से पठित भाषण शामिल है, जो सहज संवादात्मक भाषण से भिन्न है। शब्दावली भी साहित्यिक भाषा तक सीमित है, जिसमें डोमेन-विशिष्ट शब्दों की कमी है। इसके अलावा, वक्ता वितरण कुछ जनसांख्यिकी की ओर झुका हुआ है, जो प्रशिक्षित मॉडलों में पूर्वाग्रह पेश कर सकता है।
इन सीमाओं के बावजूद, LibriSpeech आर्टिफिशियल-इंटेलिजेंस अनुसंधान में एक मौलिक संसाधन बना हुआ है। शैक्षणिक और औद्योगिक सेटिंग्स में इसका निरंतर उपयोग ASR से लेकर वक्ता सत्यापन और भावना पहचान तक भाषण-संबंधी कार्यों के लिए एक बेंचमार्क के रूप में इसके महत्व को रेखांकित करता है।