Wav2Vec एक मशीन-लर्निंग ढांचा है जो स्व-पर्यवेक्षित भाषण प्रतिनिधित्व सीखने के लिए है, जिसे सितंबर 2019 में फेसबुक एआई रिसर्च (अब मेटा-एआई का हिस्सा) के शोधकर्ताओं द्वारा पेश किया गया था। यह मॉडल कच्चे तरंग रूपों से सीधे सामान्य-उद्देश्यीय ऑडियो विशेषताएँ सीखता है, बिना प्रीट्रेनिंग के दौरान प्रतिलेखित भाषण डेटा की आवश्यकता के। यह दृष्टिकोण लेबल किए गए भाषण कोरपोरा की कमी को संबोधित करता है, जो कहीं अधिक प्रचुर मात्रा में उपलब्ध अलेबल ऑडियो का लाभ उठाकर करता है।
मूल Wav2Vec आर्किटेक्चर एक बहु-परत कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करता है ताकि कच्चे ऑडियो को अव्यक्त प्रतिनिधित्व में एनकोड किया जा सके, इसके बाद एक कंट्रास्टिव लॉस होता है जो पिछले संदर्भ से भविष्य के समय-चरणों की भविष्यवाणी करता है। यह प्रीट्रेनिंग उद्देश्य मॉडल को भाषण में ध्वन्यात्मक और ध्वनिक नियमितताओं को पकड़ने के लिए मजबूर करता है। प्रीट्रेनिंग के बाद, सीखे गए प्रतिनिधित्व को डाउनस्ट्रीम कार्यों जैसे स्वचालित भाषण पहचान (ASR) पर अपेक्षाकृत छोटे लेबल किए गए डेटासेट के साथ फाइन-ट्यून किया जा सकता है, जो पूरी तरह से लेबल किए गए डेटा पर प्रशिक्षित मॉडलों की तुलना में प्रतिस्पर्धी परिणाम प्राप्त करता है।
आर्किटेक्चर और प्रशिक्षण
प्रारंभिक Wav2Vec मॉडल (v1) में पांच कन्वोल्यूशनल परतों वाला एक एनकोडर नेटवर्क शामिल था जो 16 kHz ऑडियो तरंग रूपों को प्रति सेकंड 100 की दर से फीचर वेक्टर में संसाधित करता था। बारह कन्वोल्यूशनल परतों वाला एक संदर्भ नेटवर्क फिर इन विशेषताओं को लगभग 210 मिलीसेकंड के ग्रहणशील क्षेत्र में एकत्रित करता था। प्रशिक्षण में एक कंट्रास्टिव लॉस का उपयोग किया गया जो वास्तविक भविष्य के नमूनों को उसी उच्चारण से लिए गए नकारात्मक नमूनों से अलग करता था, एक तकनीक जो शोर-कंट्रास्टिव अनुमान से प्रेरित थी।
जून 2020 में, अनुवर्ती Wav2Vec 2.0 ने एक ट्रांसफॉर्मर-आधारित संदर्भ नेटवर्क और एक क्वांटाइजेशन मॉड्यूल पेश किया। एनकोडर कन्वोल्यूशनल बना रहा, लेकिन संदर्भ नेटवर्क 12 परतों और 8 ध्यान हेड्स वाला एक ट्रांसफॉर्मर बन गया, जो 25 ms विंडो और 20 ms स्ट्राइड पर काम करता था। Wav2Vec 2.0 ने एक उत्पाद क्वांटाइजेशन परत भी जोड़ी जो अव्यक्त प्रतिनिधित्व को एक सीमित कोडबुक में असतत करती थी, जिससे मॉडल निरंतर और असतत दोनों भाषण इकाइयाँ सीख सके। इस संस्करण ने LibriSpeech बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए, जिसमें केवल 10 मिनट के लेबल किए गए डेटा के साथ स्वच्छ परीक्षण सेट पर शब्द त्रुटि दर 1.8% और अन्य परीक्षण सेट पर 3.3% तक कम हो गई।
स्व-पर्यवेक्षित शिक्षण प्रतिमान
Wav2Vec स्व-पर्यवेक्षित शिक्षण की व्यापक श्रेणी से संबंधित है, जो आधुनिक डीप-लर्निंग की आधारशिला बन गया है। लेबल किए गए उदाहरणों की आवश्यकता वाले पर्यवेक्षित तरीकों के विपरीत, स्व-पर्यवेक्षित दृष्टिकोण डेटा से ही छद्म-लेबल उत्पन्न करते हैं। भाषण के लिए, इसका मतलब ऑडियो सिग्नल के मास्क किए गए या भविष्य के हिस्सों की भविष्यवाणी करना है। Wav2Vec की सफलता ने प्रदर्शित किया कि कच्चे तरंग रूपों में स्थानांतरणीय प्रतिनिधित्व सीखने के लिए पर्याप्त संरचना होती है, जैसे बड़े-भाषा-मॉडल अलेबल पाठ से सीखते हैं।
Wav2Vec 2.0 में प्रीट्रेनिंग उद्देश्य में अव्यक्त फीचर स्पैन के एक अनुपात (आमतौर पर 50%) को मास्क करना और ट्रांसफॉर्मर को उन मास्क किए गए पदों के लिए क्वांटाइज्ड लक्ष्यों की भविष्यवाणी करने के लिए प्रशिक्षित करना शामिल है। यह मास्क किया गया भविष्यवाणी कार्य, जो एनएलपी में मास्क किए गए भाषा मॉडलिंग के समान है, मॉडल को लंबी दूरी के ध्वनिक संदर्भ को एकीकृत करने के लिए मजबूर करता है। इस दृष्टिकोण ने पिछले तरीकों की तुलना में लेबल किए गए डेटा की आवश्यकता को 100 गुना तक कम कर दिया, जिससे यह कम-संसाधन भाषाओं के लिए व्यावहारिक हो गया।
प्रभाव और अनुप्रयोग
Wav2Vec का भाषण प्रसंस्करण अनुसंधान और उद्योग अनुप्रयोगों पर महत्वपूर्ण प्रभाव पड़ा है। इसने HuBERT और WavLM जैसे बाद के मॉडलों के लिए एक आधार प्रदान किया, जिन्होंने स्व-पर्यवेक्षित उद्देश्यों को परिष्कृत किया। यह ढांचा आवाज सहायकों, प्रतिलेखन सेवाओं और भाषा सीखने के उपकरणों के लिए उत्पादन प्रणालियों में अपनाया गया है, विशेष रूप से उन परिदृश्यों में जहां लेबल किए गए डेटा दुर्लभ है।
मॉडल ने कृत्रिम-बुद्धिमत्ता में प्रीट्रेन्ड फाउंडेशन मॉडल के व्यापक चलन में भी योगदान दिया। इसकी सफलता कंप्यूटर विजन और एनएलपी में विकास के समानांतर थी, जहां बड़े अलेबल कोरपोरा पर प्रीट्रेनिंग के बाद फाइन-ट्यूनिंग मानक प्रतिमान बन गया। Wav2Vec की कच्चे तरंग रूपों के साथ काम करने की क्षमता, न कि मेल-फ्रीक्वेंसी सेप्स्ट्रल गुणांक जैसी हाथ से बनाई गई विशेषताओं के साथ, पाइपलाइन को सरल बनाती है और विभिन्न ध्वनिक स्थितियों में मजबूती में सुधार करती है।
सीमाएँ और विस्तार
अपनी ताकत के बावजूद, Wav2Vec की सीमाएँ हैं। मूल मॉडल को प्रीट्रेनिंग के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की आवश्यकता थी, हालांकि जारी किए गए चेकपॉइंट्स ने अंतिम उपयोगकर्ताओं के लिए इसे कम कर दिया। प्रतिनिधित्व मुख्य रूप से ASR के लिए अनुकूलित हैं और अतिरिक्त अनुकूलन के बिना वक्ता सत्यापन या भावना पहचान जैसे अन्य कार्यों में पूरी तरह से स्थानांतरित नहीं हो सकते हैं। मॉडल 16 kHz की एक निश्चित इनपुट नमूनाकरण दर भी मानता है, जो टेलीफोनी या संपीड़ित ऑडियो के लिए एक बाधा हो सकती है।
Wav2Vec के विस्तार में बहुभाषी प्रशिक्षण के लिए Wav2Vec 2.0 का संस्करण शामिल है, जिसे 53 भाषाओं पर प्रशिक्षित किया गया था और 2021 में जारी किया गया था। एक और विस्तार, XLS-R, ने 436,000 घंटे से अधिक ऑडियो के साथ 128 भाषाओं तक दृष्टिकोण को बढ़ाया, यह प्रदर्शित करते हुए कि स्व-पर्यवेक्षित भाषण मॉडल विविध भाषाई परिवारों में सामान्यीकरण कर सकते हैं। इन विकासों ने Wav2Vec को भाषण एआई में एक मौलिक योगदान के रूप में स्थापित किया है, जो एनएलपी में प्रारंभिक ट्रांसफॉर्मर मॉडल के प्रभाव के बराबर है।
विरासत
Wav2Vec की शुरुआत ने भाषण पहचान अनुसंधान में एक महत्वपूर्ण मोड़ चिह्नित किया, जिसने क्षेत्र को पूरी तरह से पर्यवेक्षित दृष्टिकोणों से दूर स्व-पर्यवेक्षित प्रीट्रेनिंग की ओर स्थानांतरित कर दिया। इसके सिद्धांतों को वाणिज्यिक भाषण एपीआई और हगिंग फेस ट्रांसफॉर्मर और फेयरसीक जैसे ओपन-सोर्स टूलकिट में शामिल किया गया है। मॉडल की सफलता ने संगीत और बायोमेडिकल सिग्नल सहित अन्य मोडैलिटीज के लिए स्व-पर्यवेक्षित शिक्षण में अनुसंधान को भी प्रेरित किया, इस विचार को मजबूत करते हुए कि कच्चे डेटा में समृद्ध अव्यक्त संरचना होती है जिसे स्पष्ट लेबल के बिना दोहन किया जा सकता है।