Whisper एक मशीन लर्निंग मॉडल है जो भाषण पहचान और प्रतिलेखन के लिए है, जिसे OpenAI द्वारा बनाया गया और सितंबर 2022 में पहली बार ओपन-सोर्स सॉफ्टवेयर के रूप में जारी किया गया। यह अंग्रेजी और कई अन्य भाषाओं में भाषण का प्रतिलेखन करने में सक्षम है, और कई गैर-अंग्रेजी भाषाओं का अंग्रेजी में अनुवाद कर सकता है। Whisper एक कमजोर-पर्यवेक्षित गहन शिक्षण ध्वनिक मॉडल है, जो एन्कोडर-डिकोडर ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करके बनाया गया है। OpenAI का दावा है कि इसके विकास में उपयोग किए गए विभिन्न प्रशिक्षण डेटा और पोस्ट-प्रशिक्षण फ़िल्टरिंग के संयोजन ने पिछले दृष्टिकोणों की तुलना में उच्चारण, पृष्ठभूमि शोर और शब्दजाल की बेहतर पहचान की है। जबकि मॉडल बड़े, अधिक विशिष्ट मॉडलों से बेहतर प्रदर्शन नहीं करता है और अभी भी AI मतिभ्रम का अनुभव करता है, यह सामान्य ध्वनि पहचान के लिए उपयोगी साबित हुआ है और विभिन्न उद्योगों में इसके कई अनुप्रयोग हैं।
पृष्ठभूमि
भाषण पहचान का शोध में एक लंबा इतिहास रहा है; पहले दृष्टिकोणों ने सांख्यिकीय तरीकों का उपयोग किया, जैसे कि डायनेमिक टाइम वारपिंग, और बाद में हिडन मार्कोव मॉडल। लगभग 2010 के दशक में, गहन तंत्रिका नेटवर्क दृष्टिकोण भाषण पहचान मॉडल के लिए अधिक सामान्य हो गए, जो बड़े डेटासेट ("बिग डेटा") की उपलब्धता और बढ़ी हुई कम्प्यूटेशनल प्रदर्शन द्वारा सक्षम हुए। भाषण पहचान में गहन शिक्षण के शुरुआती दृष्टिकोणों में कन्वोल्यूशनल तंत्रिका नेटवर्क शामिल थे, जो अनुक्रमिक डेटा को कैप्चर करने में असमर्थता के कारण सीमित थे, जिसने बाद में अनुक्रम-से-अनुक्रम दृष्टिकोणों के विकास को जन्म दिया, जिसमें आवर्ती तंत्रिका नेटवर्क शामिल हैं, जिन्होंने लॉन्ग शॉर्ट-टर्म मेमोरी का उपयोग किया।
2017 में Google द्वारा पेश किए गए ट्रांसफॉर्मर ने मशीन लर्निंग की एक विस्तृत श्रृंखला में कई पिछले अत्याधुनिक दृष्टिकोणों को विस्थापित कर दिया, और भाषा मॉडलिंग और कंप्यूटर विज़न जैसे क्षेत्रों में मुख्य तंत्रिका आर्किटेक्चर बनना शुरू कर दिया। 2020 के दशक की शुरुआत में ध्वनिक मॉडल के प्रशिक्षण के लिए कमजोर-पर्यवेक्षित दृष्टिकोण गहन तंत्रिका नेटवर्क का उपयोग करने वाले भाषण पहचान दृष्टिकोणों के लिए आशाजनक माने गए।
एक NYT रिपोर्ट के अनुसार, 2021 में OpenAI का मानना था कि उन्होंने अपने बड़े भाषा मॉडल को प्रशिक्षित करने के लिए उच्च-गुणवत्ता वाले डेटा के स्रोत समाप्त कर दिए हैं और उन्होंने स्क्रैप किए गए वेब टेक्स्ट को YouTube वीडियो और पॉडकास्ट के प्रतिलेखन के साथ पूरक करने का फैसला किया, और इस कार्य को हल करने के लिए Whisper विकसित किया।
Whisper Large V2 8 दिसंबर 2022 को जारी किया गया था, उसके बाद नवंबर 2023 में OpenAI Dev Day के दौरान Whisper Large V3 जारी किया गया। मार्च 2025 में, OpenAI ने GPT-4o और GPT-4o mini पर आधारित नए प्रतिलेखन मॉडल जारी किए, दोनों में Whisper की तुलना में कम त्रुटि दर है।
आर्किटेक्चर
Whisper आर्किटेक्चर एक एन्कोडर-डिकोडर ट्रांसफॉर्मर पर आधारित है। इनपुट ऑडियो को 16,000 हर्ट्ज (Hz) पर पुनः नमूना किया जाता है और 25 ms विंडो और 10 ms स्ट्राइड का उपयोग करके 80-चैनल लॉग-परिमाण मेल स्पेक्ट्रोग्राम में परिवर्तित किया जाता है। फिर स्पेक्ट्रोग्राम को [-1, 1] सीमा में लगभग शून्य माध्य के साथ सामान्यीकृत किया जाता है।
एन्कोडर इस मेल स्पेक्ट्रोग्राम को इनपुट के रूप में लेता है और इसे संसाधित करता है। यह पहले दो कन्वोल्यूशनल परतों से गुजरता है। साइनसॉइडल स्थितीय एम्बेडिंग जोड़े जाते हैं। फिर इसे ट्रांसफॉर्मर एन्कोडर ब्लॉकों की एक श्रृंखला द्वारा संसाधित किया जाता है (प्री-एक्टिवेशन अवशिष्ट कनेक्शन के साथ)। एन्कोडर का आउटपुट लेयर सामान्यीकृत होता है।
डिकोडर एक मानक ट्रांसफॉर्मर डिकोडर है। इसकी चौड़ाई और ट्रांसफॉर्मर ब्लॉक एन्कोडर के समान हैं। यह सीखे गए स्थितीय एम्बेडिंग और बंधे हुए इनपुट-आउटपुट टोकन प्रतिनिधित्व (इनपुट और आउटपुट एम्बेडिंग दोनों के लिए समान वेट मैट्रिक्स का उपयोग करके) का उपयोग करता है। यह GPT-2 में उपयोग किए जाने वाले प्रकार का बाइट-पेयर एन्कोडिंग टोकनाइज़र का उपयोग करता है। केवल-अंग्रेजी मॉडल GPT-2 शब्दावली का उपयोग करते हैं, जबकि बहुभाषी मॉडल समान संख्या में शब्दों के साथ एक पुनः-प्रशिक्षित बहुभाषी शब्दावली का उपयोग करते हैं।
डिकोडर को कई कार्य करने की अनुमति देने के लिए विशेष टोकन का उपयोग किया जाता है:
- भाषा को दर्शाने वाले टोकन (प्रत्येक भाषा के लिए एक अद्वितीय टोकन)।
- कार्य निर्दिष्ट करने वाले टोकन (<|transcribe|> या <|translate|>)।
- टोकन जो निर्दिष्ट करते हैं कि कोई टाइमस्टैम्प मौजूद नहीं है (<|notimestamps|>)। यदि टोकन मौजूद नहीं है, तो डिकोडर खंड के सापेक्ष टाइमस्टैम्प की भविष्यवाणी करता है, और 20 ms अंतराल पर मात्राबद्ध करता है।
- आवाज गतिविधि पहचान के लिए <|nospeech|>।
- <|startoftranscript|>, और <|endoftranscript|>। <|startoftranscript|> से पहले दिखाई देने वाला कोई भी पाठ डिकोडर द्वारा उत्पन्न नहीं होता है, बल्कि डिकोडर को संदर्भ के रूप में दिया जाता है। हानि की गणना केवल अनुक्रम के गैर-संदर्भात्मक भागों पर की जाती है, अर्थात इन दो विशेष टोकन के बीच के टोकन।
प्रशिक्षण डेटा
प्रशिक्षण डेटासेट में अर्ध-पर्यवेक्षित शिक्षण का उपयोग करके इंटरनेट से प्राप्त 680,000 घंटे के लेबल किए गए ऑडियो-प्रतिलेख जोड़े शामिल हैं। इसमें 96 गैर-अंग्रेजी भाषाओं में 117,000 घंटे और X→अंग्रेजी अनुवाद डेटा के 125,000 घंटे शामिल हैं, जहां X किसी भी गैर-अंग्रेजी भाषा को दर्शाता है।
प्रीप्रोसेसिंग में प्रतिलेखों का मानकीकरण, अनुमानित (जैसे, विराम चिह्न, पूंजीकरण) का उपयोग करके मशीन-जनित प्रतिलेखों को हटाने के लिए फ़िल्टरिंग, भाषा पहचान और प्रतिलेखों के साथ मिलान, फजी डिडुप्लिकेशन, और डेटा संदूषण से बचने के लिए मूल्यांकन डेटासेट के साथ डिडुप्लिकेशन शामिल था। आवाज गतिविधि पहचान प्रशिक्षण की अनुमति देने के लिए भाषण-रहित खंड भी शामिल किए गए थे। फ़िल्टरिंग प्रक्रिया के बाद शेष फ़ाइलों के लिए, ऑडियो फ़ाइलों को फिर 30-सेकंड के खंडों में तोड़ा गया और उस समय के भीतर होने वाले प्रतिलेख के उपसमुच्चय के साथ जोड़ा गया। यदि यह अनुमानित बोली जाने वाली भाषा ऑडियो से जुड़े पाठ प्रतिलेख की भाषा से भिन्न थी, तो उस ऑडियो-प्रतिलेख जोड़ी का उपयोग भाषण पहचान मॉडल के प्रशिक्षण के लिए नहीं किया गया था, बल्कि अनुवाद के प्रशिक्षण के लिए किया गया था।
मॉडल को AdamW ऑप्टिमाइज़र का उपयोग करके ग्रेडिएंट नॉर्म क्लिपिंग और वार्मअप के साथ रैखिक सीखने की दर क्षय के साथ प्रशिक्षित किया गया था, जिसमें बैच आकार 256 खंड था। प्रशिक्षण 1 मिलियन अपडेट (लगभग 2-3 युग) के लिए आगे बढ़ा। कोई डेटा वृद्धि या नियमितीकरण नहीं था, सिवाय Large V2 मॉडल के, जिसने SpecAugment, Stochastic Depth, और BPE Dropout का उपयोग किया। प्रशिक्षण ने float16, डायनेमिक लॉस स्केलिंग, और एक्टिवेशन चेकपॉइंटिंग के साथ डेटा समानांतरता का उपयोग किया।
पोस्ट-प्रशिक्षण फ़िल्टरिंग
पहले मॉडल को प्रशिक्षित करने के बाद, शोधकर्ताओं ने इसे प्रशिक्षण डेटा के विभिन्न उपसमुच्चय पर चलाया, जिनमें से प्रत्येक एक अलग स्रोत का प्रतिनिधित्व करता था। डेटा स्रोतों को उनकी त्रुटि दर और आकार के संयोजन द्वारा रैंक किया गया था। शीर्ष-रैंक वाले स्रोतों (उच्च त्रुटि, बड़ा आकार) के मैनुअल निरीक्षण ने यह निर्धारित करने में मदद की कि स्रोत कम गुणवत्ता का था (जैसे, आंशिक प्रतिलेख, गलत संरेखण)। प्रशिक्षण के बाद, इसे वक्ता नामों की भविष्यवाणी को दबाने के लिए फाइन-ट्यून किया गया और कम गुणवत्ता वाले स्रोतों को हटा दिया गया।
क्षमता
जबकि Whisper LibriSpeech डेटासेट में विशेषज्ञता रखने वाले मॉडलों से बेहतर प्रदर्शन नहीं करता है, जब कई डेटासेटों पर परीक्षण किया जाता है, तो यह अधिक मजबूत होता है और अन्य मॉडलों की तुलना में 55.2% कम त्रुटियाँ करता है। Whisper की विभिन्न भाषाओं के प्रतिलेखन के संबंध में अलग-अलग त्रुटि दर है, जिसमें प्रशिक्षण डेटा में अच्छी तरह से प्रतिनिधित्व नहीं की गई भाषाओं में उच्च शब्द त्रुटि दर है। लेखकों ने पाया कि मल्टी-टास्क लर्निंग ने एक कार्य के लिए विशिष्ट मॉडलों की तुलना में समग्र प्रदर्शन में सुधार किया। उन्होंने अनुमान लगाया कि सबसे अच्छा प्रशिक्षित Whisper मॉडल अभी भी अंडरफिटेड है, यह सुझाव देते हुए कि आगे स्केलिंग अतिरिक्त सुधार ला सकती है।