OpenAI Whisper एक स्वचालित वाक् पहचान (ASR) प्रणाली है, जिसे सितंबर 2022 में OpenAI द्वारा ओपन-सोर्स सॉफ्टवेयर के रूप में जारी किया गया था। यह एक तंत्रिका नेटवर्क मॉडल है, जिसे 680,000 घंटे के विविध बहुभाषी और मल्टीटास्क पर्यवेक्षित वेब-संग्रहित ऑडियो डेटासेट पर प्रशिक्षित किया गया है, जिसमें 117,000 घंटे की गैर-अंग्रेज़ी वाक् शामिल है। मॉडल को वाक् को पाठ में लिप्यंतरित करने और उसका अंग्रेज़ी में अनुवाद करने के लिए डिज़ाइन किया गया है, जो 98 भाषाओं का समर्थन करता है। Whisper की वास्तुकला ट्रांसफॉर्मर एनकोडर-डिकोडर ढांचे पर आधारित है, जो मशीन लर्निंग में अनुक्रम-से-अनुक्रम कार्यों के लिए मानक बन चुका गहन शिक्षण दृष्टिकोण है।
Whisper का विमोचन जनरेटिव एआई के लिए वाक् क्षेत्र में एक महत्वपूर्ण मील का पत्थर साबित हुआ, क्योंकि इसने अत्याधुनिक ASR क्षमताओं को शोधकर्ताओं और डेवलपर्स के लिए निःशुल्क उपलब्ध कराया। कई व्यावसायिक वाक् पहचान प्रणालियों के विपरीत, जो बंद थीं या भुगतान किए गए API की आवश्यकता रखती थीं, Whisper की ओपन-सोर्स प्रकृति ने फाइन-ट्यूनिंग, स्थानीय हार्डवेयर पर तैनाती, और विभिन्न अनुप्रयोगों में एकीकरण की अनुमति दी। पृष्ठभूमि शोर, उच्चारण, और विविध बोलने की शैलियों के प्रति इसकी मजबूती को इसके प्रशिक्षण डेटा के पैमाने और विविधता के लिए जिम्मेदार ठहराया गया, जो वेब से एकत्र किया गया था और इसमें साफ और शोरगुल वाली दोनों प्रकार की रिकॉर्डिंग शामिल थीं।
मॉडल वास्तुकला और प्रशिक्षण
Whisper एक मानक ट्रांसफॉर्मर वास्तुकला का उपयोग करता है, जिसमें एक एनकोडर ऑडियो के लॉग-मेल स्पेक्ट्रोग्राम को संसाधित करता है और एक डिकोडर पाठ टोकन उत्पन्न करता है। मॉडल ऑडियो सिग्नल में अस्थायी निर्भरताओं को पकड़ने के लिए मल्टी-हेड अटेंशन और स्थितीय एन्कोडिंग का उपयोग करता है। इसे अनुक्रम-से-अनुक्रम उद्देश्य के साथ प्रशिक्षित किया गया था, जहां डिकोडर एन्कोडेड ऑडियो प्रतिनिधित्व के आधार पर पाठ टोकन की भविष्यवाणी करता है। प्रशिक्षण प्रक्रिया में एडम ऑप्टिमाइज़र और सीखने की दर अनुसूची का उपयोग किया गया, और अति-अनुकूलन को रोकने के लिए ड्रॉपआउट और ग्रेडिएंट क्लिपिंग जैसी तकनीकों को शामिल किया गया।
Whisper के प्रशिक्षण में एक प्रमुख नवाचार मल्टीटास्क प्रारूप का उपयोग था, जहां मॉडल को विभिन्न कार्यों जैसे लिप्यंतरण, अनुवाद, या भाषा पहचान करने के लिए विशेष टोकन के साथ संकेत दिया जाता है। इसने एक ही मॉडल को कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना कई भाषाओं और कार्यों को संभालने की अनुमति दी। प्रशिक्षण डेटा में 680,000 घंटे का ऑडियो शामिल था, जिसमें 65% अंग्रेज़ी, 18% अन्य भाषाएं, और 17% गैर-अंग्रेज़ी वाक् के अंग्रेज़ी अनुवाद शामिल थे। इस विविधता ने कम-संसाधन भाषाओं पर Whisper के मजबूत प्रदर्शन में योगदान दिया, क्योंकि यह क्रॉस-भाषाई स्थानांतरण का लाभ उठा सकता था।
क्षमताएं और प्रदर्शन
Whisper मानक बेंचमार्क पर प्रतिस्पर्धी शब्द त्रुटि दर (WER) प्राप्त करता है, जो अक्सर व्यावसायिक प्रणालियों से मेल खाता है या उनसे आगे निकल जाता है। अंग्रेज़ी के लिए, यह LibriSpeech test-clean सेट पर लगभग 5.2% की WER रिपोर्ट करता है, और बहुभाषी कार्यों के लिए, यह Common Voice और Fleurs डेटासेट पर मजबूत प्रदर्शन प्रदर्शित करता है। मॉडल 98 भाषाओं में से किसी से भी अंग्रेज़ी में अनुवाद का समर्थन करता है, एक विशेषता जो उसी वास्तुकला में एकीकृत की गई थी। शोर और प्रतिध्वनि के प्रति Whisper की मजबूती को मूल्यांकन में उजागर किया गया, जहां इसने DeepSpeech और Kaldi-आधारित प्रणालियों जैसे पिछले ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन किया।
मॉडल कई आकारों में उपलब्ध है, जो tiny (39 मिलियन पैरामीटर) से लेकर large-v2 (1.5 बिलियन पैरामीटर) तक है, जिससे उपयोगकर्ता गति और सटीकता के बीच समझौता कर सकते हैं। बड़े मॉडल बेहतर प्रदर्शन प्राप्त करते हैं लेकिन अधिक कम्प्यूटेशनल संसाधनों की आवश्यकता होती है। Whisper आउटपुट विविधता को नियंत्रित करने के लिए बीम खोज डिकोडिंग का भी समर्थन करता है, जिसमें तापमान स्केलिंग और टॉप-पी सैंपलिंग के विकल्प शामिल हैं।
ओपन-सोर्स प्रभाव और अपनाना
MIT लाइसेंस के तहत Whisper का ओपन-सोर्स विमोचन शिक्षा और उद्योग में व्यापक रूप से अपनाए जाने में सक्षम बना। यह वाक् में कृत्रिम बुद्धिमत्ता अनुसंधान के लिए एक आधारभूत उपकरण बन गया, और इसे हगिंग फेस जैसे प्लेटफार्मों में एकीकृत किया गया और लिप्यंतरण सेवाओं से लेकर पहुंच उपकरणों तक के अनुप्रयोगों में उपयोग किया गया। मॉडल की उपभोक्ता GPU पर चलने की क्षमता ने इसे स्वतंत्र डेवलपर्स के लिए सुलभ बना दिया, जिससे चिकित्सा लिप्यंतरण और कानूनी दस्तावेज़ीकरण जैसे विशिष्ट डोमेन के लिए फाइन-ट्यून किए गए संस्करणों का एक समुदाय विकसित हुआ।
गूगल डीपमाइंड और एंथ्रोपिक के समकालीन विमोचनों की तुलना में, Whisper ने पाठ निर्माण के बजाय विशेष रूप से वाक् पर ध्यान केंद्रित किया, जिससे ओपन-सोर्स पारिस्थितिकी तंत्र में एक अंतर भरा गया। इसकी सफलता ने बाद में वाक् मॉडलों के विकास को भी प्रभावित किया, जैसे ऑडियो क्षमताओं वाला OpenAI का GPT-4o, हालांकि Whisper एक स्वतंत्र उपकरण बना रहा।
सीमाएं और नैतिक विचार
अपनी ताकतों के बावजूद, Whisper की सीमाएं हैं। यह मौन या केवल-संगीत खंडों में पाठ की कल्पना कर सकता है, और अत्यधिक उच्चारण या कोड-स्विच्ड वाक् पर इसका प्रदर्शन घट जाता है। वेब से प्राप्त प्रशिक्षण डेटा में पूर्वाग्रह हो सकते हैं, और मॉडल उन पूर्वाग्रहों को प्रतिबिंबित करने वाले लिप्यंतरण उत्पन्न कर सकता है। OpenAI ने मॉडल कार्ड में इन मुद्दों को स्वीकार किया, संवेदनशील अनुप्रयोगों में सावधानीपूर्वक उपयोग की सिफारिश की। इसके अतिरिक्त, बड़े मॉडलों के प्रशिक्षण की कम्प्यूटेशनल लागत पर्यावरणीय चिंताओं को उठाती है, हालांकि ओपन-सोर्स विमोचन ने मामूली हार्डवेयर पर अनुमान की अनुमति देकर कुछ बाधाओं को कम किया।
विरासत और भविष्य की दिशाएं
Whisper ने ओपन-सोर्स ASR के लिए एक बेंचमार्क स्थापित किया, जिसने NVIDIA के Parakeet और Meta के SeamlessM4T जैसे बाद के मॉडलों को प्रभावित किया। इसकी वास्तुकला और प्रशिक्षण पद्धति को विभिन्न शोध परियोजनाओं में अपनाया गया है, और इसके विमोचन ने बहुभाषी वाक् पहचान में प्रगति को तेज किया। 2025 तक, Whisper व्यापक रूप से उपयोग में बना हुआ है, और इसका उत्तराधिकारी, Whisper large-v3, 2023 में कम-संसाधन भाषाओं पर बेहतर प्रदर्शन के साथ जारी किया गया था। मॉडल की ओपन-सोर्स प्रकृति मशीन लर्निंग और गहन शिक्षण अनुप्रयोगों में नवाचार का समर्थन करना जारी रखती है।
संदर्भ
- OpenAI Whisper मॉडल कार्ड और तकनीकी रिपोर्ट (2022)
- Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (2022)