अंग्रेज़ी से अनुवादित

ओपनएआई द्वारा सितंबर 2022 में जारी एक ओपन-सोर्स स्वचालित वाक् पहचान प्रणाली, जिसे 680,000 घंटे के बहुभाषी ऑडियो पर प्रशिक्षित किया गया है और ट्रांसक्रिप्शन, कैप्शनिंग और वॉयस-इंटरफेस अनुप्रयोगों के लिए व्यापक रूप से अपनाया गया है।

Whisper एक स्वचालित Speech recognition प्रणाली है जिसे OpenAI द्वारा सितंबर 2022 में एक ओपन-सोर्स मॉडल के रूप में जारी किया गया था, जिसमें कोड और प्रशिक्षित वज़न दोनों सार्वजनिक रूप से उपलब्ध कराए गए थे। OpenAI के अधिकांश बाद के रिलीज़ों के विपरीत, Whisper को एक विस्तृत तकनीकी पेपर के साथ प्रकाशित किया गया था जिसमें इसके प्रशिक्षण डेटा और पद्धति का वर्णन किया गया था, जिससे यह इस अवधि के दौरान एक प्रमुख AI प्रयोगशाला के अधिक पारदर्शी रिलीज़ों में से एक बन गया।

प्रशिक्षण और वास्तुकला

Whisper एक Transformer (architecture)-आधारित एन्कोडर-डिकोडर मॉडल है जिसे वेब से एकत्रित 680,000 घंटे के ऑडियो पर बड़े पैमाने पर पर्यवेक्षित, कमजोर लेबल वाले तरीके से प्रशिक्षित किया गया है, जिसे संबंधित ट्रांसक्रिप्ट के साथ जोड़ा गया है। उस ऑडियो का लगभग एक तिहाई गैर-अंग्रेज़ी था, जो लगभग 100 भाषाओं में फैला हुआ था, और प्रशिक्षण डेटा का एक हिस्सा अनुवाद जोड़ों से बना था, जिससे मॉडल को ट्रांसक्रिप्शन के साथ-साथ अंतर्निहित भाषण-से-पाठ अनुवाद क्षमता मिली। कमजोर पर्यवेक्षित डेटा का यह पैमाना और विविधता छोटे, अधिक क्यूरेटेड शैक्षणिक डेटासेट पर प्रशिक्षित पहले के भाषण पहचान प्रणालियों के साथ एक जानबूझकर विरोधाभास था, जो क्षेत्र में स्केलिंग और डेटा विविधता के बारे में व्यापक निष्कर्षों को प्रतिध्वनित करता है जो मजबूती में सुधार करते हैं। मॉडल को कई आकारों में जारी किया गया था, डिवाइस पर उपयोग के लिए उपयुक्त हल्के "tiny" संस्करण से लेकर उच्चतम सटीकता प्रदान करने वाले बड़े मॉडल तक, एक दृष्टिकोण जिसे बाद में v2 और v3 अपडेट द्वारा अपनाया गया जिसने कई भाषाओं में प्रदर्शन में सुधार किया।

अपनाना और प्रभाव

क्योंकि Whisper के वज़न एक अनुमेय खुले लाइसेंस के तहत जारी किए गए थे, इसे तेजी से तीसरे पक्ष के उत्पादों और ओपन-सोर्स परियोजनाओं की एक विस्तृत श्रृंखला में एकीकृत किया गया, जिसमें मीटिंग ट्रांसक्रिप्शन टूल, सबटाइटल जनरेटर, वॉयस असिस्टेंट और एक्सेसिबिलिटी सॉफ्टवेयर शामिल हैं। पिछले वाणिज्यिक ASR प्रणालियों के सापेक्ष उच्चारण, पृष्ठभूमि शोर और तकनीकी शब्दावली के प्रति इसकी मजबूती ने इसे Natural language processing पाइपलाइनों पर निर्माण करने वाले डेवलपर्स के लिए एक सामान्य डिफ़ॉल्ट विकल्प बना दिया, जिन्हें भाषण-से-पाठ फ्रंट एंड की आवश्यकता थी। Whisper बड़े मल्टीमॉडल और वॉयस-इंटरैक्शन सिस्टम में भी एक घटक बन गया, जो वॉयस असिस्टेंट और कॉल-सेंटर स्वचालन के लिए ट्रांसक्राइब किए गए पाठ को डाउनस्ट्रीम बड़े भाषा मॉडल में फीड करता था, और इसके ट्रांसक्रिप्ट अन्य ऑडियो और भाषण परियोजनाओं के लिए प्रशिक्षण डेटा के स्रोत के रूप में उपयोग किए गए हैं।

मॉडल के रिलीज़ ने प्रमुख प्रयोगशालाओं से फाउंडेशन-मॉडल शैली के ओपन-वेट रिलीज़ों की व्यापक प्रवृत्ति में योगदान दिया, भले ही उन्हीं प्रयोगशालाओं ने अपने प्रमुख जनरेटिव मॉडल बंद रखे, एक पैटर्न जो एक साल पहले CLIP के साथ भी देखा गया था। क्योंकि इसने ट्रांसक्रिप्शन और अनुवाद सुविधाओं के निर्माण की लागत कम कर दी, Whisper को अक्सर वॉयस-संचालित AI अनुप्रयोगों के साथ प्रयोग को तेज करने वाले कारक के रूप में उद्धृत किया गया था, जिसमें डबिंग और स्थानीयकरण उत्पादों के लिए Text-to-speech और Voice cloning पाइपलाइनों में फीड करने वाले शुरुआती एकीकरण शामिल हैं, और यह 2025 तक शैक्षणिक और उद्योग भाषण अनुसंधान में व्यापक रूप से एक बेंचमार्क और बैकबोन के रूप में उपयोग किया जाता है।

सीमाएँ

Whisper कमजोरियों से मुक्त नहीं है: यह ऐसा पाठ उत्पन्न कर सकता है जो कभी बोला नहीं गया था, विशेष रूप से मौन या गैर-भाषण ऑडियो के दौरान, एक विफलता मोड जो जनरेटिव भाषा मॉडल में देखी गई व्यापक Hallucination (AI) समस्या से संबंधित है लेकिन अलग है। सटीकता भी भाषाओं में काफी भिन्न होती है, कम-संसाधन वाली भाषाएं अपने प्रशिक्षण डेटा में अंग्रेज़ी और अन्य अच्छी तरह से प्रतिनिधित्व वाली भाषाओं की तुलना में उच्च त्रुटि दर दिखाती हैं, और शोधकर्ताओं ने मॉडल द्वारा चिकित्सा और अन्य उच्च-दांव वाले ट्रांसक्रिप्ट में निर्मित वाक्यांश डालने के मामलों का दस्तावेजीकरण किया है, जो अप्रशिक्षित उपयोग के बारे में सावधानी बरतने के लिए प्रेरित करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:speech-recognition·open-source-ai·openai-models
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास