अंग्रेज़ी से अनुवादित

वाक् पहचान, या स्वचालित वाक् पहचान (ASR), वह तकनीक है जो बोले गए ऑडियो को लिखित पाठ में परिवर्तित करती है, जो सांख्यिकीय छिपे मार्कोव मॉडल से विकसित होकर व्हिस्पर जैसी अंत-से-अंत तंत्रिका प्रणालियों तक पहुँची है।

वाक् पहचान, जिसे स्वचालित वाक् पहचान (ASR) भी कहा जाता है, बोली गई ऑडियो को लिखित पाठ में परिवर्तित करती है। यह पाठ-से-वाक् का इनपुट-सामना करने वाला समकक्ष है और संवादात्मक एआई, वॉइस असिस्टेंट, श्रुतलेख सॉफ्टवेयर और स्वचालित कैप्शनिंग प्रणालियों का एक मूलभूत घटक है।

इतिहास

1970 और 1980 के दशक की प्रारंभिक वाक् पहचान प्रणालियाँ हाथ से निर्मित ध्वनिक विशेषताओं पर निर्भर थीं, जिन्हें छिपे हुए मार्कोव मॉडल के साथ जोड़ा गया था - ये सांख्यिकीय मॉडल वाक् की अनुक्रमिक, समय-परिवर्तनशील संरचना को दर्शाने के लिए उपयुक्त थे - और अक्सर संभावित शब्द अनुक्रमों को सीमित करने के लिए एन-ग्राम भाषा मॉडल के साथ जोड़े जाते थे। इन प्रणालियों को क्षेत्र-विशिष्ट समायोजन की काफी आवश्यकता होती थी और उच्चारणों, पृष्ठभूमि शोर और प्रशिक्षण डेटा से बाहर की शब्दावली के साथ संघर्ष करना पड़ता था। 2010 के दशक में गहन अधिगम की ओर बदलाव आया, पहले पाइपलाइन के व्यक्तिगत घटकों को तंत्रिका नेटवर्क से बदलकर और बाद में पूरी तरह से एंड-टू-एंड तंत्रिका वास्तुकला की ओर बढ़ते हुए, विशेष रूप से आवर्ती तंत्रिका नेटवर्क-आधारित अनुक्रम मॉडल और, 2017 के बाद, ट्रांसफॉर्मर-आधारित प्रणालियाँ जो कच्चे या हल्के से संसाधित ऑडियो को अलग ध्वनिक और भाषा मॉडल पाइपलाइन के बिना सीधे पाठ में मैप करती थीं।

आधुनिक प्रणालियाँ

OpenAI का व्हिस्पर, जिसे 2022 में ओपन-सोर्स के रूप में जारी किया गया, एक व्यापक रूप से अपनाई गई सामान्य-उद्देश्य ASR प्रणाली बन गया, जिसे ऑडियो के साथ जोड़े गए प्रतिलेखों के एक बड़े और विविध बहुभाषी डेटासेट पर प्रशिक्षित किया गया था, और यह प्रति-भाषा फाइन-ट्यूनिंग के बिना उच्चारणों, पृष्ठभूमि शोर और कई भाषाओं में मजबूत प्रदर्शन के लिए उल्लेखनीय है। व्हिस्पर और अन्य प्रयोगशालाओं के समान प्रणालियाँ आमतौर पर बड़े बहुविध एआई पाइपलाइनों, वॉइस असिस्टेंट और बैठक-प्रतिलेखन उत्पादों के भीतर एक घटक के रूप में उपयोग की जाती हैं, और उनके आउटपुट अक्सर सारांशीकरण या अनुवाद जैसे डाउनस्ट्रीम प्राकृतिक भाषा प्रसंस्करण कार्यों में फीड करते हैं।

तकनीकें

आधुनिक ASR प्रणालियाँ आमतौर पर एक एनकोडर का उपयोग करती हैं जो ऑडियो को सीखे गए प्रतिनिधित्वों के अनुक्रम में संसाधित करता है और एक डिकोडर जो पाठ को स्वप्रतिगामी रूप से उत्पन्न करता है, एक वास्तुकला पैटर्न जो अनुक्रम-से-अनुक्रम मॉडल और मशीन अनुवाद प्रणालियों से निकटता से संबंधित है। प्रशिक्षण बड़े पैमाने पर युग्मित ऑडियो-पाठ डेटासेट पर निर्भर करता है, और अलेबल ऑडियो पर स्व-पर्यवेक्षित अधिगम प्रीट्रेनिंग, जो किसी भी प्रतिलेख उपलब्ध होने से पहले उपयोगी प्रतिनिधित्व सीखता है, सीमित लेबल डेटा वाली भाषाओं पर प्रदर्शन सुधारने के लिए एक महत्वपूर्ण तकनीक बन गई, जो प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर दृष्टि में समान दृष्टिकोणों के समानांतर है।

अनुप्रयोग और सीमाएँ

वाक् पहचान लाइव कैप्शनिंग, स्मार्टफोन में निर्मित वॉइस असिस्टेंट, श्रुतलेख सॉफ्टवेयर, कॉल-सेंटर विश्लेषण और बधिर और कम सुनने वाले उपयोगकर्ताओं के लिए पहुंच उपकरणों को रेखांकित करती है। सटीकता में बड़ी प्रगति के बावजूद, ASR प्रणालियाँ उच्चारणों, बोलियों और कम प्रशिक्षण डेटा वाली भाषाओं में असमान रूप से प्रदर्शन करती हैं, जो वाणिज्यिक प्रणालियों में एल्गोरिदमिक पूर्वाग्रह का एक प्रलेखित स्रोत है। पृष्ठभूमि शोर, अतिव्यापी वक्ता और चिकित्सा या कानूनी शब्दावली जैसी क्षेत्र-विशिष्ट शब्दावली भी त्रुटि के स्रोत बने रहते हैं, और विशेष तैनाती के लिए प्रणालियों को अक्सर फाइन-ट्यून या कस्टम शब्दावलियों के साथ पूरक किया जाता है। मूल्यांकन आमतौर पर शब्द त्रुटि दर पर केंद्रित होता है, हालांकि यह एकल मीट्रिक जनसांख्यिकीय समूहों और बोलने की स्थितियों में असमान प्रदर्शन को अस्पष्ट कर सकता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·speech-technology
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास