उदाहरण-आधारित मशीन अनुवाद

अंग्रेज़ी से अनुवादित

उदाहरण-आधारित मशीन अनुवाद (EBMT) एक मशीन अनुवाद विधि है जो रन-टाइम पर समानांतर पाठों के द्विभाषी कोष को अपने प्राथमिक ज्ञान आधार के रूप में उपयोग करती है, पहले देखे गए उदाहरणों के अनुरूप अनुवाद करती है।

उदाहरण-आधारित मशीन अनुवाद (EBMT) मशीन अनुवाद की एक विधि है जो समानांतर पाठों के द्विभाषी कोष पर निर्भर करती है, जो रन-टाइम पर इसका मुख्य ज्ञान आधार होता है। यह अनिवार्य रूप से सादृश्य द्वारा अनुवाद है, और इसे मशीन-लर्निंग के लिए केस-आधारित तर्क दृष्टिकोण के कार्यान्वयन के रूप में देखा जा सकता है। नियम-आधारित प्रणालियों के विपरीत, जिन्हें गहन भाषाई विश्लेषण की आवश्यकता होती है, EBMT स्रोत वाक्य को वाक्यांशों में विघटित करके, कोष से उदाहरणों का उपयोग करके उन वाक्यांशों का अनुवाद करके, और फिर अनुवादित टुकड़ों को लक्ष्य वाक्य में संयोजित करके अनुवाद करता है।

यह दृष्टिकोण पहली बार 1984 में माकोतो नागाओ द्वारा सुझाया गया था, जिन्होंने तर्क दिया कि यह दो बहुत अलग भाषाओं, जैसे अंग्रेजी और जापानी, के बीच अनुवाद के लिए विशेष रूप से उपयुक्त है। ऐसे मामलों में, एक एकल वाक्य लक्ष्य भाषा में कई सुव्यवस्थित वाक्यों में मैप हो सकता है, जिससे गहन भाषाई विश्लेषण कम उपयोगी हो जाता है। EBMT को तब से सांख्यिकीय और नियम-आधारित विधियों के विकल्प के रूप में खोजा गया है, और यह सांख्यिकीय मशीन अनुवाद के साथ द्विभाषी कोष का उपयोग साझा करता है।

सादृश्य द्वारा अनुवाद

EBMT का मूल सिद्धांत सादृश्य द्वारा अनुवाद है। यह विचार इस धारणा को अस्वीकार करता है कि मानव अनुवादक हर वाक्य का गहन भाषाई विश्लेषण करते हैं। इसके बजाय, यह मानता है कि अनुवादक एक वाक्य को वाक्यांशों में विघटित करते हैं, पहले से सामना किए गए अनुवादों के सादृश्य द्वारा प्रत्येक वाक्यांश का अनुवाद करते हैं, और फिर अनुवादित वाक्यांशों को एक सुसंगत संपूर्ण में संयोजित करते हैं। EBMT में, यह सिद्धांत प्रशिक्षण कोष में संग्रहीत उदाहरण अनुवादों के माध्यम से एन्कोड किया जाता है। सिस्टम नए इनपुट के अनुवाद का मार्गदर्शन करने के लिए कोष से समान उदाहरण प्राप्त करता है।

इतिहास और विकास

माकोतो नागाओ ने 1984 में EBMT पेश किया, जिसमें बहुत अलग संरचनाओं वाली भाषा जोड़ों, जैसे अंग्रेजी और जापानी, के लिए इसकी क्षमता पर प्रकाश डाला गया। उनकी अंतर्दृष्टि यह थी कि ऐसे जोड़ों के लिए, एक वाक्य को अक्सर लक्ष्य भाषा में कई सुव्यवस्थित वाक्यों के रूप में प्रस्तुत किया जा सकता है, जिससे गहन भाषाई विश्लेषण उदाहरण-आधारित विधियों की तुलना में कम प्रभावी हो जाता है। अगले दशकों में, EBMT विकसित और परिष्कृत किया गया, जिसमें माइकल कार्ल और एंडी वे जैसे शोधकर्ताओं का योगदान रहा, जिन्होंने 2003 के खंड रिसेंट एडवांसेज इन एग्जाम्पल-बेस्ड मशीन ट्रांसलेशन का संपादन किया। हालांकि हाल के वर्षों में EBMT को न्यूरल-नेटवर्क-आधारित दृष्टिकोणों द्वारा काफी हद तक ग्रहण लगा दिया गया है, समानांतर कोष और सादृश्य के उपयोग के बारे में इसके विचार आधुनिक मशीन अनुवाद अनुसंधान को प्रभावित करते रहते हैं।

EBMT कैसे काम करता है

EBMT प्रणालियों को वाक्य जोड़ों वाले द्विभाषी समानांतर कोष पर प्रशिक्षित किया जाता है, जैसे:

  • "हाउ मच इज़ दैट रेड अम्ब्रेला?" ↔ "अनो अकाई कासा वा इकुरा देसु का।"
  • "हाउ मच इज़ दैट स्मॉल कैमरा?" ↔ "अनो चीइसाई कामेरा वा इकुरा देसु का।"

ऐसे न्यूनतम जोड़ों से, सिस्टम अनुवाद इकाइयाँ सीखता है: उदाहरण के लिए, "रेड अम्ब्रेला" "अकाई कासा" से मेल खाता है, और "स्मॉल कैमरा" "चीइसाई कामेरा" से मेल खाता है। इन इकाइयों को नए अनुवाद उत्पन्न करने के लिए संयोजित किया जा सकता है। उदाहरण के लिए, यदि सिस्टम ने "प्रेसिडेंट केनेडी वाज़ शॉट डेड ड्यूरिंग द परेड" और "द कन्विक्ट एस्केप्ड ऑन जुलाई 15th" जैसे वाक्य देखे हैं, तो यह उपयुक्त भागों को प्रतिस्थापित करके "द कन्विक्ट वाज़ शॉट डेड ड्यूरिंग द परेड" का अनुवाद कर सकता है।

वाक्यांश क्रियाएँ और उप-भाषा घटनाएँ

EBMT विशेष रूप से वाक्यांश क्रियाओं जैसी उप-भाषा घटनाओं के लिए उपयुक्त है, जिनके अर्थ संदर्भ पर अत्यधिक निर्भर होते हैं। अंग्रेजी में वाक्यांश क्रियाएँ एक क्रिया के बाद एक क्रिया-विशेषण या पूर्वसर्ग (कण) से मिलकर बनती हैं, और उनके अर्थ अक्सर व्यक्तिगत शब्दों से प्राप्त नहीं किए जा सकते। उदाहरण के लिए, वाक्यांश क्रिया "पुट ऑन" का अर्थ "स्विच ऑन" (जैसे "राम पुट ऑन द लाइट्स") या "पहनना" (जैसे "राम पुट ऑन ए कैप") हो सकता है। हिंदुस्तानी में, ये अर्थ अलग-अलग क्रियाओं से मेल खाते हैं: क्रमशः "जलाना" और "पहनना"। EBMT संदर्भ से मेल खाने वाले उदाहरणों को प्राप्त करके ऐसी अस्पष्टताओं को संभाल सकता है, बजाय शब्द-दर-शब्द अनुवाद पर निर्भर रहने के।

अन्य दृष्टिकोणों से संबंध

EBMT मशीन अनुवाद के कई डेटा-संचालित दृष्टिकोणों में से एक है। यह नियम-आधारित मशीन अनुवाद से भिन्न है, क्योंकि यह गहन भाषाई विश्लेषण से बचता है और इसके बजाय उदाहरणों के कोष का उपयोग करता है। यह सांख्यिकीय मशीन अनुवाद से भी भिन्न है, जो बड़े कोष पर संभाव्य मॉडल का उपयोग करता है, हालांकि दोनों द्विभाषी डेटा पर निर्भर करते हैं। 2010 के दशक में, डीप-लर्निंग और ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि लार्ज-लैंग्वेज-मॉडल में उपयोग किए जाने वाले, ने व्यावहारिक अनुप्रयोगों में EBMT को काफी हद तक पीछे छोड़ दिया। हालाँकि, सादृश्य और उदाहरण पुनर्प्राप्ति पर EBMT का जोर प्रासंगिक बना हुआ है, और क्यूनी जैसे ओपन-सोर्स प्लेटफार्मों ने EBMT को सांख्यिकीय विधियों के साथ संयोजित करने वाले हाइब्रिड दृष्टिकोणों की खोज की है।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-translation·natural-language-processing·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास