उदाहरण-आधारित मशीन अनुवाद (EBMT) मशीन अनुवाद की एक विधि है जो समानांतर पाठों के द्विभाषी कोष पर निर्भर करती है, जो रन-टाइम पर इसका मुख्य ज्ञान आधार होता है। यह अनिवार्य रूप से सादृश्य द्वारा अनुवाद है, और इसे मशीन-लर्निंग के लिए केस-आधारित तर्क दृष्टिकोण के कार्यान्वयन के रूप में देखा जा सकता है। नियम-आधारित प्रणालियों के विपरीत, जिन्हें गहन भाषाई विश्लेषण की आवश्यकता होती है, EBMT स्रोत वाक्य को वाक्यांशों में विघटित करके, कोष से उदाहरणों का उपयोग करके उन वाक्यांशों का अनुवाद करके, और फिर अनुवादित टुकड़ों को लक्ष्य वाक्य में संयोजित करके अनुवाद करता है।
यह दृष्टिकोण पहली बार 1984 में माकोतो नागाओ द्वारा सुझाया गया था, जिन्होंने तर्क दिया कि यह दो बहुत अलग भाषाओं, जैसे अंग्रेजी और जापानी, के बीच अनुवाद के लिए विशेष रूप से उपयुक्त है। ऐसे मामलों में, एक एकल वाक्य लक्ष्य भाषा में कई सुव्यवस्थित वाक्यों में मैप हो सकता है, जिससे गहन भाषाई विश्लेषण कम उपयोगी हो जाता है। EBMT को तब से सांख्यिकीय और नियम-आधारित विधियों के विकल्प के रूप में खोजा गया है, और यह सांख्यिकीय मशीन अनुवाद के साथ द्विभाषी कोष का उपयोग साझा करता है।
सादृश्य द्वारा अनुवाद
EBMT का मूल सिद्धांत सादृश्य द्वारा अनुवाद है। यह विचार इस धारणा को अस्वीकार करता है कि मानव अनुवादक हर वाक्य का गहन भाषाई विश्लेषण करते हैं। इसके बजाय, यह मानता है कि अनुवादक एक वाक्य को वाक्यांशों में विघटित करते हैं, पहले से सामना किए गए अनुवादों के सादृश्य द्वारा प्रत्येक वाक्यांश का अनुवाद करते हैं, और फिर अनुवादित वाक्यांशों को एक सुसंगत संपूर्ण में संयोजित करते हैं। EBMT में, यह सिद्धांत प्रशिक्षण कोष में संग्रहीत उदाहरण अनुवादों के माध्यम से एन्कोड किया जाता है। सिस्टम नए इनपुट के अनुवाद का मार्गदर्शन करने के लिए कोष से समान उदाहरण प्राप्त करता है।
इतिहास और विकास
माकोतो नागाओ ने 1984 में EBMT पेश किया, जिसमें बहुत अलग संरचनाओं वाली भाषा जोड़ों, जैसे अंग्रेजी और जापानी, के लिए इसकी क्षमता पर प्रकाश डाला गया। उनकी अंतर्दृष्टि यह थी कि ऐसे जोड़ों के लिए, एक वाक्य को अक्सर लक्ष्य भाषा में कई सुव्यवस्थित वाक्यों के रूप में प्रस्तुत किया जा सकता है, जिससे गहन भाषाई विश्लेषण उदाहरण-आधारित विधियों की तुलना में कम प्रभावी हो जाता है। अगले दशकों में, EBMT विकसित और परिष्कृत किया गया, जिसमें माइकल कार्ल और एंडी वे जैसे शोधकर्ताओं का योगदान रहा, जिन्होंने 2003 के खंड रिसेंट एडवांसेज इन एग्जाम्पल-बेस्ड मशीन ट्रांसलेशन का संपादन किया। हालांकि हाल के वर्षों में EBMT को न्यूरल-नेटवर्क-आधारित दृष्टिकोणों द्वारा काफी हद तक ग्रहण लगा दिया गया है, समानांतर कोष और सादृश्य के उपयोग के बारे में इसके विचार आधुनिक मशीन अनुवाद अनुसंधान को प्रभावित करते रहते हैं।
EBMT कैसे काम करता है
EBMT प्रणालियों को वाक्य जोड़ों वाले द्विभाषी समानांतर कोष पर प्रशिक्षित किया जाता है, जैसे:
- "हाउ मच इज़ दैट रेड अम्ब्रेला?" ↔ "अनो अकाई कासा वा इकुरा देसु का।"
- "हाउ मच इज़ दैट स्मॉल कैमरा?" ↔ "अनो चीइसाई कामेरा वा इकुरा देसु का।"
ऐसे न्यूनतम जोड़ों से, सिस्टम अनुवाद इकाइयाँ सीखता है: उदाहरण के लिए, "रेड अम्ब्रेला" "अकाई कासा" से मेल खाता है, और "स्मॉल कैमरा" "चीइसाई कामेरा" से मेल खाता है। इन इकाइयों को नए अनुवाद उत्पन्न करने के लिए संयोजित किया जा सकता है। उदाहरण के लिए, यदि सिस्टम ने "प्रेसिडेंट केनेडी वाज़ शॉट डेड ड्यूरिंग द परेड" और "द कन्विक्ट एस्केप्ड ऑन जुलाई 15th" जैसे वाक्य देखे हैं, तो यह उपयुक्त भागों को प्रतिस्थापित करके "द कन्विक्ट वाज़ शॉट डेड ड्यूरिंग द परेड" का अनुवाद कर सकता है।
वाक्यांश क्रियाएँ और उप-भाषा घटनाएँ
EBMT विशेष रूप से वाक्यांश क्रियाओं जैसी उप-भाषा घटनाओं के लिए उपयुक्त है, जिनके अर्थ संदर्भ पर अत्यधिक निर्भर होते हैं। अंग्रेजी में वाक्यांश क्रियाएँ एक क्रिया के बाद एक क्रिया-विशेषण या पूर्वसर्ग (कण) से मिलकर बनती हैं, और उनके अर्थ अक्सर व्यक्तिगत शब्दों से प्राप्त नहीं किए जा सकते। उदाहरण के लिए, वाक्यांश क्रिया "पुट ऑन" का अर्थ "स्विच ऑन" (जैसे "राम पुट ऑन द लाइट्स") या "पहनना" (जैसे "राम पुट ऑन ए कैप") हो सकता है। हिंदुस्तानी में, ये अर्थ अलग-अलग क्रियाओं से मेल खाते हैं: क्रमशः "जलाना" और "पहनना"। EBMT संदर्भ से मेल खाने वाले उदाहरणों को प्राप्त करके ऐसी अस्पष्टताओं को संभाल सकता है, बजाय शब्द-दर-शब्द अनुवाद पर निर्भर रहने के।
अन्य दृष्टिकोणों से संबंध
EBMT मशीन अनुवाद के कई डेटा-संचालित दृष्टिकोणों में से एक है। यह नियम-आधारित मशीन अनुवाद से भिन्न है, क्योंकि यह गहन भाषाई विश्लेषण से बचता है और इसके बजाय उदाहरणों के कोष का उपयोग करता है। यह सांख्यिकीय मशीन अनुवाद से भी भिन्न है, जो बड़े कोष पर संभाव्य मॉडल का उपयोग करता है, हालांकि दोनों द्विभाषी डेटा पर निर्भर करते हैं। 2010 के दशक में, डीप-लर्निंग और ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि लार्ज-लैंग्वेज-मॉडल में उपयोग किए जाने वाले, ने व्यावहारिक अनुप्रयोगों में EBMT को काफी हद तक पीछे छोड़ दिया। हालाँकि, सादृश्य और उदाहरण पुनर्प्राप्ति पर EBMT का जोर प्रासंगिक बना हुआ है, और क्यूनी जैसे ओपन-सोर्स प्लेटफार्मों ने EBMT को सांख्यिकीय विधियों के साथ संयोजित करने वाले हाइब्रिड दृष्टिकोणों की खोज की है।