मशीन अनुवाद, या एमटी, एक प्राकृतिक भाषा से दूसरी प्राकृतिक भाषा में पाठ या वाणी का स्वचालित रूप से अनुवाद करने के लिए सॉफ्टवेयर का उपयोग है। यह कृत्रिम बुद्धिमत्ता और प्राकृतिक भाषा प्रसंस्करण के सबसे पुराने लक्ष्यों में से एक है, और इसका इतिहास एआई विधियों के व्यापक विकास से निकटता से जुड़ा हुआ है, जो प्रतीकात्मक नियमों से सांख्यिकी तक और फिर तंत्रिका नेटवर्क तक पहुंचता है।
प्रारंभिक इतिहास
मशीन अनुवाद अनुसंधान 1954 में जॉर्जटाउन-आईबीएम प्रयोग के साथ गंभीरता से शुरू हुआ, जो एक प्रदर्शन था जिसने रूसी वाक्यों के एक छोटे से समूह का स्वचालित रूप से अंग्रेजी में अनुवाद किया और साथ में आशावादी भविष्यवाणियां कीं कि पूर्ण स्वचालित अनुवाद केवल कुछ वर्षों दूर था। प्रगति अपेक्षा से कहीं धीमी साबित हुई; 1966 में संयुक्त राज्य अमेरिका की एएलपीएसी रिपोर्ट ने निष्कर्ष निकाला कि मशीन अनुवाद ने मानव अनुवाद की तुलना में बहुत कम व्यावहारिक प्रगति की है और धन में कटौती की सिफारिश की, जिसने उस अवधि के व्यापक एआई शीतकाल में योगदान दिया। बाद के दशकों में नियम-आधारित प्रणालियाँ उभरीं जिन्होंने व्याकरणिक और शाब्दिक नियमों को हाथ से संहिताबद्ध किया, जिससे अच्छी तरह से संसाधन-संपन्न भाषा जोड़ियों के लिए उपयोगी लेकिन अप्राकृतिक परिणाम प्राप्त हुए।
सांख्यिकीय मशीन अनुवाद
1980 के दशक के अंत में शुरू होकर और 1990 और 2000 के दशक में परिपक्व होते हुए, सांख्यिकीय मशीन अनुवाद ने हस्तलिखित नियमों को बड़े द्विभाषी कोरपोरा पर प्रशिक्षित मॉडलों से बदल दिया, जो भाषाई सिद्धांत के बजाय सीधे डेटा से अनुवाद संभावनाएं सीखते थे। यह दृष्टिकोण भाषा जोड़ियों और डेटासेटों में अधिक आसानी से विस्तारित हुआ, लेकिन अक्सर व्याकरणिक रूप से अजीब आउटपुट उत्पन्न करता था, क्योंकि यह अनुवाद को एक सुसंगत वाक्य के बजाय खंडवार मॉडल करता था।
तंत्रिका मशीन अनुवाद
2010 के दशक के मध्य में तंत्रिका मशीन अनुवाद की ओर बदलाव ने गुणवत्ता में एक और बड़ी छलांग लगाई। प्रारंभिक तंत्रिका प्रणालियों ने अनुक्रम-से-अनुक्रम आर्किटेक्चर का उपयोग किया, एक एन्कोडर आवर्ती तंत्रिका नेटवर्क या एलएसटीएम जो स्रोत वाक्य को एक वेक्टर में संपीड़ित करता था और एक डिकोडर जो अनुवाद उत्पन्न करता था, जिसे ध्यान तंत्र के जोड़ से परिष्कृत किया गया था जो डिकोडर को प्रत्येक चरण पर प्रासंगिक स्रोत शब्दों पर ध्यान केंद्रित करने देता था, न कि एकल निश्चित सारांश पर निर्भर रहने देता था। गूगल ने 2016 में अपनी उत्पादन अनुवाद प्रणाली को तंत्रिका आर्किटेक्चर में बदल दिया, जिससे महत्वपूर्ण गुणवत्ता लाभ की सूचना मिली। 2017 का ट्रांसफॉर्मर आर्किटेक्चर आगे की गुणवत्ता और प्रशिक्षण दक्षता दोनों में सुधार किया और अनुवाद प्रणालियों के लिए मानक आर्किटेक्चर बन गया।
बड़े भाषा मॉडल युग
2020 के दशक की शुरुआत से, सामान्य-उद्देश्यीय बड़े भाषा मॉडल जैसे जीपीटी-4 और क्लॉड का अनुवाद कार्यों के लिए तेजी से उपयोग हो रहा है, जो अक्सर कई भाषा जोड़ियों में समर्पित अनुवाद प्रणालियों से मेल खाते या उनसे बेहतर प्रदर्शन करते हैं, विशेष रूप से उन पाठों के लिए जिनमें शाब्दिक प्रस्तुति के बजाय प्रासंगिक या मुहावरेदार निर्णय की आवश्यकता होती है। इस अभिसरण ने मशीन अनुवाद को एक अलग उत्पाद श्रेणी के रूप में और एक सामान्य-उद्देश्यीय मॉडल के भीतर कई क्षमताओं में से एक के रूप में अनुवाद के बीच की रेखा को धुंधला कर दिया है, हालांकि समर्पित प्रणालियाँ विलंबता, लागत और बहुत कम-संसाधन भाषाओं के समर्थन में लाभ बनाए रखती हैं।
अनुप्रयोग और सीमाएँ
मशीन अनुवाद वेब ब्राउज़र, मैसेजिंग ऐप्स, व्यावसायिक सॉफ्टवेयर और अंतर्राष्ट्रीय संचार उपकरणों में एकीकृत है, और इसने जानकारी तक क्रॉस-भाषा पहुंच की लागत को काफी कम कर दिया है। यह अभी भी कम-संसाधन भाषाओं से जूझ रहा है जिनमें बड़े प्रशिक्षण कोरपोरा की कमी है, मुहावरेदार और सांस्कृतिक रूप से विशिष्ट अभिव्यक्तियों, और लंबे दस्तावेजों में स्थिरता की कमी है, और त्रुटियों के कानूनी, चिकित्सा या राजनयिक संदर्भों में वास्तविक परिणाम हो सकते हैं, जो व्यावहारिक एआई नैतिकता के भीतर एक चलती चिंता है।