अंग्रेज़ी से अनुवादित

अनुक्रम-से-अनुक्रम (seq2seq) मशीन लर्निंग दृष्टिकोणों का एक परिवार है जो एन्कोडर-डिकोडर तंत्रिका नेटवर्क वास्तुकला का उपयोग करके एक इनपुट अनुक्रम को आउटपुट अनुक्रम में मैप करता है, जो अनुवाद और सारांशीकरण जैसे कार्यों के लिए आधारभूत है।

अनुक्रम-से-अनुक्रम (अक्सर seq2seq के रूप में संक्षिप्त) मशीन लर्निंग दृष्टिकोणों का एक परिवार है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण और अन्य अनुक्रम स्थानांतरण कार्यों के लिए किया जाता है। यह ढांचा एक अनुक्रम को दूसरे अनुक्रम में बदलता है, जैसे कि अंग्रेजी में एक वाक्य को फ्रेंच में परिवर्तित करना, एक छवि से कैप्शन उत्पन्न करना, या लंबे पाठ से सारांश तैयार करना। मूल रूप से ले वियत क्वोक द्वारा विकसित, जो गूगल ब्रेन में एक वियतनामी कंप्यूटर वैज्ञानिक और मशीन लर्निंग अग्रणी हैं, seq2seq कई आधुनिक AI प्रणालियों में मौलिक बन गया है, जिसमें बड़े भाषा मॉडल और संवादी एजेंट शामिल हैं।

seq2seq का मूल विचार दो तंत्रिका नेटवर्क का उपयोग करना है: एक एनकोडर जो इनपुट अनुक्रम को संसाधित करता है और इसकी जानकारी को एक निश्चित-लंबाई वाले वेक्टर (या संदर्भ वैक्टर के एक सेट) में संपीड़ित करता है, और एक डिकोडर जो उस प्रतिनिधित्व से आउटपुट अनुक्रम को चरण दर चरण उत्पन्न करता है। यह वास्तुकला पहली बार 2014 में प्रस्तावित की गई थी और तब से विकसित हुई है, ध्यान तंत्र और ट्रांसफॉर्मर मॉडल की शुरुआत के साथ, बाधा समस्या और समानांतरकरण की कमी जैसी सीमाओं को संबोधित करने के लिए।

ऐतिहासिक जड़ें

seq2seq की वैचारिक जड़ें सूचना सिद्धांत और मशीन अनुवाद के शोर चैनल मॉडल में निहित हैं। 1947 की शुरुआत में, मशीन अनुवाद के अग्रणी वॉरेन वीवर ने कहा: "कोई स्वाभाविक रूप से आश्चर्य करता है कि क्या अनुवाद की समस्या को क्रिप्टोग्राफी में एक समस्या के रूप में माना जा सकता है। जब मैं रूसी में एक लेख देखता हूं, तो मैं कहता हूं: 'यह वास्तव में अंग्रेजी में लिखा गया है, लेकिन इसे कुछ अजीब प्रतीकों में कोडित किया गया है। मैं अब इसे डिकोड करने के लिए आगे बढ़ूंगा।'" इस दृष्टिकोण ने अनुवाद को एक एनकोड-ट्रांसमिट-डिकोड प्रक्रिया के रूप में तैयार किया, जिसने सीधे एनकोडर-डिकोडर संरचना को प्रेरित किया।

2010 के दशक की शुरुआत में, शोधकर्ताओं ने अनुक्रम स्थानांतरण के लिए तंत्रिका नेटवर्क-आधारित एनकोडर-डिकोडर मॉडल विकसित करना शुरू किया। seq2seq के मूल के रूप में सबसे अधिक उद्धृत दो पेपर दोनों 2014 में प्रकाशित हुए थे। एक इल्या सुत्सकेवर, ओरिओल विनियल्स, और क्वोक वी. ले द्वारा था, जो गूगल ब्रेन में काम कर रहे थे, और दूसरा क्युंगह्यून चो, बार्ट वान मेरिएनबोएर, ज़मित्र बहदानाउ, और योशुआ बेंगियो द्वारा था, जो मॉन्ट्रियल विश्वविद्यालय और जैकब्स विश्वविद्यालय से थे। इन पेपरों ने एनकोडर और डिकोडर दोनों के लिए आवर्तक तंत्रिका नेटवर्क (RNN), विशेष रूप से लंबी अल्पकालिक स्मृति (LSTM) नेटवर्क का उपयोग करने का प्रस्ताव दिया।

बाधा समस्या और ध्यान

मूल seq2seq मॉडल ने एक निश्चित-लंबाई वाले एन्कोडिंग वेक्टर का उपयोग किया, जिसने एक "बाधा" समस्या पैदा की: लंबे इनपुट अनुक्रमों के लिए, जानकारी खो जाती थी क्योंकि सभी आवश्यक विवरणों को एक वेक्टर में संपीड़ित करना मुश्किल था। इसे संबोधित करने के लिए, बहदानाउ एट अल. ने 2014 में ध्यान तंत्र पेश किया। उनके मॉडल, जिसे RNNsearch कहा जाता है, ने डिकोडर को डिकोडिंग के दौरान स्रोत वाक्य के माध्यम से "खोज" करने की अनुमति दी, प्रभावी रूप से इनपुट के प्रासंगिक भागों को वापस देखने की प्रक्रिया का अनुकरण किया। ध्यान एनकोडर के छिपे हुए राज्यों का एक भारित योग गणना करता है, प्रत्येक डिकोडिंग चरण के लिए एक संदर्भ वेक्टर उत्पन्न करता है, जिसने डिकोडर को सभी इनपुट स्थितियों तक सीधी पहुंच देकर बाधा को हल किया।

ट्रांसफॉर्मर क्रांति

RNN-आधारित seq2seq मॉडल की एक महत्वपूर्ण सीमा समानांतरकरण में उनकी कठिनाई थी, क्योंकि आवर्तक प्रसंस्करण स्वाभाविक रूप से अनुक्रमिक है। 2017 में वासवानी एट अल. द्वारा ट्रांसफॉर्मर वास्तुकला का प्रकाशन (जिसमें जैकब उस्ज़कोरिट और लुकाज़ कैसर सहित प्रमुख योगदानकर्ता शामिल थे) ने आवर्तक एनकोडर को स्व-ध्यान ट्रांसफॉर्मर ब्लॉकों (जिन्हें "एनकोडर ब्लॉक" कहा जाता है) और आवर्तक डिकोडर को क्रॉस-अटेंशन कारणात्मक-मास्क्ड ट्रांसफॉर्मर ब्लॉकों ("डिकोडर ब्लॉक") के साथ बदलकर इस समस्या को हल किया। इसने समानांतर हार्डवेयर पर बहुत तेज़ प्रशिक्षण की अनुमति दी और बड़े भाषा मॉडल और जनरेटिव AI प्रणालियों जैसे बड़े पैमाने के मॉडल के विकास के लिए नेतृत्व किया।

वास्तुकला

seq2seq वास्तुकला में दो मुख्य घटक होते हैं: एनकोडर और डिकोडर।

एनकोडर

एनकोडर इनपुट अनुक्रम को संसाधित करता है, आमतौर पर टोकन या शब्दों का एक अनुक्रम, और इसकी आवश्यक जानकारी को पकड़ता है। एक RNN-आधारित एनकोडर में, यह जानकारी नेटवर्क की छिपी हुई स्थिति में संग्रहीत होती है। ध्यान के साथ, एनकोडर प्रत्येक इनपुट स्थिति के लिए छिपे हुए राज्यों का एक सेट भी उत्पन्न करता है, जिनका उपयोग संदर्भ वैक्टर की गणना करने के लिए किया जाता है। एनकोडर द्विदिश हो सकता है, जिसका अर्थ है कि यह संदर्भ को बेहतर ढंग से पकड़ने के लिए इनपुट को दोनों दिशाओं से पढ़ता है।

डिकोडर

डिकोडर एनकोडर से संदर्भ वैक्टर और छिपे हुए राज्यों को लेता है और आउटपुट अनुक्रम को स्वप्रतिगामी रूप से उत्पन्न करता है, एक समय में एक तत्व का उत्पादन करता है। प्रत्येक चरण में, यह पहले उत्पन्न तत्वों, संदर्भ वेक्टर, और इनपुट जानकारी पर विचार करता है ताकि अगले तत्व की भविष्यवाणी की जा सके। ध्यान वाले मॉडल में, संदर्भ वेक्टर और डिकोडर की छिपी हुई स्थिति को एक ध्यान छिपा वेक्टर बनाने के लिए जोड़ा जाता है, जिसका उपयोग अगले चरण के लिए इनपुट के रूप में किया जाता है। डिकोडर अक्सर कारणात्मक रूप से मास्क्ड होता है ताकि प्रशिक्षण के दौरान भविष्य के टोकन को देखने से रोका जा सके।

प्रशिक्षण बनाम भविष्यवाणी

seq2seq मॉडल में प्रशिक्षण और भविष्यवाणी के बीच एक सूक्ष्म अंतर है। प्रशिक्षण के दौरान, इनपुट और आउटपुट दोनों अनुक्रम ज्ञात होते हैं, जो "शिक्षक मजबूरी" नामक तकनीक के उपयोग की अनुमति देता है। शिक्षक मजबूरी में, प्रत्येक चरण पर डिकोडर का इनपुट प्रशिक्षण डेटा से संदर्भ आउटपुट टोकन होता है, भले ही मॉडल ने क्या भविष्यवाणी की हो। यह अभिसरण को तेज करता है और प्रशिक्षण को स्थिर करता है।

भविष्यवाणी (अनुमान) के दौरान, संदर्भ आउटपुट उपलब्ध नहीं होता है, इसलिए डिकोडर को अगले चरण के लिए इनपुट के रूप में अपने स्वयं के पहले उत्पन्न टोकन का उपयोग करना चाहिए। यह त्रुटि संचय का कारण बन सकता है, क्योंकि अनुक्रम में शुरुआती गलती फैल सकती है। इसे कम करने के लिए, बीम खोज जैसी तकनीकों का अक्सर उपयोग किया जाता है ताकि कई उम्मीदवार अनुक्रमों का पता लगाया जा सके और सबसे संभावित एक का चयन किया जा सके।

अनुप्रयोग

seq2seq मॉडल कार्यों की एक विस्तृत श्रृंखला पर लागू किए गए हैं। मशीन अनुवाद में, उन्होंने 2016 में गूगल ट्रांसलेट को गूगल न्यूरल मशीन ट्रांसलेशन में बदलने में सक्षम बनाया। अन्य अनुप्रयोगों में छवि कैप्शनिंग शामिल है, जहां एनकोडर एक छवि को संसाधित करता है (एक संवेगात्मक तंत्रिका नेटवर्क के माध्यम से) और डिकोडर एक पाठ्य विवरण उत्पन्न करता है; संवादी मॉडल, जैसे चैटबॉट; भाषण पहचान, ऑडियो अनुक्रमों को पाठ में मैप करना; और पाठ सारांशीकरण, लंबे दस्तावेजों को संक्षिप्त सारांश में संपीड़ित करना। वास्तुकला कई आधुनिक ट्रांसफॉर्मर-आधारित मॉडलों को भी रेखांकित करती है जो कृत्रिम बुद्धिमत्ता प्रणालियों में उपयोग किए जाते हैं।

प्राथमिकता विवाद

seq2seq के आविष्कार के आसपास एक उल्लेखनीय प्राथमिकता विवाद है। टोमास मिकोलोव, जो word2vec और RNNLM विकसित करने के लिए जाने जाते हैं, का दावा है कि उन्होंने वाक्यों के जोड़े पर एक तंत्रिका भाषा मॉडल का उपयोग करने और पहले वाक्य को देखने के बाद अनुवाद उत्पन्न करने का विचार कल्पना किया था, जिसे वे seq2seq मशीन अनुवाद के बराबर मानते हैं। उन्होंने कहा कि उन्होंने गूगल ब्रेन में रहते हुए इस विचार का उल्लेख इल्या सुत्सकेवर और क्वोक ले से किया था, लेकिन उन्होंने अपने 2014 के पेपर में उन्हें स्वीकार नहीं किया। सुत्सकेवर एट अल. का पेपर व्यापक रूप से एक प्रमुख मूल के रूप में श्रेय दिया जाता है, लेकिन मिकोलोव के योगदान शोध समुदाय में बहस का विषय बने हुए हैं।

विरासत और प्रभाव

seq2seq ने मशीन लर्निंग के क्षेत्र पर गहरा प्रभाव डाला है। इसने एनकोडर-डिकोडर प्रतिमान पेश किया जो अब अनुक्रम स्थानांतरण कार्यों में मानक है। ध्यान तंत्र, जो शुरू में seq2seq के लिए विकसित किया गया था, ट्रांसफॉर्मर वास्तुकला का एक मौलिक घटक बन गया, जो OpenAI, Anthropic, और Google DeepMind द्वारा विकसित बड़े भाषा मॉडल जैसे आधुनिक बड़े भाषा मॉडल को शक्ति देता है। seq2seq के सिद्धांत विशेष हार्डवेयर और क्लाउड सेवाओं में भी लागू होते हैं, जैसे AWS Trainium और Azure, जो ऐसे मॉडलों के प्रशिक्षण और अनुमान के लिए अनुकूलित हैं। 2020 के दशक की शुरुआत तक, seq2seq गहन शिक्षण पाठ्यक्रम और अनुसंधान में एक मूल अवधारणा बना हुआ है, हालांकि कई उत्पादन प्रणालियां ट्रांसफॉर्मर-आधारित वास्तुकला में स्थानांतरित हो गई हैं जो इसकी नींव पर निर्माण करती हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·natural-language-processing·deep-learning·sequence-modeling
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास