ट्रांसफॉर्मर कृत्रिम तंत्रिका नेटवर्क वास्तुकलाओं का एक परिवार है जो बहु-शीर्ष ध्यान तंत्र पर आधारित है। इस डिज़ाइन में, पाठ, चित्र, या ऑडियो जैसे इनपुट डेटा को टोकन नामक संख्यात्मक प्रतिनिधित्वों के अनुक्रम में परिवर्तित किया जाता है, और प्रत्येक टोकन को शब्द एम्बेडिंग तालिका से लुकअप के माध्यम से एक वेक्टर में परिवर्तित किया जाता है। प्रत्येक परत पर, प्रत्येक टोकन को संदर्भ विंडो के दायरे में अन्य अनमास्क्ड टोकन के साथ समानांतर बहु-शीर्ष ध्यान तंत्र के माध्यम से संदर्भित किया जाता है, जिससे प्रमुख टोकन के लिए संकेत को बढ़ाया जा सकता है और कम महत्वपूर्ण टोकन को घटाया जा सकता है। चूंकि स्व-ध्यान अकेले क्रम-परिवर्तन-अपरिवर्तनीय है, ट्रांसफॉर्मर स्थितीय जानकारी इंजेक्ट करते हैं, आमतौर पर स्थितीय एन्कोडिंग या सीखी गई स्थितीय एम्बेडिंग के माध्यम से, ताकि टोकन क्रम आउटपुट को प्रभावित कर सके।
मूल ट्रांसफॉर्मर वास्तुकला 2017 के पेपर "Attention Is All You Need" में Google के शोधकर्ताओं द्वारा प्रस्तावित की गई थी, जिनमें जैकब उस्कोरिट, लुकाज़ कैसर, और निकी परमार शामिल थे। इस पेपर ने आवर्तक तंत्रिका नेटवर्क (RNN) जैसे लंबी अल्पकालिक स्मृति (LSTM) से प्रस्थान को चिह्नित किया, जो अनुक्रम मॉडलिंग पर हावी थे। ट्रांसफॉर्मर का लाभ यह है कि उनमें कोई आवर्तक इकाइयाँ नहीं होती हैं, इसलिए पहले की आवर्तक वास्तुकलाओं की तुलना में कम प्रशिक्षण समय की आवश्यकता होती है, और तब से उन्हें बड़े डेटासेट पर बड़े भाषा मॉडल (LLM) प्रशिक्षित करने के लिए व्यापक रूप से अपनाया गया है। आधुनिक ट्रांसफॉर्मर डिज़ाइनों को आमतौर पर केवल-एन्कोडर, केवल-डिकोडर, और एन्कोडर-डिकोडर वेरिएंट में वर्गीकृत किया जाता है, यह इस पर निर्भर करता है कि वे प्रतिनिधित्व सीखने, स्वप्रतिगामी उत्पादन, या सशर्त अनुक्रम-से-अनुक्रम कार्यों के लिए अनुकूलित हैं।
पूर्ववर्ती और अनुक्रमिक प्रसंस्करण की समस्या
कई वर्षों तक, अनुक्रम मॉडलिंग और उत्पादन सादे आवर्तक तंत्रिका नेटवर्क का उपयोग करके किया जाता था। एक अच्छी तरह से उद्धृत प्रारंभिक उदाहरण एलमैन नेटवर्क (1990) था। सिद्धांत रूप में, एक टोकन से जानकारी अनुक्रम में मनमाने ढंग से दूर तक प्रसारित हो सकती है, लेकिन व्यवहार में, लुप्त-ग्रेडिएंट समस्या मॉडल की स्थिति को लंबे वाक्य के अंत में पिछले टोकन के बारे में सटीक, निकालने योग्य जानकारी के बिना छोड़ देती है। एक प्रमुख सफलता LSTM थी, जिसे मूल रूप से 1995 की तकनीकी रिपोर्ट में वर्णित किया गया था और औपचारिक रूप से 1997 में प्रकाशित किया गया था, जिसने लुप्त-ग्रेडिएंट समस्या को कम करने के लिए गेटिंग तंत्र पेश किए, जिससे लंबे-अनुक्रम मॉडलिंग का कुशल सीखना संभव हुआ। एक प्रमुख वास्तुकला तत्व गुणक गेटिंग इकाइयों का उपयोग था, जिसमें कुछ न्यूरॉन्स के आउटपुट दूसरों के आउटपुट को नियंत्रित करते हैं। ये गुणक इकाइयाँ अवधारणात्मक रूप से बाद में अनुक्रम-से-अनुक्रम मॉडल के लिए पेश किए गए योगात्मक ध्यान तंत्र से भिन्न हैं। LSTM 2017 में ट्रांसफॉर्मर के प्रकाशन तक लंबे अनुक्रम मॉडलिंग के लिए मानक वास्तुकला बन गया। हालाँकि, LSTM अभी भी अनुक्रमिक प्रसंस्करण का उपयोग करता था, पहले से अंतिम तक एक समय में एक टोकन संचालित करता था; वे अनुक्रम में सभी टोकन पर समानांतर रूप से कार्य नहीं कर सकते हैं।
आधुनिक ट्रांसफॉर्मर इस समस्या को दूर करते हैं, लेकिन RNN के विपरीत, उन्हें संदर्भ विंडो के आकार में द्विघात गणना समय की आवश्यकता होती है। रैखिक रूप से स्केलिंग फास्ट वेट कंट्रोलर (1992) इनपुट के आधार पर आगे की प्रक्रिया के लिए एक वेट मैट्रिक्स की गणना करना सीखता है। इसके दो नेटवर्कों में से एक में "फास्ट वेट" या "डायनामिक लिंक" (1981) होते हैं। एक धीमा तंत्रिका नेटवर्क ग्रेडिएंट डिसेंट द्वारा फास्ट तंत्रिका नेटवर्क के वेट परिवर्तनों की गणना के लिए कुंजी और मान उत्पन्न करना सीखता है, जो प्रश्नों के उत्तर की गणना करता है। यह बाद में अनसामान्यीकृत रैखिक ट्रांसफॉर्मर के बराबर दिखाया गया था।
अनुक्रम-से-अनुक्रम मॉडल के साथ ध्यान
एन्कोडर-डिकोडर अनुक्रम ट्रांसडक्शन का विचार 2010 के दशक की शुरुआत में विकसित किया गया था; आमतौर पर seq2seq उत्पन्न करने वाले मूल के रूप में उद्धृत 2014 के दो समवर्ती प्रकाशित पेपर हैं। मशीन अनुवाद के लिए एक 380M-पैरामीटर मॉडल दो लंबी अल्पकालिक स्मृतियों का उपयोग करता है। इसकी वास्तुकला में दो भाग होते हैं: एन्कोडर एक LSTM है जो टोकन के अनुक्रम को लेता है और इसे एक वेक्टर में बदल देता है, और डिकोडर एक और LSTM है जो वेक्टर को टोकन के अनुक्रम में परिवर्तित करता है। इसी तरह, एक और 130M-पैरामीटर मॉडल ने LSTM के बजाय गेटेड आवर्तक इकाइयों (GRU) का उपयोग किया। बाद के शोध ने दिखाया कि GRU seq2seq के लिए LSTM से न तो बेहतर हैं और न ही बदतर।
इन प्रारंभिक seq2seq मॉडल में कोई ध्यान तंत्र नहीं था, और स्थिति वेक्टर केवल स्रोत पाठ के अंतिम शब्द के प्रसंस्करण के बाद ही सुलभ होता है। हालाँकि सिद्धांत रूप में ऐसा वेक्टर पूरे मूल वाक्य के बारे में जानकारी बनाए रखता है, व्यवहार में जानकारी खराब रूप से संरक्षित होती है। ऐसा इसलिए है क्योंकि इनपुट को एक आवर्तक नेटवर्क द्वारा अनुक्रमिक रूप से एक निश्चित-आकार के आउटपुट वेक्टर में संसाधित किया जाता है, जिसे फिर एक और आवर्तक नेटवर्क द्वारा आउटपुट में संसाधित किया जाता है। यदि इनपुट लंबा है, तो आउटपुट वेक्टर सभी प्रासंगिक जानकारी शामिल करने में सक्षम नहीं होगा, जिससे आउटपुट खराब हो जाएगा। साक्ष्य के रूप में, इनपुट वाक्य को उलटने से seq2seq अनुवाद में सुधार हुआ।
RNN खोज मॉडल ने मशीन अनुवाद के लिए seq2seq में एक ध्यान तंत्र पेश किया ताकि निश्चित-आकार के आउटपुट वेक्टर की बाधा समस्या को हल किया जा सके, जिससे मॉडल को लंबी-दूरी की निर्भरताओं को अधिक आसानी से संसाधित करने की अनुमति मिली। यह नाम इसलिए है क्योंकि यह "अनुवाद को डिकोड करने के दौरान एक स्रोत वाक्य के माध्यम से खोज का अनुकरण करता है"। मशीन अनुवाद के लिए वैश्विक और स्थानीय ध्यान मॉडल वास्तुकलाओं के बीच सापेक्ष प्रदर्शनों की तुलना की गई, जिसमें पाया गया कि मिश्रित ध्यान की गुणवत्ता वैश्विक ध्यान से अधिक थी, जबकि स्थानीय ध्यान ने अनुवाद समय कम किया।
2016 में, Google Translate को Google Neural Machine Translation में पुनर्निर्मित किया गया, जिसने सांख्यिकीय मशीन अनुवाद पर आधारित पिछले मॉडल को बदल दिया। नया मॉडल एक seq2seq मॉडल था जहाँ एन्कोडर और डिकोडर दोनों द्विदिश LSTM की 8 परतें थीं। इसे विकसित करने में नौ महीने लगे, और यह सांख्यिकीय दृष्टिकोण से बेहतर प्रदर्शन करता था, जिसे विकसित करने में दस साल लगे।
ध्यान को समानांतर करना
ध्यान के साथ seq2seq मॉडल, जिसमें स्व-ध्यान शामिल है, फिर भी आवर्तक नेटवर्क के साथ उसी समस्या से पीड़ित थे: उन्हें समानांतर करना कठिन है, जिसने उन्हें GPU पर त्वरित होने से रोका। 2016 में, विघटनीय ध्यान ने फीडफॉरवर्ड नेटवर्क पर एक स्व-ध्यान तंत्र लागू किया, जो समानांतर करना आसान है, और LSTM की तुलना में परिमाण के क्रम से कम पैरामीटर के साथ पाठ्य आनुषंगिकता में अत्याधुनिक परिणाम प्राप्त किए। इसके एक लेखक, जैकब उस्कोरिट ने संदेह किया कि पुनरावृत्ति के बिना ध्यान भाषा अनुवाद के लिए पर्याप्त होगा, इस प्रकार शीर्षक "Attention Is All You Need"।
2017 के पेपर में पेश की गई ट्रांसफॉर्मर वास्तुकला ने आवर्तक इकाइयों को पूरी तरह से बहु-शीर्ष ध्यान से बदल दिया, जिससे सभी टोकन को समानांतर रूप से संसाधित किया जा सका। इस समानांतरीकरण ने प्रशिक्षण में महत्वपूर्ण गति प्रदान की और जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) और BERT (द्विदिश एन्कोडर प्रतिनिधित्व ट्रांसफॉर्मर से) जैसे पूर्व-प्रशिक्षित सिस्टम के विकास को जन्म दिया। ट्रांसफॉर्मर तब से बड़े पैमाने पर प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर दृष्टि (विज़न ट्रांसफॉर्मर), सुदृढीकरण सीखने, ऑडियो, मल्टीमॉडल सीखने, रोबोटिक्स, और शतरंज खेलने में अनुप्रयोग पाए हैं। यह वास्तुकला कृत्रिम बुद्धिमत्ता के क्षेत्र के लिए आधारभूत बन गई है, जो OpenAI, Anthropic, और Google DeepMind जैसे संगठनों द्वारा विकसित आधुनिक बड़े भाषा मॉडल को रेखांकित करती है।
प्रभाव और विरासत
ट्रांसफॉर्मर के डिज़ाइन ने गहन सीखने में बाद के शोध और विकास को प्रभावित किया है। लंबी-दूरी की निर्भरताओं को संभालने और प्रशिक्षण को समानांतर करने की इसकी क्षमता ने इसे कई कार्यों के लिए डिफ़ॉल्ट वास्तुकला बना दिया है। पेपर के लेखक, जिनमें आशीष कुमार और अन्य शामिल हैं, ने विभिन्न क्षेत्रों में योगदान दिया है, कुछ अन्य संस्थानों में स्थानांतरित हुए हैं। वास्तुकला को विविध डोमेन के लिए अनुकूलित किया गया है, Waymo के स्वायत्त ड्राइविंग से लेकर Groq के हार्डवेयर त्वरक तक। बहु-शीर्ष ध्यान और स्थितीय एन्कोडिंग के सिद्धांत आधुनिक तंत्रिका नेटवर्क डिज़ाइन में मानक घटक बन गए हैं, और ट्रांसफॉर्मर जनरेटिव AI प्रणालियों का आधारशिला बना हुआ है।