ट्रांसफॉर्मर कृत्रिम तंत्रिका नेटवर्क वास्तुकलाओं का एक परिवार है, जो गहन शिक्षण में उपयोग किया जाता है, और यह मल्टी-हेड अटेंशन तंत्र पर आधारित है। पाठ, चित्र, या ऑडियो जैसे इनपुट डेटा को टोकन नामक संख्यात्मक प्रस्तुतियों के अनुक्रम में परिवर्तित किया जाता है, जिनमें से प्रत्येक को शब्द एम्बेडिंग तालिका के माध्यम से एक वेक्टर में मैप किया जाता है। प्रत्येक परत पर, हर टोकन को संदर्भ विंडो के भीतर समानांतर मल्टी-हेड अटेंशन का उपयोग करके संदर्भित किया जाता है, जो महत्वपूर्ण टोकन को बढ़ाता है और कम प्रासंगिक टोकन को घटाता है। चूंकि सेल्फ-अटेंशन अकेले क्रम-परिवर्तन-अपरिवर्तनीय है, ट्रांसफॉर्मर स्थितीय एन्कोडिंग या सीखी गई एम्बेडिंग के माध्यम से स्थितीय जानकारी इंजेक्ट करते हैं, ताकि टोकन क्रम आउटपुट को प्रभावित करे।
ट्रांसफॉर्मर में आवर्ती इकाइयाँ नहीं होती हैं, जिससे पुराने आवर्ती वास्तुकलाओं जैसे LSTM की तुलना में कम प्रशिक्षण समय की आवश्यकता होती है। आधुनिक डिज़ाइनों को एनकोडर-केवल, डिकोडर-केवल, और एनकोडर-डिकोडर वेरिएंट में समूहित किया जाता है, जो प्रतिनिधित्व शिक्षण, ऑटोरेग्रेसिव जनरेशन, या सशर्त अनुक्रम-से-अनुक्रम कार्यों के लिए अनुकूलित होते हैं। मूल ट्रांसफॉर्मर 2017 के पेपर "Attention Is All You Need" में Google के शोधकर्ताओं द्वारा प्रस्तावित किया गया था। तब से यह बड़े भाषा मॉडल (LLM) का आधार बन गया है और प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर दृष्टि, सुदृढीकरण शिक्षण, ऑडियो, मल्टीमॉडल शिक्षण, रोबोटिक्स, और शतरंज में अनुप्रयोग पाया है।
इतिहास
पूर्ववर्ती
कई वर्षों तक, अनुक्रम मॉडलिंग में सरल आवर्ती तंत्रिका नेटवर्क (RNN) का उपयोग किया जाता था, जैसे एलमैन नेटवर्क (1990)। सिद्धांत रूप में, एक टोकन से जानकारी मनमाने ढंग से दूर तक प्रसारित हो सकती थी, लेकिन लुप्त-ग्रेडिएंट समस्या लंबे अनुक्रमों को सटीक निकालने योग्य जानकारी के बिना छोड़ देती थी। एक प्रमुख सफलता LSTM थी, जिसे 1995 की तकनीकी रिपोर्ट में वर्णित किया गया और 1997 में औपचारिक रूप से प्रकाशित किया गया, जिसने लुप्त ग्रेडिएंट को कम करने के लिए गेटिंग तंत्र पेश किए। LSTM ने गुणक गेटिंग इकाइयों का उपयोग किया, जो अवधारणात्मक रूप से योगात्मक अटेंशन से अलग था। यह 2017 तक लंबे अनुक्रम मॉडलिंग के लिए मानक बन गया, लेकिन RNN टोकन को क्रमिक रूप से संसाधित करते हैं, जिससे समानांतरीकरण रुक जाता है। रैखिक रूप से स्केलिंग फास्ट वेट कंट्रोलर (1992) ने इनपुट के आधार पर वेट मैट्रिसेस की गणना करना सीखा, जो एक अनसामान्यीकृत रैखिक ट्रांसफॉर्मर के बराबर था।
seq2seq के साथ अटेंशन
एनकोडर-डिकोडर अनुक्रम स्थानांतरण 2010 के दशक की शुरुआत में विकसित हुआ, जिसमें 2014 के दो समवर्ती पेपर थे। एक 380M-पैरामीटर मॉडल ने मशीन अनुवाद के लिए दो LSTM का उपयोग किया: एक एनकोडर LSTM ने टोकन अनुक्रम को एक वेक्टर में बदल दिया, और एक डिकोडर LSTM ने इसे आउटपुट में परिवर्तित किया। एक अन्य 130M-पैरामीटर मॉडल ने गेटेड आवर्ती इकाइयों (GRU) का उपयोग किया, जो बाद में LSTM के बराबर दिखाए गए। इन शुरुआती seq2seq मॉडल में अटेंशन की कमी थी, जो अंतिम शब्द के बाद एक निश्चित-आकार के राज्य वेक्टर पर निर्भर थे, जो लंबे इनपुट जानकारी को खराब तरीके से संरक्षित करता था। इनपुट वाक्य को उलटने से अनुवाद में सुधार हुआ, जो अड़चन को उजागर करता है। RNN सर्च मॉडल ने seq2seq में अटेंशन पेश किया, जिससे लंबे निर्भरताओं को बेहतर ढंग से संभाला जा सका। 2016 में, Google Translate को Google Neural Machine Translation में बदल दिया गया, जिसमें 8-परत द्विदिशात्मक LSTM seq2seq मॉडल का उपयोग किया गया, जो सांख्यिकीय विधियों से बेहतर प्रदर्शन करता था।
अटेंशन का समानांतरीकरण
अटेंशन के साथ seq2seq मॉडल अभी भी आवर्ती नेटवर्क की समानांतरीकरण में कठिनाई से पीड़ित थे, जिससे GPU त्वरण सीमित हो गया। 2016 में, विघटनीय अटेंशन ने फीडफॉरवर्ड नेटवर्क पर सेल्फ-अटेंशन लागू किया, जिससे कम पैरामीटर के साथ अत्याधुनिक पाठ्य निहितार्थ प्राप्त हुआ। लेखक जैकब उस्ज़कोरिट ने संदेह किया कि बिना आवृत्ति के अटेंशन अनुवाद के लिए पर्याप्त हो सकता है, जिससे शीर्षक "Attention Is All You Need" बना।
वास्तुकला
ट्रांसफॉर्मर वास्तुकला में एक एनकोडर और एक डिकोडर होता है, जिनमें से प्रत्येक में मल्टी-हेड सेल्फ-अटेंशन और स्थिति-वार फीडफॉरवर्ड नेटवर्क वाली परतें होती हैं। एनकोडर इनपुट अनुक्रम को समानांतर में संसाधित करता है, जबकि डिकोडर आउटपुट को ऑटोरेग्रेसिव रूप से उत्पन्न करता है, भविष्य के टोकन रिसाव को रोकने के लिए मास्क्ड सेल्फ-अटेंशन का उपयोग करता है। मल्टी-हेड अटेंशन कई अटेंशन तंत्रों को समानांतर में चलाता है, जिससे मॉडल विभिन्न प्रतिनिधित्व उप-स्थानों पर ध्यान केंद्रित कर सकता है। स्थितीय एन्कोडिंग को टोकन एम्बेडिंग में क्रम को पकड़ने के लिए जोड़ा जाता है। लेयर नॉर्मलाइज़ेशन और अवशिष्ट कनेक्शन प्रशिक्षण को स्थिर करते हैं। डिकोडर एनकोडर आउटपुट पर ध्यान देने के लिए क्रॉस-अटेंशन का भी उपयोग करता है।
वेरिएंट
एनकोडर-केवल
एनकोडर-केवल मॉडल, जैसे BERT, प्रतिनिधित्व शिक्षण के लिए अनुकूलित होते हैं, जो वर्गीकरण और समझ कार्यों के लिए उपयोगी संदर्भित टोकन एम्बेडिंग उत्पन्न करते हैं। वे द्विदिशात्मक अटेंशन का उपयोग करते हैं, जो बाएं और दाएं दोनों संदर्भ देखते हैं।
डिकोडर-केवल
डिकोडर-केवल मॉडल, जैसे GPT, ऑटोरेग्रेसिव जनरेशन के लिए डिज़ाइन किए गए हैं, जो पिछले टोकन दिए जाने पर अगले टोकन की भविष्यवाणी करते हैं। वे मास्क्ड सेल्फ-अटेंशन का उपयोग करते हैं और अधिकांश आधुनिक LLM का आधार हैं, जो बड़े पाठ कोषों पर प्रशिक्षित होते हैं।
एनकोडर-डिकोडर
एनकोडर-डिकोडर मॉडल, जैसे मूल ट्रांसफॉर्मर, अनुवाद और सारांशीकरण जैसे सशर्त अनुक्रम-से-अनुक्रम कार्यों को संभालते हैं। एनकोडर स्रोत को संसाधित करता है, और डिकोडर लक्ष्य उत्पन्न करता है।
अनुप्रयोग
ट्रांसफॉर्मर जनरेटिव AI प्रणालियों में उपयोग किए जाते हैं, जिनमें GPT और BERT जैसे LLM शामिल हैं, जिन्हें OpenAI, Anthropic, और Google DeepMind जैसी कंपनियों ने अपनाया है। वे प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर दृष्टि (विज़न ट्रांसफॉर्मर), सुदृढीकरण शिक्षण, ऑडियो प्रसंस्करण, मल्टीमॉडल शिक्षण, रोबोटिक्स, और यहां तक कि शतरंज खेलने वाले कार्यक्रमों को शक्ति प्रदान करते हैं। उनकी स्केलेबिलिटी ने हार्डवेयर में प्रगति को बढ़ावा दिया है, जिसमें AWS Trainium और Groq के अनुमान प्रोसेसर जैसे विशेष चिप्स शामिल हैं।
प्रभाव
ट्रांसफॉर्मर ने कृत्रिम बुद्धिमत्ता में क्रांति ला दी है, जिससे पूर्व-प्रशिक्षित प्रणालियाँ सक्षम हुई हैं जिन्हें विविध कार्यों के लिए फाइन-ट्यून किया जा सकता है। उन्होंने RNN की तुलना में प्रशिक्षण समय कम किया है और अभूतपूर्व मॉडल आकारों की अनुमति दी है, जिससे भाषा समझ और जनरेशन में सफलताएँ मिली हैं। वास्तुकला की लचीलापन ने इसे कई AI अनुप्रयोगों के लिए डिफ़ॉल्ट विकल्प बना दिया है, जो अनुसंधान और उद्योग दोनों को प्रभावित करता है।
सीमाएँ और भविष्य
उनकी सफलता के बावजूद, ट्रांसफॉर्मर को संदर्भ लंबाई में द्विघात गणना की आवश्यकता होती है, जिससे लंबे अनुक्रम महंगे हो जाते हैं। शोधकर्ता इस समस्या को हल करने के लिए रैखिक अटेंशन तंत्र और वैकल्पिक वास्तुकलाओं की खोज कर रहे हैं। 2025 तक, ट्रांसफॉर्मर प्रमुख बने हुए हैं, लेकिन चल रहे नवाचार अधिक कुशल डिज़ाइनों की ओर ले जा सकते हैं।