ट्रांसफॉर्मर एक न्यूरल नेटवर्क आर्किटेक्चर है, जिसे 2017 में पेश किया गया था, जो पाठ जैसे अनुक्रमिक डेटा को पहले के मॉडलों द्वारा उपयोग किए जाने वाले चरण-दर-चरण पुनरावृत्ति के बजाय ध्यान तंत्र के माध्यम से संसाधित करता है, जिससे पूरे अनुक्रम को समानांतर रूप से संसाधित किया जा सकता है। यह लगभग सभी आधुनिक बड़े भाषा मॉडल की नींव बन गया है और इसे छवियों, ऑडियो और अन्य डेटा प्रकारों के लिए भी अनुकूलित किया गया है।
इतिहास
ट्रांसफॉर्मर से पहले, मशीन अनुवाद जैसे कार्यों के लिए अनुक्रम मॉडलिंग मुख्य रूप से पुनरावर्ती तंत्रिका नेटवर्क पर निर्भर थी, जिसमें Seq2seq एनकोडर-डिकोडर मॉडल शामिल थे, जो इनपुट टोकन को एक-एक करके संसाधित करते हैं और इसलिए समानांतरीकरण और लंबे अनुक्रमों पर जानकारी बनाए रखने में कठिनाई होती है। ट्रांसफॉर्मर को 2017 के पेपर Attention Is All You Need में Ashish Vaswani और Noam Shazeer सहित शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिन्होंने पुनरावृत्ति को पूरी तरह से त्यागकर स्व-ध्यान के पक्ष में प्रस्ताव रखा। पेपर के सभी आठ लेखकों ने बाद में उस कंपनी को छोड़ दिया जहां काम किया गया था, ताकि वे अन्य एआई कंपनियों की स्थापना करें या उनमें शामिल हों, जो एक शोध पेपर के लिए एक असामान्य परिणाम है।
आर्किटेक्चर
एक ट्रांसफॉर्मर इनपुट अनुक्रम को संसाधित करता है, जिसे पहले टोकनाइजेशन और एम्बेडिंग के माध्यम से वेक्टर प्रतिनिधित्व में परिवर्तित किया जाता है, बार-बार स्व-ध्यान परतों को लागू करके, जो अनुक्रम में प्रत्येक स्थिति को हर अन्य स्थिति की प्रासंगिकता को तौलने देती हैं, साथ ही सरल फीड-फॉरवर्ड परतें भी। चूंकि स्व-ध्यान में अनुक्रम क्रम की कोई अंतर्निहित धारणा नहीं होती है, ट्रांसफॉर्मर अपने इनपुट प्रतिनिधित्व में स्थितीय जानकारी जोड़ते हैं। समानांतर में चलने वाले कई ध्यान "सिर" मॉडल को एक साथ विभिन्न प्रकार के संबंधों को पकड़ने की अनुमति देते हैं। मूल आर्किटेक्चर में एक अलग एनकोडर और डिकोडर का उपयोग किया गया था; अधिकांश आधुनिक बड़े भाषा मॉडल केवल-डिकोडर संस्करण का उपयोग करते हैं, जो पहले उत्पन्न सभी टोकन के आधार पर एक समय में एक टोकन उत्पन्न करता है।
प्रभाव
ट्रांसफॉर्मर की समानांतरीकरण क्षमता ने मॉडलों को पुनरावर्ती आर्किचेक्चर की तुलना में कहीं बड़े डेटासेट और कहीं अधिक मापदंडों पर प्रशिक्षित करने की अनुमति दी, जिससे 2018 में BERT से लेकर GPT-3 और उससे आगे के मॉडलों की पैमाने-संचालित प्रगति सीधे संभव हुई। इसका स्व-ध्यान तंत्र, जो सिद्धांत रूप में किसी भी डेटा पर लागू होता है जिसे अनुक्रम के रूप में दर्शाया जा सकता है, को छवियों के लिए भी अनुकूलित किया गया, जिससे विज़न ट्रांसफॉर्मर और आधुनिक विज़न-भाषा मॉडल में उपयोग किए जाने वाले संयुक्त पाठ-और-छवि सिस्टम बने।
विविधताएं और विकल्प
स्व-ध्यान की कम्प्यूटेशनल लागत अनुक्रम लंबाई के साथ द्विघात रूप से बढ़ती है, जिससे दक्षता-केंद्रित विविधताएं और पूरी तरह से अलग आर्किटेक्चर दोनों प्रेरित हुए। विशेषज्ञों का मिश्रण मॉडल किसी भी इनपुट के लिए ट्रांसफॉर्मर के केवल एक उपसमुच्चय को सक्रिय करते हैं, जिससे मॉडल आकार के सापेक्ष कम्प्यूटेशनल लागत कम होती है। राज्य-स्थान मॉडल, जैसे कि 2023 में पेश किया गया माम्बा आर्किटेक्चर, एक विकल्प प्रदान करते हैं जो अनुक्रम लंबाई के साथ द्विघात के बजाय रैखिक रूप से बढ़ता है, हालांकि 2020 के दशक के मध्य तक उन्होंने अग्रणी भाषा मॉडलों के लिए प्रमुख आर्किटेक्चर के रूप में ट्रांसफॉर्मर को विस्थापित नहीं किया था।