DeBERTa (Decoding-enhanced BERT with disentangled attention) प्राकृतिक भाषा प्रसंस्करण (NLP) के लिए ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क आर्किटेक्चर का एक परिवार है, जिसे 2021 में माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा पेश किया गया था। यह पहले के BERT मॉडल पर आधारित है, जिसमें दो प्रमुख नवाचार शामिल हैं: एक पृथक ध्यान तंत्र जो सामग्री और सापेक्ष स्थिति जानकारी को अलग-अलग मॉडल करता है, और एक उन्नत मास्क डिकोडर जो पूर्व-प्रशिक्षण के दौरान मास्क किए गए टोकन की भविष्यवाणी में सुधार करता है। ये परिवर्तन DeBERTa को कई NLP बेंचमार्क पर बेहतर प्रदर्शन प्राप्त करने की अनुमति देते हैं, जिसमें SuperGLUE लीडरबोर्ड भी शामिल है, जहां इसने जनवरी 2021 में पहली बार मानव बेसलाइन स्कोर को पार किया।
पृष्ठभूमि और प्रेरणा
DeBERTa बड़े भाषा मॉडलों के व्यापक विकास का हिस्सा है, जो 2017 में ट्रांसफॉर्मर आर्किटेक्चर की शुरुआत के साथ शुरू हुआ। BERT, जिसे 2018 में Google द्वारा जारी किया गया था, ने प्रदर्शित किया कि बड़े पाठ कोषों पर द्विदिश ट्रांसफॉर्मर एनकोडर का पूर्व-प्रशिक्षण कई डाउनस्ट्रीम कार्यों के लिए स्थानांतरणीय प्रतिनिधित्व उत्पन्न कर सकता है। हालांकि, BERT का ध्यान तंत्र टोकन स्थितियों को इनपुट में जोड़े गए निरपेक्ष एम्बेडिंग के रूप में एनकोड करता है, जो लंबे अनुक्रमों या अदृश्य स्थिति संयोजनों के लिए सामान्यीकरण की क्षमता को सीमित कर सकता है। DeBERTa सामग्री और स्थिति जानकारी को अलग करके इसे संबोधित करता है, जिससे मॉडल टोकन के बीच अधिक लचीले संबंध सीख सकता है।
आर्किटेक्चर
DeBERTa BERT की समग्र एनकोडर-केवल संरचना को बनाए रखता है, जिसमें एक एम्बेडिंग परत, कई ट्रांसफॉर्मर एनकोडर परतें और एक कार्य-विशिष्ट आउटपुट हेड शामिल है। प्राथमिक आर्किटेक्चरल अंतर ध्यान गणना और मास्क डिकोडिंग प्रक्रिया में निहित हैं।
पृथक ध्यान
मानक ट्रांसफॉर्मर ध्यान में, प्रत्येक टोकन को एक एकल वेक्टर द्वारा दर्शाया जाता है जो इसकी सामग्री और निरपेक्ष स्थिति को जोड़ता है। DeBERTa इसके बजाय प्रत्येक टोकन को दो अलग-अलग वैक्टरों के साथ दर्शाता है: एक सामग्री के लिए और एक सापेक्ष स्थिति के लिए। दो टोकन के बीच ध्यान स्कोर तब चार अलग-अलग शब्दों के योग के रूप में गणना की जाती है: सामग्री-से-सामग्री, सामग्री-से-स्थिति, स्थिति-से-सामग्री, और स्थिति-से-स्थिति। यह पृथक्करण मॉडल को शब्द क्रम और दूरी की सूक्ष्म समझ की आवश्यकता वाले कार्यों के लिए विशेष रूप से लाभकारी, अर्थ संबंधी और स्थितिगत संबंधों को स्वतंत्र रूप से कैप्चर करने की अनुमति देता है।
उन्नत मास्क डिकोडर
DeBERTa का पूर्व-प्रशिक्षण उद्देश्य मास्क किए गए भाषा मॉडलिंग है, जो BERT के समान है। हालांकि, DeBERTa एक उन्नत मास्क डिकोडर पेश करता है जो मूल शब्द की भविष्यवाणी करने के लिए मास्क किए गए टोकन की सामग्री और स्थिति दोनों जानकारी का उपयोग करता है। यह मास्क किए गए टोकन की निरपेक्ष स्थिति को डिकोडिंग परत में शामिल करके प्राप्त किया जाता है, जो मॉडल को उन अस्पष्टताओं को हल करने में मदद करता है जो कई टोकन समान सापेक्ष स्थिति साझा करने पर उत्पन्न होती हैं। उन्नत डिकोडर पूर्व-प्रशिक्षण की दक्षता में सुधार करता है और बेहतर डाउनस्ट्रीम प्रदर्शन की ओर ले जाता है।
प्रशिक्षण और विविधताएं
DeBERTa को BERT के समान कोष पर पूर्व-प्रशिक्षित किया गया था, जिसमें अंग्रेजी विकिपीडिया और BookCorpus शामिल हैं, जो कुल मिलाकर लगभग 16GB पाठ है। बेस मॉडल, DeBERTa-base, में 12 परतें, 768 छिपी हुई इकाइयां और 12 ध्यान हेड हैं, जो कुल मिलाकर लगभग 140 मिलियन पैरामीटर हैं। एक बड़ा संस्करण, DeBERTa-large, में 24 परतें, 1024 छिपी हुई इकाइयां और 16 ध्यान हेड हैं, जिसमें लगभग 400 मिलियन पैरामीटर हैं। 2021 में, माइक्रोसॉफ्ट ने DeBERTa-v3 भी जारी किया, जिसने प्रतिस्थापित टोकन पहचान नामक एक नई पूर्व-प्रशिक्षण विधि पेश की, जिससे दक्षता और प्रदर्शन में और सुधार हुआ।
प्रदर्शन और प्रभाव
DeBERTa ने कई प्रमुख NLP बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए। जनवरी 2021 में, बड़े मॉडल आकार और अतिरिक्त प्रशिक्षण डेटा के साथ DeBERTa ने SuperGLUE बेंचमार्क पर मानव बेसलाइन को पार कर लिया, एक मील का पत्थर जिसने बड़े भाषा मॉडलों की तीव्र प्रगति को उजागर किया। DeBERTa ने GLUE बेंचमार्क और SQuAD प्रश्न-उत्तर डेटासेट पर भी मजबूत प्रदर्शन किया। इसके नवाचारों ने बाद के मॉडलों को प्रभावित किया, जिसमें GPT और T5 परिवारों के मॉडल शामिल हैं, और बाद के आर्किटेक्चर में अधिक कुशल ध्यान तंत्र के विकास में योगदान दिया।