SpanBERT Transformer (architecture)-आधारित Neural network वास्तुकला का एक प्रकार है, जिसे 2020 में Carnegie Mellon University और Stanford AI Lab के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। यह मूल BERT मॉडल का विस्तार करता है, जिसमें व्यक्तिगत मास्क किए गए टोकन के बजाय सन्निहित टोकन के पूरे स्पैन की भविष्यवाणी पर ध्यान केंद्रित किया जाता है। मुख्य नवाचार दो प्रशिक्षण उद्देश्यों में निहित है: स्पैन मास्किंग और स्पैन सीमा भविष्यवाणी (SBP)। स्पैन मास्किंग टोकन के एक यादृच्छिक सन्निहित अनुक्रम को एकल [MASK] टोकन से बदल देती है, जिससे मॉडल को अपने आसपास के संदर्भ से पूरे स्पैन का अनुमान लगाने के लिए मजबूर किया जाता है। SBP फिर मास्क किए गए स्पैन के आरंभ और अंत में टोकन के प्रतिनिधित्व का उपयोग करके आंतरिक टोकन की भविष्यवाणी करता है, सीमा जानकारी का लाभ उठाते हुए। यह डिज़ाइन SpanBERT को उन कार्यों के लिए विशेष रूप से प्रभावी बनाता है जिनमें बहु-टोकन इकाइयों और संबंधों की समझ की आवश्यकता होती है, जैसे प्रश्न उत्तर और कोरफेरेंस समाधान।
वास्तुकला और प्रशिक्षण
SpanBERT BERT की मानक Transformer (architecture) एनकोडर वास्तुकला को बनाए रखता है, जिसमें बहु-परत द्विदिश एनकोडर होता है। मुख्य अंतर पूर्व-प्रशिक्षण डेटा मास्किंग रणनीति में है। व्यक्तिगत टोकन के 15% को यादृच्छिक रूप से मास्क करने के बजाय, SpanBERT एक ज्यामितीय वितरण (औसत 3.8 टोकन के साथ) से स्पैन लंबाई का नमूना लेता है और उस पूरे सन्निहित ब्लॉक को मास्क करता है। स्पैन लंबाई 10 टोकन पर सीमित है। यह दृष्टिकोण मॉडल को लंबे अनुक्रमों के भीतर निर्भरता को पकड़ने के लिए प्रोत्साहित करता है। मॉडल को BERT के समान अंग्रेजी विकिपीडिया और BooksCorpus डेटासेट पर प्रशिक्षित किया जाता है, मास्क किए गए स्पैन के लिए समान मास्क भाषा मॉडलिंग उद्देश्य का उपयोग करते हुए, लेकिन अतिरिक्त SBP हानि के साथ। SBP उद्देश्य स्पैन के पहले और अंतिम टोकन (मास्किंग के बाद) की छिपी स्थितियों का उपयोग करके आंतरिक टोकन की भविष्यवाणी करता है, प्रभावी रूप से मॉडल को सामग्री को पुनर्निर्माण करने के लिए सीमा जानकारी का उपयोग करना सिखाता है।
स्पैन सीमा भविष्यवाणी
स्पैन सीमा भविष्यवाणी SpanBERT में प्रस्तुत एक नया सहायक कार्य है। प्रत्येक मास्क किए गए स्पैन के लिए, मॉडल स्पैन से ठीक पहले और ठीक बाद के टोकन के आउटपुट प्रतिनिधित्व लेता है। इन दो वैक्टरों को जोड़ा जाता है और प्रत्येक आंतरिक मास्क टोकन की भविष्यवाणी करने के लिए एक रैखिक परत से गुजारा जाता है। यह मॉडल को स्पैन की सीमाओं को इस तरह से एनकोड करने के लिए मजबूर करता है जो आंतरिक शब्दार्थ सामग्री को पकड़ता है। BERT की मास्क भाषा मॉडलिंग के विपरीत, जो प्रत्येक टोकन को स्वतंत्र रूप से मानता है, SBP मॉडल को स्पैन को एक इकाई के रूप में तर्क करने के लिए प्रोत्साहित करता है। यह विशेष रूप से प्रश्न-उत्तर जैसे कार्यों के लिए फायदेमंद है, जहां उत्तर अक्सर पाठ का एक सन्निहित स्पैन होता है, और कोरफेरेंस-समाधान के लिए, जहां उल्लेख आमतौर पर बहु-टोकन वाक्यांश होते हैं।
प्रदर्शन और प्रभाव
SpanBERT ने अपने रिलीज़ के समय कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए। SQuAD 1.1 और SQuAD 2.0 प्रश्न उत्तर डेटासेट पर, इसने BERT और RoBERTa जैसे समकालीन मॉडलों को पीछे छोड़ दिया। इसने OntoNotes कोरफेरेंस समाधान कार्य और TACRED संबंध निष्कर्षण डेटासेट पर भी नए रिकॉर्ड स्थापित किए। सुधार उन कार्यों पर सबसे अधिक स्पष्ट थे जिनमें स्पैन-स्तरीय तर्क की आवश्यकता होती है, जो स्पैन-केंद्रित पूर्व-प्रशिक्षण की प्रभावशीलता की पुष्टि करता है। SpanBERT के दृष्टिकोण ने स्पैन-आधारित प्रतिनिधित्व सीखने में बाद के शोध को प्रभावित किया। इसने प्रदर्शित किया कि सन्निहित स्पैन को मास्क करना और सीमा भविष्यवाणी का उपयोग करना कुछ डाउनस्ट्रीम कार्यों के लिए टोकन-स्तरीय मास्किंग की तुलना में अधिक प्रभावी हो सकता है। मॉडल का कोड और पूर्व-प्रशिक्षित वजन सार्वजनिक रूप से जारी किए गए, जिससे शोध समुदाय में अपनाने में सुविधा हुई।
BERT और RoBERTa के साथ तुलना
SpanBERT मुख्य रूप से अपनी मास्किंग रणनीति और SBP के जोड़ में BERT से भिन्न है। BERT व्यक्तिगत टोकन को यादृच्छिक रूप से मास्क करता है, जबकि SpanBERT स्पैन को मास्क करता है। RoBERTa, एक और लोकप्रिय प्रकार, गतिशील मास्किंग का उपयोग करता है और अगले-वाक्य भविष्यवाणी उद्देश्य को हटा देता है, लेकिन फिर भी व्यक्तिगत टोकन को मास्क करता है। SpanBERT की स्पैन मास्किंग लंबी दूरी की निर्भरता को पकड़ने के लिए एक मजबूत प्रशिक्षण संकेत प्रदान करती है। सीधी तुलना में, SpanBERT ने स्पैन-संबंधित कार्यों पर BERT को लगातार पीछे छोड़ दिया, और समान प्रशिक्षण डेटा आकार का उपयोग करने के बावजूद, प्रश्न उत्तर और कोरफेरेंस पर अक्सर RoBERTa के बराबर या उससे बेहतर प्रदर्शन किया। मुख्य निष्कर्ष यह है कि Natural language processing में प्रतिनिधित्व सीखने के लिए मास्किंग ग्रैन्युलैरिटी का चुनाव महत्वपूर्ण रूप से मायने रखता है।
अनुप्रयोग और विरासत
SpanBERT की वास्तुकला को प्रश्न उत्तर और कोरफेरेंस से परे विभिन्न Machine learning कार्यों पर लागू किया गया है। इसका उपयोग सूचना निष्कर्षण में किया गया है, जहां इकाई उल्लेखों और संबंधों की पहचान के लिए अक्सर स्पैन-स्तरीय भविष्यवाणियों की आवश्यकता होती है। इसे जैव चिकित्सा पाठ खनन के लिए भी अनुकूलित किया गया है, जैसे दवा-दवा इंटरैक्शन या जीन-रोग संबंध निकालना। स्पैन मास्किंग और सीमा भविष्यवाणी के सिद्धांतों को अन्य मॉडलों में शामिल किया गया है, जिनमें कुछ Large language model पूर्व-प्रशिक्षण पाइपलाइन शामिल हैं। जबकि SpanBERT स्वयं Generative AI प्रणालियों जैसे बड़े मॉडलों की तरह व्यापक रूप से उपयोग नहीं किया जाता है, यह ट्रांसफार्मर-आधारित एनकोडर के विकास में एक महत्वपूर्ण मील का पत्थर बना हुआ है। स्पैन-स्तरीय समझ पर इसका ध्यान अधिक हाल के मॉडलों के डिजाइन को सूचित करता है जो संरचित भविष्यवाणी कार्यों में सुधार करना चाहते हैं। 2020 के दशक के मध्य तक, SpanBERT को अभी भी शोध साहित्य में स्पैन-संबंधित बेंचमार्क के लिए एक मजबूत आधार रेखा के रूप में संदर्भित किया जाता है।
सीमाएं
SpanBERT की कुछ सीमाएं हैं। स्पैन मास्किंग रणनीति के लिए स्पैन लंबाई वितरण के सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है, और SBP उद्देश्य कम्प्यूटेशनल ओवरहेड जोड़ता है। मॉडल ट्रांसफार्मर की निश्चित संदर्भ विंडो, आमतौर पर 512 टोकन, द्वारा भी सीमित है, जो बहुत लंबे दस्तावेज़ों को संसाधित करने की क्षमता को प्रतिबंधित कर सकता है। इसके अलावा, SpanBERT एक एनकोडर-केवल मॉडल है, इसलिए यह पाठ निर्माण के लिए डिज़ाइन नहीं किया गया है। जनरेटिव कार्यों पर इसका प्रदर्शन डिकोडर-आधारित मॉडलों के बराबर नहीं है। इन बाधाओं के बावजूद, स्पैन प्रतिनिधित्व सीखने में SpanBERT के योगदान स्थायी रहे हैं, और यह पूर्व-प्रशिक्षण उद्देश्यों में व्यापार-नापसंद को समझने के लिए एक मूल्यवान संदर्भ बिंदु के रूप में कार्य करता है।