BERT (Bidirectional Encoder Representations from Transformers) एक भाषा मॉडल है जिसे अक्टूबर 2018 में Google के शोधकर्ताओं द्वारा पेश किया गया था। यह स्व-पर्यवेक्षित शिक्षण का उपयोग करके पाठ को वैक्टर के अनुक्रम के रूप में प्रस्तुत करना सीखता है, जिसमें केवल-एनकोडर ट्रांसफॉर्मर वास्तुकला को नियोजित किया जाता है। BERT ने बड़े भाषा मॉडलों के लिए अत्याधुनिक स्थिति में नाटकीय रूप से सुधार किया, और 2026 तक, यह प्राकृतिक भाषा प्रसंस्करण (NLP) अनुसंधान में एक सामान्य पद्धतिगत घटक बना हुआ है।
BERT को मास्क्ड टोकन भविष्यवाणी और अगले वाक्य भविष्यवाणी के माध्यम से प्रशिक्षित किया जाता है, जो ELMo जैसे पहले के मॉडलों और बाद के GPT-2 के समान, उनके संदर्भ में टोकनों के प्रासंगिक, अव्यक्त प्रतिनिधित्व सीखता है। इसने कई NLP कार्यों के लिए अनुप्रयोग पाए, जिनमें कोरफेरेंस रिज़ॉल्यूशन और पॉलीसेमी रिज़ॉल्यूशन शामिल हैं। ELMo पर इसकी सफलता ने "BERTology" के अध्ययन को जन्म दिया, जो यह व्याख्या करने का प्रयास करता है कि मॉडल क्या सीखता है।
वास्तुकला
BERT एक केवल-एनकोडर ट्रांसफॉर्मर वास्तुकला है, जिसमें चार मुख्य मॉड्यूल शामिल हैं: एक टोकनाइज़र, एक एम्बेडिंग परत, एक एनकोडर स्टैक, और एक कार्य हेड। टोकनाइज़र अंग्रेजी पाठ को पूर्णांकों (टोकन) के अनुक्रम में परिवर्तित करता है। एम्बेडिंग परत इन टोकनों को वास्तविक-मूल्य वाले वैक्टर में परिवर्तित करती है। एनकोडर स्टैक, जो स्व-ध्यान के साथ लेकिन कारणात्मक मास्किंग के बिना ट्रांसफॉर्मर ब्लॉकों से बना है, इन वैक्टरों को संसाधित करता है। कार्य हेड अंतिम प्रतिनिधित्व वैक्टर को टोकन प्रकारों पर संभाव्यता वितरण में वापस परिवर्तित करता है, जो एक अन-एम्बेडिंग परत के रूप में कार्य करता है।
कार्य हेड पूर्व-प्रशिक्षण के लिए आवश्यक है लेकिन प्रश्न उत्तर या भावना वर्गीकरण जैसे डाउनस्ट्रीम कार्यों के लिए अक्सर अनावश्यक होता है। ऐसे मामलों में, इसे हटा दिया जाता है और कार्य के लिए उपयुक्त नए आरंभिक मॉड्यूल से बदल दिया जाता है, फिर फाइन-ट्यून किया जाता है। अव्यक्त वेक्टर प्रतिनिधित्व सीधे इस नए मॉड्यूल में फीड होते हैं, जिससे नमूना-कुशल स्थानांतरण शिक्षण सक्षम होता है।
एम्बेडिंग
BERT का टोकनाइज़र WordPiece का उपयोग करता है, जो बाइट-पेयर एन्कोडिंग के समान एक उप-शब्द रणनीति है, जिसमें 30,000 की शब्दावली आकार होता है। शब्दावली में नहीं होने वाले किसी भी टोकन को [UNK] से बदल दिया जाता है। एम्बेडिंग परत में तीन घटक होते हैं: टोकन प्रकार एम्बेडिंग, स्थिति एम्बेडिंग, और खंड प्रकार एम्बेडिंग। टोकन प्रकार एम्बेडिंग वन-हॉट वैक्टर को घने वैक्टर में अनुवादित करती है। स्थिति एम्बेडिंग पूर्ण स्थितियों का उपयोग करती है, जिसमें प्रत्येक आयाम स्थिति का एक साइनसॉइडल फ़ंक्शन होता है। खंड प्रकार एम्बेडिंग 0 या 1 की शब्दावली का उपयोग करती है, जो दर्शाती है कि कोई टोकन पहले या दूसरे पाठ खंड से संबंधित है, जो [SEP] टोकन द्वारा अलग किए जाते हैं।
ये तीन एम्बेडिंग वैक्टर एक साथ जोड़े जाते हैं, फिर LayerNorm का उपयोग करके सामान्यीकृत किए जाते हैं, जिससे BERTBASE में प्रत्येक टोकन के लिए 768-आयामी वेक्टर उत्पन्न होता है। वैक्टर 12 ट्रांसफॉर्मर एनकोडर ब्लॉकों से गुजरते हैं और एक बुनियादी एफाइन परिवर्तन के माध्यम से 30,000-आयामी शब्दावली स्थान पर वापस डिकोड किए जाते हैं।
वास्तुकला परिवार
एनकोडर स्टैक में दो मुक्त पैरामीटर हैं: L (परतों की संख्या) और H (छिपा आकार)। हमेशा H/64 स्व-ध्यान हेड होते हैं, और फीड-फॉरवर्ड या फ़िल्टर आकार हमेशा 4H होता है। L और H को भिन्न करने से मॉडलों का एक परिवार प्राप्त होता है। संकेतन L/H है, इसलिए BERTBASE 12L/768H है, BERTLARGE 24L/1024H है, और BERTTINY 2L/128H है।
प्रशिक्षण
BERT को एक साथ दो कार्यों पर पूर्व-प्रशिक्षित किया गया था: मास्क्ड भाषा मॉडलिंग (MLM) और अगले वाक्य भविष्यवाणी (NSP)। MLM में, BERT शब्दों का एक अनुक्रम ग्रहण करता है जहां एक शब्द यादृच्छिक रूप से मास्क किया जा सकता है, और यह मूल शब्द की भविष्यवाणी करता है। यह द्विदिशात्मक संदर्भ सिखाता है, दोनों दिशाओं से एक साथ शब्दों के बीच संबंधों को समझता है। NSP में, BERT भविष्यवाणी करता है कि क्या एक वाक्य तार्किक रूप से दूसरे का अनुसरण करता है, जो प्रश्न उत्तर और दस्तावेज़ वर्गीकरण जैसे कार्यों में मदद करता है।
मास्क्ड भाषा मॉडलिंग
MLM में, 15% टोकन यादृच्छिक रूप से मास्क्ड-भविष्यवाणी कार्य के लिए चुने जाते हैं। चयनित टोकन को 80% संभावना के साथ [MASK] टोकन से बदल दिया जाता है, 10% संभावना के साथ एक यादृच्छिक शब्द टोकन से, या 10% संभावना के साथ अपरिवर्तित छोड़ दिया जाता है। यह आंशिक मास्किंग डेटासेट शिफ्ट से बचाता है, जहां प्रशिक्षण के दौरान इनपुट का वितरण अनुमान से भिन्न होता है। यदि सभी चयनित टोकन मास्क किए गए होते, तो मॉडल अनुमान के दौरान अनमास्क्ड इनपुट को अच्छी तरह से संभाल नहीं पाता।
मॉडल आकार और रिलीज़
BERT मूल रूप से अंग्रेजी में दो आकारों में लागू किया गया था: 110 मिलियन पैरामीटर के साथ BERTBASE और 340 मिलियन पैरामीटर के साथ BERTLARGE। दोनों को टोरंटो BookCorpus (800 मिलियन शब्द) और अंग्रेजी विकिपीडिया (2,500 मिलियन शब्द) पर प्रशिक्षित किया गया था। वजन GitHub पर जारी किए गए थे। 11 मार्च 2020 को, 24 छोटे मॉडल जारी किए गए, सबसे छोटा BERTTINY केवल 4 मिलियन पैरामीटर के साथ था। इन छोटे मॉडलों ने व्यापक प्रयोग और संसाधन-सीमित सेटिंग्स में तैनाती को सक्षम किया।
प्रभाव और विरासत
BERT के परिचय ने NLP में एक महत्वपूर्ण बदलाव को चिह्नित किया, जो एकदिशात्मक मॉडलों से द्विदिशात्मक संदर्भ समझ की ओर बढ़ गया। इसका पूर्व-प्रशिक्षण और फाइन-ट्यूनिंग प्रतिमान एक मानक दृष्टिकोण बन गया, जिसने GPT-2 जैसे बाद के मॉडलों और बड़े भाषा मॉडलों के व्यापक विकास को प्रभावित किया। BERT की वास्तुकला और प्रशिक्षण विधियों को क्षेत्र में व्यापक रूप से अपनाया और अनुकूलित किया गया है, जिससे आधुनिक मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में एक मौलिक तकनीक के रूप में इसकी जगह मजबूत हुई है।