BERT (Bidirectional Encoder Representations from Transformers) एक भाषा मॉडल है जिसे अक्टूबर 2018 में Google के शोधकर्ताओं द्वारा पेश किया गया था। यह स्व-पर्यवेक्षित अधिगम का उपयोग करके पाठ को सदिशों के अनुक्रम के रूप में प्रस्तुत करना सीखता है, जिसमें केवल-एनकोडर ट्रांसफॉर्मर वास्तुकला का उपयोग किया जाता है। BERT ने बड़े भाषा मॉडलों के लिए अत्याधुनिक स्थिति में नाटकीय रूप से सुधार किया और 2026 तक, यह प्राकृतिक भाषा प्रसंस्करण (NLP) अनुसंधान में एक सामान्य पद्धतिगत घटक बना हुआ है।
BERT को मास्क्ड टोकन पूर्वानुमान और अगले वाक्य पूर्वानुमान का उपयोग करके प्रशिक्षित किया जाता है, जिससे यह अपने संदर्भ में टोकनों के सांदर्भिक, अव्यक्त प्रतिनिधित्व सीख सकता है, जो ELMo और GPT-2 के समान है। इसने कई NLP कार्यों में अनुप्रयोग पाया, जैसे सहसंदर्भ समाधान और बह्वर्थकता समाधान। BERT ने ELMo में सुधार किया और "BERTology" के अध्ययन को जन्म दिया, जो BERT द्वारा सीखी गई चीज़ों की व्याख्या करने का प्रयास करता है।
वास्तुकला
BERT एक "केवल-एनकोडर" ट्रांसफॉर्मर वास्तुकला है। उच्च स्तर पर, BERT में चार मॉड्यूल होते हैं: एक टोकनाइज़र, एक एम्बेडिंग मॉड्यूल, एक एनकोडर स्टैक, और एक कार्य हेड। टोकनाइज़र अंग्रेज़ी पाठ को पूर्णांकों (टोकन) के अनुक्रम में परिवर्तित करता है। एम्बेडिंग मॉड्यूल टोकन को वास्तविक-मूल्य वाले सदिशों में परिवर्तित करता है। एनकोडर स्टैक में स्व-ध्यान के साथ ट्रांसफॉर्मर ब्लॉक होते हैं लेकिन कारणात्मक मास्किंग के बिना। कार्य हेड अंतिम प्रतिनिधित्व सदिशों को टोकन प्रकारों पर एक प्रायिकता वितरण में परिवर्तित करता है, जो एक अन-एम्बेडिंग परत के रूप में कार्य करता है।
कार्य हेड पूर्व-प्रशिक्षण के लिए आवश्यक है लेकिन प्रश्नोत्तर या भावना वर्गीकरण जैसे डाउनस्ट्रीम कार्यों के लिए अक्सर अनावश्यक होता है। ऐसे कार्यों के लिए, कार्य हेड को हटा दिया जाता है और कार्य के लिए उपयुक्त नए आरंभ किए गए मॉड्यूल से बदल दिया जाता है, जिसके बाद फाइन-ट्यूनिंग की जाती है। अव्यक्त सदिश प्रतिनिधित्व सीधे इस नए मॉड्यूल में फीड किया जाता है, जिससे नमूना-कुशल स्थानांतरण अधिगम सक्षम होता है।
एम्बेडिंग
BERT का टोकनाइज़र WordPiece है, जो बाइट-पेयर एन्कोडिंग के समान एक उप-शब्द रणनीति है। इसका शब्दावली आकार 30,000 है, और शब्दावली में नहीं दिखने वाले किसी भी टोकन को [UNK] से बदल दिया जाता है। एम्बेडिंग परत में तीन घटक होते हैं: टोकन प्रकार एम्बेडिंग, स्थिति एम्बेडिंग, और खंड प्रकार एम्बेडिंग। टोकन प्रकार एम्बेडिंग टोकन प्रकार के आधार पर एक-हॉट सदिश को घने सदिश में अनुवाद करती है। स्थिति एम्बेडिंग पूर्ण स्थितियों का उपयोग करती है, जिसमें प्रत्येक आयाम स्थिति का एक साइनसॉइडल फलन होता है। खंड प्रकार एम्बेडिंग 0 या 1 की शब्दावली का उपयोग करती है, जो इंगित करती है कि कोई टोकन पहले या दूसरे पाठ खंड से संबंधित है ([SEP] विशेष टोकन के बाद के टोकन प्रकार-1 होते हैं)। तीन एम्बेडिंग सदिशों को एक साथ जोड़ा जाता है, फिर LayerNorm का उपयोग करके सामान्यीकृत किया जाता है, जिससे प्रत्येक टोकन के लिए 768-आयामी सदिश आउटपुट होता है। ये सदिश 12 ट्रांसफॉर्मर एनकोडर ब्लॉकों से गुजरते हैं और एक एफ़िन परिवर्तन के माध्यम से 30,000-आयामी शब्दावली स्थान में वापस डिकोड किए जाते हैं।
वास्तुकला परिवार
एनकोडर स्टैक में दो मुक्त पैरामीटर होते हैं: L (परतों की संख्या) और H (छिपा हुआ आकार)। हमेशा H/64 स्व-ध्यान हेड होते हैं, और फीड-फॉरवर्ड/फ़िल्टर आकार हमेशा 4H होता है। इन पैरामीटरों को बदलने से BERT मॉडलों का एक परिवार प्राप्त होता है। संकेतन L/H है: BERTBASE 12L/768H है, BERTLARGE 24L/1024H है, और BERTTINY 2L/128H है।
प्रशिक्षण
पूर्व-प्रशिक्षण
BERT को एक साथ दो कार्यों पर पूर्व-प्रशिक्षित किया गया था: मास्क्ड भाषा मॉडलिंग (MLM) और अगले वाक्य पूर्वानुमान (NSP)। MLM में, BERT शब्दों का एक अनुक्रम ग्रहण करता है जहाँ एक शब्द यादृच्छिक रूप से मास्क किया जा सकता है, और यह मूल शब्द की भविष्यवाणी करता है। यह BERT को द्विदिशात्मक संदर्भ सीखने में मदद करता है, दोनों दिशाओं से शब्दों के बीच संबंधों को एक साथ समझता है। NSP में, BERT को यह भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है कि क्या एक वाक्य तार्किक रूप से दूसरे का अनुसरण करता है, जो प्रश्नोत्तर या दस्तावेज़ वर्गीकरण जैसे कार्यों के लिए महत्वपूर्ण है।
#### मास्क्ड भाषा मॉडलिंग
मास्क्ड भाषा मॉडलिंग में, 15% टोकन यादृच्छिक रूप से मास्क्ड-पूर्वानुमान कार्य के लिए चुने जाते हैं। चयनित टोकन को 80% प्रायिकता के साथ [MASK] टोकन से बदल दिया जाता है, 10% प्रायिकता के साथ यादृच्छिक शब्द टोकन से बदल दिया जाता है, और 10% प्रायिकता के साथ अपरिवर्तित छोड़ दिया जाता है। यह रणनीति डेटासेट शिफ्ट समस्या से बचाती है, जहाँ प्रशिक्षण के दौरान इनपुट का वितरण अनुमान के दौरान से भिन्न होता है।
रिलीज़ और प्रभाव
BERT मूल रूप से अंग्रेज़ी में दो मॉडल आकारों में लागू किया गया था: BERTBASE (110 मिलियन पैरामीटर) और BERTLARGE (340 मिलियन पैरामीटर)। दोनों को टोरंटो BookCorpus (800 मिलियन शब्द) और अंग्रेज़ी विकिपीडिया (2,500 मिलियन शब्द) पर प्रशिक्षित किया गया था। वज़न GitHub पर जारी किए गए, जिससे मॉडल व्यापक रूप से सुलभ हो गया। 11 मार्च, 2020 को, 24 छोटे मॉडल जारी किए गए, जिनमें सबसे छोटा BERTTINY था जिसमें केवल 4 मिलियन पैरामीटर थे।
BERT की रिलीज़ का प्राकृतिक भाषा प्रसंस्करण के क्षेत्र पर गहरा प्रभाव पड़ा। इसने प्रश्नोत्तर, भावना विश्लेषण और नामित इकाई पहचान सहित कई कार्यों पर नए बेंचमार्क स्थापित किए। इसकी सफलता ने पूर्व-प्रशिक्षण और फाइन-ट्यूनिंग प्रतिमान को लोकप्रिय बनाया, जिसने GPT-2 और RoBERTa जैसे बाद के मॉडलों को प्रभावित किया। BERT ने व्याख्यात्मकता में अनुसंधान को भी प्रेरित किया, जिसमें "BERTology" मॉडल द्वारा सीखे गए आंतरिक प्रतिनिधित्व को समझने के लिए एक क्षेत्र के रूप में उभरा।
अनुप्रयोग और विरासत
BERT के सांदर्भिक एम्बेडिंग को कई कार्यों पर लागू किया गया है, जिनमें सहसंदर्भ समाधान, बह्वर्थकता समाधान और मशीन अनुवाद शामिल हैं। इसकी वास्तुकला को विभिन्न भाषाओं और डोमेन के लिए अनुकूलित किया गया है, और यह कई NLP प्रणालियों के लिए एक आधार रेखा बना हुआ है। 2026 तक, BERT NLP अनुसंधान और उद्योग अनुप्रयोगों में एक मौलिक उपकरण बना हुआ है, GPT-3 और T5 जैसे बड़े मॉडलों के उदय के बावजूद। इसका प्रभाव ट्रांसफॉर्मर-आधारित मॉडलों के व्यापक रूप से अपनाने और बड़े भाषा मॉडलों के विकास में स्पष्ट है।
BERT की रिलीज़ ने DistilBERT और ALBERT जैसे कुशल मॉडल वेरिएंट में प्रगति को भी प्रेरित किया, जो प्रदर्शन को बनाए रखते हुए कम्प्यूटेशनल लागत को कम करने का लक्ष्य रखते हैं। मॉडल के डिज़ाइन सिद्धांत, जिनमें मास्क्ड भाषा मॉडलिंग और अगले वाक्य पूर्वानुमान शामिल हैं, को कई बाद की वास्तुकलाओं में शामिल किया गया है, जिससे आधुनिक NLP के आधारशिला के रूप में BERT की विरासत मजबूत हुई है।