मास्क्ड लैंग्वेज मॉडलिंग

अंग्रेज़ी से अनुवादित

मास्क्ड लैंग्वेज मॉडलिंग एक स्व-पर्यवेक्षित प्रीट्रेनिंग उद्देश्य है जिसमें एक मॉडल अनुक्रम में मास्क किए गए टोकन की भविष्यवाणी करता है, जिससे द्विदिशात्मक संदर्भ समझ संभव होती है, जैसा कि [[bert|BERT]] द्वारा लोकप्रिय बनाया गया।

मास्क्ड लैंग्वेज मॉडलिंग (एमएलएम) एक स्व-पर्यवेक्षित शिक्षण उद्देश्य है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण में किया जाता है, जहां एक मॉडल को आसपास के संदर्भ के आधार पर अनुक्रम में यादृच्छिक रूप से मास्क किए गए टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है। पारंपरिक भाषा मॉडल के विपरीत जो बाएं से दाएं तरीके से अगले टोकन की भविष्यवाणी करते हैं, एमएलएम मॉडल को बाएं और दाएं दोनों संदर्भों का उपयोग करने की अनुमति देता है, जिससे भाषा की गहरी द्विदिशात्मक समझ संभव होती है। यह दृष्टिकोण ट्रांसफॉर्मर-आधारित मॉडल बीईआरटी (बिडायरेक्शनल एनकोडर रिप्रेजेंटेशन्स फ्रॉम ट्रांसफॉर्मर्स) द्वारा लोकप्रिय बनाया गया था, जिसे 2018 में गूगल द्वारा पेश किया गया था, और तब से यह कई बड़े भाषा मॉडल और गहन शिक्षण प्रणालियों की आधारशिला बन गया है।

एमएलएम का मूल विचार इनपुट टेक्स्ट के एक हिस्से को कुछ टोकन को एक विशेष [MASK] टोकन के साथ बदलकर दूषित करना है, फिर मॉडल को मूल टोकन को पुनर्निर्मित करने के लिए प्रशिक्षित करना है। यह मॉडल को वाक्यात्मक और अर्थ संबंधी संबंधों को पकड़ने वाले संदर्भात्मक प्रतिनिधित्व सीखने के लिए मजबूर करता है। एमएलएम कृत्रिम बुद्धिमत्ता प्रशिक्षण का एक रूप है जिसके लिए मानव-लेबल वाले डेटा की आवश्यकता नहीं होती है, जिससे यह विशाल पाठ कोरपोरा पर प्रीट्रेनिंग के लिए अत्यधिक स्केलेबल बन जाता है।

ऐतिहासिक पृष्ठभूमि

पाठ में लापता शब्दों की भविष्यवाणी की अवधारणा की जड़ें पहले के सांख्यिकीय और तंत्रिका मॉडल में हैं, लेकिन एमएलएम का आधुनिक रूप गहन शिक्षण के आगमन के साथ उभरा। 2018 में, जैकब डेवलिन और गूगल एआई के सहयोगियों ने बीईआरटी पेश किया, जिसने एमएलएम को अपने प्राथमिक प्रीट्रेनिंग उद्देश्य के रूप में उपयोग किया। बीईआरटी की सफलता ने प्रदर्शित किया कि द्विदिशात्मक प्रीट्रेनिंग प्रश्न उत्तर और भावना विश्लेषण सहित प्राकृतिक भाषा प्रसंस्करण कार्यों की एक विस्तृत श्रृंखला पर प्रदर्शन में काफी सुधार कर सकती है।

बीईआरटी से पहले, ईएलएमओ जैसे मॉडल द्विदिशात्मक एलएसटीएम का उपयोग करते थे लेकिन गहरे तरीके से दोनों दिशाओं पर संयुक्त रूप से शर्त नहीं लगाते थे। 2017 में वासवानी एट अल द्वारा पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, बीईआरटी के द्विदिशात्मक ध्यान तंत्र की नींव प्रदान करता था। एमएलएम एक प्रमुख नवाचार बन गया जिसने बीईआरटी को जीपीटी जैसे पहले के यूनिडायरेक्शनल मॉडल से अलग किया।

मास्क्ड लैंग्वेज मॉडलिंग कैसे काम करता है

एक विशिष्ट एमएलएम सेटअप में, एक प्रशिक्षण अनुक्रम निम्नानुसार संसाधित किया जाता है:

  1. टोकनाइजेशन: इनपुट टेक्स्ट को टोकनाइज़र (जैसे, वर्डपीस) का उपयोग करके टोकन में विभाजित किया जाता है।
  2. मास्किंग: टोकन का एक यादृच्छिक उपसमूह (आमतौर पर 15%) चुना जाता है। प्रत्येक चयनित टोकन के लिए, इसे [MASK] के साथ बदलने की 80% संभावना, इसे यादृच्छिक टोकन के साथ बदलने की 10% संभावना, और इसे अपरिवर्तित रखने की 10% संभावना होती है।
  3. भविष्यवाणी: मॉडल मास्क किए गए अनुक्रम को संसाधित करता है और प्रत्येक मास्क स्थिति के लिए शब्दावली पर एक संभाव्यता वितरण आउटपुट करता है।
  4. हानि: हानि की गणना भविष्यवाणी किए गए वितरण और सही टोकन के बीच क्रॉस-एन्ट्रॉपी के रूप में की जाती है, और मॉडल वजन को अपडेट करने के लिए ग्रेडिएंट को बैकप्रोपेगेट किया जाता है।

यह मास्किंग रणनीति, जिसे "यादृच्छिक प्रतिस्थापन के साथ मास्क्ड एलएम" के रूप में जाना जाता है, बीईआरटी में प्रीट्रेनिंग (जहां [MASK] दिखाई देता है) और फाइन-ट्यूनिंग (जहां [MASK] अनुपस्थित है) के बीच बेमेल को कम करने के लिए पेश की गई थी।

लाभ और सीमाएं

एमएलएम कई लाभ प्रदान करता है:

  • द्विदिशात्मक संदर्भ: मॉडल एक टोकन के दोनों ओर से जानकारी का लाभ उठा सकते हैं, जिससे समृद्ध प्रतिनिधित्व प्राप्त होते हैं।
  • स्केलेबिलिटी: प्रीट्रेनिंग बिना लेबल वाले पाठ पर की जा सकती है, जिससे मॉडल विशाल कोरपोरा से सीख सकते हैं।
  • ट्रांसफर लर्निंग: डाउनस्ट्रीम कार्यों पर प्रीट्रेन्ड एमएलएम मॉडल को फाइन-ट्यून करना अक्सर सीमित लेबल वाले डेटा के साथ अत्याधुनिक परिणाम देता है।

हालांकि, एमएलएम की सीमाएं भी हैं:

  • कम्प्यूटेशनल लागत: प्रशिक्षण के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, अक्सर एडब्ल्यूएस ट्रेनियम या सेरेब्रास जैसे विशेष हार्डवेयर का उपयोग करना पड़ता है।
  • मास्किंग अक्षमता: प्रति प्रशिक्षण चरण में केवल टोकन का एक छोटा सा अंश भविष्यवाणी के लिए उपयोग किया जाता है, जिससे प्रशिक्षण ऑटोरेग्रेसिव तरीकों की तुलना में कम नमूना-कुशल होता है।
  • प्रीट्रेन-फाइनट्यून बेमेल: [MASK] टोकन फाइन-ट्यूनिंग के दौरान मौजूद नहीं होता है, जिससे वितरण में बदलाव हो सकता है।

विविधताएं और सुधार

एमएलएम की सीमाओं को संबोधित करने के लिए कई विविधताएं प्रस्तावित की गई हैं:

  • रोबर्टा: फेसबुक एआई (अब मेटा एआई) द्वारा विकसित, रोबर्टा अगले-वाक्य भविष्यवाणी उद्देश्य को हटा देता है और गतिशील मास्किंग का उपयोग करता है, जहां मास्किंग पैटर्न हर युग में बदलता है। यह बड़े बैच और अधिक डेटा के साथ भी प्रशिक्षित होता है।
  • अल्बर्ट: मेमोरी उपयोग को कम करने के लिए पैरामीटर साझाकरण और वाक्य-क्रम भविष्यवाणी पेश करता है जबकि प्रदर्शन बनाए रखता है।
  • इलेक्ट्रा: एक प्रतिस्थापित-टोकन पहचान कार्य का उपयोग करता है, जहां मॉडल वास्तविक टोकन को जनरेटर-उत्पन्न प्रतिस्थापन से अलग करना सीखता है, जिससे प्रशिक्षण अधिक कुशल हो जाता है।
  • स्पैन-आधारित मास्किंग: स्पैनबीईआरटी जैसे मॉडल व्यक्तिगत टोकन के बजाय टोकन के सन्निहित स्पैन को मास्क करते हैं, जिससे स्पैन-संबंधित कार्यों पर प्रदर्शन में सुधार होता है।

ये विविधताएं विभिन्न बड़े भाषा मॉडल में अपनाई गई हैं और नए आर्किटेक्चर के डिजाइन को प्रभावित किया है।

आधुनिक एआई में अनुप्रयोग

एमएलएम का उपयोग न केवल सामान्य-उद्देश्य भाषा मॉडल के प्रीट्रेनिंग के लिए किया जाता है, बल्कि डोमेन-विशिष्ट मॉडल में भी किया जाता है। उदाहरण के लिए, बायोबीईआरटी जैव चिकित्सा ग्रंथों पर एमएलएम लागू करता है, और क्लिनिकलबीईआरटी को नैदानिक नोट्स पर प्रशिक्षित किया जाता है। इसके अलावा, एमएलएम को मास्क्ड ऑटोएनकोडर (जैसे, छवियों के लिए एमएई) के माध्यम से छवि और ऑडियो जैसे अन्य मोडैलिटी तक बढ़ाया गया है।

जनरेटिव एआई के संदर्भ में, एमएलएम का उपयोग अक्सर हाइब्रिड मॉडल में एक घटक के रूप में किया जाता है जो द्विदिशात्मक और ऑटोरेग्रेसिव उद्देश्यों को जोड़ते हैं, जैसे टी5 और बार्ट, जो एमएलएम के समान एक डीनॉइज़िंग उद्देश्य का उपयोग करते हैं लेकिन अनुक्रम-से-अनुक्रम आर्किटेक्चर के साथ।

अन्य प्रीट्रेनिंग उद्देश्यों से संबंध

एमएलएम मशीन लर्निंग के क्षेत्र में कई प्रीट्रेनिंग उद्देश्यों में से एक है। अन्य में शामिल हैं:

  • ऑटोरेग्रेसिव मॉडलिंग: पिछले टोकन दिए जाने पर अगले टोकन की भविष्यवाणी करता है (जैसे, जीपीटी)। यह यूनिडायरेक्शनल है और ओपनएआई जैसे कई बड़े भाषा मॉडल का आधार है।
  • अनुक्रम-से-अनुक्रम डीनॉइज़िंग: टी5 और बार्ट जैसे मॉडल इनपुट को दूषित करते हैं और मॉडल को मूल अनुक्रम को पुनर्निर्मित करने के लिए प्रशिक्षित करते हैं, जिसे एमएलएम का सामान्यीकृत रूप देखा जा सकता है।
  • कंट्रास्टिव लर्निंग: सिमसीई जैसे मॉडल में वाक्य एम्बेडिंग सीखने के लिए उपयोग किया जाता है, जिसमें समान वाक्यों को एक साथ खींचा जाता है और असमान वाक्यों को अलग किया जाता है।

एमएलएम की द्विदिशात्मक प्रकृति इसे उन कार्यों के लिए विशेष रूप से उपयुक्त बनाती है जिन्हें पूर्ण संदर्भ की समझ की आवश्यकता होती है, जैसे नामित इकाई पहचान और संबंध निष्कर्षण।

क्षेत्र पर प्रभाव

बीईआरटी के साथ एमएलएम की शुरूआत ने प्राकृतिक भाषा प्रसंस्करण में एक प्रतिमान बदलाव को चिह्नित किया। इसने प्रदर्शित किया कि एक सरल उद्देश्य के साथ बड़े कोरपोरा पर प्रीट्रेनिंग ऐसे प्रतिनिधित्व उत्पन्न कर सकती है जो कार्यों की एक विस्तृत श्रृंखला में अच्छी तरह से स्थानांतरित होते हैं। इससे डिस्टिलबीईआरटी, टिनीबीईआरटी और मोबाइलबीईआरटी जैसे कई बीईआरटी-जैसे मॉडलों का विकास हुआ, जिनका उद्देश्य प्रदर्शन को बनाए रखते हुए मॉडल आकार को कम करना है।

एमएलएम ने अन्य डोमेन में ट्रांसफॉर्मर-आधारित मॉडल के डिजाइन को भी प्रभावित किया है, जैसे कंप्यूटर विजन (जैसे, बीईआईटी, एमएई) और भाषण प्रसंस्करण (जैसे, वेव2वेक 2.0)। मास्किंग और पुनर्निर्माण की अवधारणा स्व-पर्यवेक्षित शिक्षण में एक सामान्य सिद्धांत बन गई है।

भविष्य की दिशाएं

2025 तक, शोध अधिक कुशल और प्रभावी प्रीट्रेनिंग उद्देश्यों का पता लगाना जारी रखता है। कुछ दिशाओं में शामिल हैं:

  • एकीकृत मॉडल: एक ही मॉडल में एमएलएम को ऑटोरेग्रेसिव उद्देश्यों के साथ जोड़ना, जैसा कि यूनीएलएम और एक्सएलनेट (जो क्रमपरिवर्तन भाषा मॉडलिंग का उपयोग करता है) जैसे मॉडल में देखा गया है।
  • कुशल ध्यान: द्विदिशात्मक ध्यान की कम्प्यूटेशनल लागत को कम करना, लंबे अनुक्रमों पर एमएलएम को सक्षम करना।
  • मल्टीमॉडल एमएलएम: पाठ, छवियों और ऑडियो को संयुक्त रूप से मॉडल करने के लिए एमएलएम का विस्तार, जैसा कि सीएलआईपी और फ्लेमिंगो जैसे मॉडल में है।

गूगल डीपमाइंड, ओपनएआई और एंथ्रोपिक जैसी कंपनियां प्रीट्रेनिंग शोध में निवेश करना जारी रखती हैं, और एमएलएम उनके टूलकिट में एक मौलिक तकनीक बनी हुई है।

निष्कर्ष

मास्क्ड लैंग्वेज मॉडलिंग आधुनिक एआई में एक मौलिक तकनीक बन गई है, जो मॉडल को बिना लेबल वाले पाठ से समृद्ध, द्विदिशात्मक प्रतिनिधित्व सीखने में सक्षम बनाती है। 2018 में बीईआरटी के साथ इसकी शुरूआत ने प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में क्रांति ला दी और तब से इसे विभिन्न मोडैलिटी और आर्किटेक्चर में अनुकूलित किया गया है। जबकि नए उद्देश्य और मॉडल उभरे हैं, एमएलएम के मास्किंग और पुनर्निर्माण के सिद्धांत अत्याधुनिक प्रणालियों के डिजाइन को प्रभावित करना जारी रखते हैं। जैसे-जैसे क्षेत्र आगे बढ़ता है, एमएलएम संभवतः अधिक सक्षम और कुशल एआई मॉडल के विकास में एक प्रमुख घटक बना रहेगा।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·self-supervised-learning·pretraining·transformer
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास