अंग्रेज़ी से अनुवादित

अगला-टोकन पूर्वानुमान स्वतःप्रतिगामी भाषा मॉडलों के लिए मुख्य प्रशिक्षण उद्देश्य है, जिसमें मॉडल पिछले सभी टोकन दिए जाने पर अनुक्रम में अगले टोकन की भविष्यवाणी करना सीखता है, जिससे पाठ निर्माण और अन्य प्राकृतिक भाषा कार्य संभव होते हैं।

अगला-टोकन पूर्वानुमान एक मौलिक प्रशिक्षण उद्देश्य है जिसका उपयोग स्वप्रतिगामी भाषा मॉडलों में किया जाता है, विशेष रूप से बड़े भाषा मॉडलों (LLMs) में। इस प्रतिमान में, एक मॉडल को अनुक्रम में सभी पूर्ववर्ती टोकनों को देखते हुए अगले टोकन की संभावना का अनुमान लगाने के लिए प्रशिक्षित किया जाता है, प्रभावी रूप से सशर्त संभाव्यता वितरण P(token_n | token_1, ..., token_{n-1}) सीखते हुए। यह उद्देश्य मॉडल को सबसे संभावित अगले टोकन को पुनरावृत्त रूप से नमूना या चयन करके और उसे इनपुट अनुक्रम में जोड़कर पाठ उत्पन्न करने की अनुमति देता है।

यह दृष्टिकोण Transformer (architecture) वास्तुकला पर निर्मित आधुनिक बड़े भाषा मॉडलों के लिए केंद्रीय है, जिसने पहले के पुनरावर्ती तंत्रिका नेटवर्क-आधारित मॉडलों और शब्द n-ग्राम भाषा मॉडलों जैसे विशुद्ध सांख्यिकीय मॉडलों का स्थान ले लिया है। विशाल डेटासेटों पर प्रशिक्षण द्वारा, अक्सर सार्वजनिक इंटरनेट से स्क्रैप किए गए, ये मॉडल प्राकृतिक भाषा निर्माण, मशीन अनुवाद, और प्रश्न उत्तरण सहित कार्यों की एक विस्तृत श्रृंखला में सुसंगत और संदर्भ-प्रासंगिक पाठ उत्पन्न करना सीखते हैं।

ऐतिहासिक विकास

अगला-टोकन पूर्वानुमान की वैचारिक जड़ें 1950 के दशक तक जाती हैं, जब नोआम चोम्स्की ने औपचारिक व्याकरण का उपयोग करके भाषा का वर्णन करने के औपचारिक दृष्टिकोण विकसित किए। हालाँकि, ये प्रारंभिक मॉडल नियम-आधारित थे और इनमें संभाव्य पूर्वानुमान शामिल नहीं था। 1970 के दशक में, फ्रेडरिक जेलिनेक और आईबीएम रिसर्च के सहयोगियों ने भाषण पहचान कार्य के भाग के रूप में भाषा मॉडलिंग के लिए सांख्यिकीय दृष्टिकोण पेश किए। उनके समूह ने शब्द अनुक्रमों के संभाव्य n-ग्राम मॉडल का उपयोग किया और मॉडल अनिश्चितता के सूचना-सिद्धांतिक माप के रूप में पेरप्लेक्सिटी पेश की।

1980 में, पहला महत्वपूर्ण सांख्यिकीय भाषा मॉडल प्रस्तावित किया गया था, और उस दशक के दौरान आईबीएम ने 'शैनन-शैली' प्रयोग किए, जहाँ मानव विषयों ने भाषा मॉडलिंग के लिए संभावित सुधारों की पहचान करने के लिए पाठ की भविष्यवाणी या सुधार किया। 2000 के दशक में तंत्रिका दृष्टिकोणों के उदय तक ये सांख्यिकीय विधियाँ प्रभावी रहीं।

सांख्यिकीय आधार

विशुद्ध सांख्यिकीय मॉडल, विशेष रूप से शब्द n-ग्राम पर आधारित, पिछले n-1 शब्दों को देखते हुए एक शब्द की संभावना का अनुमान लगाते हैं। ये मॉडल प्रशिक्षण संग्रह में घटनाओं की गिनती पर निर्भर करते हैं और आयाम की विपत्ति से ग्रस्त होते हैं, क्योंकि संभावित अनुक्रमों की संख्या शब्दावली आकार के साथ तेजी से बढ़ती है, जिससे डेटा विरलता उत्पन्न होती है।

घातांकीय भाषा मॉडल, जैसे अधिकतम एंट्रॉपी मॉडल, फीचर फ़ंक्शनों का उपयोग करके शब्दों और n-ग्राम इतिहासों के बीच संबंधों को एन्कोड करके कुछ सीमाओं का समाधान करते हैं। इसके इतिहास को देखते हुए एक शब्द की संभावना की गणना P(w_m | w_1, ..., w_{m-1}) = 1/Z(w_1, ..., w_{m-1}) * exp(a^T f(w_1, ..., w_m)) के रूप में की जाती है, जहाँ Z एक विभाजन फलन है, a एक पैरामीटर सदिश है, और f एक फीचर फलन है। इन मॉडलों को अक्सर मापदंडों पर नियमितीकरण या एक प्रायर की आवश्यकता होती है। लॉग-द्विरेखीय मॉडल एक घातांकीय भाषा मॉडल का एक और उदाहरण है।

स्किप-ग्राम मॉडल, जो बाद में पेश किए गए, एक केंद्रीय शब्द को देखते हुए आसपास के शब्दों की भविष्यवाणी पर ध्यान केंद्रित करते हैं, जो सख्त अगला-टोकन पूर्वानुमान से भिन्न है लेकिन संदर्भ से शब्द वितरण सीखने के विचार को साझा करता है।

तंत्रिका भाषा मॉडल

तंत्रिका भाषा मॉडल 2000 के दशक में तेजी से महत्वपूर्ण हो गए। योशुआ बेंगियो और सह-लेखकों ने एक संभाव्य तंत्रिका नेटवर्क भाषा मॉडल पेश किया जिसने शब्द अनुक्रमों की संभावना का अनुमान लगाते हुए वितरित शब्द निरूपण सीखे। इन सतत-स्थान एम्बेडिंग ने शब्दों को तंत्रिका नेटवर्क में भार के गैर-रेखीय संयोजनों के रूप में प्रस्तुत करके आयाम की विपत्ति को कम करने में मदद की, जिससे n-ग्राम मॉडलों में निहित डेटा विरलता की समस्या से बचा जा सका।

पुनरावर्ती तंत्रिका नेटवर्क (RNNs) ने अनुक्रम के संसाधित होने पर पहले के शब्दों से जानकारी बनाए रखकर इस दृष्टिकोण का विस्तार किया। 2010 में, तोमास मिकोलोव और सहयोगियों ने प्रदर्शित किया कि पुनरावर्ती तंत्रिका नेटवर्क भाषा मॉडल पारंपरिक n-ग्राम मॉडलों से काफी बेहतर प्रदर्शन कर सकते हैं। RNN-आधारित मॉडल अनुक्रमों को क्रमिक रूप से संसाधित करते हैं, एक छिपी हुई स्थिति बनाए रखते हैं जो संदर्भ को पकड़ती है, और इस स्थिति और वर्तमान इनपुट के आधार पर अगले टोकन की भविष्यवाणी करते हैं।

ट्रांसफार्मर क्रांति

Transformer (architecture) वास्तुकला की शुरुआत ने अगला-टोकन पूर्वानुमान में एक महत्वपूर्ण बदलाव को चिह्नित किया। ट्रांसफार्मर, जो स्व-ध्यान तंत्र पर निर्भर करते हैं, मॉडल को क्रमिक रूप से संसाधित करने के बजाय एक अनुक्रम में सभी पिछले टोकनों के महत्व को एक साथ तौलने की अनुमति देते हैं। इस समानांतरीकरण ने बहुत बड़े डेटासेटों पर प्रशिक्षण को सक्षम किया और बड़े भाषा मॉडलों के विकास को जन्म दिया।

2026 तक, बड़े भाषा मॉडल मुख्य रूप से बड़े डेटासेटों पर प्रशिक्षित ट्रांसफार्मर पर आधारित हैं, अक्सर सार्वजनिक इंटरनेट से स्क्रैप किए गए पाठों का उपयोग करते हुए। इन मॉडलों ने पुनरावर्ती तंत्रिका नेटवर्क-आधारित मॉडलों का स्थान ले लिया है, जिन्होंने पहले विशुद्ध सांख्यिकीय मॉडलों का स्थान लिया था। OpenAI, Anthropic, और Google DeepMind जैसी कंपनियों ने प्रमुख LLM विकसित किए हैं जो अपने मूल प्रशिक्षण उद्देश्य के रूप में अगला-टोकन पूर्वानुमान का उपयोग करते हैं।

प्रशिक्षण और निर्माण प्रक्रिया

प्रशिक्षण के दौरान, एक मॉडल को टोकनों के अनुक्रम प्रस्तुत किए जाते हैं और वह पूर्ववर्ती टोकनों को देखते हुए प्रत्येक टोकन की भविष्यवाणी करना सीखता है। हानि फलन, आमतौर पर क्रॉस-एंट्रॉपी, पूर्वानुमानित संभावनाओं और वास्तविक अगले टोकनों के बीच अंतर को मापता है। बैकप्रोपेगेशन और अनुकूलन तकनीकों के माध्यम से, मॉडल प्रशिक्षण संग्रह में इस हानि को कम करने के लिए अपने मापदंडों को समायोजित करता है।

अनुमान के समय, पाठ निर्माण स्वप्रतिगामी रूप से आगे बढ़ता है: मॉडल एक प्रारंभिक प्रॉम्प्ट प्राप्त करता है, अगले टोकन की भविष्यवाणी करता है, उसे प्रॉम्प्ट में जोड़ता है, और प्रक्रिया को दोहराता है। यह टोकन द्वारा टोकन पाठ उत्पन्न करता है, प्रत्येक नया टोकन पहले उत्पन्न सभी टोकनों पर आधारित होता है। टोकन का चयन निर्धारक (उच्चतम संभावना का चयन) या स्टोकेस्टिक (संभाव्यता वितरण से नमूनाकरण) हो सकता है, जिसमें तापमान स्केलिंग और टॉप-के सैंपलिंग जैसी तकनीकें आउटपुट विविधता को प्रभावित करती हैं।

अनुप्रयोग और प्रभाव

अगला-टोकन पूर्वानुमान पाठ निर्माण के अलावा प्राकृतिक भाषा कार्यों की एक विस्तृत विविधता को सक्षम बनाता है। इनमें भाषण पहचान, मशीन अनुवाद, ऑप्टिकल कैरेक्टर पहचान, हस्तलेखन पहचान, व्याकरण अधिष्ठापन, सूचना पुनर्प्राप्ति, और आपदा प्रतिक्रिया शामिल हैं। प्राकृतिक भाषा में अनुक्रमों की भविष्यवाणी करने की क्षमता भाषा मॉडलों को मार्ग अनुकूलन और अन्य अनुक्रम-आधारित कार्यों के लिए उपयोगी बनाती है।

अगला-टोकन पूर्वानुमान के साथ प्रशिक्षित बड़े भाषा मॉडलों ने सारांशीकरण, कोड निर्माण, और संवादी AI जैसे कार्यों में क्षमताओं का प्रदर्शन किया है। हालाँकि, यह स्पष्ट नहीं है कि क्या ये मॉडल मानव भाषा प्रसंस्करण के प्रशंसनीय संज्ञानात्मक मॉडल हैं। कम से कम पुनरावर्ती तंत्रिका नेटवर्कों के लिए, शोध ने दिखाया है कि वे कभी-कभी ऐसे पैटर्न सीखते हैं जो मनुष्य सीखते हैं, लेकिन उन पैटर्नों को सीखने में विफल होते हैं जो मनुष्य आमतौर पर सीखते हैं।

मूल्यांकन और बेंचमार्क

भाषा मॉडलों का मूल्यांकन अधिकतर विशिष्ट भाषा-उन्मुख कार्यों से प्राप्त मानव-निर्मित नमूना बेंचमार्कों के साथ तुलना द्वारा किया जाता है। अन्य, कम स्थापित गुणवत्ता परीक्षण मॉडल के आंतरिक चरित्र की जांच करते हैं या दो मॉडलों की तुलना करते हैं। चूंकि भाषा मॉडल गतिशील होने और डेटा से सीखने के लिए अभिप्रेत हैं, कुछ प्रस्तावित मॉडल सीखने की अवस्थाओं के निरीक्षण के माध्यम से सीखने की दरों की जांच करते हैं।

भाषा प्रसंस्करण प्रणालियों के मूल्यांकन के लिए कई डेटासेट विकसित किए गए हैं। इनमें मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (MMLU), कॉर्पस ऑफ़ लिंग्विस्टिक असेप्टेबिलिटी, GLUE बेंचमार्क, माइक्रोसॉफ्ट रिसर्च पैराफ्रेज़ कॉर्पस, मल्टी-जेनर नेचुरल लैंग्वेज इन्फ़रेंस, क्वेश्चन नेचुरल लैंग्वेज इन्फ़रेंस, क्वोरा क्वेश्चन पेयर्स, रिकग्नाइज़िंग टेक्स्टुअल एंटेलमेंट, सिमेंटिक टेक्स्टुअल सिमिलैरिटी बेंचमार्क, SQuAD प्रश्न उत्तरण परीक्षण, स्टैनफोर्ड सेंटीमेंट ट्रीबैंक, विनोग्राड NLI, BoolQ, PIQA, SIQA, हेलास्वाग, विनोग्रांडे, ARC, ओपनबुकQA, नेचुरल क्वेश्चन, ट्रिवियाQA, RACE, BIG-बेंच हार्ड, GSM8k, रियलटॉक्सिसिटीप्रॉम्प्ट्स, विनोजेंडर, और क्राउS-पेयर्स शामिल हैं। ये बेंचमार्क भाषा समझ और निर्माण के विभिन्न पहलुओं का आकलन करते हैं, जो मॉडल प्रदर्शन की तुलना के लिए मानकीकृत उपाय प्रदान करते हैं।

भविष्य की दिशाएँ

जैसे-जैसे बड़े भाषा मॉडल विकसित होते रहते हैं, अगला-टोकन पूर्वानुमान एक मौलिक उद्देश्य बना हुआ है, लेकिन शोधकर्ता विविधताओं और विस्तारों की खोज कर रहे हैं। इनमें मानव प्रतिक्रिया से सुदृढीकरण सीखने को शामिल करने वाले उद्देश्य, साथ ही दक्षता और संदर्भ हैंडलिंग में सुधार करने वाली वास्तुकलाएँ शामिल हैं। AWS Trainium और Cerebras प्रणालियों जैसे विशेष हार्डवेयर का निरंतर विकास, इन मॉडलों को बड़े पैमाने पर प्रशिक्षित करने और तैनात करने की कम्प्यूटेशनल मांगों का समर्थन करने का लक्ष्य रखता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:language-modeling·machine-learning·natural-language-processing·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास