एक बड़ा भाषा मॉडल (LLM) एक तंत्रिका-नेटवर्क है, जो आम तौर पर ट्रांसफॉर्मर वास्तुकला पर निर्मित होता है, और पाठ के अगले अंश, या टोकन, की भविष्यवाणी करने के लिए बहुत बड़ी मात्रा में पाठ पर प्रशिक्षित किया जाता है। इस संकीर्ण प्रशिक्षण उद्देश्य के बावजूद, पर्याप्त पैमाने पर प्रशिक्षित LLM भाषा समझ, निर्माण, अनुवाद, सारांशीकरण और तर्क में व्यापक क्षमताएँ प्रदर्शित करते हैं, और चैटजीपीटी, क्लॉड और जेमिनी जैसे सहायकों का तकनीकी आधार बनाते हैं।
इतिहास
ट्रांसफॉर्मर-आधारित भाषा मॉडल 2017 में वास्तुकला की शुरुआत के तुरंत बाद उभरे। बर्ट (2018) ने भाषा समझने के कार्यों के लिए बड़े पैमाने पर प्रीट्रेनिंग के मूल्य का प्रदर्शन किया, जबकि OpenAI की GPT श्रृंखला ने बढ़ते पैमाने पर जनरेटिव, ऑटोरेग्रेसिव प्रशिक्षण का अनुसरण किया, जिसकी परिणति जीपीटी-3 (2020) में हुई, जिसके 175 बिलियन पैरामीटर और मजबूत फ्यू-शॉट लर्निंग प्रदर्शन ने व्यापक ध्यान आकर्षित किया। जीपीटी-4 (2023) ने मल्टीमोडल इनपुट और कहीं अधिक क्षमता के साथ प्रतिमान का विस्तार किया, और नवंबर 2022 में GPT-3.5 मॉडल पर निर्मित ChatGPT की रिलीज़ ने संवादात्मक LLM को मुख्यधारा में ला दिया, जिससे Google के Gemini परिवार और Meta की ओपन-वेट Llama श्रृंखला सहित प्रतिस्पर्धियों का तेज़ी से प्रवेश हुआ।
वे कैसे काम करते हैं
LLM को प्रीट्रेनिंग चरण में विशाल, अधिकतर असंपादित पाठ कोषों पर एक स्व-पर्यवेक्षित उद्देश्य का उपयोग करके प्रशिक्षित किया जाता है, जिसमें पूर्व संदर्भ को देखते हुए अगले टोकन की भविष्यवाणी करना सीखा जाता है। यह एक ऑटोरेग्रेसिव मॉडल उत्पन्न करता है जो एक समय में एक टोकन के रूप में धाराप्रवाह पाठ उत्पन्न करने में सक्षम होता है। प्रीट्रेंड "बेस" मॉडल को आम तौर पर फाइन-ट्यूनिंग और मानव प्रतिक्रिया से सुदृढीकरण सीखने के माध्यम से और अधिक अनुकूलित किया जाता है ताकि वे निर्देशों का पालन कर सकें और सुरक्षित रूप से बातचीत कर सकें, यह प्रक्रिया ChatGPT और Claude जैसे मॉडलों के लिए केंद्रीय है। एक मॉडल एक इंटरैक्शन में संसाधित कर सकने वाले पाठ की मात्रा उसके संदर्भ-विंडो द्वारा सीमित होती है, जो प्रारंभिक मॉडलों में लगभग कुछ हज़ार टोकन से बढ़कर 2025-युग के कुछ सिस्टम में दस लाख से अधिक हो गई है।
पैमाना और क्षमता
स्केलिंग-लॉ के रूप में ज्ञात अनुभवजन्य संबंध वर्णन करते हैं कि कैसे एक मॉडल का नुकसान उसके पैरामीटर गणना, प्रशिक्षण डेटा और कंप्यूट की संयुक्त वृद्धि के साथ पूर्वानुमानित रूप से बेहतर होता है। कुछ क्षमताएँ, जैसे बहु-चरणीय अंकगणित या जटिल निर्देशों का पालन, कुछ पैमाने की सीमाओं के पार अपेक्षाकृत अचानक उभरती हुई प्रतीत होती हैं, इस घटना को उभरती-क्षमताएँ कहा जाता है, हालाँकि शोधकर्ता विवाद करते हैं कि यह वास्तव में मॉडलों की एक वास्तविक संपत्ति है या क्षमताओं को मापने के तरीके का एक कलाकृति।
सीमाएँ
LLM मतिभ्रम से ग्रस्त हैं, जिसमें वे धाराप्रवाह लेकिन तथ्यात्मक रूप से गलत कथन उत्पन्न करते हैं, बिना उपयोगकर्ता को कोई संकेत दिए कि आउटपुट अविश्वसनीय है। क्योंकि वे सत्यापित ज्ञान के बजाय सीखे गए सांख्यिकीय पैटर्न के आधार पर पाठ उत्पन्न करते हैं, वे प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को भी पुन:उत्पन्न कर सकते हैं और जेलब्रेक जैसी प्रतिकूल प्रॉम्प्टिंग तकनीकों के प्रति संवेदनशील रहते हैं। शमन में आउटपुट को पुनर्प्राप्त बाहरी दस्तावेजों में आधारित करना शामिल है, एक तकनीक जिसे रिट्रीवल-ऑगमेंटेड जनरेशन के रूप में जाना जाता है, और तेजी से, "रीजनिंग मॉडल" जो उत्तर देने से पहले अपने काम की जाँच करने के लिए अतिरिक्त टेस्ट-टाइम कंप्यूटेशन का उपयोग करते हैं।