उभरती क्षमताएं, बड़े भाषा मॉडल के संदर्भ में, उन क्षमताओं को संदर्भित करती हैं जो एक बार जब मॉडल पैरामीटर, प्रशिक्षण डेटा, या कंप्यूट की एक निश्चित मात्रा को पार कर जाता है, तो अचानक उभरती हुई प्रतीत होती हैं, बजाय इसके कि वे स्केलिंग-नियमों के तहत समग्र प्रशिक्षण हानि के तरह सुचारू और पूर्वानुमानित रूप से सुधरें। एक क्षमता को उभरती हुई तब वर्णित किया जाता है जब यह छोटे मॉडलों में मौके के स्तर के करीब प्रदर्शन करती है और फिर उसी परिवार के एक बड़े मॉडल में काफी ऊपर-मौके के प्रदर्शन तक कूद जाती है, बिना छोटे मॉडलों के स्कोर में आने वाले सुधार का स्पष्ट संकेत दिए।
शब्द की उत्पत्ति
इस अवधारणा को 2022 के एक व्यापक रूप से उद्धृत पेपर, "एमर्जेंट एबिलिटीज ऑफ लार्ज लैंग्वेज मॉडल्स" में जेसन वेई और सह-लेखकों द्वारा औपचारिक रूप दिया गया था, जिसने मॉडल परिवारों में बेंचमार्क परिणामों का सर्वेक्षण किया और दर्जनों कार्यों की पहचान की, जिनमें कुछ अंकगणितीय समस्याएं, कुछ बहु-चरणीय तर्क कार्य, और निर्देश-पालन व्यवहार शामिल हैं, जहां छोटे मॉडलों के लिए प्रदर्शन यादृच्छिक अनुमान के पास स्थिर रहा और फिर एक बार मॉडल एक विशेष आकार तक पहुंचने पर तेजी से बढ़ गया। पेपर ने इस पैटर्न को फ्यू-शॉट-लर्निंग और इन-कॉन्टेक्स्ट-लर्निंग जैसी तकनीकों से जोड़ा, जहां प्रॉम्प्ट में दिए गए उदाहरणों का उपयोग करने की मॉडल की क्षमता, अतिरिक्त प्रशिक्षण के बजाय, क्षमता सीमा को पार करने पर निर्भर प्रतीत होती थी। चेन-ऑफ-थॉट प्रॉम्प्टिंग, जिसमें मॉडल को उत्तर देने से पहले चरण-दर-चरण तर्क करने के लिए कहा जाता है, को एक ऐसी तकनीक के रूप में उद्धृत किया गया था जिसका लाभ केवल पर्याप्त रूप से बड़े मॉडलों में उभरता प्रतीत हुआ, छोटे मॉडलों में बहुत कम या कोई लाभ नहीं देता और कभी-कभी प्रदर्शन को नुकसान पहुंचाता है।
"मिराज" आलोचना
2023 में, शोधकर्ताओं राइलान शेफ़र, ब्रैंडो मिरांडा, और सैनमी कोयेजो ने "आर एमर्जेंट एबिलिटीज ऑफ लार्ज लैंग्वेज मॉडल्स ए मिराज?" शीर्षक से एक पेपर प्रकाशित किया, जिसमें तर्क दिया गया कि कई दावा की गई उभरती क्षमताएं शोधकर्ताओं द्वारा चुने गए मेट्रिक्स की कलाकृति थीं, न कि अंतर्निहित मॉडलों की वास्तविक संपत्ति। उन्होंने दिखाया कि एक सख्त, सब-या-कुछ-नहीं सटीकता मेट्रिक से स्विच करना, जो उत्तर को पूरी तरह से सही या पूरी तरह से गलत के रूप में स्कोर करता है, उसी कार्यों और उसी मॉडल आउटपुट पर एक चिकनी, आंशिक-क्रेडिट मेट्रिक में, अक्सर स्पष्ट रूप से तेज छलांग को एक क्रमिक, निरंतर सुधार में बदल देता है जो स्केलिंग नियमों का बारीकी से पालन करता है। इस दृष्टिकोण के तहत, अंतर्निहित क्षमता हर समय सुचारू रूप से सुधर रही थी, और केवल एक असंतत स्कोरिंग नियम का चयन ही सुधार को अचानक उभरने जैसा दिखाता था।
चल रही बहस
यह विवाद पूरी तरह से सुलझा नहीं है। मूल ढांचे के समर्थक ध्यान देते हैं कि कुछ क्षमताएं वास्तव में प्रकट होने के लिए एक सीमा मात्रा की आवश्यकता प्रतीत होती हैं, और विभिन्न आकारों के मॉडलों को वास्तविक कार्यों पर उपयोग करने का व्यावहारिक अनुभव, न केवल बेंचमार्क, अक्सर गुणात्मक बजाय वृद्धिशील अंतर दिखाता है कि एक मॉडल विश्वसनीय रूप से क्या कर सकता है। संदेहवादी जवाब देते हैं कि सबूत का बोझ उन मेट्रिक्स के तहत एक अचानक संक्रमण प्रदर्शित करने पर होना चाहिए जो स्वयं निर्माण से असंतत नहीं हैं, और कई सबसे नाटकीय दावे किए गए छलांग करीबी सांख्यिकीय जांच के तहत टिके नहीं हैं। यह बहस शैक्षणिक रुचि से परे मायने रखती है क्योंकि यह प्रभावित करती है कि भविष्य की क्षमता लाभ कितने पूर्वानुमानित हैं: यदि क्षमताएं अचानक और अप्रत्याशित रूप से एक ऐसे पैमाने पर प्रकट हो सकती हैं जो अभी तक नहीं पहुंचा गया है, तो यह अधिक सक्षम प्रणालियों से जुड़े जोखिमों का पूर्वानुमान लगाने के प्रयासों को जटिल बनाता है, एक चिंता जो उभरती क्षमताओं को कृत्रिम-सामान्य-बुद्धिमत्ता और एआई-से-अस्तित्वगत-जोखिम की व्यापक चर्चा से जोड़ती है।