स्केलिंग लॉज़, मशीन लर्निंग के संदर्भ में, अनुभवजन्य संबंध हैं जो वर्णन करते हैं कि किसी मॉडल का प्रदर्शन तीन मात्राओं के बढ़ने पर एक पूर्वानुमानित, मोटे तौर पर पावर-लॉ तरीके से कैसे सुधरता है: मॉडल में पैरामीटरों की संख्या, प्रशिक्षण डेटा की मात्रा जो वह देखता है, और प्रशिक्षण पर खर्च की गई कुल कंप्यूट शक्ति। एक एकल नियम के बजाय, यह शब्द शोध के एक निकाय को संदर्भित करता है जो स्थापित करता है कि आयोजित-बाहर डेटा पर हानि इन मात्राओं के एक साथ बढ़ने पर सुचारू और पूर्वानुमानित रूप से घटती है, जो शोधकर्ताओं को प्रशिक्षण से पहले एक बहुत बड़े मॉडल के प्रदर्शन की भविष्यवाणी करने की अनुमति देता है।
कापलान एट अल., 2020
मूलभूत पेपर, "स्केलिंग लॉज़ फॉर न्यूरल लैंग्वेज मॉडल्स," जेरेड कापलान और ओपनएआई में सहयोगियों द्वारा जनवरी 2020 में प्रकाशित किया गया था। इसमें पाया गया कि भाषा मॉडल हानि मॉडल आकार, डेटासेट आकार और कंप्यूट के साथ पावर-लॉ संबंधों का पालन करती है, जो काफी हद तक नेटवर्क गहराई या चौड़ाई जैसे विशिष्ट वास्तुकला विवरणों से स्वतंत्र है, और यह कि समान मात्रा में डेटा पर प्रशिक्षित बड़े मॉडल लगातार अधिक नमूना-कुशल थे। उस समय एक व्यापक रूप से निकाला गया निहितार्थ यह था कि एक निश्चित कंप्यूट बजट के लिए, अपेक्षाकृत मामूली मात्रा में डेटा पर बहुत बड़े मॉडल को प्रशिक्षित करना बेहतर था, बजाय छोटे मॉडल को अभिसरण तक प्रशिक्षित करने के, एक निष्कर्ष जिसने जीपीटी-3 जैसे मॉडलों के डिजाइन को आकार दिया।
चिंचिला, 2022
गूगल डीपमाइंड में हॉफमैन और सहयोगियों द्वारा 2022 का एक पेपर, जिसमें चिंचिला नामक एक मॉडल पेश किया गया था, ने इस तस्वीर को संशोधित किया। विभिन्न आकारों के कई मॉडलों को विभिन्न मात्रा में डेटा पर प्रशिक्षित करके और समान कंप्यूट बजट पर उनकी तुलना करके, लेखकों ने पाया कि मूल स्केलिंग लॉज़ ने यह कम आंका कि एक मॉडल को अपने पैरामीटर गिनती के सापेक्ष कितने प्रशिक्षण डेटा की आवश्यकता होती है; इस ढांचे में कई समकालीन बड़े मॉडल अपने आकार के सापेक्ष अप्रशिक्षित थे। चिंचिला पेपर की कंप्यूट-इष्टतम विधि, जिसने मॉडल आकार और प्रशिक्षण डेटा को मोटे तौर पर अनुपात में बढ़ाने की सिफारिश की, बाद के प्रीट्रेनिंग रनों में प्रयोगशालाओं ने कंप्यूट कैसे आवंटित किया, इसके लिए एक प्रभावशाली संदर्भ बिंदु बन गई।
परिणाम और बहस
स्केलिंग लॉज़ ने फाउंडेशन मॉडल के विकास के पीछे विशाल पूंजी निवेश को उचित ठहराने में मदद की, क्योंकि कंप्यूट और प्रदर्शन के बीच एक पूर्वानुमानित संबंध निवेशकों और प्रयोगशालाओं को तेजी से बड़े प्रशिक्षण रनों पर रिटर्न की भविष्यवाणी करने का आधार देता है। उन्होंने यह सवाल भी उठाया कि क्या स्केलिंग अनिश्चित काल तक जारी रह सकती है, सीमित उच्च-गुणवत्ता वाले प्रशिक्षण डेटा और भौतिक तथा वित्तीय सीमाओं को देखते हुए जिन्हें अनौपचारिक रूप से मूर के नियम के एआई कंप्यूट विकास के विस्तार द्वारा वर्णित किया गया है। आसानी से उपलब्ध उच्च-गुणवत्ता वाले पाठ डेटा से बाहर निकलने की चिंताओं, जिन्हें कभी-कभी डेटा वॉल कहा जाता है, ने शोध को सिंथेटिक डेटा और प्रीट्रेनिंग से परे नए स्केलिंग आयामों की ओर धकेला, जिसमें टेस्ट-टाइम कंप्यूट शामिल है, जो किसी दिए गए समस्या पर आउटपुट गुणवत्ता में सुधार करने के लिए अनुमान पर अधिक कंप्यूट खर्च करने की प्रथा है, न कि केवल मॉडल को ही स्केल करने की। कच्चे स्केलिंग और गुणात्मक रूप से नई क्षमताओं के बीच संबंध बहस का विषय बना हुआ है, और यह उभरती क्षमताओं पर शोध से निकटता से जुड़ा है, जो पूछता है कि क्या कुछ क्षमताएं हानि के साथ सुचारू रूप से सुधरने के बजाय विशेष पैमानों पर अचानक प्रकट होती हैं।