ULMFiT (Universal Language Model Fine-tuning) एक प्राकृतिक भाषा प्रसंस्करण (NLP) के लिए स्थानांतरण अधिगम दृष्टिकोण है, जिसे 2018 में fast.ai और सैन फ्रांसिस्को विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। इसने प्रदर्शित किया कि एक पूर्व-प्रशिक्षित भाषा मॉडल को अपेक्षाकृत कम लेबल वाले डेटा के साथ विभिन्न पाठ वर्गीकरण कार्यों के लिए प्रभावी ढंग से सूक्ष्म-ट्यून किया जा सकता है, जिससे उस समय के अत्याधुनिक परिणाम प्राप्त हुए। इस विधि ने तीन प्रमुख तकनीकें पेश कीं: विभेदक सूक्ष्म-ट्यूनिंग, तिरछी त्रिकोणीय अधिगम दरें, और क्रमिक अनफ्रीज़िंग, जो बाद के बड़े भाषा मॉडल प्रशिक्षण प्रथाओं के लिए आधारभूत बन गईं।
यह दृष्टिकोण पहले के NLP एम्बेडिंग विधियों से भिन्न है, क्योंकि यह स्थिर शब्द वैक्टर का उपयोग करने के बजाय पूरे पूर्व-प्रशिक्षित तंत्रिका नेटवर्क को सूक्ष्म-ट्यून करता है। ULMFiT की वास्तुकला एक तीन-परत गहन अधिगम दीर्घकालिक अल्पकालिक स्मृति (LSTM) नेटवर्क है, जो ट्रांसफार्मर मॉडल के उदय से पहले लोकप्रिय आवर्ती तंत्रिका नेटवर्क का एक रूप है। छह बेंचमार्क कार्यों पर इसकी सफलता, जिसमें भावना विश्लेषण और प्रश्न वर्गीकरण शामिल हैं, ने स्थानांतरण अधिगम को NLP में एक मुख्य प्रतिमान के रूप में स्थापित करने में मदद की।
विकास और प्रकाशन
ULMFiT को जेरेमी हॉवर्ड और सेबेस्टियन रुडर द्वारा बनाया गया था, जिन्होंने जुलाई 2018 में एसोसिएशन फॉर कम्प्यूटेशनल लिंग्विस्टिक्स (ACL) की 56वीं वार्षिक बैठक में "यूनिवर्सल लैंग्वेज मॉडल फाइन-ट्यूनिंग फॉर टेक्स्ट क्लासिफिकेशन" पेपर प्रकाशित किया। यह कार्य कंप्यूटर विज़न में पहले के स्थानांतरण अधिगम अनुसंधान पर आधारित था और ELMo जैसे पूर्व-प्रशिक्षित एम्बेडिंग पर पिछले कार्य से प्रेरित था। पेपर ने IMDb मूवी समीक्षा डेटासेट और AG News कॉर्पस जैसे कई पाठ वर्गीकरण बेंचमार्क पर पिछले अत्याधुनिक परिणामों की तुलना में 9-24% त्रुटि में कमी की सूचना दी।
प्रारंभिक कार्यान्वयन 2018 की शुरुआत में fast.ai लाइब्रेरी के हिस्से के रूप में जारी किया गया था और बाद में अन्य फ्रेमवर्क में स्थानांतरित किया गया। कोड और पूर्व-प्रशिक्षित मॉडल एक अनुमेय ओपन-सोर्स लाइसेंस के तहत उपलब्ध कराए गए थे, जिससे शोधकर्ताओं और चिकित्सकों द्वारा व्यापक रूप से अपनाया जा सके। इस खुलेपन ने शैक्षणिक समुदाय के भीतर विधि के तेजी से प्रतिकृति और विस्तार में योगदान दिया।
मुख्य तकनीकें
तीन मुख्य नवाचार ULMFiT के सूक्ष्म-ट्यूनिंग प्रोटोकॉल को परिभाषित करते हैं। विभेदक सूक्ष्म-ट्यूनिंग नेटवर्क की प्रत्येक परत को अलग-अलग अधिगम दरें निर्दिष्ट करता है, जिसमें निचली परतें (अधिक सामान्य भाषा विशेषताओं को पकड़ने वाली) उच्च परतों (कार्य-विशिष्ट) की तुलना में धीमी गति से अद्यतन की जाती हैं। यह अनुकूलन के दौरान मशीन अधिगम ज्ञान के विनाशकारी विस्मरण को रोकता है।
तिरछी त्रिकोणीय अधिगम दरें एक छोटी रैखिक वृद्धि के बाद रैखिक क्षय का उपयोग करती हैं, जिससे मॉडल उपयुक्त पैरामीटर क्षेत्र में तेजी से अभिसरण कर सकता है और फिर उसे परिष्कृत कर सकता है। क्रमिक अनफ्रीज़िंग अंतिम परत से शुरू होती है और कई युगों में पहले की परतों को धीरे-धीरे अनफ्रीज़ करती है, जिससे प्रशिक्षण प्रक्रिया स्थिर होती है।
इन रणनीतियों को अनुभवजन्य रूप से प्रदर्शन के लिए महत्वपूर्ण मान्य किया गया था। पेपर में एब्लेशन अध्ययनों ने दिखाया कि तीन घटकों में से किसी को भी हटाने से IMDb भावना कार्य पर सटीकता कम हो गई, जो उनकी पूरक भूमिकाओं को रेखांकित करता है।
प्रभाव और विरासत
ULMFiT ने NLP में एक महत्वपूर्ण मोड़ चिह्नित किया, जिसने क्षेत्र को प्रत्येक कार्य के लिए शुरू से मॉडल प्रशिक्षित करने से दूर ले जाया। इसका स्थानांतरण अधिगम ढांचा बाद के बड़े भाषा मॉडल पर सीधे प्रभाव डालता है और प्रमुख प्रौद्योगिकी संगठनों का ध्यान आकर्षित करता है। उदाहरण के लिए, Google DeepMind, OpenAI, और Anthropic से जुड़े अनुसंधान समूहों ने बाद के ट्रांसफार्मर-आधारित प्रणालियों में सूक्ष्म-ट्यूनिंग सिद्धांतों को अपनाया, हालांकि वे मॉडल वास्तुकला में भिन्न हैं।
विधि ने सॉफ्टवेयर पारिस्थितिकी तंत्र को भी प्रभावित किया। AWS Trainium और अन्य क्लाउड AI बुनियादी ढांचा प्रदाताओं ने प्रशिक्षण पाइपलाइनों को अनुकूलित किया है जो ULMFiT के समान पूर्व-प्रशिक्षण और सूक्ष्म-ट्यूनिंग वर्कफ़्लो मानते हैं। स्टैनफोर्ड एआई लैब और MIT CSAIL जैसे शैक्षणिक संस्थानों ने प्रारंभिक स्थानांतरण अधिगम पाठ्यक्रमों में इसकी तकनीकों को शामिल किया। छोटे डेटासेट के साथ कुशल सूक्ष्म-ट्यूनिंग पर ध्यान 2020 के दशक में प्रासंगिक बना हुआ है, क्योंकि अधिकांश उत्पादन NLP प्रणालियाँ सूक्ष्म-ट्यून किए गए पूर्व-प्रशिक्षित मॉडल पर निर्भर हैं।
सीमाएँ और संक्रमण
अपनी सफलता के बावजूद, ULMFiT की LSTM वास्तुकला में सीमाएँ थीं। यह अनुक्रमों को क्रमिक रूप से संसाधित करता था, जिससे प्रशिक्षण धीमा और बाद के ट्रांसफार्मर मॉडल की तुलना में कम समानांतर हो गया। प्रासंगिक प्रतिनिधित्व द्विदिश थे लेकिन ट्रांसफार्मर द्वारा उत्पादित की तुलना में उतने गहरे या लचीले नहीं थे, जो स्व-ध्यान तंत्र का उपयोग करते हैं।
2019 तक, BERT और GPT संस्करणों जैसे ट्रांसफार्मर-आधारित मॉडल ने कई बेंचमार्क पर ULMFiT को पीछे छोड़ दिया, बड़े कॉर्पोरा और अधिक स्केलेबल वास्तुकला का लाभ उठाते हुए। हालांकि, ULMFiT की सूक्ष्म-ट्यूनिंग ह्यूरिस्टिक्स - विभेदक दरें, तिरछी अनुसूचियाँ, क्रमिक अनफ्रीज़िंग - को ट्रांसफार्मर प्रशिक्षण के लिए अनुकूलित किया गया और रूप में बना रहा। स्थिर स्थानांतरण अधिगम प्रक्रियाओं का इसका दस्तावेज़ीकरण Hugging Face के ट्रांसफार्मर लाइब्रेरी जैसे फ्रेमवर्क में वर्कफ़्लो को मानकीकृत करने में मदद करता है, जिससे यह एक अप्रचलित कलाकृति के बजाय एक अग्रदूत बन गया।
वर्तमान उपयोग
ULMFiT ऐतिहासिक और शैक्षणिक रुचि का बना हुआ है। इसे अक्सर कृत्रिम बुद्धिमत्ता पाठ्यक्रमों में अनुक्रमिक डेटा के लिए स्थानांतरण अधिगम के स्पष्ट उदाहरण के रूप में उद्धृत किया जाता है। मूल fast.ai पाठ्यक्रम इसे सीमित कंप्यूट संसाधनों के साथ पाठ वर्गीकरण के लिए एक व्यावहारिक प्रारंभिक बिंदु के रूप में सिखाना जारी रखता है। कुछ विशिष्ट, डोमेन-विशिष्ट छोटे डेटासेट पर कुछ आला अनुप्रयोग अभी भी इसे नियोजित करते हैं, लेकिन प्रमुख उत्पादन तैनाती बड़े पैमाने पर बड़े ट्रांसफार्मर मॉडल के पैरामीटर-कुशल सूक्ष्म-ट्यूनिंग में स्थानांतरित हो गई है।