फाइन-ट्यूनिंग वह अभ्यास है जिसमें पहले से प्रशिक्षित मॉडल को लिया जाता है, जिसे आमतौर पर प्रीट्रेनिंग के दौरान एक बड़े, सामान्य-उद्देश्य वाले डेटासेट पर प्रशिक्षित किया गया होता है, और उसके प्रशिक्षण को एक छोटे, अधिक विशिष्ट डेटासेट पर जारी रखा जाता है ताकि वह किसी विशेष कार्य, डोमेन या शैली के अनुकूल हो सके। यह तकनीक स्थानांतरण-अधिगम की अवधारणा पर आधारित है: एक मॉडल जिसने पहले से ही व्यापक सांख्यिकीय संरचना सीख ली है, चाहे वह छवियों से दृश्य विशेषताएँ हों या पाठ से भाषाई पैटर्न, उसे विशेषज्ञता प्राप्त करने के लिए समान गुणवत्ता वाले मॉडल को शुरू से प्रशिक्षित करने की तुलना में अपेक्षाकृत कम अतिरिक्त डेटा और कंप्यूट की आवश्यकता होती है।
इतिहास
फाइन-ट्यूनिंग 2012 के इमेजनेट सफलता के बाद कंप्यूटर विज़न में एक मानक अभ्यास बन गई, जब शोधकर्ताओं ने पाया कि इमेजनेट पर प्रशिक्षित कन्वोल्यूशनल नेटवर्क अंतिम परतों के हल्के पुनर्प्रशिक्षण के साथ छोटे, असंबंधित छवि वर्गीकरण कार्यों में अच्छी तरह से स्थानांतरित हो जाते हैं। प्राकृतिक भाषा प्रसंस्करण में, इस तकनीक ने 2018 में बर्ट के साथ नया महत्व ग्रहण किया, जिसका "प्रीट्रेन फिर फाइन-ट्यून" प्रतिमान, एक एकल प्रीट्रेन्ड एनकोडर को भावना विश्लेषण या प्रश्न उत्तर जैसे कई डाउनस्ट्रीम कार्यों के लिए अनुकूलित करना, कई वर्षों तक प्रमुख कार्यप्रणाली बन गया। बड़े बड़े भाषा मॉडल के उदय के साथ, फाइन-ट्यूनिंग संकीर्ण वर्गीकरण कार्यों के लिए मॉडल को अनुकूलित करने से हटकर निर्देश फाइन-ट्यूनिंग की ओर स्थानांतरित हो गई, जहां केवल अगला टोकन भविष्यवाणी करने के लिए प्रशिक्षित एक आधार मॉडल को निर्देशों और अपेक्षित प्रतिक्रियाओं के क्यूरेटेड उदाहरणों पर समायोजित किया जाता है ताकि वह एक सहायक सहायक की तरह व्यवहार कर सके, यह कदम चैटजीपीटी जैसी प्रणालियों के प्रशिक्षण में उपयोग किया जाता है।
विधियाँ
पूर्ण फाइन-ट्यूनिंग मॉडल के सभी मापदंडों को अद्यतन करती है और सबसे बड़े मॉडल के लिए, काफी कंप्यूट और मेमोरी की आवश्यकता होती है, क्योंकि इसमें हर वजन के लिए ग्रेडिएंट और ऑप्टिमाइज़र स्थिति संग्रहीत करना शामिल होता है। इस लागत ने पैरामीटर-कुशल फाइन-ट्यूनिंग विधियों के विकास को प्रेरित किया जो मूल मॉडल के अधिकांश भाग को स्थिर रखते हैं और केवल कुछ अतिरिक्त मापदंडों को प्रशिक्षित करते हैं। इनमें से सबसे व्यापक रूप से अपनाई गई विधि लोरा है, जो मॉडल की परतों में छोटे निम्न-रैंक मैट्रिक्स डालती है और केवल उन्हें प्रशिक्षित करती है, जिससे मेमोरी आवश्यकताओं में नाटकीय रूप से कटौती होती है जबकि कई कार्यों पर पूर्ण फाइन-ट्यूनिंग के करीब परिणाम प्राप्त होते हैं। अन्य दृष्टिकोणों में एडेप्टर परतें, प्रॉम्प्ट ट्यूनिंग और प्रीफिक्स ट्यूनिंग शामिल हैं, जिनमें से प्रत्येक लचीलेपन और दक्षता के बीच अलग-अलग मात्रा में समझौता करता है।
पर्यवेक्षित फाइन-ट्यूनिंग (SFT) एक मॉडल को लेबल किए गए इनपुट-आउटपुट जोड़ों पर प्रशिक्षित करती है और एक आधार LLM को निर्देश-पालन सहायक में अनुकूलित करने में पहला मानक कदम है। इसके बाद अक्सर आरएलएचएफ या प्रत्यक्ष-प्राथमिकता-अनुकूलन जैसी प्राथमिकता-आधारित विधियाँ आती हैं जो एकल सही लेबल के बजाय दो आउटपुट में से कौन सा बेहतर है, इस पर मानवीय निर्णयों का उपयोग करके मॉडल के व्यवहार को और परिष्कृत करती हैं।
फाइन-ट्यूनिंग बनाम अन्य दृष्टिकोण
फाइन-ट्यूनिंग की तुलना अक्सर पुनर्प्राप्ति-संवर्धित-पीढ़ी से की जाती है ताकि मॉडल को अधिक सटीक या विशेषज्ञ आउटपुट उत्पन्न करने में मदद मिल सके। फाइन-ट्यूनिंग मॉडल के आंतरिक वजन को बदलती है और एक सुसंगत शैली, प्रारूप या विशेषज्ञ कौशल सिखाने के लिए उपयुक्त है; इसके बजाय पुनर्प्राप्ति मॉडल को बदले बिना अनुमान के समय प्रासंगिक तथ्य प्रदान करती है, जिससे स्रोत जानकारी बदलने पर इसे अद्यतन करना आसान होता है और मॉडल की सामान्य क्षमताओं को अधिलेखित करने की संभावना कम होती है। व्यवहार में, दोनों को अक्सर संयुक्त किया जाता है, जिसमें एक फाइन-ट्यून्ड मॉडल आधार के लिए पुनर्प्राप्त दस्तावेजों पर निर्भर करता है।
जोखिम
एक संकीर्ण डेटासेट पर फाइन-ट्यूनिंग से विनाशकारी विस्मृति हो सकती है, जहां मॉडल अनुकूलन से पहले की सामान्य क्षमताओं को खो देता है, और एक छोटे फाइन-ट्यूनिंग सेट पर ओवरफिटिंग एक लगातार जोखिम है, विशेष रूप से जब उदाहरणों की संख्या मॉडल की क्षमता के सापेक्ष कम हो। बिना फ़िल्टर किए या खराब क्यूरेटेड डेटा पर फाइन-ट्यूनिंग से मॉडल के सुरक्षा प्रशिक्षण को कमजोर करते हुए दिखाया गया है, यह चिंता प्रदाताओं को अपने सबसे सक्षम मॉडल तक फाइन-ट्यूनिंग पहुंच को प्रतिबंधित या निगरानी करने के लिए प्रेरित करती है।