अतिअनुकूलन (Overfitting) Machine learning में एक विफलता मोड है जिसमें एक मॉडल प्रशिक्षण डेटा को बहुत बारीकी से सीखता है, जिसमें उसका शोर और विशिष्टताएँ शामिल होती हैं, और नए, अनदेखे डेटा पर सामान्यीकरण करने वाले पैटर्न सीखने की कीमत पर ऐसा करता है। एक अतिअनुकूलित मॉडल आमतौर पर उस डेटा पर बहुत कम त्रुटि दिखाता है जिस पर उसे प्रशिक्षित किया गया था, लेकिन बाहरी डेटा पर काफी अधिक त्रुटि दिखाता है, जो उन उदाहरणों पर अच्छा प्रदर्शन करने वाला मॉडल बनाने के इच्छित लक्ष्य के विपरीत है जिन्हें उसने कभी नहीं देखा है।
कारण
अतिअनुकूलन तब होता है जब एक मॉडल में पर्याप्त क्षमता होती है, जिसका अर्थ है पर्याप्त पैरामीटर या प्रभावी लचीलापन, ताकि वह एक सीमित प्रशिक्षण सेट की विशिष्ट बारीकियों को याद कर सके, बजाय इसके कि उसे अंतर्निहित सरल, अधिक सामान्य पैटर्न खोजने के लिए मजबूर किया जाए। यह तब अधिक संभावित हो जाता है जब मॉडल क्षमता और प्रशिक्षण डेटा आकार का अनुपात बढ़ता है, यही कारण है कि ऐतिहासिक रूप से अतिअनुकूलन छोटे डेटासेट और अपेक्षाकृत सरल मॉडलों के लिए एक बड़ी चिंता थी, जितना कि यह आज के Large language model के लिए प्रतीत हो सकता है, जिनके प्रशिक्षण सेट बहुत बड़े हैं। अतिअनुकूलन अधिक स्थानीय रूप से भी हो सकता है, उदाहरण के लिए जब एक मॉडल को Pretraining के बाद एक छोटे, संकीर्ण डेटासेट पर फाइन-ट्यून किया जाता है, जहाँ यह अपनी कुछ व्यापक क्षमताओं को खो सकता है जबकि फाइन-ट्यूनिंग सेट के लिए अत्यधिक अनुकूलित हो जाता है, एक संबंधित घटना जिसे कभी-कभी विनाशकारी विस्मरण कहा जाता है। एक ही डेटा पर बहुत अधिक पासों के लिए प्रशिक्षण, जिसे बहुत अधिक युग (epochs) के रूप में जाना जाता है, एक क्लासिक प्रत्यक्ष कारण है, क्योंकि पर्याप्त क्षमता वाला मॉडल धीरे-धीरे सामान्य पैटर्न सीखने से विशिष्ट उदाहरणों को याद करने की ओर स्थानांतरित हो जाएगा, जितना अधिक समय तक वह उन पर प्रशिक्षण लेता है।
पहचान
अतिअनुकूलन का पता लगाने का मानक तरीका एक Loss function को एक सत्यापन सेट (validation set) पर निगरानी करना है, जो प्रशिक्षण से बाहर रखा गया डेटा का एक हिस्सा है, साथ ही प्रशिक्षण हानि की निगरानी करना है। जब तक दोनों हानियाँ एक साथ गिरती हैं, मॉडल सामान्यीकरण कर रहा है; एक बार जब प्रशिक्षण हानि गिरती रहती है जबकि सत्यापन हानि रुक जाती है या बढ़ जाती है, तो मॉडल ने अतिअनुकूलन शुरू कर दिया है। यह सत्यापन वक्र प्रारंभिक रोक (early stopping) का आधार है, एक तकनीक जो प्रशिक्षण को उस बिंदु के पास रोक देती है जहाँ सत्यापन प्रदर्शन सर्वोत्तम होता है, और एक सत्यापन सेट का उपयोग करके प्रतिस्पर्धी आर्किटेक्चर या हाइपरपैरामीटर सेटिंग्स के बीच चयन करने के लिए भी, जिस पर मॉडल कभी प्रशिक्षित नहीं हुआ था।
शमन
अतिअनुकूलन को रोकने या कम करने के लिए तकनीकों का सामान्य परिवार Regularization के रूप में जाना जाता है, जिसमें वजन दंड, ड्रॉपआउट, डेटा संवर्धन, और अधिक या अधिक विविध Training data एकत्र करना शामिल है ताकि याद करने योग्य विशिष्टताएँ वास्तविक पैटर्न के सापेक्ष कम मायने रखें। क्रॉस-वैलिडेशन, जो बार-बार डेटा को विभिन्न प्रशिक्षण और सत्यापन विभाजनों में विभाजित करता है, एक एकल प्रशिक्षण-सत्यापन विभाजन की तुलना में मॉडल के सामान्यीकरण का अधिक मजबूत अनुमान देता है, और छोटे डेटासेट के लिए मानक अभ्यास है जहाँ एक एकल बाहरी सेट स्वयं शोरगुल वाला होगा।
बेंचमार्क स्तर पर अतिअनुकूलन
उसी समस्या का एक संबंधित, उच्च-स्तरीय संस्करण पूरे क्षेत्र के मापन प्रगति के तरीके को प्रभावित करता है: जब शोधकर्ता वर्षों तक एक ही सार्वजनिक AI benchmark के खिलाफ मॉडलों को बार-बार ट्यून करते हैं, तो परिणाम उस विशिष्ट बेंचमार्क पर सुधर सकते हैं बिना वास्तविक दुनिया के लाभ के, और लोकप्रिय मूल्यांकन सेट वेब से स्क्रैप किए गए Training data में लीक होने का जोखिम उठाते हैं, एक समस्या जिसे बेंचमार्क या डेटा संदूषण कहा जाता है। इसने बाहरी, संदूषण-प्रतिरोधी मूल्यांकनों को, और ARC-AGI जैसे बेंचमार्क को, जो स्पष्ट रूप से याद करने का विरोध करने के लिए डिज़ाइन किए गए हैं, ईमानदारी से मापने के लिए तेजी से महत्वपूर्ण बना दिया है कि क्या Large language model वास्तविक तर्क में सुधार कर रहे हैं, न कि परिचित परीक्षण वितरणों के लिए अतिअनुकूलित हो रहे हैं।