विनाशकारी हस्तक्षेप, जिसे विनाशकारी विस्मरण के रूप में भी जाना जाता है, एक कृत्रिम तंत्रिका नेटवर्क की प्रवृत्ति है कि वह नई जानकारी सीखने पर पहले से सीखी गई जानकारी को अचानक और नाटकीय रूप से भूल जाए। यह घटना मशीन-लर्निंग और डीप-लर्निंग में एक केंद्रीय चुनौती है, खासकर जब मॉडल को कई कार्यों पर क्रमिक रूप से प्रशिक्षित किया जाता है। यह स्थिरता-प्लास्टिसिटी दुविधा की एक कट्टरपंथी अभिव्यक्ति है, जो एक ऐसा नेटवर्क बनाने की कठिनाई को संदर्भित करती है जो नई जानकारी के प्रति संवेदनशील हो लेकिन उससे बाधित न हो।
तंत्रिका नेटवर्क संज्ञानात्मक विज्ञान के कनेक्शनिस्ट दृष्टिकोण का एक प्रमुख घटक हैं। मानव स्मृति के मॉडलिंग में विनाशकारी हस्तक्षेप का मुद्दा पहली बार मैकक्लोस्की और कोहेन (1989) और रैटक्लिफ (1990) के शोध द्वारा वैज्ञानिक ध्यान में लाया गया था। इन अध्ययनों ने कृत्रिम नेटवर्क और मानव स्मृति के बीच एक मौलिक अंतर को उजागर किया: जबकि मनुष्य आमतौर पर ऐसा नाटकीय विस्मरण प्रदर्शित नहीं करते हैं, मानक बैकप्रोपेगेशन नेटवर्क अक्सर ऐसा करते हैं।
स्थिरता-प्लास्टिसिटी दुविधा
स्थिरता-प्लास्टिसिटी दुविधा एक प्रणाली की नई जानकारी को एकीकृत करने की क्षमता (प्लास्टिसिटी) और मौजूदा ज्ञान को संरक्षित करने की क्षमता (स्थिरता) के बीच व्यापार-बंद का वर्णन करती है। लुकअप टेबल और कनेक्शनिस्ट नेटवर्क इस स्पेक्ट्रम के विपरीत छोर पर स्थित हैं। एक लुकअप टेबल नई जानकारी जोड़े जाने पर पूरी तरह से स्थिर रहती है लेकिन अनदेखे इनपुट के लिए सामान्यीकरण नहीं कर सकती है। इसके विपरीत, कनेक्शनिस्ट नेटवर्क, जैसे कि मानक बैकप्रोपेगेशन नेटवर्क, नए इनपुट के लिए सामान्यीकरण कर सकते हैं लेकिन नई जानकारी के प्रति अत्यधिक संवेदनशील होते हैं, जिससे अक्सर विनाशकारी हस्तक्षेप होता है।
मानव स्मृति के मॉडलिंग में यह संवेदनशीलता समस्याग्रस्त है, क्योंकि मनुष्य आम तौर पर नया ज्ञान प्राप्त करते समय पहले से सीखी गई जानकारी को बनाए रखते हैं। यह अंतर बताता है कि जैविक स्मृति प्रणालियाँ ऐसे तंत्रों का उपयोग करती हैं जो कृत्रिम नेटवर्क में कमी हैं, जैसे कि पूरक शिक्षण प्रणाली या सिनैप्टिक समेकन।
अनुक्रमिक शिक्षण प्रयोग
मैकक्लोस्की और कोहेन (1989) ने बैकप्रोपेगेशन नेटवर्क के साथ दो प्रयोगों के माध्यम से विनाशकारी हस्तक्षेप का प्रदर्शन किया। पहले प्रयोग में, उन्होंने एक नेटवर्क को एक नंबर से जुड़े एकल-अंक जोड़ तथ्यों (जैसे, 1+1 से 9+1 और 1+2 से 1+9) पर तब तक प्रशिक्षित किया जब तक कि उसने सभी का सही उत्तर नहीं दिया। फिर उन्होंने उसी नेटवर्क को दो नंबर से जुड़े जोड़ तथ्यों (जैसे, 2+1 से 2+9 और 1+2 से 9+2) पर प्रशिक्षित किया। दो तथ्यों पर सिर्फ एक प्रशिक्षण परीक्षण के बाद, एक तथ्यों पर नेटवर्क का प्रदर्शन नाटकीय रूप से गिर गया, जिससे अक्सर गलत उत्तरों से मिलते-जुलते आउटपुट उत्पन्न हुए। यहां तक कि 2+1 और 1+2 जैसी ओवरलैपिंग समस्याओं ने भी महत्वपूर्ण व्यवधान दिखाया।
दूसरे प्रयोग में, मैकक्लोस्की और कोहेन ने बार्न्स और अंडरवुड (1959) द्वारा मनुष्यों में पूर्वव्यापी हस्तक्षेप पर एक क्लासिक अध्ययन को दोहराया। उन्होंने एक नेटवर्क को युग्मित सहयोगी (ए-बी और ए-सी सूचियाँ) पर सूचियों को अलग करने के लिए संदर्भ पैटर्न के साथ प्रशिक्षित किया। जब दोनों सूचियों पर एक साथ प्रशिक्षित किया गया, तो नेटवर्क ने सभी संघों को सही ढंग से सीखा। हालांकि, जब क्रमिक रूप से प्रशिक्षित किया गया (पहले ए-बी, फिर ए-सी), तो ए-सी प्रशिक्षण की मात्रा जो मनुष्यों में 50% सही प्रतिक्रिया उत्पन्न करती थी, नेटवर्क में ए-बी संघों के लिए लगभग 0% सही प्रतिक्रिया उत्पन्न की। बी संकेतों के लिए नेटवर्क के आउटपुट अक्सर सी प्रतिक्रियाओं से मिलते-जुलते थे, यह दर्शाता है कि नई शिक्षा ने पुराने ज्ञान को अधिलेखित कर दिया था।
मैकक्लोस्की और कोहेन ने विभिन्न जोड़तोड़ों के माध्यम से हस्तक्षेप को कम करने का प्रयास किया, जिसमें छिपी हुई इकाइयों की संख्या बदलना, सीखने की दर को समायोजित करना, ए-बी सूची पर अति-प्रशिक्षण, कुछ कनेक्शन भार को स्थिर करना और लक्ष्य मूल्यों को बदलना शामिल है। इनमें से किसी ने भी विनाशकारी विस्मरण को संतोषजनक ढंग से कम नहीं किया।
मान्यता स्मृति निष्कर्ष
रैटक्लिफ (1990) ने मानक मान्यता स्मृति प्रक्रियाओं पर लागू बैकप्रोपेगेशन मॉडल का उपयोग करके इन निष्कर्षों का विस्तार किया, जहां आइटम क्रमिक रूप से सीखे गए थे। उन्होंने दो प्रमुख समस्याओं की पहचान की। पहला, अच्छी तरह से सीखी गई जानकारी को नई जानकारी सीखने पर विनाशकारी रूप से भुला दिया गया, छोटे और बड़े दोनों नेटवर्कों में। दूसरा, नई जानकारी के साथ एक भी प्रशिक्षण परीक्षण से पुरानी जानकारी का महत्वपूर्ण नुकसान हुआ, जो मैकक्लोस्की और कोहेन के परिणामों के समानांतर था।
रैटक्लिफ ने यह भी देखा कि आउटपुट अक्सर पिछले और नए इनपुट का मिश्रण होते थे। बड़े नेटवर्कों में, समूहों में सीखे गए आइटम (जैसे, एबी फिर सीडी) व्यक्तिगत रूप से सीखे गए आइटम (जैसे, ए फिर बी फिर सी) की तुलना में विस्मरण के प्रति अधिक प्रतिरोधी थे, हालांकि विस्मरण पर्याप्त बना रहा। नई छिपी हुई इकाइयों को जोड़ने से हस्तक्षेप कम नहीं हुआ।
आधुनिक एआई के लिए निहितार्थ
विनाशकारी हस्तक्षेप समकालीन कृत्रिम-बुद्धिमत्ता प्रणालियों में एक महत्वपूर्ण चुनौती बनी हुई है, जिसमें बड़े-भाषा-मॉडल और ट्रांसफार्मर-आधारित आर्किटेक्चर शामिल हैं। जब इन मॉडलों को नए कार्यों या डेटासेट पर ठीक-ट्यून किया जाता है, तो वे पहले से सीखे गए कार्यों पर प्रदर्शन खो सकते हैं। यह मुद्दा निरंतर सीखने के लिए विशेष रूप से प्रासंगिक है, जहां मॉडल को पुराने ज्ञान को भूलने के बिना नई जानकारी के अनुकूल होना चाहिए।
शोधकर्ताओं ने विनाशकारी विस्मरण को कम करने के लिए विभिन्न रणनीतियाँ विकसित की हैं, जैसे पाठ्यचर्या-शिक्षण, मॉडल-प्रूनिंग, और नियमितीकरण तकनीक। हालांकि, कोई सार्वभौमिक समाधान मौजूद नहीं है, और यह समस्या तंत्रिका-नेटवर्क सिद्धांत और अनुप्रयोग में अनुसंधान का एक सक्रिय क्षेत्र बनी हुई है।
निष्कर्ष
विनाशकारी हस्तक्षेप मानक तंत्रिका नेटवर्क की एक मौलिक सीमा को उजागर करता है और मानव स्मृति को दोहराने की जटिलता को रेखांकित करता है। मैकक्लोस्की और कोहेन और रैटक्लिफ के काम ने घटना और इसकी विशेषताओं को स्थापित किया, जो अधिक स्थिर और अनुकूलनीय शिक्षण प्रणालियों के निर्माण के लिए चल रहे प्रयासों की नींव प्रदान करता है।