मैकेनिस्टिक इंटरप्रिटेबिलिटी (कभी-कभी मेक इंटरप्रेट, मेकइंटरप्रेट, या एमआई के रूप में संक्षिप्त) व्याख्यात्मक कृत्रिम बुद्धिमत्ता के भीतर अनुसंधान का एक उपक्षेत्र है जिसका उद्देश्य तंत्रिका नेटवर्क के आंतरिक कार्यों को उनकी ठोस संरचनाओं, एल्गोरिदम और सर्किट का विश्लेषण करके समझना है। यह दृष्टिकोण पारंपरिक सॉफ्टवेयर के रिवर्स इंजीनियरिंग के समान तरीके से तंत्रिका नेटवर्क का विश्लेषण करना चाहता है, ब्लैक-बॉक्स स्पष्टीकरण से आगे बढ़कर उन विशिष्ट तंत्रों की पहचान करता है जो मॉडल व्यवहार को संचालित करते हैं। यह क्षेत्र 2020 के दशक की शुरुआत से तेजी से विकसित हुआ है, जिसमें Anthropic, OpenAI, और Google DeepMind जैसे अनुसंधान संगठनों के साथ-साथ MIT CSAIL, Stanford AI Lab, और BAIR (Berkeley AI Research) सहित शैक्षणिक संस्थानों का महत्वपूर्ण योगदान रहा है।
मैकेनिस्टिक इंटरप्रिटेबिलिटी व्याख्यात्मक एआई के व्यापक संदर्भ में स्थित है, लेकिन यह पोस्ट-हॉक आरोपण विधियों के बजाय कारणात्मक, संरचनात्मक विश्लेषण पर ध्यान केंद्रित करके स्वयं को अलग करती है। यह मशीन लर्निंग, डीप लर्निंग, और तंत्रिका नेटवर्क सिद्धांत की अवधारणाओं पर आधारित है, और यह बड़े भाषा मॉडल और अन्य जनरेटिव एआई प्रणालियों के ऑडिट के लिए विशेष रूप से प्रासंगिक हो गया है। अंतिम लक्ष्य पारंपरिक सॉफ्टवेयर इंजीनियरिंग के बराबर समझ का स्तर प्रदान करना है, जहां कोड का निरीक्षण, डिबग और सत्यापन किया जा सकता है।
इतिहास
"मैकेनिस्टिक इंटरप्रिटेबिलिटी" शब्द Anthropic के सह-संस्थापक क्रिस ओला द्वारा गढ़ा गया था, जो व्याख्यात्मक एआई में सामान्य तरीकों के विपरीत सर्किट विश्लेषण में उनके काम के विवरण के रूप में था। सर्किट विश्लेषण ने मॉडल के भीतर व्यक्तिगत विशेषताओं और सर्किट को पूरी तरह से चिह्नित करने का प्रयास किया, जबकि व्यापक क्षेत्र सैलिएंसी मैप्स जैसे ग्रेडिएंट-आधारित दृष्टिकोणों की ओर झुकाव रखता था। ओला का प्रारंभिक कार्य, जो OpenAI में और बाद में एंथ्रोपिक में उनके समय के दौरान किया गया था, तंत्रिका नेटवर्क को समझने के लिए अधिक कठोर, बॉटम-अप दृष्टिकोण की नींव रखी।
सर्किट विश्लेषण से पहले, उपक्षेत्र में काम ने विज़न मॉडल इंसेप्शन वी1 जैसे मॉडलों का विश्लेषण करने के लिए मानव-कंप्यूटर इंटरैक्शन विधियों के साथ फीचर विज़ुअलाइज़ेशन, आयामीता में कमी और आरोपण जैसी विभिन्न तकनीकों को संयुक्त किया। ये प्रारंभिक प्रयास, जिसमें Google DeepMind और शैक्षणिक प्रयोगशालाओं के शोधकर्ता भी शामिल थे, ने प्रदर्शित किया कि तंत्रिका नेटवर्क अक्सर अपनी मध्यवर्ती परतों में व्याख्या योग्य विशेषताओं को एन्कोड करते हैं, लेकिन उनके पास कारणात्मक संबंधों को सत्यापित करने के लिए एक व्यवस्थित पद्धति का अभाव था।
यह क्षेत्र 2010 के दशक के अंत और 2020 के दशक की शुरुआत में गति प्राप्त कर गया क्योंकि ट्रांसफॉर्मर-आधारित मॉडल प्रमुख हो गए। Jacob Steinhardt, Llion Jones, और एंथ्रोपिक और OpenAI के अन्य शोधकर्ताओं ने छोटे मॉडलों के विस्तृत सर्किट विश्लेषण प्रकाशित करना शुरू किया, और बाद में इन तकनीकों को बड़ी प्रणालियों तक बढ़ाया। 2023 तक, मैकेनिस्टिक इंटरप्रिटेबिलिटी समर्पित कार्यशालाओं, सम्मेलनों और वित्त पोषण पहलों के साथ एक मान्यता प्राप्त उपक्षेत्र बन गया था।
प्रमुख अवधारणाएँ
मैकेनिस्टिक इंटरप्रिटेबिलिटी का उद्देश्य मशीन लर्निंग मॉडल के वजन में एन्कोड की गई संरचनाओं, सर्किट या एल्गोरिदम की पहचान करना है। यह पहले की व्याख्या विधियों के विपरीत है जो मुख्य रूप से "ब्लैक बॉक्स" स्पष्टीकरणों पर केंद्रित थीं, जैसे सैलिएंसी मैप्स या फीचर आरोपण। मूल धारणा यह है कि तंत्रिका नेटवर्क, अपनी जटिलता के बावजूद, असतत, विश्लेषण योग्य गणनाएँ लागू करते हैं जिन्हें रिवर्स-इंजीनियर किया जा सकता है।
एक केंद्रीय अवधारणा "फीचर" है, जो सक्रियण स्थान में एक दिशा या पैटर्न को संदर्भित करती है जो मानव-समझने योग्य अवधारणा से मेल खाती है, जैसे कि एक विशिष्ट वस्तु, शब्दार्थ श्रेणी, या वाक्यात्मक भूमिका। फीचर अक्सर स्पार्स ऑटोएनकोडर या आयामीता में कमी जैसी तकनीकों का उपयोग करके पहचाने जाते हैं। एक अन्य प्रमुख अवधारणा "सर्किट" है, जो फीचर सक्रियणों की एक कारणात्मक श्रृंखला है जो इनपुट को आउटपुट से जोड़ती है। सर्किट का मानचित्रण करके, शोधकर्ता यह पता लगा सकते हैं कि एक मॉडल सूचना को कैसे संसाधित करता है और निर्णय लेता है।
रैखिक प्रतिनिधित्व परिकल्पना
यह परिकल्पना सुझाव देती है कि उच्च-स्तरीय अवधारणाओं को तंत्रिका नेटवर्क के सक्रियण स्थान में रैखिक दिशाओं के रूप में दर्शाया जाता है। शब्द एम्बेडिंग और बड़े भाषा मॉडल से अनुभवजन्य साक्ष्य इस दृष्टिकोण का समर्थन करते हैं, हालांकि यह सार्वभौमिक रूप से धारण नहीं करता है। उदाहरण के लिए, कई ट्रांसफॉर्मर-आधारित मॉडलों में, लिंग, काल, या भावना जैसी अवधारणाओं को विशिष्ट वैक्टर जोड़कर या घटाकर हेरफेर किया जा सकता है, जो एक रैखिक संरचना का संकेत देता है। हालांकि, कुछ अवधारणाएँ गैर-रैखिक रूप से वितरित दिखाई देती हैं, और परिकल्पना अनुसंधान का एक सक्रिय क्षेत्र बनी हुई है।
रैखिक प्रतिनिधित्व परिकल्पना में व्याख्या के लिए व्यावहारिक निहितार्थ हैं, क्योंकि यह सुझाव देती है कि प्रमुख घटक विश्लेषण या स्पार्स डिक्शनरी लर्निंग जैसी सरल रैखिक बीजगणित तकनीकों का उपयोग करके फीचर की पहचान की जा सकती है। यह कई स्पार्स ऑटोएनकोडर दृष्टिकोणों को भी रेखांकित करता है, जिनका उद्देश्य कच्चे सक्रियणों से इन रैखिक दिशाओं को पुनर्प्राप्त करना है।
विधियाँ
मैकेनिस्टिक इंटरप्रिटेबिलिटी यह समझने के लिए कारणात्मक विधियों का उपयोग करती है कि आंतरिक मॉडल घटक आउटपुट को कैसे प्रभावित करते हैं, अक्सर कार्य-कारण सिद्धांत से औपचारिक उपकरणों का उपयोग करते हुए। इन विधियों में सक्रियण पैचिंग शामिल है, जहां एक इनपुट से सक्रियण को आउटपुट में परिवर्तनों का निरीक्षण करने के लिए दूसरे में प्रतिस्थापित किया जाता है; एब्लेशन अध्ययन, जहां विशिष्ट घटकों को हटा दिया जाता है या शून्य कर दिया जाता है; और ग्रेडिएंट-आधारित आरोपण, हालांकि क्षेत्र सहसंबंधी विधियों पर कारणात्मक हस्तक्षेपों को प्राथमिकता देता है।
एक विशिष्ट विश्लेषण पाइपलाइन में कई चरण शामिल होते हैं: पहले, एक मॉडल को प्रशिक्षित या चुना जाता है, अक्सर एक छोटा ट्रांसफॉर्मर या विज़न कार्यों के लिए एक अवशिष्ट नेटवर्क। अगला, शोधकर्ता फीचर विज़ुअलाइज़ेशन या स्पार्स ऑटोएनकोडर जैसी तकनीकों का उपयोग करके उम्मीदवार फीचर की पहचान करते हैं। फिर, वे यह सत्यापित करने के लिए कारणात्मक प्रयोग करते हैं कि ये फीचर विशिष्ट व्यवहारों में भूमिका निभाते हैं। अंत में, वे सर्किट आरेख बनाते हैं जो फीचर और परतों के बीच बातचीत को सारांशित करते हैं।
मैकेनिस्टिक इंटरप्रिटेबिलिटी, एआई सुरक्षा के क्षेत्र में, जटिल एआई प्रणालियों के व्यवहार को समझने और सत्यापित करने के लिए उपयोग की जाती है, और एआई मिसअलाइनमेंट जैसे संभावित जोखिमों की पहचान करने का प्रयास करती है। मॉडल आंतरिक का एक दानेदार दृश्य प्रदान करके, यह आउटपुट में प्रकट होने से पहले भ्रामक या अनपेक्षित व्यवहारों का पता लगाना संभव बनाने का लक्ष्य रखती है।
स्पार्स ऑटोएनकोडर
एक स्पार्स ऑटोएनकोडर (एसएई) एक मॉडल है जिसे तंत्रिका नेटवर्क सक्रियणों को स्पार्स प्रतिनिधित्वों में अलग करने के लिए प्रशिक्षित किया जाता है। सीखे गए आयाम अक्सर सरल, मानव-समझने योग्य अवधारणाओं का प्रतिनिधित्व करते हैं। तकनीक को 2023 और 2024 में Anthropic द्वारा बड़े भाषा मॉडल व्याख्या पर लागू किया गया था, जिसमें क्लाउड जैसे मॉडलों से व्याख्या योग्य फीचर निकालने में उल्लेखनीय सफलता मिली। एसएई सक्रियणों को सक्रिय फीचर के एक छोटे सेट से पुनर्निर्माण करके काम करते हैं, नेटवर्क को एक स्पार्स, ओवरकम्प्लीट आधार सीखने के लिए प्रोत्साहित करते हैं।
एसएई का उपयोग विशिष्ट संस्थाओं, भावनाओं और यहां तक कि अमूर्त तर्क पैटर्न जैसी अवधारणाओं के लिए फीचर की पहचान करने के लिए किया गया है। वे बड़े भाषा मॉडल का विश्लेषण करने के लिए विशेष रूप से उपयोगी हैं, जहां सक्रियण स्थान उच्च-आयामी और घनी आबादी वाला है। हालांकि, एसएई को प्रशिक्षित करना कम्प्यूटेशनल रूप से महंगा हो सकता है, और परिणामी फीचर हमेशा मानव श्रेणियों के साथ पूरी तरह से संरेखित नहीं हो सकते हैं।
फीचर और सर्किट
एक तंत्रिका नेटवर्क में एक सर्किट फीचर सक्रियणों की कारणात्मक श्रृंखलाओं से बना होता है। यह मानचित्रण करके कि कौन से सर्किट किस डाउनस्ट्रीम परिणामों की ओर ले जाते हैं, साथ ही सर्किट को सक्रिय और बाधित करके, कोई विश्लेषण कर सकता है कि एक तंत्रिका नेटवर्क (जैसे एलएलएम) किसी दिए गए इनपुट से दिए गए परिणाम तक कैसे पहुंचता है। उदाहरण के लिए, शोधकर्ताओं ने अप्रत्यक्ष वस्तु पहचान जैसे कार्यों के लिए सर्किट की पहचान की है, जहां एक मॉडल किसी क्रिया के प्राप्तकर्ता की सही भविष्यवाणी करता है, और छोटे ट्रांसफॉर्मर में अंकगणितीय संचालन के लिए।
सर्किट विश्लेषण में अक्सर सक्रियण पैचिंग और लॉजिट लेंस जैसी तकनीकें शामिल होती हैं, जो शोधकर्ताओं को मध्यवर्ती प्रतिनिधित्वों का निरीक्षण करने की अनुमति देती हैं। विज़न मॉडलों में, किनारों, बनावट और वस्तु भागों का पता लगाने के लिए सर्किट पाए गए हैं, जबकि भाषा मॉडलों में, वाक्यात्मक समझौते, तथ्यात्मक स्मरण और यहां तक कि कुछ प्रकार के तर्क के लिए सर्किट मैप किए गए हैं। लक्ष्य सर्किट का एक व्यापक पुस्तकालय बनाना है जिसे मॉडलों में पुन: उपयोग और सत्यापित किया जा सके।
अनुप्रयोग और निहितार्थ
मैकेनिस्टिक इंटरप्रिटेबिलिटी के कई व्यावहारिक अनुप्रयोग हैं। एआई सुरक्षा में, इसका उपयोग छिपे हुए पूर्वाग्रहों, बैकडोर या मिसअलाइन उद्देश्यों के लिए मॉडल का ऑडिट करने के लिए किया जाता है। उदाहरण के लिए, शोधकर्ताओं ने सर्किट विश्लेषण का उपयोग यह पता लगाने के लिए किया है कि एक मॉडल कब भ्रामक सहसंबंधों पर निर्भर हो सकता है या जब यह चापलूसी व्यवहार प्रदर्शित कर सकता है। मॉडल डिबगिंग में, व्याख्या इंजीनियरों को यह पहचानने में मदद कर सकती है कि एक मॉडल विशिष्ट इनपुट पर विफल क्यों होता है और फाइन-ट्यूनिंग या पुनः प्रशिक्षण का मार्गदर्शन कर सकती है।
यह क्षेत्र अधिक व्याख्या योग्य आर्किटेक्चर के डिजाइन को भी सूचित करता है। कुछ शोधकर्ता अंतर्निहित व्याख्या के साथ मॉडल बनाने का प्रस्ताव करते हैं, जैसे कि एक परत के रूप में स्पार्स ऑटोएनकोडर का उपयोग करना या अलग किए गए प्रतिनिधित्वों को शामिल करना। हालांकि, ये दृष्टिकोण अभी भी प्रयोगात्मक हैं, और इस बात पर बहस चल रही है कि क्या प्रदर्शन का त्याग किए बिना व्याख्या प्राप्त की जा सकती है।
2025 तक, मैकेनिस्टिक इंटरप्रिटेबिलिटी खुली चुनौतियों के साथ एक तेजी से विकसित होने वाला क्षेत्र बना हुआ है। GPT-4 या क्लाउड 3 जैसे बड़े मॉडलों के लिए विश्लेषण को स्केल करना कम्प्यूटेशनल रूप से गहन है, और सर्किट की जटिलता मॉडल आकार के साथ बढ़ती है। इसके अतिरिक्त, सैद्धांतिक नींव के बारे में चल रही चर्चा है, कुछ शोधकर्ता यह सवाल उठाते हैं कि क्या तंत्रिका नेटवर्क को उनकी स्टोकेस्टिक प्रशिक्षण प्रक्रियाओं को देखते हुए पूरी तरह से रिवर्स-इंजीनियर किया जा सकता है।
यह भी देखें
- एआई संरेखण
- व्याख्यात्मक एआई
- स्पार्स ऑटोएनकोडर
- सर्किट विश्लेषण
- फीचर विज़ुअलाइज़ेशन
- सक्रियण पैचिंग
संदर्भ
- Olah, C., et al. (2020). "Zoom In: An Introduction to Circuits." Distill.
- Elhage, N., et al. (2021). "A Mathematical Framework for Transformer Circuits." Anthropic.
- Cunningham, H., et al. (2023). "Sparse Autoencoders Find Highly Interpretable Features in Language Models." Anthropic.
- Nanda, N., et al. (2023). "Emergent Linear Representations in World Models of Self-Supervised Sequence Models." BlackNLP Workshop.
आगे पढ़ें
- Bricken, T., et al. (2023). "Towards Monosemanticity: Decomposing Language Models With Dictionary Learning." Anthropic.
- Lieberum, T., et al. (2023). "Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla." DeepMind.
- Rauker, T., et al. (2023). "Towards Interpretable Deep Learning: A Review." arXiv.