लॉजिट लेंस मशीन लर्निंग व्याख्येयता में एक तकनीक है जिसका उपयोग ट्रांसफॉर्मर-आधारित बड़े भाषा मॉडल के आंतरिक निरूपण का निरीक्षण करने के लिए किया जाता है। यह किसी दिए गए परत पर छिपी स्थिति लेकर, मॉडल के अंतिम अनएम्बेडिंग मैट्रिक्स (जो छिपी स्थितियों को शब्दावली पर लॉजिट में मैप करता है) को लागू करके, और फिर एक प्रायिकता वितरण प्राप्त करने के लिए सॉफ्टमैक्स लागू करके काम करता है। यह वितरण प्रकट करता है कि यदि मॉडल उस परत पर रुक जाता तो वह क्या भविष्यवाणी करता, जो परत दर परत भविष्यवाणियों के विकास की एक खिड़की प्रदान करता है। यह विधि 2020 में nostalgebraist द्वारा प्रस्तुत की गई थी और तब से GPT-2 और GPT-3 जैसे मॉडलों के आंतरिक संगणनाओं का अध्ययन करने के लिए एक मानक उपकरण बन गई है।
प्रोबिंग क्लासिफायर के विपरीत जिन्हें सहायक मॉडलों के प्रशिक्षण की आवश्यकता होती है, लॉजिट लेंस मॉडल के स्वयं के आउटपुट हेड का उपयोग करता है, जिससे यह एक शून्य-पैरामीटर और प्रशिक्षण-मुक्त दृष्टिकोण बन जाता है। यह विशेष रूप से अवशिष्ट स्ट्रीम वाले मॉडलों के लिए प्रभावी है, क्योंकि प्रत्येक परत पर छिपी स्थितियाँ योगात्मक होती हैं और सीधे प्रक्षेपित की जा सकती हैं। इस तकनीक का उपयोग यह पहचानने के लिए किया गया है कि मॉडल विशिष्ट भविष्यवाणियों के लिए कब प्रतिबद्ध होते हैं, "देर से" बनाम "जल्दी" डिकोडिंग का पता लगाने के लिए, और तथ्यात्मक स्मरण और अंकगणितीय तर्क जैसी घटनाओं का विश्लेषण करने के लिए। हालाँकि, इसकी प्रयोज्यता बंधे या साझा एम्बेडिंग वाले मॉडलों तक सीमित है, और यह जटिल परत सामान्यीकरण या गैर-रेखीय परिवर्तनों वाले मॉडलों के लिए अच्छी तरह से काम नहीं कर सकता है।
तंत्र और कार्यान्वयन
लॉजिट लेंस ट्रांसफॉर्मर की अवशिष्ट स्ट्रीम पर कार्य करता है। एक विशिष्ट ट्रांसफॉर्मर में, प्रत्येक परत अपने आउटपुट को अवशिष्ट स्ट्रीम में जोड़ती है, इसलिए परत \( l \) पर छिपी स्थिति प्रारंभिक एम्बेडिंग और \( l \) तक के सभी परत आउटपुट का योग होती है। अंतिम लॉजिट की गणना परत सामान्यीकरण (यदि मौजूद हो) लागू करके और फिर अनएम्बेडिंग मैट्रिक्स \( W_U \) लागू करके की जाती है। लॉजिट लेंस वितरण बदलाव को ध्यान में रखने के लिए अक्सर अंतिम परत मानदंड (या एक सीखा हुआ एफाइन परिवर्तन) लागू करने के बाद, मध्यवर्ती छिपी स्थितियों पर समान अनएम्बेडिंग लागू करता है।
बंधे एम्बेडिंग वाले मॉडलों के लिए (जहाँ इनपुट एम्बेडिंग और आउटपुट अनएम्बेडिंग वजन साझा करते हैं), प्रक्षेपण सीधा है। अलग अनएम्बेडिंग मैट्रिक्स वाले मॉडलों के लिए, तकनीक तब भी काम करती है जब तक अनएम्बेडिंग उपलब्ध है। परिणाम प्रत्येक परत के लिए शब्दावली पर प्रायिकता वितरण का एक अनुक्रम है, जिसे हीटमैप के रूप में देखा जा सकता है या उम्मीदवार टोकनों के बीच "लॉजिट अंतर" जैसे मीट्रिक की गणना करने के लिए उपयोग किया जा सकता है।
व्याख्येयता में अनुप्रयोग
लॉजिट लेंस को विभिन्न व्याख्येयता कार्यों पर लागू किया गया है। एक सामान्य उपयोग परतों में भविष्यवाणियों के विकास का पता लगाना है। उदाहरण के लिए, "फ्रांस की राजधानी __ है" को पूरा करने के लिए कहे गए मॉडल में, लॉजिट लेंस दिखा सकता है कि प्रारंभिक परतें कई परतों के बाद ही "पेरिस" को उच्च प्रायिकता प्रदान करती हैं, जिससे पता चलता है कि मॉडल प्रासंगिक तथ्य कब प्राप्त करता है। शोधकर्ताओं ने इसका उपयोग "इंडक्शन हेड्स" और अन्य ध्यान पैटर्न की पहचान करने के लिए किया है जो विशिष्ट व्यवहारों में योगदान करते हैं।
एक अन्य अनुप्रयोग "देर से" डिकोडिंग का पता लगाना है, जहाँ एक मॉडल शुरू में एक टोकन की भविष्यवाणी कर सकता है लेकिन बाद में अपना मन बदल सकता है। प्रत्येक परत पर लॉजिट लेंस की जांच करके, कोई देख सकता है कि अंतिम भविष्यवाणी कब "लॉक इन" होती है और कब यह अभी भी लचीली होती है। मॉडल आत्मविश्वास को समझने और हस्तक्षेपों को डिजाइन करने के लिए इसके निहितार्थ हैं।
इस तकनीक का उपयोग अंकगणित और तर्क का अध्ययन करने के लिए भी किया गया है। GPT-3 जैसे मॉडलों में, लॉजिट लेंस दिखा सकता है कि मध्यवर्ती परतें मध्यवर्ती योग या कैरी का प्रतिनिधित्व करती हैं, जो बहु-चरणीय संगणना के लिए साक्ष्य प्रदान करती हैं। इसने यांत्रिक व्याख्येयता पर आगे के काम को जन्म दिया है, जैसे एंथ्रोपिक और अन्य शोध समूहों द्वारा "इंडक्शन हेड्स" और "सर्किट" ढांचा।
सीमाएँ और आलोचनाएँ
अपनी उपयोगिता के बावजूद, लॉजिट लेंस की कई सीमाएँ हैं। सबसे पहले, यह मानता है कि अनएम्बेडिंग मैट्रिक्स सभी परतों के लिए एक सार्थक प्रक्षेपण है, जो धारण नहीं कर सकता है यदि मॉडल की छिपी स्थितियाँ महत्वपूर्ण परिवर्तनों (जैसे, परत सामान्यीकरण) से गुजरती हैं जिन्हें ध्यान में नहीं रखा गया है। कुछ मॉडल, विशेष रूप से प्री-नॉर्म आर्किटेक्चर वाले, मध्यवर्ती स्थितियों पर अंतिम परत मानदंड लागू करने की आवश्यकता होती है, लेकिन यह हमेशा पर्याप्त नहीं होता है।
दूसरा, लॉजिट लेंस बड़ी शब्दावली वाले मॉडलों या बहु-टोकन भविष्यवाणियों की आवश्यकता वाले कार्यों के लिए कम प्रभावी है, क्योंकि यह केवल अगले-टोकन वितरण दिखाता है। यह मॉडल की पूरी स्थिति को भी पकड़ने में विफल रहता है, क्योंकि यह उनके योगात्मक प्रभाव से परे ध्यान और फीड-फॉरवर्ड उप-परतों के योगदान को अनदेखा करता है।
तीसरा, तकनीक भ्रामक परिणाम उत्पन्न कर सकती है यदि मॉडल एक अलग आउटपुट हेड का उपयोग करता है जो अवशिष्ट स्ट्रीम के साथ संरेखित नहीं है। ऐसे मामलों में, प्रक्षेपित लॉजिट शोर या सूचनाहीन हो सकते हैं। शोधकर्ताओं ने संरेखण में सुधार के लिए प्रति-परत एफाइन परिवर्तन सीखने वाले "ट्यून्ड लेंस" जैसे वेरिएंट प्रस्तावित किए हैं, लेकिन इन्हें अतिरिक्त प्रशिक्षण डेटा की आवश्यकता होती है।
अन्य व्याख्येयता विधियों से संबंध
लॉजिट लेंस व्याख्येयता तकनीकों के एक व्यापक परिवार का हिस्सा है जिसमें प्रोबिंग क्लासिफायर, एक्टिवेशन पैचिंग और कारण ट्रेसिंग शामिल हैं। प्रोबिंग क्लासिफायर विशिष्ट विशेषताओं की भविष्यवाणी करने के लिए छिपी स्थितियों पर एक रैखिक या गैर-रेखीय मॉडल को प्रशिक्षित करते हैं, लेकिन उन्हें पर्यवेक्षण की आवश्यकता होती है और वे मॉडल की वास्तविक संगणना को प्रतिबिंबित नहीं कर सकते हैं। इसके विपरीत, लॉजिट लेंस मॉडल के स्वयं के आउटपुट हेड का उपयोग करता है, जिससे यह अधिक प्रत्यक्ष होता है।
एक्टिवेशन पैचिंग में यह देखने के लिए छिपी स्थितियों पर हस्तक्षेप करना शामिल है कि वे आउटपुट को कैसे प्रभावित करते हैं, जिसका उपयोग लॉजिट लेंस के निष्कर्षों को मान्य करने के लिए किया जा सकता है। डेविड कपलान और अन्य द्वारा लोकप्रिय कारण ट्रेसिंग, यह पहचानने के लिए भ्रष्ट रन का उपयोग करती है कि कौन सी परतें विशिष्ट तथ्यों के लिए जिम्मेदार हैं, और लॉजिट लेंस प्रत्येक परत पर भविष्यवाणी किए गए टोकन को दिखाकर इसे पूरक कर सकता है।
एक और संबंधित विधि "अवशिष्ट स्ट्रीम" दृष्टिकोण है, जो ट्रांसफॉर्मर को योगात्मक अद्यतनों की एक श्रृंखला के रूप में मानता है। लॉजिट लेंस इस दृष्टिकोण के लिए एक स्वाभाविक फिट है, क्योंकि यह प्रत्येक बिंदु पर अवशिष्ट स्ट्रीम को प्रक्षेपित करता है। इसने "ट्रांसफॉर्मर डीबगर" और अन्य विज़ुअलाइज़ेशन लाइब्रेरी जैसे उपकरणों को प्रेरित किया है।
विस्तार और वेरिएंट
लॉजिट लेंस के कई विस्तार प्रस्तावित किए गए हैं। "ट्यून्ड लेंस" मानक लॉजिट लेंस के विफल होने वाले मॉडलों पर प्रदर्शन में सुधार करने के लिए अनएम्बेडिंग के साथ छिपी स्थितियों को बेहतर ढंग से संरेखित करने के लिए एक प्रति-परत एफाइन परिवर्तन सीखता है। एक अन्य वेरिएंट "सॉफ्टमैक्स लेंस" है, जो वितरण को तेज या चपटा करने के लिए लॉजिट पर एक तापमान लागू करता है, जिससे कम-प्रायिकता भविष्यवाणियों को देखना आसान हो जाता है।
कई आउटपुट हेड या डिकोडर वाले मॉडलों के लिए, लॉजिट लेंस को प्रत्येक हेड पर अलग से लागू किया जा सकता है। एनकोडर-डिकोडर मॉडल में, तकनीक को डिकोडर की छिपी स्थितियों पर लागू किया जा सकता है, लेकिन यह स्पष्ट नहीं है कि इसे एनकोडर पर कैसे लागू किया जाए।
हाल के काम ने मल्टीमॉडल मॉडलों का विश्लेषण करने के लिए लॉजिट लेंस का उपयोग करने की भी खोज की है, जहाँ शब्दावली में छवि टोकन या अन्य मोडैलिटी शामिल हैं। हालाँकि, यह अभी भी अनुसंधान का एक सक्रिय क्षेत्र है।
संगणनात्मक विचार
लॉजिट लेंस संगणनात्मक रूप से कुशल है, क्योंकि इसे केवल एक फॉरवर्ड पास और प्रत्येक परत पर एक मैट्रिक्स गुणन की आवश्यकता होती है। \( L \) परतों और शब्दावली आकार \( V \) वाले मॉडल के लिए, अतिरिक्त लागत \( O(L \cdot V \cdot d) \) है, जहाँ \( d \) छिपा आयाम है। यह फॉरवर्ड पास की लागत की तुलना में नगण्य है।
हालाँकि, सभी परतों के लिए लॉजिट संग्रहीत करना मेमोरी-गहन हो सकता है, विशेष रूप से बड़ी शब्दावली के लिए। व्यवहार में, मेमोरी उपयोग को कम करने के लिए प्रत्येक परत पर शीर्ष-k टोकन की गणना की जा सकती है। यह तकनीक कई ओपन-सोर्स लाइब्रेरी में लागू की गई है, जिसमें TransformerLens लाइब्रेरी और हगिंग फेस व्याख्येयता उपकरण शामिल हैं।
भविष्य की दिशाएँ
जैसे-जैसे डीप लर्निंग मॉडल आकार में बढ़ते जा रहे हैं, लॉजिट लेंस जैसे व्याख्येयता उपकरण तेजी से महत्वपूर्ण होते जा रहे हैं। भविष्य का काम तकनीक को नई आर्किटेक्चर, जैसे मिश्रण-ऑफ-एक्सपर्ट्स या स्टेट-स्पेस मॉडल, के अनुकूल बनाने और इसे स्वचालित व्याख्येयता पाइपलाइनों के साथ एकीकृत करने पर केंद्रित हो सकता है। लॉजिट लेंस का उपयोग सुरक्षा अनुसंधान में यह पता लगाने के लिए भी किया जा रहा है कि मॉडल हानिकारक आउटपुट के बारे में कब "सोच" रहे हैं, जो संरेखण रणनीतियों को सूचित कर सकता है।
कुल मिलाकर, लॉजिट लेंस तंत्रिका नेटवर्क के ब्लैक बॉक्स में झांकने के लिए एक सरल फिर भी शक्तिशाली उपकरण बना हुआ है, और यांत्रिक व्याख्येयता के क्षेत्र के परिपक्व होने के साथ इसके अनुप्रयोगों के विस्तार की संभावना है।