प्रोबिंग क्लासिफायर सरल रैखिक मॉडल हैं जो एक तंत्रिका नेटवर्क के आंतरिक प्रतिनिधित्व पर प्रशिक्षित होते हैं, यह निर्धारित करने के लिए कि क्या विशिष्ट जानकारी उन प्रतिनिधित्वों में एन्कोडेड है। मूल विचार यह है कि यदि एक रैखिक क्लासिफायर किसी नेटवर्क परत की सक्रियताओं से किसी विशेष गुण (जैसे शब्द-भेद, भावना, या तथ्यात्मक ज्ञान) की सफलतापूर्वक भविष्यवाणी कर सकता है, तो वह जानकारी संभवतः उस परत पर रैखिक रूप से अलग करने योग्य रूप में मौजूद और सुलभ है। यह तकनीक Artificial intelligence और Machine learning में व्याख्यात्मकता अनुसंधान की आधारशिला है, जो Deep learning मॉडलों की अन्यथा अपारदर्शी गणनाओं में एक खिड़की प्रदान करती है।
यह विधि अधिक जटिल, गैर-रैखिक प्रोबों के विपरीत है। प्रोब को एक रैखिक फलन तक सीमित करके, शोधकर्ताओं का लक्ष्य उस जानकारी को मापना है जो सीधे और रैखिक रूप से उपलब्ध है, न कि उस जानकारी को जो केवल जटिल गैर-रैखिक परिवर्तनों के माध्यम से निकाली जा सकती है। यह अंतर यह समझने के लिए महत्वपूर्ण है कि एक मॉडल आंतरिक रूप से ज्ञान का प्रतिनिधित्व कैसे करता है, बनाम एक शक्तिशाली डिकोडर सैद्धांतिक रूप से क्या निकाल सकता है। प्रोबिंग क्लासिफायर व्यापक रूप से Neural network मॉडलों पर लागू होते हैं, जिनमें Transformer (architecture)-आधारित Large language model शामिल हैं, उनकी भाषाई और तथ्यात्मक क्षमताओं की जांच करने के लिए।
ऐतिहासिक विकास
प्रोबिंग क्लासिफायर की अवधारणा 2010 के दशक के मध्य में तंत्रिका नेटवर्क विश्लेषण के व्यापक क्षेत्र से उभरी। सबसे शुरुआती प्रभावशाली कार्यों में से एक University of Toronto और अन्य संस्थानों के शोधकर्ताओं द्वारा किया गया था, जिन्होंने 2016 में भाषा मॉडलिंग के लिए आवर्ती तंत्रिका नेटवर्क द्वारा सीखे गए प्रतिनिधित्व का विश्लेषण करने के लिए रैखिक क्लासिफायर का उपयोग किया। उन्होंने प्रदर्शित किया कि ये नेटवर्क वाक्यात्मक और अर्थ संबंधी जानकारी को रैखिक रूप से अलग करने योग्य तरीके से एन्कोड करते हैं, एक निष्कर्ष जिसने तकनीक में व्यापक रुचि पैदा की।
2017 और 2018 में बाद के कार्य, विशेष रूप से Carnegie Mellon University और MIT CSAIL के समूहों से, ने पद्धति का विस्तार किया। शोधकर्ताओं ने मानकीकृत प्रोबिंग कार्य विकसित किए, जैसे शब्द-भेद टैग, नामित संस्थाओं, और यहां तक कि वाक्य की लंबाई की भविष्यवाणी करना, यह व्यवस्थित रूप से मूल्यांकन करने के लिए कि नेटवर्क की विभिन्न परतें क्या एन्कोड करती हैं। इन अध्ययनों में अक्सर पाया गया कि निचली परतें अधिक सतही विशेषताओं को पकड़ती हैं, जबकि उच्च परतें अधिक अमूर्त और कार्य-विशिष्ट जानकारी एन्कोड करती हैं।
पद्धति और डिजाइन
मानक प्रोबिंग प्रक्रिया में कई चरण शामिल हैं। पहले, एक पूर्व-प्रशिक्षित तंत्रिका नेटवर्क का चयन किया जाता है, और इनपुट उदाहरणों के एक सेट के लिए इसकी सक्रियताएं दर्ज की जाती हैं। ये सक्रियताएं आमतौर पर एक विशिष्ट परत या परतों के सेट से निकाली जाती हैं। दूसरे, एक रैखिक क्लासिफायर - अक्सर लॉजिस्टिक रिग्रेशन या एकल-परत परसेप्ट्रॉन - इन सक्रियताओं पर एक लक्ष्य लेबल की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है। लक्ष्य लेबल एक बाहरी डेटासेट से आते हैं, जैसे व्याकरणिक टैग के साथ एनोटेटेड एक कॉर्पस या ज्ञात उत्तरों के साथ प्रश्नों का एक सेट।
प्रोब डिजाइन का एक महत्वपूर्ण पहलू नियंत्रण कार्य का चयन है। यह सुनिश्चित करने के लिए कि एक प्रोब केवल तुच्छ सांख्यिकीय नियमितताओं का शोषण नहीं कर रहा है, शोधकर्ता अक्सर एक नियंत्रण डेटासेट पर एक प्रोब प्रशिक्षित करते हैं जहां लेबल बेतरतीब ढंग से फेरबदल किए गए हैं। यदि प्रोब नियंत्रण पर मौके से बेहतर प्रदर्शन नहीं करता है, तो यह सुझाव देता है कि मूल प्रदर्शन लक्ष्य जानकारी के वास्तविक एन्कोडिंग के कारण है। एक और सामान्य नियंत्रण नेटवर्क द्वारा सीखे गए प्रतिनिधित्व के साथ तुलना करने के लिए सीधे इनपुट एम्बेडिंग (जैसे, शब्द वैक्टर) पर एक प्रोब प्रशिक्षित करना है।
रैखिकता बाधा वह है जो प्रोबिंग को अन्य व्याख्यात्मकता विधियों से अलग करती है। एक रैखिक प्रोब का रूप \( f(x) = Wx + b \) होता है, जहां \( x \) प्रतिनिधित्व वेक्टर है, \( W \) एक भार मैट्रिक्स है, और \( b \) एक पूर्वाग्रह पद है। प्रशिक्षण उद्देश्य आमतौर पर वर्गीकरण कार्यों के लिए क्रॉस-एन्ट्रॉपी हानि को कम करना है। इस मॉडल की सरलता का मतलब है कि इसकी सफलता का तात्पर्य है कि प्रतिनिधित्व स्वयं इस तरह से व्यवस्थित है कि लक्ष्य वर्गों को हाइपरप्लेन द्वारा अलग किया जाता है।
भाषा मॉडलों में अनुप्रयोग
प्रोबिंग क्लासिफायर Large language model का विश्लेषण करने के लिए एक मानक उपकरण बन गए हैं। उदाहरण के लिए, शोधकर्ताओं ने प्रोबों का उपयोग यह दिखाने के लिए किया है कि GPT-2 और BERT जैसे मॉडल अपनी मध्यवर्ती परतों में विषय-क्रिया समझौते, सहसंदर्भ, और यहां तक कि विश्व ज्ञान के बारे में जानकारी एन्कोड करते हैं। 2019 में एक उल्लेखनीय अध्ययन में पाया गया कि एक रैखिक प्रोब एक ट्रांसफार्मर की मध्य परतों की सक्रियताओं से उच्च सटीकता के साथ भविष्यवाणी कर सकता है कि एक वाक्य व्याकरणिक था या नहीं, यह सुझाव देते हुए कि ये मॉडल अंतर्निहित रूप से व्याकरणिक नियम सीखते हैं।
तथ्यात्मक ज्ञान के संदर्भ में, प्रोबों का उपयोग यह जांचने के लिए किया गया है कि मॉडल नेटवर्क में विशिष्ट तथ्यों को कहां संग्रहीत करता है। उदाहरण के लिए, Anthropic और Google DeepMind के शोधकर्ताओं द्वारा 2022 का एक अध्ययन किसी देश की राजधानी या किसी पुस्तक के लेखक को एन्कोड करने के लिए जिम्मेदार परतों का पता लगाने के लिए प्रोबिंग क्लासिफायर का उपयोग किया। अनुसंधान की यह पंक्ति मॉडल संपादन और व्याख्यात्मकता के लिए निहितार्थ रखती है, क्योंकि यह पूर्ण पुनर्प्रशिक्षण के बिना मॉडल के ज्ञान में लक्षित संशोधनों की अनुमति दे सकती है।
प्रोबिंग बहुभाषी मॉडलों पर भी लागू किया गया है। शोधकर्ताओं ने mBERT जैसे मॉडलों से प्रतिनिधित्व पर रैखिक प्रोबों को प्रशिक्षित किया है ताकि यह दिखाया जा सके कि वाक्यात्मक संरचनाएं विभिन्न भाषाओं में भाषा-अज्ञेय तरीके से एन्कोडेड हैं। यह निष्कर्ष इस विचार का समर्थन करता है कि बहुभाषी ट्रांसफार्मर एक साझा अमूर्त प्रतिनिधित्व स्थान विकसित करते हैं, जो क्रॉस-भाषाई स्थानांतरण सीखने के लिए एक महत्वपूर्ण अंतर्दृष्टि है।
सीमाएं और आलोचनाएं
यह पद्धति आलोचकों के बिना नहीं है। एक प्रमुख चिंता यह है कि एक रैखिक प्रोब की सफलता का जरूरी मतलब यह नहीं है कि नेटवर्क अपने प्राथमिक कार्य के लिए उस जानकारी का उपयोग करता है। जानकारी मौजूद हो सकती है लेकिन उपयोग नहीं की जा सकती है, या यह अन्य गणनाओं का उप-उत्पाद हो सकती है। इसे संबोधित करने के लिए, शोधकर्ताओं ने कारणात्मक प्रोबिंग विधियों को विकसित किया है, जिसमें नेटवर्क की सक्रियताओं पर हस्तक्षेप करना शामिल है ताकि यह देखा जा सके कि प्रोब की भविष्यवाणियां मॉडल के आउटपुट को प्रभावित करती हैं या नहीं। हालांकि, ये विधियां अधिक जटिल और कम सामान्य रूप से उपयोग की जाती हैं।
एक और सीमा प्रोब ओवरफिटिंग का जोखिम है। यदि प्रोब बहुत जटिल है या बहुत कम उदाहरणों पर प्रशिक्षित है, तो यह वास्तविक संरचना का पता लगाने के बजाय शोर को याद कर सकता है। यही कारण है कि रैखिक प्रोबों को प्राथमिकता दी जाती है, क्योंकि उनके पास कम पैरामीटर होते हैं और ओवरफिटिंग की संभावना कम होती है। हालांकि, यहां तक कि रैखिक प्रोब भी भ्रामक हो सकते हैं यदि प्रतिनिधित्व स्थान उच्च-आयामी है और प्रशिक्षण डेटा विरल है।
एक संबंधित आलोचना, Aleksander Madry और सहयोगियों जैसे शोधकर्ताओं द्वारा व्यक्त की गई, यह है कि प्रोब बहुत आसान हो सकते हैं - वे रैखिक अलगाव पा सकते हैं जो प्रतिनिधित्व की ज्यामिति का एक कलाकृति है, न कि एक सार्थक अर्थ संबंधी विशेषता। उदाहरण के लिए, एक प्रोब लेबल के साथ सहसंबंधित एक प्रमुख आयाम के आधार पर दो वर्गों के बीच अंतर कर सकता है, बिना अवधारणा की सूक्ष्म संरचना को पकड़े। इससे न्यूनतम विवरण लंबाई प्रोबों का विकास हुआ है, जो एक अधिक सैद्धांतिक तरीके से एक प्रोब द्वारा निकाली गई जानकारी की मात्रा को मापते हैं।
अन्य व्याख्यात्मकता विधियों से संबंध
प्रोबिंग क्लासिफायर तंत्रिका नेटवर्क व्याख्यात्मकता के लिए एक व्यापक टूलकिट का हिस्सा हैं। उनकी तुलना अक्सर सक्रियण अधिकतमकरण से की जाती है, जो उन इनपुटों को खोजने की कोशिश करता है जो किसी विशेष न्यूरॉन या परत को अधिकतम रूप से सक्रिय करते हैं, और विशेषता विज़ुअलाइज़ेशन से, जो छवियों को उत्पन्न करता है जो दर्शाता है कि नेटवर्क क्या खोज रहा है। इन विधियों के विपरीत, जो मुख्य रूप से Computer vision मॉडलों के लिए उपयोग की जाती हैं, प्रोबिंग अधिक सामान्य है और पाठ, ऑडियो, और ग्राफ डेटा पर सफलतापूर्वक लागू की गई है।
एक और संबंधित दृष्टिकोण रैखिक रीडआउट है, जो अनिवार्य रूप से एक प्रोबिंग क्लासिफायर के समान है लेकिन कभी-कभी सुदृढीकरण सीखने या नियंत्रण कार्यों के संदर्भ में उपयोग किया जाता है। इन सेटिंग्स में, एक रैखिक रीडआउट का उपयोग एजेंट के आंतरिक प्रतिनिधित्व से उसकी स्थिति को डिकोड करने के लिए किया जा सकता है, जो इस बात की अंतर्दृष्टि प्रदान करता है कि एजेंट ने अपने पर्यावरण के बारे में क्या सीखा है।
प्रोबिंग प्रतिनिधित्व सीखने सिद्धांत के साथ भी प्रतिच्छेद करता है। एक रैखिक प्रोब की सफलता को अक्सर इस बात के प्रमाण के रूप में व्याख्या किया जाता है कि प्रतिनिधित्व लक्ष्य कार्य के लिए रैखिक रूप से अलग करने योग्य है, जो डाउनस्ट्रीम कार्यों के लिए एक वांछनीय गुण है। इसने प्रशिक्षण उद्देश्यों में अनुसंधान को प्रेरित किया है जो रैखिक अलगाव को प्रोत्साहित करते हैं, जैसे कि कंट्रास्टिव लर्निंग और कुछ प्रकार के ऑटोएन्कोडर।
हालिया प्रगति और भविष्य की दिशाएं
हाल के काम ने प्रोबिंग को अधिक मजबूत और व्याख्या योग्य बनाने पर ध्यान केंद्रित किया है। एक दिशा पुनरावृत्त शून्य-स्थान प्रक्षेपण है, जो उस जानकारी को हटा देता है जो एक प्रोब पहले ही निकाल चुका है, जिससे शोधकर्ताओं को एक ही प्रतिनिधित्व में कई स्वतंत्र विशेषताओं को खोजने की अनुमति मिलती है। 2021 में पेश की गई यह विधि, यह प्रकट कर सकती है कि एक एकल परत ऑर्थोगोनल उप-स्थानों में कई अलग-अलग अवधारणाओं को एन्कोड करती है।
एक और प्रगति यांत्रिक व्याख्यात्मकता के संदर्भ में प्रोबिंग का उपयोग है। OpenAI और अन्य प्रयोगशालाओं के शोधकर्ताओं ने विशिष्ट सर्किट - न्यूरॉन्स के समूह जो एक विशेष कार्य करते हैं - की पहचान करने के लिए रैखिक प्रोबों का उपयोग किया है। प्रोबिंग को कारणात्मक हस्तक्षेपों के साथ जोड़कर, वे यह मैप करने में सक्षम हैं कि जानकारी एक ट्रांसफार्मर के माध्यम से कैसे बहती है, उदाहरण के लिए, एक अनुक्रम में अगला टोकन की गणना करने के लिए।
यह क्षेत्र गतिशील प्रोबिंग की ओर भी बढ़ रहा है, जहां प्रोब को विभिन्न समय चरणों पर या इनपुट के विभिन्न हिस्सों (जैसे, एक वाक्य में व्यक्तिगत टोकन) पर लागू किया जाता है। यह अधिक सूक्ष्म विश्लेषण की अनुमति देता है कि समय के साथ जानकारी कैसे संसाधित होती है। उदाहरण के लिए, एक प्रोब दिखा सकता है कि एक मॉडल शुरुआत में एक वाक्य के विषय को एन्कोड करता है, लेकिन केवल बाद में क्रिया के काल को शामिल करता है।
जैसे-जैसे Large language model आकार और क्षमता में बढ़ते जा रहे हैं, प्रोबिंग क्लासिफायर उनकी सुरक्षा और विश्वसनीयता सुनिश्चित करने के लिए एक आवश्यक उपकरण बने हुए हैं। यह समझकर कि ये मॉडल क्या जानते हैं और वे इसका प्रतिनिधित्व कैसे करते हैं, शोधकर्ता पूर्वाग्रहों, तथ्यात्मक त्रुटियों, और संभावित विफलता मोड का बेहतर पता लगा सकते हैं। यह तकनीक आने वाले वर्षों के लिए व्याख्यात्मकता टूलबॉक्स में एक मानक विधि बने रहने की संभावना है।
व्यावहारिक विचार
प्रोबिंग क्लासिफायर लागू करते समय, कई व्यावहारिक विवरण मायने रखते हैं। परत का चयन महत्वपूर्ण है: हर परत की प्रोबिंग कम्प्यूटेशनल रूप से महंगी हो सकती है, इसलिए शोधकर्ता अक्सर एक उपसमुच्चय का नमूना लेते हैं या मॉडल की वास्तुकला के आधार पर अनुमानों का उपयोग करते हैं। प्रोब के लिए प्रशिक्षण सेट का आकार भी मायने रखता है; आमतौर पर, विश्वसनीय परिणाम प्राप्त करने के लिए हजारों उदाहरणों की आवश्यकता होती है, लेकिन यह वर्गों की संख्या और प्रतिनिधित्व की आयामीता पर निर्भर करता है।
एक और विचार प्रतिनिधित्व का सामान्यीकरण है। कुछ शोधकर्ता प्रोब को प्रशिक्षित करने से पहले सक्रियताओं को सामान्यीकृत करते हैं (जैसे, परत सामान्यीकरण का उपयोग करके), जो प्रदर्शन और स्थिरता में सुधार कर सकता है। अन्य कच्ची सक्रियताओं का उपयोग करते हैं, यह तर्क देते हुए कि सामान्यीकरण उपयोगी जानकारी को हटा सकता है। चुनाव अक्सर विशिष्ट मॉडल और कार्य पर निर्भर करता है।
अंत में, उचित आधार रेखाओं के साथ प्रोब प्रदर्शन की रिपोर्ट करना महत्वपूर्ण है। एक सामान्य आधार रेखा बहुमत-वर्ग क्लासिफायर है, जो हमेशा सबसे लगातार लेबल की भविष्यवाणी करता है। एक और बेतरतीब ढंग से क्रमबद्ध लेबल पर प्रशिक्षित एक प्रोब है, जैसा कि पहले उल्लेख किया गया है। इन आधार रेखाओं के बिना, प्रोब की पूर्ण सटीकता की व्याख्या करना मुश्किल है। क्षेत्र ने सर्वोत्तम प्रथाओं के एक सेट पर अभिसरण किया है, लेकिन प्रोबिंग परिणामों से निष्कर्ष निकालने के सबसे कठोर तरीके के बारे में अभी भी चल रही बहस है।