कॉन्सेप्ट बॉटलनेक मॉडल (सीबीएम) तंत्रिका नेटवर्क वास्तुकलाओं का एक वर्ग है जो इनपुट और अंतिम भविष्यवाणी के बीच मानव-समझने योग्य अवधारणाओं की एक बॉटलनेक परत डालकर व्याख्यात्मकता में सुधार करने के लिए डिज़ाइन किया गया है। कच्चे डेटा को सीधे आउटपुट में मैप करने के बजाय, एक सीबीएम पहले पूर्वनिर्धारित अवधारणाओं (जैसे, 'पंख हैं', 'लाल है') का अनुमान लगाता है और फिर अंतिम निर्णय लेने के लिए उन अवधारणा भविष्यवाणियों का उपयोग करता है। यह डिज़ाइन उपयोगकर्ताओं को यह निरीक्षण करने की अनुमति देता है कि कौन सी अवधारणाओं ने भविष्यवाणी को प्रभावित किया और अवधारणा मूल्यों को सुधारकर हस्तक्षेप करने की सुविधा देता है, जिससे मॉडल मानक ब्लैक-बॉक्स मॉडल की तुलना में अधिक पारदर्शी और डीबग करने योग्य बन जाता है।
इस ढांचे को 2020 के एक पेपर में पैंग वेई कोह, थाओ गुयेन, येव सियांग टैंग, स्टीफन मुसमैन, ब्रैंडन यिंग और पर्सी लियांग द्वारा औपचारिक रूप दिया गया था, जिसे 34वें सम्मेलन ऑन न्यूरल इंफॉर्मेशन प्रोसेसिंग सिस्टम्स (NeurIPS 2020) में प्रस्तुत किया गया था। लेखकों ने प्रदर्शित किया कि सीबीएम छवि वर्गीकरण कार्यों पर प्रतिस्पर्धी सटीकता प्राप्त कर सकते हैं जबकि व्याख्यात्मकता लाभ प्रदान करते हैं। उन्होंने 'इंटरवेंशनेबल' सीबीएम जैसे वेरिएंट भी पेश किए, जहां एक उपयोगकर्ता यह देखने के लिए अनुमानित अवधारणाओं को ओवरराइड कर सकता है कि अंतिम भविष्यवाणी कैसे बदलती है, और 'जॉइंट' सीबीएम, जो अवधारणा और अंतिम भविष्यवक्ताओं को एक साथ प्रशिक्षित करता है।
वास्तुकला और डिज़ाइन
एक मानक सीबीएम में तीन घटक होते हैं: एक फीचर एक्सट्रैक्टर (अक्सर एक पूर्व-प्रशिक्षित ResNet या समान गहन शिक्षण बैकबोन), एक अवधारणा भविष्यवक्ता जो फीचर को अवधारणा संभावनाओं में मैप करता है, और एक अंतिम भविष्यवक्ता जो अवधारणा संभावनाओं को आउटपुट लेबल में मैप करता है। अवधारणा परत आमतौर पर एक रैखिक या छोटा बहु-परत पर्सेप्ट्रॉन होता है, और अंतिम भविष्यवक्ता अक्सर व्याख्यात्मकता बनाए रखने के लिए एक रैखिक मॉडल होता है।
कोह एट अल. ने तीन प्रशिक्षण प्रतिमानों का पता लगाया: स्वतंत्र (अवधारणा भविष्यवक्ता को पहले प्रशिक्षित करें, इसे फ्रीज करें, फिर अंतिम भविष्यवक्ता को प्रशिक्षित करें), अनुक्रमिक (अवधारणा भविष्यवक्ता को प्रशिक्षित करें, फिर अवधारणा लेबल के साथ अंतिम भविष्यवक्ता को प्रशिक्षित करें), और संयुक्त (दोनों को भारित हानि के साथ एक साथ प्रशिक्षित करें)। CUB-200-2011 पक्षी डेटासेट (312 अवधारणाओं के साथ) और SUN विशेषता डेटासेट (102 विशेषताओं के साथ) पर उनके प्रयोगों से पता चला कि स्वतंत्र सीबीएम की सटीकता मानक मॉडल से कम थी, लेकिन संयुक्त प्रशिक्षण ने अंतर को काफी हद तक कम कर दिया। उदाहरण के लिए, CUB पर, एक मानक ResNet-18 ने लगभग 75% सटीकता हासिल की, जबकि एक संयुक्त सीबीएम ने लगभग 72% और एक स्वतंत्र सीबीएम ने लगभग 66% हासिल की।
व्याख्यात्मकता और हस्तक्षेप
सीबीएम की एक प्रमुख विशेषता हस्तक्षेप करने की क्षमता है: यदि मॉडल किसी अवधारणा की गलत भविष्यवाणी करता है (जैसे, 'पंख का रंग: भूरा' जब पक्षी वास्तव में नीला है), तो एक उपयोगकर्ता उस अवधारणा को सुधार सकता है और अंतिम भविष्यवक्ता को फिर से चला सकता है। कोह एट अल. ने दिखाया कि गलत भविष्यवाणी की गई अवधारणा पर एक भी हस्तक्षेप सटीकता में काफी सुधार कर सकता है। CUB पर, प्रति छवि केवल एक अवधारणा पर हस्तक्षेप करने से स्वतंत्र मॉडल में सटीकता 66% से बढ़कर 90% से अधिक हो गई, और संयुक्त मॉडल में भी समान लाभ देखे गए। यह सीबीएम को उच्च-दांव वाले डोमेन में उपयोगी बनाता है जहां मानव निरीक्षण मूल्यवान है।
हस्तक्षेप तंत्र डीबगिंग को भी सक्षम बनाता है: यह निरीक्षण करके कि कौन सी अवधारणाएं अक्सर गलत भविष्यवाणी की जाती हैं, डेवलपर्स फीचर एक्सट्रैक्टर या अवधारणा परिभाषाओं में कमजोरियों की पहचान कर सकते हैं। हालांकि, हस्तक्षेप की गुणवत्ता अवधारणा सेट के व्यापक और सटीक रूप से एनोटेट होने पर निर्भर करती है, जो एक प्रमुख व्यावहारिक सीमा है।
विस्तार और वेरिएंट
2020 के बाद से कई विस्तार प्रस्तावित किए गए हैं। 'लेबल-विशिष्ट अवधारणाओं वाले कॉन्सेप्ट बॉटलनेक मॉडल' (2021) रीगर एट अल. द्वारा अवधारणाओं को वर्गों में साझा करने की अनुमति देता है, जिससे एनोटेशन बोझ कम हो जाता है। 'पोस्ट-हॉक कॉन्सेप्ट बॉटलनेक मॉडल' (2021) युकारा इकामी एट अल. द्वारा और बाद में वोंग एट अल. (2021) के काम ने एक अवधारणा खोज चरण का उपयोग करके पूर्व-प्रशिक्षित ब्लैक-बॉक्स मॉडल को खरोंच से पुनः प्रशिक्षण के बिना सीबीएम में परिवर्तित करने के तरीके पेश किए। काम की एक और पंक्ति, 'कॉन्सेप्ट एम्बेडिंग मॉडल' (2021) ज़ारलेंगा एट अल. द्वारा, निरंतर अवधारणा एम्बेडिंग का उपयोग करके बाइनरी अवधारणा धारणा को शिथिल किया, जिससे अभिव्यक्ति क्षमता में सुधार हुआ।
2023 में, 'इंटरैक्टिव कॉन्सेप्ट बॉटलनेक मॉडल' कॉलिन्स एट अल. द्वारा अनुमान के दौरान उपयोगकर्ताओं को अवधारणा स्पष्टीकरण के लिए मॉडल से पूछताछ करने के लिए एक तंत्र जोड़ा गया, और 'कॉन्सेप्ट इरेज़र के साथ कॉन्सेप्ट बॉटलनेक मॉडल' (2023) किम एट अल. द्वारा अवधारणा रिसाव के मुद्दे को संबोधित किया, जहां अंतिम भविष्यवक्ता अवधारणाओं द्वारा कैप्चर नहीं की गई जानकारी पर भरोसा कर सकता है। इन विस्तारों का मूल्यांकन CUB, SUN और सिंथेटिक dSprites डेटासेट जैसे डेटासेट पर किया गया है, जिसमें सटीकता और व्याख्यात्मकता के बीच अलग-अलग व्यापार-बंद हैं।
अनुप्रयोग
सीबीएम को चिकित्सा इमेजिंग में लागू किया गया है, जहां व्याख्यात्मकता महत्वपूर्ण है। उदाहरण के लिए, ग्राज़ियानी एट अल. द्वारा 2022 के एक अध्ययन ने त्वचा घाव वर्गीकरण के लिए सीबीएम का उपयोग किया, जिसमें ABCD नियम से 'विषमता' और 'सीमा अनियमितता' जैसी अवधारणाओं को परिभाषित किया गया, जिससे ISIC 2018 डेटासेट पर 0.91 का AUC प्राप्त हुआ, जो एक ब्लैक-बॉक्स बेसलाइन (0.93) के बराबर है लेकिन भविष्यवाणियों को समझाने की अतिरिक्त क्षमता के साथ। रेडियोलॉजी में, सीबीएम का उपयोग छाती एक्स-रे निदान के लिए किया गया है, जिसमें 'कार्डियोमेगाली' और 'इफ्यूजन' जैसी अवधारणाएं शामिल हैं, जैसा कि चेन एट अल. द्वारा 2021 के एक पेपर में CheXpert डेटासेट पर प्रदर्शित किया गया था, जहां हस्तक्षेप ने सटीकता में 0.82 से 0.87 तक सुधार किया।
स्वायत्त ड्राइविंग में, ड्राइवर व्यवहार की भविष्यवाणी या यातायात दृश्य समझ के लिए सीबीएम का पता लगाया गया है। झांग एट अल. द्वारा 2023 के एक पेपर ने 'क्रॉसिंग' और 'देखना' जैसी अवधारणाओं के साथ पैदल यात्री पहचान के लिए सीबीएम का उपयोग किया, जिससे एक कस्टम डेटासेट पर 95% सटीकता प्राप्त हुई, जबकि गलत वर्गीकृत अवधारणाओं के मानव सुधार की अनुमति दी गई। वित्त में, क्रेडिट स्कोरिंग के लिए सीबीएम प्रस्तावित किए गए हैं, जहां 'आय स्थिरता' और 'ऋण अनुपात' जैसी अवधारणाओं का उपयोग किया जाता है, हालांकि नियामक और डेटा चुनौतियों के कारण अपनाना सीमित है।
सीमाएं और चुनौतियां
प्राथमिक सीमा अवधारणा एनोटेशन की आवश्यकता है, जो प्राप्त करना महंगा है। बड़े पैमाने पर डेटासेट के लिए, एक पूर्ण और गैर-अतिव्यापी अवधारणा सेट को परिभाषित करना कठिन है। सीबीएम जटिल कार्यों पर ब्लैक-बॉक्स मॉडल से कम प्रदर्शन करते हैं, क्योंकि अवधारणा बॉटलनेक सूचना प्रवाह को प्रतिबंधित करता है। उदाहरण के लिए, ImageNet पर, 1000 अवधारणाओं (प्रति वर्ग एक) वाले एक सीबीएम ने केवल 55% शीर्ष-1 सटीकता हासिल की, जबकि एक मानक ResNet-50 के लिए 76% की तुलना में, जैसा कि कोह एट अल. के अनुवर्ती कार्य में 2021 के एक अध्ययन में बताया गया था।
एक और मुद्दा अवधारणा रिसाव है: अंतिम भविष्यवक्ता अनजाने में अवधारणा संभावनाओं में सहसंबंधों का उपयोग कर सकता है जो शब्दार्थ रूप से सार्थक नहीं हैं, जिससे व्याख्यात्मकता कम हो जाती है। शोधकर्ताओं ने इसे कम करने के लिए अवधारणा एम्बेडिंग पर ऑर्थोगोनैलिटी बाधाओं जैसी नियमितीकरण तकनीकों का प्रस्ताव किया है। इसके अतिरिक्त, सीबीएम मानते हैं कि अवधारणाएं स्वतंत्र हैं, लेकिन वास्तविक दुनिया की अवधारणाएं अक्सर सहसंबद्ध होती हैं (जैसे, 'पंख हैं' और 'उड़ सकते हैं'), जिससे अनावश्यक या परस्पर विरोधी भविष्यवाणियां हो सकती हैं।
अन्य व्याख्यात्मकता विधियों से संबंध
सीबीएम व्याख्यात्मक मॉडल के व्यापक परिवार का हिस्सा हैं, जिसमें निर्णय वृक्ष, नियम-आधारित प्रणाली और ध्यान-आधारित स्पष्टीकरण शामिल हैं। सैलिएंसी मैप या LIME जैसी पोस्ट-हॉक विधियों के विपरीत, जो प्रशिक्षण के बाद एक ब्लैक-बॉक्स मॉडल की व्याख्या करते हैं, सीबीएम डिज़ाइन द्वारा स्वाभाविक रूप से व्याख्या योग्य हैं। वे ध्यान तंत्र से ट्रांसफॉर्मर में संबंधित हैं, जो कुछ व्याख्यात्मकता भी प्रदान करते हैं, लेकिन ध्यान भार अक्सर शोरगुल वाले होते हैं और सीधे कार्रवाई योग्य नहीं होते हैं। सीबीएम मॉडल प्रूनिंग से भी जुड़े हुए हैं क्योंकि दोनों का उद्देश्य मॉडल को सरल बनाना है, लेकिन प्रूनिंग आकार कम करता है जबकि सीबीएम अस्पष्टता कम करते हैं।
हाल के काम ने सीबीएम को बड़े भाषा मॉडल (एलएलएम) के साथ जोड़ा है। उदाहरण के लिए, ओइकारिनन एट अल. द्वारा 2023 के एक पेपर ने डेटासेट के लिए अवधारणा उम्मीदवारों को स्वचालित रूप से उत्पन्न करने के लिए GPT-3 का उपयोग किया, जिससे मानव एनोटेशन की आवश्यकता कम हो गई। यांग एट अल. द्वारा 2024 के एक अन्य अध्ययन ने अवधारणा परिभाषाओं को पुनरावृत्त रूप से परिष्कृत करने के लिए एक एलएलएम का उपयोग किया, जिससे एक निश्चित अवधारणा सेट पर CUB पर सीबीएम सटीकता में 3% सुधार हुआ। ये हाइब्रिड दृष्टिकोण अनुसंधान का एक सक्रिय क्षेत्र हैं, खासकर जब जनरेटिव एआई मॉडल अधिक सक्षम हो जाते हैं।
भविष्य की दिशाएं
भविष्य का शोध सीबीएम को बड़े डेटासेट और अधिक जटिल कार्यों, जैसे वीडियो समझ और मल्टी-मॉडल इनपुट तक स्केल करने पर केंद्रित है। डेटा से स्वचालित रूप से अवधारणाओं को सीखने पर भी काम चल रहा है, अनुपयोगी या स्व-पर्यवेक्षित विधियों का उपयोग करके, हालांकि ये अवधारणाएं मानव शब्दार्थ के साथ संरेखित नहीं हो सकती हैं। एक और दिशा अनुक्रमिक निर्णय लेने के लिए सुदृढीकरण सीखने के साथ सीबीएम को एकीकृत करना है, जहां रोबोटिक्स और गेम खेलने में व्याख्यात्मकता मदद कर सकती है।
2025 तक, सीबीएम एक विशिष्ट लेकिन प्रभावशाली दृष्टिकोण बना हुआ है, जिसे 2,000 से अधिक पेपरों में उद्धृत किया गया है। वे विशेष रूप से उन डोमेन में मूल्यवान हैं जहां नियामक आवश्यकताएं व्याख्या को अनिवार्य करती हैं, जैसे स्वास्थ्य देखभाल और वित्त। हालांकि, उनका अपनाना एनोटेशन लागत और सटीकता अंतर से सीमित है, और यह देखा जाना बाकी है कि क्या उन्हें स्केलेबल और प्रतिस्पर्धी पर्याप्त बनाया जा सकता है।