फुली कन्वोल्यूशनल नेटवर्क (FCN) गहन-अधिगम आर्किटेक्चर का एक वर्ग है जो सिमेंटिक सेगमेंटेशन के लिए डिज़ाइन किया गया है, जो किसी छवि के हर पिक्सेल को एक वर्ग लेबल निर्दिष्ट करने का कार्य है। पारंपरिक वर्गीकरण नेटवर्क के विपरीत, जो पूरी छवि के लिए एक एकल लेबल आउटपुट करते हैं, FCN इनपुट के समान स्थानिक आयामों का एक सघन आउटपुट मानचित्र उत्पन्न करते हैं, जिससे पिक्सेल-स्तरीय समझ संभव होती है। 2015 में कैलिफोर्निया विश्वविद्यालय, बर्कले में जोनाथन लॉन्ग, इवान शेलहैमर और ट्रेवर डैरेल द्वारा पेश किए गए, FCN आधुनिक कंप्यूटर विज़न में एक मौलिक योगदान थे, जिन्होंने यू-नेट जैसी बाद की आर्किटेक्चर और कई अन्य को प्रभावित किया।
FCN की प्रमुख नवीनता पूरी तरह से जुड़ी परतों का प्रतिस्थापन है, जो आमतौर पर AlexNet या VGG जैसे वर्गीकरण नेटवर्क में उपयोग की जाती हैं, कन्वोल्यूशनल परतों के साथ। यह नेटवर्क को मनमाने आकार के इनपुट स्वीकार करने और निश्चित-लंबाई वाले वैक्टर के बजाय स्थानिक मानचित्र आउटपुट करने की अनुमति देता है। आर्किटेक्चर में आमतौर पर एक डाउनसैंपलिंग पथ (एनकोडर) होता है जो विशेषताओं को निकालता है, उसके बाद एक अपसैंपलिंग पथ (डिकोडर) होता है जो स्थानिक रिज़ॉल्यूशन को पुनर्स्थापित करता है। अपसैंपलिंग अक्सर ट्रांसपोज़्ड कन्वोल्यूशन (जिसे डीकन्वोल्यूशन भी कहा जाता है) या बाइलिनियर इंटरपोलेशन का उपयोग करके किया जाता है, और सीमाओं को परिष्कृत करने के लिए स्किप कनेक्शन जोड़े जा सकते हैं।
आर्किटेक्चर और डिज़ाइन
एक FCN एक आधार वर्गीकरण नेटवर्क पर बनाया गया है, जैसे VGG-16 या रेसनेट, जिसकी पूरी तरह से जुड़ी परतें 1x1 कन्वोल्यूशन में परिवर्तित हो जाती हैं। फिर नेटवर्क फीचर मैप्स को इनपुट रिज़ॉल्यूशन पर वापस अपसैंपल करने के लिए ट्रांसपोज़्ड कन्वोल्यूशन परतों की एक श्रृंखला का उपयोग करता है। मूल FCN पेपर ने तीन प्रकार पेश किए: FCN-32s, FCN-16s, और FCN-8s, जो मोटे, उच्च-स्तरीय विशेषताओं को बारीक, निम्न-स्तरीय विशेषताओं के साथ संयोजित करने के लिए उपयोग किए जाने वाले स्किप कनेक्शन की संख्या में भिन्न हैं। FCN-8s, जो पहले की परतों से भविष्यवाणियां जोड़ता है, ने तीनों में सबसे अच्छी सेगमेंटेशन सटीकता हासिल की।
FCN को प्रशिक्षित करने के लिए एक पिक्सेल-वार हानि फ़ंक्शन की आवश्यकता होती है, आमतौर पर क्रॉस-एंट्रॉपी, और मानक अनुकूलन तकनीकों जैसे स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग गति के साथ करता है। लेखकों ने अभिसरण और सामान्यीकरण में सुधार के लिए बैच नॉर्मलाइज़ेशन और ड्रॉपआउट जैसी तकनीकों का भी उपयोग किया।
अनुप्रयोग और प्रभाव
FCN को सिमेंटिक सेगमेंटेशन से परे कई कार्यों पर लागू किया गया है, जिसमें चिकित्सा छवि विश्लेषण, स्वायत्त ड्राइविंग और रिमोट सेंसिंग शामिल हैं। चिकित्सा इमेजिंग में, FCN का उपयोग CT और MRI स्कैन में अंगों या ट्यूमर को सेगमेंट करने के लिए किया जाता है, जो अक्सर U-Net जैसे अधिक उन्नत मॉडल के आधार के रूप में कार्य करता है। स्वायत्त ड्राइविंग में, FCN कैमरा फ़ीड से सड़क की सीमाओं, पैदल चलने वालों और वाहनों की पहचान करने में मदद करते हैं, जो वेमो और टेस्ला ऑटोपायलट जैसी कंपनियों द्वारा विकसित प्रणालियों में योगदान करते हैं।
FCN का प्रभाव कृत्रिम बुद्धिमत्ता के व्यापक क्षेत्र तक फैला हुआ है, क्योंकि उन्होंने प्रदर्शित किया कि कन्वोल्यूशनल नेटवर्क को अलग पोस्ट-प्रोसेसिंग चरणों की आवश्यकता के बिना सघन भविष्यवाणी कार्यों के लिए अंत-से-अंत प्रशिक्षित किया जा सकता है। इस प्रतिमान बदलाव ने बाद की आर्किटेक्चर, जिसमें एनकोडर-डिकोडर मॉडल और ध्यान-आधारित दृष्टिकोण शामिल हैं, को प्रभावित किया।
सीमाएं और विकास
उनकी सफलता के बावजूद, FCN की सीमाएं हैं। वे डाउनसैंपलिंग के दौरान स्थानिक विवरण के नुकसान के कारण मोटे सेगमेंटेशन मानचित्र उत्पन्न कर सकते हैं, और छोटी वस्तुओं या पतली संरचनाओं के साथ संघर्ष कर सकते हैं। ट्रांसपोज़्ड कन्वोल्यूशन का उपयोग चेकरबोर्ड कलाकृतियों को भी पेश कर सकता है। इन मुद्दों ने अधिक परिष्कृत आर्किटेक्चर के विकास को प्रेरित किया, जैसे कि इसके व्यापक स्किप कनेक्शन के साथ U-Net, और बाद में मल्टी-हेड अटेंशन तंत्र को शामिल करने वाले मॉडल।
आधुनिक सिमेंटिक सेगमेंटेशन मॉडल अक्सर FCN-शैली एनकोडर को ट्रांसफॉर्मर डिकोडर के साथ जोड़ते हैं, जैसा कि SegFormer जैसे मॉडल में देखा गया है, जो लंबी दूरी की निर्भरता को पकड़ने के लिए स्थितीय एनकोडिंग और क्रॉस-अटेंशन का लाभ उठाते हैं। फिर भी, FCN कंप्यूटर विज़न पाठ्यक्रमों में पढ़ाई जाने वाली एक मौलिक अवधारणा और नए तरीकों का मूल्यांकन करने के लिए एक आधार रेखा बनी हुई है।
प्रशिक्षण और अनुकूलन
FCN को प्रशिक्षित करने के लिए मेमोरी और गणना के सावधानीपूर्वक प्रबंधन की आवश्यकता होती है, क्योंकि सघन आउटपुट मेमोरी-गहन होते हैं। डेटा संवर्धन (जैसे, यादृच्छिक क्रॉपिंग, फ़्लिपिंग) और सीखने की दर अनुसूची जैसी तकनीकें आमतौर पर नियोजित की जाती हैं। मूल कार्यान्वयन ने Caffe फ्रेमवर्क का उपयोग किया और PASCAL VOC डेटासेट पर प्रशिक्षित किया गया, जिसने उस समय अत्याधुनिक परिणाम प्राप्त किए। बाद के कार्यों ने FCN को अन्य फ्रेमवर्क और डेटासेट, जिसमें COCO और Cityscapes शामिल हैं, के लिए अनुकूलित किया है।
व्यवहार में, FCN को अक्सर पूर्व-प्रशिक्षित वर्गीकरण नेटवर्क से ठीक-ट्यून किया जाता है, जो अभिसरण को तेज करता है और सटीकता में सुधार करता है। यह स्थानांतरण अधिगम दृष्टिकोण मशीन लर्निंग में मानक है और तंत्रिका नेटवर्क अनुसंधान में व्यापक रूप से अपनाया गया है।
विरासत
FCN की शुरूआत ने कंप्यूटर विज़न में एक महत्वपूर्ण मोड़ चिह्नित किया, यह प्रदर्शित करते हुए कि गहरे नेटवर्क सीधे सघन भविष्यवाणी कार्यों को हल कर सकते हैं। उनके सिद्धांत अनगिनत आधुनिक प्रणालियों में शामिल हैं, चिकित्सा निदान से लेकर स्वायत्त वाहनों तक। 2020 के दशक के मध्य तक, FCN अभी भी शैक्षणिक साहित्य में संदर्भित हैं और अधिक उन्नत मॉडल के लिए एक निर्माण खंड के रूप में कार्य करते हैं, जो गहन अधिगम समुदाय में उनकी स्थायी प्रासंगिकता को रेखांकित करता है।