EfficientNet परिवर्तनीय तंत्रिका नेटवर्क (CNNs) का एक परिवार है जिसे कंप्यूटर विज़न कार्यों के लिए विकसित किया गया है, जिसे पहली बार 2019 में Google AI के शोधकर्ताओं द्वारा प्रकाशित किया गया था। इसकी परिभाषित विशेषता कंपाउंड स्केलिंग है, एक तकनीक जो एक तंत्रिका नेटवर्क के सभी आयामों - गहराई, चौड़ाई और रिज़ॉल्यूशन - को एक ही गुणांक का उपयोग करके समान रूप से समायोजित करती है। यह दृष्टिकोण पारंपरिक प्रथाओं के विपरीत है जो केवल एक आयाम को स्केल करते हैं, जैसे परतें जोड़ना या इनपुट आकार बढ़ाना। EfficientNet मॉडल को छवि वर्गीकरण, वस्तु पहचान और अर्थपूर्ण विभाजन सहित क्षेत्रों में व्यापक रूप से अपनाया गया है, और पहले के आर्किटेक्चर की तुलना में कम कम्प्यूटेशनल लागत के साथ उच्च सटीकता प्राप्त करने के लिए जाने जाते हैं।
मूल EfficientNet पेपर ने प्रदर्शित किया कि कंपाउंड स्केलिंग ImageNet बेंचमार्क पर व्यक्तिगत रूप से ट्यून किए गए आयामों वाले मॉडलों से बेहतर प्रदर्शन कर सकती है। कई अक्षों में वृद्धि को सावधानीपूर्वक संतुलित करके, परिवार फ्लोटिंग-पॉइंट ऑपरेशन (FLOPs) को प्रबंधनीय रखते हुए अत्याधुनिक परिणाम प्राप्त करता है। मॉडल एक आधारभूत आर्किटेक्चर पर निर्भर करते हैं जो तंत्रिका आर्किटेक्चर खोज के माध्यम से खोजा गया था, और स्केलिंग विधि इस नींव पर कॉम्पैक्ट से लेकर अत्यधिक सटीक तक मॉडलों का एक स्पेक्ट्रम उत्पन्न करने के लिए बनाती है।
आर्किटेक्चर और कंपाउंड स्केलिंग
EfficientNet की मुख्य नवीनता कंपाउंड स्केलिंग विधि है। गहराई (परतों की संख्या), चौड़ाई (चैनलों की संख्या), या रिज़ॉल्यूशन (इनपुट छवि आकार) को व्यक्तिगत रूप से मनमाने ढंग से बढ़ाने के बजाय, विधि तीनों को एक साथ स्केल करती है। एक आधारभूत नेटवर्क दिए जाने पर, गहराई गुणक d, चौड़ाई गुणक w, और रिज़ॉल्यूशन गुणक r को d = α^φ, w = β^φ, और r = γ^φ के रूप में परिभाषित किया जाता है, जहाँ φ एक कंपाउंड गुणांक है जो समग्र पैमाने को नियंत्रित करता है। ये गुणक शर्त α · β² · γ² ≈ 2 द्वारा बाधित हैं, जो सुनिश्चित करता है कि φ को φ₀ के कारक से बढ़ाने से नेटवर्क की कुल कम्प्यूटेशनल लागत लगभग 2^φ₀ गुना बढ़ जाती है। हाइपरपैरामीटर α, β, और γ आमतौर पर एक छोटे ग्रिड खोज के माध्यम से सेट किए जाते हैं; मूल पेपर ने क्रमशः 1.2, 1.1 और 1.15 के मान सुझाए थे।
आर्किटेक्चरल रूप से, आधारभूत EfficientNet-B0 को तंत्रिका आर्किटेक्चर खोज (NAS) का उपयोग करके पाया गया था, जिसने उल्टे अवरोधक कनवल्शन (जिसे MBConv कहा जाता है) की पहचान की - एक बिल्डिंग ब्लॉक जिसे पहले MobileNet में लोकप्रिय बनाया गया था - अत्यधिक प्रभावी के रूप में। पूर्ण EfficientNet परिवार में स्टैक किए गए MBConv परतें शामिल हैं, जिनकी सटीक संख्या और फ़िल्टर आकार कंपाउंड स्केलिंग समीकरणों द्वारा निर्धारित किए जाते हैं। मूल प्रकाशन ने आठ मॉडल पेश किए, EfficientNet-B0 से EfficientNet-B7 तक, प्रत्येक बढ़ती गहराई, चौड़ाई और रिज़ॉल्यूशन के साथ, जिससे छवि वर्गीकरण जैसे कार्यों में सटीकता में समान सुधार होता है।
विविधताएं और अनुकूलन
मूल B0-B7 मॉडलों के अलावा, EfficientNet को आगे तंत्रिका आर्किटेक्चर खोज के माध्यम से विशेष हार्डवेयर के लिए अनुकूलित किया गया है। विविधताओं को एज TPU के लिए ट्यून किया गया है, जो कम विलंबता और ऊर्जा दक्षता को प्राथमिकता देते हैं, साथ ही केंद्रीकृत TPU या GPU क्लस्टर के लिए जहां थ्रूपुट सर्वोपरि है। ये अनुकूलन अक्सर अनुमान गति में महत्वपूर्ण लाभ के लिए मामूली सटीकता में कमी का व्यापार करते हैं, जिससे वे एम्बेडेड सिस्टम और क्लाउड सेवाओं में वास्तविक समय अनुप्रयोगों के लिए उपयुक्त होते हैं।
EfficientNet V2 जून 2021 में प्रकाशित हुआ था, जिसमें कई आर्किटेक्चरल सुधार पेश किए गए थे। अद्यतन डिज़ाइन में विस्तारित NAS खोज के माध्यम से खोजे गए कनवल्शनल परत प्रकारों का एक व्यापक सेट शामिल किया गया, जिसमें फ्यूज्ड MBConv ब्लॉक शामिल हैं। एक उल्लेखनीय प्रगति एक नई प्रशिक्षण प्रक्रिया थी जो प्रशिक्षण के दौरान इनपुट छवि आकार को धीरे-धीरे बढ़ाती है, साथ ही ड्रॉपआउट, RandAugment और Mixup जैसी नियमितीकरण तकनीकों के साथ। लेखकों ने बताया कि यह दृष्टिकोण प्रगतिशील रीसाइज़िंग का उपयोग करते समय आमतौर पर देखी जाने वाली सटीकता में गिरावट को कम करता है, जिससे तेज़ प्रशिक्षण और बेहतर अंतिम प्रदर्शन होता है। EfficientNet V2 ने S, M और L जैसे विविधताएं भी पेश कीं, जो विभिन्न संसाधन बाधाओं को लक्षित करती हैं।
प्रभाव और अनुप्रयोग
EfficientNet ने गहन शिक्षण के क्षेत्र में मॉडल स्केलिंग और आर्किटेक्चर डिज़ाइन में बाद के शोध को प्रभावित किया है। इसका कंपाउंड स्केलिंग सिद्धांत अन्य आर्किटेक्चर पर लागू किया गया है, जिसमें ट्रांसफॉर्मर शामिल हैं, जहां इसने बहु-आयामी स्केलिंग रणनीतियों को प्रेरित किया है। व्यवहार में, EfficientNet मॉडल आमतौर पर You Only Look Once (YOLO) जैसी वस्तु पहचान प्रणालियों और U-Net जैसे विभाजन मॉडल के लिए बैकबोन नेटवर्क के रूप में उपयोग किए जाते हैं, उनकी मजबूत फीचर निष्कर्षण क्षमताओं और दक्षता के कारण। वे अक्सर ट्रांसफर लर्निंग पाइपलाइनों में भी नियोजित होते हैं, जहां ImageNet जैसे बड़े डेटासेट पर पूर्व-प्रशिक्षित वजन को डोमेन-विशिष्ट कार्यों के लिए ठीक किया जाता है।
मॉडल परिवार का कम्प्यूटेशनल दक्षता पर जोर इसे मोबाइल उपकरणों और एज हार्डवेयर पर तैनाती के लिए एक लोकप्रिय विकल्प बनाता है, जो Apple और Qualcomm जैसी कंपनियों के तंत्रिका नेटवर्क अनुमान को अनुकूलित करने के काम का पूरक है। इसकी ओपन-सोर्स उपलब्धता, आमतौर पर अनुमेय लाइसेंस के तहत, शिक्षा और उद्योग दोनों में व्यापक अपनाने की सुविधा प्रदान की है, जिससे आधुनिक CNN डिज़ाइन के लिए एक बेंचमार्क के रूप में इसकी स्थिति मजबूत हुई है।
सीमाएं और भविष्य की दिशाएं
अपनी ताकत के बावजूद, EfficientNet की सीमाएं हैं। कंपाउंड स्केलिंग विधि एक मोटे FLOPs अनुमान पर निर्भर करती है और विशिष्ट हार्डवेयर या बाधाओं के लिए हमेशा इष्टतम व्यापार-बंद नहीं दे सकती है। इसके अतिरिक्त, मूल MBConv परतें, हालांकि कुशल हैं, ट्रांसफॉर्मर मॉडल में पाए जाने वाले नए ध्यान-आधारित तंत्रों की तुलना में कम प्रभावी हो सकती हैं। शोध ने तब से हाइब्रिड आर्किटेक्चर की खोज की है जो कनवल्शनल ब्लॉक को ध्यान के साथ एकीकृत करते हैं, जिसका उद्देश्य CNN की दक्षता को मल्टी-हेड अटेंशन की प्रासंगिक समझ के साथ जोड़ना है। हाल के वर्षों में, EfficientNet एक प्रतिस्पर्धी आधार रेखा बना हुआ है, लेकिन नए मॉडल तेजी से तंत्रिका आर्किटेक्चर खोज और स्वचालित स्केलिंग से विचारों को शामिल कर रहे हैं ताकि सटीकता और दक्षता की सीमाओं को और आगे बढ़ाया जा सके।