MobileNet कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) आर्किटेक्चर का एक परिवार है, जिसे छवि वर्गीकरण, वस्तु पहचान, और अन्य कंप्यूटर विज़न कार्यों के लिए विकसित किया गया है। ये मॉडल छोटे आकार, कम विलंबता, और कम बिजली खपत के लिए इंजीनियर किए गए हैं, जिससे वे ऑन-डिवाइस अनुमान और संसाधन-सीमित उपकरणों जैसे मोबाइल फोन और एम्बेडेड सिस्टम पर एज कंप्यूटिंग के लिए उपयुक्त बनते हैं। मूल रूप से, उन्हें TensorFlow Lite का उपयोग करके मोबाइल उपकरणों पर कुशलतापूर्वक चलाने के लिए डिज़ाइन किया गया था, जो मशीन लर्निंग मॉडल के लिए एक हल्का रनटाइम है।
मोबाइल उपकरणों पर कुशल डीप लर्निंग मॉडल की आवश्यकता ने Google के शोधकर्ताओं को MobileNet विकसित करने के लिए प्रेरित किया। जून 2025 तक, परिवार में पाँच प्रमुख संस्करण शामिल हैं, जिनमें से प्रत्येक अपने पूर्ववर्ती पर आधारित है ताकि प्रदर्शन और दक्षता में सुधार हो सके जबकि सीमित वातावरण के लिए उपयुक्तता बनाए रखी जा सके।
आर्किटेक्चर सिद्धांत
MobileNet आर्किटेक्चर कई प्रमुख तकनीकों के माध्यम से कम्प्यूटेशनल लागत को कम करने पर ध्यान केंद्रित करते हैं। मुख्य नवाचार depthwise separable convolutions का उपयोग है, जो एक मानक कन्वोल्यूशन को दो अलग-अलग ऑपरेशनों में विघटित करता है: एक depthwise कन्वोल्यूशन जो प्रत्येक इनपुट चैनल को स्वतंत्र रूप से फ़िल्टर करता है, और एक pointwise कन्वोल्यूशन (एक 1×1 कन्वोल्यूशन) जो आउटपुट को जोड़ता है। यह फैक्टराइज़ेशन मानक कन्वोल्यूशन की तुलना में पैरामीटर और फ्लोटिंग-पॉइंट ऑपरेशनों की संख्या को काफी कम करता है, जिससे सीमित प्रोसेसिंग पावर वाले उपकरणों पर कुशल अनुमान संभव होता है।
एक और महत्वपूर्ण रणनीति हाइपरपैरामीटर की शुरुआत है जो मॉडल आकार और कम्प्यूटेशनल भार को नियंत्रित करते हैं। चौड़ाई गुणक (α के रूप में दर्शाया गया) प्रत्येक परत में चैनलों की संख्या को समायोजित करता है; छोटे α मान छोटे और तेज़ मॉडल उत्पन्न करते हैं लेकिन सटीकता की कीमत पर। रिज़ॉल्यूशन गुणक(ρ) इनपुट छवि रिज़ॉल्यूशन को समायोजित करता है, जिसमें कम रिज़ॉल्यूशन प्रोसेसिंग को तेज़ करते हैं लेकिन संभावित रूप से परिशुद्धता को कम करते हैं।
आर्किटेक्चर में batch normalization और डेटा ऑग्मेंटेशन जैसी तकनीकें भी शामिल हैं ताकि प्रशिक्षण स्थिरता और सामान्यीकरण में सुधार हो सके। ये डिज़ाइन विकल्प MobileNet को मोबाइल और एम्बेडेड संदर्भों में रीयल-टाइम अनुप्रयोगों के लिए एक लोकप्रिय विकल्प बनाते हैं।
MobileNetV1
MobileNetV1 अप्रैल 2017 में प्रकाशित हुआ था। इसका मुख्य आर्किटेक्चरल नवाचार depthwise separable convolutions का समावेश था, जो एक अवधारणा पहली बार Laurent Sifre द्वारा 2013 में Google Brain में इंटर्नशिप के दौरान AlexNet पर एक भिन्नता के रूप में पेश की गई थी ताकि अभिसरण गति में सुधार हो और मॉडल आकार कम हो सके। depthwise separable कन्वोल्यूशन प्रत्येक मानक कन्वोल्यूशन को एक depthwise फ़िल्टर(प्रति चैनल संचालित) और एक pointwise संयोजन(1×1 कन्वोल्यूशन) में विघटित करता है जो depthwise परत से आउटपुट को मर्ज करता है।
MobileNetV1 के लिए डिफ़ॉल्ट में चौड़ाई गुणक 1.0 और रिज़ॉल्यूशन गुणक 224x224 शामिल थे। हालांकि, इन गुणकों को समायोजित करके, डेवलपर्स फॉर्म फैक्टर और सटीकता के बीच संतुलन बना सकते थे। आर्किटेक्चर में प्रत्येक कन्वोल्यूशन के बाद ReLU सक्रियण का उपयोग भी किया गया और प्रशिक्षण को तेज़ करने के लिए Batch Normalization लागू किया गया।
MobileNetV2
MobileNetV2, मार्च 2019 में प्रकाशित, दो महत्वपूर्ण परिशोधन पेश किए: inverted residual layers और linear bottlenecks। inverted residuals पारंपरिक अवशिष्ट ब्लॉकों की संरचना को उलट देते हैं पहले इनपुट चैनलों का विस्तार करके, फिर depthwise कन्वोल्यूशन करके, और अंत में कम संख्या में चैनलों पर वापस प्रोजेक्ट करके। यह विस्तार depthwise कन्वोल्यूशन को उच्च-आयामी स्थान में संचालित करने की अनुमति देता है, जिससे सूचना प्रवाह अधिक संरक्षित रहता है।
Linear bottlenecks प्रोजेक्शन परतों से ReLU सक्रियण को हटा देते हैं, इस अंतर्ज्ञान पर आधारित कि निम्न-आयामी स्थानों में नॉनलाइनियरिटी सूचना हानि का कारण बनती हैं। इन परतों को रैखिक रखकर, मॉडल अधिक अभिव्यंजक शक्ति बनाए रखता है भले ही चैनल संख्या छोटी हो। ये सुधार V1 की तुलना में उच्च सटीकता और कम विलंबता प्रदान करते हैं, जिससे V2 मोबाइल विज़न कार्यों के लिए एक सामान्य विकल्प बन गया।
MobileNetV3 और V4
MobileNetV3, 2019 में जारी, तीन वेरिएंट पेश किए: MobileNetV3-Large, MobileNetV3-Small, और MobileNetEdgeTPU, बाद वाला Pixel 4 स्मार्टफोन के लिए अनुकूलित था। ये मॉडल न्यूरल आर्किटेक्चर सर्च(NAS) के माध्यम से खोजे गए थे जो सीधे मोबाइल विलंबता को मापते थे, सटीकता और अनुमान गति के बीच वांछित व्यापार-बंद प्राप्त करते हुए। V3 में swish और sigmoid सक्रियणों के piecewise-linear अनुमान(h-swish और h-sigmoid), squeeze-and-excitation मॉड्यूल भी शामिल थे, और V2 से inverted bottleneck संरचना विरासत में मिली।
MobileNetV4, सितंबर 2024 में प्रकाशित, ने NAS द्वारा पाए गए कई आर्किटेक्चर के साथ परिवार का विस्तार किया। V4 ने multi-query attention पेश किया, जो विज़न ट्रांसफॉर्मर से प्रेरित था, और एक नया पोस्ट-मिक्स ब्लॉक प्रस्तावित किया जिसे universal inverted bottleneck कहा जाता है, जो पहले के संस्करणों से inverted residual और inverted bottleneck अवधारणाओं को एकीकृत करता है।
MobileNetV5 और भविष्य की दिशाएँ
MobileNetV5 की आर्किटेक्चर की घोषणा Gemma 3n(एक भाषा मॉडल(के जारी होने के तुरंत बाद जून 2025 में की गई थी। हालांकि घोषणा में उल्लेख किया गया था कि एक तकनीकी रिपोर्ट जल्द प्रकाशित होगी, अक्टूबर 2025 तक, ऐसी कोई रिपोर्ट उपलब्ध नहीं कराई गई थी। V5 नेटवर्क सबसे बड़े V4 वेरिएंट से लगभग दस गुना बड़ा होने की सूचना है, जो उच्च-क्षमता मॉडल की ओर बदलाव का संकेत देता है जबकि मोबाइल तैनाती के लिए प्राप्त करने योग्य दक्षता बनाए रखता है।
अपने विकास के दौरान, MobileNet ने कई आर्किटेक्चर को प्रभावित किया है और एम्बेडेड विज़न सिस्टम के लिए एक आधारशिला बना हुआ है, जो स्वायत्त ड्राइविंग, रोबोटिक्स, और मोबाइल फोटोग्राफी जैसे क्षेत्रों में व्यावहारिक अनुप्रयोगों को सक्षम बनाता है।