EfficientDet एक ऑब्जेक्ट डिटेक्शन मॉडल का परिवार है, जिसे Google के शोधकर्ताओं द्वारा विकसित किया गया और 2019 में पेश किया गया। ये मॉडल उच्च सटीकता प्राप्त करने के साथ-साथ कम्प्यूटेशनल लागत को न्यूनतम करने के लिए डिज़ाइन किए गए हैं, जिससे वे मोबाइल डिवाइस और एज कम्प्यूटिंग प्लेटफॉर्म जैसे संसाधन-सीमित वातावरण में तैनाती के लिए उपयुक्त बनते हैं। EfficientDet का मुख्य नवाचार कम्पाउंड स्केलिंग का अनुप्रयोग है, एक तकनीक जो संसाधन बजट की एक श्रृंखला में प्रदर्शन को अनुकूलित करने के लिए न्यूरल नेटवर्क की गहराई, चौड़ाई और इनपुट रिज़ॉल्यूशन को एक साथ समायोजित करती है।
EfficientDet की वास्तुकला कुशल इमेज वर्गीकरण में पहले के कार्यों की सफलता पर आधारित है, विशेष रूप से EfficientNet मॉडल के परिवार पर, जिसने दिखाया कि नेटवर्क आयामों की सावधानीपूर्वक स्केलिंग दक्षता में महत्वपूर्ण सुधार ला सकती है। EfficientDet इस सिद्धांत को ऑब्जेक्ट डिटेक्शन तक विस्तारित करता है, एक ऐसा कार्य जिसके लिए न केवल छवि के भीतर वस्तुओं को वर्गीकृत करना आवश्यक है, बल्कि बाउंडिंग बॉक्स के साथ उन्हें स्थानीयकृत करना भी आवश्यक है। वास्तुकला में एक फीचर पिरामिड नेटवर्क (FPN) शामिल है, जो द्विदिश क्रॉस-स्केल कनेक्शन और एक भारित फीचर फ्यूज़न तंत्र के साथ बेहतर बनाया गया है, जिससे मॉडल विभिन्न स्केल से जानकारी को प्रभावी ढंग से संयोजित कर सकता है।
वास्तुकला और डिज़ाइन
EfficientDet की रीढ़ एक पूर्व-प्रशिक्षित EfficientNet मॉडल है, जो फीचर निष्कर्षणकर्ता के रूप में कार्य करता है। रीढ़ इनपुट छवि को संसाधित करती है और कई रिज़ॉल्यूशन पर फीचर मैप्स का एक सेट उत्पन्न करती है। इन फीचर मैप्स को फिर एक द्विदिश फीचर पिरामिड नेटवर्क (BiFPN) में फीड किया जाता है, जो विभिन्न स्तरों से फीचर्स को पुनरावृत्त रूप से फ्यूज़ करता है। पारंपरिक FPN के विपरीत जो सरल योग का उपयोग करते हैं, BiFPN प्रत्येक इनपुट फीचर पर सीखे गए भार लागू करता है, जिससे नेटवर्क अधिक सूचनात्मक स्केल पर जोर दे सकता है।
EfficientDet मॉडल का हेड वर्गीकरण और बाउंडिंग बॉक्स प्रतिगमन एक साथ करता है। यह सभी फीचर स्तरों के लिए एक साझा कन्वोल्यूशनल हेड का उपयोग करता है, जो पैरामीटर गणना को कम करता है और दक्षता में सुधार करता है। डिज़ाइन में एक कम्पाउंड स्केलिंग विधि भी शामिल है जो रीढ़ की गहराई, BiFPN की गहराई और चौड़ाई, और इनपुट रिज़ॉल्यूशन को समान रूप से स्केल करती है, जिससे एक एकल वास्तुकला को विभिन्न सटीकता और गति व्यापार-बंदों के अनुकूल बनाया जा सकता है।
कम्पाउंड स्केलिंग
कम्पाउंड स्केलिंग EfficientDet की दक्षता के पीछे मुख्य सिद्धांत है। यह विधि, जो पहले EfficientNet में पेश की गई थी, नेटवर्क की गहराई, चौड़ाई और रिज़ॉल्यूशन को नियंत्रित करने के लिए स्केलिंग गुणांकों के एक सेट का उपयोग करती है। EfficientDet के लिए, स्केलिंग गुणांक एक सत्यापन सेट पर ग्रिड खोज द्वारा निर्धारित किए जाते हैं, जिसका लक्ष्य दिए गए कम्प्यूटेशनल बजट (FLOPs में मापा गया) के तहत सटीकता को अधिकतम करना है।
यह दृष्टिकोण पहले के ऑब्जेक्ट डिटेक्शन मॉडल के विपरीत है, जिन्हें अक्सर प्रत्येक लक्ष्य प्लेटफॉर्म के लिए मैनुअल आर्किटेक्चर ट्यूनिंग की आवश्यकता होती थी। स्केलिंग प्रक्रिया को स्वचालित करके, EfficientDet मॉडलों का एक परिवार उत्पन्न कर सकता है, EfficientDet-D0 (सबसे छोटा) से EfficientDet-D7 (सबसे बड़ा) तक, प्रत्येक गति और सटीकता का एक अलग संतुलन प्रदान करता है। उदाहरण के लिए, EfficientDet-D0 COCO डेटासेट पर 34.6 की औसत औसत सटीकता (mAP) प्राप्त करता है, जबकि केवल 2.5 बिलियन FLOPs की आवश्यकता होती है, जबकि EfficientDet-D7 77 बिलियन FLOPs के साथ 55.1 mAP प्राप्त करता है।
प्रदर्शन और तुलना
EfficientDet ने अपनी रिलीज़ पर ऑब्जेक्ट डिटेक्शन में दक्षता के लिए नए मानक स्थापित किए। COCO डेटासेट पर, मॉडलों ने पिछले अत्याधुनिक डिटेक्टरों जैसे YOLOv3 और Faster R-CNN की तुलना में कम FLOPs और पैरामीटर का उपयोग करते हुए उच्च सटीकता प्राप्त की। उदाहरण के लिए, EfficientDet-D2 ने 11 बिलियन FLOPs के साथ 43.0 mAP प्राप्त किया, जो 65 बिलियन FLOPs के साथ YOLOv3 के 33.0 mAP से बेहतर प्रदर्शन करता है।
दक्षता लाभ विशेष रूप से एज डिवाइसों पर उल्लेखनीय थे। छोटे वेरिएंट, जैसे EfficientDet-D0 और D1, मोबाइल CPU और GPU पर वास्तविक समय में चलने के लिए डिज़ाइन किए गए थे, जिससे वे स्वायत्त ड्राइविंग, निगरानी और संवर्धित वास्तविकता जैसे अनुप्रयोगों के लिए आकर्षक बन गए। मॉडलों ने मजबूत ट्रांसफर लर्निंग क्षमताओं का भी प्रदर्शन किया, न्यूनतम फाइन-ट्यूनिंग के साथ अन्य डिटेक्शन डेटासेट पर अच्छा प्रदर्शन किया।
अनुप्रयोग और प्रभाव
EfficientDet की शुरुआत ने कुशल ऑब्जेक्ट डिटेक्शन और कंप्यूटर विज़न में बाद के शोध को प्रभावित किया। इसके डिज़ाइन सिद्धांत, विशेष रूप से भारित द्विदिश फीचर फ्यूज़न और कम्पाउंड स्केलिंग का उपयोग, बाद के मॉडलों में अपनाया और विस्तारित किया गया। EfficientDet का व्यापक रूप से उद्योग में विनिर्माण में दोष पहचान, चिकित्सा छवि विश्लेषण और खुदरा विश्लेषण जैसे कार्यों के लिए उपयोग किया गया है।
मॉडल की दक्षता ने इसे ARM-आधारित डिवाइसों और अन्य कम-शक्ति हार्डवेयर पर तैनाती के लिए एक लोकप्रिय विकल्प भी बनाया। इसका ओपन-सोर्स कार्यान्वयन, Apache 2.0 लाइसेंस के तहत जारी किया गया, शैक्षणिक शोधकर्ताओं और उद्योग चिकित्सकों दोनों द्वारा अपनाने की सुविधा प्रदान करता है। EfficientDet नए ऑब्जेक्ट डिटेक्शन आर्किटेक्चर की तुलना के लिए एक प्रासंगिक आधार रेखा बना हुआ है, विशेष रूप से उन लोगों के लिए जो दक्षता को लक्षित करते हैं।
सीमाएँ और भविष्य की दिशाएँ
जबकि EfficientDet ने दक्षता में महत्वपूर्ण सुधार प्राप्त किए, इसकी सीमाएँ हैं। कम्पाउंड स्केलिंग विधि एक निश्चित वास्तुकला मानती है और सभी कार्यों या हार्डवेयर के लिए इष्टतम नहीं हो सकती है। इसके अतिरिक्त, मॉडल मुख्य रूप से 2D ऑब्जेक्ट डिटेक्शन के लिए डिज़ाइन किए गए थे और सीधे इंस्टेंस सेगमेंटेशन या 3D डिटेक्शन जैसे अन्य कार्यों को संबोधित नहीं करते हैं, हालांकि रीढ़ को ऐसे उद्देश्यों के लिए अनुकूलित किया जा सकता है।
बाद के कार्यों ने डिटेक्शन मॉडल को और अनुकूलित करने के लिए न्यूरल आर्किटेक्चर खोज और स्वचालित मशीन लर्निंग का पता लगाया है। ट्रांसफॉर्मर-आधारित डिटेक्टरों का उदय, जैसे DETR और इसके वेरिएंट, ने भी डिटेक्शन पाइपलाइन को सरल बनाने वाले एंड-टू-एंड दृष्टिकोणों की ओर ध्यान केंद्रित किया है। फिर भी, कुशल मॉडल डिज़ाइन में EfficientDet के योगदान आधुनिक डीप लर्निंग शोध को सूचित करते रहते हैं।