एज इन्फेरेंस एक प्रशिक्षित मशीन-लर्निंग मॉडल को केंद्रीय क्लाउड सर्वर पर डेटा भेजने के बजाय, स्थानीय डिवाइस, जैसे स्मार्टफोन, सेंसर, या एम्बेडेड सिस्टम पर चलाने की प्रक्रिया है। शब्द 'एज' नेटवर्क एज को संदर्भित करता है, जो भौतिक दुनिया और मुख्य नेटवर्क बुनियादी ढांचे के बीच की सीमा है। स्थानीय रूप से इन्फेरेंस करने से, एज इन्फेरेंस डेटा ट्रांसमिशन के लिए राउंड-ट्रिप समय को कम करता है, जो वास्तविक समय की प्रतिक्रिया की आवश्यकता वाले अनुप्रयोगों, जैसे स्वायत्त वाहन, औद्योगिक स्वचालन, और संवर्धित वास्तविकता के लिए महत्वपूर्ण है। यह संवेदनशील डेटा को डिवाइस पर रखकर गोपनीयता संबंधी चिंताओं को भी संबोधित करता है और क्लाउड सेवाओं में निरंतर डेटा स्ट्रीमिंग के लिए आवश्यक बैंडविड्थ को कम करता है।
यह प्रथा 2010 के दशक के अंत में प्रमुखता प्राप्त हुई, जब डीप-लर्निंग मॉडल अधिक जटिल हो गए और कम-विलंबता AI अनुप्रयोगों की मांग बढ़ी। जबकि क्लाउड-आधारित इन्फेरेंस बड़े पैमाने के मॉडलों के लिए प्रमुख बना हुआ है, एज इन्फेरेंस उपभोक्ता इलेक्ट्रॉनिक्स और औद्योगिक सेटिंग्स में आर्टिफिशियल-इंटेलिजेंस तैनाती के लिए एक प्रमुख रणनीति बन गया है। इस क्षेत्र में मॉडल सटीकता और एज हार्डवेयर की कम्प्यूटेशनल बाधाओं के बीच एक समझौता शामिल है, जिसमें आमतौर पर क्लाउड सर्वर की तुलना में सीमित मेमोरी, प्रोसेसिंग पावर और ऊर्जा बजट होता है।
हार्डवेयर और सॉफ्टवेयर नींव
एज इन्फेरेंस विशेष हार्डवेयर पर निर्भर करता है जो सीमित पावर बजट के भीतर न्यूरल-नेटवर्क गणनाओं को तेज करने के लिए डिज़ाइन किया गया है। एप्पल ने 2017 में अपने A11 बायोनिक चिप में न्यूरल इंजन पेश किया, जो ऑन-डिवाइस मशीन-लर्निंग कार्यों के लिए एक समर्पित ब्लॉक है। सैमसंग इलेक्ट्रॉनिक्स ने 2019 में Exynos 9820 प्रोसेसर में अपने न्यूरल प्रोसेसिंग यूनिट (NPU) के साथ इसका अनुसरण किया। क्वालकॉम ने 2019 में अपने स्नैपड्रैगन 855 मोबाइल प्लेटफॉर्म में हेक्सागोन टेंसर एक्सेलेरेटर को एकीकृत किया, जिससे एंड्रॉइड डिवाइसों पर तेज़ AI वर्कलोड सक्षम हुए। इंटेल और एएमडी ने एज सर्वर और औद्योगिक पीसी के लिए कम-पावर प्रोसेसर और एक्सेलेरेटर विकसित किए हैं, जबकि आर्म होल्डिंग्स कई एज चिप्स के लिए आर्किटेक्चर प्रदान करता है, TSMC-निर्मित सिलिकॉन के लिए डिज़ाइन लाइसेंस देता है।
सॉफ्टवेयर की ओर, TensorFlow Lite, PyTorch Mobile, और ONNX Runtime जैसे फ्रेमवर्क प्रशिक्षित मॉडलों को एज तैनाती के लिए अनुकूलित प्रारूपों में बदलने के उपकरण प्रदान करते हैं। ये फ्रेमवर्क मॉडल-प्रूनिंग जैसी तकनीकों का समर्थन करते हैं, जो अनावश्यक वेट्स को हटाती हैं, और क्वांटाइजेशन, जो वेट्स की सटीकता को 32-बिट फ्लोटिंग पॉइंट से 8-बिट पूर्णांक तक कम करती है, जिससे मॉडल का आकार घटता है और इन्फेरेंस गति में सुधार होता है। उदाहरण के लिए, 50% स्पार्सिटी तक प्रून किया गया मॉडल कुछ हार्डवेयर पर लगभग दोगुनी तेजी से चल सकता है, हालांकि सटीकता में थोड़ी गिरावट हो सकती है।
एज अनुकूलन के लिए तकनीकें
कई एल्गोरिथमिक तकनीकें जटिल मॉडलों को संसाधन-सीमित डिवाइसों पर चलाने में सक्षम बनाती हैं। नॉलेज डिस्टिलेशन एक छोटे 'छात्र' मॉडल को बड़े 'शिक्षक' मॉडल के आउटपुट की नकल करने के लिए प्रशिक्षित करती है, जिससे कम पैरामीटरों के साथ तुलनीय सटीकता प्राप्त होती है। वेट-इनिशियलाइज़ेशन और बैच-नॉर्मलाइज़ेशन मानक प्रशिक्षण प्रथाएं हैं जो क्वांटाइजेशन के लिए अधिक अनुकूल मॉडल उत्पन्न करती हैं। प्रशिक्षण के दौरान ड्रॉपआउट ओवरफिटिंग को रोकने में मदद करता है, जो विविध एज वातावरणों में तैनाती के लिए महत्वपूर्ण है। ग्रेडिएंट-क्लिपिंग और लर्निंग-रेट-शेड्यूल प्रशिक्षण-पक्ष तकनीकें हैं जो स्थिर अभिसरण सुनिश्चित करती हैं, जो अप्रत्यक्ष रूप से अंतिम मॉडल की मजबूती को प्रभावित करती हैं।
रिसिड्यूअल-नेटवर्क आर्किटेक्चर, जैसे ResNet, एज विज़न अनुप्रयोगों में आमतौर पर उपयोग किए जाते हैं क्योंकि उनके स्किप कनेक्शन अत्यधिक कम्प्यूटेशनल लागत के बिना गहरे नेटवर्क की अनुमति देते हैं। यू-नेट क्लीनिकों में एज डिवाइसों पर चिकित्सा छवि विभाजन के लिए लोकप्रिय है। अनुक्रम कार्यों के लिए, ट्रांसफॉर्मर मॉडल तेजी से एज उपयोग के लिए संपीड़ित किए जा रहे हैं, हालांकि उनकी मेमोरी आवश्यकताएं एक चुनौती बनी हुई हैं। टॉप-के-सैंपलिंग और टेम्परेचर-स्केलिंग जैसी तकनीकें जनरेटिव कार्यों के दौरान इन्फेरेंस में लागू की जाती हैं, लेकिन ये एज डिवाइसों की तुलना में क्लाउड-आधारित लार्ज-लैंग्वेज-मॉडल तैनाती में अधिक सामान्य हैं।
अनुप्रयोग और उद्योग अपनाना
एज इन्फेरेंस ने उपभोक्ता इलेक्ट्रॉनिक्स में व्यापक रूप से अपनाया गया है। स्मार्टफोन फोटोग्राफी, वॉयस रिकग्निशन और पूर्वानुमानित टेक्स्ट के लिए ऑन-डिवाइस AI का उपयोग करते हैं। टेस्ला ऑटोपायलट और वेमो अपने वाहनों में कैमरा और सेंसर डेटा को वास्तविक समय में संसाधित करने के लिए एज इन्फेरेंस का उपयोग करते हैं, जिसमें सुरक्षा-महत्वपूर्ण निर्णयों के लिए 100 मिलीसेकंड से कम की विलंबता आवश्यकताएं होती हैं। स्वास्थ्य सेवा में, इंट्यूटिव सर्जिकल अपने डा विंची सर्जिकल सिस्टम में सर्जनों को वास्तविक समय की इमेजिंग विश्लेषण में सहायता करने के लिए एज इन्फेरेंस का उपयोग करता है। कम्योर और ओम्निसिएंट क्रमशः अस्पताल निगरानी और न्यूरोइमेजिंग के लिए एज AI विकसित करते हैं।
औद्योगिक अनुप्रयोगों में पूर्वानुमानित रखरखाव शामिल है, जहां मशीनरी पर सेंसर स्थानीय रूप से विसंगति-पहचान मॉडल चलाते हैं, और विनिर्माण में गुणवत्ता नियंत्रण, जहां विज़न सिस्टम असेंबली लाइनों पर उत्पादों का निरीक्षण करते हैं। फर्माटा कृषि में फसल निगरानी के लिए एज इन्फेरेंस का उपयोग करता है, ड्रोन और स्थिर कैमरों से छवियों का विश्लेषण करता है। टॉमटॉम अपने नेविगेशन डिवाइसों में वास्तविक समय की ट्रैफिक भविष्यवाणी के लिए एज AI को एकीकृत करता है। नोकिया बेल लैब्स ने 5G नेटवर्क अनुकूलन के लिए एज इन्फेरेंस पर शोध किया है, और ज़ेरॉक्स PARC ने वितरित कंप्यूटिंग पर प्रारंभिक कार्य में योगदान दिया जो आधुनिक एज आर्किटेक्चर को सूचित करता है।
चुनौतियाँ और समझौते
एक प्राथमिक चुनौती सटीकता-विलंबता समझौता है। बड़े मॉडल आमतौर पर उच्च सटीकता प्राप्त करते हैं लेकिन अधिक मेमोरी और कंप्यूट की आवश्यकता होती है, जो एज डिवाइस क्षमताओं से अधिक हो सकती है। उदाहरण के लिए, अरबों पैरामीटरों वाला एक लार्ज-लैंग्वेज-मॉडल महत्वपूर्ण संपीड़न के बिना एक सामान्य स्मार्टफोन पर नहीं चल सकता है, और फिर भी, प्रदर्शन अपर्याप्त हो सकता है। मॉडल-प्रूनिंग और क्वांटाइजेशन न्यूनतम सटीकता हानि के साथ मॉडल के आकार को 90% तक कम कर सकते हैं, लेकिन आक्रामक संपीड़न एज मामलों पर प्रदर्शन को खराब कर सकता है।
ऊर्जा खपत एक और बाधा है। एज डिवाइस अक्सर बैटरी पर चलते हैं, और निरंतर इन्फेरेंस बिजली को जल्दी खत्म कर सकता है। एप्पल के न्यूरल इंजन जैसे हार्डवेयर एक्सेलेरेटर ऊर्जा-कुशल होने के लिए डिज़ाइन किए गए हैं, लेकिन सॉफ्टवेयर अनुकूलन भी उतने ही महत्वपूर्ण हैं। बैच-नॉर्मलाइज़ेशन फोल्डिंग, जो पिछली परतों में नॉर्मलाइज़ेशन पैरामीटरों को एकीकृत करता है, रनटाइम ओवरहेड को कम करता है। लेयर-नॉर्मलाइज़ेशन ट्रांसफॉर्मर में उपयोग किया जाता है और इसे समान रूप से अनुकूलित किया जा सकता है।
सुरक्षा एक बढ़ती चिंता है। ऑन-डिवाइस इन्फेरेंस डेटा एक्सपोज़र को कम करता है, लेकिन मॉडल स्वयं निकाले या छेड़छाड़ किए जा सकते हैं। प्रतिकूल प्रशिक्षण और सुरक्षित एन्क्लेव जैसी तकनीकों की खोज की जा रही है, हालांकि वे कम्प्यूटेशनल ओवरहेड जोड़ते हैं। अलेक्जेंडर मैड्री और अन्य ने प्रतिकूल मजबूती का अध्ययन किया है, जो सुरक्षा-संवेदनशील अनुप्रयोगों में एज तैनाती के लिए प्रासंगिक है।
भविष्य की दिशाएँ
2025 तक, एज इन्फेरेंस अधिक विषम कंप्यूटिंग की ओर बढ़ रहा है, जिसमें डिवाइस CPU, GPU, NPU और विशेष एक्सेलेरेटर को जोड़ते हैं। गूगल डीपमाइंड और ओपनएआई मॉडल संपीड़न तकनीकों पर शोध कर रहे हैं जो एज डिवाइसों पर अधिक शक्तिशाली AI को सक्षम कर सकती हैं। एंथ्रोपिक सुरक्षा पर केंद्रित है, जिसमें एज-तैनात मॉडलों का विश्वसनीय व्यवहार सुनिश्चित करना शामिल है। अमेज़न वेब सर्विसेज AWS IoT Greengrass प्रदान करता है, जो क्लाउड क्षमताओं को एज डिवाइसों तक विस्तारित करता है, और एज़्योर और गूगल क्लाउड के समान पेशकश हैं। ग्रोक और संबानोवा उच्च-प्रदर्शन इन्फेरेंस हार्डवेयर विकसित कर रहे हैं, हालांकि मुख्य रूप से डेटा केंद्रों के लिए, उनके आर्किटेक्चर भविष्य के एज चिप्स को प्रभावित कर सकते हैं।
उभरती हुई मेमोरी तकनीकें, जैसे इन-मेमोरी कंप्यूटिंग, मेमोरी और कंप्यूट इकाइयों के बीच डेटा ले जाने की ऊर्जा लागत को कम करने का वादा करती हैं। ग्राफकोर का IPU और सेरेब्रास (प्रदान की गई सूची में नहीं) नवीन आर्किटेक्चर की खोज कर रहे हैं, लेकिन एज पर उनकी प्रयोज्यता अनिश्चित है। छोटे, अधिक कुशल मॉडलों की ओर रुझान, जैसे AI21 लैब्स और इन्फ्लेक्शन AI द्वारा विकसित, सुझाव देता है कि एज इन्फेरेंस समय के साथ अधिक जटिल कार्यों तक विस्तारित होगा।