अंग्रेज़ी से अनुवादित

Neural Magic एक सॉफ्टवेयर कंपनी है जो सामान्य CPU पर AI मॉडलों के लिए उच्च-प्रदर्शन इन्फ्रेंस में विशेषज्ञता रखती है, जो विशेष हार्डवेयर के बिना GPU जैसी गति प्राप्त करने के लिए स्पार्सिटी और क्वांटाइज़ेशन का उपयोग करती है।

Neural Magic एक सॉफ्टवेयर कंपनी है जो कमोडिटी CPU हार्डवेयर पर मशीन-लर्निंग अनुमान को तेज करने के लिए प्रौद्योगिकियों का विकास करती है। 2017 में स्थापित और बोस्टन, मैसाचुसेट्स में मुख्यालय वाली, यह कंपनी GPU जैसे विशेष एक्सेलेरेटर की आवश्यकता को समाप्त करके कृत्रिम-बुद्धिमत्ता तैनाती को अधिक सुलभ और लागत-प्रभावी बनाने पर केंद्रित है। इसका मुख्य दृष्टिकोण मॉडल स्पार्सिटी और क्वांटाइजेशन में एल्गोरिदमिक नवाचारों को CPU-विशिष्ट अनुकूलन के साथ जोड़ता है, जिससे गहरे तंत्रिका नेटवर्क मानक x86 प्रोसेसर पर कुशलता से चल सकें। कंपनी के समाधान विभिन्न उद्योगों में कंप्यूटर विज़न, प्राकृतिक भाषा प्रसंस्करण, और बड़े पैमाने पर जनरेटिव-एआई कार्यभार सहित कार्यों के लिए उपयोग किए जाते हैं।

यह कंपनी एमआईटी-सीएसएआईएल और बर्कले-एआई-रिसर्च में अनुसंधान से उभरी, जहां इसके संस्थापकों ने कम्प्यूटेशनल मांगों को कम करने के लिए तंत्रिका नेटवर्क की गणितीय संरचना का दोहन करने के तरीकों की खोज की। Neural Magic की तकनीक इस अवलोकन पर आधारित है कि कई तंत्रिका नेटवर्क में महत्वपूर्ण अतिरेक होता है, और वेट्स को प्रूनिंग या क्वांटाइज़ करके, अनुमान बहुत कम संचालन के साथ किया जा सकता है। कंपनी का सॉफ्टवेयर स्टैक, जिसमें इसका DeepSparse रनटाइम और SparseML टूलकिट शामिल है, डेवलपर्स को कस्टम हार्डवेयर की आवश्यकता के बिना मॉडल को संपीड़ित और तेज करने की अनुमति देता है। यह दृष्टिकोण Neural Magic को AI बुनियादी ढांचे के क्षेत्र में एक उल्लेखनीय खिलाड़ी के रूप में स्थापित कर चुका है, विशेष रूप से उन संगठनों के लिए जो GPU क्लस्टर की उच्च लागत और आपूर्ति बाधाओं से बचना चाहते हैं।

इतिहास और स्थापना

Neural Magic की स्थापना 2017 में मार्क-चेन, जैकब-उस्ज़कोरिट, और लुकाज़-कैसर द्वारा की गई थी, जो मशीन लर्निंग और सिस्टम में पृष्ठभूमि वाले तीन शोधकर्ता थे। उस्ज़कोरिट और कैसर Google में ट्रांसफॉर्मर आर्किटेक्चर के शुरुआती योगदानकर्ता थे, और चेन ने कुशल अनुमान तकनीकों पर काम किया था। तिकड़ी का उद्देश्य स्पार्स तंत्रिका नेटवर्क पर अनुसंधान का व्यावसायीकरण करना था, जिसने दिखाया था कि मॉडल को उनके मूल आकार के एक अंश तक प्रून किया जा सकता है जबकि सटीकता बनाए रखी जा सकती है। कंपनी शुरू में गुप्त रूप से संचालित हुई, शैक्षणिक पेपर प्रकाशित किए और अपनी मुख्य तकनीक विकसित की, इससे पहले कि उसने 2020 में अपने पहले उत्पाद सार्वजनिक रूप से लॉन्च किए।

2020 में, Neural Magic ने अपना DeepSparse अनुमान इंजन जारी किया, जिसने CPU पर कन्वोल्यूशनल और ट्रांसफॉर्मर मॉडल के लिए महत्वपूर्ण गति वृद्धि प्रदर्शित की। कंपनी ने SparseML भी पेश किया, जो प्रशिक्षण के दौरान मॉडल पर स्पार्सिटी और क्वांटाइजेशन लागू करने के लिए एक ओपन-सोर्स लाइब्रेरी है। इन रिलीज़ों ने उद्यमों और क्लाउड प्रदाताओं का ध्यान आकर्षित किया, जिससे इंटेल और एएमडी जैसी कंपनियों के साथ साझेदारी हुई। 2021 तक, Neural Magic ने NEA, Andreessen Horowitz, और Pillar VC सहित निवेशकों से $50 मिलियन से अधिक की फंडिंग जुटाई थी। कंपनी ने अपनी उत्पाद लाइन का विस्तार जारी रखा, बड़े-भाषा-मॉडल अनुमान के लिए समर्थन जोड़ा और PyTorch और Hugging Face Transformers जैसे लोकप्रिय फ्रेमवर्क के साथ एकीकरण किया।

प्रौद्योगिकी और दृष्टिकोण

Neural Magic की मुख्य तकनीक दो मुख्य तकनीकों के इर्द-गिर्द घूमती है: स्पार्सिटी और क्वांटाइजेशन। स्पार्सिटी में तंत्रिका नेटवर्क के वेट्स को प्रून करना शामिल है, उनमें से कई को शून्य पर सेट करना, जो अनुमान के दौरान आवश्यक गुणाओं की संख्या को कम करता है। क्वांटाइजेशन वेट्स और एक्टिवेशन की सटीकता को 32-बिट फ्लोटिंग पॉइंट से 8-बिट पूर्णांक तक कम करता है, जिससे कम्प्यूटेशनल लागत और मेमोरी बैंडविड्थ और कम हो जाती है। कंपनी का सॉफ्टवेयर इन तकनीकों को मॉडल पर स्वचालित रूप से लागू करता है, अक्सर सटीकता में न्यूनतम हानि के साथ, और फिर लक्ष्य CPU के लिए अनुकूलित कोड उत्पन्न करता है।

DeepSparse रनटाइम वह इंजन है जो इन संपीड़ित मॉडलों को निष्पादित करता है। यह स्पार्स मैट्रिक्स गुणन नामक तकनीक का उपयोग करता है, जो शून्य प्रविष्टियों को छोड़ देता है, और शेष संचालन को तेज करने के लिए AVX-512 और VNNI जैसे CPU वेक्टर निर्देशों का लाभ उठाता है। रनटाइम में एक जस्ट-इन-टाइम कंपाइलर भी शामिल है जो प्रत्येक मॉडल और हार्डवेयर कॉन्फ़िगरेशन के लिए विशेष कर्नेल उत्पन्न करता है। यह दृष्टिकोण Neural Magic को कुछ कार्यभारों के लिए GPU-आधारित सिस्टम के बराबर या उससे अधिक अनुमान गति प्राप्त करने की अनुमति देता है, विशेष रूप से बैच अनुमान और वास्तविक समय अनुप्रयोगों के लिए।

SparseML, साथी प्रशिक्षण लाइब्रेरी, मॉडल प्रशिक्षण या फाइन-ट्यूनिंग के दौरान प्रूनिंग और क्वांटाइजेशन के लिए API प्रदान करती है। यह क्रमिक परिमाण प्रूनिंग नामक तकनीक का समर्थन करती है, जो उनके परिमाण के आधार पर वेट्स को धीरे-धीरे हटाती है, और क्वांटाइजेशन-जागरूक प्रशिक्षण, जो सटीकता को संरक्षित करने के लिए प्रशिक्षण के दौरान कम-परिशुद्धता अंकगणित का अनुकरण करता है। ये उपकरण मौजूदा मशीन-लर्निंग पाइपलाइनों में एकीकृत करने के लिए आसान बनाए गए हैं, जिससे तकनीक डेवलपर्स की एक विस्तृत श्रृंखला के लिए सुलभ हो जाती है।

उत्पाद और सेवाएं

Neural Magic DeepSparse और SparseML ब्रांडों के तहत कई उत्पाद प्रदान करता है। DeepSparse रनटाइम एक Python पैकेज और एक Docker कंटेनर के रूप में उपलब्ध है, और यह CPU और क्लाउड दोनों तैनाती का समर्थन करता है। इसमें REST API के माध्यम से मॉडल की सेवा के लिए एक सर्वर मोड, साथ ही अनुप्रयोगों में अनुमान एम्बेड करने के लिए एक क्लाइंट लाइब्रेरी शामिल है। कंपनी एक पूर्व-अनुकूलित मॉडल ज़ू भी प्रदान करती है, जो लोकप्रिय मॉडलों का एक संग्रह है जिन्हें प्रून और क्वांटाइज़ किया गया है, तत्काल तैनाती के लिए तैयार।

SparseML एक ओपन-सोर्स लाइब्रेरी है जो PyTorch और TensorFlow के साथ एकीकृत होती है, जो स्पार्सिटी और क्वांटाइजेशन लागू करने के लिए कमांड-लाइन इंटरफेस और Python API प्रदान करती है। इसमें अवशिष्ट-नेटवर्क और ट्रांसफॉर्मर वेरिएंट जैसे सामान्य मॉडलों के लिए रेसिपी भी शामिल हैं, जो प्रूनिंग शेड्यूल और हाइपरपैरामीटर निर्दिष्ट करती हैं। इसके अतिरिक्त, Neural Magic DeepSparse Cloud नामक एक क्लाउड सेवा प्रदान करता है, जो ऑटोस्केलिंग के साथ प्रबंधित अनुमान एंडपॉइंट प्रदान करती है, हालांकि इस सेवा को बाद में ऑन-प्रिमाइसेस तैनाती के पक्ष में हटा दिया गया था।

बड़े-भाषा-मॉडल अनुमान के लिए, Neural Magic ने Llama और Mistral जैसे मॉडलों के लिए विशेष अनुकूलन विकसित किए हैं। इन अनुकूलन में KV-कैश क्वांटाइजेशन और फ्यूज्ड कर्नेल शामिल हैं जो मेमोरी उपयोग को कम करते हैं और थ्रूपुट में सुधार करते हैं। कंपनी ने Intel के नवीनतम Xeon प्रोसेसर के लिए अपने सॉफ्टवेयर को अनुकूलित करने के लिए इंटेल के साथ भी सहयोग किया है, जिससे लोकप्रिय बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त हुए हैं।

प्रदर्शन और बेंचमार्क

Neural Magic अपनी तकनीक की प्रभावशीलता को प्रदर्शित करने वाले बेंचमार्क परिणाम प्रकाशित करता है। उदाहरण के लिए, एक डुअल-सॉकेट Intel Xeon Platinum 8380 सर्वर पर, कंपनी ने बताया कि BERT-large मॉडल का एक प्रून और क्वांटाइज़्ड संस्करण प्रति सेकंड 1,000 से अधिक वाक्य प्राप्त करता है, जबकि अनुकूलित बेसलाइन लगभग 200 था। YOLOv5 जैसे कंप्यूटर विज़न मॉडल के लिए, DeepSparse ने एकल CPU सॉकेट पर 100 FPS से अधिक फ्रेम दर प्राप्त की, जो कई अनुप्रयोगों के लिए GPU अनुमान के साथ प्रतिस्पर्धी है।

कंपनी CPU-आधारित अनुमान के लागत लाभों पर भी प्रकाश डालती है। मौजूदा सर्वर बुनियादी ढांचे का उपयोग करके, संगठन GPU क्लस्टर की पूंजीगत व्यय से बच सकते हैं और ऊर्जा खपत को कम कर सकते हैं। Neural Magic की तकनीक विशेष रूप से एज तैनाती के लिए आकर्षक है, जहां बिजली और स्थान सीमित हैं, और वास्तविक समय अनुप्रयोगों के लिए जिन्हें कम विलंबता की आवश्यकता होती है।

हालांकि, प्रदर्शन लाभ मॉडल आर्किटेक्चर और प्राप्त करने योग्य स्पार्सिटी की डिग्री पर निर्भर करते हैं। सीमित अतिरेक वाले घने मॉडल छोटे सुधार देख सकते हैं, और कुछ कार्यभार अभी भी GPU से लाभान्वित होते हैं, विशेष रूप से विशाल समानांतरता वाले बहुत बड़े मॉडलों के लिए। Neural Magic इन सीमाओं को स्वीकार करता है और मार्गदर्शन प्रदान करता है कि कौन से मॉडल CPU त्वरण के लिए सबसे उपयुक्त हैं।

बाजार स्थिति और प्रतिस्पर्धा

Neural Magic AI अनुमान अनुकूलन के प्रतिस्पर्धी क्षेत्र में काम करता है, जिसमें हार्डवेयर और सॉफ्टवेयर दोनों समाधान शामिल हैं। हार्डवेयर पक्ष पर, एनवीडिया जैसी कंपनियां GPU के साथ हावी हैं, जबकि ग्रॉक और सांबा-नोवा विशेष AI एक्सेलेरेटर प्रदान करते हैं। सॉफ्टवेयर पक्ष पर, प्रतिस्पर्धियों में ओपनएआई का Triton, गूगल-डीपमाइंड का JAX, और TVM और ONNX Runtime जैसे विभिन्न कंपाइलर फ्रेमवर्क शामिल हैं। Neural Magic खुद को विशेष रूप से CPU पर केंद्रित करके अलग करता है, जो डेटा केंद्रों में सर्वव्यापी और अक्सर कम उपयोग किए जाते हैं।

कंपनी को मॉडल डिस्टिलेशन और नॉलेज डिस्टिलेशन जैसी उभरती तकनीकों से भी प्रतिस्पर्धा का सामना करना पड़ा है, जो विशेष हार्डवेयर के बिना छोटे मॉडल उत्पन्न कर सकते हैं। हालांकि, Neural Magic का दृष्टिकोण इन विधियों के साथ जोड़ा जा सकता है, और इसके उपकरण मौजूदा अनुकूलन वर्कफ़्लो को पूरक करने के लिए डिज़ाइन किए गए हैं।

2023 में, Neural Magic को रेड-हैट द्वारा अधिग्रहित किया गया था, जो आईबीएम की सहायक कंपनी है, एक अज्ञात राशि के लिए। अधिग्रहण का उद्देश्य Neural Magic की तकनीक को Red Hat के OpenShift AI प्लेटफ़ॉर्म में एकीकृत करना था, जिससे ग्राहकों को CPU-आधारित अनुमान विकल्प मिल सकें। यह कदम कुशल AI तैनाती में उद्यम सॉफ्टवेयर विक्रेताओं की बढ़ती रुचि का संकेत देता है।

उपयोग के मामले और अनुप्रयोग

Neural Magic की तकनीक विभिन्न वास्तविक दुनिया के अनुप्रयोगों में उपयोग की जाती है। कंप्यूटर विज़न में, यह खुदरा, विनिर्माण, और सुरक्षा में उपयोग के लिए वस्तु पहचान, छवि वर्गीकरण, और विभाजन मॉडल को तेज करता है। प्राकृतिक भाषा प्रसंस्करण में, यह भावना विश्लेषण, नामित इकाई पहचान, और प्रश्न-उत्तर प्रणालियों को शक्ति प्रदान करता है। बड़े भाषा मॉडलों के लिए कंपनी का समर्थन CPU सर्वर पर चैटबॉट और कोड जनरेशन टूल की तैनाती को भी सक्षम बनाता है, जिससे स्टार्टअप और उद्यमों के लिए लागत कम होती है।

एक उल्लेखनीय उपयोग का मामला स्वास्थ्य सेवा में है, जहां Neural Magic के सॉफ्टवेयर का उपयोग अस्पताल सर्वर पर चिकित्सा इमेजिंग मॉडल चलाने के लिए किया गया है, जिससे संवेदनशील डेटा को क्लाउड पर भेजने की आवश्यकता से बचा जा सके। वित्त में, यह धोखाधड़ी पहचान और एल्गोरिदमिक ट्रेडिंग मॉडल को तेज करता है जिन्हें कम विलंबता की आवश्यकता होती है। तकनीक स्वायत्त वाहनों और रोबोटिक्स में भी उपयोग की जाती है, जहां CPU अक्सर एकमात्र उपलब्ध कंप्यूट संसाधन होते हैं।

अनुसंधान और ओपन सोर्स

Neural Magic एक सक्रिय अनुसंधान कार्यक्रम बनाए रखता है, जो स्पार्स प्रशिक्षण, क्वांटाइजेशन, और अनुमान अनुकूलन पर पेपर प्रकाशित करता है। इसके शोधकर्ताओं ने NeurIPS, ICML, और MLSys जैसे सम्मेलनों में योगदान दिया है। कंपनी अपने अधिकांश सॉफ्टवेयर को ओपन सोर्स के रूप में भी जारी करती है, जिसमें SparseML और DeepSparse के कुछ हिस्से शामिल हैं, जो उपयोगकर्ताओं और योगदानकर्ताओं का एक समुदाय बनाता है।

ओपन-सोर्स रणनीति ने Neural Magic को एक बड़ा उपयोगकर्ता आधार बनाने और मशीन-लर्निंग समुदाय में विश्वसनीयता स्थापित करने में मदद की है। डेवलपर्स उपकरणों के साथ प्रयोग कर सकते हैं और उन्हें अपनी परियोजनाओं में एकीकृत कर सकते हैं, और कंपनी समुदाय की प्रतिक्रिया और योगदान से लाभान्वित होती है। यह दृष्टिकोण हगिंग-फेस और वेट्स-एंड-बायसेस जैसी अन्य AI बुनियादी ढांचा कंपनियों के समान है।

भविष्य की दिशाएं

आगे देखते हुए, Neural Magic का लक्ष्य उभरते मॉडल आर्किटेक्चर और हार्डवेयर के लिए अपना समर्थन विस्तारित करना है। ट्रांसफॉर्मर-आधारित मॉडलों और जनरेटिव-एआई के उदय के साथ, कंपनी बड़े-भाषा-मॉडल अनुमान के लिए अनुकूलन में निवेश कर रही है, जिसमें स्पेक्युलेटिव डिकोडिंग और डायनेमिक बैचिंग जैसी तकनीकें शामिल हैं। यह एआरएम-होल्डिंग्स प्रोसेसर और एएमडी EPYC CPU के लिए समर्थन की भी खोज कर रहा है, जो क्लाउड वातावरण में लोकप्रियता प्राप्त कर रहे हैं।

जैसे-जैसे AI मॉडल बड़े और अधिक जटिल होते जाते हैं, कुशल अनुमान की आवश्यकता और बढ़ेगी। Neural Magic का CPU पर ध्यान तेजी से प्रासंगिक हो सकता है क्योंकि संगठन प्रदर्शन, लागत, और ऊर्जा खपत को संतुलित करना चाहते हैं। Red Hat और IBM के साथ कंपनी का एकीकरण उद्यम अपनाने का मार्ग प्रदान करता है, और इसका ओपन-सोर्स पारिस्थितिकी तंत्र डेवलपर्स को आकर्षित करना जारी रखता है।

निष्कर्ष

Neural Magic ने CPU-आधारित अनुमान अनुकूलन में एक अग्रणी के रूप में खुद को स्थापित किया है, जो GPU-केंद्रित दृष्टिकोणों के लिए एक आकर्षक विकल्प प्रदान करता है। स्पार्सिटी, क्वांटाइजेशन, और रनटाइम इंजीनियरिंग का इसका संयोजन कमोडिटी हार्डवेयर पर महत्वपूर्ण प्रदर्शन सुधार प्रदान करता है, जिससे AI अधिक सुलभ और किफायती बनता है। जबकि चुनौतियां बनी हुई हैं, जैसे कि कुछ कार्यभारों के लिए CPU की अंतर्निहित सीमाएं, कंपनी की तकनीक कई उद्योगों में मूल्यवान साबित हुई है। Red Hat और IBM के समर्थन के साथ, Neural Magic AI तैनाती के भविष्य में एक महत्वपूर्ण भूमिका निभाने के लिए अच्छी स्थिति में है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-software·inference-optimization·machine-learning·startups
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास