तंत्रिका नेटवर्क आर्किटेक्चर खोज (NAS) कृत्रिम तंत्रिका नेटवर्क (ANN) के डिजाइन को स्वचालित करने की एक तकनीक है, जो मशीन लर्निंग के क्षेत्र में व्यापक रूप से उपयोग किया जाने वाला मॉडल है। NAS का उपयोग ऐसे नेटवर्क डिजाइन करने के लिए किया गया है जो मैन्युअल रूप से डिजाइन किए गए आर्किटेक्चर के बराबर या उनसे बेहतर प्रदर्शन करते हैं। NAS के तरीकों को खोज स्थान, खोज रणनीति और प्रदर्शन अनुमान रणनीति के अनुसार वर्गीकृत किया जा सकता है। खोज स्थान ANN के प्रकारों को परिभाषित करता है जिन्हें डिजाइन और अनुकूलित किया जा सकता है; खोज रणनीति खोज स्थान का पता लगाने के लिए उपयोग किए जाने वाले दृष्टिकोण को परिभाषित करती है; और प्रदर्शन अनुमान रणनीति एक संभावित ANN के प्रदर्शन का मूल्यांकन उसके डिजाइन से करती है, बिना उसे निर्मित और प्रशिक्षित किए। NAS हाइपरपैरामीटर अनुकूलन और मेटा-लर्निंग से निकटता से संबंधित है और स्वचालित मशीन लर्निंग (AutoML) का एक उपक्षेत्र है।
सुदृढीकरण लर्निंग
सुदृढीकरण लर्निंग (RL) NAS खोज रणनीति का आधार बन सकती है। बैरेट ज़ोफ और क्वोक ले ने CIFAR-10 डेटासेट को लक्षित करते हुए RL के साथ NAS लागू किया और एक नेटवर्क आर्किचेक्चर प्राप्त किया जो सटीकता के लिए सर्वोत्तम मैन्युअल रूप से डिजाइन किए गए आर्किटेक्चर को टक्कर देता है, जिसमें त्रुटि दर 3.65 है, जो संबंधित मैन्युअल रूप से डिजाइन किए गए मॉडल से 0.09 प्रतिशत बेहतर और 1.05x तेज है। पेन ट्रीबैंक डेटासेट पर, उस मॉडल ने एक आवर्ती कोशिका बनाई जो LSTM से बेहतर प्रदर्शन करती है, जिसमें परीक्षण सेट की उलझन 62.4 तक पहुंचती है, या पिछली अग्रणी प्रणाली से 3.6 उलझन बेहतर है। PTB वर्ण भाषा मॉडलिंग कार्य पर इसने प्रति वर्ण 1.214 बिट्स प्राप्त किए।
बड़े डेटासेट पर सीधे मॉडल आर्किटेक्चर सीखना एक लंबी प्रक्रिया हो सकती है। NASNet ने छोटे डेटासेट के लिए डिजाइन किए गए बिल्डिंग ब्लॉक को बड़े डेटासेट में स्थानांतरित करके इस मुद्दे को संबोधित किया। डिजाइन दो प्रकार की कनवल्शनल कोशिकाओं का उपयोग करने तक सीमित था, जो इनपुट फीचर मैप को कनवल्ट करते समय दो मुख्य कार्यों को पूरा करने वाले फीचर मैप लौटाती हैं: सामान्य कोशिकाएं जो समान आयाम (ऊंचाई और चौड़ाई) के मैप लौटाती हैं और कमी कोशिकाएं जिनमें लौटाए गए फीचर मैप की ऊंचाई और चौड़ाई दो के कारक से कम हो जाती है। कमी कोशिका के लिए, कोशिका के इनपुट पर लागू प्रारंभिक संचालन ऊंचाई और चौड़ाई को कम करने के लिए स्ट्राइड दो का उपयोग करता है। डिजाइन का सीखा हुआ पहलू ऐसे तत्वों को शामिल करता है जैसे कि प्रत्येक उच्च परत किस निचली परत (परतों) से इनपुट लेती है, उस परत पर लागू परिवर्तन, और प्रत्येक परत पर कई आउटपुट को कैसे विलय किया जाए। अध्ययन किए गए उदाहरण में, सर्वोत्तम कनवल्शनल परत (या "कोशिका") CIFAR-10 डेटासेट के लिए डिजाइन की गई थी और फिर इस कोशिका की प्रतियों को स्टैक करके ImageNet डेटासेट पर लागू किया गया, प्रत्येक के अपने पैरामीटर थे। इस दृष्टिकोण ने 82.7% शीर्ष-1 और 96.2% शीर्ष-5 की सटीकता प्राप्त की। यह सर्वोत्तम मानव-आविष्कृत आर्किटेक्चर से 9 बिलियन कम FLOPS की लागत पर बेहतर था, जो 28% की कमी है। सिस्टम विभिन्न गणना स्तरों पर मैन्युअल रूप से डिजाइन किए गए विकल्प से बेहतर प्रदर्शन करता रहा। छवि वर्गीकरण से सीखी गई छवि विशेषताओं को अन्य कंप्यूटर विज़न समस्याओं में स्थानांतरित किया जा सकता है। ऑब्जेक्ट डिटेक्शन के लिए, सीखी गई कोशिकाएं Faster-RCNN फ्रेमवर्क के साथ एकीकृत होकर COCO डेटासेट पर प्रदर्शन में 4.0% सुधार करती हैं।
तथाकथित कुशल तंत्रिका आर्किटेक्चर खोज (ENAS) में, एक नियंत्रक एक बड़े ग्राफ के भीतर एक इष्टतम उपग्राफ की खोज करना सीखकर आर्किटेक्चर की खोज करता है। नियंत्रक को पॉलिसी ग्रेडिएंट के साथ प्रशिक्षित किया जाता है ताकि एक उपग्राफ का चयन किया जा सके जो सत्यापन सेट के अपेक्षित पुरस्कार को अधिकतम करता है। उपग्राफ के अनुरूप मॉडल को विहित क्रॉस-एन्ट्रॉपी हानि को कम करने के लिए प्रशिक्षित किया जाता है। कई चाइल्ड मॉडल पैरामीटर साझा करते हैं, इसलिए ENAS को अन्य दृष्टिकोणों की तुलना में कम GPU-घंटे और "मानक" NAS से 1000 गुना कम की आवश्यकता होती है। CIFAR-10 पर, ENAS डिजाइन ने 2.89% की परीक्षण त्रुटि प्राप्त की, जो NASNet के बराबर है। पेन ट्रीबैंक पर, ENAS डिजाइन ने 55.8 की परीक्षण उलझन प्राप्त की।
विकास
NAS के लिए एक वैकल्पिक दृष्टिकोण विकासवादी एल्गोरिदम पर आधारित है, जिसे कई समूहों द्वारा नियोजित किया गया है। तंत्रिका आर्किटेक्चर खोज के लिए एक विकासवादी एल्गोरिदम आम तौर पर निम्नलिखित प्रक्रिया करता है। पहले, विभिन्न उम्मीदवार आर्किटेक्चर के साथ-साथ उनके सत्यापन स्कोर (फिटनेस) से युक्त एक पूल प्रारंभ किया जाता है। प्रत्येक चरण में, उम्मीदवार पूल में आर्किटेक्चर को उत्परिवर्तित किया जाता है (उदाहरण के लिए, 5x5 कनवल्शन के बजाय 3x3 कनवल्शन)। इसके बाद, नए आर्किटेक्चर को कुछ युगों के लिए शुरू से प्रशिक्षित किया जाता है और उनके सत्यापन स्कोर प्राप्त किए जाते हैं। इसके बाद उम्मीदवार पूल में सबसे कम स्कोर वाले आर्किटेक्चर को बेहतर, नए आर्किटेक्चर से बदल दिया जाता है। यह प्रक्रिया कई बार दोहराई जाती है, और इस प्रकार उम्मीदवार पूल समय के साथ परिष्कृत होता जाता है। ANN के विकास के संदर्भ में उत्परिवर्तन ऐसे संचालन हैं जैसे कि एक परत को जोड़ना या हटाना, जिसमें एक परत के प्रकार को बदलना (उदाहरण के लिए, कनवल्शन से पूलिंग तक), एक परत के हाइपरपैरामीटर बदलना, या प्रशिक्षण हाइपरपैरामीटर बदलना शामिल है। CIFAR-10 और ImageNet पर, विकास और RL ने समान रूप से प्रदर्शन किया, जबकि दोनों ने यादृच्छिक खोज से थोड़ा बेहतर प्रदर्शन किया।
बायेसियन अनुकूलन
बायेसियन अनुकूलन (BO), जो हाइपरपैरामीटर अनुकूलन के लिए एक कुशल विधि साबित हुई है, को NAS पर भी लागू किया जा सकता है। इस संदर्भ में, उद्देश्य फ़ंक्शन एक आर्किटेक्चर को कई युगों के लिए प्रशिक्षित होने के बाद उसकी सत्यापन त्रुटि से मैप करता है। प्रत्येक पुनरावृत्ति पर, BO पहले प्राप्त आर्किटेक्चर और उनकी सत्यापन त्रुटियों के आधार पर इस उद्देश्य फ़ंक्शन को मॉडल करने के लिए एक सरोगेट का उपयोग करता है। फिर कोई अधिग्रहण फ़ंक्शन, जैसे कि अपेक्षित सुधार, को अधिकतम करके मूल्यांकन करने के लिए अगला आर्किटेक्चर चुनता है, जो अन्वेषण और दोहन के बीच संतुलन प्रदान करता है। अधिग्रहण फ़ंक्शन अधिकतमकरण और उद्देश्य फ़ंक्शन मूल्यांकन अक्सर NAS के लिए कम्प्यूटेशनल रूप से महंगे होते हैं, और इस संदर्भ में BO के अनुप्रयोग को चुनौतीपूर्ण बनाते हैं। हाल ही में, BANANAS ने एक तंत्रिका भविष्यवक्ता के साथ युग्मित BO का एक उच्च-प्रदर्शन उदाहरण पेश करके इस दिशा में आशाजनक परिणाम प्राप्त किए हैं।
हिल-क्लाइम्बिंग
एक अन्य समूह ने एक हिल-क्लाइम्बिंग प्रक्रिया का उपयोग किया जो नेटवर्क मॉर्फिज्म लागू करती है, जिसके बाद छोटे कोसाइन-एनीलिंग अनुकूलन रन होते हैं। इस दृष्टिकोण ने प्रतिस्पर्धी परिणाम प्राप्त किए, जिसके लिए एकल नेटवर्क को प्रशिक्षित करने के समान क्रम के संसाधनों की आवश्यकता होती है। उदाहरण के लिए, CIFAR-10 पर, विधि ने एक GPU पर 12 घंटे में 5% से कम त्रुटि दर वाले नेटवर्क को डिजाइन और प्रशिक्षित किया।
बहु-उद्देश्यीय खोज
जबकि अधिकांश दृष्टिकोण केवल अधिकतम भविष्यवाणी प्रदर्शन वाले आर्किटेक्चर खोजने पर ध्यान केंद्रित करते हैं, अधिकांश व्यावहारिक अनुप्रयोगों के लिए अन्य उद्देश्य प्रासंगिक हैं, जैसे कि मेमोरी खपत, मॉडल आकार, या अनुमान समय (यानी, भविष्यवाणी प्राप्त करने के लिए आवश्यक समय)। इस कारण से, शोधकर्ताओं ने एक बहु-उद्देश्यीय खोज बनाई। LEMONADE एक विकासवादी एल्गोरिदम है जिसने कई उद्देश्यों को कुशलतापूर्वक अनुकूलित करने के लिए लैमार्कवाद को अपनाया। प्रत्येक पीढ़ी में, चाइल्ड नेटवर्क ANN की वर्तमान आबादी के संबंध में पारेतो सीमा में सुधार करने के लिए उत्पन्न होते हैं। न्यूरल आर्किटेक्ट को नेटवर्क एम्बेडिंग और प्रदर्शन भविष्यवाणी के साथ एक संसाधन-जागरूक बहु-उद्देश्यीय RL-आधारित NAS होने का दावा किया जाता है। नेटवर्क एम्बेडिंग एक मौजूदा नेटवर्क को एक प्रशिक्षण योग्य एम्बेडिंग वेक्टर में एन्कोड करता है, जिसका उपयोग प्रदर्शन की भविष्यवाणी करने और खोज को उन आर्किटेक्चर की ओर मार्गदर्शन करने के लिए किया जा सकता है जो सटीकता और संसाधन बाधाओं को संतुलित करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
ENAS और वेट शेयरिंग जैसी प्रगति के बावजूद NAS कम्प्यूटेशनल रूप से गहन बना हुआ है। खोज स्थान डिजाइन परिणामों को भारी रूप से प्रभावित करता है, और आर्किटेक्चर का मूल्यांकन अक्सर महत्वपूर्ण कंप्यूट की आवश्यकता होती है। हाल के काम ने विभेदक NAS का पता लगाया है, जहां खोज को एक सतत अनुकूलन समस्या में शिथिल किया जाता है, और भविष्यवक्ता-आधारित विधियां जो पूर्ण प्रशिक्षण के बिना प्रदर्शन का अनुमान लगाना सीखती हैं। 2020 के दशक के मध्य तक, NAS विकसित हो रहा है, जिसमें Deep learning मॉडल, जिसमें Transformer (architecture)-आधारित आर्किटेक्चर शामिल हैं, और स्वचालित मशीन लर्निंग पाइपलाइनों के साथ एकीकरण शामिल है। Google DeepMind, OpenAI, और Stanford AI Lab जैसे संस्थानों के शोधकर्ताओं ने NAS विधियों को आगे बढ़ाने में योगदान दिया है, हालांकि लागत और जटिलता के कारण कई व्यावहारिक तैनाती अभी भी मैन्युअल रूप से डिजाइन किए गए नेटवर्क पर निर्भर हैं।
अन्य क्षेत्रों से संबंध
NAS हाइपरपैरामीटर अनुकूलन और Meta-Learning से निकटता से जुड़ा हुआ है, क्योंकि यह मॉडल डिजाइन प्रक्रिया के हिस्से को स्वचालित करना चाहता है। यह Neural network सिद्धांत और Machine learning अभ्यास के साथ भी प्रतिच्छेद करता है। NAS में उपयोग की जाने वाली तकनीकें, जैसे कि सुदृढीकरण लर्निंग और विकासवादी एल्गोरिदम, व्यापक Artificial intelligence अनुसंधान से ली गई हैं। प्रदर्शन अनुमान रणनीतियाँ अक्सर खोज के दौरान प्रशिक्षण समय को कम करने के लिए Weight Initialization और Batch Normalization तकनीकों का लाभ उठाती हैं। NAS का अंतिम लक्ष्य प्रभावी Neural network आर्किटेक्चर डिजाइन करने के लिए आवश्यक मानव प्रयास को कम करना है, संभावित रूप से गैर-विशेषज्ञों को विशिष्ट कार्यों के लिए उच्च-प्रदर्शन मॉडल बनाने में सक्षम बनाना है।
निष्कर्ष
तंत्रिका आर्किटेक्चर खोज तंत्रिका नेटवर्क के डिजाइन को स्वचालित करने की दिशा में एक महत्वपूर्ण कदम का प्रतिनिधित्व करती है। सुदृढीकरण लर्निंग, विकासवादी एल्गोरिदम, बायेसियन अनुकूलन और अन्य रणनीतियों का लाभ उठाकर, NAS ऐसे आर्किटेक्चर खोज सकता है जो मानव-डिज़ाइन किए गए आर्किटेक्चर को टक्कर देते हैं या उनसे आगे निकल जाते हैं। हालांकि, कम्प्यूटेशनल लागत और खोज स्थान जटिलता प्रमुख चुनौतियाँ बनी हुई हैं। जैसे-जैसे विधियों में सुधार होता है, NAS विभिन्न डोमेन में कुशल और शक्तिशाली Deep learning मॉडल के विकास में तेजी से महत्वपूर्ण भूमिका निभाने की संभावना है।