AlexNet एक Convolutional neural network है जिसे एलेक्स क्रिज़ेव्स्की ने Ilya Sutskever और Geoffrey Hinton के साथ मिलकर टोरंटो विश्वविद्यालय में डिज़ाइन किया था। 2012 की ImageNet 2012 (AlexNet moment) प्रतियोगिता में प्रवेश करते हुए, इसने ImageNet तस्वीरों को 1,000 श्रेणियों में वर्गीकृत किया, जिसमें शीर्ष-5 त्रुटि दर 15.3 प्रतिशत थी, जो अगले सर्वश्रेष्ठ प्रतियोगी से दस प्रतिशत अंकों से अधिक आगे थी, जो अभी भी पारंपरिक हाथ से निर्मित कंप्यूटर-विज़न सुविधाओं पर निर्भर था। इस परिणाम को व्यापक रूप से आधुनिक Deep learning युग के प्रारंभिक बिंदु के रूप में माना जाता है।
नेटवर्क का नाम इसके मुख्य लेखक के पहले नाम का संक्षिप्त रूप है और इसे औपचारिक उत्पाद शीर्षक के रूप में नहीं बनाया गया था; पेपर को आमतौर पर केवल "ImageNet Classification with Deep Convolutional Neural Networks" (2012) के रूप में उद्धृत किया जाता है।
इतिहास
क्रिज़ेव्स्की ने हिंटन की प्रयोगशाला में स्नातक छात्र के रूप में AlexNet का निर्माण किया, जो 1990 के दशक में यान लेकुन द्वारा किए गए पहले के कन्वोल्यूशनल-नेटवर्क कार्य को आगे बढ़ाता था। कन्वोल्यूशनल नेटवर्क दो दशकों से मौजूद थे, और फी-फी ली के समूह द्वारा तैयार किया गया ImageNet डेटासेट 2009 से सार्वजनिक था, लेकिन किसी भी टीम ने शास्त्रीय विज़न पाइपलाइनों को हराने के लिए पर्याप्त गहरे नेटवर्क को पर्याप्त कंप्यूट और डेटा के साथ नहीं जोड़ा था। क्रिज़ेव्स्की ने मॉडल को दो NVIDIA GPU (in AI) कार्ड (GTX 580s) पर प्रशिक्षित किया, नेटवर्क को उनके बीच विभाजित करते हुए क्योंकि एक कार्ड में पर्याप्त मेमोरी नहीं थी, और निम्न-स्तरीय कर्नेल खुद लिखने के लिए NVIDIA के CUDA प्लेटफॉर्म का उपयोग किया।
वास्तुकला
AlexNet में आठ सीखी गई परतें हैं: पांच कन्वोल्यूशनल परतें जिनके बाद तीन पूरी तरह से जुड़ी परतें हैं, कुल मिलाकर लगभग 60 मिलियन पैरामीटर। कई विकल्पों ने इसे पहले के नेटवर्क से अलग किया। इसने धीमी संतृप्त सिग्मॉइड या तन्ह फ़ंक्शन के बजाय ReLU (रेक्टिफाइड लीनियर यूनिट) सक्रियण फ़ंक्शन का उपयोग किया, जिससे प्रशिक्षण काफी तेज हुआ। इसने 1.2 मिलियन प्रशिक्षण छवियों के डेटासेट पर ओवरफिटिंग कम करने के लिए पूरी तरह से जुड़ी परतों में ड्रॉपआउट, एक Regularization तकनीक, लागू की। इसने ओवरफिटिंग को और सीमित करने के लिए डेटा संवर्धन (यादृच्छिक क्रॉप और क्षैतिज फ्लिप) का उपयोग किया, और परतों के बीच स्थानीय प्रतिक्रिया सामान्यीकरण, एक तकनीक जिसे बाद की पीढ़ियों के नेटवर्क ने ज्यादातर छोड़ दिया। प्रशिक्षण में दो GPU पर लगभग छह दिनों में स्टोकेस्टिक ग्रेडिएंट डिसेंट के साथ Backpropagation का उपयोग किया गया, जो उस समय एक विज़न मॉडल के लिए असामान्य रूप से बड़ी कंप्यूटेशनल प्रतिबद्धता थी।
प्रभाव और विरासत
AlexNet की जीत के अंतर ने कंप्यूटर विज़न क्षेत्र के अधिकांश हिस्से को आश्वस्त किया, जो दूसरे AI winter के झटकों के बाद Neural network दृष्टिकोणों के प्रति संदेहपूर्ण था, कि गहराई प्लस पैमाना प्लस GPU कंप्यूट एक विजयी संयोजन था। मूल पेपर के उद्धरण दसियों हज़ारों में हैं, और पेपर को अक्सर क्षेत्र-बदलने वाले अनुभवजन्य परिणाम के विहित उदाहरण के रूप में पढ़ाया जाता है। उद्योग अपनाना जल्दी से हुआ: दो वर्षों के भीतर, ImageNet चुनौती में अधिकांश प्रतियोगियों ने गहरे कन्वोल्यूशनल नेटवर्क का उपयोग किया, और Google, Facebook, और Baidu सहित कंपनियों ने बड़ी आंतरिक गहन शिक्षण टीमें बनाईं। NVIDIA के शेयर और रणनीति AlexNet के बाद बदल गई क्योंकि GPU को केवल ग्राफिक्स रेंडरिंग के बजाय प्रशिक्षण के लिए तेजी से विपणन किया गया, एक संबंध जो अगले दशक में गहरा हुआ क्योंकि नेटवर्क AlexNet की आठ परतों से सैकड़ों परतों तक बढ़े और बाद में, Transformer (architecture) की बहुत अलग वास्तुकला तक।
AlexNet स्वयं बाद के ImageNet प्रतियोगिताओं में VGGNet, GoogLeNet, और ResNet जैसे गहरे नेटवर्क द्वारा जल्दी से पीछे छोड़ दिया गया था, और कई कार्यों के लिए कन्वोल्यूशनल आर्किटेक्चर को तब से विज़न ट्रांसफॉर्मर द्वारा चुनौती दी गई है। इसका स्थायी महत्व तकनीकी के बजाय ऐतिहासिक है: इसे आमतौर पर एकल परिणाम के रूप में उद्धृत किया जाता है जिसने व्यापक मशीन लर्निंग और Computer vision समुदाय को पैमाने पर Deep learning विधियों के लिए प्रतिबद्ध होने के लिए आश्वस्त किया, जिससे शैक्षणिक अनुसंधान प्राथमिकताओं और उनका समर्थन करने वाले हार्डवेयर उद्योग दोनों को नया आकार मिला।