डीप लर्निंग मशीन लर्निंग की एक शाखा है जो कृत्रिम तंत्रिका नेटवर्क के कई स्तरित परतों का उपयोग करके कच्चे डेटा, जैसे पिक्सेल, ऑडियो तरंगों, या पाठ से सीधे पदानुक्रमित प्रतिनिधित्व सीखती है, बिना हाथ से इंजीनियर की गई विशेषताओं की आवश्यकता के। शब्द "डीप" इनपुट और आउटपुट के बीच की परतों की संख्या को संदर्भित करता है।
इतिहास
डीप लर्निंग की गणितीय नींव 1980 के दशक में है, जब बैकप्रोपेगेशन को बहु-परत नेटवर्क को प्रशिक्षित करने के तरीके के रूप में लोकप्रिय बनाया गया था। 1990 और 2000 के दशक में सीमित डेटा, सीमित कंप्यूटिंग, और अन्य सांख्यिकीय तरीकों से प्रतिस्पर्धा के कारण प्रगति रुकी रही, यह अवधि कभी-कभी कनेक्शनिस्ट दृष्टिकोणों के लिए व्यापक AI सर्दी के हिस्से के रूप में वर्णित की जाती है। क्षेत्र का आधुनिक युग आमतौर पर 2012 से माना जाता है, जब एलेक्सनेट, जो ग्राफिक्स प्रोसेसिंग यूनिट पर प्रशिक्षित एक गहरा कन्वोल्यूशनल तंत्रिका नेटवर्क था, ने हाथ से निर्मित विशेषताओं पर आधारित तरीकों पर व्यापक अंतर से ImageNet प्रतियोगिता जीती। शोधकर्ता जेफ्री हिंटन, यान लेकुन, और योशुआ बेंगियो, जिन्हें बाद में क्षेत्र की संस्थापक तिकड़ी कहा गया, को 2018 का ट्यूरिंग पुरस्कार मिला; हिंटन और भौतिक विज्ञानी जॉन हॉपफील्ड ने संबंधित मौलिक कार्य के लिए 2024 का भौतिकी में नोबेल पुरस्कार साझा किया।
वास्तुकला
प्रारंभिक डीप लर्निंग सफलता छवियों के लिए कन्वोल्यूशनल नेटवर्क और आवर्तक तंत्रिका नेटवर्क से आई, जिसमें अनुक्रमिक डेटा जैसे पाठ और भाषण के लिए LSTM संस्करण शामिल है। 2017 में ट्रांसफॉर्मर वास्तुकला की शुरुआत, जो चरण-दर-चरण पुनरावृत्ति के बजाय ध्यान तंत्र का उपयोग करके समानांतर में अनुक्रमों को संसाधित करती है, ने भाषा कार्यों के लिए आवर्तक नेटवर्क को काफी हद तक विस्थापित कर दिया और आधुनिक बड़े भाषा मॉडल का आधार बन गई। नेटवर्क को ग्रेडिएंट डिसेंट के विभिन्न रूपों के माध्यम से एक हानि फ़ंक्शन को कम करके प्रशिक्षित किया जाता है, जिसमें बैकप्रोपेगेशन का उपयोग यह गणना करने के लिए किया जाता है कि प्रत्येक पैरामीटर को कैसे बदलना चाहिए।
यह बड़े पैमाने पर क्यों काम करता है
डीप नेटवर्क पहले के सांख्यिकीय तरीकों की तुलना में अधिक डेटा और अधिक कंप्यूटिंग से असमान रूप से लाभान्वित होते हैं, यह संबंध बाद में स्केलिंग कानूनों के रूप में औपचारिक रूप से स्थापित किया गया। यह स्केलिंग व्यवहार, जीपीयू हार्डवेयर की समानांतर प्रसंस्करण क्षमता के साथ मिलकर, जो मूल रूप से ग्राफिक्स रेंडरिंग के लिए बनाया गया था, ने चिकित्सकों को 2010 और 2020 के दशक में लगातार बड़े मॉडल प्रशिक्षित करने की अनुमति दी। AI-सक्षम GPU में Nvidia का प्रभुत्व और इसका CUDA सॉफ्टवेयर प्लेटफ़ॉर्म इसके परिणामस्वरूप उद्योग के बुनियादी ढांचे का एक केंद्रीय हिस्सा बन गया।
प्रभाव और आलोचना
डीप लर्निंग ने कंप्यूटर दृष्टि, भाषण पहचान, मशीन अनुवाद, और सबसे अधिक सार्वजनिक रूप से दिखाई देने वाले पाठ और छवि निर्माण में तेजी से प्रगति की। आलोचक ध्यान देते हैं कि डीप नेटवर्क काफी हद तक अपारदर्शी बने हुए हैं, सांख्यिकीय पैटर्न मिलानकर्ता के रूप में कार्य करते हैं जिनकी विफलताओं की भविष्यवाणी करना मुश्किल हो सकता है, और उन्हें भारी ऊर्जा और डेटा संसाधनों की आवश्यकता होती है, जिससे पर्यावरणीय और कॉपीराइट दोनों चिंताएं उठती हैं। समर्थकों का तर्क है कि उसी स्केलिंग नुस्खे ने बार-बार ऐसी क्षमताएं उत्पन्न की हैं जिन्हें स्पष्ट रूप से डिज़ाइन नहीं किया गया था, यह पैटर्न अधिक सामान्य बुद्धिमत्ता की दिशा में क्षेत्र के प्रक्षेपवक्र के बारे में चल रही बहस का केंद्र है।