बैकप्रोपेगेशन वह एल्गोरिदम है जिसका उपयोग यह गणना करने के लिए किया जाता है कि तंत्रिका-नेटवर्क की हानि उसके प्रत्येक भार के सापेक्ष कैसे बदलती है, नेटवर्क की परतों के माध्यम से कैलकुलस की श्रृंखला नियम को पीछे की ओर लागू करके। यह वह तंत्र है जो ग्रेडिएंट-डिसेंट के साथ गहरे नेटवर्क को प्रशिक्षित करना कम्प्यूटेशनल रूप से संभव बनाता है, क्योंकि यह एक अद्यतन के लिए आवश्यक सभी ग्रेडिएंट्स की गणना लगभग एक ही समय में करता है जितना एकल फॉरवर्ड पास में लगता है, बजाय प्रत्येक व्यक्तिगत भार के लिए अलग-अलग महंगी गणना की आवश्यकता के।
इतिहास
बैकप्रोपेगेशन के पीछे की गणितीय तकनीक, रिवर्स-मोड स्वचालित विभेदन, को 1960 के दशक से विभिन्न रूपों में वर्णित किया गया था, और पॉल वेरबोस ने इसे 1974 में अपने हार्वर्ड डॉक्टरेट शोध प्रबंध में स्पष्ट रूप से तंत्रिका-नेटवर्क पर लागू किया, हालांकि उस कार्य पर उस समय अधिक ध्यान नहीं दिया गया। बैकप्रोपेगेशन मुख्यधारा की एआई अनुसंधान में 1986 के डेविड रुमेलहार्ट, जेफ्री हिंटन, और रोनाल्ड विलियम्स के नेचर पेपर, "लर्निंग रिप्रेजेंटेशन्स बाय बैक-प्रोपेगेटिंग एरर्स" के बाद प्रवेश किया, जिसने प्रदर्शित किया कि यह विधि बहु-परत नेटवर्क को उपयोगी आंतरिक प्रतिनिधित्व खोजने के लिए प्रशिक्षित कर सकती है, जो दो दशक पहले मार्विन मिंस्की और सीमोर पेपर्ट द्वारा एकल-परत परसेप्ट्रॉन में पहचानी गई सीमाओं का सीधा उत्तर था। 1986 के पेपर को व्यापक रूप से दूसरे एआई-विंटर को समाप्त करने और 1980 के दशक के अंत और 1990 के दशक में एआई के प्रति कनेक्शनिस्ट दृष्टिकोणों में रुचि को पुनर्जीवित करने का श्रेय दिया जाता है।
यह कैसे काम करता है
नेटवर्क का फॉरवर्ड पास वर्तमान इनपुट और भार से एक आउटपुट और हानि-फलन मान की गणना करता है। फिर बैकप्रोपेगेशन उस हानि से पीछे की ओर काम करता है, श्रृंखला नियम का उपयोग करके, परत दर परत, यह गणना करता है कि प्रत्येक भार ने त्रुटि में कितना योगदान दिया, एक ही पिछड़े पास में नेटवर्क के प्रत्येक पैरामीटर के लिए एक ग्रेडिएंट उत्पन्न करता है। फिर इन ग्रेडिएंट्स का उपयोग एक अनुकूलक द्वारा किया जाता है, आमतौर पर ग्रेडिएंट-डिसेंट का एक प्रकार, प्रत्येक भार को उस दिशा में समायोजित करने के लिए जो हानि को कम करता है। इस पिछड़े गणना की दक्षता, औपचारिक रूप से रिवर्स-मोड स्वचालित विभेदन का एक उदाहरण, वही है जो अरबों मापदंडों वाले नेटवर्क को प्रशिक्षित करना व्यावहारिक बनाती है; एक भोला संख्यात्मक दृष्टिकोण जो प्रत्येक ग्रेडिएंट की स्वतंत्र रूप से पुनर्गणना करता है, उस पैमाने पर कम्प्यूटेशनल रूप से असंभव होगा।
अपनाना और सीमाएँ
1986 में लोकप्रिय होने के बावजूद, बैकप्रोपेगेशन ने तुरंत प्रभुत्व नहीं जमाया: 1990 और 2000 के दशकों के दौरान, बैकप्रोपेगेशन के साथ प्रशिक्षित गहरे नेटवर्क कई परतों वाले नेटवर्क में लुप्त और विस्फोटक ग्रेडिएंट्स से पीड़ित थे, जिसने व्यावहारिक गहराई को सीमित कर दिया और उथले मॉडलों और सपोर्ट वेक्टर मशीनों जैसे वैकल्पिक तरीकों के लिए प्राथमिकता में योगदान दिया। वास्तुशिल्प सुधार, जिनमें एलएसटीएम नेटवर्क में गेटिंग तंत्र, सावधानीपूर्वक भार आरंभीकरण, और बाद में अवशिष्ट कनेक्शन और सामान्यीकरण परतें शामिल हैं, ने धीरे-धीरे इन मुद्दों को हल किया और बहुत गहरे नेटवर्क को सक्षम किया, जिनमें कन्वोल्यूशनल-तंत्रिका-नेटवर्क और अंततः ट्रांसफॉर्मर शामिल हैं, जो आधुनिक गहन-शिक्षण को परिभाषित करते हैं। बैकप्रोपेगेशन ने स्वयं भी वैज्ञानिक आलोचना आकर्षित की है, सबसे प्रमुख रूप से बाद के वर्षों में जेफ्री हिंटन से, इसकी जैविक असंगतता के लिए, क्योंकि मस्तिष्क में सटीक, सममित पिछड़े त्रुटि संकेतों के लिए कोई ज्ञात तंत्र नहीं है जिसकी एल्गोरिदम को आवश्यकता होती है, जिसने अधिक जैविक रूप से प्रशंसनीय शिक्षण नियमों पर चल रहे अनुसंधान को प्रेरित किया है जो अब तक इसके व्यावहारिक प्रदर्शन से मेल नहीं खा सके हैं।
महत्व
बैकप्रोपेगेशन तंत्रिका-नेटवर्क के लिए लगभग सार्वभौमिक प्रशिक्षण विधि बना हुआ है, कंप्यूटर-विज़न से लेकर प्राकृतिक-भाषा-प्रसंस्करण तक के डोमेन में, और हर प्रमुख गहन शिक्षण ढांचा, जिसमें पायटॉर्च और टेंसरफ्लो शामिल हैं, स्वचालित विभेदन इंजनों के आसपास बनाया गया है जो इसे बड़े पैमाने पर लागू करते हैं।