अंग्रेज़ी से अनुवादित

फीड फॉरवर्ड एक तंत्रिका नेटवर्क वास्तुकला पैटर्न है जिसमें डेटा बिना चक्रों के इनपुट से आउटपुट तक एक दिशा में प्रवाहित होता है, जो ट्रांसफॉर्मर और बड़े भाषा मॉडल सहित अधिकांश आधुनिक मशीन लर्निंग प्रणालियों का आधार बनता है।

फीड फॉरवर्ड एक मौलिक आर्किटेक्चरल पैटर्न है न्यूरल नेटवर्क में जहां जानकारी सख्ती से एक दिशा में चलती है: इनपुट परत से, छिपी हुई परतों के माध्यम से, आउटपुट परत तक, बिना किसी लूप या फीडबैक कनेक्शन के। यह डिज़ाइन आवर्ती आर्किटेक्चर के विपरीत है जो जानकारी को वापस चक्रित करने की अनुमति देता है, और यह समकालीन मशीन लर्निंग प्रणालियों के विशाल बहुमत को रेखांकित करता है, जिसमें डीप लर्निंग मॉडल और बड़े भाषा मॉडल शामिल हैं।

यह शब्द नियंत्रण सिद्धांत और प्रारंभिक कृत्रिम बुद्धिमत्ता अनुसंधान से उत्पन्न हुआ है, जहां एक फीड-फॉरवर्ड सिस्टम अपने आउटपुट की गणना सीधे अपने इनपुट से करता है बिना किसी पिछले आउटपुट पर निर्भरता के। न्यूरल नेटवर्क के संदर्भ में, इसका मतलब है कि प्रत्येक परत की सक्रियताएं पूरी तरह से पिछली परत की सक्रियताओं से गणना की जाती हैं, जिससे एक सरल, रचनात्मक संरचना बनती है जिसे बैकप्रोपेगेशन का उपयोग करके कुशलतापूर्वक प्रशिक्षित किया जा सकता है।

ऐतिहासिक विकास

फीड-फॉरवर्ड नेटवर्क की अवधारणा पर्सेप्ट्रॉन से जुड़ी है, जिसे 1958 में फ्रैंक रोसेनब्लैट ने पेश किया था, जो एक एकल-परत फीड-फॉरवर्ड मॉडल था। 1969 में, मार्विन मिंस्की और सीमोर पेपर्ट की पुस्तक "पर्सेप्ट्रॉन्स" ने एकल-परत फीड-फॉरवर्ड नेटवर्क की सीमाओं को उजागर किया, जिससे अनुसंधान धीमा हो गया। 1980 के दशक में बैकप्रोपेगेशन के लोकप्रिय होने के साथ यह क्षेत्र पुनर्जीवित हुआ, जिसने बहु-परत फीड-फॉरवर्ड नेटवर्क, जिन्हें अक्सर मल्टीलेयर पर्सेप्ट्रॉन कहा जाता है, के प्रशिक्षण को सक्षम बनाया। प्रमुख प्रारंभिक योगदानकर्ताओं में बर्नार्ड विड्रो और बर्कले एआई रिसर्च के संबद्ध सदस्य शामिल थे जिन्होंने अनुकूली फ़िल्टरिंग और सीखने के एल्गोरिदम को आगे बढ़ाया।

2010 के दशक तक, फीड-फॉरवर्ड आर्किटेक्चर आधुनिक एआई की रीढ़ बन गए। ट्रांसफॉर्मर आर्किटेक्चर, जिसे 2017 के पेपर "अटेंशन इज़ ऑल यू नीड" में पेश किया गया था, जिसमें जैकब उस्ज़कोरेत, लुकाज़ कैसर, और निकी पार्मर जैसे शोधकर्ता शामिल थे, ध्यान तंत्र के साथ अंतःस्थापित फीड-फॉरवर्ड परतों पर बहुत अधिक निर्भर करता है। यह डिज़ाइन ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड द्वारा विकसित प्रणालियों को शक्ति प्रदान करता है।

मुख्य घटक

एक विशिष्ट फीड-फॉरवर्ड नेटवर्क में एक इनपुट परत, एक या अधिक छिपी हुई परतें, और एक आउटपुट परत होती है। प्रत्येक परत एक रैखिक परिवर्तन के बाद एक गैर-रेखीय सक्रियण फ़ंक्शन लागू करती है। सामान्य सक्रियण फ़ंक्शन में ReLU (रेक्टिफाइड लीनियर यूनिट), सिग्मॉइड, और tanh शामिल हैं। भार और बायस एडम या स्टोकेस्टिक ग्रेडिएंट डिसेंट वेरिएंट जैसे अनुकूलन एल्गोरिदम के माध्यम से सीखे जाते हैं।

आधुनिक आर्किटेक्चर में, फीड-फॉरवर्ड परतों को अक्सर विस्तारित और संकुचित किया जाता है। उदाहरण के लिए, एक ट्रांसफॉर्मर में, प्रत्येक ब्लॉक में एक फीड-फॉरवर्ड नेटवर्क होता है जो पहले प्रतिनिधित्व को उच्च आयाम (अक्सर मॉडल चौड़ाई का 4 गुना) में प्रोजेक्ट करता है और फिर वापस प्रोजेक्ट करता है, बीच में एक गैर-रेखीयता के साथ। यह डिज़ाइन, जिसे कभी-कभी पोज़िशन-वाइज़ फीड-फॉरवर्ड नेटवर्क कहा जाता है, प्रत्येक टोकन को स्वतंत्र रूप से संसाधित करता है।

आधुनिक आर्किटेक्चर में भूमिका

फीड-फॉरवर्ड परतें एनकोडर-डिकोडर मॉडल और सीक्वेंस-टू-सीक्वेंस प्रणालियों में आवश्यक हैं। ट्रांसफॉर्मर में, एनकोडर और डिकोडर दोनों स्टैक में फीड-फॉरवर्ड उप-परतें होती हैं। ये परतें मल्टी-हेड अटेंशन तंत्र द्वारा उत्पन्न प्रतिनिधित्व को बदलने के लिए जिम्मेदार होती हैं, जिससे मॉडल जटिल फीचर इंटरैक्शन सीख सकता है।

अवशिष्ट नेटवर्क (ResNets), 2015 में पेश किए गए, स्किप कनेक्शन शामिल करते हैं जो गहरे फीड-फॉरवर्ड स्टैक के माध्यम से ग्रेडिएंट को अधिक आसानी से प्रवाहित करने की अनुमति देते हैं, जिससे सैकड़ों परतों वाले नेटवर्क सक्षम होते हैं। यह नवाचार मॉडल को आधुनिक जनरेटिव एआई प्रणालियों के आकार तक बढ़ाने के लिए महत्वपूर्ण था। बैच नॉर्मलाइज़ेशन और लेयर नॉर्मलाइज़ेशन जैसी तकनीकें गहरे फीड-फॉरवर्ड नेटवर्क के प्रशिक्षण को और स्थिर करती हैं।

प्रशिक्षण और अनुकूलन

फीड-फॉरवर्ड नेटवर्क का प्रशिक्षण बैकप्रोपेगेशन पर निर्भर करता है, जो सभी भारों के संबंध में हानि फ़ंक्शन के ग्रेडिएंट की गणना करता है। प्रमुख प्रथाओं में भार आरंभीकरण रणनीतियाँ, सीखने की दर अनुसूची, और ग्रेडिएंट क्लिपिंग शामिल हैं ताकि विस्फोटक ग्रेडिएंट को रोका जा सके। ड्रॉपआउट और डेटा वृद्धि जैसी नियमितीकरण विधियाँ ओवरफिटिंग को रोकने में मदद करती हैं।

हानि फ़ंक्शन कार्य के अनुसार भिन्न होते हैं: वर्गीकरण के लिए क्रॉस-एंट्रोपी हानि, प्रतिगमन के लिए माध्य वर्ग त्रुटि, और जनरेटिव मॉडल के लिए विशेष हानि। अनुमान अक्सर बीम सर्च जैसी डिकोडिंग रणनीतियों या टॉप-के सैंपलिंग और टॉप-पी सैंपलिंग सहित सैंपलिंग विधियों का उपयोग करता है, जिसमें तापमान स्केलिंग यादृच्छिकता को नियंत्रित करता है।

अनुप्रयोग और विविधताएं

फीड-फॉरवर्ड नेटवर्क का उपयोग विभिन्न डोमेन में किया जाता है। कंप्यूटर विज़न में, कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) स्वाभाविक रूप से फीड-फॉरवर्ड होते हैं, जिसमें छवि विभाजन के लिए U-Net (यू-नेट) जैसी आर्किटेक्चर शामिल हैं। प्राकृतिक भाषा प्रसंस्करण में, फीड-फॉरवर्ड परतें बड़े भाषा मॉडल जैसे GPT और Claude में उपयोग किए जाने वाले ट्रांसफॉर्मर का अभिन्न अंग हैं। NVIDIA, AMD, इंटेल, और क्वालकॉम जैसी कंपनियों के हार्डवेयर त्वरक फीड-फॉरवर्ड गणना के केंद्रीय मैट्रिक्स गुणन के लिए अनुकूलित हैं।

विविधताओं में क्रॉस-अटेंशन तंत्र शामिल हैं जो एनकोडर और डिकोडर फीड-फॉरवर्ड पथों को जोड़ते हैं, और पोज़िशनल एनकोडिंग जो क्रम जानकारी प्रदान करते हैं। आरएलएआईएफ (एआई फीडबैक से सुदृढीकरण सीखना) और पाठ्यक्रम सीखना जैसी उन्नत प्रशिक्षण विधियाँ मॉडल व्यवहार को और परिष्कृत करती हैं। फीड-फॉरवर्ड नेटवर्क विशेष हार्डवेयर डिज़ाइन में भी दिखाई देते हैं, जैसे कि ग्रोक और संबा-नोवा से, जो कम-विलंबता अनुमान के लिए अनुकूलित हैं।

सीमाएं और भविष्य की दिशाएं

उनकी सफलता के बावजूद, फीड-फॉरवर्ड नेटवर्क में सीमाएं हैं। उनमें पिछले इनपुट की अंतर्निहित स्मृति की कमी होती है, जिससे बाहरी तंत्र के बिना अनुक्रमिक डेटा के लिए वे अनुपयुक्त होते हैं। वे कम्प्यूटेशनल रूप से गहन भी हो सकते हैं, जिसके लिए बड़ी मात्रा में ऊर्जा और विशेष हार्डवेयर की आवश्यकता होती है। अनुसंधान अधिक कुशल आर्किटेक्चर पर जारी है, जैसे कि मिश्रण-ऑफ-एक्सपर्ट्स परतें जो प्रति इनपुट फीड-फॉरवर्ड पैरामीटर के केवल एक सबसेट को सक्रिय करती हैं, और उनके सैद्धांतिक गुणों को समझने पर।

2020 के मध्य तक, फीड-फॉरवर्ड एआई में प्रमुख प्रतिमान बना हुआ है, जिसमें स्टैनफोर्ड एआई लैब और एमआईटी सीएसएआईएल जैसे शैक्षणिक संस्थानों के साथ-साथ उद्योग प्रयोगशालाओं से चल रहे नवाचार शामिल हैं। फीड-फॉरवर्ड डिज़ाइन की सरलता और मापनीयता अनुसंधान और तैनात प्रणालियों दोनों में उनकी निरंतर प्रासंगिकता सुनिश्चित करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:neural-networks·machine-learning·deep-learning·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास