अंग्रेज़ी से अनुवादित

ग्रेडिएंट डिसेंट एक पुनरावृत्तीय अनुकूलन एल्गोरिदम है जो पैरामीटरों को ग्रेडिएंट के विपरीत दिशा में अद्यतन करके एक लॉस फ़ंक्शन को न्यूनतम करता है, जो अधिकांश मशीन लर्निंग मॉडलों के प्रशिक्षण तंत्र का मूल बनाता है।

ग्रेडिएंट डिसेंट एक पुनरावृत्तीय अनुकूलन एल्गोरिदम है जिसका उपयोग हानि-फलन को न्यूनतम करने के लिए किया जाता है, जिसमें मॉडल के मापदंडों को बार-बार ग्रेडिएंट के विपरीत दिशा में समायोजित किया जाता है - ग्रेडिएंट आंशिक अवकलजों का सदिश है जो हानि में सबसे तीव्र वृद्धि की ओर इशारा करता है। यह वह मूल तंत्र है जिसके द्वारा अधिकांश आधुनिक मशीन-लर्निंग और डीप-लर्निंग प्रणालियाँ डेटा से सीखती हैं, जो सरल रैखिक प्रतिगमन से लेकर सैकड़ों अरब मापदंडों वाले मॉडल तक सब कुछ के प्रशिक्षण का आधार है।

इतिहास

यह विधि कंप्यूटिंग से पहले की है: फ्रांसीसी गणितज्ञ ऑगस्टिन-लुई कॉची ने 1847 में ग्रेडिएंट-आधारित न्यूनीकरण का एक संस्करण वर्णित किया था। इसका सांख्यिकीय रूप, स्टोकेस्टिक सन्निकटन, 1951 में हर्बर्ट रॉबिंस और सटन मुनरो द्वारा औपचारिक रूप से प्रस्तुत किया गया था। ग्रेडिएंट डिसेंट एआई का केंद्रीय हिस्सा तब बना जब इसे 1980 के दशक में बैकप्रॉपैगेशन के साथ जोड़ा गया, जो बहु-परत तंत्रिका-नेटवर्क के माध्यम से ग्रेडिएंट की कुशलता से गणना करने का मानक तरीका बन गया, और इसका व्यावहारिक प्रभुत्व बड़े डेटासेट और जीपीयू हार्डवेयर की उपलब्धता के साथ बढ़ा, जो विधि के लिए आवश्यक कई छोटे अद्यतन चरणों को चलाने में सक्षम है।

विविधताएँ

बैच ग्रेडिएंट डिसेंट प्रत्येक अद्यतन से पहले पूरे डेटासेट पर ग्रेडिएंट की गणना करता है, जो सटीक है लेकिन बड़े डेटासेट के लिए धीमा और मेमोरी-गहन है। स्टोकेस्टिक ग्रेडिएंट डिसेंट (एसजीडी) एक उदाहरण, या अधिक सामान्यतः एक छोटे "मिनी-बैच" का उपयोग करके मापदंडों को अद्यतन करता है, जो प्रति चरण कुछ सटीकता का व्यापार करता है लेकिन अधिक लगातार अद्यतन और बेहतर स्केलेबिलिटी प्रदान करता है। मोमेंटम विधियाँ शोर भरे अद्यतनों को सुचारू करने और सुसंगत दिशाओं में अभिसरण को तेज करने के लिए पिछले ग्रेडिएंट्स का एक चलता औसत संचित करती हैं। अनुकूली विधियाँ, विशेष रूप से एडम, जिसे 2014 में डीडेरिक किंगमा और जिमी बा द्वारा प्रस्तुत किया गया था, ग्रेडिएंट के पहले और दूसरे क्षणों के अनुमानों के आधार पर प्रति-पैरामीटर सीखने की दर बनाए रखती हैं, और एडम या इसके विविधताएँ लगभग सभी समकालीन बड़े-भाषा-मॉडल के प्रशिक्षण के लिए डिफ़ॉल्ट अनुकूलक हैं।

व्यावहारिक विचार

सीखने की दर, जो प्रत्येक अद्यतन चरण के आकार को मापती है, ग्रेडिएंट डिसेंट में सबसे महत्वपूर्ण हाइपरपैरामीटर है: बहुत अधिक होने पर प्रशिक्षण विचलित या दोलन करता है, बहुत कम होने पर प्रशिक्षण अव्यावहारिक रूप से धीमा होता है या हानि परिदृश्य के खराब क्षेत्रों में फंस जाता है। आधुनिक प्रशिक्षण रन आमतौर पर एक सीखने की दर अनुसूची का उपयोग करते हैं जो धीरे-धीरे गर्म होती है और फिर प्रशिक्षण के दौरान घटती है। चूंकि गहरे नेटवर्क की हानि सतहें अत्यधिक उच्च-आयामी और गैर-उत्तल होती हैं, व्यवहार में ग्रेडिएंट डिसेंट एक सच्चा वैश्विक न्यूनतम नहीं खोजता है; इसके बजाय यह अनुभवजन्य अवलोकन पर निर्भर करता है कि अति-पैरामीटरयुक्त नेटवर्क में ग्रेडिएंट डिसेंट द्वारा पाए गए कई स्थानीय न्यूनतम अच्छी तरह से सामान्यीकरण करते हैं, एक घटना जो अभी भी सैद्धांतिक रूप से पूरी तरह से समझाई नहीं गई है। ग्रेडिएंट डिसेंट बहुत गहरे या आवर्ती आर्किटेक्चर में लुप्त होते और विस्फोटक ग्रेडिएंट जैसी समस्याओं के लिए भी संवेदनशील है, जिसने एलएसटीएम के गेटिंग तंत्र और बाद में ट्रांसफॉर्मर आर्किटेक्चर में उपयोग किए जाने वाले अवशिष्ट कनेक्शन जैसे नवाचारों को प्रेरित किया।

अन्य अवधारणाओं से संबंध

ग्रेडिएंट डिसेंट वह है जिसके साथ एक नेटवर्क का हानि-फलन न्यूनतम किया जाता है, लेकिन यह अकेले एक उपयोगी मॉडल उत्पन्न करने के लिए पर्याप्त नहीं है: नियमितीकरण जैसी तकनीकों के बिना, ग्रेडिएंट डिसेंट प्रशिक्षण सेट को याद करके प्रशिक्षण हानि को शून्य की ओर ले जाएगा, जिसे अति-अनुकूलन के रूप में जाना जाता है। सुदृढीकरण-सीखने में, ग्रेडिएंट-आधारित विधियाँ एक एजेंट के अपेक्षित पुरस्कार को अनुकूलित करने के लिए अनुकूलित की जाती हैं, न कि एक निश्चित लेबल वाली हानि को, जो नीति-ग्रेडिएंट एल्गोरिदम का आधार बनती हैं जो आरएलएचएफ के साथ प्रशिक्षित प्रणालियों में उपयोग की जाती हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·deep-learning·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास