अनुकूली क्षण अनुमान, जिसे आमतौर पर एडम के नाम से जाना जाता है, मशीन लर्निंग मॉडल को प्रशिक्षित करने के लिए एक अनुकूलन एल्गोरिदम है। इसे मॉडल मापदंडों को पुनरावृत्त रूप से अद्यतन करके एक उद्देश्य फलन, आमतौर पर एक हानि फलन, को न्यूनतम करने के लिए डिज़ाइन किया गया है। एडम दो अन्य स्टोकेस्टिक ग्रेडिएंट डिसेंट (एसजीडी) विस्तारों के लाभों को जोड़ता है: संवेग, जो पिछले ग्रेडिएंट्स को संचित करके अभिसरण को तेज करता है, और आरएमएसप्रॉप, जो हाल के ग्रेडिएंट्स के परिमाण के आधार पर प्रति पैरामीटर सीखने की दर को अनुकूलित करता है। यह दोहरी तंत्र एडम को विरल ग्रेडिएंट्स और शोर वाले डेटा को प्रभावी ढंग से संभालने की अनुमति देता है, जिससे यह डीप लर्निंग और तंत्रिका नेटवर्क प्रशिक्षण में एक लोकप्रिय विकल्प बन जाता है।
एडम को 2014 में डिडेरिक पी. किंग्मा और जिमी बा द्वारा लिखित एक शोधपत्र, "एडम: ए मेथड फॉर स्टोकेस्टिक ऑप्टिमाइज़ेशन" में प्रस्तुत किया गया था। तब से यह एल्गोरिदम कई मशीन लर्निंग कार्यों के लिए एक डिफ़ॉल्ट अनुकूलक बन गया है, विशेष रूप से बड़े भाषा मॉडल और अन्य जटिल ट्रांसफॉर्मर-आधारित आर्किटेक्चर के प्रशिक्षण में। इसकी लोकप्रियता इसकी दक्षता और पूर्ण-मैट्रिक्स अनुकूलन विधियों की तुलना में अपेक्षाकृत कम मेमोरी आवश्यकताओं से उपजी है।
एल्गोरिदम अवलोकन
एडम प्रत्येक पैरामीटर के लिए दो चलती औसत बनाए रखता है: ग्रेडिएंट्स का पहला क्षण (माध्य) और दूसरा क्षण (अकेंद्रित विचरण)। इन औसतों को प्रत्येक पुनरावृत्ति पर अद्यतन किया जाता है, और पैरामीटर अद्यतन की गणना पूर्वाग्रह-सही अनुमानों का उपयोग करके की जाती है। यह विधि एडाग्रैड के लाभों को जोड़ती है, जो विरल ग्रेडिएंट्स के साथ अच्छी तरह से काम करता है, और आरएमएसप्रॉप, जो गैर-स्थिर उद्देश्यों को संभालता है। एल्गोरिदम दो हाइपरपैरामीटर का उपयोग करता है, जिन्हें आमतौर पर बीटा1 और बीटा2 के रूप में दर्शाया जाता है, जो क्षण अनुमानों की घातीय क्षय दरों को नियंत्रित करते हैं। व्यवहार में, बीटा1 के लिए 0.9 और बीटा2 के लिए 0.999 के डिफ़ॉल्ट मान, संख्यात्मक स्थिरता के लिए एक छोटे एप्सिलॉन के साथ, आमतौर पर उपयोग किए जाते हैं।
एडम के लिए अद्यतन नियम में पक्षपाती पहले और दूसरे क्षण अनुमानों की गणना करना शामिल है, फिर पैरामीटर अद्यतन करने से पहले उनके आरंभिकरण पूर्वाग्रह को सही करना शामिल है। प्रत्येक पैरामीटर के लिए चरण आकार दूसरे क्षण अनुमान के वर्गमूल के व्युत्क्रम द्वारा मापा जाता है, जिससे बड़े ग्रेडिएंट्स वाले पैरामीटर छोटे कदम उठा सकते हैं और छोटे ग्रेडिएंट्स वाले बड़े कदम उठा सकते हैं। यह प्रति-पैरामीटर अनुकूली सीखने की दर अक्सर मानक स्टोकेस्टिक ग्रेडिएंट डिसेंट की तुलना में तेज़ और अधिक स्थिर अभिसरण की ओर ले जाती है।
स्टोकेस्टिक ग्रेडिएंट डिसेंट से संबंध
एडम स्टोकेस्टिक-ग्रेडिएंट-डिसेंट (एसजीडी) का एक प्रकार है, जो मशीन लर्निंग में एक मौलिक अनुकूलन विधि है। एसजीडी मॉडल मापदंडों को प्रशिक्षण डेटा के एक छोटे बैच पर गणना किए गए उद्देश्य फलन के ग्रेडिएंट के विपरीत दिशा में ले जाकर अद्यतन करता है। प्रभावी होते हुए भी, एसजीडी सीखने की दर की पसंद के प्रति संवेदनशील हो सकता है और विरल या शोर वाले ग्रेडिएंट्स के साथ संघर्ष कर सकता है। एडम ग्रेडिएंट्स के पहले क्षण (माध्य) और दूसरे क्षण (अकेंद्रित विचरण) के दो अतिरिक्त अनुमानों को बनाए रखकर इन मुद्दों को संबोधित करता है। इन अनुमानों का उपयोग पैरामीटर अद्यतनों को मापने के लिए किया जाता है, जो प्रति-पैरामीटर अनुकूली सीखने की दर प्रदान करता है।
एल्गोरिदम अवलोकन
एडम ग्रेडिएंट्स के पहले और दूसरे क्षणों के अनुमानों से प्रत्येक पैरामीटर के लिए अनुकूली सीखने की दर की गणना करता है। प्रत्येक पुनरावृत्ति पर, यह दो घातीय रूप से क्षय होने वाली चलती औसत बनाए रखता है: एक ग्रेडिएंट के लिए (पहला क्षण) और एक वर्ग ग्रेडिएंट के लिए (दूसरा क्षण)। इन्हें अक्सर m और v के रूप में संदर्भित किया जाता है। प्रारंभिक चरणों में शून्य की ओर पूर्वाग्रह को सही करने के लिए, एल्गोरिदम में पूर्वाग्रह-सुधार शर्तें शामिल हैं।
एक विशिष्ट अद्यतन चरण निम्नानुसार आगे बढ़ता है: मापदंडों के संबंध में हानि के ग्रेडिएंट की गणना करें, पक्षपाती पहले और दूसरे क्षण अनुमानों को अद्यतन करें, पूर्वाग्रह को सही करें, और फिर इन सही क्षणों का उपयोग करके मापदंडों को अद्यतन करें। एल्गोरिदम में तीन मुख्य हाइपरपैरामीटर हैं: सीखने की दर, और क्षण अनुमानों के लिए दो क्षय दरें (आमतौर पर बीटा1 और बीटा2 के रूप में दर्शाया जाता है)। एडम को पेश करने वाले शोधपत्र ने बीटा1 के लिए 0.9, बीटा2 के लिए 0.999, और शून्य से विभाजन से बचने के लिए एक छोटे एप्सिलॉन के डिफ़ॉल्ट मानों की सिफारिश की।
डीप लर्निंग में अनुप्रयोग
एडम अपनी मजबूती और उपयोग में आसानी के कारण डीप लर्निंग में एक मानक अनुकूलक बन गया है। यह ट्रांसफॉर्मर मॉडल के प्रशिक्षण के लिए विशेष रूप से प्रभावी है, जिसमें बड़े भाषा मॉडल और जनरेटिव एआई सिस्टम में उपयोग किए जाने वाले मॉडल शामिल हैं। कई फ्रेमवर्क और प्लेटफॉर्म, जैसे टेंसरफ्लो और पायटॉर्च, में एडम कार्यान्वयन शामिल हैं, जो इसे कई चिकित्सकों के लिए एक डिफ़ॉल्ट विकल्प बनाता है। विरल ग्रेडिएंट्स को संभालने की इसकी क्षमता और अपेक्षाकृत तेज़ अभिसरण ने इसके व्यापक रूप से अपनाने में योगदान दिया है।
विविधताएं और विस्तार
एडम की कई विविधताएं विशिष्ट सीमाओं को संबोधित करने के लिए विकसित की गई हैं। उदाहरण के लिए, एडमडब्ल्यू वजन क्षय को अनुकूलन चरणों से अलग करता है, जिसे कुछ डीप लर्निंग कार्यों में सामान्यीकरण में सुधार करने के लिए दिखाया गया है। एएमएसग्रैड दूसरे क्षण अद्यतन को संशोधित करता है ताकि यह सुनिश्चित किया जा सके कि सीखने की दर में वृद्धि न हो, जो कुछ सेटिंग्स में हो सकती है। ये विविधताएं विशिष्ट व्यवहारों को समायोजित करते हुए मूल अनुकूली क्षण तंत्र को बनाए रखती हैं।
अनुप्रयोग और प्रभाव
एडम का व्यापक रूप से ट्रांसफॉर्मर-आधारित मॉडल के प्रशिक्षण में उपयोग किया जाता है, जिसमें आधुनिक जनरेटिव एआई सिस्टम और बड़े भाषा मॉडल को शक्ति प्रदान करने वाले मॉडल शामिल हैं। हाइपरपैरामीटर विकल्पों के प्रति इसकी मजबूती और बड़े पैमाने की समस्याओं को संभालने की क्षमता ने इसे कई डीप लर्निंग फ्रेमवर्क में एक डिफ़ॉल्ट विकल्प बना दिया है। एल्गोरिदम की दक्षता विशेष रूप से मूल्यवान है जब एनवीडिया जीपीयू या एडब्ल्यूएस ट्रेनियम चिप्स जैसे हार्डवेयर पर प्रशिक्षण होता है, जहां कम्प्यूटेशनल संसाधन पर्याप्त लेकिन फिर भी सीमित होते हैं। स्टैनफोर्ड एआई लैब, बर्कले एआई रिसर्च, और टोरंटो विश्वविद्यालय जैसे संस्थानों में शोध समूहों ने इसकी सैद्धांतिक समझ और व्यावहारिक परिशोधन में योगदान दिया है।