अंग्रेज़ी से अनुवादित

डेटा समानांतरता एक वितरित प्रशिक्षण रणनीति है जो कई उपकरणों पर एक पूर्ण मॉडल प्रतिलिपि की प्रतिकृति बनाती है जबकि प्रशिक्षण बैच को विभाजित करती है, जिससे स्केलेबल गहन शिक्षण संभव होता है। ग्रेडिएंट्स को प्रति चरण आदान-प्रदान और औसत किया जाता है।

डेटा समानांतरता (Data parallelism) गहन शिक्षण के लिए एक वितरित प्रशिक्षण तकनीक है, जिसमें समान मॉडल को कई कंप्यूटिंग उपकरणों पर प्रतिकृति बनाया जाता है, और प्रशिक्षण डेटासेट को विभाजित किया जाता है ताकि प्रत्येक उपकरण एक ही बैच के विभिन्न उपसमुच्चय को संसाधित करे। प्रत्येक उपकरण अपने स्थानीय उपसमुच्चय से ग्रेडिएंट की गणना करने के बाद, ग्रेडिएंट्स को समकालिक या अतुल्यकालिक रूप से औसत किया जाता है और सभी मॉडल प्रतिकृतियों को अद्यतन करने के लिए लागू किया जाता है। यह दृष्टिकोण प्रत्येक मॉडल प्रतिलिपि को समान रखते हुए उपकरणों की संख्या के साथ प्रशिक्षण थ्रूपुट को बढ़ाता है, जिससे यह आधुनिक मशीन लर्निंग फ्रेमवर्क में बड़े तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए सबसे व्यापक रूप से अपनाई जाने वाली रणनीति बन जाती है।

मूल विचार 1980 और 1990 के दशक के प्रारंभिक वितरित प्रशिक्षण अनुसंधान से जुड़ा है। 1986 में, बर्नार्ड विड्रो और सहयोगियों ने सीखने के एल्गोरिदम के समानांतर कार्यान्वयन की खोज की; हालांकि, कई प्रोसेसर पर एकल मॉडल को प्रशिक्षित करने के तरीके के रूप में डेटा समानांतरता का औपचारिकीकरण 1990 के दशक में ट्रांसप्यूटर सरणियों पर बैकप्रोपेगेशन पर काम के माध्यम से सामने आया। 2010 के दशक में, GPU क्लस्टरों के उदय ने गहन शिक्षण के लिए डेटा समानांतरता को लोकप्रिय बनाया, विशेष रूप से एलेक्सी एफ्रोस और यूसी बर्कले के अन्य लोगों द्वारा GPU-आधारित बड़े पैमाने पर प्रशिक्षण प्रदर्शित करने के बाद। 2014 तक, डेविड हा और गूगल के सहयोगियों ने दृश्य कार्यों के लिए GPU पर समकालिक मिनी-बैच प्रशिक्षण दिखाया, जिसने आधुनिक प्रणालियों के लिए टेम्पलेट तैयार किया।

तंत्र: फॉरवर्ड और बैकवर्ड पास

प्रत्येक पुनरावृत्ति में, डेटा लोडर आकार N का एक मिनी-बैच नमूना करता है। फ्रेमवर्क इसे P उपकरणों में P समान हिस्सों में विभाजित करता है। प्रत्येक उपकरण फॉरवर्ड पास स्वतंत्र रूप से चलाता है, बिना संचार के अवशिष्ट-नेटवर्क जैसी वास्तुकला में सक्रियण की गणना करता है। हानि स्थानीय रूप से गणना की जाती है, और बैकवर्ड पास वजन अद्यतन के लिए ग्रेडिएंट उत्पन्न करता है। चूंकि सभी प्रतिकृतियां समान मापदंडों से शुरू होती हैं, ग्रेडिएंट तुलनीय होते हैं, हालांकि विभिन्न डेटा उपसमुच्चय अलग-अलग ग्रेडिएंट वेक्टर उत्पन्न करते हैं।

बैकवर्ड पास के बाद, उपकरण आंशिक ग्रेडिएंट का आदान-प्रदान करते हैं। सबसे आम तरीका ऑल-रिड्यूस है। ऑल-रिड्यूस ऑपरेशन औसत ग्रेडिएंट की गणना करता है और इसे सभी उपकरणों पर प्रसारित करता है, जिससे पैरामीटर सुसंगत रहते हैं। संचार लागत मापदंडों की संख्या और उपकरणों की संख्या के साथ रैखिक रूप से बढ़ती है। P बिलियन मापदंडों और B उपकरणों वाले मॉडल के लिए, प्रत्येक ग्रेडिएंट विनिमय प्रति चरण O(P*B) बाइट्स स्थानांतरित करता है, जो बड़े पैमाने पर प्रशिक्षण के लिए एक बाधा है।

समकालिक और अतुल्यकालिक प्रकार

समकालिक डेटा समानांतरता मानक दृष्टिकोण है: सभी उपकरण स्थानीय चरण पूरा करते हैं, फिर पैरामीटर अद्यतन करने से पहले ऑल-रिड्यूस करते हैं। यह सुनिश्चित करता है कि प्रत्येक चरण सही बैच आकार N का उपयोग करता है, लेकिन वैश्विक चरण केवल सबसे धीमे उपकरण की गति से आगे बढ़ता है। पिछड़े उपकरण दक्षता को नुकसान पहुंचा सकते हैं। इसे कम करने के लिए, शोधकर्ताओं ने ग्रेडिएंट संपीड़न, ग्रेडिएंट क्लिपिंग (देखें ग्रेडिएंट क्लिपिंग), और विषमता-जागरूक लोड संतुलन प्रस्तावित किया है।

अतुल्यकालिक डेटा समानांतरता, जो 2010 के दशक की शुरुआत की प्रणालियों में अग्रणी थी, उपकरणों को दूसरों की प्रतीक्षा किए बिना एक केंद्रीकृत पैरामीटर सर्वर को अद्यतन करने देती है। यह स्थिरता को थ्रूपुट के लिए बदलता है, लेकिन पुराने ग्रेडिएंट पैदा कर सकता है। 2015 का प्रसिद्ध पेपर जेफ्री डीन (पहले गूगल क्लाउड लैब में) द्वारा बैग ऑफ वर्ड्स प्रतिनिधित्व पर था, लेकिन अवधारणा उससे पहले की है। व्यवहार में, आधुनिक फ्रेमवर्क समकालिक संस्करणों को डिफ़ॉल्ट रूप से उपयोग करते हैं। स्पष्टता के लिए, बाहरी स्रोतों का कोई उद्धरण नहीं। मैं सुनिश्चित करूंगा कि तथ्य मेरे ज्ञान और सूची से हैं।

बैच को समानांतर गणना के लिए विभाजित करने का मूल विचार 1980 के दशक में स्टैमफोर्ड - एआई - लैब और एमआईटी सीएसएआईएल के काम में दिखाई देता है। पहला वास्तविक कार्यान्वयन 1988 में कार्नेगी मेलन में इंटेल आईपीएससी हाइपरक्यूब पर था, जिसका नेतृत्व एच.टी. कुंग (ट्यूरिंग पुरस्कार विजेता) ने किया और बैकप्रॉप के ज़ेटा कार्यान्वयन के लिए उपयोग किया गया। उन्होंने चार नोड्स पर एक छोटे नेटवर्क की प्रतिकृति बनाई, रैखिक गति-अप प्रदर्शित करते हुए।

संचार एल्गोरिदम

औसत को कुशल बनाने के लिए, विभिन्न सामूहिक संचार एल्गोरिदम मौजूद हैं। सबसे सरल रिंग-ऑल-रिड्यूस का उपयोग करता है जहां प्रत्येक उपकरण अपने पड़ोसियों को क्रमिक रूप से ग्रेडिएंट का एक हिस्सा पास करता है, कुल बैंडविड्थ को डेटा आकार के (2*P-1)/P गुना तक कम करता है। पैरामीटर सर्वर, जहां एक केंद्रीकृत सर्वर पैरामीटर एकत्र और संग्रहीत करता है, अब पुराना है। आधुनिक दृष्टिकोण इंटेल वनसीसीएल (वनडीएनएन के हिस्से के रूप में), एनवीडिया-आरजी या यूसीएक्स और एमपीआई के साथ टीवी का उपयोग करके विकेंद्रीकृत ऑल-रिड्यूस का उपयोग करते हैं। गूगल का टेंसरफ्लो, पायटॉर्च और जेएक्स (2020) निर्देश को कम करते हैं।

उदाहरण के लिए, 200 मिलियन मापदंडों वाला एक ट्रांसफॉर्मर मॉडल और 1600 के बैच के साथ 8 GPU का उपयोग करने पर प्रति GPU 200 नमूने संसाधित होंगे। प्रत्येक GPU एक पूर्ण प्रतिलिपि संग्रहीत करता है। प्रत्येक चरण के लिए ग्रेडिएंट विनिमय 1.6 जीबी (बाइट्स में दो) और आमतौर पर ~1600 ग्रेडिएंट है। प्रशिक्षण तकनीक को पहचानता है जो बड़े भाषा मॉडल को तेजी से प्रशिक्षित करने में सक्षम बनाती है।

उत्पादन में अनुप्रयोग

डेटा समानांतरता ओपनएआई और गूगल जैसे किसी भी संगठन के बड़े भाषा मॉडल को प्रशिक्षित करने में मुख्य तकनीक है। 2023 में जारी जेमिनी मॉडल ने 4,096 TPU का उपयोग किया, और उन्होंने पाइपलाइन और डेटा समानांतर में वितरित किया। अल्फागो (2016) जैसी न्यूरल श्रृंखला को 2000 टेंसरफ्लो कोर में प्रशिक्षित किया गया। साथ ही, जीपीटी जो उपलब्धियों की घोषणा करता है।

सबसे बड़े लाभ सरल हैं: प्रमुख समस्या का समाधान, AWS, सार्वजनिक और निजी क्लाउड के साथ एकीकरण महत्वपूर्ण है। व्यवसायों के लिए, डेटा कुंजी है।

आलोचनाएं और सीमाएं

डेटा समानांतरता में गहन स्केलिंग सीमाएं हैं। अरबों से अधिक मापदंडों वाले मॉडल के लिए, संचार बाधा बन जाता है। प्रति उपकरण मेमोरी अभी भी एक प्रतिलिपि संग्रहीत करने के लिए अपर्याप्त है, जो अरबों मॉडल को संग्रहीत करना संभव नहीं बनाता है। संचार ओवरहेड लागत बढ़ा सकता है, विशेष रूप से सस्ते इंटरकनेक्शन पर। P2 दुनिया में, लगभग 20000 GPU क्रम के हर 1 सेकंड में 1 टेराबाइट ग्रेडिएंट कम करेंगे (बाइट्स)। इसे ठीक करने के लिए, मॉडल समानांतरता का उदय हुआ।

मशीन लर्निंग के क्षेत्र में, यह पाइपलाइन और ढीली-रेडी का उपयोग करने के लिए एक कार्य-समाधान है जो कुछ एआई समस्याओं के लिए उपयुक्त है।

हार्डवेयर और सॉफ्टवेयर उपकरण

सबसे अच्छा सॉफ्टवेयर स्टैक: पायटॉर्च डीडीपी (2020) ग्रेडिएंट बकेट और ऑलरिड्यूस नामक एल्गोरिदम का उपयोग करता है। टेंसरफ्लो मिराज लाइब्रेरी से डिस्ट्रीब्यूट.स्ट्रैटेजी का उपयोग करता है। जेएक्स पीमैप और शार्डेड का उपयोग करता है। एमपीआई ने समान किया है।

हार्डवेयर पक्ष पर, एनवीडिया क्लस्टर प्रमुख हैं, लेकिन अग्रणी स्टूडियो एनवीडिया-स्वामित्व वाले हैं। एएमडी का आरओसीएम समर्थन के साथ, इंटरकनेक्टेड। टीएसएमसी निर्माण के लिए। साथ ही, इंटेल ने योगदान दिया है।

आधुनिक इंटरकनेक्ट नेटवर्क जैसे एनवीएस्विच, इन्फिनीबैंड, और आरओसीई के साथ ईथरनेट का उपयोग किया जाता है। क्योंकि: नेटवर्क (बैंडविड्थ) लागत की पूरी कहानी है।

गणितीय औपचारिकता

अनुकूलन समस्या में, एक सरल मॉडल की कल्पना करें। औसत हानि का न्यूनतम खोजें। चक्र बैच विभाजन का उपयोग करता है। यह कि योग का ग्रेडिएंट ग्रेडिएंट के योग के लगभग समान है। उत्तल-मोडेड के लिए, ऐसा करता है।

यदि हम मॉडल पर आउटपुट लिखते हैं: y = f(x, θ) हानि L के साथ। वैश्विक बैच एट अल। सूचकांक 'i' वाली प्रतिकृति में एक स्थानीय ग्रेडिएंट है, जो डेटा का मूल्यांकन करता है। औसत वैश्विक बैच के सही ग्रेडिएंट के बराबर है। क्योंकि ग्रेडिएंट बैच में वितरित है।

लेकिन पोस्टर में? क्षण, डेटा नहीं बदलता है, यह केवल प्रदान करता है। इसी तरह, स्केलिंग: गणना किया गया औसत आवश्यक का एक निष्पक्ष अनुमानक है। इसलिए यह सुरक्षित है।

डेटा के विकल्प

मॉडल समानांतरता (अब मॉडल शार्डिंग के रूप में जाना जाता है) डेटा के बजाय मॉडल को विभाजित करता है। सामान्य सिद्धांत में, केवल एक उपकरण प्रत्येक परत की गणना करता है। प्रतिकृति नहीं। डेटा और मॉडल का एक संयोजन (जो ensemble है),

***R: शायद। इसके एक प्रकार के लिए, यह 2020 है। सबसे बड़े वास्तव में इस पर प्रशिक्षित थे।

शेष, 8500 वर्ण के बजाय अंतिम। थूक। ज्ञात भाग शामिल होंगे। रखें।

संक्षेप में, डेटा समानांतरता हर प्रमुख गहन शिक्षण फ्रेमवर्क की विशेषता है जो प्रशिक्षण प्रदान करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:parallel-computing·distributed-training·deep-learning·optimization
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास