फेडरेटेड लर्निंग एक मशीन लर्निंग तकनीक है जिसमें एक साझा मॉडल को कई विकेंद्रीकृत डिवाइसों या सर्वरों पर प्रशिक्षित किया जाता है, जिनमें से प्रत्येक के पास अपना स्थानीय डेटा होता है, बिना उस कच्चे डेटा को कभी केंद्रीकृत किए। केंद्रीय सर्वर पर डेटा अपलोड करने के बजाय, प्रत्येक प्रतिभागी मॉडल में स्थानीय रूप से एक अद्यतन की गणना करता है और केवल उस अद्यतन को भेजता है, जिसे अन्य प्रतिभागियों के अद्यतनों के साथ जोड़कर एक साझा वैश्विक मॉडल को बेहतर बनाया जाता है।
इतिहास और प्रेरणा
गूगल ने 2016 की एक ब्लॉग पोस्ट और साथ की शोधपत्र में फेडरेटेड लर्निंग के लिए शब्द और एक व्यावहारिक प्रणाली पेश की, जो Gboard, इसके मोबाइल कीबोर्ड ऐप से प्रेरित थी, जो उपयोगकर्ताओं द्वारा टाइप किए गए पाठ का उपयोग करके अगले-शब्द भविष्यवाणी में सुधार करना चाहता था, बिना उस अक्सर संवेदनशील पाठ को गूगल के सर्वरों पर अपलोड किए। इस तकनीक ने गहन-शिक्षण युग की बड़े प्रशिक्षण डेटा की भूख और डेटा गोपनीयता तथा विनियमन के बढ़ते चिंताओं के बीच बढ़ते तनाव को संबोधित किया, जो EU के GDPR जैसे कानूनों में औपचारिक रूप से निहित है। इसने एज डिवाइसों, फोन, अस्पतालों के स्थानीय सर्वरों, या बैंक शाखाओं पर उत्पन्न डेटा से लाभ उठाने का एक तरीका पेश किया, बिना उस डेटा को केंद्रीकृत करने के कानूनी, तार्किक, या नैतिक बोझ के।
यह कैसे काम करता है
मानक फेडरेटेड औसत एल्गोरिथ्म में, एक केंद्रीय सर्वर वर्तमान वैश्विक तंत्रिका नेटवर्क मॉडल को भाग लेने वाले डिवाइसों के एक नमूने को भेजता है। प्रत्येक डिवाइस सामान्य ग्रेडिएंट डिसेंट का उपयोग करके अपने स्थानीय डेटा के साथ मॉडल को संक्षेप में प्रशिक्षित करता है, फिर परिणामी मॉडल अद्यतन को, डेटा को नहीं, सर्वर पर वापस भेजता है। सर्वर सभी भाग लेने वाले डिवाइसों के अद्यतनों का औसत निकालकर एक बेहतर वैश्विक मॉडल तैयार करता है, और यह चक्र कई दौरों में दोहराया जाता है। क्योंकि कच्चा डेटा कभी डिवाइस से बाहर नहीं जाता, फेडरेटेड लर्निंग केंद्रीकृत प्रशिक्षण पर एक संरचनात्मक गोपनीयता लाभ प्रदान करता है, हालांकि यह अपने आप में गोपनीयता-प्रमाण नहीं है; अंतर गोपनीयता और सुरक्षित एकत्रीकरण जैसी तकनीकें अक्सर मॉडल अद्यतनों को व्यक्तिगत उपयोगकर्ताओं के बारे में जानकारी लीक करने से रोकने के लिए शीर्ष पर जोड़ी जाती हैं, जो व्यापक AI सुरक्षा और डेटा-शासन कार्य से निकटता से संबंधित चिंता है।
अनुप्रयोग और सीमाएँ
फेडरेटेड लर्निंग को गूगल के Gboard कीबोर्ड भविष्यवाणी और एंड्रॉइड की गाना-पहचान सुविधा में तैनात किया गया है, और स्वास्थ्य सेवा में इसका पता लगाया गया है, जहां अस्पताल संस्थानों के बीच रोगी रिकॉर्ड साझा किए बिना नैदानिक मॉडल को सहयोगात्मक रूप से प्रशिक्षित करना चाहते हैं, और वित्त में, बैंकों के बीच धोखाधड़ी का पता लगाने के लिए। इसकी सीमाएँ महत्वपूर्ण हैं: डिवाइस कंप्यूट, कनेक्टिविटी, और उनके पास मौजूद डेटा की मात्रा में व्यापक रूप से भिन्न होते हैं, जो एकत्रित मॉडल को सबसे सक्रिय या सबसे अच्छे-जुड़े प्रतिभागियों की ओर पक्षपाती बना सकता है; संचार लागत गैर-तुच्छ है, क्योंकि मॉडल अद्यतनों को हर दौर में प्रसारित किया जाना चाहिए; और कई अविश्वसनीय, कम-शक्ति वाले डिवाइसों में प्रशिक्षण का समन्वय एक अच्छी तरह से नियंत्रित क्लस्टर पर प्रशिक्षण की तुलना में अधिक जटिल है। 2020 के दशक के मध्य तक, फेडरेटेड लर्निंग एक विशेष तकनीक बनी हुई है जिसका उपयोग वहां किया जाता है जहां डेटा को केंद्रीकृत नहीं किया जा सकता या नहीं किया जाना चाहिए, बजाय बड़े मॉडल जैसे बड़े भाषा मॉडल के पारंपरिक केंद्रीकृत प्रशिक्षण के डिफ़ॉल्ट विकल्प के, जो अभी भी मुख्य रूप से कॉमन क्रॉल जैसे स्रोतों से लिए गए केंद्रीकृत, क्यूरेटेड डेटासेट पर प्रशिक्षित होते हैं।