फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स एक मशीन लर्निंग प्रतिमान है जो प्रशिक्षण से पहले भाग लेने वाले डेटा स्रोतों को कोहोर्ट्स, या समूहों, में व्यवस्थित करके फ़ेडरेटेड लर्निंग का विस्तार करता है। मानक फ़ेडरेटेड लर्निंग में, एक केंद्रीय सर्वर स्थानीय डेटा रखने वाले कई क्लाइंट्स से मॉडल अपडेट का समन्वय करता है, बिना कच्चे डेटा को स्थानांतरित किए। फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स कोहोर्टिंग की एक परत जोड़ता है, जहां क्लाइंट्स को डेटा समानता, सांख्यिकीय गुणों, या अन्य मानदंडों के आधार पर समूहीकृत किया जाता है, और मॉडल प्रशिक्षण इन कोहोर्ट्स के भीतर या उनके पार होता है। इस दृष्टिकोण का उद्देश्य मॉडल वैयक्तिकरण में सुधार करना, संचार ओवरहेड को कम करना, और डेटा एक्सपोज़र को केवल एक कोहोर्ट के भीतर सीमित करके गोपनीयता बढ़ाना है।
यह अवधारणा Machine learning और Artificial intelligence में मौलिक कार्य पर आधारित है, विशेष रूप से विकेंद्रीकृत डेटा पर मॉडल प्रशिक्षित करने की आवश्यकता पर। पारंपरिक केंद्रीकृत प्रशिक्षण के लिए सभी डेटा को एक ही स्थान पर एकत्र करने की आवश्यकता होती है, जो गोपनीयता संबंधी चिंताएं और तार्किक चुनौतियां पैदा करता है। फ़ेडरेटेड लर्निंग, 2016 में Google DeepMind और Google Cloud (तब Google का हिस्सा) के शोधकर्ताओं द्वारा पेश किया गया, ने कच्चे डेटा के बजाय मॉडल अपडेट साझा करने की अनुमति देकर इसे संबोधित किया। फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स एक मध्यवर्ती समूहीकरण चरण पेश करके इसे परिष्कृत करता है, जो स्थिर या प्रशिक्षण के दौरान गतिशील रूप से समायोजित किया जा सकता है।
प्रेरणा और लाभ
फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स के लिए प्राथमिक प्रेरणा वितरित डेटा में विषमता को संबोधित करना है। कई वास्तविक दुनिया के परिदृश्यों में, विभिन्न क्लाइंट्स का डेटा समान रूप से वितरित नहीं होता है; उदाहरण के लिए, विभिन्न अस्पतालों के मेडिकल रिकॉर्ड रोगी जनसांख्यिकी, उपकरण, या कोडिंग प्रथाओं में भिन्न हो सकते हैं। ऐसे डेटा पर एक एकल वैश्विक मॉडल प्रशिक्षित करने से विशिष्ट उपसमूहों के लिए खराब प्रदर्शन हो सकता है। समान डेटा विशेषताओं को साझा करने वाले क्लाइंट्स को कोहोर्ट्स में समूहीकृत करके, मॉडल को प्रत्येक कोहोर्ट के अनुरूप बनाया जा सकता है, जिससे सटीकता और प्रासंगिकता में सुधार होता है।
एक और लाभ संचार दक्षता है। मानक फ़ेडरेटेड लर्निंग में, प्रत्येक क्लाइंट हर दौर में केंद्रीय सर्वर के साथ संवाद करता है। कोहोर्ट्स के साथ, अपडेट को पहले एक कोहोर्ट के भीतर एकत्र किया जा सकता है, जिससे केंद्रीय सर्वर को भेजे जाने वाले संदेशों की संख्या कम हो जाती है। यह सीमित बैंडविड्थ वाले वातावरणों में विशेष रूप से मूल्यवान है, जैसे मोबाइल डिवाइस या एज कंप्यूटिंग सिस्टम। इसके अतिरिक्त, कोहोर्टिंग गोपनीयता बढ़ा सकती है: यदि क्लाइंट केवल एक भरोसेमंद कोहोर्ट के भीतर अपडेट साझा करते हैं, तो केंद्रीय सर्वर से अनुमान हमलों का जोखिम कम हो जाता है, हालांकि केंद्रीय सर्वर अभी भी समग्र प्रक्रिया का समन्वय करता है।
तकनीकी कार्यान्वयन
फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स को कई तरीकों से लागू किया जा सकता है। एक सामान्य दृष्टिकोण मेटाडेटा, जैसे भौगोलिक क्षेत्र, डिवाइस प्रकार, या उपयोगकर्ता जनसांख्यिकी के आधार पर कोहोर्ट्स को परिभाषित करना है। उदाहरण के लिए, उपयोगकर्ता टेक्स्ट पर प्रशिक्षित एक Large language model उपयोगकर्ताओं को भाषा या बोली के आधार पर समूहित कर सकता है। एक अन्य दृष्टिकोण ग्रेडिएंट्स या मॉडल अपडेट के आधार पर कोहोर्ट्स बनाने के लिए क्लस्टरिंग एल्गोरिदम का उपयोग करता है। K-Means Clustering या पदानुक्रमित क्लस्टरिंग जैसी तकनीकों को प्राकृतिक समूहों की पहचान करने के लिए स्थानीय मॉडल मापदंडों पर लागू किया जा सकता है।
प्रशिक्षण के दौरान, प्रत्येक कोहोर्ट का अपना मॉडल इंस्टेंस हो सकता है, जिसे उसके सदस्यों के स्थानीय डेटा का उपयोग करके अपडेट किया जाता है। समय-समय पर, कोहोर्ट मॉडल को एक वैश्विक मॉडल बनाने के लिए एकत्र किया जा सकता है, जिसे फिर आगे परिष्करण के लिए कोहोर्ट्स में पुनर्वितरित किया जाता है। यह federated averaging के समान है लेकिन एक अतिरिक्त पदानुक्रम के साथ। कुछ कार्यान्वयन दो-स्तरीय वास्तुकला का उपयोग करते हैं: एक वैश्विक सर्वर कोहोर्ट-स्तरीय अपडेट का समन्वय करता है, जबकि प्रत्येक कोहोर्ट के पास एक स्थानीय एग्रीगेटर होता है जो अपने क्लाइंट्स का प्रबंधन करता है। यह केंद्रीय सर्वर पर भार कम करता है और कोहोर्ट्स के भीतर अधिक लगातार अपडेट की अनुमति देता है।
अनुप्रयोग
फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स ने स्वास्थ्य देखभाल, वित्त, और उपभोक्ता प्रौद्योगिकी में अनुप्रयोग पाए हैं। स्वास्थ्य देखभाल में, अस्पताल रोगी रिकॉर्ड साझा किए बिना नैदानिक मॉडल प्रशिक्षित करने के लिए सहयोग कर सकते हैं। समान रोगी आबादी (जैसे, बाल चिकित्सा बनाम वयस्क) वाले अस्पतालों को कोहोर्ट करके, मॉडल प्रत्येक समूह के लिए विशेषीकृत किए जा सकते हैं। उदाहरण के लिए, डायबिटिक रेटिनोपैथी का पता लगाने के लिए एक Neural network को समान इमेजिंग उपकरण वाले क्लीनिकों के कोहोर्ट्स पर प्रशिक्षित किया जा सकता है, जिससे विभिन्न सेटिंग्स में सटीकता में सुधार होता है।
वित्त में, बैंक क्षेत्रों या ग्राहक खंडों के लिए विशिष्ट धोखाधड़ी पैटर्न का पता लगाने के लिए कोहोर्टिंग का उपयोग कर सकते हैं। कई बैंकों से लेनदेन डेटा पर प्रशिक्षित एक Deep learning मॉडल, देश द्वारा समूहीकृत, ग्राहक गोपनीयता बनाए रखते हुए स्थानीय धोखाधड़ी प्रवृत्तियों की पहचान कर सकता है। उपभोक्ता प्रौद्योगिकी में, Apple और Samsung Electronics जैसी कंपनियों ने ऑन-डिवाइस वैयक्तिकरण, जैसे कीबोर्ड भविष्यवाणी या फोटो वर्गीकरण के लिए फ़ेडरेटेड लर्निंग का पता लगाया है। उपयोगकर्ताओं को भाषा या उपयोग पैटर्न द्वारा कोहोर्ट करना इन मॉडलों को व्यक्तिगत आवश्यकताओं के प्रति अधिक उत्तरदायी बना सकता है।
चुनौतियां और सीमाएं
इसके लाभों के बावजूद, फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स को कई चुनौतियों का सामना करना पड़ता है। कोहोर्ट्स की इष्टतम संख्या और संरचना निर्धारित करना गैर-तुच्छ है। बहुत कम कोहोर्ट्स विषमता को पकड़ नहीं सकते हैं, जबकि बहुत अधिक ओवरफिटिंग या बढ़ी हुई संचार लागत का कारण बन सकते हैं। गतिशील कोहोर्टिंग, जहां समूह समय के साथ बदलते हैं, जटिलता जोड़ता है और सदस्यता परिवर्तनों को संभालने के लिए मजबूत एल्गोरिदम की आवश्यकता होती है।
कोहोर्टिंग द्वारा गोपनीयता पूरी तरह से हल नहीं होती है। जबकि कच्चा डेटा स्थानीय रहता है, मॉडल अपडेट अभी भी व्यक्तिगत डेटा बिंदुओं के बारे में जानकारी लीक कर सकते हैं। Differential Privacy या सुरक्षित-मल्टी-पार्टी-गणना जैसी तकनीकों को अक्सर मजबूत गारंटी प्रदान करने के लिए कोहोर्टिंग के साथ जोड़ा जाता है। इसके अतिरिक्त, कोहोर्टिंग पूर्वाग्रह पेश कर सकती है यदि कोहोर्ट्स संवेदनशील विशेषताओं के आधार पर बनाए जाते हैं, जिससे असमान मॉडल प्रदर्शन होता है। शोधकर्ताओं को अनजाने भेदभाव से बचने के लिए कोहोर्टिंग मानदंडों को सावधानीपूर्वक डिजाइन करना चाहिए।
भविष्य की दिशाएं
फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स में अनुसंधान जारी है, जिसमें MIT CSAIL, Stanford AI Lab, और BAIR (Berkeley AI Research) जैसे संस्थानों में सक्रिय कार्य हो रहा है। एक दिशा कोहोर्ट असाइनमेंट स्वचालित रूप से निर्धारित करने के लिए Reinforcement learning का उपयोग है। एक और एकीकरण federated transfer learning के साथ है, जहां सामान्यीकरण में सुधार के लिए एक कोहोर्ट से दूसरे में ज्ञान स्थानांतरित किया जाता है। जैसे-जैसे Generative AI मॉडल अधिक प्रचलित होते हैं, कोहोर्टिंग को विकेंद्रीकृत डेटा पर Transformer (architecture)-आधारित मॉडल प्रशिक्षित करने के लिए भी लागू किया जा सकता है, जिससे संवेदनशील जानकारी को केंद्रीकृत किए बिना Large language model के सहयोगी विकास को सक्षम किया जा सके।
यह दृष्टिकोण एज कंप्यूटिंग और इंटरनेट-ऑफ-थिंग्स के लिए भी प्रासंगिक है, जहां डिवाइस सीमित संसाधन रखते हैं। समान क्षमताओं वाले डिवाइसों को समूहीकृत करके, मॉडल को विशिष्ट हार्डवेयर के लिए अनुकूलित किया जा सकता है, जिससे ऊर्जा खपत कम होती है। कुल मिलाकर, फ़ेडरेटेड लर्निंग ऑफ़ कोहोर्ट्स गोपनीयता-संरक्षण, वैयक्तिकृत मशीन लर्निंग के लिए एक लचीला ढांचा प्रस्तुत करता है, जिसमें भविष्य के Artificial intelligence सिस्टम को आकार देने की क्षमता है।