ऊर्जा-आधारित मॉडल (EBM), जिसे कैननिकल एन्सेम्बल लर्निंग (CEL) या कैननिकल एन्सेम्बल के माध्यम से लर्निंग (LCE) भी कहा जाता है, डेटा से सीखने के लिए सांख्यिकीय भौतिकी से कैननिकल एन्सेम्बल सूत्रीकरण का एक अनुप्रयोग है। यह दृष्टिकोण जनरेटिव AI में प्रमुखता से दिखाई देता है। EBM ऐसी सीखने के लिए कई संभाव्य और गैर-संभाव्य दृष्टिकोणों के लिए एक एकीकृत ढांचा प्रदान करते हैं, विशेष रूप से ग्राफिकल और अन्य संरचित मॉडलों के प्रशिक्षण के लिए। एक EBM लक्ष्य डेटासेट की विशेषताओं को सीखता है और एक समान लेकिन बड़ा डेटासेट उत्पन्न करता है। EBM डेटासेट के अव्यक्त चरों का पता लगाते हैं और समान वितरण के साथ नए डेटासेट उत्पन्न करते हैं। ऊर्जा-आधारित जनरेटिव तंत्रिका नेटवर्क जनरेटिव मॉडलों का एक वर्ग है जिसका उद्देश्य ऊर्जा-आधारित मॉडलों के रूप में डेटा के स्पष्ट संभाव्य वितरण को सीखना है, जिनके ऊर्जा फलन आधुनिक गहरे तंत्रिका नेटवर्कों द्वारा पैरामीट्रिज्ड होते हैं। बोल्ट्ज़मैन मशीनें ऊर्जा के एक विशिष्ट पैरामीट्रीकरण के साथ ऊर्जा-आधारित मॉडलों का एक विशेष रूप हैं।
गणितीय सूत्रीकरण
किसी दिए गए इनपुट \(x\) के लिए, मॉडल एक ऊर्जा \(E_\theta(x)\) का वर्णन करता है जैसे कि बोल्ट्ज़मैन वितरण \(P_\theta(x) = e^{-\beta E_\theta(x)} / Z(\theta)\) एक संभाव्यता (घनत्व) है, और आमतौर पर \(\beta = 1\)। सामान्यीकरण स्थिरांक \(Z(\theta) := \int_{x \in X} e^{-\beta E_\theta(x)} dx\), जिसे विभाजन फलन भी कहा जाता है, सभी संभावित इनपुट \(x\) के सभी बोल्ट्ज़मैन कारकों पर निर्भर करता है, जिससे यह उच्च-आयामी डेटा के लिए कम्प्यूटेशनल रूप से असंभव हो जाता है। यह असंभवता मानक अधिकतम संभावना अनुमान को जटिल बनाती है।
हालाँकि, एकल प्रशिक्षण उदाहरण \(x\) के लिए लॉग-संभावना का ग्रेडिएंट इस प्रकार व्यक्त किया जा सकता है:
\[
\partial_\theta \log P_\theta(x) = \mathbb{E}_{x' \sim P_\theta}[\partial_\theta E_\theta(x')] - \partial_\theta E_\theta(x)
\]
इस ग्रेडिएंट में एक सकारात्मक चरण (अवलोकित डेटा की ऊर्जा) और एक नकारात्मक चरण (मॉडल वितरण के तहत अपेक्षित ऊर्जा) शामिल है। नकारात्मक चरण में अपेक्षा को आमतौर पर मार्कोव चेन मोंटे कार्लो (MCMC) विधियों का उपयोग करके \(P_\theta\) से नमूने खींचकर अनुमानित किया जाता है।
कंट्रास्टिव डाइवर्जेंस के माध्यम से प्रशिक्षण
प्रारंभिक ऊर्जा-आधारित मॉडल, जैसे कि 2003 का हिंटन का बोल्ट्ज़मैन मशीन, ने अवरुद्ध गिब्स सैंपलिंग के माध्यम से अपेक्षा का अनुमान लगाया। नए दृष्टिकोण अधिक कुशल स्टोकेस्टिक ग्रेडिएंट लैंगेविन डायनेमिक्स (LD) का उपयोग करते हैं, नमूने खींचते हुए:
\[
x_0' \sim P_0, \quad x_{i+1}' = x_i' - \frac{\alpha}{2} \frac{\partial E_\theta(x_i')}{\partial x_i'} + \epsilon
\]
जहाँ \(\epsilon \sim \mathcal{N}(0, \alpha)\)। पिछले मानों \(x_i'\) का एक रीप्ले बफर LD के साथ अनुकूलन मॉड्यूल को आरंभ करने के लिए उपयोग किया जाता है। तंत्रिका नेटवर्क के पैरामीटर \(\theta\) को MCMC-आधारित अधिकतम संभावना अनुमान के माध्यम से जनरेटिव तरीके से प्रशिक्षित किया जाता है। सीखने की प्रक्रिया एक "विश्लेषण द्वारा संश्लेषण" योजना का पालन करती है: प्रत्येक सीखने के पुनरावृत्ति के भीतर, एल्गोरिदम वर्तमान मॉडल से ग्रेडिएंट-आधारित MCMC विधि (जैसे, लैंगेविन डायनेमिक्स या हाइब्रिड मोंटे कार्लो) द्वारा संश्लेषित उदाहरणों का नमूना लेता है, और फिर अवलोकित डेटा की ऊर्जा को कम करने के लिए पैरामीटर \(\theta\) को अपडेट करता है जबकि नमूना डेटा की ऊर्जा को बढ़ाता है।
अन्य जनरेटिव मॉडलों से संबंध
ऊर्जा-आधारित मॉडल अन्य जनरेटिव दृष्टिकोणों के लिए एक लचीला विकल्प प्रदान करते हैं। जनरेटिव AI मॉडलों के विपरीत जो सीधे डेटा आउटपुट करते हैं (जैसे, बड़े भाषा मॉडल या ट्रांसफॉर्मर), EBM एक अमानकीकृत संभाव्य वितरण को परिभाषित करते हैं। यह उन्हें एक सुगम संभावना की आवश्यकता के बिना जटिल निर्भरताओं को मॉडल करने की अनुमति देता है। वे तंत्रिका नेटवर्क से निकटता से संबंधित हैं जब ऊर्जा फलन एक गहरे नेटवर्क द्वारा पैरामीट्रिज्ड होता है, जिससे ऊर्जा-आधारित जनरेटिव तंत्रिका नेटवर्क बनते हैं। बोल्ट्ज़मैन मशीनें, जिनमें प्रतिबंधित बोल्ट्ज़मैन मशीनें शामिल हैं, एक विशेष मामला हैं जहाँ ऊर्जा फलन की एक विशिष्ट द्विदलीय संरचना होती है।
जनरेटिव AI में अनुप्रयोग
ऊर्जा-आधारित मॉडल विभिन्न जनरेटिव कार्यों पर लागू किए गए हैं, जिनमें छवि निर्माण, शोर हटाना और विसंगति का पता लगाना शामिल है। गहन शिक्षण के संदर्भ में, EBM का उपयोग अव्यक्त प्रतिनिधित्व सीखने और प्रशिक्षण डेटा के समान आँकड़ों के साथ नए नमूने उत्पन्न करने के लिए किया जा सकता है। उन्हें संरचित भविष्यवाणी और अर्ध-पर्यवेक्षित शिक्षण के लिए भी खोजा गया है। हाल के शोध ने EBM को मशीन लर्निंग तकनीकों जैसे अवशिष्ट नेटवर्क और U-नेट के साथ जोड़कर स्केलेबिलिटी में सुधार किया है।
चुनौतियाँ और विस्तार
EBM प्रशिक्षण में मुख्य चुनौती असंभव विभाजन फलन है, जिसके लिए परिष्कृत सैंपलिंग तकनीकों की आवश्यकता होती है। लैंगेविन डायनेमिक्स जैसी MCMC विधियाँ मिश्रण में धीमी हो सकती हैं, विशेष रूप से उच्च-आयामी स्थानों में। इसे संबोधित करने के लिए, शोधकर्ताओं ने कंट्रास्टिव डाइवर्जेंस, सतत कंट्रास्टिव डाइवर्जेंस और स्कोर मिलान जैसी तकनीकें विकसित की हैं। स्कोर मिलान लॉग-घनत्व के ग्रेडिएंट को मिलान करके स्पष्ट सैंपलिंग से बचता है, जो ऊर्जा फलन से संबंधित है। एक और विस्तार नमूना गुणवत्ता और प्रशिक्षण स्थिरता में सुधार के लिए डेटा संवर्धन का उपयोग है।
ऐतिहासिक संदर्भ
ऊर्जा-आधारित मॉडलों की अवधारणा की जड़ें सांख्यिकीय भौतिकी में हैं, जहाँ कैननिकल एन्सेम्बल थर्मल संतुलन में एक प्रणाली के राज्यों के वितरण का वर्णन करता है। मशीन लर्निंग में अनुप्रयोग 1980 के दशक में हॉपफील्ड नेटवर्क और बोल्ट्ज़मैन मशीनों के साथ शुरू हुआ। 2003 का हिंटन का बोल्ट्ज़मैन मशीन गहरे EBM प्रशिक्षण में एक महत्वपूर्ण मील का पत्थर था। तब से, EBM का अध्ययन MIT CSAIL और स्टैनफोर्ड AI लैब जैसे संस्थानों में किया गया है। आधुनिक विकास तंत्रिका नेटवर्क और MCMC विधियों में प्रगति से प्रेरित हुए हैं।
भविष्य की दिशाएँ
2020 के दशक की शुरुआत तक, ऊर्जा-आधारित मॉडल अनुसंधान का एक सक्रिय क्षेत्र बने हुए हैं, विशेष रूप से सैंपलिंग दक्षता में सुधार और बड़े डेटासेट तक स्केलिंग के लिए। उन्हें जनरेटिव AI प्रणालियों जैसे बड़े भाषा मॉडल के लिए एक संभावित पूरक के रूप में देखा जाता है, जो अनिश्चितता और बाधाओं को मॉडल करने का एक सैद्धांतिक तरीका प्रदान करते हैं। शोधकर्ता EBM को ट्रांसफॉर्मर और अन्य आर्किटेक्चर के साथ जोड़ने वाले हाइब्रिड दृष्टिकोणों के साथ-साथ सुदृढीकरण सीखने और रोबोटिक्स में अनुप्रयोगों की खोज कर रहे हैं।