बोल्ट्ज़मैन मशीन एक प्रकार का स्टोकेस्टिक आवर्तक तंत्रिका नेटवर्क है जो बाइनरी आउटपुट अवस्थाओं पर संभाव्यता वितरणों का प्रतिनिधित्व और नमूनाकरण सीखता है। इसका नाम सांख्यिकीय यांत्रिकी से बोल्ट्ज़मैन वितरण के नाम पर रखा गया है, जो ऊर्जा के आधार पर प्रत्येक नेटवर्क अवस्था की संभावना को नियंत्रित करता है। यह मॉडल मार्कोव यादृच्छिक क्षेत्र के रूप में भी वर्गीकृत है और बाहरी क्षेत्र के साथ शेरिंगटन-किर्कपैट्रिक मॉडल का एक विशिष्ट उदाहरण है, जिसे स्टोकेस्टिक इसिंग मॉडल भी कहा जाता है। इसे संज्ञानात्मक विज्ञान और मशीन लर्निंग समुदायों में जेफ्री हिंटन, टेरी सेजनोव्स्की और यान लेकुन द्वारा ऊर्जा-आधारित मॉडलों के व्यापक वर्ग के हिस्से के रूप में भारी प्रचारित किया गया था, जहाँ स्पिन ग्लास का हैमिल्टनियन सीखने के कार्य को परिभाषित करने वाले ऊर्जा फलन के रूप में कार्य करता है।
बोल्ट्ज़मैन मशीनें सैद्धांतिक रूप से अपने प्रशिक्षण एल्गोरिदम की स्थानीयता और हेबियन प्रकृति के लिए उल्लेखनीय हैं, जो हेब के नियम का पालन करती है, और उनकी समानता और सरल भौतिक प्रक्रियाओं से मिलती-जुलती प्रकृति के लिए भी। हालाँकि, अप्रतिबंधित कनेक्टिविटी वाले बोल्ट्ज़मैन मशीनें मशीन लर्निंग या अनुमान में व्यावहारिक समस्याओं के लिए उपयोगी साबित नहीं हुई हैं। जब कनेक्टिविटी ठीक से प्रतिबंधित होती है, जैसे कि प्रतिबंधित बोल्ट्ज़मैन मशीनों में, सीखना व्यावहारिक अनुप्रयोगों के लिए पर्याप्त कुशल हो जाता है।
संरचना
एक बोल्ट्ज़मैन मशीन में बाइनरी इकाइयों का एक नेटवर्क होता है, जिनमें से प्रत्येक 0 या 1 की अवस्था उत्पन्न करती है। समग्र नेटवर्क में एक वैश्विक ऊर्जा फलन होता है, जो हॉपफील्ड नेटवर्क और इसिंग मॉडल के समान रूप का होता है, जिसे इस प्रकार परिभाषित किया गया है:
E = - (i<j पर w_ij s_i s_j का योग + i पर theta_i * s_i का योग)
यहाँ, w_ij इकाई j और इकाई i के बीच कनेक्शन की ताकत है, s_i इकाई i की बाइनरी अवस्था है, और theta_i इकाई i का पूर्वाग्रह है, जिसमें -theta_i सक्रियण सीमा का प्रतिनिधित्व करता है। वजन को अक्सर एक सममित मैट्रिक्स W के रूप में दर्शाया जाता है जिसमें विकर्ण पर शून्य होते हैं।
इकाई अवस्था संभावना
एकल इकाई i के बंद बनाम चालू होने से उत्पन्न वैश्विक ऊर्जा में अंतर, जिसे Delta E_i के रूप में दर्शाया गया है, जुड़ी इकाइयों से वजन के योग और पूर्वाग्रह के रूप में दिया जाता है। यह ऊर्जा अंतर बोल्ट्ज़मैन कारक के माध्यम से दो अवस्थाओं की संभावनाओं से संबंधित है, जहाँ एक अवस्था की संभावना exp(-E / (k_B T)) के समानुपाती होती है, जिसमें k_B बोल्ट्ज़मैन स्थिरांक और T एक कृत्रिम तापमान पैरामीटर है। यह संबंध नेटवर्क को इकाइयों को स्टोकेस्टिक रूप से अद्यतन करने की अनुमति देता है, जो कम-ऊर्जा विन्यासों का पक्ष लेता है।
प्रशिक्षण एल्गोरिदम
बोल्ट्ज़मैन मशीन का प्रशिक्षण वजन और पूर्वाग्रहों को समायोजित करने का लक्ष्य रखता है ताकि नेटवर्क का संतुलन वितरण दृश्य इकाइयों पर एक लक्ष्य वितरण से मेल खाए। सीखने का नियम स्थानीय और हेबियन है: एक वजन में परिवर्तन दो इकाइयों के सहसंबंध के बीच अंतर के समानुपाती होता है जब नेटवर्क डेटा पर क्लैंप किया जाता है और जब यह मुक्त-चालित होता है। यह कंट्रास्टिव सीखने की प्रक्रिया मॉडल के वितरण से नमूनाकरण पर निर्भर करती है, अक्सर मार्कोव चेन मोंटे कार्लो विधियों का उपयोग करती है। एल्गोरिदम की स्थानीयता इसे जैविक रूप से प्रशंसनीय बनाती है, लेकिन अप्रतिबंधित नेटवर्क धीमी अभिसरण और खराब मापनीयता से ग्रस्त हैं।
व्यावहारिक प्रकार
पूरी तरह से जुड़े बोल्ट्ज़मैन मशीनों की अक्षमता को संबोधित करने के लिए, शोधकर्ताओं ने प्रतिबंधित बोल्ट्ज़मैन मशीनें (RBMs) पेश कीं, जो कनेक्टिविटी को दो परतों - दृश्य और छिपी - तक सीमित करती हैं, जिसमें कोई अंतर-परत कनेक्शन नहीं होता। यह बाधा कंट्रास्टिव डाइवर्जेंस का उपयोग करके अधिक कुशल प्रशिक्षण सक्षम बनाती है। स्टैक्ड RBMs गहरे विश्वास नेटवर्क का आधार बनाते हैं, जो गहन शिक्षण के प्रारंभिक विकास में प्रभावशाली थे। इन प्रकारों को आयामीता में कमी, फीचर सीखने और सहयोगी फ़िल्टरिंग जैसे कार्यों पर लागू किया गया है, हालाँकि वे कई डोमेन में अन्य आर्किटेक्चर द्वारा बड़े पैमाने पर प्रतिस्थापित किए गए हैं।
विरासत और प्रभाव
बोल्ट्ज़मैन मशीन ने जनरेटिव एआई और ऊर्जा-आधारित मॉडलों में मौलिक अवधारणाओं का योगदान दिया। इसकी स्टोकेस्टिक गतिशीलता और संभाव्य व्याख्या ने तंत्रिका नेटवर्क अनुसंधान में बाद के विकासों को प्रभावित किया, जिसमें अव्यक्त चर और नमूनाकरण-आधारित अनुमान का उपयोग शामिल है। हालाँकि समकालीन बड़े पैमाने के सिस्टम जैसे बड़े भाषा मॉडल में व्यापक रूप से उपयोग नहीं किया जाता है, इसकी सैद्धांतिक अंतर्दृष्टि संभाव्य ग्राफिकल मॉडल और अनुपयोगी शिक्षण को समझने में प्रासंगिक बनी हुई है। मॉडल का नाम साहित्य में एक स्टोकेस्टिक आवर्तक नेटवर्क और सांख्यिकीय भौतिकी और कृत्रिम बुद्धिमत्ता के बीच एक पुल के विहित उदाहरण के रूप में बना हुआ है।