एक स्टेट स्पेस मॉडल (SSM), आधुनिक AI के संदर्भ में, अनुक्रम मॉडलिंग के लिए तंत्रिका नेटवर्क आर्किटेक्चर का एक वर्ग है जो नियंत्रण सिद्धांत और सिग्नल प्रोसेसिंग से लिए गए समीकरणों के अनुसार प्रत्येक चरण पर अद्यतन की गई एक छिपी हुई अवस्था का उपयोग करके एक अनुक्रम को संसाधित करता है। ट्रांसफॉर्मर के विपरीत, जिसका सेल्फ-अटेंशन तंत्र हर टोकन की तुलना हर दूसरे टोकन से करता है और इस प्रकार अनुक्रम लंबाई के साथ द्विघात रूप से स्केल करता है, स्टेट स्पेस मॉडल प्रत्येक स्थिति पर एक निश्चित आकार की छिपी हुई अवस्था को अद्यतन करते हैं, जिससे उन्हें संदर्भ लंबाई के साथ रैखिक या लगभग-रैखिक स्केलिंग मिलती है।
सबसे व्यापक रूप से चर्चित तंत्रिका स्टेट स्पेस मॉडल माम्बा है, जिसे दिसंबर 2023 में अल्बर्ट गु और त्रि दाओ द्वारा पेश किया गया था, जिसने पहले के रैखिक स्टेट स्पेस मॉडल में एक इनपुट-निर्भर, या चयनात्मक, तंत्र जोड़ा ताकि मॉडल प्रत्येक चरण पर क्या याद रखना या भूलना है, चुन सके, जो भाषा कार्यों पर पिछले SSM की एक प्रमुख कमजोरी को संबोधित करता है।
इतिहास
स्टेट स्पेस मॉडल का नियंत्रण इंजीनियरिंग में एक लंबा इतिहास है, जहां वे वर्णन करते हैं कि कैसे एक प्रणाली की आंतरिक अवस्था समय के साथ विकसित होती है और दृश्यमान आउटपुट उत्पन्न करती है। 2021 में स्टैनफोर्ड शोधकर्ताओं द्वारा प्रकाशित S4 मॉडल जैसे प्रारंभिक तंत्रिका अनुकूलन ने दिखाया कि एक सावधानीपूर्वक पैरामीटरयुक्त रैखिक स्टेट स्पेस परत आवर्ती तंत्रिका नेटवर्क और लंबी-सीमा निर्भरता पर जोर देने वाले बेंचमार्क पर कन्वोल्यूशनल दृष्टिकोणों के साथ प्रतिस्पर्धात्मक रूप से बहुत लंबे अनुक्रमों को संभाल सकती है। ये प्रारंभिक SSM भाषा मॉडलिंग में ट्रांसफॉर्मर से कम प्रदर्शन करते रहे, जब तक कि माम्बा के 2023 के चयनात्मक तंत्र ने अधिकांश अंतर को कम नहीं कर दिया, जिससे SSM में एक संभावित ट्रांसफॉर्मर विकल्प के रूप में नए सिरे से रुचि पैदा हुई।
आर्किटेक्चर और तंत्र
एक बुनियादी SSM परत प्रत्येक अनुक्रम स्थिति पर एक रैखिक पुनरावृत्ति द्वारा अद्यतन एक छिपी हुई अवस्था वेक्टर बनाए रखती है, अवधारणात्मक रूप से LSTM के समान, लेकिन एक गणितीय संरचना के साथ जो प्रशिक्षण के दौरान कन्वोल्यूशन या समानांतर-स्कैन एल्गोरिदम के माध्यम से कुशल समानांतर गणना की अनुमति देती है। माम्बा जैसे चयनात्मक SSM पुनरावृत्ति के मापदंडों को वर्तमान इनपुट का एक फ़ंक्शन बनाते हैं, जिससे मॉडल गतिशील रूप से यह तय कर सकता है कि कौन सी जानकारी आगे प्रसारित करनी है, एक क्षमता जो अटेंशन की सामग्री-आधारित खोज के करीब है, न कि एक निश्चित रैखिक फ़िल्टर की। हाइब्रिड आर्किटेक्चर जो SSM परतों को कम संख्या में अटेंशन परतों के साथ जोड़ते हैं, SSM की रैखिक-समय दक्षता के साथ-साथ अटेंशन की कुछ अभिव्यक्ति की तलाश में, 2024 और 2025 तक कई प्रयोगशालाओं से सामने आए।
ट्रांसफॉर्मर के साथ तुलना
स्टेट स्पेस मॉडल की मुख्य अपील लंबे अनुक्रमों पर अनुमान दक्षता है: क्योंकि छिपी हुई अवस्था का आकार निश्चित होता है, प्रत्येक नए टोकन को उत्पन्न करने के लिए पूरे बढ़ते संदर्भ पर फिर से ध्यान देने की आवश्यकता नहीं होती है, मानक ट्रांसफॉर्मर अनुमान के विपरीत, जो पिछले टोकन पर अटेंशन की पुनर्गणना करता है, जिसे व्यवहार में की-वैल्यू कैशिंग द्वारा आंशिक रूप से कम किया जाता है। यह SSM को बहुत लंबे संदर्भ विंडो और संसाधन-सीमित तैनाती के लिए आकर्षक बनाता है। हालांकि, 2025 तक शुद्ध SSM ने अधिकांश भाषा बेंचमार्क पर अच्छी तरह से ट्यून किए गए ट्रांसफॉर्मर को स्पष्ट रूप से पीछे नहीं छोड़ा था, और क्षेत्र की अधिकांश गतिविधि अटेंशन को पूरी तरह से बदलने के बजाय हाइब्रिड डिजाइनों की ओर स्थानांतरित हो गई।
स्वागत और दृष्टिकोण
माम्बा और इसके उत्तराधिकारियों को 2017 के मूल Attention Is All You Need पेपर के बाद से ट्रांसफॉर्मर प्रभुत्व के लिए सबसे विश्वसनीय आर्किटेक्चरल चुनौतियों में से एक के रूप में प्राप्त किया गया, जिसने महत्वपूर्ण शैक्षणिक रुचि और कई ओपन-सोर्स कार्यान्वयन उत्पन्न किए। यान लेकुन सहित शोधकर्ताओं ने नोट किया है कि आवर्ती-शैली की अवस्था, चाहे LSTM में हो या SSM में, बहुत लंबे इनपुट पर तर्क की आवश्यकता वाले कार्यों के लिए लाभ प्रदान कर सकती है, जैसे कि पूरी किताबें, कोडबेस या जीनोमिक अनुक्रमों को संसाधित करना। 2025 तक, स्टेट स्पेस मॉडल ट्रांसफॉर्मर की तुलना में उत्पादन बड़े भाषा मॉडल में एक अल्पसंख्यक आर्किटेक्चर बने रहे, लेकिन कई प्रमुख प्रयोगशालाओं में हाइब्रिड मॉडल डिजाइन को प्रभावित करते रहे।