अंग्रेज़ी से अनुवादित

राज्य स्थान मॉडल एक तंत्रिका अनुक्रम वास्तुकला है जो प्रत्येक चरण पर राज्य स्थान समीकरणों का उपयोग करके एक निश्चित-आकार की छिपी हुई स्थिति को अद्यतन करता है, जो ट्रांसफार्मर आत्म-ध्यान के विकल्प के रूप में रैखिक-समय स्केलिंग प्रदान करता है।

एक स्टेट स्पेस मॉडल (SSM), आधुनिक AI के संदर्भ में, अनुक्रम मॉडलिंग के लिए तंत्रिका नेटवर्क आर्किटेक्चर का एक वर्ग है जो नियंत्रण सिद्धांत और सिग्नल प्रोसेसिंग से लिए गए समीकरणों के अनुसार प्रत्येक चरण पर अद्यतन की गई एक छिपी हुई अवस्था का उपयोग करके एक अनुक्रम को संसाधित करता है। ट्रांसफॉर्मर के विपरीत, जिसका सेल्फ-अटेंशन तंत्र हर टोकन की तुलना हर दूसरे टोकन से करता है और इस प्रकार अनुक्रम लंबाई के साथ द्विघात रूप से स्केल करता है, स्टेट स्पेस मॉडल प्रत्येक स्थिति पर एक निश्चित आकार की छिपी हुई अवस्था को अद्यतन करते हैं, जिससे उन्हें संदर्भ लंबाई के साथ रैखिक या लगभग-रैखिक स्केलिंग मिलती है।

सबसे व्यापक रूप से चर्चित तंत्रिका स्टेट स्पेस मॉडल माम्बा है, जिसे दिसंबर 2023 में अल्बर्ट गु और त्रि दाओ द्वारा पेश किया गया था, जिसने पहले के रैखिक स्टेट स्पेस मॉडल में एक इनपुट-निर्भर, या चयनात्मक, तंत्र जोड़ा ताकि मॉडल प्रत्येक चरण पर क्या याद रखना या भूलना है, चुन सके, जो भाषा कार्यों पर पिछले SSM की एक प्रमुख कमजोरी को संबोधित करता है।

इतिहास

स्टेट स्पेस मॉडल का नियंत्रण इंजीनियरिंग में एक लंबा इतिहास है, जहां वे वर्णन करते हैं कि कैसे एक प्रणाली की आंतरिक अवस्था समय के साथ विकसित होती है और दृश्यमान आउटपुट उत्पन्न करती है। 2021 में स्टैनफोर्ड शोधकर्ताओं द्वारा प्रकाशित S4 मॉडल जैसे प्रारंभिक तंत्रिका अनुकूलन ने दिखाया कि एक सावधानीपूर्वक पैरामीटरयुक्त रैखिक स्टेट स्पेस परत आवर्ती तंत्रिका नेटवर्क और लंबी-सीमा निर्भरता पर जोर देने वाले बेंचमार्क पर कन्वोल्यूशनल दृष्टिकोणों के साथ प्रतिस्पर्धात्मक रूप से बहुत लंबे अनुक्रमों को संभाल सकती है। ये प्रारंभिक SSM भाषा मॉडलिंग में ट्रांसफॉर्मर से कम प्रदर्शन करते रहे, जब तक कि माम्बा के 2023 के चयनात्मक तंत्र ने अधिकांश अंतर को कम नहीं कर दिया, जिससे SSM में एक संभावित ट्रांसफॉर्मर विकल्प के रूप में नए सिरे से रुचि पैदा हुई।

आर्किटेक्चर और तंत्र

एक बुनियादी SSM परत प्रत्येक अनुक्रम स्थिति पर एक रैखिक पुनरावृत्ति द्वारा अद्यतन एक छिपी हुई अवस्था वेक्टर बनाए रखती है, अवधारणात्मक रूप से LSTM के समान, लेकिन एक गणितीय संरचना के साथ जो प्रशिक्षण के दौरान कन्वोल्यूशन या समानांतर-स्कैन एल्गोरिदम के माध्यम से कुशल समानांतर गणना की अनुमति देती है। माम्बा जैसे चयनात्मक SSM पुनरावृत्ति के मापदंडों को वर्तमान इनपुट का एक फ़ंक्शन बनाते हैं, जिससे मॉडल गतिशील रूप से यह तय कर सकता है कि कौन सी जानकारी आगे प्रसारित करनी है, एक क्षमता जो अटेंशन की सामग्री-आधारित खोज के करीब है, न कि एक निश्चित रैखिक फ़िल्टर की। हाइब्रिड आर्किटेक्चर जो SSM परतों को कम संख्या में अटेंशन परतों के साथ जोड़ते हैं, SSM की रैखिक-समय दक्षता के साथ-साथ अटेंशन की कुछ अभिव्यक्ति की तलाश में, 2024 और 2025 तक कई प्रयोगशालाओं से सामने आए।

ट्रांसफॉर्मर के साथ तुलना

स्टेट स्पेस मॉडल की मुख्य अपील लंबे अनुक्रमों पर अनुमान दक्षता है: क्योंकि छिपी हुई अवस्था का आकार निश्चित होता है, प्रत्येक नए टोकन को उत्पन्न करने के लिए पूरे बढ़ते संदर्भ पर फिर से ध्यान देने की आवश्यकता नहीं होती है, मानक ट्रांसफॉर्मर अनुमान के विपरीत, जो पिछले टोकन पर अटेंशन की पुनर्गणना करता है, जिसे व्यवहार में की-वैल्यू कैशिंग द्वारा आंशिक रूप से कम किया जाता है। यह SSM को बहुत लंबे संदर्भ विंडो और संसाधन-सीमित तैनाती के लिए आकर्षक बनाता है। हालांकि, 2025 तक शुद्ध SSM ने अधिकांश भाषा बेंचमार्क पर अच्छी तरह से ट्यून किए गए ट्रांसफॉर्मर को स्पष्ट रूप से पीछे नहीं छोड़ा था, और क्षेत्र की अधिकांश गतिविधि अटेंशन को पूरी तरह से बदलने के बजाय हाइब्रिड डिजाइनों की ओर स्थानांतरित हो गई।

स्वागत और दृष्टिकोण

माम्बा और इसके उत्तराधिकारियों को 2017 के मूल Attention Is All You Need पेपर के बाद से ट्रांसफॉर्मर प्रभुत्व के लिए सबसे विश्वसनीय आर्किटेक्चरल चुनौतियों में से एक के रूप में प्राप्त किया गया, जिसने महत्वपूर्ण शैक्षणिक रुचि और कई ओपन-सोर्स कार्यान्वयन उत्पन्न किए। यान लेकुन सहित शोधकर्ताओं ने नोट किया है कि आवर्ती-शैली की अवस्था, चाहे LSTM में हो या SSM में, बहुत लंबे इनपुट पर तर्क की आवश्यकता वाले कार्यों के लिए लाभ प्रदान कर सकती है, जैसे कि पूरी किताबें, कोडबेस या जीनोमिक अनुक्रमों को संसाधित करना। 2025 तक, स्टेट स्पेस मॉडल ट्रांसफॉर्मर की तुलना में उत्पादन बड़े भाषा मॉडल में एक अल्पसंख्यक आर्किटेक्चर बने रहे, लेकिन कई प्रमुख प्रयोगशालाओं में हाइब्रिड मॉडल डिजाइन को प्रभावित करते रहे।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·model-architecture
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास