स्थितीय एन्कोडिंग (Positional Encoding)

अंग्रेज़ी से अनुवादित

स्थितीय एन्कोडिंग ट्रांसफॉर्मर तंत्रिका नेटवर्क में एक तकनीक है, जो एम्बेडिंग में टोकन क्रम की जानकारी डालती है, साइनसॉइडल फलनों या सीखे गए मापदंडों का उपयोग करके अनुक्रम-जागरूक प्रसंस्करण को सक्षम बनाती है।

पोजिशनल एन्कोडिंग Transformer (architecture) आर्किटेक्चर का एक मूलभूत घटक है, जो Deep learning में उपयोग होता है। ट्रांसफॉर्मर इनपुट अनुक्रमों को क्रमिक रूप से नहीं, बल्कि समानांतर रूप से संसाधित करते हैं, इसलिए उनमें क्रम की सहज समझ का अभाव होता है। पोजिशनल एन्कोडिंग प्रत्येक टोकन के एम्बेडिंग में एक अद्वितीय संकेत जोड़ती है जो अनुक्रम में उसकी स्थिति को दर्शाता है, जिससे मॉडल शब्द क्रम और दूरी को समझ पाता है। यह तकनीक 2017 के ऐतिहासिक पेपर "Attention Is All You Need" में पेश की गई थी और Large language model और अन्य अनुक्रम-प्रसंस्करण प्रणालियों के लिए आवश्यक बन गई है।

मूल विचार ट्रांसफॉर्मर की अटेंशन परतों में प्रवेश करने से पहले इनपुट एम्बेडिंग को संशोधित करना है। अनुक्रम में प्रत्येक स्थिति के लिए, एक वेक्टर उत्पन्न किया जाता है जो स्थिति के सूचकांक को एन्कोड करता है। यह वेक्टर टोकन एम्बेडिंग में जोड़ा जाता है, जिससे एक संयुक्त प्रतिनिधित्व बनता है जो अर्थ संबंधी और स्थितिगत दोनों जानकारी रखता है। अटेंशन तंत्र फिर इन स्थितिगत संकेतों का उपयोग टोकन के बीच संबंधों की गणना करने के लिए कर सकता है, जो उनकी सापेक्ष दूरी पर आधारित होते हैं।

साइनसॉइडल एन्कोडिंग

मूल ट्रांसफॉर्मर पेपर ने एक साइनसॉइडल पोजिशनल एन्कोडिंग योजना का प्रस्ताव रखा। एक स्थिति pos और आयाम i के लिए, एन्कोडिंग मान है:

  • PE(pos, 2i) = sin(pos / 10000^(2i/d_model))
  • PE(pos, 2i+1) = cos(pos / 10000^(2i/d_model))

जहाँ d_model एम्बेडिंग आयाम है। इस विकल्प में कई वांछनीय गुण हैं। साइन और कोसाइन फ़ंक्शन मानों को एक सीमित सीमा में उत्पन्न करते हैं, और प्रत्येक स्थिति के लिए एन्कोडिंग नियतात्मक होती है। अधिक महत्वपूर्ण रूप से, स्थितियों के बीच रैखिक संबंध मॉडल को सापेक्ष स्थितियों को आसानी से सीखने की अनुमति देता है: किसी भी निश्चित ऑफसेट k के लिए, PE(pos+k) को PE(pos) के रैखिक फ़ंक्शन के रूप में व्यक्त किया जा सकता है। यह गुण अटेंशन तंत्र को प्रशिक्षण के दौरान देखे गए अनुक्रमों से अधिक लंबे अनुक्रमों में सामान्यीकरण करने में मदद करता है।

आयाम के साथ आवृत्ति घटती जाती है, निचले आयाम तेजी से दोलन करते हैं और उच्च आयाम धीरे-धीरे। यह एक बहु-स्तरीय प्रतिनिधित्व बनाता है, जो मस्तिष्क द्वारा स्थानिक जानकारी को एन्कोड करने के तरीके के समान है। मूल लेखकों ने यह विधि चुनी क्योंकि इसमें कोई सीखा हुआ पैरामीटर आवश्यक नहीं होता और यह सैद्धांतिक रूप से मनमानी लंबाई के अनुक्रमों को संभाल सकती है।

सीखी गई पोजिशनल एम्बेडिंग

साइनसॉइडल एन्कोडिंग का एक विकल्प प्रशिक्षण के दौरान पोजिशनल एम्बेडिंग सीखना है। इस दृष्टिकोण में, प्रत्येक स्थिति सूचकांक को एक प्रशिक्षण योग्य वेक्टर सौंपा जाता है, और इन वेक्टरों को मॉडल के बाकी हिस्सों के साथ अनुकूलित किया जाता है। मॉडल अपने कार्य के लिए सबसे उपयुक्त स्थितिगत प्रतिनिधित्व सीखता है।

सीखी गई एम्बेडिंग का उपयोग प्रारंभिक ट्रांसफॉर्मर कार्यान्वयन में किया गया था, जिसमें मूल BERT मॉडल शामिल है। वे लचीलापन प्रदान करते हैं क्योंकि मॉडल एन्कोडिंग को विशिष्ट डेटा वितरण के अनुसार अनुकूलित कर सकता है। हालाँकि, वे प्रशिक्षण समय पर परिभाषित अधिकतम अनुक्रम लंबाई तक सीमित हैं, और उन्हें अतिरिक्त पैरामीटर की आवश्यकता होती है। बहुत लंबे अनुक्रमों के लिए, मेमोरी लागत महत्वपूर्ण हो सकती है।

साइनसॉइडल और सीखी गई दोनों एन्कोडिंग व्यापक रूप से अपनाई गई हैं। कई आधुनिक मॉडल, जैसे GPT वेरिएंट, सीखी गई एम्बेडिंग का उपयोग करते हैं, जबकि अन्य, जैसे मूल ट्रांसफॉर्मर, साइनसॉइडल का उपयोग करते हैं। शोध ने दिखाया है कि दोनों विधियाँ कई कार्यों पर समान प्रदर्शन करती हैं, लेकिन सीखी गई एम्बेडिंग अक्सर कार्यान्वयन में सरलता के कारण पसंद की जाती हैं।

ट्रांसफॉर्मर आर्किटेक्चर में भूमिका

ट्रांसफॉर्मर आर्किटेक्चर में, पोजिशनल एन्कोडिंग इनपुट चरण पर लागू होती है। इनपुट टोकन को पहले एक सीखी गई एम्बेडिंग मैट्रिक्स के माध्यम से एम्बेडिंग में परिवर्तित किया जाता है। फिर, पोजिशनल एन्कोडिंग वेक्टर को टोकन एम्बेडिंग में तत्व-वार जोड़ा जाता है। यह संयुक्त वेक्टर मल्टी-हेड अटेंशन परतों के माध्यम से पारित किया जाता है।

अटेंशन तंत्र इनपुट से क्वेरी, की और वैल्यू वेक्टर की गणना करता है। स्थितिगत जानकारी इन गणनाओं को प्रभावित करती है, जिससे मॉडल अपनी सापेक्ष स्थितियों के आधार पर टोकन पर ध्यान केंद्रित कर पाता है। उदाहरण के लिए, एक वाक्य में, मॉडल सीख सकता है कि एक क्रिया को अपने कर्ता पर ध्यान देना चाहिए, जो अक्सर कुछ स्थान दूर होता है।

पोजिशनल एन्कोडिंग के बिना, ट्रांसफॉर्मर इनपुट को शब्दों के एक बैग के रूप में मानेगा, जिससे सभी क्रम जानकारी खो जाएगी। यह भाषा मॉडलिंग और अनुवाद जैसे कार्यों को असंभव बना देगा। पोजिशनल एन्कोडिंग इस प्रकार एक महत्वपूर्ण नवाचार है जिसने ट्रांसफॉर्मर को अनुक्रमिक डेटा के लिए प्रभावी बनाया।

विविधताएँ और सुधार

मूल प्रस्ताव के बाद से, पोजिशनल एन्कोडिंग की कई विविधताएँ विकसित की गई हैं। एक उल्लेखनीय भिन्नता सापेक्ष पोजिशनल एन्कोडिंग है, जो पूर्ण स्थितियों के बजाय टोकन के बीच की दूरी को एन्कोड करती है। यह दृष्टिकोण, जो Transformer-XL और T5 जैसे मॉडलों में पेश किया गया, लंबे अनुक्रमों में बेहतर सामान्यीकरण कर सकता है और अधिक व्याख्या योग्य है।

एक और भिन्नता रोटरी पोजिशनल एन्कोडिंग (RoPE) है, जो LLaMA और PaLM जैसे मॉडलों में उपयोग होती है। RoPE अपनी स्थितियों के आधार पर क्वेरी और की वेक्टर पर एक रोटेशन मैट्रिक्स लागू करता है, सापेक्ष जानकारी को संरक्षित करते हुए मॉडल को लंबे अनुक्रमों में एक्सट्रपोलेट करने की अनुमति देता है। यह विधि हाल के बड़े भाषा मॉडलों में लोकप्रिय हो गई है।

अन्य दृष्टिकोणों में ALiBi (Attention with Linear Biases) शामिल है, जो दूरी के आधार पर अटेंशन स्कोर में एक रैखिक पूर्वाग्रह जोड़ता है, और T5 जैसे मॉडलों में उपयोग किए जाने वाले सीखे गए सापेक्ष पूर्वाग्रह शामिल हैं। ये विधियाँ अक्सर स्पष्ट पोजिशनल एम्बेडिंग की आवश्यकता को समाप्त करती हैं, जिससे आर्किटेक्चर सरल हो जाता है।

बड़े भाषा मॉडलों में अनुप्रयोग

पोजिशनल एन्कोडिंग सभी आधुनिक Large language model में अभिन्न है। GPT-3, GPT-4, Claude और Gemini जैसे मॉडल सुसंगत और संदर्भ-उपयुक्त पाठ उत्पन्न करने के लिए स्थितिगत जानकारी पर भरोसा करते हैं। एन्कोडिंग विधि का चुनाव मॉडल की लंबे दस्तावेज़ों, कोड और अन्य संरचित डेटा को संभालने की क्षमता को प्रभावित कर सकता है।

उदाहरण के लिए, OpenAI के GPT मॉडल सीखी गई पोजिशनल एम्बेडिंग का उपयोग करते हैं, जबकि Google DeepMind के Chinchilla और Gopher रोटरी एन्कोडिंग का उपयोग करते हैं। लंबे संदर्भ विंडो की ओर रुझान ने अधिक कुशल और स्केलेबल पोजिशनल एन्कोडिंग विधियों में शोध को प्रेरित किया है।

पोजिशनल एन्कोडिंग मल्टीमॉडल मॉडलों में भी भूमिका निभाती है जो छवियों, ऑडियो और पाठ को संसाधित करते हैं। विज़न ट्रांसफॉर्मर में, स्थानिक लेआउट को संरक्षित करने के लिए छवि पैच में पोजिशनल एन्कोडिंग जोड़ी जाती हैं। भाषण पहचान में, वे अस्थायी क्रम को मॉडल करने में मदद करती हैं।

सैद्धांतिक और व्यावहारिक विचार

सैद्धांतिक दृष्टिकोण से, पोजिशनल एन्कोडिंग प्रेरक पूर्वाग्रह का एक रूप है जो अनुक्रम क्रम के बारे में पूर्व ज्ञान को मॉडल में इंजेक्ट करता है। साइनसॉइडल एन्कोडिंग की सापेक्ष स्थितियों को रैखिक रूप से प्रस्तुत करने की क्षमता एक प्रमुख सैद्धांतिक लाभ है। हालाँकि, कुछ शोधकर्ताओं का तर्क है कि सीखी गई एम्बेडिंग अधिक जटिल स्थितिगत संबंधों को पकड़ सकती हैं।

व्यावहारिक रूप से, एन्कोडिंग का चुनाव प्रशिक्षण स्थिरता और प्रदर्शन को प्रभावित करता है। साइनसॉइडल एन्कोडिंग निश्चित हैं और अतिरिक्त पैरामीटर की आवश्यकता नहीं होती, जो ओवरफिटिंग को कम कर सकती है। सीखी गई एम्बेडिंग अधिक लचीली हो सकती हैं लेकिन प्रभावी ढंग से प्रशिक्षित करने के लिए अधिक डेटा की आवश्यकता हो सकती है।

एक और विचार एक्सट्रपोलेशन है - प्रशिक्षण के दौरान देखे गए अनुक्रमों से अधिक लंबे अनुक्रमों को संभालने की क्षमता। साइनसॉइडल एन्कोडिंग सैद्धांतिक रूप से मनमानी लंबाई तक एक्सट्रपोलेट कर सकती हैं, लेकिन व्यवहार में, अटेंशन तंत्र अक्सर अनदेखी लंबाई के साथ संघर्ष करते हैं। सीखी गई एम्बेडिंग बिल्कुल भी एक्सट्रपोलेट नहीं कर सकतीं, क्योंकि वे एक निश्चित अधिकतम लंबाई के लिए परिभाषित होती हैं। इसने RoPE और ALiBi जैसी विधियों में शोध को प्रेरित किया है जो एक्सट्रपोलेशन में सुधार करते हैं।

भविष्य की दिशाएँ

पोजिशनल एन्कोडिंग पर शोध लगातार विकसित हो रहा है। लंबे-संदर्भ मॉडलों की बढ़ती मांग के साथ, सैकड़ों हजारों या लाखों टोकन के अनुक्रमों में स्थितियों को कुशलतापूर्वक एन्कोड करने के लिए नई विधियाँ विकसित की जा रही हैं। पदानुक्रमित पोजिशनल एन्कोडिंग और निरंतर प्रतिनिधित्व जैसी तकनीकों की खोज की जा रही है।

कुछ हालिया मॉडल, जैसे Mamba और अन्य राज्य-स्थान मॉडल, ने अटेंशन के विकल्प प्रस्तावित किए हैं जिन्हें स्पष्ट पोजिशनल एन्कोडिंग की आवश्यकता नहीं होती। हालाँकि, ट्रांसफॉर्मर प्रमुख बने हुए हैं, और पोजिशनल एन्कोडिंग अध्ययन का एक प्रमुख क्षेत्र बना हुआ है।

2025 तक, क्षेत्र अधिक अनुकूली और डेटा-संचालित स्थितिगत प्रतिनिधित्व की ओर बढ़ रहा है, लेकिन 2017 में पेश किए गए मौलिक अवधारणाएँ आधारभूत बनी हुई हैं।

निष्कर्ष

पोजिशनल एन्कोडिंग एक सरल फिर भी शक्तिशाली तकनीक है जो ट्रांसफॉर्मर को अनुक्रमिक डेटा को संसाधित करने में सक्षम बनाती है। टोकन एम्बेडिंग में क्रम जानकारी इंजेक्ट करके, यह मॉडलों को भाषा, कोड और अन्य क्रमबद्ध डेटा को समझने की अनुमति देती है। साइनसॉइडल और सीखी गई दोनों एन्कोडिंग प्रभावी साबित हुई हैं, और चल रहे शोध इन विधियों को परिष्कृत करना जारी रखते हैं। आधुनिक Artificial intelligence और Machine learning का अध्ययन करने वाले किसी भी व्यक्ति के लिए पोजिशनल एन्कोडिंग को समझना आवश्यक है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·transformer·natural-language-processing·positional-encoding
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास