प्राकृतिक भाषा प्रसंस्करण में, शब्द एम्बेडिंग एक शब्द का वास्तविक-मूल्य वाले वेक्टर के रूप में प्रतिनिधित्व है जो उसके अर्थ को एन्कोड करता है। मूल विचार यह है कि वेक्टर स्थान में निकट के शब्दों के अर्थ में समान होने की उम्मीद की जाती है, जिससे शब्दार्थ संबंधों का मात्रात्मक विश्लेषण संभव होता है। शब्द एम्बेडिंग आमतौर पर भाषा मॉडलिंग और फीचर लर्निंग तकनीकों के माध्यम से प्राप्त की जाती हैं, जो शब्दावली से शब्दों या वाक्यांशों को संख्याओं के वेक्टर में मैप करती हैं। इन प्रतिनिधित्वों को इनपुट फीचर के रूप में उपयोग करने पर वाक्यात्मक पार्सिंग और भावना विश्लेषण जैसे कार्यों में प्रदर्शन बढ़ाने के लिए दिखाया गया है।
शब्द एम्बेडिंग उत्पन्न करने के तरीकों में तंत्रिका नेटवर्क, शब्द सह-घटना मैट्रिक्स पर आयामीता में कमी, संभाव्य मॉडल, और संदर्भों का स्पष्ट प्रतिनिधित्व शामिल हैं। यह दृष्टिकोण प्रारंभिक शब्दार्थ स्थान मॉडल से आधुनिक गहन शिक्षण तकनीकों तक विकसित हुआ है, जो प्राकृतिक भाषा समझ प्रणालियों की आधारशिला बन गया है।
विकास और इतिहास
अंतर्निहित विचार कि "एक शब्द उस कंपनी से पहचाना जाता है जिसे वह रखता है" जॉन रूपर्ट फर्थ के 1957 के लेख में प्रस्तावित किया गया था, जो वितरणात्मक शब्दार्थ में निहित है। प्रारंभिक शब्दार्थ स्थान मॉडल, जैसे सूचना पुनर्प्राप्ति के लिए वेक्टर स्थान मॉडल, शब्दों को विरल, उच्च-आयामी स्थानों में प्रस्तुत करते थे। एकवचन मूल्य अपघटन के माध्यम से आयामीता में कमी ने 1980 के दशक के अंत में अव्यक्त शब्दार्थ विश्लेषण को जन्म दिया। 2000 में, योशुआ बेंगियो और सहयोगियों ने तंत्रिका संभाव्य भाषा मॉडल पेश किए जिन्होंने शब्दों के लिए वितरित प्रतिनिधित्व सीखा, आयामीता को कम किया। 2002 के एक NeurIPS अध्ययन ने द्विभाषी कोरपोरा पर कर्नेल CCA लागू किया, जो शब्द एम्बेडिंग के लिए स्व-पर्यवेक्षित शिक्षण का एक प्रारंभिक उदाहरण था।
बेंगियो और अन्य के मौलिक कार्य के बाद, 2005 के बाद की अधिकांश नई तकनीकें तंत्रिका नेटवर्क आर्किटेक्चर पर निर्भर थीं। 2013 में, टॉमस मिकोलोव के नेतृत्व में Google की एक टीम ने word2vec बनाया, एक टूलकिट जो पिछले दृष्टिकोणों की तुलना में तेजी से वेक्टर स्थान मॉडल प्रशिक्षित करता था, जिसने शब्द एम्बेडिंग को व्यापक रूप से लोकप्रिय बनाया। बाद के काम में fastText शामिल था, जो शब्दों को आंशिक रूप से वर्ण n-ग्राम के माध्यम से प्रस्तुत करता था।
बहुअर्थिता और समनामिता
स्थिर शब्द एम्बेडिंग की एक प्रमुख सीमा यह है कि कई अर्थों वाले शब्द एक एकल वेक्टर में समाहित हो जाते हैं, जो बहुअर्थिता और समनामिता को संभालने में विफल रहते हैं। उदाहरण के लिए, "club" एक सैंडविच, एक क्लबहाउस, या एक गोल्फ क्लब का उल्लेख कर सकता है। बहु-अर्थ एम्बेडिंग विभिन्न अर्थों के लिए अलग-अलग वेक्टर निर्दिष्ट करके इसे संबोधित करती हैं। दृष्टिकोणों में मल्टी-सेंस स्किप-ग्राम (MSSG) शामिल है, जो शब्द-अर्थ भेदभाव और एम्बेडिंग को एक साथ करता है, और नॉन-पैरामीट्रिक मल्टी-सेंस स्किप-ग्राम (NP-MSSG), जो प्रति शब्द चर संख्या में अर्थों की अनुमति देता है। सबसे उपयुक्त अर्थ एनोटेशन (MSSA) शब्दनेट जैसे शाब्दिक डेटाबेस को शब्द अर्थ विसंदिग्धीकरण के साथ आत्म-सुधारात्मक तरीके से जोड़ता है।
बहु-अर्थ एम्बेडिंग भाषण-भाग टैगिंग, शब्दार्थ संबंध पहचान, और भावना विश्लेषण जैसे कार्यों में प्रदर्शन में सुधार करती हैं। 2010 के दशक के अंत तक, ELMo और BERT जैसे संदर्भात्मक रूप से सार्थक एम्बेडिंग टोकन-स्तरीय प्रतिनिधित्व प्रदान करते हैं, जहां प्रत्येक शब्द की प्रत्येक घटना का अपना एम्बेडिंग होता है, जो बहु-अर्थ प्रकृति को बेहतर ढंग से दर्शाता है।
जैविक अनुक्रम
शब्द एम्बेडिंग को जैव सूचना विज्ञान अनुप्रयोगों के लिए जैविक अनुक्रमों, जैसे DNA, RNA, और प्रोटीन तक विस्तारित किया गया है। असगरी और सहयोगियों ने BioVectors प्रस्तावित किया, जो जैविक अनुक्रमों में n-ग्राम पर एम्बेडिंग तकनीक लागू करता है, जिससे कार्यात्मक और संरचनात्मक समानताओं का विश्लेषण संभव होता है।
अनुप्रयोग और प्रभाव
शब्द एम्बेडिंग व्यापक रूप से Machine learning और Deep learning मॉडल में उपयोग की जाती हैं, जो पाठ वर्गीकरण, मशीन अनुवाद, और प्रश्न उत्तर जैसे कार्यों के लिए इनपुट प्रतिनिधित्व के रूप में कार्य करती हैं। वे Large language model और Transformer (architecture) आर्किटेक्चर के अभिन्न अंग हैं, जो टोकन-स्तरीय एम्बेडिंग पर निर्माण करते हैं। इस तकनीक ने University of Toronto और Stanford AI Lab जैसे संस्थानों में अनुसंधान को प्रभावित किया है, और Google DeepMind और OpenAI जैसी कंपनियों के उपकरणों में लागू किया गया है।
भविष्य की दिशाएँ
दुर्लभ शब्दों के लिए एम्बेडिंग में सुधार, क्रॉस-भाषाई संरेखण, और डोमेन-विशिष्ट अनुप्रयोगों पर अनुसंधान जारी है। कई अनुप्रयोगों में संदर्भात्मक एम्बेडिंग की ओर बदलाव ने स्थिर एम्बेडिंग को काफी हद तक प्रतिस्थापित कर दिया है, लेकिन स्थिर एम्बेडिंग दक्षता और व्याख्यात्मकता के लिए उपयोगी बनी हुई हैं।