FastText फेसबुक एआई रिसर्च (FAIR) द्वारा विकसित एक ओपन-सोर्स लाइब्रेरी है, जो शब्द प्रतिनिधित्व सीखने और टेक्स्ट वर्गीकरण करने के लिए बनाई गई है। इसे 2016 में सार्वजनिक रूप से जारी किया गया था। यह लाइब्रेरी मशीन-लर्निंग तकनीकों को कम्प्यूटेशनल दक्षता पर केंद्रित करते हुए जोड़ती है, जिससे यह बड़े पैमाने के प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयुक्त बनती है। इसका GitHub रिपॉजिटरी 19 मार्च, 2024 को संग्रहीत किया गया था, जो सक्रिय विकास के अंत का संकेत देता है, हालांकि स्रोत कोड और पूर्व-प्रशिक्षित मॉडल उपलब्ध रहते हैं।
शब्द प्रतिनिधित्व
FastText word2vec में उपयोग किए जाने वाले स्किप-ग्राम मॉडल पर आधारित है, लेकिन यह शब्दों की आंतरिक संरचना को भी ध्यान में रखता है। प्रत्येक शब्द के लिए केवल एक संपूर्ण इकाई के रूप में प्रतिनिधित्व सीखने के बजाय, यह शब्दों को कैरेक्टर n-ग्राम का उपयोग करके दर्शाता है। जो शब्द कैरेक्टर अनुक्रम साझा करते हैं, वे इसलिए कुछ समान सीखी गई जानकारी साझा कर सकते हैं।
सबवर्ड जानकारी का यह उपयोग विशेष रूप से दुर्लभ शब्दों और जटिल शब्द निर्माण वाली भाषाओं के लिए उपयोगी है, और यह fastText को प्रशिक्षण के दौरान न देखे गए शब्दों के लिए भी प्रतिनिधित्व बनाने की अनुमति देता है। फेसबुक एआई रिसर्च ने बाद में कई भाषाओं के लिए पूर्व-प्रशिक्षित fastText वेक्टर जारी किए, जिसमें कॉमन क्रॉल और विकिपीडिया पर प्रशिक्षित 157 भाषाओं का एक संग्रह शामिल है। ये वेक्टर Machine learning क्लासिफायर और शब्दार्थ समानता कार्यों जैसे डाउनस्ट्रीम अनुप्रयोगों में व्यापक रूप से अपनाए गए हैं।
टेक्स्ट वर्गीकरण
FastText का उपयोग पर्यवेक्षित टेक्स्ट वर्गीकरण के लिए भी किया जा सकता है। यह एक क्लास लेबल की भविष्यवाणी करने के लिए टेक्स्ट में शब्दों और शब्द n-ग्राम की जानकारी को जोड़ता है। यह विधि कम्प्यूटेशनल रूप से कुशल होने के लिए डिज़ाइन की गई थी और, अपने मूल मूल्यांकन में, कई समकालीन डीप-लर्निंग मॉडल के बराबर सटीकता प्राप्त की, जबकि प्रशिक्षण और भविष्यवाणी बहुत तेजी से की। पर्यवेक्षित मोड बड़े लेबल सेट को कुशलतापूर्वक संभालने के लिए पदानुक्रमित सॉफ्टमैक्स का उपयोग करता है, जिससे यह भावना विश्लेषण और दस्तावेज़ टैगिंग जैसे कार्यों के लिए व्यावहारिक बन जाता है।
आर्किटेक्चर और प्रशिक्षण
मुख्य मॉडल एक उथला Neural network है जिसमें एक एकल छिपी हुई परत होती है, जो आधुनिक Deep learning में सामान्य गहरी आर्किटेक्चर के विपरीत है। अप्रशिक्षित मोड में, प्रत्येक शब्द को उसके कैरेक्टर n-ग्राम वेक्टर के योग के साथ-साथ एक वैकल्पिक पूरे-शब्द वेक्टर के रूप में दर्शाया जाता है। पर्यवेक्षित मोड में, इनपुट टेक्स्ट को उसके शब्द वेक्टर के औसत के रूप में एम्बेड किया जाता है, जिसे फिर एक रैखिक क्लासिफायर के माध्यम से भेजा जाता है। प्रशिक्षण स्टोकेस्टिक ग्रेडिएंट डिसेंट और नेगेटिव सैंपलिंग के साथ किया जाता है, जो कम्प्यूटेशनल लागत को कम करता है। यह सरलता fastText को एक ही मशीन पर मिनटों के भीतर अरबों शब्दों तक स्केल करने की अनुमति देती है।
विरासत और प्रभाव
FastText ने टेक्स्ट प्रतिनिधित्व और वर्गीकरण में बाद के विकास को प्रभावित किया, विशेष रूप से सीमित कम्प्यूटेशनल संसाधनों वाले परिदृश्यों में। इसके सबवर्ड दृष्टिकोण ने रूपात्मक रूप से समृद्ध भाषाओं और शब्दावली से बाहर के शब्दों के प्रबंधन पर शोध को सूचित किया, और यह Large language model जैसे अधिक जटिल मॉडलों के मूल्यांकन के लिए एक सामान्य आधार रेखा बना हुआ है। संग्रहीत रिपॉजिटरी और जारी किए गए पूर्व-प्रशिक्षित वेक्टर का उपयोग शिक्षाविदों और उद्योग में शोधकर्ताओं और चिकित्सकों द्वारा जारी है, जिसमें क्लाउड प्लेटफॉर्म जैसे Amazon Web Services और Google Cloud में कस्टम Artificial intelligence पाइपलाइनों के लिए शामिल है।
यह भी देखें
- Word2vec (संबंधित अवधारणा, प्रदान की गई सूची में नहीं, लेकिन पाठ के रूप में उल्लेखित)
- Word2vec
- GloVe
- न्यूरल नेटवर्क (मशीन लर्निंग)
- प्राकृतिक भाषा प्रसंस्करण