अंग्रेज़ी से अनुवादित

FastText फेसबुक एआई रिसर्च (2016) का एक ओपन-सोर्स लाइब्रेरी है, जो सबवर्ड इकाइयों और कुशल टेक्स्ट वर्गीकरण के माध्यम से शब्द प्रतिनिधित्व सीखने के लिए है, और मार्च 2024 में GitHub पर संग्रहीत किया गया था।

FastText फेसबुक एआई रिसर्च (FAIR) द्वारा विकसित एक ओपन-सोर्स लाइब्रेरी है, जो शब्द प्रतिनिधित्व सीखने और टेक्स्ट वर्गीकरण करने के लिए बनाई गई है। इसे 2016 में सार्वजनिक रूप से जारी किया गया था। यह लाइब्रेरी मशीन-लर्निंग तकनीकों को कम्प्यूटेशनल दक्षता पर केंद्रित करते हुए जोड़ती है, जिससे यह बड़े पैमाने के प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए उपयुक्त बनती है। इसका GitHub रिपॉजिटरी 19 मार्च, 2024 को संग्रहीत किया गया था, जो सक्रिय विकास के अंत का संकेत देता है, हालांकि स्रोत कोड और पूर्व-प्रशिक्षित मॉडल उपलब्ध रहते हैं।

शब्द प्रतिनिधित्व

FastText word2vec में उपयोग किए जाने वाले स्किप-ग्राम मॉडल पर आधारित है, लेकिन यह शब्दों की आंतरिक संरचना को भी ध्यान में रखता है। प्रत्येक शब्द के लिए केवल एक संपूर्ण इकाई के रूप में प्रतिनिधित्व सीखने के बजाय, यह शब्दों को कैरेक्टर n-ग्राम का उपयोग करके दर्शाता है। जो शब्द कैरेक्टर अनुक्रम साझा करते हैं, वे इसलिए कुछ समान सीखी गई जानकारी साझा कर सकते हैं।

सबवर्ड जानकारी का यह उपयोग विशेष रूप से दुर्लभ शब्दों और जटिल शब्द निर्माण वाली भाषाओं के लिए उपयोगी है, और यह fastText को प्रशिक्षण के दौरान न देखे गए शब्दों के लिए भी प्रतिनिधित्व बनाने की अनुमति देता है। फेसबुक एआई रिसर्च ने बाद में कई भाषाओं के लिए पूर्व-प्रशिक्षित fastText वेक्टर जारी किए, जिसमें कॉमन क्रॉल और विकिपीडिया पर प्रशिक्षित 157 भाषाओं का एक संग्रह शामिल है। ये वेक्टर Machine learning क्लासिफायर और शब्दार्थ समानता कार्यों जैसे डाउनस्ट्रीम अनुप्रयोगों में व्यापक रूप से अपनाए गए हैं।

टेक्स्ट वर्गीकरण

FastText का उपयोग पर्यवेक्षित टेक्स्ट वर्गीकरण के लिए भी किया जा सकता है। यह एक क्लास लेबल की भविष्यवाणी करने के लिए टेक्स्ट में शब्दों और शब्द n-ग्राम की जानकारी को जोड़ता है। यह विधि कम्प्यूटेशनल रूप से कुशल होने के लिए डिज़ाइन की गई थी और, अपने मूल मूल्यांकन में, कई समकालीन डीप-लर्निंग मॉडल के बराबर सटीकता प्राप्त की, जबकि प्रशिक्षण और भविष्यवाणी बहुत तेजी से की। पर्यवेक्षित मोड बड़े लेबल सेट को कुशलतापूर्वक संभालने के लिए पदानुक्रमित सॉफ्टमैक्स का उपयोग करता है, जिससे यह भावना विश्लेषण और दस्तावेज़ टैगिंग जैसे कार्यों के लिए व्यावहारिक बन जाता है।

आर्किटेक्चर और प्रशिक्षण

मुख्य मॉडल एक उथला Neural network है जिसमें एक एकल छिपी हुई परत होती है, जो आधुनिक Deep learning में सामान्य गहरी आर्किटेक्चर के विपरीत है। अप्रशिक्षित मोड में, प्रत्येक शब्द को उसके कैरेक्टर n-ग्राम वेक्टर के योग के साथ-साथ एक वैकल्पिक पूरे-शब्द वेक्टर के रूप में दर्शाया जाता है। पर्यवेक्षित मोड में, इनपुट टेक्स्ट को उसके शब्द वेक्टर के औसत के रूप में एम्बेड किया जाता है, जिसे फिर एक रैखिक क्लासिफायर के माध्यम से भेजा जाता है। प्रशिक्षण स्टोकेस्टिक ग्रेडिएंट डिसेंट और नेगेटिव सैंपलिंग के साथ किया जाता है, जो कम्प्यूटेशनल लागत को कम करता है। यह सरलता fastText को एक ही मशीन पर मिनटों के भीतर अरबों शब्दों तक स्केल करने की अनुमति देती है।

विरासत और प्रभाव

FastText ने टेक्स्ट प्रतिनिधित्व और वर्गीकरण में बाद के विकास को प्रभावित किया, विशेष रूप से सीमित कम्प्यूटेशनल संसाधनों वाले परिदृश्यों में। इसके सबवर्ड दृष्टिकोण ने रूपात्मक रूप से समृद्ध भाषाओं और शब्दावली से बाहर के शब्दों के प्रबंधन पर शोध को सूचित किया, और यह Large language model जैसे अधिक जटिल मॉडलों के मूल्यांकन के लिए एक सामान्य आधार रेखा बना हुआ है। संग्रहीत रिपॉजिटरी और जारी किए गए पूर्व-प्रशिक्षित वेक्टर का उपयोग शिक्षाविदों और उद्योग में शोधकर्ताओं और चिकित्सकों द्वारा जारी है, जिसमें क्लाउड प्लेटफॉर्म जैसे Amazon Web Services और Google Cloud में कस्टम Artificial intelligence पाइपलाइनों के लिए शामिल है।

यह भी देखें

  • Word2vec (संबंधित अवधारणा, प्रदान की गई सूची में नहीं, लेकिन पाठ के रूप में उल्लेखित)
  • Word2vec
  • GloVe
  • न्यूरल नेटवर्क (मशीन लर्निंग)
  • प्राकृतिक भाषा प्रसंस्करण
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·natural-language-processing·open-source-software·text-classification
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास