अंग्रेज़ी से अनुवादित

n-gram किसी दिए गए पाठ या भाषण नमूने से n वस्तुओं का एक सन्निहित अनुक्रम है, जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण और कम्प्यूटेशनल जीवविज्ञान में सांख्यिकीय विश्लेषण और अनुक्रमिक डेटा के मॉडलिंग के लिए किया जाता है।

एन-ग्राम किसी दिए गए पाठ या भाषण के नमूने से n वस्तुओं का एक सतत अनुक्रम है। वस्तुएँ वर्ण, शब्दांश, शब्द, स्वनिम, या यहाँ तक कि जैविक अनुक्रम जैसे किसी जीनोम में आधार युग्म हो सकते हैं। एन-ग्राम एक पाठ कोष या भाषण कोष से एकत्र किए जाते हैं और सांख्यिकीय प्राकृतिक भाषा प्रसंस्करण के लिए मौलिक हैं, जो मॉडलों को अनुक्रमिक डेटा में स्थानीय पैटर्न और निर्भरताओं को पकड़ने में सक्षम बनाते हैं।

यह शब्द लैटिन संख्यात्मक उपसर्गों से लिया गया है: एक यूनिग्राम एक वस्तु का अनुक्रम है, एक बिग्राम (या डिग्राम) दो का, एक ट्राइग्राम तीन का, और इसी तरह आगे। बड़े आकारों के लिए, अंग्रेजी कार्डिनल संख्याओं का उपयोग किया जाता है, जैसे चार-ग्राम या पाँच-ग्राम। कम्प्यूटेशनल जीव विज्ञान में, समान अनुक्रमों को k-मर्स कहा जाता है, जिसमें ग्रीक उपसर्गों जैसे मोनोमर, डाइमर, ट्राइमर, या अंग्रेजी रूपों जैसे वन-मर, टू-मर का उपयोग होता है। जब वस्तुएँ शब्द होती हैं, तो एन-ग्राम को कभी-कभी शिंगल्स कहा जाता है।

ऐतिहासिक विकास

भाषा में एन-ग्राम मॉडल की अवधारणा 1951 की है, जब क्लॉड शैनन ने सूचना सिद्धांत के संदर्भ में उन पर चर्चा की थी। शैनन ने प्रदर्शित किया कि कैसे वर्ण-स्तरीय और शब्द-स्तरीय एन-ग्राम मॉडल देखे गए अनुक्रमों की संभाव्यता वितरण से नमूना लेकर प्रशंसनीय अंग्रेजी पाठ उत्पन्न कर सकते हैं। उदाहरण के लिए, एक 3-ग्राम वर्ण मॉडल "in no ist lat whey cratict froure birs grocid pondenome" जैसा पाठ उत्पन्न कर सकता है, जबकि एक 2-ग्राम शब्द मॉडल "the head and in frontal attack on an english writer" जैसा पाठ उत्पन्न कर सकता है। इन शुरुआती प्रयोगों ने एन-ग्राम को सांख्यिकीय रूप से भाषा मॉडलिंग के लिए एक व्यावहारिक उपकरण के रूप में स्थापित किया।

प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग

प्राकृतिक भाषा प्रसंस्करण में, एन-ग्राम बैग-ऑफ-वर्ड्स मॉडल को शब्द क्रम जानकारी को पकड़ने की अनुमति देते हैं जो अन्यथा खो जाती। एक पारंपरिक बैग-ऑफ-वर्ड्स प्रतिनिधित्व एक दस्तावेज़ को शब्दों के एक अव्यवस्थित सेट के रूप में मानता है, लेकिन एन-ग्राम विशेषताएँ स्थानीय संदर्भ को संरक्षित करती हैं। यह क्षमता भाषा मॉडलिंग, वर्तनी सुधार, मशीन अनुवाद, और पाठ वर्गीकरण जैसे कार्यों के लिए आवश्यक है। एन-ग्राम भाषा मॉडल पूर्ववर्ती n-1 शब्दों को देखते हुए एक शब्द की संभावना का अनुमान लगाते हैं, जो तंत्रिका नेटवर्क के उदय से पहले कई सांख्यिकीय दृष्टिकोणों का आधार बनता है।

बड़े भाषा मॉडल जो ट्रांसफार्मर वास्तुकला पर निर्मित हैं, ने कई कार्यों के लिए स्पष्ट एन-ग्राम मॉडल को काफी हद तक प्रतिस्थापित कर दिया है, लेकिन एन-ग्राम लेखकत्व आरोपण, स्टाइलोमेट्री, और जैव सूचना विज्ञान जैसे क्षेत्रों में प्रासंगिक बने हुए हैं। गूगल बुक्स एनग्राम व्यूअर, जो लाखों डिजिटलीकृत पुस्तकों में एन-ग्राम की आवृत्ति को चार्ट करता है, सांस्कृतिक और भाषाई विश्लेषण के लिए उनकी निरंतर उपयोगिता को प्रदर्शित करता है।

कम्प्यूटेशनल जीव विज्ञान

जीनोमिक्स में, k-मर्स (एन-ग्राम के जैविक समकक्ष) का उपयोग डीएनए और आरएनए अनुक्रमों का विश्लेषण करने के लिए किया जाता है। एक k-मर लंबाई k का एक सतत उप-अनुक्रम है, और k-मर आवृत्ति विश्लेषण जीनोम असेंबली, अनुक्रम संरेखण, और गुणवत्ता नियंत्रण के लिए एक मानक तकनीक है। उदाहरण के लिए, डीएनए अनुक्रमण परियोजनाओं के लिए एल्गोरिदम अक्सर त्रुटियों का पता लगाने या जीनोम आकार का अनुमान लगाने के लिए k-मर वितरण का उपयोग करते हैं। k का चुनाव संवेदनशीलता और विशिष्टता को प्रभावित करता है: छोटे k-मर्स अधिक प्रचुर होते हैं लेकिन कम विशिष्ट होते हैं, जबकि बड़े k-मर्स अधिक अद्वितीय मिलान प्रदान करते हैं लेकिन अनुक्रमण त्रुटियों के कारण अनुपस्थित हो सकते हैं।

सांख्यिकीय गुण और प्रकार

एन-ग्राम मॉडल को अनदेखे अनुक्रमों को संभालने के लिए स्मूथ किया जा सकता है, जिसमें एड-वन स्मूथिंग या नेसर-ने स्मूथिंग जैसी अधिक उन्नत तकनीकों का उपयोग होता है। उन्हें आवृत्ति द्वारा भारित भी किया जा सकता है, जैसा कि गूगल एन-ग्राम कोष में देखा गया है, जो "serve as the independent" (794 घटनाएँ) या "ceramics collectables fine" (130 घटनाएँ) जैसे वाक्यांशों के लिए गणना प्रदान करता है। ये आवृत्ति वितरण संभाव्य भविष्यवाणियों को सक्षम करते हैं और पूर्वानुमानित पाठ इनपुट से लेकर भाषण पहचान तक के अनुप्रयोगों में उपयोग किए जाते हैं।

सीमाएँ और विस्तार

एन-ग्राम की एक प्रमुख सीमा निश्चित विंडो आकार से परे लंबी दूरी की निर्भरताओं को पकड़ने में उनकी असमर्थता है। n बढ़ाने से संदर्भ में सुधार होता है लेकिन डेटा विरलता की ओर ले जाता है, क्योंकि कई संभावित अनुक्रम प्रशिक्षण डेटा में कभी प्रकट नहीं होते। इसे संबोधित करने के लिए, शोधकर्ताओं ने बैकऑफ मॉडल, इंटरपोलेशन, और तंत्रिका भाषा मॉडल विकसित किए हैं जो वितरित प्रतिनिधित्व सीखते हैं। फिर भी, एन-ग्राम एक सरल, व्याख्यात्मक आधार रेखा बने हुए हैं और अक्सर मशीन लर्निंग विधियों के साथ हाइब्रिड सिस्टम में उपयोग किए जाते हैं।

पाठ और भाषण के अलावा, एन-ग्राम को संगीत विश्लेषण पर लागू किया गया है, जहाँ नोट्स या कॉर्ड्स के अनुक्रम वस्तुओं के रूप में माने जाते हैं, और पैकेट अनुक्रमों में विसंगतियों का पता लगाने के लिए नेटवर्क सुरक्षा में भी। उनकी सामान्यता उन्हें अनुक्रमिक डेटा से निपटने वाले विषयों में एक बहुमुखी उपकरण बनाती है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·statistics·computational-linguistics·bioinformatics
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास