एन-ग्राम किसी दिए गए पाठ या भाषण के नमूने से n वस्तुओं का एक सतत अनुक्रम है। वस्तुएँ वर्ण, शब्दांश, शब्द, स्वनिम, या यहाँ तक कि जैविक अनुक्रम जैसे किसी जीनोम में आधार युग्म हो सकते हैं। एन-ग्राम एक पाठ कोष या भाषण कोष से एकत्र किए जाते हैं और सांख्यिकीय प्राकृतिक भाषा प्रसंस्करण के लिए मौलिक हैं, जो मॉडलों को अनुक्रमिक डेटा में स्थानीय पैटर्न और निर्भरताओं को पकड़ने में सक्षम बनाते हैं।
यह शब्द लैटिन संख्यात्मक उपसर्गों से लिया गया है: एक यूनिग्राम एक वस्तु का अनुक्रम है, एक बिग्राम (या डिग्राम) दो का, एक ट्राइग्राम तीन का, और इसी तरह आगे। बड़े आकारों के लिए, अंग्रेजी कार्डिनल संख्याओं का उपयोग किया जाता है, जैसे चार-ग्राम या पाँच-ग्राम। कम्प्यूटेशनल जीव विज्ञान में, समान अनुक्रमों को k-मर्स कहा जाता है, जिसमें ग्रीक उपसर्गों जैसे मोनोमर, डाइमर, ट्राइमर, या अंग्रेजी रूपों जैसे वन-मर, टू-मर का उपयोग होता है। जब वस्तुएँ शब्द होती हैं, तो एन-ग्राम को कभी-कभी शिंगल्स कहा जाता है।
ऐतिहासिक विकास
भाषा में एन-ग्राम मॉडल की अवधारणा 1951 की है, जब क्लॉड शैनन ने सूचना सिद्धांत के संदर्भ में उन पर चर्चा की थी। शैनन ने प्रदर्शित किया कि कैसे वर्ण-स्तरीय और शब्द-स्तरीय एन-ग्राम मॉडल देखे गए अनुक्रमों की संभाव्यता वितरण से नमूना लेकर प्रशंसनीय अंग्रेजी पाठ उत्पन्न कर सकते हैं। उदाहरण के लिए, एक 3-ग्राम वर्ण मॉडल "in no ist lat whey cratict froure birs grocid pondenome" जैसा पाठ उत्पन्न कर सकता है, जबकि एक 2-ग्राम शब्द मॉडल "the head and in frontal attack on an english writer" जैसा पाठ उत्पन्न कर सकता है। इन शुरुआती प्रयोगों ने एन-ग्राम को सांख्यिकीय रूप से भाषा मॉडलिंग के लिए एक व्यावहारिक उपकरण के रूप में स्थापित किया।
प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग
प्राकृतिक भाषा प्रसंस्करण में, एन-ग्राम बैग-ऑफ-वर्ड्स मॉडल को शब्द क्रम जानकारी को पकड़ने की अनुमति देते हैं जो अन्यथा खो जाती। एक पारंपरिक बैग-ऑफ-वर्ड्स प्रतिनिधित्व एक दस्तावेज़ को शब्दों के एक अव्यवस्थित सेट के रूप में मानता है, लेकिन एन-ग्राम विशेषताएँ स्थानीय संदर्भ को संरक्षित करती हैं। यह क्षमता भाषा मॉडलिंग, वर्तनी सुधार, मशीन अनुवाद, और पाठ वर्गीकरण जैसे कार्यों के लिए आवश्यक है। एन-ग्राम भाषा मॉडल पूर्ववर्ती n-1 शब्दों को देखते हुए एक शब्द की संभावना का अनुमान लगाते हैं, जो तंत्रिका नेटवर्क के उदय से पहले कई सांख्यिकीय दृष्टिकोणों का आधार बनता है।
बड़े भाषा मॉडल जो ट्रांसफार्मर वास्तुकला पर निर्मित हैं, ने कई कार्यों के लिए स्पष्ट एन-ग्राम मॉडल को काफी हद तक प्रतिस्थापित कर दिया है, लेकिन एन-ग्राम लेखकत्व आरोपण, स्टाइलोमेट्री, और जैव सूचना विज्ञान जैसे क्षेत्रों में प्रासंगिक बने हुए हैं। गूगल बुक्स एनग्राम व्यूअर, जो लाखों डिजिटलीकृत पुस्तकों में एन-ग्राम की आवृत्ति को चार्ट करता है, सांस्कृतिक और भाषाई विश्लेषण के लिए उनकी निरंतर उपयोगिता को प्रदर्शित करता है।
कम्प्यूटेशनल जीव विज्ञान
जीनोमिक्स में, k-मर्स (एन-ग्राम के जैविक समकक्ष) का उपयोग डीएनए और आरएनए अनुक्रमों का विश्लेषण करने के लिए किया जाता है। एक k-मर लंबाई k का एक सतत उप-अनुक्रम है, और k-मर आवृत्ति विश्लेषण जीनोम असेंबली, अनुक्रम संरेखण, और गुणवत्ता नियंत्रण के लिए एक मानक तकनीक है। उदाहरण के लिए, डीएनए अनुक्रमण परियोजनाओं के लिए एल्गोरिदम अक्सर त्रुटियों का पता लगाने या जीनोम आकार का अनुमान लगाने के लिए k-मर वितरण का उपयोग करते हैं। k का चुनाव संवेदनशीलता और विशिष्टता को प्रभावित करता है: छोटे k-मर्स अधिक प्रचुर होते हैं लेकिन कम विशिष्ट होते हैं, जबकि बड़े k-मर्स अधिक अद्वितीय मिलान प्रदान करते हैं लेकिन अनुक्रमण त्रुटियों के कारण अनुपस्थित हो सकते हैं।
सांख्यिकीय गुण और प्रकार
एन-ग्राम मॉडल को अनदेखे अनुक्रमों को संभालने के लिए स्मूथ किया जा सकता है, जिसमें एड-वन स्मूथिंग या नेसर-ने स्मूथिंग जैसी अधिक उन्नत तकनीकों का उपयोग होता है। उन्हें आवृत्ति द्वारा भारित भी किया जा सकता है, जैसा कि गूगल एन-ग्राम कोष में देखा गया है, जो "serve as the independent" (794 घटनाएँ) या "ceramics collectables fine" (130 घटनाएँ) जैसे वाक्यांशों के लिए गणना प्रदान करता है। ये आवृत्ति वितरण संभाव्य भविष्यवाणियों को सक्षम करते हैं और पूर्वानुमानित पाठ इनपुट से लेकर भाषण पहचान तक के अनुप्रयोगों में उपयोग किए जाते हैं।
सीमाएँ और विस्तार
एन-ग्राम की एक प्रमुख सीमा निश्चित विंडो आकार से परे लंबी दूरी की निर्भरताओं को पकड़ने में उनकी असमर्थता है। n बढ़ाने से संदर्भ में सुधार होता है लेकिन डेटा विरलता की ओर ले जाता है, क्योंकि कई संभावित अनुक्रम प्रशिक्षण डेटा में कभी प्रकट नहीं होते। इसे संबोधित करने के लिए, शोधकर्ताओं ने बैकऑफ मॉडल, इंटरपोलेशन, और तंत्रिका भाषा मॉडल विकसित किए हैं जो वितरित प्रतिनिधित्व सीखते हैं। फिर भी, एन-ग्राम एक सरल, व्याख्यात्मक आधार रेखा बने हुए हैं और अक्सर मशीन लर्निंग विधियों के साथ हाइब्रिड सिस्टम में उपयोग किए जाते हैं।
पाठ और भाषण के अलावा, एन-ग्राम को संगीत विश्लेषण पर लागू किया गया है, जहाँ नोट्स या कॉर्ड्स के अनुक्रम वस्तुओं के रूप में माने जाते हैं, और पैकेट अनुक्रमों में विसंगतियों का पता लगाने के लिए नेटवर्क सुरक्षा में भी। उनकी सामान्यता उन्हें अनुक्रमिक डेटा से निपटने वाले विषयों में एक बहुमुखी उपकरण बनाती है।
यह भी देखें
- कृत्रिम बुद्धिमत्ता
- मशीन लर्निंग
- प्राकृतिक भाषा प्रसंस्करण
- सांख्यिकीय-मॉडल
- गूगल-बुक्स-एनग्राम-व्यूअर