अंग्रेज़ी से अनुवादित

बिग्राम दो आसन्न तत्वों का अनुक्रम है, आमतौर पर अक्षर या शब्द, जो सांख्यिकीय पाठ विश्लेषण में भाषा मॉडलिंग, क्रिप्टोग्राफी और वाक् पहचान के लिए उपयोग किया जाता है।

बिग्राम, जिसे डिग्राम के रूप में भी जाना जाता है, टोकन की एक स्ट्रिंग से लिए गए दो आसन्न तत्वों का एक अनुक्रम है, जो आम तौर पर अक्षर, शब्दांश या शब्द होते हैं। औपचारिक रूप से, बिग्राम एक एन-ग्राम है जिसमें n का मान 2 के बराबर होता है। किसी दिए गए स्ट्रिंग में प्रत्येक बिग्राम की आवृत्ति वितरण का उपयोग आमतौर पर कई अनुप्रयोगों में पाठ के सरल सांख्यिकीय विश्लेषण के लिए किया जाता है, जिसमें कम्प्यूटेशनल भाषाविज्ञान, क्रिप्टोग्राफी और भाषण पहचान शामिल हैं।

बिग्राम प्राकृतिक भाषा को समझने और संसाधित करने में एक मूलभूत निर्माण खंड के रूप में कार्य करते हैं। आसन्न वस्तुओं के सह-घटना की जांच करके, शोधकर्ता और इंजीनियर पाठ के भीतर स्थानीय संबंधों को पकड़ सकते हैं, जो किसी अनुक्रम में अगले शब्द की भविष्यवाणी करने से लेकर किसी दस्तावेज़ की भाषा की पहचान करने तक के कार्यों के लिए उपयोगी होते हैं। वे एकल-वर्ण या एकल-शब्द विश्लेषण और लंबे एन-ग्राम मॉडल के बीच एक मध्य मार्ग का प्रतिनिधित्व करते हैं, जो कम्प्यूटेशनल दक्षता और वर्णनात्मक शक्ति को संतुलित करते हैं।

अनुप्रयोग

बिग्राम का उपयोग विभिन्न क्षेत्रों में किया जाता है जहां पाठ के सांख्यिकीय गुण प्रासंगिक होते हैं। कम्प्यूटेशनल भाषाविज्ञान और प्राकृतिक भाषा प्रसंस्करण में, वे कई भाषा मॉडलों के अभिन्न अंग हैं, विशेष रूप से स्वचालित भाषण पहचान में उपयोग किए जाने वाले मॉडल। ये मॉडल संभावित ध्वन्यात्मक व्याख्याओं के बीच असंदिग्धता को दूर करने और प्रतिलेखन सटीकता में सुधार करने के लिए पिछले शब्द को देखते हुए एक शब्द की संभावना पर निर्भर करते हैं, जो बिग्राम आवृत्ति का प्रत्यक्ष अनुप्रयोग है।

क्रिप्टोग्राफी में, बिग्राम आवृत्ति हमले क्रिप्टोग्राम को हल करने के लिए उपयोग की जाने वाली एक शास्त्रीय तकनीक है, जिसमें सरल प्रतिस्थापन सिफर शामिल हैं। एन्क्रिप्टेड पाठ में अक्षर जोड़े की आवृत्ति की तुलना संदिग्ध भाषा से ज्ञात वितरणों के साथ करके, क्रिप्टोविश्लेषक संभावित अक्षर मैपिंग का अनुमान लगा सकते हैं। यह विधि व्यापक आवृत्ति विश्लेषण के अंतर्गत आती है, जो प्राकृतिक भाषाओं में वर्णों और उनके संयोजनों के गैर-समान वितरण का फायदा उठाती है।

सांख्यिकीय भाषा पहचान के लिए, बिग्राम आवृत्ति एक सीधा दृष्टिकोण प्रदान करती है। विभिन्न भाषाओं के लिए विशिष्ट बिग्राम वितरण की प्रोफाइल बनाकर, सिस्टम यह मापकर कि किसी अज्ञात पाठ नमूने की बिग्राम आवृत्तियाँ प्रत्येक प्रोफाइल से कितनी मेल खाती हैं, उसे वर्गीकृत कर सकते हैं। यह तकनीक अपेक्षाकृत छोटे पाठ अंशों के साथ भी प्रभावी है।

मनोरंजक भाषाविज्ञान, या लोगोलॉजी में, बिग्राम चंचल अन्वेषण का विषय हैं। उत्साही लोग अंग्रेजी शब्दों की तलाश करते हैं जो हर संभव बिग्राम से शुरू होते हैं, या दोहराए गए बिग्राम की एक स्ट्रिंग वाले शब्दों को खोजने का प्रयास करते हैं, जैसे कि 'लोगोगोग' शब्द। ये गतिविधियाँ अंग्रेजी भाषा में शब्द निर्माण के दिलचस्प पैटर्न और सीमाओं को उजागर करती हैं।

इसके अतिरिक्त, गैपी बिग्राम, जिन्हें स्किपिंग बिग्राम भी कहा जाता है, शब्द जोड़े हैं जो घटक शब्दों के बीच अंतराल की अनुमति देते हैं। यह भिन्नता व्यापक निर्भरता को मॉडल करने की अनुमति देती है, जैसे कि जोड़ने वाले शब्दों से बचना या निर्भरता व्याकरण के समान वाक्यात्मक संबंधों का अनुकरण करना। ऐसे बिग्राम एक वाक्य के भीतर अधिक दूर की अंतःक्रियाओं को पकड़ने के लिए मूल अवधारणा का विस्तार करते हैं।

अंग्रेजी भाषा में बिग्राम आवृत्ति

एक बड़े अंग्रेजी कोष में सबसे आम अक्षर बिग्राम की आवृत्ति एक विशिष्ट वितरण का पालन करती है। सबसे लगातार बिग्राम 'th' है, जो सभी बिग्राम घटनाओं के 3.56% पर दिखाई देता है, इसके बाद 'he' 3.07%, 'in' 2.43%, 'er' 2.05%, और 'an' 1.99% पर है। अन्य लगातार बिग्राम में 're' 1.85%, 'on' 1.76%, और 'at' 1.49% शामिल हैं।

वितरण 'en' 1.45%, 'nd' 1.35%, 'ti' 1.34%, 'es' 1.34%, 'or' 1.28%, और 'te' 1.20% के साथ जारी रहता है। बिग्राम 'of' 1.17% पर दिखाई देता है, 'ed' भी 1.17% पर। कम लेकिन फिर भी उल्लेखनीय आवृत्तियों में 'is' 1.13%, 'it' 1.12%, 'al' 1.09%, 'ar' 1.07%, 'st' 1.05%, और 'to' 1.05% शामिल हैं।

सूची में आगे, 'nt' की आवृत्ति 1.04%, 'ng' 0.95%, 'se' 0.93%, 'ha' 0.93%, 'as' 0.87%, 'ou' 0.87%, 'io' 0.83%, 'le' 0.83%, और 've' 0.83% है। बिग्राम 'co' और 'me' प्रत्येक 0.79% पर होते हैं, इसके बाद 'de' और 'hi' प्रत्येक 0.76% पर। अन्य छोटे प्रतिशतों में 'ri' 0.73%, 'ro' 0.73%, 'ic' 0.70%, 'ne' 0.69%, 'ea' 0.69%, 'ra' 0.69%, और 'ce' 0.65% शामिल हैं।

यह आवृत्ति डेटा क्रिप्टोग्राफी जैसे अनुप्रयोगों के लिए महत्वपूर्ण है, जहां सबसे आम जोड़े की पहचान करने से सिफर को तोड़ने में मदद मिलती है, और कीबोर्ड लेआउट या पाठ संपीड़न एल्गोरिदम को अनुकूलित करने के लिए।

अन्य एन-ग्राम से संबंध

बिग्राम सामान्य एन-ग्राम तकनीक का एक विशिष्ट मामला है, जहां n अनुक्रम में तत्वों की संख्या को दर्शाता है। यूनिग्राम (n=1) व्यक्तिगत टोकन पर विचार करते हैं, जबकि ट्रिग्राम (n=3) और उच्च-क्रम एन-ग्राम लंबे संदर्भों को पकड़ते हैं। n का चुनाव एक व्यापार-बंद शामिल करता है: बड़े n मान अधिक जटिल निर्भरता को मॉडल कर सकते हैं लेकिन डेटा विरलता के कारण विश्वसनीय रूप से अनुमान लगाने के लिए तेजी से अधिक डेटा की आवश्यकता होती है।

आधुनिक Machine learning अनुप्रयोगों में, विशेष रूप से Natural language processing पाइपलाइनों के भीतर, एन-ग्राम आँकड़े बड़े पैमाने पर Neural network मॉडल जैसे Transformer (architecture) आर्किटेक्चर द्वारा प्रतिस्थापित किए गए हैं। हालांकि, बिग्राम मौलिक language model अनुसंधान और उन परिदृश्यों में प्रासंगिक बने हुए हैं जहां कम्प्यूटेशनल संसाधन सीमित हैं या व्याख्या की आवश्यकता अधिक है।

कम्प्यूटेशनल पहलू

बिग्राम आवृत्तियों की गणना सीधी और कुशल है। टोकन की दी गई स्ट्रिंग के लिए, कोई अनुक्रम के माध्यम से पुनरावृत्ति कर सकता है, आसन्न टोकन के प्रत्येक जोड़े की गिनती कर सकता है। परिणामी गणनाओं को फिर संभावनाओं का उत्पादन करने के लिए सामान्यीकृत किया जा सकता है। यह प्रक्रिया मार्कोव मॉडल का आधार बनती है, जहां अगले टोकन की संभावना वर्तमान टोकन पर निर्भर होती है।

बिग्राम का उपयोग Data Augmentation तकनीकों और कुछ कार्यों के लिए Loss Functions में भी किया जाता है, हालांकि ये उपयोग पारंपरिक सांख्यिकीय तरीकों की तुलना में कम आम हैं। अनुक्रम निर्माण में Beam Search की अवधारणा अक्सर एन-ग्राम मॉडल से संभावना अनुमानों पर निर्भर करती है, हालांकि आधुनिक सिस्टम आम तौर पर अधिक उन्नत Neural network-आधारित स्कोरिंग का उपयोग करते हैं।

यह भी देखें

  • डिग्राफ (वर्तनी)
  • अक्षर आवृत्ति
  • एन-ग्राम
  • आवृत्ति विश्लेषण

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·nlp·linguistics·statistics
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास