एक कन्फ्यूजन नेटवर्क, जिसे कभी-कभी शब्द कन्फ्यूजन नेटवर्क या अनौपचारिक रूप से सॉसेज के रूप में जाना जाता है, एक डेटा संरचना है जिसका उपयोग प्राकृतिक भाषा प्रसंस्करण में कई स्वचालित वाक् पहचान या मशीन अनुवाद प्रणालियों के आउटपुट को संयोजित करने के लिए किया जाता है। यह शब्दों के अनुक्रम के बारे में प्रतिस्पर्धी परिकल्पनाओं को एक संक्षिप्त रूप में प्रस्तुत करता है, जिससे डाउनस्ट्रीम प्रक्रियाएं अधिक संदर्भ उपलब्ध होने तक अस्पष्ट सामग्री के बारे में निर्णय स्थगित कर सकती हैं।
संरचना एक सरल रैखिक निर्देशित अचक्रीय ग्राफ है। इसमें एक एकल प्रारंभ नोड और एक एकल अंत नोड होता है, जिसमें यह गुण होता है कि प्रारंभ से अंत तक हर पथ सभी मध्यवर्ती नोड्स से क्रम में गुजरता है। किन्हीं दो आसन्न नोड्स के बीच, किनारों का एक सेट वैकल्पिक शब्दों या वाक्यांशों का प्रतिनिधित्व करता है जो अनुक्रम में उस स्थिति पर कब्जा कर सकते हैं। विकल्पों के इस सेट को कन्फ्यूजन सेट कहा जाता है। प्रत्येक किनारे पर आमतौर पर एक भार या संभावना होती है जो उस विशेष विकल्प में अंतर्निहित प्रणालियों के विश्वास को दर्शाती है।
उत्पत्ति और उद्देश्य
कन्फ्यूजन नेटवर्क 1990 के दशक के अंत और 2000 के दशक की शुरुआत में स्वचालित वाक् पहचान में अनुसंधान से उभरे। वाक् पहचानकर्ता अक्सर एक लैटिस उत्पन्न करते हैं, जो संभावित शब्द अनुक्रमों का एक अधिक जटिल ग्राफ होता है, लेकिन लैटिस डाउनस्ट्रीम घटकों जैसे भाषा मॉडल या मशीन अनुवाद प्रणालियों के लिए प्रक्रिया करने में कम्प्यूटेशनल रूप से महंगा हो सकता है। कन्फ्यूजन नेटवर्क लैटिस को एक रैखिक संरचना में समेट कर इसे सरल बनाते हैं, कुछ अभिव्यंजक शक्ति का व्यापार दक्षता के लिए करते हैं। रैखिक रूप एल्गोरिदम को आउटपुट को एक ही पास में संसाधित करने की अनुमति देता है, जो टेलीफोनी या प्रसारण प्रतिलेखन जैसे वास्तविक समय के अनुप्रयोगों में विशेष रूप से मूल्यवान है।
अनौपचारिक नाम "सॉसेज" ग्राफ की दृश्य उपस्थिति से लिया गया है, जो खींचे जाने पर जुड़े खंडों की एक श्रृंखला जैसा दिखता है। यह शब्द 2000 के दशक की शुरुआत के अकादमिक साहित्य में दिखाई देता है, विशेष रूप से Nokia Bell Labs और लैटिस संपीड़न तकनीकों की खोज करने वाले अन्य संस्थानों के शोधकर्ताओं के काम में।
मशीन अनुवाद में उपयोग
मशीन अनुवाद में, कन्फ्यूजन नेटवर्क एक विशिष्ट भूमिका निभाते हैं। कई पहचानकर्ताओं से आउटपुट को संयोजित करने के बजाय, वे एक अनुवाद प्रणाली को कई अस्पष्ट इनपुट स्वीकार करने और प्रसंस्करण के बाद के चरणों तक अंतिम निर्णय स्थगित करने की अनुमति देते हैं। उदाहरण के लिए, जब अनिश्चितता के साथ लिखित भाषण का अनुवाद किया जाता है, तो अनुवाद प्रणाली इनपुट के रूप में एक कन्फ्यूजन नेटवर्क ले सकती है और एक अनुवाद उत्पन्न कर सकती है जो सभी विकल्पों पर एक साथ विचार करता है। यह दृष्टिकोण एक गलत प्रतिलेखन के लिए प्रतिबद्ध होने से बचाता है, और इसके बजाय अनुवाद मॉडल को अपने स्वयं के ज्ञान का उपयोग करके संभावनाओं को तौलने देता है।
इस संदर्भ में परिभाषित विशेषता निर्णयों का स्थगन है। कन्फ्यूजन नेटवर्क का उपयोग करने वाली एक अनुवाद प्रणाली एक लक्ष्य-भाषा आउटपुट उत्पन्न कर सकती है जो स्वयं एक कन्फ्यूजन नेटवर्क है, जिसे फिर अतिरिक्त मॉडल का उपयोग करके पुनः स्कोर या डीकोड किया जा सकता है। यह बोली जाने वाली भाषा अनुवाद में विशेष रूप से उपयोगी है, जहां पहचान त्रुटियां आम हैं और गलत प्रारंभिक विकल्प की लागत पूरे अनुवाद में फैल सकती है।
सॉफ्टवेयर कार्यान्वयन
कन्फ्यूजन नेटवर्क कई व्यापक रूप से उपयोग किए जाने वाले अनुवाद और वाक् प्रसंस्करण उपकरणों में लागू किए गए हैं। ओपन सोर्स मशीन अनुवाद सॉफ्टवेयर Moses, जो मुख्य रूप से university of edinburgh और Carnegie Mellon University में कई संस्थानों के योगदान के साथ विकसित किया गया है, में कन्फ्यूजन नेटवर्क डिकोडिंग के लिए समर्थन शामिल है। Moses उपयोगकर्ताओं को एक विशिष्ट प्रारूप में कन्फ्यूजन नेटवर्क इनपुट करने की अनुमति देता है और ऐसे अनुवाद उत्पन्न करता है जो वैकल्पिक परिकल्पनाओं को ध्यान में रखते हैं।
वाणिज्यिक क्षेत्र में, IBM Bluemix Watson में स्वामित्व अनुवाद API, जो अब ibm के क्लाउड प्रसाद का हिस्सा है, ने अपनी भाषण-से-भाषण अनुवाद पाइपलाइन के हिस्से के रूप में कन्फ्यूजन नेटवर्क का उपयोग किया है। API ऑडियो इनपुट स्वीकार करता है, पहचान करता है, और एक कन्फ्यूजन नेटवर्क का निर्माण करता है जिसे फिर अनुवाद इंजन को पारित किया जाता है, जिससे पहचान त्रुटियों के खिलाफ मजबूती में सुधार होता है।
अन्य तकनीकों से संबंध
कन्फ्यूजन नेटवर्क परिकल्पनाओं को संयोजित करने के अन्य तरीकों से संबंधित हैं लेकिन उनसे अलग हैं। Beam Search एक डिकोडिंग रणनीति है जो कई आंशिक परिकल्पनाओं की खोज करती है लेकिन एक संक्षिप्त ग्राफ संरचना उत्पन्न नहीं करती है। Sequence-to-Sequence (Seq2Seq) मॉडल, जैसे कि Transformer (architecture) आर्किटेक्चर पर आधारित, आमतौर पर एक एकल इनपुट अनुक्रम पर काम करते हैं और मूल रूप से वैकल्पिक इनपुट को संभालते नहीं हैं, हालांकि विस्तार प्रस्तावित किए गए हैं। कन्फ्यूजन नेटवर्क का उपयोग सिस्टम संयोजन में भी किया जाता है, जहां कई स्वतंत्र पहचानकर्ताओं से आउटपुट को एक एकल नेटवर्क में विलय कर दिया जाता है, एक तकनीक जो किसी भी एकल प्रणाली की तुलना में शब्द त्रुटि दर को कम करने के लिए दिखाई गई है।
आधुनिक Deep learning आधारित प्रणालियों में, कन्फ्यूजन नेटवर्क ने कम प्रमुखता देखी है, क्योंकि बड़े डेटासेट पर प्रशिक्षित एंड-टू-एंड मॉडल अक्सर अस्पष्टता को आंतरिक रूप से संभालते हैं। हालांकि, वे हाइब्रिड सिस्टम और उन परिदृश्यों में प्रासंगिक बने हुए हैं जहां कई विरासत प्रणालियों को एकीकृत किया जाना चाहिए, जैसे कि समाचार प्रसारण प्रतिलेखन या बहुभाषी कॉल रूटिंग में।
सीमाएं और विस्तार
कन्फ्यूजन नेटवर्क की एक प्रमुख सीमा यह है कि वे पदों का एक निश्चित क्रम मानते हैं। यह उन्हें विभिन्न परिकल्पनाओं में शब्द सम्मिलन या विलोपन का प्रतिनिधित्व करने के लिए अनुपयुक्त बनाता है, जो तब हो सकता है जब सिस्टम किसी शब्द की उपस्थिति पर असहमत हों। सामान्यीकृत कन्फ्यूजन नेटवर्क या संरेखण-आधारित वेरिएंट जैसे विस्तार अशक्त किनारों की अनुमति देकर या अधिक जटिल संरेखण प्रक्रियाओं का उपयोग करके इसे संबोधित करते हैं। एक और सीमा यह है कि रैखिक संरचना लंबी दूरी की निर्भरता खो सकती है जो एक पूर्ण लैटिस संरक्षित करेगा, हालांकि व्यवहार में दक्षता लाभ अक्सर इस नुकसान से अधिक होते हैं।
अनुसंधान ने अन्य कार्यों में कन्फ्यूजन नेटवर्क के उपयोग का भी पता लगाया है, जैसे कि Data Augmentation Neural network मॉडल के प्रशिक्षण के लिए, जहां विकल्प प्रशिक्षण डेटा में प्राकृतिक भिन्नता प्रदान करते हैं। कुछ काम ने उन्हें Large language model प्रॉम्प्टिंग पर लागू किया है, नेटवर्क का उपयोग करके उपयोगकर्ता क्वेरी की कई संभावित व्याख्याओं का प्रतिनिधित्व करते हैं।