कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (CTC) एक लॉस फ़ंक्शन और आउटपुट प्रतिनिधित्व है जिसका उपयोग न्यूरल नेटवर्क को अनुक्रम-लेबलिंग कार्यों पर प्रशिक्षित करने के लिए किया जाता है, जहाँ इनपुट और आउटपुट समय में संरेखित नहीं होते हैं। इसे 2006 में पेश किया गया था और यह अंतर्निहित न्यूरल नेटवर्क संरचना से स्वतंत्र है, जिसका अर्थ है कि इसे विभिन्न आर्किटेक्चर पर लागू किया जा सकता है। CTC का उपयोग आमतौर पर ऑनलाइन हस्तलेखन पहचान और वाक् पहचान जैसे कार्यों के लिए किया जाता है, जहाँ इनपुट अनुक्रम (जैसे, ऑडियो फ्रेम या पेन स्ट्रोक) आउटपुट लेबल अनुक्रम (जैसे, फोनीम या वर्ण) से काफी लंबा होता है।
CTC द्वारा संबोधित मुख्य चुनौती इनपुट अवलोकनों और लक्ष्य लेबलों के बीच अज्ञात संरेखण है। उदाहरण के लिए, वाक् ऑडियो में, कई समय स्लाइस एक एकल फोनीम के अनुरूप हो सकते हैं, और प्रशिक्षण के दौरान सटीक सीमाएँ ज्ञात नहीं होती हैं। CTC इसे प्रत्येक समय चरण पर लेबलों पर एक संभाव्यता वितरण की भविष्यवाणी करके हल करता है, जिसमें एक विशेष ब्लैंक आउटपुट भी शामिल है। यह सीमाओं या समय को सीखने का प्रयास नहीं करता है; इसके बजाय, लेबल अनुक्रम समतुल्य माने जाते हैं यदि वे केवल संरेखण में भिन्न होते हैं, ब्लैंक को अनदेखा करते हुए। यह समतुल्यता किसी दिए गए लेबल अनुक्रम के लिए कई संभावित संरेखणों की ओर ले जाती है, जिससे स्कोरिंग गैर-तुच्छ हो जाती है, लेकिन कुल संभाव्यता की गणना करने के लिए एक कुशल फॉरवर्ड-बैकवर्ड एल्गोरिदम मौजूद है।
प्रशिक्षण और स्कोरिंग
CTC स्कोर की गणना उन सभी संभावित संरेखणों पर संभाव्यताओं के योग के रूप में की जाती है जो एक लक्ष्य लेबल अनुक्रम पर मैप करते हैं। यह स्कोर अवकलनीय है, जिससे इसे न्यूरल नेटवर्क वज़न को अद्यतन करने के लिए बैक-प्रोपेगेशन एल्गोरिदम के साथ उपयोग किया जा सकता है। नेटवर्क में आमतौर पर एक सतत आउटपुट होता है, जैसे कि एक सॉफ्टमैक्स परत, जिसे प्रशिक्षण के माध्यम से प्रत्येक समय चरण पर प्रत्येक लेबल की संभावना को मॉडल करने के लिए फिट किया जाता है। फॉरवर्ड-बैकवर्ड एल्गोरिदम, जो छिपे हुए मार्कोव मॉडल (HMM) में उपयोग किए जाने वाले के समान है, लॉस और इसके ग्रेडिएंट की कुशल गणना को सक्षम बनाता है। CTC-फिटेड न्यूरल नेटवर्क के वैकल्पिक दृष्टिकोणों में HMM का उपयोग शामिल है, जो स्पष्ट रूप से राज्य संक्रमण और अवधियों को मॉडल करता है।
अनुप्रयोग और मील के पत्थर
CTC को कई उल्लेखनीय प्रणालियों में सफलतापूर्वक लागू किया गया है। 2009 में, एक CTC-प्रशिक्षित लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क पैटर्न पहचान प्रतियोगिताओं को जीतने वाला पहला आवर्तक न्यूरल नेटवर्क (RNN) था, जिसने कई जुड़े हस्तलेखन पहचान प्रतियोगिताओं में जीत हासिल की। 2014 में, चीनी कंपनी Baidu ने CTC लॉस फ़ंक्शन पर प्रशिक्षित एक द्विदिश RNN (LSTM नहीं) का उपयोग करके किसी भी पारंपरिक वाक् प्रसंस्करण विधियों का उपयोग किए बिना 2S09 Switchboard Hub5'00 वाक् पहचान डेटासेट बेंचमार्क को तोड़ दिया। 2015 में, CTC का उपयोग Google वॉयस सर्च और Android उपकरणों पर डिक्टेशन में किया गया, जिससे उपभोक्ता उत्पादों में इसकी व्यावहारिक उपयोगिता प्रदर्शित हुई।
सीमाएँ और विस्तार
CTC एकदिष्ट संरेखण तक सीमित है, जिसका अर्थ है कि आउटपुट लेबलों का क्रम इनपुट अवलोकनों के क्रम के अनुरूप होना चाहिए। यह वाक् पहचान के लिए कोई समस्या नहीं है, जहाँ फोनीम और शब्द एक निश्चित क्रम में होते हैं। हालाँकि, यह भाषा अनुवाद के लिए समस्याग्रस्त हो सकता है, क्योंकि एक भाषा में बाद के शब्द दूसरी भाषा में पहले के शब्दों के अनुरूप हो सकते हैं, विभिन्न शब्द क्रमों के कारण। इस सीमा ने वैकल्पिक अनुक्रम-से-अनुक्रम मॉडल के विकास को प्रेरित किया है, जैसे कि ध्यान तंत्र पर आधारित, जो गैर-एकदिष्ट संरेखण को संभाल सकते हैं। इसके बावजूद, CTC अनुक्रम लेबलिंग में एक मौलिक तकनीक बनी हुई है और अक्सर हाइब्रिड प्रणालियों में या अधिक जटिल आर्किटेक्चर में एक घटक के रूप में उपयोग की जाती है।
अन्य तकनीकों से संबंध
CTC अन्य अनुक्रम मॉडलिंग दृष्टिकोणों से निकटता से संबंधित है। इसकी तुलना अक्सर छिपे हुए मार्कोव मॉडल (HMM) से की जाती है, जो अनुक्रम संरेखण को भी संभालते हैं लेकिन एक अलग संभाव्य ढांचे का उपयोग करते हैं। गहन शिक्षण में, CTC का उपयोग अक्सर आवर्तक न्यूरल नेटवर्क के साथ किया जाता है, विशेष रूप से LSTM और द्विदिश RNN के साथ, लेकिन इसे ट्रांसफॉर्मर जैसे अन्य आर्किटेक्चर पर भी लागू किया जा सकता है। लॉस फ़ंक्शन एक प्रकार का लॉस फ़ंक्शन है जिसका उपयोग पर्यवेक्षित शिक्षण में किया जाता है, और इसे अक्सर अनुमान के दौरान डिकोडिंग के लिए बीम-सर्च जैसी तकनीकों के साथ जोड़ा जाता है। संरेखण-मुक्त प्रशिक्षण पर CTC का ध्यान अनुक्रम-से-अनुक्रम शिक्षण में बाद के विकास को प्रभावित करता है, हालाँकि यह ध्यान-आधारित विधियों से अलग रहता है।