पेन ट्रीबैंक (PTB) अंग्रेजी पाठ का एक कॉर्पस है जिसमें पार्ट-ऑफ-स्पीच टैग और वाक्यात्मक वाक्यांश संरचना वृक्षों के साथ एनोटेट किया गया है। 1990 के दशक की शुरुआत में पेंसिल्वेनिया विश्वविद्यालय में विकसित, यह प्राकृतिक भाषा प्रसंस्करण (NLP) प्रणालियों के प्रशिक्षण और मूल्यांकन के लिए एक मानक बेंचमार्क बन गया। "ट्रीबैंक" नाम पदानुक्रमित पार्स संरचनाओं, या वृक्षों को संदर्भित करता है, जो एक वाक्य में शब्दों के बीच व्याकरणिक संबंधों को एन्कोड करते हैं।
प्रारंभिक रिलीज़ ACL एंथोलॉजी कॉर्पस के वॉल स्ट्रीट जर्नल (WSJ) अनुभाग पर केंद्रित थीं, जिसमें समाचार पाठ के लगभग 1 मिलियन शब्द शामिल थे। बाद के संस्करणों में अन्य शैलियों जैसे ट्रांसक्राइब्ड टेलीफोन वार्तालाप, प्रसारण समाचार और वेब पाठ शामिल करने के लिए विस्तार किया गया। PTB एनोटेशन योजना 36 पार्ट-ऑफ-स्पीच टैग (जैसे, एकवचन संज्ञाओं के लिए NN, भूतकाल क्रियाओं के लिए VBD) और वाक्यांश श्रेणियों (जैसे, NP, VP, PP) का एक सेट उपयोग करती है, जिसमें विषय और वस्तु जैसे व्याकरणिक कार्यों के लिए लेबल होते हैं।
निर्माण और एनोटेशन
PTB का निर्माण पेंसिल्वेनिया विश्वविद्यालय में मिशेल मार्कस के नेतृत्व में एक टीम द्वारा किया गया था, जिसमें बीट्राइस सैंटोरिनी और मैरी एन मार्किनकिविज़ सहित शोधकर्ताओं का योगदान था। एनोटेशन प्रक्रिया में दो मुख्य चरण शामिल थे: पार्ट-ऑफ-स्पीच टैगिंग और वाक्यात्मक ब्रैकेटिंग। मानव एनोटेटरों ने शुरू में प्रत्येक टोकन को टैग सौंपे, इसके बाद वाक्यांश सीमाएँ बनाने के लिए एक अलग पास किया। गाइडलाइन पुस्तक, जिसे आमतौर पर "ब्रैकेटिंग गाइडलाइन्स" के रूप में जाना जाता है, ने विराम चिह्न, समन्वय और अन्य भाषाई घटनाओं को संभालने के लिए विस्तृत नियम निर्दिष्ट किए।
कॉर्पस को 1993 से शुरू करके वृद्धिशील रूप से जारी किया गया था। पहला सार्वजनिक वितरण, पेन ट्रीबैंक-1 (PTB-1), में विभिन्न शैलियों में 4.5 मिलियन शब्दों का पार्स किया गया पाठ शामिल था। एक अधिक व्यापक रूप से उद्धृत संस्करण, पेन ट्रीबैंक-3 (PTB-3), 1999 में जारी किया गया, जिसने एनोटेशन को परिष्कृत किया और WSJ अनुभागों को जोड़ा जो कई NLP कार्यों के लिए वास्तविक मानक बन गए। पहली रिलीज़ की सटीक तारीख मार्च 1993 थी, LDC कैटलॉग के अनुसार।
NLP अनुसंधान पर प्रभाव
PTB पार्ट-ऑफ-स्पीच टैगिंग और वाक्यात्मक पार्सिंग अनुसंधान के लिए एक आधारशिला बन गया। 1990 और 2000 के दशक में, CoNLL साझा कार्यों जैसे प्रतिस्पर्धी मूल्यांकनों ने PTB-व्युत्पन्न डेटासेट का उपयोग किया, जिससे संभाव्य संदर्भ-मुक्त व्याकरण (PCFGs) और शाब्दिक पार्सर जैसे मॉडलों के साथ सांख्यिकीय पार्सिंग में प्रगति हुई। उदाहरण के लिए, यूजीन-चार्नियाक का पार्सर और स्टैनफोर्ड-पार्सर अक्सर PTB परीक्षण सेटों पर सटीकता के साथ रिपोर्ट किए गए थे।
पार्सिंग से परे, PTB के WSJ अनुभागों को नामित इकाई पहचान और अर्थपूर्ण भूमिका लेबलिंग सहित कई अन्य कार्यों के लिए पुनः उपयोग किया गया। कॉर्पस ने प्रशिक्षण और मूल्यांकन के लिए स्वर्ण-मानक एनोटेशन प्रदान करके NLTK और spaCy के विकास को भी सूचित किया। मशीन लर्निंग और डीप लर्निंग में आधुनिक दृष्टिकोण, जैसे आवर्ती तंत्रिका नेटवर्क और ट्रांसफॉर्मर, अभी भी PTB डेटा पर पर्प्लेक्सिटी या सटीकता संख्याएँ रिपोर्ट करते हैं, हालांकि बड़े पूर्व-प्रशिक्षित बड़े भाषा मॉडल के युग में इसका उपयोग घट गया है।
मानक बेंचमार्क और विविधताएँ
एक सामान्य प्रयोगात्मक सेटअप PTB शब्द-स्तरीय भाषा मॉडलिंग बेंचमार्क है, जहाँ प्रशिक्षण, सत्यापन और परीक्षण विभाजन क्रमशः WSJ अनुभाग 0-20, 21-22 और 23-24 के अनुरूप हैं। यह विभाजन, 2010 में टोमास मिकोलोव और सहयोगियों द्वारा स्थापित, मॉडलों के बीच प्रतिलिपि प्रस्तुत करने योग्य तुलना की अनुमति देता है। बेंचमार्क में पिछले संदर्भ को देखते हुए अगले शब्द की भविष्यवाणी करना शामिल है, जिसमें प्रदर्शन को पर्प्लेक्सिटी द्वारा मापा जाता है। कई प्रारंभिक तंत्रिका नेटवर्क भाषा मॉडल, जैसे LSTM और GRU, ने इस बेंचमार्क पर महत्वपूर्ण पर्प्लेक्सिटी कमी हासिल की।
PTB ने कई एनोटेशन विविधताएँ भी उत्पन्न कीं, जिनमें ? और यूनिवर्सल डिपेंडेंसी रूपांतरण शामिल हैं, जो मूल टैगसेट को एक क्रॉस-भाषाई एनोटेशन योजना में मैप करते हैं। Google सिंटैक्टिक एन-ग्राम डेटासेट, 2015 में Google द्वारा जारी, PTB-शैली एनोटेशन से आसपास के पार्स संदर्भ के साथ एन-ग्राम प्राप्त किया, जिससे इसकी पहुँच और बढ़ गई।
सीमाएँ और आलोचनाएँ
PTB में उल्लेखनीय सीमाएँ हैं। इसका प्रमुख समाचार डोमेन और अपेक्षाकृत छोटा आकार (WSJ के लगभग 1 मिलियन शब्द) अन्य पाठ प्रकारों के लिए सामान्यीकरण को सीमित करता है। एनोटेशन असंगतताएँ, विशेष रूप से विराम चिह्न और कुछ क्रिया निर्माणों के आसपास, दस्तावेजित की गई हैं। इसके अतिरिक्त, कॉर्पस एक विशिष्ट समय अवधि (1980 के दशक के अंत से 1990 के दशक की शुरुआत) से अंग्रेजी को दर्शाता है, जो समकालीन उपयोग को पकड़ नहीं सकता है।
आलोचकों ने बताया है कि PTB पर प्रदर्शन हमेशा वास्तविक दुनिया की पार्सिंग मजबूती के साथ सहसंबंधित नहीं होता है, क्योंकि बेंचमार्क की सरलता वितरण-बाहर सामान्यीकरण जैसे मुद्दों को छिपा सकती है। परिणामस्वरूप, शोधकर्ता बड़े और अधिक विविध कॉर्पस की ओर बढ़ गए हैं, जिनमें विकिपीडिया-आधारित डेटासेट और बहुभाषी संसाधन शामिल हैं।
विरासत और निरंतर उपयोग
अपनी उम्र के बावजूद, PTB एक शैक्षणिक संसाधन और नए मॉडलों के लिए एक सैनिटी चेक के रूप में प्रभावशाली बना हुआ है। इसकी एनोटेशन गाइडलाइन्स ने अन्य भाषाओं के लिए बाद के ट्रीबैंकों को सूचित किया, जैसे चीनी ट्रीबैंक और अरबी ट्रीबैंक, दोनों भी पेंसिल्वेनिया विश्वविद्यालय में निर्मित। PTB भाषाई डेटा कंसोर्टियम (LDC) द्वारा होस्ट किया गया है और पुनर्वितरण के लिए लाइसेंस की आवश्यकता होती है।
आधुनिक कृत्रिम बुद्धिमत्ता के संदर्भ में, PTB की भूमिका कम हुई है लेकिन गायब नहीं हुई है। उदाहरण के लिए, डीप लर्निंग पाठ्यपुस्तकें और पाठ्यक्रम अभी भी अनुक्रम मॉडल के प्रोटोटाइपिंग के लिए एक सरल डेटासेट के रूप में PTB का उपयोग करते हैं। इसकी संरचित प्रकृति इसे तंत्रिका मॉडल में भाषाई संरचना का अध्ययन करने के लिए भी उपयोगी बनाती है। कॉर्पस नियम-आधारित प्रणालियों से डेटा-संचालित सांख्यिकीय विधियों और उससे आगे NLP के ऐतिहासिक प्रक्षेपवक्र को समझने के लिए एक संदर्भ बिंदु बना हुआ है।
एनोटेशन गाइडलाइन्स और दस्तावेज़ीकरण
PTB कई तकनीकी रिपोर्टों और उपयोगकर्ता मैनुअल में दस्तावेजित है, विशेष रूप से मार्कस एट अल द्वारा "द पेन ट्रीबैंक: एनोटेटिंग प्रेडिकेट आर्गुमेंट स्ट्रक्चर" (1994), जिसने एनोटेशन योजना का विवरण दिया। LDC से आधिकारिक वितरण में फ़ाइल प्रारूपों के बीच रूपांतरण के लिए निर्देश शामिल हैं। टैगसेट और गाइडलाइन्स को व्यापक रूप से अपनाया गया है और अभी भी कम्प्यूटेशनल भाषाविज्ञान पाठ्यक्रमों में पढ़ाया जाता है।