AZFinText एक वित्तीय पाठ खनन प्रणाली है जो वास्तविक समय के समाचार लेख सामग्री को शेयर मूल्य डेटा के साथ एकीकृत करके इंट्राडे मूल्य आंदोलनों की भविष्यवाणी करती है। एरिज़ोना स्टेट यूनिवर्सिटी के शोधकर्ताओं द्वारा विकसित, यह प्रणाली 2010 में प्राकृतिक भाषा प्रसंस्करण और मशीन लर्निंग तकनीकों को मिलाकर वित्तीय समाचारों और इक्विटी बाजार व्यवहार के बीच संबंध का विश्लेषण करने के लिए एक हाइब्रिड दृष्टिकोण के रूप में पेश की गई थी। यह प्रणाली अपनी सूक्ष्म-स्तरीय घटना निष्कर्षण विधि के लिए उल्लेखनीय है, जो केवल व्यापक भावना विश्लेषण पर निर्भर रहने के बजाय समाचार लेखों के भीतर विशिष्ट वित्तीय घटनाओं की पहचान करती है।
AZFinText का मूल नवाचार समाचार लेखों और शेयर मूल्य डेटा को एक साथ संसाधित करने की क्षमता में निहित है, जो एक समय-संवेदनशील ढांचे का उपयोग करता है जो समाचारों का शेयर मूल्यों पर तत्काल प्रभाव को पकड़ता है। यह प्रणाली उच्च-आवृत्ति ट्रेडिंग भविष्यवाणियों की चुनौती का समाधान करने के लिए डिज़ाइन की गई थी, जहां समाचार प्रकाशन और बाजार प्रतिक्रिया के बीच की खिड़की अक्सर मिनटों में मापी जाती है। पाठ्य सुविधाओं और संख्यात्मक मूल्य डेटा के संयोजन का लाभ उठाकर, AZFinText ने प्रदर्शित किया कि मशीन लर्निंग मॉडल अल्पकालिक शेयर आंदोलनों के लिए सांख्यिकीय रूप से महत्वपूर्ण भविष्यवाणी सटीकता प्राप्त कर सकते हैं, विशेष रूप से सपोर्ट वेक्टर मशीन (SVM) क्लासिफायर का उपयोग करते समय।
विकास और पृष्ठभूमि
AZFinText एरिज़ोना स्टेट यूनिवर्सिटी के शोधकर्ताओं की एक टीम द्वारा विकसित किया गया था, जिसका नेतृत्व प्रोफेसर ह्सिनचुन चेन ने किया था, जो ज्ञान खोज और डेटा खनन के क्षेत्र में एक प्रमुख व्यक्ति हैं। यह परियोजना वित्तीय पाठ खनन के व्यापक क्षेत्र से उभरी, जिसने 2000 के दशक के मध्य में गति प्राप्त की जब शोधकर्ताओं ने वित्तीय दस्तावेजों पर प्राकृतिक भाषा प्रसंस्करण लागू करना शुरू किया। प्रणाली का नाम इसके दोहरे फोकस को दर्शाता है: 'AZ' एरिज़ोना के लिए खड़ा है, 'Fin' वित्तीय के लिए, और 'Text' पाठ्य विश्लेषण घटक के लिए।
प्रारंभिक शोध 2010 में जर्नल डिसीजन सपोर्ट सिस्टम्स में प्रकाशित हुआ था, जिसमें 'AZFinText: ए हाइब्रिड अप्रोच फॉर प्रेडिक्टिंग स्टॉक प्राइस मूवमेंट्स यूजिंग फाइनेंशियल न्यूज एंड स्टॉक प्राइस डेटा' शीर्षक वाला एक पेपर था। यह कार्य समाचार लेखों के भावना विश्लेषण का उपयोग करने वाले पहले के अध्ययनों पर आधारित था, लेकिन AZFinText ने पाठ से विशिष्ट घटनाओं, जैसे 'आय में वृद्धि' या 'विलय घोषणा' को निकालकर एक अधिक सूक्ष्म दृष्टिकोण पेश किया। यह घटना-आधारित प्रतिनिधित्व प्रणाली को उन अर्थ संबंधी बारीकियों को पकड़ने की अनुमति देता था जो सरल बैग-ऑफ-वर्ड्स मॉडल अक्सर चूक जाते थे।
तकनीकी वास्तुकला
AZFinText प्रणाली एक बहु-चरण पाइपलाइन में संचालित होती है। सबसे पहले, यह रॉयटर्स और ब्लूमबर्ग सहित प्रमुख वित्तीय समाचार स्रोतों से वास्तविक समय के समाचार लेख एकत्र करती है, साथ ही न्यूयॉर्क स्टॉक एक्सचेंज (NYSE) और NASDAQ से संबंधित शेयर मूल्य डेटा भी। समाचार लेखों को फिर एक प्राकृतिक भाषा प्रसंस्करण मॉड्यूल का उपयोग करके संसाधित किया जाता है जो कंपनियों, वित्तीय शर्तों और घटना विवरणकों की पहचान करने के लिए टोकनाइजेशन, पार्ट-ऑफ-स्पीच टैगिंग और नामित इकाई पहचान करता है।
मुख्य घटक घटना निष्कर्षण मॉड्यूल है, जो विशिष्ट घटनाओं की पहचान और वर्गीकरण के लिए एक नियम-आधारित दृष्टिकोण को वित्तीय ऑन्टोलॉजी के साथ जोड़ता है। प्रत्येक घटना को (अभिनेता, क्रिया, वस्तु, समय) के टपल के रूप में दर्शाया जाता है, जहां अभिनेता आमतौर पर एक कंपनी या विश्लेषक होता है, क्रिया एक वित्तीय क्रिया होती है (जैसे, 'वृद्धि,' 'कमी,' 'घोषणा'), और वस्तु प्रभावित इकाई होती है (जैसे, 'राजस्व,' 'शेयर मूल्य')। यह संरचित प्रतिनिधित्व फिर एक फीचर वेक्टर में परिवर्तित हो जाता है जिसमें पाठ्य सुविधाएँ (जैसे, घटना प्रकार, आवृत्ति) और संख्यात्मक सुविधाएँ (जैसे, मूल्य परिवर्तन, ट्रेडिंग वॉल्यूम) दोनों शामिल होते हैं।
प्रणाली अपने प्राथमिक क्लासिफायर के रूप में एक सपोर्ट वेक्टर मशीन (SVM) का उपयोग करती है, जिसे ऐतिहासिक डेटा पर प्रशिक्षित किया जाता है ताकि यह भविष्यवाणी की जा सके कि किसी स्टॉक की कीमत समाचार जारी होने के बाद एक छोटी समय खिड़की, आमतौर पर 20 मिनट के भीतर, ऊपर या नीचे जाएगी। SVM को उच्च-आयामी फीचर स्पेस में इसकी प्रभावशीलता और ओवरफिटिंग के खिलाफ इसकी मजबूती के लिए चुना गया था, जो प्रशिक्षण नमूनों की अपेक्षाकृत छोटी संख्या को देखते हुए महत्वपूर्ण है।
डेटा और पद्धति
AZFinText का मूल्यांकन 2008 में छह महीने की अवधि में एकत्र किए गए लगभग 5,500 समाचार लेखों के डेटासेट का उपयोग करके किया गया था, जिसमें NYSE और NASDAQ पर सबसे अधिक सक्रिय रूप से कारोबार किए जाने वाले 50 स्टॉक शामिल थे। शेयर मूल्य डेटा TAQ (ट्रेड एंड क्वोट) डेटाबेस से प्राप्त किया गया था, जो टिक-दर-टिक लेनदेन डेटा प्रदान करता है। शोधकर्ताओं ने प्रत्येक समाचार लेख को लेख के प्रकाशन टाइमस्टैम्प के बाद 20 मिनट में संबंधित शेयर मूल्य आंदोलनों के साथ संरेखित किया।
एक महत्वपूर्ण पद्धतिगत योगदान 'अस्थायी अंतराल' विश्लेषण का उपयोग था, जिसने जांच की कि 5 से 60 मिनट तक विभिन्न समय खिड़कियों के साथ भविष्यवाणी सटीकता कैसे भिन्न होती है। परिणामों से पता चला कि उच्चतम सटीकता 20 मिनट के निशान पर हासिल की गई थी, जिसमें लगभग 70% की भविष्यवाणी सटीकता थी, जबकि यादृच्छिक अनुमान के लिए 50% की आधार रेखा थी। इस खोज ने वित्तीय समाचार विश्लेषण में समय के महत्व पर प्रकाश डाला और सुझाव दिया कि समाचारों के प्रति बाजार की प्रतिक्रिया तात्कालिक नहीं है बल्कि थोड़े समय में सामने आती है।
शोधकर्ताओं ने AZFinText की तुलना कई आधार मॉडलों से भी की, जिसमें एक नाइव बेयस क्लासिफायर और एक सरल भावना विश्लेषण दृष्टिकोण शामिल था। AZFinText ने लगातार इन आधार रेखाओं से बेहतर प्रदर्शन किया, जो सरल पाठ्य प्रतिनिधित्वों पर घटना-आधारित फीचर निष्कर्षण के मूल्य को प्रदर्शित करता है। सिस्टम के प्रदर्शन को ट्रेडिंग सिमुलेशन की एक श्रृंखला के माध्यम से और अधिक मान्य किया गया, जिसने दिखाया कि AZFinText भविष्यवाणियों पर आधारित एक काल्पनिक ट्रेडिंग रणनीति सकारात्मक रिटर्न उत्पन्न कर सकती है, हालांकि लेखकों ने चेतावनी दी कि लेनदेन लागत और बाजार घर्षण व्यवहार में इन लाभों को कम कर देंगे।
मशीन लर्निंग से संबंध
AZFinText कई Machine learning उपक्षेत्रों के चौराहे पर स्थित है, जिसमें Natural language processing (हालांकि स्पष्ट रूप से सूचीबद्ध नहीं है, यह निहित है), Deep learning (एक अग्रदूत के रूप में), और डेटा-माइनिंग शामिल हैं। यह प्रणाली Deep learning और Transformer (architecture)-आधारित मॉडल के आधुनिक युग से पहले की है, जो पारंपरिक फीचर इंजीनियरिंग और उथले क्लासिफायर पर निर्भर थी। हालांकि, इसके डिजाइन सिद्धांत - विशेष रूप से विषम डेटा स्रोतों का एकीकरण और अस्थायी गतिशीलता पर ध्यान केंद्रित करना - ने वित्तीय Artificial intelligence में बाद के काम को प्रभावित किया है।
सिस्टम का सपोर्ट-वेक्टर-मशीनों (एक प्रकार का Kernel Method) का उपयोग उस युग के लिए विशिष्ट था, इससे पहले कि Neural network दृष्टिकोण व्यापक रूप से अपनाए जाते। बाद के शोधकर्ता समान समस्याओं के लिए आवर्तक-तंत्रिका-नेटवर्क और Long Short‑Term Memory (LSTM) नेटवर्क लागू करेंगे, लेकिन AZFinText ने प्रदर्शित किया कि अच्छी तरह से डिज़ाइन की गई सुविधाओं के साथ जोड़े जाने पर अपेक्षाकृत सरल मॉडल भी सार्थक परिणाम प्राप्त कर सकते हैं। घटना निष्कर्षण दृष्टिकोण को संरचित-भविष्यवाणी के शुरुआती रूप के रूप में देखा जा सकता है, जो आधुनिक Large language model अनुप्रयोगों में प्रासंगिक बना हुआ है जहां असंरचित पाठ से संरचित जानकारी निकालना एक प्रमुख कार्य है।
प्रभाव और विरासत
AZFinText ने बढ़ते सबूतों के समूह में योगदान दिया कि वित्तीय समाचारों में कार्रवाई योग्य जानकारी होती है जिसे व्यवस्थित रूप से दोहन किया जा सकता है। इसके निष्कर्ष वित्तीय पाठ खनन पर कई बाद के अध्ययनों में उद्धृत किए गए थे, और घटना-आधारित प्रतिनिधित्व बाद के सिस्टम के लिए एक टेम्पलेट बन गया। शोध ने पाठ्य और संख्यात्मक डेटा को एकीकृत करने के महत्व पर भी प्रकाश डाला, एक विषय जो आधुनिक फिनटेक अनुप्रयोगों के लिए केंद्रीय बन गया है।
इंट्राडे भविष्यवाणियों पर सिस्टम का ध्यान अपने समय से आगे था, क्योंकि अधिकांश पहले के काम दैनिक या साप्ताहिक भविष्यवाणियों पर केंद्रित थे। यह ग्रैन्युलैरिटी एल्गोरिदमिक ट्रेडिंग और उच्च-आवृत्ति-ट्रेडिंग के उदय के साथ संरेखित थी, जो तेज और अधिक सटीक संकेतों की मांग करती थी। जबकि AZFinText स्वयं व्यावसायीकृत नहीं था, इसकी पद्धति ने हेज फंड और वित्तीय प्रौद्योगिकी कंपनियों में मालिकाना ट्रेडिंग सिस्टम के विकास को सूचित किया।
शैक्षणिक समुदाय में, AZFinText को अक्सर वित्त में अनुप्रयुक्त-मशीन-लर्निंग के शुरुआती उदाहरण के रूप में उद्धृत किया जाता है, साथ ही स्टॉकसोनार और न्यूज़कैट्स जैसे अन्य सिस्टम के साथ। Google Scholar के अनुसार, पेपर को 500 से अधिक विद्वान कार्यों में संदर्भित किया गया है, और यह क्षेत्र में प्रवेश करने वाले शोधकर्ताओं के लिए एक मानक संदर्भ बना हुआ है। यह परियोजना ह्सिनचुन चेन के नेतृत्व में खुफिया और सुरक्षा सूचना विज्ञान में व्यापक एरिज़ोना-स्टेट-यूनिवर्सिटी अनुसंधान कार्यक्रम में भी योगदान दिया।
सीमाएं और आलोचनाएं
अपनी सफलताओं के बावजूद, AZFinText की कई सीमाएं थीं जिन्हें इसके डेवलपर्स ने स्वीकार किया था। सिस्टम को एक अपेक्षाकृत छोटे डेटासेट पर एक ही समय अवधि (2008) से प्रशिक्षित किया गया था, जिसमें वित्तीय संकट शामिल था, जो संभावित रूप से परिणामों को पक्षपाती बना सकता था। घटना निष्कर्षण नियम हस्त-निर्मित थे और महत्वपूर्ण डोमेन विशेषज्ञता की आवश्यकता थी, जिससे सिस्टम को नए डोमेन या भाषाओं में स्केल करना मुश्किल हो गया। इसके अतिरिक्त, SVM क्लासिफायर ने प्रत्येक स्टॉक को स्वतंत्र रूप से माना, क्रॉस-स्टॉक सहसंबंधों और बाजार-व्यापी कारकों को अनदेखा किया।
आलोचकों ने यह भी बताया कि 70% सटीकता का आंकड़ा, जबकि प्रभावशाली है, डेटा संरेखण में लुक-आहेड पूर्वाग्रह की संभावना के लिए जिम्मेदार नहीं था। शोधकर्ताओं ने लेख के प्रकाशन टाइमस्टैम्प का उपयोग किया, लेकिन व्यवहार में, समाचार फ़ीड में परिवर्तनशील देरी हो सकती है, और बाजार प्रतिक्रिया का सटीक समय अनिश्चित है। बाद के अध्ययनों ने दिखाया है कि समान परिणाम सरल तरीकों से प्राप्त किए जा सकते हैं, जैसे केवल मूल्य गति या वॉल्यूम डेटा का उपयोग करना, यह सुझाव देते हुए कि पाठ्य घटक शुरू में दावा किए गए अनुसार महत्वपूर्ण नहीं हो सकता है।
आधुनिक दृष्टिकोणों के साथ तुलना
Deep learning और Transformer (architecture)-आधारित मॉडल के आगमन ने AZFinText के फीचर-इंजीनियरिंग दृष्टिकोण को काफी हद तक बदल दिया है। आधुनिक सिस्टम, जैसे कि BERT या gpt पर आधारित, मैन्युअल घटना निष्कर्षण के बिना कच्चे पाठ से सीधे प्रतिनिधित्व सीख सकते हैं। ये मॉडल अधिक जटिल भाषाई पैटर्न को पकड़ सकते हैं और अक्सर बड़े वित्तीय कोरपोरा पर ठीक-ट्यून किए जाते हैं। हालांकि, उन्हें पर्याप्त कम्प्यूटेशनल संसाधनों और बड़े डेटासेट की आवश्यकता होती है, जो 2010 में उपलब्ध नहीं थे।
AZFinText का अस्थायी संरेखण पर जोर प्रासंगिक बना हुआ है। आधुनिक Large language model-आधारित ट्रेडिंग सिस्टम अभी भी समाचार टाइमस्टैम्प को बाजार डेटा के साथ संरेखित करने की चुनौती का सामना करते हैं, और AZFinText द्वारा पहचानी गई 20 मिनट की खिड़की को बाद के शोध द्वारा पुष्टि की गई है। सिस्टम का हाइब्रिड आर्किटेक्चर, पाठ्य और संख्यात्मक सुविधाओं का संयोजन, मल्टीमोडल दृष्टिकोणों को भी पूर्वाभास करता है जो अब Generative AI अनुप्रयोगों में आम हैं।
यह भी देखें
- financial-text-mining
- भावना-विश्लेषण
- algorithmic-trading
- support-vector-machine
- arizona-state-university
संदर्भ
- Schumaker, R. P., & Chen, H. (2010). AZFinText: A hybrid approach for predicting stock price movements using financial news and stock price data. डिसीजन सपोर्ट सिस्टम्स, 49(3), 258-269.
- Schumaker, R. P., & Chen, H. (2009). Textual analysis of stock market prediction using breaking financial news. ACM ट्रांजेक्शन्स ऑन इंफॉर्मेशन सिस्टम्स, 27(2), 1-23.