भावना विश्लेषण, जिसे ओपिनियन माइनिंग भी कहा जाता है, प्राकृतिक भाषा प्रसंस्करण, पाठ विश्लेषण, कम्प्यूटेशनल भाषाविज्ञान और बायोमेट्रिक्स का उपयोग है जो भावात्मक अवस्थाओं और व्यक्तिपरक सूचनाओं को व्यवस्थित रूप से पहचानने, निकालने, मात्रात्मक रूप से मापने और अध्ययन करने के लिए किया जाता है। इसे व्यापक रूप से ग्राहक की आवाज़ की सामग्री जैसे समीक्षाएं और सर्वेक्षण प्रतिक्रियाएं, ऑनलाइन और सोशल मीडिया, और स्वास्थ्य देखभाल सामग्री पर लागू किया जाता है, जिसके अनुप्रयोग विपणन से लेकर ग्राहक सेवा और नैदानिक चिकित्सा तक होते हैं। रोबर्टा (RoBERTa) जैसे गहन भाषा मॉडल के उदय के साथ, अधिक कठिन डेटा डोमेन का विश्लेषण किया जा सकता है, उदाहरण के लिए, समाचार पाठ जहां लेखक आमतौर पर अपनी राय/भावना को कम स्पष्ट रूप से व्यक्त करते हैं।
भावना विश्लेषण के प्रकार
भावना विश्लेषण में एक बुनियादी कार्य दिए गए पाठ की ध्रुवता को दस्तावेज़, वाक्य, या सुविधा/पहलू स्तर पर वर्गीकृत करना है - चाहे व्यक्त की गई राय सकारात्मक, नकारात्मक, या तटस्थ हो। उन्नत, "ध्रुवता से परे" भावना वर्गीकरण भावनात्मक अवस्थाओं जैसे आनंद, क्रोध, घृणा, उदासी, भय और आश्चर्य को देखता है।
भावना विश्लेषण के अग्रदूतों में जनरल इन्क्वायरर शामिल है, जिसने पाठ में पैटर्न को मात्रात्मक रूप से मापने के संकेत प्रदान किए, और मनोवैज्ञानिक शोध जिसने किसी व्यक्ति के मौखिक व्यवहार के विश्लेषण के आधार पर उनकी मनोवैज्ञानिक स्थिति की जांच की। इसके बाद, वोल्कानी और फोगल द्वारा वर्णित एक पेटेंट में वर्णित विधि विशेष रूप से भावना पर केंद्रित थी और विभिन्न भावनात्मक पैमानों के संबंध में व्यक्तिगत शब्दों और वाक्यांशों की पहचान करती थी। उनके काम पर आधारित एक वर्तमान प्रणाली, जिसे इफेक्टचेक कहा जाता है, ऐसे पर्यायवाची प्रस्तुत करती है जिनका उपयोग प्रत्येक पैमाने में उत्तेजित भावना के स्तर को बढ़ाने या घटाने के लिए किया जा सकता है।
कई बाद के प्रयास कम परिष्कृत थे, भावना के केवल एक सरल ध्रुवीय दृष्टिकोण का उपयोग करते हुए, सकारात्मक से नकारात्मक तक, जैसे कि टर्नी और पैंग का काम, जिन्होंने क्रमशः उत्पाद समीक्षाओं और फिल्म समीक्षाओं की ध्रुवता का पता लगाने के लिए विभिन्न तरीकों को लागू किया। यह काम दस्तावेज़ स्तर पर है। कोई व्यक्ति दस्तावेज़ की ध्रुवता को बहु-मार्गीय पैमाने पर भी वर्गीकृत कर सकता है, जैसा कि पैंग और स्नाइडर ने अन्य लोगों के बीच प्रयास किया: पैंग और ली ने फिल्म समीक्षा को सकारात्मक या नकारात्मक के रूप में वर्गीकृत करने के बुनियादी कार्य को 3- या 4-स्टार पैमाने पर स्टार रेटिंग की भविष्यवाणी करने के लिए विस्तारित किया, जबकि स्नाइडर ने रेस्तरां समीक्षाओं का गहन विश्लेषण किया, भोजन और वातावरण जैसे विभिन्न पहलुओं के लिए रेटिंग की भविष्यवाणी की (पांच-स्टार पैमाने पर)।
विभिन्न दृष्टिकोणों - अधिगमात्मक, शाब्दिक, ज्ञान-आधारित - को एक साथ लाने के पहले कदम 2004 एएएआई स्प्रिंग संगोष्ठी में उठाए गए, जहां भाषाविदों, कंप्यूटर वैज्ञानिकों और अन्य शोधकर्ताओं ने पहली बार हितों को संरेखित किया और पाठ में प्रभाव, अपील, विषयनिष्ठता और भावना पर व्यवस्थित कम्प्यूटेशनल अनुसंधान के लिए साझा कार्यों और बेंचमार्क डेटा सेट प्रस्तावित किए।
तटस्थ वर्ग और स्केलिंग प्रणाली
हालांकि अधिकांश सांख्यिकीय वर्गीकरण विधियों में, तटस्थ वर्ग को इस धारणा के तहत अनदेखा किया जाता है कि तटस्थ पाठ द्विआधारी वर्गीकरण की सीमा के पास स्थित होते हैं, कई शोधकर्ता सुझाव देते हैं कि तीन श्रेणियों की पहचान की जानी चाहिए। यह सिद्ध किया जा सकता है कि मैक्स एन्ट्रॉपी और एसवीएम जैसे विशिष्ट वर्गीकरणकर्ता तटस्थ वर्ग की शुरूआत से लाभ उठा सकते हैं और समग्र सटीकता में सुधार कर सकते हैं। तटस्थ वर्ग के साथ काम करने के दो तरीके हैं: या तो एल्गोरिथ्म पहले तटस्थ भाषा की पहचान करता है, उसे फ़िल्टर करता है, फिर शेष का सकारात्मक और नकारात्मक भावनाओं के संदर्भ में आकलन करता है, या यह एक ही चरण में त्रि-मार्गीय वर्गीकरण बनाता है। दूसरा दृष्टिकोण अक्सर सभी श्रेणियों पर एक संभाव्यता वितरण का अनुमान लगाना शामिल करता है (उदाहरण के लिए, एनएलटीके द्वारा कार्यान्वित नाइव बेयस वर्गीकरणकर्ता)। तटस्थ वर्ग का उपयोग करना है या नहीं और कैसे करना है यह डेटा पर निर्भर करता है: यदि डेटा स्पष्ट रूप से तटस्थ, नकारात्मक और सकारात्मक भाषा में समूहीकृत है, तो तटस्थ भाषा को फ़िल्टर करना समझदारी है; यदि डेटा छोटे विचलन के साथ अधिकतर तटस्थ है, तो यह रणनीति दो ध्रुवों के बीच अंतर करना कठिन बना देगी।
भावना निर्धारित करने की एक अलग विधि एक स्केलिंग प्रणाली का उपयोग है जिसके द्वारा नकारात्मक, तटस्थ, या सकारात्मक भावना से जुड़े शब्दों को -10 से +10 के पैमाने पर (सबसे नकारात्मक से सबसे सकारात्मक) या 0 से सकारात्मक ऊपरी सीमा जैसे +4 तक एक संख्या दी जाती है। यह भावना को उसके परिवेश (आमतौर पर वाक्य स्तर पर) के सापेक्ष समायोजित करने की अनुमति देता है। जब असंरचित पाठ का प्राकृतिक भाषा प्रसंस्करण का उपयोग करके विश्लेषण किया जाता है, तो प्रत्येक अवधारणा को इस आधार पर एक स्कोर दिया जाता है कि भावना शब्द उससे कैसे संबंधित हैं। भावना को तीव्र, शिथिल या नकारने वाले शब्द स्कोर को प्रभावित कर सकते हैं। वैकल्पिक रूप से, ग्रंथों को सकारात्मक और नकारात्मक भावना शक्ति स्कोर दिए जा सकते हैं यदि लक्ष्य समग्र ध्रुवता के बजाय पाठ में भावना का निर्धारण करना है।
अन्य प्रकारों में पहलू-आधारित भावना विश्लेषण, ग्रेडिंग भावना विश्लेषण (सकारात्मक, नकारात्मक, तटस्थ), बहुभाषी भावना विश्लेषण, और भावनाओं का पता लगाना शामिल है।
विषयनिष्ठता और वस्तुनिष्ठता पहचान
यह कार्य आमतौर पर दिए गए पाठ (आमतौर पर एक वाक्य) को दो वर्गों में से एक में वर्गीकृत करने के रूप में परिभाषित किया जाता है: वस्तुनिष्ठ या विषयनिष्ठ। यह समस्या कभी-कभी ध्रुवता वर्गीकरण से अधिक कठिन हो सकती है। शब्दों और वाक्यांशों की विषयनिष्ठता संदर्भ पर निर्भर हो सकती है, और एक वस्तुनिष्ठ दस्तावेज़ में विषयनिष्ठ वाक्य हो सकते हैं (उदाहरण के लिए, एक समाचार लेख जो लोगों की राय उद्धृत करता है)। जैसा कि सु ने उल्लेख किया है, परिणाम काफी हद तक पाठों को एनोटेट करते समय उपयोग की जाने वाली विषयनिष्ठता की परिभाषा पर निर्भर करते हैं। हालांकि, पैंग ने दिखाया कि ध्रुवता को वर्गीकृत करने से पहले दस्तावेज़ से वस्तुनिष्ठ वाक्यों को हटाने से प्रदर्शन में सुधार करने में मदद मिली।
विषयनिष्ठ और वस्तुनिष्ठ पहचान उभरते उप-कार्य हैं जो यह पहचानने के लिए वाक्यात्मक, शब्दार्थ विशेषताओं और मशीन लर्निंग ज्ञान का उपयोग करते हैं कि क्या एक वाक्य या दस्तावेज़ में तथ्य या राय हैं। तथ्यों और राय को पहचानने की जागरूकता हाल की नहीं है, संभवतः पहली बार 1979 में येल विश्वविद्यालय में कार्बोनेल द्वारा प्रस्तुत की गई थी।
शब्द "वस्तुनिष्ठ" तथ्यात्मक जानकारी ले जाने वाली घटना को संदर्भित करता है। उदाहरण: "संयुक्त राज्य अमेरिका का राष्ट्रपति चुने जाने के लिए, एक उम्मीदवार की आयु कम से कम पैंतीस वर्ष होनी चाहिए।" शब्द "विषयनिष्ठ" विभिन्न रूपों में गैर-तथ्यात्मक जानकारी वाली घटना का वर्णन करता है, जैसे व्यक्तिगत राय, निर्णय और भविष्यवाणियां।
अनुप्रयोग और चुनौतियाँ
भावना विश्लेषण व्यापक रूप से व्यवसाय में ब्रांड प्रतिष्ठा की निगरानी, ग्राहक प्रतिक्रिया का विश्लेषण और उत्पाद विकास की जानकारी देने के लिए उपयोग किया जाता है। स्वास्थ्य देखभाल में, यह रोगी-रिपोर्ट किए गए परिणामों या सार्वजनिक स्वास्थ्य निगरानी के लिए सोशल मीडिया का विश्लेषण कर सकता है। राजनीति में, यह उम्मीदवारों या नीतियों पर जनमत का आकलन कर सकता है।
चुनौतियों में व्यंग्य, विडंबना और संदर्भ-निर्भर भावना को संभालना शामिल है। गहन शिक्षण मॉडल, विशेष रूप से ट्रांसफॉर्मर और बड़े भाषा मॉडल, ने जटिल डोमेन पर प्रदर्शन में सुधार किया है। हालांकि, उन्नत मॉडल भी सूक्ष्म अभिव्यक्तियों के साथ संघर्ष करते हैं। शोधकर्ता पहलू-आधारित भावना विश्लेषण और भावना पहचान के लिए तरीके विकसित करना जारी रखते हैं, जो अक्सर मशीन लर्निंग और गहन शिक्षण तकनीकों का लाभ उठाते हैं।
भविष्य की दिशाएँ
जैसे-जैसे कृत्रिम बुद्धिमत्ता आगे बढ़ती है, भावना विश्लेषण अधिक सूक्ष्म और बहुविध विश्लेषण की ओर बढ़ रहा है, जिसमें ऑडियो, दृश्य और पाठ्य संकेत शामिल हैं। तंत्रिका नेटवर्क और जनरेटिव एआई मॉडल का एकीकरण मानवीय भावना की समझ को बढ़ाने का वादा करता है। गोपनीयता और पूर्वाग्रह जैसे नैतिक विचार, ध्यान के महत्वपूर्ण क्षेत्र बने हुए हैं। यह क्षेत्र एमआईटी सीएसएआईएल और स्टैनफोर्ड एआई लैब जैसे शैक्षणिक संस्थानों के साथ-साथ गूगल डीपमाइंड और ओपनएआई जैसी उद्योग प्रयोगशालाओं के योगदान से विकसित होता रहता है।