译自英文

情感分析,又称意见挖掘,是对人们针对实体及其属性所持有的观点、情感、情绪和态度的计算性研究,通常从文本中提取。

情感分析,又称观点挖掘,是指利用自然语言处理、文本分析、计算语言学和生物特征识别技术,系统地识别、提取、量化并研究情感状态和主观信息。它广泛应用于客户之声材料,如评论和调查回复、在线及社交媒体内容,以及医疗保健材料,应用范围涵盖市场营销、客户服务到临床医学。随着深度语言模型(如RoBERTa)的兴起,更复杂的数据领域也能被分析,例如新闻文本,其中作者通常以较不明确的方式表达其观点或情感。

情感分析的类型

情感分析的一项基本任务是在文档、句子或特征/方面层面分类给定文本的极性,即所表达的观点是正面、负面还是中性。高级的“超越极性”情感分类则关注情感状态,如愉悦、愤怒、厌恶、悲伤、恐惧和惊讶。

情感分析的先驱包括General Inquirer,它为量化文本中的模式提供了线索,以及心理学研究,该研究通过分析个体的言语行为来考察其心理状态。随后,Volcani和Fogel在一项专利中描述的方法专门针对情感,识别了与不同情感尺度相关的单个词语和短语。基于他们工作的当前系统名为EffectCheck,提供了可用于增加或减少每个尺度中唤起情感水平的同义词。

许多后续工作较为简单,仅采用从正面到负面的极性观点,例如Turney和Pang的工作,他们分别应用不同方法检测产品评论和电影评论的极性。这项工作是在文档层面进行的。人们还可以在多向尺度上分类文档的极性,如Pang和Snyder等人所尝试的:Pang和Lee将电影评论分类为正面或负面的基本任务扩展为预测3星或4星级别的星级评分,而Snyder则对餐厅评论进行了深入分析,预测食物和氛围等各个方面的评分(采用五星制)。

整合各种方法(学习、词汇、基于知识)的第一步是在2004年AAAI春季研讨会上迈出的,当时语言学家、计算机科学家和其他研究人员首次统一了兴趣,并提出了共享任务和基准数据集,用于对文本中的情感、吸引力、主观性和情绪进行系统性计算研究。

中性类别与评分系统

尽管在大多数统计分类方法中,中性类别被忽略,假设中性文本位于二元分类器的边界附近,但一些研究人员建议必须识别三个类别。可以证明,特定分类器(如最大熵和支持向量机)可以从引入中性类别中受益,并提高整体准确性。使用中性类别有两种操作方式:要么算法首先识别中性语言并将其过滤掉,然后根据正面和负面情感评估其余部分;要么一步构建三向分类。第二种方法通常涉及估计所有类别的概率分布(例如,NLTK实现的朴素贝叶斯分类器)。是否以及如何使用中性类别取决于数据:如果数据清晰聚类为中性、负面和正面语言,过滤中性语言是合理的;如果数据大多为中性且偏差较小,则该策略会使区分两个极性变得更加困难。

确定情感的另一种方法是使用评分系统,其中通常与负面、中性或正面情感相关的词语被赋予-10到+10的数值(从最负面到最正面),或从0到正上限(如+4)。这允许根据其环境(通常在句子层面)调整情感。当使用自然语言处理分析非结构化文本时,每个概念根据情感词与其关联方式获得一个分数。增强、减弱或否定情感的词语会影响分数。或者,如果目标是确定文本中的情感而非整体极性,文本可以被赋予正面和负面情感强度分数。

其他类型包括基于方面的情感分析、分级情感分析(正面、负面、中性)、多语言情感分析以及情感检测。

主观性与客观性识别

此任务通常定义为将给定文本(通常是句子)分类为两类之一:客观或主观。这个问题有时比极性分类更困难。词语和短语的主观性可能取决于上下文,而客观文档可能包含主观句子(例如,引用人们观点的新闻文章)。正如Su所提到的,结果在很大程度上取决于注释文本时使用的主观性定义。然而,Pang表明,在分类极性之前从文档中移除客观句子有助于提高性能。

主观性和客观性识别是新兴的子任务,利用句法、语义特征和机器学习知识来识别句子或文档是否包含事实或观点。识别事实和观点的意识并非近期才出现,可能最早由Carbonell于1979年在耶鲁大学提出。

术语“客观”指携带事实信息的事件。例如:“要当选美国总统,候选人必须年满三十五岁。”术语“主观”描述包含各种非事实信息的事件,如个人观点、判断和预测。

应用与挑战

情感分析在商业中广泛用于监测品牌声誉、分析客户反馈以及指导产品开发。在医疗保健领域,它可以分析患者报告的结果或社交媒体以进行公共卫生监测。在政治领域,它可以衡量公众对候选人或政策的意见。

挑战包括处理讽刺、反语和依赖上下文的情感。深度学习模型,特别是transformerslarge language models,在复杂领域上提高了性能。然而,即使是先进的模型也难以处理细微的表达。研究人员继续开发基于方面的情感分析和情感检测方法,通常利用machine learningdeep learning技术。

未来方向

随着artificial intelligence的进步,情感分析正朝着更细粒度和多模态分析的方向发展,整合音频、视觉和文本线索。neural networksgenerative AI模型的集成有望增强对人类情感的理解。隐私和偏见等伦理考虑仍然是重要的关注领域。该领域持续发展,得益于MIT CSAILStanford AI Lab等学术机构,以及Google DeepMindOpenAI等行业实验室的贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·text-mining·opinion-mining·affective-computing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史