对话中的情感识别是人工智能和机器学习的一个子领域,专注于自动识别和追踪对话参与者中的情感状态。与将文本分类为正面、负面或中性的基础情感分析不同,该任务考虑了人类互动中情感的动态性和上下文依赖性。它整合了语言、声音韵律以及有时面部表情的信号,并应用于虚拟助手、心理健康监测和客户服务分析等领域。
该领域在2010年代随着深度学习的兴起而受到关注,特别是神经网络架构如变换器模型。早期系统依赖从音频和文本中手工设计的特征,但现代方法使用在大型对话数据集上训练的端到端模型。该任务通常被构建为序列标注,其中对话中的每个话语被分配一个情感标签(例如,快乐、悲伤、愤怒、中性),同时建模说话者随时间的情感状态。
核心挑战
一个核心挑战是上下文依赖性。相同的词语可能因说话者、对象以及先前内容而传达不同的情感。例如,讽刺性评论表面上可能显得正面,但表达的是沮丧。因此,模型必须编码对话历史,包括说话者身份和轮流模式。这需要序列到序列或编码器-解码器架构来处理可变长度的对话。
另一个问题是情感的多模态性质。在面对面或基于语音的对话中,情感由语调、音高和语速承载,而不仅仅是词语。仅使用文本的系统会错过这些线索。多模态模型将声学特征与文本嵌入融合,通常使用交叉注意力机制来对齐不同模态的信息。然而,收集对齐的音频-文本-情感数据集成本高昂且容易受到标注主观性的影响。
技术方法
现代系统通常使用预训练的大型语言模型作为骨干,并在对话情感数据集上进行微调。这些模型利用多头注意力来权衡过去话语在预测当前情感时的重要性。例如,一个变换器可以关注对话早期朋友的安慰话语,以将后来的含泪回应解释为宽慰而非悲伤。
循环架构,如LSTM,在变换器之前很流行,但它们在长期依赖性上存在困难。当前最先进的模型通常将变换器编码器与条件随机场(CRF)层结合,以强制跨话语的标签一致性。一些方法还结合了说话者特定的嵌入,以捕捉个体的情感倾向,例如一个人比另一个人更善于表达。
训练数据来自IEMOCAP语料库(记录的二元互动)和MELD(来自电视节目的多方对话)等来源。这些数据集提供话语级情感标签,但它们在规模和领域上有限。为缓解这一问题,研究人员使用数据增强技术,如改写或添加合成噪声,以及课程学习,其中模型首先在较简单的对话上学习,然后再处理较难的对话。
应用与系统
对话中的情感识别在多个商业和研究环境中部署。来自亚马逊网络服务和谷歌云等公司的虚拟助手使用它来根据用户的沮丧或满意度调整响应。在医疗保健中,它支持治疗聊天机器人,从患者语音中检测抑郁或焦虑的迹象。客户服务平台分析呼叫中心录音,以标记愤怒的客户供人工干预。
研究实验室,包括麻省理工学院计算机科学与人工智能实验室和斯坦福人工智能实验室,已发表关于对话情感建模的有影响力的论文。像Halcyon和Omniscient这样的初创公司已构建了专门的情感检测API,尽管其准确性各不相同。该领域还与情感计算交叉,后者研究机器如何识别和模拟人类情感。
评估与局限性
性能通常通过准确率和加权F1分数在保留测试集上衡量。然而,人类对情感标签的一致性通常较低,对于细粒度类别约为60-70%,这限制了可实现的性能。模型在文化差异的情感表达上也存在困难;一种文化中认为礼貌的短语在另一种文化中可能被视为粗鲁,导致误分类。
另一个局限性是处理混合或微妙的情感。真实对话通常涉及混合状态,如焦虑的兴奋,离散标签集无法捕捉这些。一些研究人员提出连续维度,如效价和唤醒度,但这些更难标注。此外,模型可能受到人口统计因素的偏见,在语音模式与训练数据不同的说话者上表现较差。
未来方向
未来的工作旨在整合生成式人工智能模型,这些模型不仅能识别,还能生成情感上适当的响应。这需要对情感动态有更深入的理解,例如一个人的愤怒如何升级或降级另一个人的情绪。研究人员还在探索使用reinforcement-learning-from-ai-feedback(RLAIF)来使模型与人类情感偏好对齐。
对于实时处理现场对话的兴趣日益增长,这要求高效的架构能在边缘设备上运行。像高通和ARM控股这样的公司正在为此开发低功耗神经加速器。伦理考虑,包括隐私和情感操纵的风险,也正在推动对情感AI系统进行监管和透明度的呼吁。
参见
- 情感分析(相关概念,未在列表中但隐含)
- affective-computing(相关领域)
- dialogue-systems(应用领域)
参考文献
- Poria, S., et al. (2019). "Conversational Emotion Recognition." IEEE Transactions on Affective Computing.
- Hazarika, D., et al. (2018). "MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations." ACL.
- Busso, C., et al. (2008). "IEMOCAP: Interactive emotional dyadic motion capture database." Language Resources and Evaluation.