译自英文

ELMo(语言模型嵌入)是一种词嵌入方法,通过双向LSTM生成上下文相关的词向量,由艾伦人工智能研究所和华盛顿大学于2018年提出。

ELMo(语言模型嵌入)是一种词嵌入方法,用于将单词序列表示为相应的向量序列。它由艾伦人工智能研究所和华盛顿大学的研究人员创建,并于2018年2月首次发布。ELMo是一种双向LSTM,接收字符级输入并生成词级嵌入,训练语料库包含约3000万个句子和10亿个单词。

ELMo的架构实现了对词元的上下文理解。深度上下文化的词表示对许多自然语言处理任务(如共指消解和多义词消解)非常有用。ELMo在历史上具有重要意义,它是自监督生成式预训练后接微调范式的先驱,其中大型模型被训练以复现大型语料库,然后添加额外的任务特定权重并在监督任务数据上进行微调。它是向基于Transformer的语言建模演进过程中的关键一步。

架构

ELMo是在词元嵌入层之上的多层双向LSTM。所有LSTM的输出拼接在一起构成词元嵌入。输入文本序列首先由嵌入层映射为向量序列。然后两个部分并行运行于其上。前向部分是一个具有4096个单元和512维投影的两层LSTM,第一层到第二层之间有残差连接。后向部分具有相同架构,但从前到后处理序列。所有5个组件(嵌入层、两个前向LSTM层和两个后向LSTM层)的输出被拼接并乘以一个线性矩阵(投影矩阵),以生成每个输入词元的512维表示。

ELMo在包含10亿单词的文本语料库上进行了预训练。前向部分通过反复预测下一个词元进行训练,后向部分通过反复预测前一个词元进行训练。预训练后,ELMo的参数被冻结,除了投影矩阵,该矩阵可以针对特定语言任务进行微调以最小化损失。这是预训练-微调范式的早期示例。原始论文通过改进六个基准NLP任务的最先进性能证明了这一点。

上下文词表示

ELMo的架构实现了对词元的上下文理解。例如,第一个前向LSTM在每个先前词元的上下文中处理每个输入词元,第一个后向LSTM在每个后续词元的上下文中处理每个词元。第二个前向LSTM随后整合这些信息以进一步上下文化每个词元。

深度上下文化的词表示对许多自然语言处理任务(如共指消解和多义词消解)非常有用。例如,考虑句子“她去银行取钱”。为了表示词元“银行”,模型必须解决其在上下文中的多义性。第一个前向LSTM在“她去”的上下文中处理“银行”,这使其能够将该词表示为主语正在前往的地点。第一个后向LSTM在“取钱”的上下文中处理“银行”,这使其能够将该词消解为指代金融机构。第二个前向LSTM随后可以使用第一个后向LSTM提供的表示向量来处理“银行”,从而使其能够将其表示为主语正在前往的金融机构。

历史背景

ELMo是语言建模历史演进中的一环。考虑一个简单的文档分类问题,其中我们想为给定文本分配标签(例如,“垃圾邮件”、“非垃圾邮件”、“政治”、“体育”)。最简单的方法是“词袋”方法,其中文档中的每个单词被独立处理,其频率被用作分类特征。这在计算上廉价,但忽略了单词的顺序及其在句子中的上下文。GloVe和Word2Vec在此基础上通过基于大型文本语料库中的共现模式学习单词的固定向量表示(嵌入)进行了改进。

与BERT类似(但不同于Word2Vec和GloVe等“词袋”方法),ELMo词嵌入是上下文敏感的,为拼写相同的单词生成不同的表示。它在一个包含约3000万个句子和10亿单词的语料库上进行了训练。此前,双向LSTM已被用于上下文词表示,但ELMo将该想法应用于大规模,实现了最先进的性能。

在2017年Transformer (architecture)架构发表后,ELMo的架构从多层双向LSTM改为Transformer编码器,从而催生了BERT。BERT具有类似的预训练-微调工作流程,但使用Transformer,具有更可并行化训练的优势。ELMo的影响还扩展到其他Large language model的发展,因为它展示了在大型语料库上预训练后接任务特定微调的力量,这一范式后来成为OpenAIGoogle DeepMind等模型的核心。

影响与遗产

ELMo于2018年2月发布标志着自然语言处理的转变。通过提供上下文化的嵌入,它提高了问答、情感分析和命名实体识别等任务的性能。其成功推动了Deep learning语言方法的进一步研究,导致Artificial intelligence应用的快速进步。ELMo常与BERT一起被引用为现代Machine learning文本时代的基础模型。

该方法还强调了捕获长距离依赖的Neural network架构的重要性,这一概念后来在基于Transformer (architecture)的模型中得到了完善。ELMo的字符级输入处理使其对词汇表外单词具有鲁棒性,这一特性影响了后续的嵌入技术。尽管ELMo本身已不再广泛用于生产环境,但其原理仍嵌入在许多当代NLP系统中。

参考文献

  • Peters, M. E., et al. (2018). Deep contextualized word representations. Proceedings of NAACL-HLT.
  • Allen Institute for Artificial Intelligence. (2018). ELMo: Deep contextualized word representations. Official release notes.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·word-embeddings·deep-learning·language-models
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史