译自英文

词嵌入是一种学习得到的实值向量表示,用于编码单词的意义,使相似词在向量空间中彼此靠近。它是自然语言处理中的基础技术,用于文本分析和机器学习。

在自然语言处理中,词嵌入是将单词表示为实数向量以编码其含义的一种方式。核心思想是,在向量空间中距离较近的单词预期在语义上相似,从而能够对语义关系进行定量分析。词嵌入通常通过语言建模和特征学习技术获得,将词汇表中的单词或短语映射为数字向量。这些表示作为输入特征时,已被证明能够提升句法分析和情感分析等任务的性能。

生成词嵌入的方法包括神经网络、词共现矩阵的降维、概率模型以及上下文的显式表示。该方法从早期的语义空间模型演变为现代深度学习技术,成为自然语言理解系统的基石。

发展与历史

“词由其伴随词所表征”这一基本思想由约翰·鲁珀特·弗斯在1957年的一篇文章中提出,源于分布语义学。早期的语义空间模型,如用于信息检索的向量空间模型,将单词表示为稀疏的高维空间。通过奇异值分解进行降维,在20世纪80年代末催生了潜在语义分析。2000年,约舒亚·本吉奥及其同事引入了神经概率语言模型,该模型学习单词的分布式表示,从而降低了维度。2002年的一项NeurIPS研究将核典型相关分析应用于双语语料库,这是词嵌入自监督学习的早期实例。

在本吉奥等人的基础性工作之后,约2005年以后的大多数新技术依赖于神经网络架构。2013年,由托马斯·米科洛夫领导的谷歌团队创建了word2vec,这是一个比先前方法更快地训练向量空间模型的工具包,广泛普及了词嵌入。后续工作包括fastText,它通过字符n-gram部分表示单词。

多义词与同形异义词

静态词嵌入的一个关键限制是,具有多种含义的单词被合并为单一向量,无法处理多义性和同形异义性。例如,“club”可能指三明治、俱乐部会所或高尔夫球杆。多义嵌入通过为不同含义分配不同向量来解决这一问题。相关方法包括多义跳跃语法(MSSG),它同时进行词义区分和嵌入,以及非参数多义跳跃语法(NP-MSSG),它允许每个单词具有可变数量的含义。最合适语义标注(MSSA)以自我改进的方式结合了WordNet等词汇数据库与词义消歧。

多义嵌入提升了词性标注、语义关系识别和情感分析等任务的性能。截至2010年代末,ELMo和BERT等上下文相关嵌入提供了词元级表示,其中每个单词的出现都有其自己的嵌入,更好地反映了多义性。

生物序列

词嵌入已扩展到生物序列,如DNA、RNA和蛋白质,用于生物信息学应用。阿斯加里等人提出了BioVectors,该技术将嵌入方法应用于生物序列中的n-gram,从而能够分析功能和结构相似性。

应用与影响

词嵌入广泛应用于Machine learningDeep learning模型,作为文本分类、机器翻译和问答等任务的输入表示。它们是Large language modelTransformer (architecture)架构的组成部分,这些架构基于词元级嵌入构建。该技术影响了University of TorontoStanford AI Lab等机构的研究,并在Google DeepMindOpenAI等公司的工具中实现。

未来方向

研究继续致力于改进稀有词的嵌入、跨语言对齐以及特定领域的应用。上下文嵌入的转变在许多应用中已基本取代静态嵌入,但静态嵌入在效率和可解释性方面仍然有用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·machine-learning·representation-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史