译自英文

嵌入是将一段数据(如单词、句子、图像或用户)表示为数值向量的方式,该向量位于连续空间中,使得含义或内容相近的项彼此靠近。

嵌入是一种将对象(通常是单词、句子、图像或用户)表示为连续空间中固定长度实值向量的方式。一个好的嵌入的核心特性在于,该空间中的几何接近性对应语义相似性:“狗”和“小狗”的向量彼此靠近,而“狗”和“股市”则相距甚远。嵌入将意义这一模糊的符号问题转化为算术运算,使神经网络能够从中学习,并让计算机可以高效地搜索。

这一思想早于深度学习。20世纪90年代的分布语义学研究者主张“词的特性由其同伴决定”,早期基于计数的方法(如潜在语义分析)通过词共现统计构建低维表示。现代时代始于2013年的Word2vec,它训练一个浅层神经网络来预测邻近单词,生成的嵌入具有如今著名的性质:向量算术能捕捉类比关系,例如“国王”减“男人”加“女人”的结果接近“女王”。同期发布的GloVe提供了一种竞争性的基于计数的方法,结果相似。

嵌入是如何产生的

静态词嵌入(如word2vec和GloVe)为每个词分配一个固定向量,而不考虑上下文。这多义词上会失效:“银行”会得到一个混合了河岸和金融含义的单一向量。Transformer架构及其注意力机制通过生成上下文嵌入解决了这一问题,即同一个词根据周围句子获得不同向量。BERT等模型推动了上下文嵌入在下游任务中的普及,而每个现代大语言模型内部都将分词后的标记表示为嵌入,并逐层精炼。

在文本之外,嵌入可推广到任何模态。CLIP联合训练图像和文本编码器,使猫的照片和“一只猫”的标题在共享空间中靠近,这构成了现代文本到图像生成和多模态检索的基础。推荐系统将用户和物品嵌入共享空间,使接近性预示偏好,生物学也采用相同技巧来嵌入蛋白质序列。

应用

嵌入是语义搜索的基础,其中查询被嵌入并与嵌入的文档语料库通过余弦相似度或点积进行比较,而非精确的关键词匹配。这一能力支撑了检索增强生成系统,该系统先嵌入知识库一次,在查询时检索最相关的段落,以支撑大语言模型的回答并减少幻觉。高效存储和搜索数百万或数十亿个嵌入是向量数据库的任务,它使用近似最近邻索引来使大规模相似性搜索变得快速。

嵌入还为聚类、去重、异常检测和分类提供动力,因为基于良好嵌入之上训练的简单线性分类器通常能与从零训练的复杂多模型相媲美。在推荐和搜索排序系统中,用户和物品的嵌入常被联合学习,并随着行为数据的积累而持续更新。

属性与局限性

嵌入的维度(文本通常从几百到几千)是一种设计选择,在表现力与存储和计算成本之间权衡。由此产生的几何结构有时被称为潜在空间,在该空间中两点之间插值可产生合理的中间示例,这一性质在生成式图像和音频模型中被广泛利用。

嵌入会继承训练数据中存在的偏见:基于网络文本训练的词嵌入已被证明在几何关系中编码性别和种族刻板印象,这是算法偏见研究中广泛引用的发现。它们也可能对分布变化脆弱,即在一个领域(如通用网络文本)训练的嵌入模型,在应用于法律或医学等专门领域时,若无额外微调可能表现不佳。尽管存在这些局限,嵌入仍是现代人工智能系统中最持久且广泛复用的构建模块之一,自2013年word2vec突破以来概念上基本未变,即使生成它们的模型已变得强大得多。

分类:machine-learning·natural-language-processing·representation-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史