嵌入空间是机器学习和人工智能中使用的一种数学构造,用于将离散对象(如单词、图像、用户或产品)表示为低维空间中的连续向量。嵌入空间的定义性特征是,语义相似的对象在空间中彼此靠近,而不相似的对象则相距较远。这种几何排列使得算法能够通过测量向量之间的距离或角度来执行相似性搜索、聚类和分类等任务。
嵌入空间是现代深度学习系统的基础,包括大型语言模型和神经网络架构。它们将高维、稀疏的表示(如独热编码的单词)转换为捕捉潜在关系的密集、低维向量。这一概念从早期的分布语义学发展到通过反向传播训练的复杂学习嵌入,并支撑了自然语言处理、计算机视觉和推荐系统中的许多应用。
历史起源
通过空间关系表示思想的概念可以追溯到20世纪50年代,当时语言学家和认知科学家探索语义空间。1954年,Zellig Harris提出了分布语义学,认为出现在相似语境中的单词具有相似的含义。这一原则后来启发了统计模型,如1990年Scott Deerwester及其同事引入的潜在语义分析(LSA),该模型使用奇异值分解从文档-术语矩阵中创建低维单词向量。
在2000年代,神经概率语言模型(如Bengio 2003年的工作)开始将学习单词嵌入作为预测下一个单词的副产品。然而,突破性进展出现在2013年,当时Tomas Mikolov及其在谷歌的团队推出了Word2vec模型。Word2vec使用浅层神经网络生成捕捉丰富语义和句法关系的嵌入,著名的向量运算如“国王 - 男人 + 女人 ≈ 女王”展示了这一点。这证明了嵌入空间编码了类比结构,引发了广泛采用。
数学基础
形式上,嵌入空间是一个向量空间,通常是欧几里得空间,维度为d(通常从50到1000或更多)。每个对象通过嵌入函数映射到该空间中的一个点,该函数在训练过程中学习。映射通常是查找表或神经网络层,将输入特征转换为向量。
距离度量至关重要。最常见的是欧几里得距离和余弦相似度。余弦相似度测量两个向量之间夹角的余弦,忽略幅度,这通常更受文本嵌入的青睐,因为它关注方向。点的排列反映了语义结构:类别形成簇,连续属性(如大小或情感)可能对应于空间中的方向。
嵌入空间相对于输入空间通常是低维的,但仍然足够高以捕捉复杂关系。维度是一个超参数,平衡了表达能力和计算效率。主成分分析(PCA)和t-SNE等技术常用于在二维或三维空间中可视化这些空间以进行分析。
学习嵌入
嵌入通过各种训练目标进行学习。在监督设置中,嵌入被优化以预测标签。在无监督或自监督设置中,它们从上下文中学习。对于单词,Word2vec的跳元(skip-gram)和连续词袋(CBOW)架构分别预测上下文单词或从上下文预测目标单词。Jeffrey Pennington及其同事(2014年)提出的GloVe(全局向量)分解单词共现矩阵以生成嵌入。
对于句子和文档,像Transformer这样的模型学习上下文嵌入,其中单词的表示取决于其周围上下文。这是对静态单词嵌入的重大进步,静态单词嵌入为每个单词分配一个固定向量,无论上下文如何。上下文嵌入(如来自BERT(2018年)和GPT的嵌入)捕捉多义性和细微含义。
现代嵌入学习通常使用对比学习,其中模型被训练将相似对拉近并将不相似对推远。这种方法在视觉-语言模型(如CLIP(2021年))中很常见,该模型在共享嵌入空间中对齐图像和文本。
跨领域应用
嵌入空间在广泛的应用中使用。在自然语言处理中,它们是大多数大型语言模型的输入层,使它们能够处理文本。在推荐系统中,学习用户和物品嵌入以预测偏好,如协同过滤模型(如矩阵分解和神经推荐器)所示。
在计算机视觉中,图像嵌入用于相似性搜索、人脸识别和零样本学习。例如,FaceNet(2015年)将人脸图像映射到嵌入空间,其中距离对应于身份相似性。在生物信息学中,嵌入表示基因、蛋白质或药物分子,有助于药物发现和基因组分析。
嵌入空间还支持迁移学习:在大语料库上预训练的模型可以通过调整嵌入空间来微调以完成特定任务。这是现代人工智能系统的基石,包括由OpenAI、Anthropic和Google DeepMind开发的系统。
属性和挑战
嵌入空间表现出几个显著属性。它们通常显示线性结构,使类比推理成为可能。它们还表现出聚类,其中相关项目聚集在一起。然而,它们可能遭受各向异性等问题,其中嵌入占据空间中的狭窄锥体,限制了表达能力。后处理和正则化等技术解决了这个问题。
另一个挑战是维度灾难:随着维度增加,距离变得不那么有意义。因此,选择正确的维度至关重要。此外,嵌入可以编码训练数据中存在的偏见,导致不公平或有害的结果。研究人员正在积极研究去偏嵌入的方法。
可解释性有限:通常不清楚每个维度代表什么。这推动了关于解缠嵌入和可解释模型的工作。此外,嵌入空间不是静态的;它们随着新数据而演变,需要在生产系统中进行仔细管理。
高级嵌入技术
最近的进展包括双曲嵌入,它通过嵌入双曲空间更有效地表示层次数据,其中距离呈指数增长。这对于分类法和知识图谱很有用。另一种技术是图嵌入,如Node2Vec和GraphSAGE,它们在保留结构关系的同时嵌入网络中的节点。
在生成式AI的背景下,嵌入空间用于控制生成。例如,在文本到图像模型中,文本提示被嵌入,然后用于指导图像生成。在强化学习中(尽管未列出,但相关),嵌入表示状态和动作。
像AMD、Apple和三星电子这样的公司正在将基于嵌入的功能集成到其硬件和软件中,如设备端语义搜索和个性化助手。像Amazon Web Services、Azure和Google Cloud这样的云提供商提供嵌入API和向量数据库,使开发人员无需管理基础设施即可构建相似性搜索应用。
未来方向
嵌入空间的未来在于多模态和统一嵌入,其中文本、图像、音频和其他模态共享一个共同空间。像CLIP和DALL-E这样的模型展示了这一潜力。还有对持续学习的兴趣,其中嵌入适应新数据而不会忘记旧知识。
另一个方向是节能嵌入,因为训练大型模型消耗大量资源。关于稀疏嵌入和量化的研究旨在减少内存和计算。此外,隐私保护嵌入(如联邦学习)允许在不集中数据的情况下进行训练。
随着人工智能的持续发展,嵌入空间将保持核心抽象,使机器能够以几何方式理解和推理世界。它们的简单性和强大性确保它们将在未来几年成为AI研究和应用的主要工具。