译自英文

潜在空间是神经网络学习到的压缩、低维表示,用于编码其训练数据的底层结构,其中语义相似的输入最终会彼此靠近排列。

潜在空间是神经网络在内部学习到的一种压缩后的低维空间,用于表示其训练数据的结构。与直接存储原始像素、单词或音频样本不同,使用潜在空间的模型会将输入映射为一组抽象的数值坐标(即向量),并确保含义或外观相似的输入在空间中彼此靠近。这一思想广泛应用于深度学习领域,从自编码器生成对抗网络,到现代的扩散模型和基于嵌入的搜索系统。

起源

这一思想可追溯至统计学中更早期的降维方法,但通过自编码器(一种训练将输入压缩到瓶颈层并重建的神经网络)进入机器学习主流。瓶颈层的值即为潜在表示。变分自编码器于2013年提出,通过强制潜在空间遵循平滑的概率分布扩展了这一概念,使得通过在该空间中随机选取点来采样新的、合理的输出成为可能。另一条并行研究路线,Word2vec(2013年),展示了在文本上训练的潜在空间能够捕捉单词之间的类比关系,从而普及了潜在空间中方向和距离承载意义的观点。

在生成模型中的作用

潜在空间通过生成对抗网络成为图像生成的核心,其生成器学习将随机潜在向量映射为逼真的图像。在潜在扩散(即稳定扩散及相关系统背后的技术)中,这一作用变得更加重要:模型不是直接在像素上执行缓慢的去噪过程,而是通过自编码器将图像压缩为一个小型潜在网格,在该网格中执行扩散模型步骤,最后才解码回像素。这使得高分辨率文本到图像生成在计算成本上大幅降低。诸如CLIP之类的多模态系统学习图像和文本的共享潜在空间,使标题与其匹配图像在空间中靠近,这正是扩散模型能够由文本提示引导的基础。

插值、算术与搜索

由于结构良好的潜在空间中邻近点往往语义相似,从业者可以在两点之间平滑插值以将一个输出变形为另一个,或执行向量算术,一个著名的早期例子是词嵌入中的“国王减去男人加上女人等于女王”。这一特性同样支撑了语义搜索:文档和查询被嵌入到共享潜在空间中,向量数据库查找邻近向量而非匹配精确关键词。在图像模型中,沿发现的方向编辑潜在向量可以改变输出的某个属性(如光照或姿态),而无需重新训练模型。

局限性

潜在空间是学习得到的,而非人为设计的,因此其结构不保证可解释或均匀组织;区域可能纠缠,意味着单个维度同时影响多个可见属性。可解释性领域的研究试图使潜在表示更透明,但成效不一,且潜在空间的几何结构在不同模型版本之间可能显著变化,这使跨模型重用已学习方向的尝试变得复杂。

分类:deep-learning·generative-ai·representation-learning
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史