表征学习,又称特征学习,是一套机器学习中的技术,允许系统自动发现进行特征检测或分类所需的表示,这些表示直接源自原始数据。这取代了手动特征工程,使机器既能学习特征,又能利用这些特征执行特定任务。其动机在于,许多机器学习任务(如分类)需要数学上且计算上便于处理的输入,而现实世界的数据(如图像、视频和传感器数据)却难以通过算法定义的特征来处理。相反,表示是通过检查数据本身来发现的,而不依赖于显式算法。
特征学习可以是监督式、无监督式或自监督式的。在监督式特征学习中,特征是利用带有标签的输入数据来学习的,其中每个输入都有一个真实标签。在无监督式特征学习中,特征是从无标签数据中通过分析数据点之间的关系来学习的。在自监督式特征学习中,从每个数据点构建输入-标签对,从而能够通过监督式方法(如梯度下降)进行学习,这在词嵌入和自编码器中有所体现。
监督式特征学习
监督式特征学习利用带标签的数据来计算误差项,该误差项衡量系统未能产生正确标签的程度。此误差作为反馈来调整学习过程。相关方法包括监督式字典学习和神经网络。
监督式字典学习
字典学习从输入数据中开发出一组代表性元素(即字典),使得每个数据点都可以表示为这些元素的加权和。字典和权重通过最小化平均表示误差来求得,通常使用L1正则化来鼓励稀疏性。在监督式字典学习中,数据结构和标签都被用于优化字典。对于分类任务,目标函数包括分类误差、表示误差、权重的L1正则化以及分类器参数的L2正则化。
神经网络
神经网络是一类受动物神经系统启发的学习算法,由多层相互连接的节点(神经元)和边(突触)组成,并带有相关权重。网络定义了将输入数据从输入层传递到输出层的计算规则。多层神经网络在隐藏层学习表示,这些表示随后在输出层用于分类或回归。一个值得注意的架构是孪生网络,它通过共享权重来学习比较输入。
无监督式特征学习
无监督式特征学习发现能够捕捉高维输入数据结构的低维特征,且无需标签。这些特征随后可以以半监督的方式用于改进监督式任务。常见方法包括k-means聚类和主成分分析。
K-Means聚类
K-means聚类将n个向量分组到k个簇中,每个向量属于均值最近的簇。该问题是NP难的,但存在贪心算法。在特征学习中,k-means可以通过为最近的质心添加二元指示符,或使用到质心的距离(可能经过径向基函数变换)来生成特征。Coates和Ng的研究发现,某些k-means变体的行为与稀疏编码相似。在一项比较评估中,Coates、Lee和Ng发现,经过适当变换的k-means在图像分类任务上优于自编码器和受限玻尔兹曼机。K-means还改进了自然语言处理中的命名实体识别,与Brown聚类和神经词嵌入相竞争。
主成分分析
主成分分析(PCA)是一种降维技术,它生成数据矩阵的p个最大奇异值对应的p个右奇异向量。这些向量定义了一个捕捉最大方差的低维子空间,为后续任务提供了紧凑的表示。
自监督式特征学习
自监督式特征学习从无标签数据中构建输入-标签对,从而允许监督式训练方法学习数据结构。经典例子包括词嵌入和自编码器。词嵌入,例如大型语言模型中使用的那些,将单词映射为捕捉语义关系的稠密向量。自编码器通过瓶颈层学习重构其输入,迫使网络学习高效的表示。自监督学习已通过深度架构(如卷积神经网络和Transformer)应用于多种模态。
应用与影响
表征学习是现代深度学习和生成式AI的基础。它使系统能够直接从原始数据中学习特征,减少了对手动特征工程的需求。这已在计算机视觉、自然语言处理和语音识别领域带来了突破。在人工智能领域,表征学习支撑了许多最先进的模型,包括由OpenAI、Google DeepMind和Anthropic等组织开发的模型。自动学习有用表示的能力是神经网络成功的关键因素,并推动了从医疗保健到自动驾驶等领域的进步。
挑战与未来方向
尽管取得了成功,表征学习仍面临可解释性、数据效率和泛化性等挑战。学习到的表示通常难以解释,且模型可能需要大量数据。研究人员正在探索使表示更鲁棒且跨任务可迁移的方法。截至2020年代初期,自监督学习和多模态学习是活跃的研究领域,有望进一步减少对标签数据的依赖,并提升在多样化任务上的性能。