译自英文

自注意力是一种机制,其中序列中的每个元素都关注所有其他元素,基于内部关系计算权重。它支撑着变换器架构和现代大型语言模型。

自注意力是机器学习中的一种机制,其中序列中的每个元素都关注所有其他元素,并根据它们之间的关系计算注意力权重。与早期在编码器和解码器序列之间运作的注意力机制不同,自注意力从同一输入序列中派生查询、键和值,使模型能够直接捕获全局依赖关系。这一概念是Transformer (architecture)架构的核心,该架构用注意力机制取代了循环,并成为BERT、T5和生成式预训练变换器(GPT)等模型的基础。

在自注意力中,输入序列中的每个令牌被转换为三个向量:查询、键和值。两个令牌之间的注意力权重通过一个令牌的查询与另一个令牌的键的点积计算,通常经过缩放并通过softmax函数。这些权重通常被称为“软”权重,仅存在于前向传播中,并随每个输入步骤而变化,不同于训练期间计算的“硬”权重。每个令牌的输出是值的加权和,其中权重反映了其他令牌与当前令牌的相关性。

历史

注意力机制是为了解决循环神经网络(RNN)的弱点而开发的,RNN偏向于句子中较后单词的信息,削弱了较早的上下文。早期的注意力设计将注意力机制嫁接在用于机器翻译的编码器-解码器RNN上,如Bahdanau等人在2014年所述。然而,重大突破来自自注意力,其中输入序列中的每个元素都关注所有其他元素,使模型能够捕获全局依赖关系。这一思想是2017年论文《Attention Is All You Need》中引入的transformer架构的核心,该论文由Jakob UszkoreitLukasz Kaiser及谷歌同事撰写。transformer移除了较慢的顺序RNN,依赖更快的并行注意力,从而产生了BERT、T5和GPT等模型。Niu等人和Soydaner提供了深度学习注意力机制的额外综述。

机制

自注意力对令牌嵌入序列进行操作,每个嵌入表示为一个向量。对于每个令牌,模型通过学习的线性变换计算查询向量、键向量和值向量。令牌i和令牌j之间的注意力分数通过query_i和key_j的点积计算,通常除以维度的平方根以稳定梯度。这些分数通过softmax产生注意力权重,每个查询的权重之和为1。令牌i的输出是所有值向量的加权和,使用这些权重。

此机制允许每个令牌直接访问序列的任何部分,无论距离多远,克服了RNN的顺序瓶颈。在实践中,transformer使用多头注意力,其中多组查询、键和值投影并行运行,使模型能够同时关注序列的不同方面。

解释注意力权重

在翻译中,对齐指的是将源句中的单词与翻译句中的单词匹配。不考虑词序而进行逐字翻译的网络会在对齐矩阵的对角线上显示最高的注意力分数。对角线外的优势表示更细致的对齐。例如,将“I love you”翻译成法语:在第一次解码器传递中,94%的注意力权重在“I”上,产生“je”;在第二次传递中,88%在“you”上,产生“t'”;在第三次传递中,95%在“love”上,产生“aime”。这产生了一个对齐矩阵,其中“love”与“aime”对齐。

有时对齐是多对多的,例如“look it up”对应“cherchez-le”。软注意力权重(产生隐藏向量的加权和)比硬注意力(将一个权重设为1,其他设为0)效果更好,因为可能没有单一的“最佳”隐藏向量。

变体

许多注意力变体实现软权重。早期形式包括快速权重程序员或快速权重控制器(1992年),其中“慢”神经网络通过外积输出另一个网络的“快”权重,后来更名为“线性化自注意力”。Bahdanau风格注意力(也称为加性注意力)和Luong风格注意力(或乘性注意力)在基于RNN的系统中很常见。早期类似现代自注意力的机制使用RNN提出,但高度可并行化的自注意力于2017年引入并用于transformer。其他变体包括位置注意力和因子化位置注意力。对于卷积神经网络,注意力可以作用于空间维度、通道维度或组合。这些变体重新组合编码器侧输入以重新分配效果到每个目标输出,通常使用点积的相关性风格矩阵进行重新加权。

优化

注意力矩阵的大小随令牌数量呈二次方增长,对于长序列需要大量GPU内存。Flash注意力于2022年引入,通过将注意力计算划分为适合GPU更快片上内存的块,减少中间存储,从而降低内存需求并提高效率,同时不牺牲准确性。Meta开发的FlexAttention允许用户在softmax之前修改注意力分数,并动态选择最优注意力算法。

应用

注意力广泛应用于自然语言处理、计算机视觉和语音识别。在NLP中,它通过问答和摘要等任务改善上下文理解。在视觉中,视觉注意力帮助模型关注相关图像区域,增强对象检测和图像字幕生成。自注意力是大型语言模型(如GPT)的核心组件,用于处理和生成文本。

视觉变换器的注意力图作为解释

从原始视觉变换器(ViT)论文开始,将注意力分数可视化为热图(称为显著性图或注意力图)已成为检查ViT模型决策过程的常规方法。可以计算任何层中任何注意力头的注意力图,较深层显示更具语义意义的可视化。注意力展开是一种递归算法,通过计算连续注意力图的点积来组合所有层的注意力分数。由于视觉变换器通常以自监督方式训练,注意力图通常不具有类别敏感性。当附加分类头时,类别判别性注意力图(CDAM)结合了注意力图和相对于类别[CLS]令牌的梯度。一些最初为卷积神经网络开发的类别敏感可解释性方法也可以适应。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·natural-language-processing·attention-mechanism
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史