译自英文

注意力是一种神经网络机制,使模型在生成输出时能够权衡不同输入元素的相关性。它是Transformer的核心组成部分,支撑着现代大型语言模型和生成式AI系统。

注意力是一种机器学习深度学习中的技术,它允许神经网络在生成每个输出时动态地关注其输入中最相关的部分。注意力不是按固定顺序处理序列,而是计算所有输入位置的加权和,权重由学习到的相关性分数决定。这一机制最初在序列到序列模型的背景下被引入,并成为Transformer架构的基础构建块,该架构支撑着当代大多数大型语言模型生成式人工智能系统。

在典型的注意力操作中,每个输入元素被转换为三个向量:查询、键和值。当前位置的查询与所有位置的键进行比较,通常通过点积产生注意力分数。这些分数被归一化(通常使用softmax函数)以形成权重,然后用于计算值向量的加权和。这使得模型能够从序列中的任何位置检索信息,无论距离远近,这解决了早期循环架构在处理长距离依赖时的一个关键局限。

起源与发展

注意力的概念源于2010年代中期对神经机器翻译的研究。2014年,Dzmitry Bahdanau及其同事发表了一篇开创性论文,引入了一种注意力机制,使编码器-解码器模型能够在翻译过程中将源语言单词与目标语言单词对齐。与固定长度的上下文向量相比,这提高了长句子的翻译性能。2015年,Yoshua Bengio等人进一步探索了注意力的变体,2016年,Google Brain的研究人员开发了Transformer架构,该架构完全依赖注意力,完全摒弃了循环结构。Transformer在2017年由Ashish KumarJakob UszkoreitLukasz KaiserNiki Parmar等人发表的论文《Attention Is All You Need》中提出,并迅速成为序列建模的标准。

多头注意力与变体

Transformer使用多头注意力,其中多个注意力机制并行运行,各自学习不同的关系。输出被拼接并通过线性投影。这使得模型能够同时捕捉句法和语义依赖等多种模式。另一个重要的变体是交叉注意力,用于编码器-解码器模型,其中查询来自解码器,键和值来自编码器,使解码器能够关注输入序列。自注意力,即查询、键和值都来自同一序列,在Transformer的编码器和解码器中都有使用。位置编码被添加到输入嵌入中,以注入关于词序的信息,因为注意力本身是置换不变的。

在大型语言模型中的作用

注意力是几乎所有现代大型语言模型的核心机制,包括由OpenAIAnthropicGoogle DeepMind开发的模型。这些模型,如GPT和Claude,使用堆叠的Transformer层和自注意力来处理和生成文本。能够关注上下文窗口中的所有标记,使得连贯的长篇生成、上下文学习和复杂推理成为可能。然而,注意力相对于序列长度的二次方计算成本,促使了对高效变体的研究,如稀疏注意力和线性注意力,以处理更长的上下文。截至2020年代初期,大多数生产模型使用完整注意力,上下文窗口从几千到几十万个标记不等。

语言之外的应用

注意力已被应用于自然语言处理之外的领域。在计算机视觉中,视觉Transformer(ViT)将图像块视为标记,并使用自注意力进行图像分类和对象检测。在语音识别中,注意力机制将音频帧与文本输出对齐。在强化学习中,注意力帮助智能体关注观察中的相关部分。该机制也用于推荐系统和药物发现。其多功能性使其成为人工智能研究中的通用工具,并且是许多跨领域最先进系统的关键组成部分。

计算考量与硬件

注意力操作涉及大型矩阵乘法,非常适合在GPU和专用加速器上进行并行处理。NVIDIAAMD等公司设计的硬件优化了这些操作。Amazon Web ServicesGoogle CloudAzure等云提供商提供具有高带宽内存的实例,以处理注意力计算。注意力的内存占用随序列长度呈二次方增长,这导致了梯度检查点和Flash Attention等技术来减少内存使用。随着模型规模的扩大,高效的注意力实现仍然是研究和工程的一个活跃领域。

未来方向

研究继续改进注意力机制。努力包括降低计算复杂度、整合外部记忆以及使注意力更具可解释性。一些工作探索了完整注意力的替代方案,如状态空间模型,但注意力仍然是主导范式。截至2025年,基于Transformer的注意力模型是大多数商业AI产品的基础,该机制预计在可预见的未来仍将是AI发展的核心。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·neural-networks·natural-language-processing
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史