Transformer(变换器)是一种深度学习模型架构,它彻底改变了自然语言处理(NLP)领域。与按顺序处理文本的循环神经网络(RNN)不同,Transformer 采用了一种称为“自注意力”的机制,能够并行处理整个序列,并捕捉单词之间的长距离依赖关系。
自注意力机制允许模型在编码每个单词时,权衡句子中所有其他单词的相关性。这使得模型能够理解上下文,例如在句子“The animal didn't cross the street because it was too tired”中,模型可以判断“it”指的是“animal”而不是“street”。
Transformer 架构由两个主要部分组成:编码器(Encoder)和解码器(Decoder)。编码器负责处理输入序列,而解码器负责生成输出序列。这种架构特别适用于机器翻译、文本摘要等序列到序列的任务。
Transformer 是许多现代大型语言模型(如 GPT、BERT)的基础,其强大的并行处理能力和对上下文的深刻理解,使其成为生成式 AI 领域的核心技术。