交叉注意力

영어에서 번역됨

크로스-어텐션은 두 개의 서로 다른 시퀀스의 요소 간 관계를 계산하는 어텐션 메커니즘으로, 트랜스포머와 같은 인코더-디코더 모델에서 소스와 타깃 정보를 정렬하는 데 일반적으로 사용됩니다.

Transformer(变换器)是一种深度学习模型架构,它彻底改变了自然语言处理(NLP)领域。与按顺序处理文本的循环神经网络(RNN)不同,Transformer 采用了一种称为“自注意力”的机制,能够并行处理整个序列,并捕捉单词之间的长距离依赖关系。

自注意力机制允许模型在编码每个单词时,权衡句子中所有其他单词的相关性。这使得模型能够理解上下文,例如在句子“The animal didn't cross the street because it was too tired”中,模型可以判断“it”指的是“animal”而不是“street”。

Transformer 架构由两个主要部分组成:编码器(Encoder)和解码器(Decoder)。编码器负责处理输入序列,而解码器负责生成输出序列。这种架构特别适用于机器翻译、文本摘要等序列到序列的任务。

Transformer 是许多现代大型语言模型(如 GPT、BERT)的基础,其强大的并行处理能力和对上下文的深刻理解,使其成为生成式 AI 领域的核心技术。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning·deep-learning·neural-networks·transformer
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사