ध्यान ही आपकी आवश्यकता है

अंग्रेज़ी से अनुवादित

2017年Google研究论文介绍了Transformer架构,用自注意力取代了循环结构,成为几乎所有后续大型语言模型的基础。

"Attention Is All You Need" 2017年发表的研究论文,引入了Transformer架构,这是一种完全围绕注意力机制构建的神经网络设计,而非依赖循环或卷积。该论文于2017年6月12日作为arXiv预印本发布,并在同年晚些时候的NeurIPS会议上展示,由谷歌的八位研究人员撰写:Ashish Vaswani、Noam Shazeer、Aidan Gomez、Illia Polosukhin、Jakob Uszkoreit、Llion Jones、Lukasz Kaiser和Niki Parmar。它是计算机科学领域被引用最多的论文之一,被广泛认为是现代大型语言模型发展中最具影响力的单一出版物。

背景

在Transformer之前,用于机器翻译等任务的先进自然语言处理系统依赖于循环架构,通常是LSTM,按顺序处理文本,并辅以从早期序列到序列工作中借鉴的注意力层。顺序处理训练速度慢,且难以捕捉长距离依赖。作者提出完全用自注意力取代循环,让模型并行地权衡序列中每个标记与其他所有标记的相关性,这加速了GPU上的训练,并改善了对长距离结构的建模。

架构与影响

论文的设计,即自注意力和前馈层的编码器-解码器堆叠,并用位置编码替代循环,成为后续几乎所有主要模型的模板。BERT改编了编码器侧用于语言理解,而GPT风格模型则采用了仅解码器的变体,通过下一个标记预测进行训练。该架构被证明异常易于扩展,直接推动了扩展定律研究,该研究显示更多数据、参数和计算能带来可预测的性能提升,并后来支撑了跨文本、视觉、音频和多模态领域的基础模型。

遗产

关于这篇论文,一个常被提及的事实是,所有八位原始作者最终都离开了谷歌,创办或加入了其他AI公司。Noam Shazeer共同创立了Character.AI,之后返回谷歌,而Aidan Gomez成为Cohere的首席执行官。论文的引用次数在发表后不到十年内增长到数万次,截至2020年代中期,Transformer仍然是前沿模型背后的主导架构,尽管研究人员继续探索诸如状态空间模型等替代方案,以应对特定的效率权衡。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·history-of-ai·research
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास