译自英文

BART是一种用于自然语言处理中序列到序列模型预训练的去噪自编码器,由Facebook AI于2019年提出。它结合了双向和自回归Transformer,以改进文本生成和理解能力。

BART(双向自回归变换器)是一种去噪自编码器,专为自然语言处理中的序列到序列模型预训练而设计。BART由Facebook AI的研究人员于2019年提出,它使用任意噪声函数破坏文本,并学习一个模型来重建原始文本。它因将多种预训练目标(包括BERT和GPT等模型中使用的目标)统一到一个在理解和生成任务中均表现出色的单一框架中而闻名。

BART的架构是标准的序列到序列变换器,具有类似于BERT的双向编码器和类似于GPT的自回归解码器。这种设计使编码器能够从左右两侧捕获上下文,而解码器则逐词生成输出。预训练目标涉及破坏输入文本,并训练模型以最小化解码器输出与原始未破坏文本之间的交叉熵损失。BART在处理各种噪声策略(如词元掩码、词元删除、文本填充、句子排列和文档旋转)方面的灵活性,使其成为一个强大的通用模型。

开发与发布

BART由Facebook AI(现为Meta AI的一部分)的一个团队开发,并在2020年计算语言学协会(ACL)年会上发表的论文《BART:用于自然语言生成、翻译和理解的去噪序列到序列预训练》中提出。该模型以开源软件形式发布,实现可在Fairseq库中获取。初始版本包含英语预训练模型,提供基础版和大型变体,后来扩展至多语言版本,如mBART。

BART的开发动机是观察到现有的预训练方法通常专门针对理解任务(如BERT)或生成任务(如GPT)。BART旨在通过使用序列到序列架构来结合两者的优势,该架构可针对广泛的应用进行微调。预训练期间使用的噪声函数旨在模拟现实世界文本中发生的各种破坏类型,使模型对噪声输入具有鲁棒性。

应用与性能

BART在发布时在多个基准测试上取得了最先进的结果。它在抽象式对话、问答和摘要任务中表现尤为出色。例如,在CNN/DailyMail摘要数据集上,BART-large实现了47.6的ROUGE-1分数,优于之前的模型。在SQuAD问答数据集上,它实现了94.6的F1分数,达到或超过了专门模型的性能。BART还在自然语言生成任务(如对话系统中的响应生成)中表现出强劲的性能。

BART的关键优势之一是它能够以最小的任务特定修改微调用于理解和生成任务。对于分类任务,使用解码器的相同表示,而对于生成任务,解码器用于生成输出序列。这种多功能性使BART成为人工智能机器学习领域从业者的热门选择。

影响与遗产

BART对自然语言处理预训练的后续研究产生了重大影响。其去噪自编码器方法启发了后来的模型,如T5(也使用文本到文本框架),以及各种其他基于去噪的预训练方法。破坏输入文本并重建它的概念已成为开发大型语言模型的标准技术。BART的架构和训练方法也被用于许多领域特定应用,如生物医学文本摘要和法律文档处理。

该模型的成功促进了基于变换器的模型在深度学习神经网络研究中的更广泛趋势。它证明了序列到序列架构可以在大型语料库上有效预训练,然后适应各种任务,为该领域更统一的模型铺平了道路。BART的开源发布也促进了其在学术和工业环境中的采用,许多公司将其集成到自然语言处理流程中。

技术细节

BART使用标准的变换器架构,具有双向编码器和自回归解码器。基础模型在编码器和解码器中各有6层,隐藏大小为768,12个注意力头,总计约1.4亿个参数。大型模型有12层,隐藏大小为1024,16个注意力头,总计约4亿个参数。预训练数据包括英语维基百科和书籍中的文本,与BERT使用的数据类似。

BART中使用的噪声函数包括词元掩码(随机词元被替换为掩码词元)、词元删除(随机词元被移除)、文本填充(文本片段被替换为单个掩码词元)、句子排列(句子被打乱)和文档旋转(文档被旋转以从随机词元开始)。模型被训练从损坏版本重建原始文本,这迫使其学习文本中的局部和全局依赖关系。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·transformer-models·pretraining·sequence-to-sequence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史