一、 论文基本信息

  • 标题:​​ BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension

  • 作者:​​ Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Ves Stoyanov, Luke Zettlemoyer

  • 机构:​​ Facebook AI (现 Meta AI)

  • 发表会议/年份:​​ 2020年(于ACL等会议发表)

  • 核心思想:​​ 采用序列到序列的“去噪”/“文本修复”​​ 作为统一的预训练目标,旨在构建一个能同时胜任自然语言理解(NLU)和自然语言生成(NLG)的通用框架。

  • 论文链接:​​ arXiv:1910.13461


二、 解决的问题与核心贡献

1. 背景与待解决的问题

在BART问世之前,预训练语言模型领域呈现“双雄并立”的格局:

  • BERT(代表自编码模型):​​ 采用双向Transformer编码器,通过“掩码语言模型”目标进行预训练。优势在于深度双向理解,在文本分类、问答等理解任务上表现卓越。但其缺陷在于:

    • 生成能力弱:​​ 预训练与微调阶段存在差异([MASK]标记在微调时不会出现),且其架构不适合进行流畅的、自回归的文本生成。

    • 独立性假设:​​ 假设被掩码的令牌之间相互独立,这与自然语言的内在逻辑不符。

  • GPT(代表自回归模型):​​ 采用单向Transformer解码器,通过“自左向右的语言模型”目标进行预训练。优势在于流畅的文本生成。但其核心局限在于:

    • 单向上下文:​​ 每个令牌只能关注其左侧上下文,无法像BERT一样进行全局的、深度的语义理解。

因此,一个核心问题被提出:能否设计一个模型,像BERT一样“精通阅读”,又能像GPT一样“善于写作”?​​ BART正是为了弥合这一鸿沟,旨在构建一个统一的理解与生成框架

2. BART的核心贡献

  1. 提出了通用的“去噪自编码器”预训练范式:​​ BART的创新不在于模型结构,而在于其预训练目标。它将任务统一为“文本修复”:即模型学习将一份被任意方式破坏的输入文本,完整地恢复成原始文本。这个目标天然地融合了理解(理解被破坏文本的语义)和生成(流畅地输出原文)。

  2. 系统性地探索了多种噪声注入方法:​​ 论文没有局限于单一的掩码方式,而是实验了包括令牌掩码、令牌删除、文本填充、句子重排、文档旋转在内的五种噪声方法,并通过消融实验证明了文本填充句子重排的组合最为有效。

  3. 实证了统一框架的强大泛化能力:​​ 在广泛的自然语言处理任务上(包括文本摘要、机器翻译、文本分类、抽取式问答等),BART都达到了当时的顶尖水平,有力地证明了其作为通用基础模型的潜力。


三、 架构与核心方法分块详解

1. 模型架构:标准的编码器-解码器

BART采用了标准的Transformer架构作为骨干,包含一个编码器和一个解码器。

  • 编码器:​​ 是一个双向的Transformer编码器,与BERT的编码器类似,但做了一处关键改动:​移除了BERT中的填充激活函数(ReLU)​,改为使用GeLU激活函数,并与GPT一样采用了参数初始化方式。编码器的任务是理解被破坏的文本,为其生成一个双向的、上下文化的表示。

  • 解码器:​​ 是一个自回归的Transformer解码器。在计算第i个位置的表示时,它只能访问到前i-1个位置的信息(通过掩码注意力实现)​以及编码器的全部输出。这使得解码器能够基于完整的输入上下文,从左到右地生成文本。

  • 插图描述建议:​​ 图左侧为“被破坏的文本”输入给编码器,编码器产生中间表示,连接至右侧的解码器,解码器自回归地输出“原始文本”。图中可用箭头清晰展示信息流动方向,并标注出编码器(双向)和解码器(自回归,带掩码注意力)的特性。

2. 预训练目标:去噪(文本修复)​

这是BART的灵魂所在。其预训练流程可概括为两个步骤:

  • 步骤一:噪声腐蚀。​​ 从原始文本中抽取一个句子或文档,使用某种或多种噪声函数对其进行破坏,生成损坏的文本。论文中详细比较了五种噪声方法:

    • 令牌掩码:​​ 随机将一些令牌替换为[MASK](同BERT)。

    • 令牌删除:​​ 随机删除一些令牌。模型必须学习预测缺失令牌的位置和内容

    • 文本填充:​​ 随机选择若干个文本片段(text span),每个片段用一个单一的[MASK]令牌替换。这是最关键、最有效的噪声,因为它迫使模型学习预测缺失片段的内容和长度。

    • 句子重排:​​ 根据句号将文本分割成句子,然后随机打乱句子顺序。模型需要学习恢复原始的文档逻辑结构。

    • 文档旋转:​​ 随机选择一个令牌,然后旋转文档使其以该令牌开头。模型需要识别出文档的真正起始点。

  • 步骤二:序列重建。​​ 将破坏后的文本输入编码器,解码器则基于编码器的输出,以自回归的方式(逐个令牌)生成原始的、未被破坏的文本。损失函数计算的是解码器输出与原始文本之间的交叉熵损失。

  • 插图描述建议:​​ 用五个小图分别展示五种噪声方法如何作用于同一段示例文本“A fast butterfly flies over beautiful flowers.”,并对应生成被破坏的文本。例如,文本填充可展示为 “A fast [MASK] over beautiful flowers.”。

3. 微调:适配下游任务

BART的编码器-解码器架构使其能灵活适配多种NLP任务:

  • 文本生成(如摘要、对话):​​ 这是最直接的应用。将源文档(如新闻文章)作为输入,解码器直接生成目标文本(如摘要)。

  • 序列分类(如情感分析):​​ 将输入文本同时作为编码器的输入和解码器的目标输出。取解码器最后一个令牌对应的最终隐藏状态(即序列结束符</s>的位置)作为整个序列的表示,接一个线性分类器进行分类。

  • 机器翻译:​​ 论文提出了一个巧妙的适配方法。将BART的编码器替换为一个由目标语言到英语的反向翻译模型随机初始化的编码器,然后将整个模型(新编码器+BART预训练好的解码器)在翻译数据上端到端微调。这相当于用BART强大的生成能力来初始化一个翻译模型,取得了优异效果。

  • 抽取式问答:​​ 将问题和上下文拼接后输入模型,模型通过解码器生成答案在上下文中的文本范围(如生成起始和结束位置)。


四、 影响与展望

1. 深远影响

  • 统一范式的确立:​​ BART成功验证了“文本到文本”作为统一NLP任务范式的巨大潜力。它将理解和生成任务都转化为序列到序列的映射问题,为后续如T5、mT5等更通用的模型铺平了道路。

  • 文本修复思想的普及:​​ BART的“去噪”预训练目标因其有效性而被广泛采纳。许多后续的模型,特别是在文本编辑、数据清洗、文本增强等领域,都受到了BART思想的启发。

  • 工业应用的基石:​​ 由于其强大的生成质量和任务适应性,BART及其改进版本成为了许多实际应用(如智能客服、内容创作平台、文本润色工具)的核心技术基础。

2. 局限性与未来展望

  • 计算效率:​​ 完整的编码器-解码器架构在预训练和推理(特别是自回归生成)时的计算开销和延迟都大于纯编码器或纯解码器模型。

  • 与超大规模单向模型的竞争:​​ 随着如GPT-3、PaLM等千亿级参数的单向解码器模型的出现,它们在少样本/零样本学习上展现出惊人能力,对BART这种需要任务特定微调的范式构成了挑战。未来的研究可能会探索如何将BART的深度理解能力与大规模语言模型的泛化能力相结合。

  • 非自回归生成的探索:​​ 如何让BART这类模型实现快速的非自回归生成(并行生成所有令牌)同时不显著牺牲生成质量,仍然是一个开放的研究方向。

  • 多模态扩展:​​ 将BART的“去噪-重建”思想扩展到多模态领域(如图文生成、视频描述)是一个自然且有前景的演进方向,例如后续的VL-BART等模型。

总结:​​ BART是预训练技术发展史上的一个关键转折点。它通过一个简洁而强大的“文本修复”目标,巧妙地统一了自然语言的理解与生成,证明了通用序列到序列框架的强大威力。尽管后续模型在参数规模和应用范式上不断演进,但BART所奠定的思想基石及其在架构设计上的权衡智慧,至今仍深刻地影响着大模型技术的发展。

更多推荐