零样本学习是指模型在没有见过该特定任务的任何标注示例的情况下(无论是在训练中还是在提示中)正确执行任务的能力。在大语言模型的背景下,零样本使用通常意味着仅向模型提供指令,例如“将这句话翻译成法语”或“将这条评论分类为正面或负面”,并期望模型在没有附带任何演示的情况下给出正确响应。该术语早于大语言模型出现,最初用于计算机视觉和经典机器学习,描述能够识别训练数据中从未出现过的类别的分类器,通常通过辅助信息(如文本描述或属性)将新标签与已知标签关联起来。
在语言模型中
现代语言模型的零样本性能依赖于两个发展。首先,在广泛文本语料库上进行的大规模预训练使模型接触到极其多样的任务格式、措辞和体裁,因此新指令往往类似于模型在训练中隐式学会执行的内容,即使没有专门的示例。其次,指令微调和对齐技术(如基于人类反馈的强化学习)明确训练模型遵循自然语言指令,而不仅仅是以风格上合理的方式续写文本,这正是使ChatGPT等对话助手能够直接从普通语言请求中使用的关键。在第二步之前,基于GPT-3风格的基础模型通常可以被诱导执行零样本任务,但在没有示例的情况下可靠且有益地遵循任意指令的能力,在指令微调成为行业标准做法后显著提升。
零样本与少样本
零样本学习通常与少样本学习和上下文学习一起讨论,作为由提示中任务演示数量定义的谱系上的一个点:零个演示对应零样本,少量演示对应少样本。GPT-3论文报告称,在同一基础模型上,少样本提示通常优于零样本提示,尤其是对于输出格式不寻常的任务,但对于经过良好对齐的聊天模型在常见任务上的差距已经缩小,因为这些模型专门训练用于解释和执行朴素指令。零样本提示仍然是大多数消费级聊天机器人交互的默认模式,因为要求用户在每个请求前提供示例将是不合理的界面负担。
思维链与零样本推理
一个显著的扩展是零样本思维链提示,即在零样本指令后附加诸如“让我们一步步思考”之类的简单短语,可以显著提高算术和逻辑推理任务的准确性,而无需提供任何工作示例。这一发现由研究人员在2022年报告,表明早期工作中通过少样本演示引发的推理能力通常也可以零样本触发,只需提示模型外化中间步骤即可,这直接影响了后来专门推理模型系统的设计理念。
局限性
零样本性能是不均衡的:它在自然语言中常见的任务(摘要、翻译、情感分类)上往往最强,而在需要精确、不寻常输出格式或模型接触较少的领域特定惯例的任务上较弱。模糊的指令也可能在没有示例锚定模型理解的情况下被以不同于预期的方式解释,这是提示工程实践通常建议在可靠性重要的任务中添加至少几个演示、系统消息或明确格式规则的原因之一。零样本能力也经常被用作学术基准中的评估视角,因为它比少样本分数更直接地衡量模型从预训练中的泛化能力,而少样本分数可能因恰好与测试分布匹配的示例而虚高。