译自英文

零样本分类是一项机器学习任务,其中模型利用辅助信息(如文本描述或属性)来桥接已见类别和未见类别,从而将数据分类到训练期间从未见过的类别中。

零样本分类是Machine learning中的一个问题设定,在测试时,学习器观察到来自训练期间未观察到的类别的样本,并需要预测其类别。这一名称是基于计算机视觉中早期概念“单样本学习”的谐音,后者指仅凭一个示例即可学习分类。零样本方法通常通过编码对象可观察区分属性的辅助信息,将已观察和未观察的类别关联起来。例如,给定一组待分类的动物图像,以及关于动物外观的辅助文本描述,一个经过训练能识别马、但从未见过斑马的模型,在知道斑马看起来像条纹马的情况下,仍能识别出斑马。这一问题在计算机视觉、自然语言处理和机器感知领域被广泛研究。

背景与历史

自然语言处理中关于零样本学习的第一篇论文出现在2008年Chang、Ratinov、Roth和Srikumar发表于AAAI'08的论文中,但该学习范式当时被命名为“无数据分类”。计算机视觉中关于零样本学习的第一篇论文出现在同一会议上,名为“零数据学习”。术语“零样本学习”本身首次出现在文献中,是在2009年Palatucci、Hinton、Pomerleau和Mitchell发表于NIPS'09的论文中。这一术语后来在另一篇计算机视觉论文中被重复使用,并作为多年前计算机视觉中引入的“单样本学习”的衍生词而流行起来。

在计算机视觉中,零样本学习模型为已见类别学习参数及其类别表示,并依赖类别标签之间的表示相似性,从而在推理时能将实例分类到新类别。在自然语言处理中,发展的关键技术方向基于“理解标签”的能力,即将标签表示在与待分类文档相同的语义空间中。这支持在未观察任何标注数据的情况下对单个示例进行分类,这是零样本分类最纯粹的形式。原始论文使用了显式语义分析(ESA)表示,但后来的论文使用了其他表示,包括稠密表示。这种方法也被扩展到多语言领域、细粒度实体类型识别及其他问题。此外,除了仅依赖表示外,计算方法还被扩展到依赖其他任务的迁移,如文本蕴含和问答。

原始论文还指出,除了对单个示例进行分类的能力外,当给定一组示例并假设它们来自同一分布时,可以以类似半监督的方式(或转导学习)提升性能。与机器学习中的标准泛化不同,后者期望分类器能正确分类训练期间已观察类别的新样本,而在零样本分类中,训练分类器时未提供任何来自这些类别的样本。因此,它可以被视为域适应的极端情况。

零样本类别的先决信息

自然,必须提供某种形式的关于这些零样本类别的辅助信息,而这类信息可以有多种类型。

基于属性的学习:类别附带预定义的结构化描述。例如,对于鸟类描述,这可能包括“红头”、“长喙”。这些属性通常以结构化的组合方式组织,考虑这种结构有助于改进学习。虽然这种方法主要用于计算机视觉,但在自然语言处理中也有一些例子。

基于文本描述的学习:如上所述,这是自然语言处理中追求的关键方向。这里类别标签被认为具有含义,并通常附有定义或自由文本的自然语言描述。例如,这可能包括类别的维基百科描述。

类别间相似性:这里类别被嵌入到连续空间中。零样本分类器可以预测样本对应于该空间中的某个位置,即使训练期间未观察到此类样本,也使用最近的嵌入类别作为预测类别。

广义零样本学习

上述零样本分类设定假设在测试时仅给出零样本样本,即来自新的未见类别的样本。在广义零样本学习中,测试时可能出现来自新类别和已知类别的样本。这给测试时的分类器带来了新挑战,因为估计给定样本是新类别还是已知类别非常困难。处理此问题的一些方法包括:

  • 门控模块,首先训练以决定给定样本来自新类别还是旧类别,然后在推理时输出硬决策或软概率决策
  • 生成模块,训练以生成未见类别的特征表示,然后可以在所有类别(已见和未见)的样本上训练标准分类器。

应用领域

零样本学习已应用于以下领域:

  • 图像分类
  • 语义分割
  • 图像生成
  • 目标检测
  • 自然语言处理
  • 计算生物学
  • 抽象推理

与现代AI的关系

随着Large language modelTransformer (architecture)架构的兴起,零样本分类已成为现代Artificial intelligence系统中的突出能力。诸如OpenAIAnthropicGoogle DeepMind开发的模型,可以利用其预训练的语言理解能力对文本进行零样本分类,而无需特定任务的微调。这代表了从早期基于属性和基于嵌入的方法,转向利用Neural network权重中编码的语义知识。在计算机视觉中,通过对齐图像和文本表示也取得了类似进展,使模型能将图像分类到仅由自然语言描述的类别中。该技术也是Generative AI中许多应用的基础,在这些应用中,模型必须理解并分类新颖输入。

参见

  • 少样本学习
  • 迁移学习
  • 快速映射
  • 基于解释的学习
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·natural-language-processing·computer-vision·classification
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史