译自英文

知识蒸馏是一种机器学习技术,其中较小的学生模型被训练以复现较大教师模型的行为,将性能压缩为更高效的形式。

知识蒸馏是机器学习中的一种技术,用于将大型、计算成本高昂的模型(称为教师模型)学到的行为迁移到较小的模型(称为学生模型)中,使学生模型以更小的规模和成本逼近教师模型的性能。蒸馏不是仅用硬标签训练学生模型,而是训练其匹配教师模型的输出分布,该分布携带了教师模型在所有可能答案上的置信度信息,而不仅仅是单一正确答案。

历史

这一核心思想可追溯到21世纪初的模型压缩工作,但现代形式由杰弗里·辛顿、Oriol Vinyals和Jeff Dean在2015年发表的论文《蒸馏神经网络中的知识》中引入。他们提出通过提高softmax函数的“温度”来生成教师模型的软化输出概率,并据此训练学生模型,认为这些软目标揭示了硬标签所丢弃的类别间相对相似性。该技术在2010年代仍是一种小众压缩方法,主要应用于卷积神经网络的视觉任务,直到大语言模型时代才成为核心。

方法

在标准设置中,学生模型的训练损失由两项组成:一项是针对真实标签的常规损失函数,另一项是学生模型与教师模型软化输出分布之间的散度项,通常采用Kullback-Leibler散度。温度参数控制软目标的平滑程度;温度越高,教师模型的不确定性结构暴露得越多。该技术的变体超越了输出匹配:基于特征的蒸馏对齐中间层激活,基于关系的蒸馏匹配教师模型对样本间关系的表示。蒸馏不同于微调LoRA,后者调整现有模型自身的权重,而非从教师信号训练独立的更小网络,尽管这些技术在实践中常被结合使用。

应用

蒸馏在BERT系列压缩中变得具有商业意义,最著名的是DistilBERT(2019年),它以少40%的参数和约快60%的推理速度保留了BERT约97%的语言理解性能,使其适用于边缘AI和延迟敏感型部署。该技术在2025年因DeepSeek-R1发布一系列从其自身推理轨迹蒸馏出的较小开源权重模型而重新受到关注,表明蒸馏不仅能迁移分类准确性,还能将逐步推理能力迁移到可在普通硬件上运行的紧凑模型中。主要实验室也在内部使用蒸馏来生产旗舰模型的更便宜、更快变体,用于高吞吐量推理,并将集成模型压缩为单一可部署网络。

局限性与批评

蒸馏出的学生模型在最难的样本上通常不如教师模型,并且可能继承或放大教师模型的偏见和盲点,因为它们被优化为模仿教师模型,而非独立建模底层任务。关于模型能力有多少能在蒸馏中幸存、又有多少取决于规模本身,存在持续争论;一些证据表明,即使基准分数看似相近,某些涌现能力在更小的蒸馏模型中也会不成比例地退化。蒸馏也已成为商业争议焦点:多家AI实验室指控竞争对手通过大规模训练其输出来蒸馏专有模型,这种做法违反大多数服务提供商的条款,但难以检测或证明,并成为2025年1月DeepSeek冲击报道中的引爆点。

分类:deep-learning·model-compression·efficiency
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史