译自英文

一种降低神经网络权重存储与计算数值精度的技术,可缩小模型体积并加速推理,通常伴随轻微且可控的精度损失。

量化是一种降低用于表示神经网络权重(在某些情况下还包括激活值)的数值精度的技术,目的是缩小模型体积并减少运行所需的计算量。神经网络通常使用32位或16位浮点数进行训练,但训练后模型实际需要良好表示的许多值可以用低得多的精度格式(如8位甚至4位整数)来近似,且精度损失通常很小,往往可以接受。应用于大型语言模型时,量化可以将模型的内存占用相比其原始训练精度减少四倍或更多,从而使得模型能够在内存远低于原本要求的硬件上运行。

量化作为数字信号处理和计算中的通用技术,其历史远早于深度学习,但将其应用于神经网络,特别是大型语言模型,则是在2020年代初随着模型规模增长到数百亿甚至数千亿参数而开始广泛实践,当时全精度部署对许多用户而言成本过高。2023年Llama等大型开放权重模型的发布,推动了社区对量化技术的特别关注,因为它使个人能够在单个消费级GPU甚至笔记本电脑上运行具有数百亿参数的模型,而这是全精度下几乎不可能实现的。

工作原理

量化将连续或高精度的权重值范围映射到一组较小的、离散的低精度值上,通常通过将原始值缩放到目标格式的可表示范围并进行舍入来实现。训练后量化在不对已训练模型进行进一步训练的情况下应用这种转换,是最常见且成本最低的方法;它可以简单到独立转换每个权重,也可以更复杂,使用校准数据来选择缩放因子,以最小化针对特定模型引入的误差,有时还按层或按权重组进行。量化感知训练则在训练过程中本身纳入降低精度的影响,这通常在极低位宽下能更好地保持精度,但需要访问训练基础设施和数据,而大多数预训练模型用户并不具备这些条件。截至2020年代中期,常见的目标格式包括8位整数量化(通常产生可忽略的质量损失),以及更激进的4位甚至更低格式,这些格式以较大但仍通常适度的质量下降换取显著更小的模型体积。

应用

量化是与蒸馏混合专家等架构方法并列的主要技术之一,用于使大型模型能够在GPU内存充足的数据中心之外实际部署。它支撑了大多数本地和边缘AI语言模型部署,使开放权重模型能够在消费级硬件、单加速卡甚至移动设备上运行。它也被大型AI实验室用于生产级服务基础设施中,以降低大规模推理的成本,因为低精度计算在现代加速器(如配备专用低精度算术单元的GPU硬件)上通常更快且更便宜。围绕高效整数和低位推理构建的流行开源量化及本地运行大型模型的工具,包括各种格式和库,与Hugging Face等仓库一起,成为开放权重生态系统中广泛普及的组成部分。

权衡与限制

量化的核心权衡在于体积和速度提升与精度损失之间的平衡,而这种损失并非均匀分布:某些任务,特别是需要精确算术或细粒度推理的任务,在激进量化下往往比开放式文本生成更容易出现明显退化。极低位宽(如2位或更低)通常会产生大幅且往往不可接受的质量下降,除非采用专门技术进行补偿。由于量化通常在训练后应用,且相对便宜和快速,当模型需要在比原始全精度版本更严格的内存或延迟约束下运行时,它往往是实践者首先且最容易使用的杠杆,经常与基于LoRA微调技术(如QLoRA)结合使用,后者将量化后的基础权重与一小部分可训练的低秩适配器相结合。

分类:efficiency·model-deployment·inference
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史