译自英文

AWQ(激活感知权重量化)是一种针对大型语言模型的模型压缩技术,通过基于激活统计对权重进行量化,减少内存和计算需求,从而在边缘设备上实现高效推理。

AWQ(激活感知权重量化)是一种面向大型语言模型(LLM)的模型压缩方法,旨在减少推理过程中的内存占用和计算成本,而无需对模型进行完整重训练。该方法由MIT CSAILCarnegie Mellon University的研究人员于2023年提出,通过分析激活统计信息而非仅依赖权重幅度,识别神经网络中最重要的权重,并以较高精度保留这些关键权重,同时将其他权重量化为较低位宽。这种方法使LLM能够在消费级硬件、移动设备和边缘计算平台上运行,且输出质量下降极小。

AWQ的工作原理基于一个原则:已训练的神经网络中并非所有权重对模型性能的贡献相同。通过观察代表性输入数据激活了哪些权重,该方法确定一个逐通道缩放因子,以保护显著权重免受量化误差影响。与依赖穷举搜索或基于梯度的优化的先前量化技术不同,AWQ采用简单而有效的无数据或校准数据驱动过程,使其计算高效且易于集成到现有推理管道中。

技术基础

AWQ的核心创新在于利用激活统计信息指导权重量化。传统的训练后量化方法(如最近舍入(RTN))对所有权重一视同仁,这通常会导致低位宽下显著的精度损失。AWQ则针对小型校准数据集(通常为几百个样本)计算每个权重通道的激活幅度,并推导出一个缩放因子,以放大关键通道的重要性。此缩放应用于量化之前,逆缩放应用于反量化之后,确保模型输出分布保持稳定。

该方法支持多种位宽,包括4位和3位量化,并可与其他压缩技术(如剪枝和知识蒸馏)结合使用。在LLaMA和OPT等模型的基准测试中,AWQ在4位精度下实现了近乎无损的性能,困惑度相比全精度基线增加不到0.1。在3位精度下,性能下降更为明显,但仍与其他最先进方法具有竞争力。

开发与发布

AWQ在一篇题为“AWQ:面向LLM压缩与加速的激活感知权重量化”的论文中提出,作者包括Ji Lin、Jiaming Tang、Haotian Tang、Shang Yang、Wei-Ming Chen、Wei-Chen Wang、Guangxuan Xiao、Xingyu Dang、Chuang Gan和Song Han,并于2024年机器学习与系统会议(MLSys)上展示。该研究在MIT CSAILCarnegie Mellon University进行,并得到Samsung Research及其他机构的贡献。作者发布了开源实现,包括名为awq的库,以及与vLLM和Hugging Face Transformers等流行推理框架的集成。

该项目迅速在机器学习社区获得关注,GitHub仓库在数月内获得数千颗星。该方法被多家硬件和软件供应商采用,包括AMDIntelQualcomm,他们已将AWQ纳入其面向边缘和数据中心部署的模型优化工具包中。

应用与影响

AWQ已被广泛用于在资源受限设备上部署LLM。例如,AppleSamsung Electronics已探索将AWQ用于设备端生成式人工智能应用,如文本摘要和代码补全,这些场景中内存和电池限制至关重要。云服务提供商,包括Amazon Web ServicesGoogle Cloud,已将AWQ集成到其模型服务平台中,以降低推理成本并提高吞吐量。

该技术还使原本需要高端GPU的模型能够在消费级硬件上运行。一个70亿参数的模型通过AWQ量化为4位精度后,可在配备8 GB RAM的笔记本电脑上运行,使大型语言模型研究和实验对个人开发者和小型组织更加可及。

与其他方法的比较

AWQ常与GPTQ(GPT量化)进行比较,后者是另一种流行的训练后量化方法。GPTQ利用二阶信息最小化量化误差,而AWQ依赖激活统计信息,计算成本更低且所需校准数据更少。在实践中,AWQ应用速度更快,对校准数据集的变化更具鲁棒性,而GPTQ在某些模型上有时能达到略低的困惑度。两种方法互补,可结合使用,AWQ可作为GPTQ之前的预处理步骤。

另一种相关方法是SmoothQuant,它将量化难度从激活迁移到权重。AWQ的不同之处在于专注于权重量化,使其实现更简单,更适合缺乏混合精度激活支持的硬件加速器。

未来方向

随着LLM规模持续增长,高效推理仍是一个关键挑战。AWQ的原理已扩展到其他模态,包括视觉语言模型和扩散模型,并取得了有前景的结果。研究人员还在探索自适应量化方案,根据输入复杂度动态调整位宽,以及利用Arm HoldingsTSMC制造的芯片中专用指令的硬件感知实现。

AWQ的开源特性催生了一个充满活力的工具和基准生态系统,现已成为许多模型优化工作流的标准组件。其成功激发了对激活感知技术在剪枝、蒸馏和架构搜索方面的进一步研究,巩固了其作为高效深度学习推理基础性贡献的地位。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:model-compression·quantization·large-language-models·machine-learning
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史