AWQ (Quantização de Pesos Sensível à Ativação) é um método de compressão de modelos projetado para grandes modelos de linguagem (LLMs) que reduz a pegada de memória e o custo computacional da inferência sem exigir retreinamento completo do modelo. Desenvolvido por pesquisadores do MIT CSAIL e da Carnegie Mellon University em 2023, o AWQ identifica os pesos mais importantes em uma rede neural analisando estatísticas de ativação, em vez de apenas magnitudes de pesos, e preserva esses pesos críticos em maior precisão enquanto quantiza o restante para larguras de bits menores. Essa abordagem permite que LLMs sejam executados em hardware de consumo, dispositivos móveis e plataformas de computação de borda com degradação mínima na qualidade da saída.
O AWQ opera com base no princípio de que nem todos os pesos em uma Neural network treinada contribuem igualmente para o desempenho do modelo. Ao observar quais pesos são ativados por dados de entrada representativos, o método determina um fator de escala por canal que protege pesos salientes de erros de quantização. Diferente de técnicas de quantização anteriores que dependem de busca exaustiva ou otimização baseada em gradientes, o AWQ usa um processo simples e eficaz, sem dados ou orientado por dados de calibração, tornando-o computacionalmente eficiente e fácil de integrar em pipelines de inferência existentes.
Fundamentos Técnicos
A inovação central do AWQ reside no uso de estatísticas de ativação para orientar a quantização de pesos. Métodos tradicionais de quantização pós-treinamento, como arredondamento para o mais próximo (RTN), tratam todos os pesos de forma uniforme, o que frequentemente leva a perdas significativas de precisão em larguras de bits baixas. O AWQ, em vez disso, calcula a magnitude de ativação para cada canal de peso em um pequeno conjunto de dados de calibração, tipicamente algumas centenas de amostras, e deriva um fator de escala que amplifica a importância de canais críticos. Essa escala é aplicada antes da quantização, e a escala inversa é aplicada após a dequantização, garantindo que a distribuição de saída do modelo permaneça estável.
O método suporta várias larguras de bits, incluindo quantização de 4 bits e 3 bits, e pode ser combinado com outras técnicas de compressão, como poda e destilação de conhecimento. Em testes de benchmark em modelos como LLaMA e OPT, o AWQ alcançou desempenho quase sem perdas em precisão de 4 bits, com um aumento de perplexidade inferior a 0,1 em comparação com a linha de base de precisão total. Em precisão de 3 bits, a degradação foi mais pronunciada, mas ainda competitiva com outros métodos de ponta.
Desenvolvimento e Lançamento
O AWQ foi introduzido em um artigo intitulado "AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration" por Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan e Song Han, apresentado na Conferência de 2024 sobre Aprendizado de Máquina e Sistemas (MLSys). A pesquisa foi conduzida no MIT CSAIL e na Carnegie Mellon University, com contribuições da Samsung Research e outras instituições. Os autores lançaram uma implementação de código aberto, incluindo uma biblioteca chamada awq e integração com frameworks de inferência populares, como vLLM e Hugging Face Transformers.
O projeto rapidamente ganhou tração na comunidade de Machine learning, com o repositório GitHub acumulando milhares de estrelas em poucos meses. O método foi adotado por vários fornecedores de hardware e software, incluindo AMD, Intel e Qualcomm, que incorporaram o AWQ em seus kits de ferramentas de otimização de modelos para implantações de borda e data centers.
Aplicações e Impacto
O AWQ tem sido amplamente usado para implantar LLMs em dispositivos com recursos limitados. Por exemplo, Apple e Samsung Electronics exploraram o AWQ para aplicações de Generative AI no dispositivo, como sumarização de texto e conclusão de código, onde memória e restrições de bateria são críticas. Provedores de nuvem, incluindo Amazon Web Services e Google Cloud, integraram o AWQ em suas plataformas de serviço de modelos para reduzir custos de inferência e aumentar a taxa de transferência.
A técnica também permite a execução de modelos que, de outra forma, exigiriam GPUs de alto desempenho em hardware de consumo. Um modelo de 7 bilhões de parâmetros quantizado com AWQ para precisão de 4 bits pode ser executado em um laptop com 8 GB de RAM, tornando a pesquisa e experimentação com Large language model mais acessível para desenvolvedores individuais e pequenas organizações.
Comparação com Outros Métodos
O AWQ é frequentemente comparado com o GPTQ (Quantização GPT), outro método popular de quantização pós-treinamento. Enquanto o GPTQ usa informações de segunda ordem para minimizar o erro de quantização, o AWQ depende de estatísticas de ativação, que são mais baratas de calcular e exigem menos dados de calibração. Na prática, o AWQ tende a ser mais rápido de aplicar e mais robusto a variações em conjuntos de dados de calibração, enquanto o GPTQ às vezes alcança perplexidade ligeiramente menor em certos modelos. Ambos os métodos são complementares e podem ser usados juntos, com o AWQ servindo como uma etapa de pré-processamento antes do GPTQ.
Outra abordagem relacionada é o SmoothQuant, que transfere a dificuldade de quantização de ativações para pesos. O AWQ difere ao focar exclusivamente na quantização de pesos, tornando-o mais simples de implementar e mais adequado para aceleradores de hardware que não suportam ativações de precisão mista.
Direções Futuras
À medida que os LLMs continuam a crescer em tamanho, a inferência eficiente permanece um desafio crítico. Os princípios do AWQ foram estendidos a outras modalidades, incluindo modelos de visão-linguagem e modelos de difusão, com resultados promissores. Pesquisadores também estão explorando esquemas de quantização adaptativa que ajustam dinamicamente as larguras de bits com base na complexidade da entrada, bem como implementações cientes de hardware que aproveitam instruções especializadas em chips fabricados pela Arm Holdings e TSMC.
A natureza de código aberto do AWQ fomentou um ecossistema vibrante de ferramentas e benchmarks, e agora é um componente padrão em muitos fluxos de trabalho de otimização de modelos. Seu sucesso inspirou pesquisas adicionais em técnicas sensíveis à ativação para poda, destilação e busca de arquitetura, consolidando seu lugar como uma contribuição fundamental para a inferência eficiente em Deep learning.