AWQ(Activization-aware Weight Quantization)는 대규모 언어 모델(LLM)을 위해 설계된 모델 압축 방법으로, 전체 모델 재학습 없이 추론의 메모리 사용량과 계산 비용을 줄인다. 2023년 MIT CSAIL 및 Carnegie Mellon University의 연구자들이 개발한 AWQ는 가중치 크기만이 아닌 활성화 통계를 분석하여 신경망에서 가장 중요한 가중치를 식별하고, 해당 중요 가중치는 더 높은 정밀도로 유지하면서 나머지를 더 낮은 비트 폭으로 양자화한다. 이 접근 방식은 LLM이 소비자급 하드웨어, 모바일 장치 및 엣지 컴퓨팅 플랫폼에서 출력 품질의 저하를 최소화하며 실행될 수 있게 한다.
AWQ는 훈련된 신경망의 모든 가중치가 모델 성능에 동등하게 기여하지 않는다는 원리에 기반한다. 대표 입력 데이터에 의해 어떤 가중치가 활성화되는지를 관찰함으로써, 이 방법은 중요한 채널을 양자화 오류로부터 보호하는 채널별 스케일링 팩터를 결정한다. 이전의 양자화 기법이 철저한 검색이나 그라디언트 기반 최적화에 의존하는 것과 달리, AWQ는 데이터 없이 또는 보정 데이터 기반의 간단한 프로세스를 사용하며, 이는 계산 효율성이 높고 기존 추론 파이프라인에 통합하기 쉽다.
기술적 기반
AWQ의 핵심 혁신은 활성화 통계를 사용하여 가중치 양자화를 안내하는 데 있다. 전통적인 사후 훈련 양자화 방법, 예를 들어 둘러 반올림(RTN)은 모든 가중치를 균등하게 처리하여 낮은 비트 폭에서 종종 상당한 정확도 손실을 초래한다. 반면, AWQ는 보통 수백 샘플의 작은 보정 데이터셋에서 각 가중치 채널에 대한 활성화 크기를 계산하고, 중요한 채널의 중요성을 높이는 스케일링 팩터를 도출한다. 이 스케일링은 양자화를 하기 전에 적용되고 역 스케일링은 고양화 후에 적용되어 모델의 출력 분포가 안정적으로 유지된다.
이 방법은 4비트 및 3비트 양자화를 포함한 다양한 비트 폭을 지원하며, 가지치기 및 지식 유약과 같은 다른 압축 기법과 결합할 수 있음. LLaMA 및 OPT와 같은 모델의 벤치마크 테스트에서 AWQ는 4비트 정밀도에서 무결점에 가까운 성능을 달성하여 전체 정밀도 기준선과 비교하여 퍼플렉서티가 0.1 미만으로 증가했다. 3비트 정밀도에서 성능 빈손가시 여러 최첨단 방법과 경쟁력이 있었다.
개발 및 배포
AWQ는 “AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration”라는 논문에 소개되었으며, Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, 및 Song Han에 의해 작성되었고, 2024년 머신 러닝 및 시스템 학회 (MLSys)에서 발표되었다. 연구는 MIT CSAIL 및 Carnegie Mellon University에서 수행되었고, Samsung Research 및 다른 기관의 기여가 포함되었다. 저자들은 awq 라이브러리 및 vLLM과 Hugging Face Transformers와 같은 인기 추론 프레임워크와의 통합을 포함한 오픈 소스 구현을 제공했다.
이 프로젝트는 빠르게 머신 러닝 커뮤니티에서 관심을 받았으며, GitHub 저장소는 몇 개월 내에 수천 개의 스타를 축적했다. 이 방법은 밝은 하드웨어 및 소프트웨어 업체들, 예를 들어 AMD, Intel 및 Qualcomm로 채택되었으며, 그들은 마에지 데이터 센터 배포를 위한 모델 최적화 도구에 AWQ를 통합했다.
응용 분야와 영향
AWQ는 자원이 제한된 하드웨어 장치에 LLM을 배치하는 데 광범위하게 사용되고 있다. 예를 들어 Apple 및 Samsung Electronics은 텍스트 요약 및 코드 완성 같은 온디바이스 생성 인공지능 애플리케이션에 대한 비전의 AWQ를 탐색했으며, 여기서 메모리 및 배터리 제약이 중요하다. Amazon Web Services 및 Google Cloud를 포함한 클라우드 공급자의 AWQ는 모델 서빙 플랫폼에 통합하여 추론 비용을 낮추고 처리량을 증가시켰다.
이 기술은 또한 기존의 고급 GPU가 필요했을 모델을 소비자 하드웨어에서 실행할 수 있게 한다. 7억 개의 파라미터 모델을 AWQ로 4비트 정밀도로 양자화하면 8GB RAM의 랩톱에서 실행할 수 있으며, 이로 인해 대규모 언어 모델 연구와 실험 접근성이 개별 개발자 및 소규모 조직에게 더 직관적으로 높아졌다.
다른 방법과의 비교
AWQ는 다른 인기 있는 사후 양자화 방법인 GPTQ(GPT quantization)와 자주 비교된다. GPTQ는 두 번째 덕분의 정보를 사용한 오류를 최소화하는 반면, AWQ는 더 저렴한 비용으로 활성화 통계에 의존하며 필요한 보정 데이터도 덜 사용한다. 실쇼적으로 AWQ는 보정 데이터셋의 변동성에 대해 더 빠르게 적용되고 더 견고하게 처리하다 경향이 있지만, 특정 모델에 대한 퍼플 렉서티에서 GPTQ가 약간 낮a로 나온 경우도 있다. 이 두 방법은 상호 보완적이며 AWQ를 GPTQ 전에 전처리 단계로 사용하여 결합할 수 있다.
또 다른 관련 접근 방식은 SmoothQuant으로, 양자화 어려움을 활동에 전달하는 것이다. AWQ는 오로지 활성의 양자화에 초점을 맞춤은 다르며, 구현이 더 간단하고 혼합 정밀도 활성을 지원하는 하드웨어 가속기에 더 적합하다.
미래 전망
LLM이 계속해서 크기면에서 증가함에 따라 효율적 추론은 여전히 중대한 과제다. AWQ 야 기반은 비주얼-언어 모델 및 알버전모델을 포함한 다른 모달리티로 확장되었으며 유망한 결과를 보이고 있다. 연구자들은 입력 복잡도에 기반하여 비트 폭을 동적으로 조정하는 적응형 양자화 방식과 Arm Holdings 및 TSMC에서 제조된 칩의 특화된 지침을 활용하는 하드웨어 인식 구현을 탐색하고 있다.
AWQ의 오픈 소스 특성은 다양한 도구와 벤치마크의 생태계를 조성했으며, 이제 많은 모델 최적화 워크플로우에서 표준 구성 요소로 자리잡았다. 그것의 성공은 가지치기, 지식 증성 및 아키텍처 검색에 대한 활성화 인식 기술의 추가 연구를 호확시키며, 효율적인 deep-learning 딥 러닝 추론에 대한 기초적인 기여로서 그 위치를 고정하고 있다.