영어에서 번역됨

신경망의 가중치를 저장하고 계산하는 데 사용되는 수치 정밀도를 줄여 모델 크기를 축소하고 추론 속도를 높이는 기술로, 일반적으로 작고 제어 가능한 정확도 손실을 동반한다.

양자화는 신경망의 가중치와 경우에 따라 활성화 값을 표현하는 데 사용되는 수치 정밀도를 줄여 모델 크기를 축소하고 실행에 필요한 계산량을 줄이는 기법입니다. 신경망은 일반적으로 32비트 또는 16비트 부동소수점 숫자로 훈련되지만, 훈련된 모델이 실제로 잘 표현해야 하는 값 중 상당수는 8비트 또는 4비트 정수와 같은 훨씬 낮은 정밀도 형식을 사용하여 근사할 수 있으며, 이때 정확도 손실은 작고 종종 허용 가능한 수준입니다. 대규모 언어 모델에 적용하면 양자화는 원래 훈련 정밀도에 비해 모델의 메모리 사용량을 4배 이상 줄일 수 있어, 그렇지 않으면 필요한 것보다 훨씬 적은 메모리를 가진 하드웨어에서 모델을 실행할 수 있게 합니다.

디지털 신호 처리와 컴퓨팅에서의 일반적인 기법으로서 양자화는 딥러닝보다 훨씬 오래 전부터 존재했지만, 신경망, 특히 대규모 언어 모델에 대한 적용은 2020년대 초반 모델 크기가 수백억 개의 매개변수로 성장하면서 널리 실용화되었으며, 이로 인해 전체 정밀도 배포는 많은 사용자에게 엄청나게 비용이 많이 드는 일이 되었습니다. 2023년 라마와 같은 대규모 오픈 가중치 모델의 출시는 특히 양자화에 대한 커뮤니티의 관심을 급증시켰는데, 이는 개인이 수백억 개의 매개변수를 가진 모델을 단일 소비자 GPU나 심지어 노트북에서 실행할 수 있게 했기 때문이며, 이는 전체 정밀도에서는 사실상 불가능한 일이었습니다.

작동 방식

양자화는 연속적이거나 고정밀도의 가중치 값 범위를 더 작고 이산적인 저정밀도 값 집합에 매핑하며, 일반적으로 원래 값을 대상 형식의 표현 가능한 범위로 스케일링하고 반올림하여 수행합니다. 훈련 후 양자화는 이미 훈련된 모델에 추가 훈련 없이 이 변환을 적용하며, 가장 일반적이고 저렴한 접근 방식입니다. 이는 각 가중치를 독립적으로 변환하는 단순한 방식부터, 특정 모델에 대해 도입되는 오류를 최소화하는 스케일링 요소를 선택하기 위해 보정 데이터를 사용하는 더 정교한 방식(때로는 레이어별 또는 가중치 그룹별)까지 다양합니다. 양자화 인지 훈련은 대신 훈련 과정 자체에 저정밀도의 영향을 통합하며, 일반적으로 매우 낮은 비트 폭에서 더 많은 정확도를 유지하지만 사전 훈련된 모델의 대부분 사용자가 갖지 못한 훈련 인프라와 데이터에 대한 접근이 필요합니다. 2020년대 중반 기준 일반적인 대상 형식에는 일반적으로 무시할 수 있는 품질 손실을 초래하는 8비트 정수 양자화와, 더 크지만 종종 여전히 적당한 품질 감소를 대가로 모델 크기를 훨씬 더 줄이는 더 공격적인 4비트 및 때로는 더 낮은 형식이 포함되었습니다.

응용 분야

양자화는 증류혼합 전문가와 같은 구조적 접근 방식과 함께 대규모 모델을 풍부한 GPU 메모리를 갖춘 데이터 센터 외부에서 실용적으로 배포할 수 있게 만드는 주요 기법 중 하나입니다. 이는 대부분의 로컬 및 엣지 AI 언어 모델 배포의 기반이 되며, 오픈 가중치 모델이 소비자 하드웨어, 단일 가속기 카드 또는 모바일 장치에서 실행될 수 있게 합니다. 또한 대규모 AI 연구소의 프로덕션 서빙 인프라에서도 사용되어 대규모 추론 비용을 줄이는데, 이는 전용 저정밀도 산술 유닛을 갖춘 GPU 하드웨어와 같은 최신 가속기에서 저정밀도 계산이 일반적으로 더 빠르고 저렴하기 때문입니다. 로컬에서 대규모 모델을 양자화하고 실행하기 위한 인기 있는 오픈 소스 도구(효율적인 정수 및 저비트 추론을 중심으로 구축된 형식과 라이브러리 포함)는 허깅 페이스와 같은 저장소와 함께 오픈 가중치 생태계의 널리 퍼진 부분이 되었습니다.

절충점과 한계

양자화의 핵심 절충점은 크기와 속도 이득 대 정확도 손실 사이의 균형이며, 이 손실은 균일하지 않습니다. 일부 작업, 특히 정밀한 산술이나 세밀한 추론을 요구하는 작업은 공격적인 양자화에서 개방형 텍스트 생성보다 더 눈에 띄게 저하되는 경향이 있습니다. 2비트 이하와 같은 극도로 낮은 비트 폭은 일반적으로 이를 보완하는 특수 기법 없이는 대부분의 사용 사례에서 상당하고 종종 허용할 수 없는 품질 저하를 초래합니다. 양자화는 일반적으로 훈련 후에 적용되고 비교적 저렴하고 빠르게 수행되므로, 모델이 원래 전체 정밀도 버전이 허용하는 것보다 더 엄격한 메모리 또는 지연 시간 제약 하에서 실행되어야 할 때 실무자들이 가장 먼저 쉽게 사용하는 수단이 되며, 종종 양자화된 기본 가중치와 소수의 훈련 가능한 저순위 어댑터를 결합하는 QLoRA와 같은 로라 기반 미세 조정 기법과 함께 사용됩니다.

분류:efficiency·model-deployment·inference
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사