기술 가이드

GPTQ 및 AWQ 훈련 후 양자화

GPTQ와 AWQ는 이미 학습된 언어 모델을 4비트 정밀도로 축소하여 더 저렴하고 작은 하드웨어에서 실행되도록 하는 두 가지 주요 방법입니다.

2분 읽기마지막 업데이트

개요

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

심층 분석

PTQ(사후 훈련 양자화)는 완성된 모델을 재훈련하지 않고 압축하여 고정밀 가중치를 4비트로 매핑하여 메모리를 대략 4분의 1로 줄입니다. 문제는 정확성을 훼손하지 않고 이를 수행하는 것입니다. GPTQ(OBQ의 개선)는 작은 교정 데이터 세트의 2차 정보를 사용하여 레이어별로 가중치를 양자화하여 나머지 가중치를 조정하고 각 반올림 오류를 보상합니다. AWQ(활성화 인식 가중치 양자화)는 다른 각도를 취합니다. 즉, 가중치 채널의 작은 부분이 불균형적으로 중요하다는 것을 관찰하고 활성화 규모를 확인하여 식별하고 공격적으로 양자화하는 대신 크기를 조정하여 주요 채널을 보호합니다. 둘 다 Llama와 같은 모델을 4비트에서 실행할 수 있으며 vLLM, llama.cpp 및 AutoGPTQ와 같은 도구를 통해 로컬 및 비용 효율적인 추론을 위한 주류로 만들었습니다.

기술적 통찰력

GPTQ는 헤세 분포(손실 곡률)의 근사치를 사용하여 한 가중치를 반올림하여 다른 가중치를 어떻게 조정하여 발생하는 오류를 최소화할지 결정합니다. AWQ는 헤세 행렬을 완전히 건너뜁니다. 즉, 중요한 가중치 채널이 유효 정밀도를 유지할 수 있도록 채널별 배율 인수를 계산한 다음 균일하게 양자화합니다. 둘 다 활성화를 더 높은 정밀도로 유지하고 가중치만 압축합니다. 가중치가 메모리를 지배하는 반면 활성화 양자화는 정확도를 더 손상시키는 경향이 있기 때문입니다.

전략적 영향

비용 및 예산

아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.

더 명확한 결정들

기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.

품질 관리

더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.

GPTQ 및 AWQ 교육 후 양자화의 미래

양자화는 종종 희소성과 결합되는 3비트, 2비트 및 혼합 정밀도 체계를 향해 4비트 미만으로 추진됩니다. 양자화, KV 캐시 압축 및 추측 디코딩이 함께 작동하도록 서비스 엔진과의 긴밀한 결합을 기대합니다. NVFP4 및 MXFP4와 같은 낮은 비트 형식에 대한 하드웨어 지원이 성숙해지고 있으며 자동화된 도구는 점점 더 레이어별 비트 폭을 선택하게 될 것입니다. 광범위한 목표는 기본값으로 거의 무손실 4비트(및 그 이하)를 제공하여 강력한 모델을 저렴하게 모든 곳에 제공하는 것입니다.

실제 구현

4비트 GPTQ 가중치를 사용하여 단일 24GB 소비자 GPU에서 700억 개의 매개변수 Llama 모델을 실행합니다.

AWQ 양자화 모델은 비용 효율적인 프로덕션 API를 위해 vLLM에서 높은 처리량으로 제공됩니다.

llama.cpp는 양자화된 GGUF 가중치를 사용하여 노트북 CPU에서 로컬로 언어 모델을 실행합니다.

Hugging Face의 AutoGPTQ 및 AutoAWQ 라이브러리를 사용하면 개발자가 몇 줄의 코드로 다운로드한 모델을 양자화할 수 있습니다.

위험 및 가드레일

하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.

인프라 및 유지 관리 비용은 종종 과소평가됩니다.

시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.

구현 로드맵

1

구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.

2

현실적인 로드 및 데이터 조건에서 벤치마킹합니다.

3

오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.

4

확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.

계속 탐색하세요

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

퀴즈 시작

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

다음 가이드

훈련 데이터 귀속을 위한 영향 함수

자주 묻는 질문

What is GPTQ and AWQ Post-Training Quantization?

GPTQ와 AWQ는 이미 학습된 언어 모델을 4비트 정밀도로 축소하여 더 저렴하고 작은 하드웨어에서 실행되도록 하는 두 가지 주요 방법입니다. 이것이 데이터센터 랙 대신 단일 소비자 GPU에서 유능한 모델을 실행할 수 있는 이유입니다.

'훈련 후 양자화'는 무엇을 의미하나요?

학습 후 양자화는 처음부터 다시 학습하지 않고도 완성된 모델 가중치의 정밀도(예: 4비트)를 줄입니다.

양자화 시 반올림 오류를 보상하기 위해 GPTQ는 어떤 정보를 사용합니까?

GPTQ는 대략적인 헤세 행렬을 사용하여 하나의 가중치를 양자화하면 손실에 어떤 영향을 미치는지 이해한 다음 나머지 가중치를 조정하여 보상합니다.

AWQ(활성화 인식 가중치 양자화)를 구동하는 주요 통찰력은 무엇입니까?

AWQ는 활성화 크기를 사용하여 두드러진 가중치 채널을 식별하고 일부 채널이 불균형적으로 중요하기 때문에 스케일링을 통해 이를 보호합니다.

16비트 가중치에 비해 4비트 양자화는 대략 얼마나 많은 메모리를 절약합니까?

무게당 16비트에서 4비트로 이동하면 무게 메모리가 약 1/4로 약 4배 감소합니다.

GPTQ와 AWQ가 일반적으로 가중치를 양자화하지만 활성화를 더 높은 정밀도로 유지하는 이유는 무엇입니까?

가중치는 주 메모리 비용인 반면 활성화는 정밀도 손실에 더 민감하므로 가중치 전용 양자화가 일반적으로 가장 적합합니다.