SmoothQuant 및 활성화 양자화
SmoothQuant는 재교육 없이 가중치와 활성화 모두에 대해 대규모 언어 모델을 8비트 정수로 압축할 수 있는 기술입니다.
개요
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
심층 분석
모델을 16비트 부동 소수점에서 8비트 정수로 축소하면 가중치는 쉽게 압축되지만 활성화는 문제가 됩니다. 특정 채널은 나머지 채널보다 10~100배 더 큰 값을 전달하고 이를 거친 정수 그리드로 강제 적용하면 정확도가 손상됩니다. Xiao 등이 소개한 SmoothQuant. 2022년에는 가중치가 부드럽고 양자화하기 쉬운 반면 활성화는 급격하게 나타나는 것을 관찰합니다. 따라서 난이도를 수학적으로 마이그레이션합니다. 활성화 채널을 채널별 규모로 나누고 해당 가중치에 동일한 규모를 곱합니다. 두 작업이 취소되어 모델 출력은 변경되지 않지만 이제 두 텐서는 모두 친숙한 범위에 있습니다. 그 결과 정확도 손실이 거의 0에 가깝고 속도가 약 2배 향상되었으며 메모리가 절약되는 W8A8(8비트 가중치 및 활성화) 추론이 탄생했습니다.
기술적 통찰력
핵심 트릭은 s = max(|X|)^alpha / max(|W|)^(1-alpha)로 계산되는 채널별 평활화 요소입니다. 활성화는 1/s로 조정되고 가중치는 s로 조정되므로 행렬 곱 XW가 보존됩니다. 스케일링은 이전 레이어의 가중치 또는 융합 작업에 오프라인으로 흡수되므로 런타임 비용이 추가되지 않습니다. 알파 초매개변수(종종 0.5)는 이상값 부담이 활성화에서 가중치로 이동하는 정도를 제어합니다.
전략적 영향
비용 및 예산
아키텍처 결정은 수년 동안 성능과 운영 비용을 결정합니다.
더 명확한 결정들
기술 교육은 팀이 최신 스택뿐만 아니라 올바른 스택을 선택하는 데 도움이 됩니다.
품질 관리
더 나은 엔지니어링 선택은 생산 시 신뢰성 사고를 줄입니다.
SmoothQuant 및 활성화 양자화의 미래
SmoothQuant는 활성화 이상값이 불가피한 것이 아니라 마이그레이션 가능하다는 사실을 확인했으며, 이러한 아이디어는 이제 프로덕션 INT8 및 FP8 서비스를 뒷받침합니다. 스무딩은 그룹별 양자화, 학습된 스케일링, 4비트 활성화 연구(예: 이상치 인식 방법)와 같은 보다 세분화된 체계와 결합될 것으로 예상됩니다. FP8 하드웨어(Hopper, Blackwell)가 성숙해짐에 따라 스무딩 스타일 밸런싱이 컴파일러 및 추론 엔진 파이프라인에 계속 적용되어 양자화가 거의 무료로 유지됩니다.
실제 구현
메모리와 행렬 곱셈 비용을 절반으로 줄여 더 적은 수의 GPU로 W8A8에서 70B 매개변수 LLM 제공
기본적으로 8비트 정수 수학을 가속화하는 NVIDIA Hopper/Blackwell 텐서 코어에서 INT8 추론을 활성화합니다.
처리량을 두 배로 늘리면 토큰당 비용이 직접 절감되는 비용이 제한된 클라우드 엔드포인트에 채팅 모델을 배포합니다.
8비트 커널이 더 빠르고 더 시원하게 실행되는 기기 내 음성 또는 번역을 위한 압축 변환기 인코더
위험 및 가드레일
하나의 벤치마크를 최적화하면 더 광범위한 시스템 약점을 숨길 수 있습니다.
인프라 및 유지 관리 비용은 종종 과소평가됩니다.
시스템이 더욱 복잡해짐에 따라 보안 및 관찰 가능성의 격차가 커질 수 있습니다.
구현 로드맵
구현하기 전에 지연 시간, 품질, 비용 목표를 정의하세요.
현실적인 로드 및 데이터 조건에서 벤치마킹합니다.
오류, 드리프트 및 사용자 영향에 대한 계측기 모니터링.
확장하기 전에 롤백 및 사고 대응 경로를 준비하세요.
계속 탐색하세요
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
다음 가이드
활성화 조정 및 표현 엔지니어링
자주 묻는 질문
What is SmoothQuant and Activation Quantization?
SmoothQuant는 재교육 없이 가중치와 활성화 모두에 대해 대규모 언어 모델을 8비트 정수로 압축할 수 있는 기술입니다. 대형 모델의 활성화에는 일반적으로 정밀도가 낮은 수학을 망가뜨리는 극단적인 이상값이 포함되어 있고 SmoothQuant가 이를 길들이기 때문에 중요합니다.
SmoothQuant는 정밀도가 낮은 추론에서 구체적으로 어떤 문제를 해결합니까?
SmoothQuant는 특정 활성화 채널에 나타나는 큰 이상치 값을 목표로 합니다. 그렇지 않으면 활성화가 8비트로 양자화될 때 정확도가 떨어집니다.
SmoothQuant는 어떻게 활성화를 더 쉽게 양자화할 수 있도록 합니까?
활성화 채널을 채널별 스케일로 나누고 일치하는 가중치에 해당 스케일을 곱하므로 결과는 변경되지 않지만 두 텐서는 양자화하기가 더 쉬워집니다.
W8A8 표기법은 무엇을 의미합니까?
W8A8은 가중치(W)와 활성화(A) 모두에 대한 8비트 양자화를 나타내며, SmoothQuant 방식은 정확도 손실을 최소화하면서 가능합니다.
SmoothQuant의 스케일링이 본질적으로 런타임 오버헤드를 추가하지 않는 이유는 무엇입니까?
스무딩 스케일은 이전 레이어의 가중치 또는 융합된 작업에 미리 접혀 있으므로 추론 시 추가 계산이 발생하지 않습니다.
SmoothQuant에서 알파 하이퍼파라미터는 어떤 역할을 합니까?
알파(일반적으로 0.5)는 평활화 요소의 균형을 유지하여 양자화 난이도가 활성화에서 가중치로 이동되는 정도를 결정합니다.