GPTQ 和 AWQ 訓練後量化
GPTQ 和 AWQ 是將已訓練的語言模型縮小到 4 位元精確度的兩種領先方法,以便它們在更便宜、更小的硬體上運行。
概述
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
深入探討
訓練後量化 (PTQ) 無需重新訓練即可壓縮完成的模型,將高精度權重映射至 4 位,大約佔用四分之一的記憶體。挑戰在於在不破壞準確性的情況下做到這一點。 GPTQ(OBQ 的改進)逐層量化權重,使用來自小型校準資料集的二階資訊來調整剩餘權重並補償每個舍入誤差。 AWQ(激活感知權重量化)採取不同的角度:它觀察到一小部分權重通道異常重要,透過查看激活幅度來識別,並透過縮放而不是積極量化它們來保護這些顯著通道。兩者都允許像 Llama 這樣的模型以 4 位元運行,而 vLLM、llama.cpp 和 AutoGPTQ 等工具使它們成為本地且經濟高效的推理的主流。
技術洞察
GPTQ 使用 Hessian 矩陣(損失曲率)的近似值來決定如何捨入一個權重來推動其他權重,從而最大限度地減少引入的誤差。 AWQ 完全跳過 Hessians:它計算每個通道的縮放因子,以便重要的權重通道保持其有效精度,然後統一量化。兩者都使激活保持更高的精度,並且只壓縮權重,因為權重主導內存,而激活量化往往會更大程度地損害準確性。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
GPTQ 與 AWQ 訓練後量化的未來
量化正在將 4 位元以下推向 3 位元、2 位元和混合精度方案,通常與稀疏性相結合。期望與服務引擎更緊密地耦合,以便量化、KV 快取壓縮和推測解碼一起工作。對 NVFP4 和 MXFP4 等低位格式的硬體支援正在成熟,自動化工具將越來越多地選擇每層位寬度。總體目標是將近乎無損的 4 位元(及更低位元)作為預設值,使強大的模型能夠廉價地服務於任何地方。
現實世界的實施
使用 4 位元 GPTQ 權重在單一 24 GB 消費級 GPU 上運行 700 億參數的 Llama 模型。
AWQ 量化模型在 vLLM 中以高吞吐量提供服務,以實現經濟高效的生產 API。
llama.cpp 使用量化的 GGUF 權重在筆記型電腦 CPU 上本地運行語言模型。
Hugging Face 的 AutoGPTQ 和 AutoAWQ 函式庫讓開發人員可以用幾行程式碼量化下載的模型。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is GPTQ and AWQ Post-Training Quantization?
GPTQ 和 AWQ 是將已訓練的語言模型縮小到 4 位元精確度的兩種領先方法,以便它們在更便宜、更小的硬體上運行。這就是為什麼您可以在單一消費級 GPU 而不是資料中心機架上運行功能強大的模型。
「訓練後量化」是什麼意思?
訓練後量化會降低最終模型權重的精確度(例如,降低到 4 位元),而無需從頭開始重新訓練。
GPTQ 量化時使用哪些資訊來補償舍入誤差?
GPTQ 使用近似 Hessian 矩陣來了解量化一個權重如何影響損失,然後調整剩餘權重進行補償。
哪些關鍵洞見推動了 AWQ(啟動感知權重量化)?
AWQ 使用激活幅度識別顯著權重通道,並透過縮放來保護它們,因為少數通道的重要性不成比例。
與 16 位元權重相比,4 位元量化大約可以節省多少記憶體?
每個權重從 16 位變為 4 位,將權重記憶體減少到大約四分之一,大約減少了 4 倍。
為什麼 GPTQ 和 AWQ 通常都會量化權重但保持激活精度更高?
權重是主要的記憶體成本,而活化對精確度損失更敏感,因此僅權重量化是常見的最佳點。