模型量化
模型量化透過將數字儲存在更少的位元中來縮小神經網絡,因此相同的模型可以在更小的硬體上運行得更快。
概述
這也是大型模型能裝在單一 GPU、筆電甚至手機上的主要原因。
深入探討
經過訓練的模型通常將每個權重儲存為 32 位元或 16 位元浮點數。量化取代了 8 位元整數 (INT8) 或 4 位元值 (INT4) 等低精度格式,從而將記憶體節省了大約 4 到 8 倍。一個 700 億參數的模型在 16 位元下需要約 140GB,在 4 位元下則需要約 35GB,適合一個消費級 GPU。問題在於準確性:將大範圍的值壓縮到 256 或 16 個桶中會丟失細節。 GPTQ、AWQ 和 QLoRA 中使用的 NF4 格式等現代方法選擇智慧縮放因子並保護最敏感的權重,因此品質損失通常很小。量化是 llama.cpp 和 Ollama 等工具無需資料中心即可在本地運行強大模型的原因。
技術洞察
量化使用標度和零點將實數值對應到小整數網格:stored_int = round(value / scale) + Zero_point。選擇好尺度就是整個遊戲的關鍵。每個通道或每組縮放為權重矩陣的切片保留單獨的縮放,從而在重要的地方保持精度。訓練後量化只是轉換完成的模型,而量化感知訓練會在訓練期間模擬舍入,以便網路學會容忍它,通常會提供更好的低位精度。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
模型量化的未來
預計越來越低的精度將成為常態。研究正在推動可靠的 4 位、2 位甚至二進位權重,以及保持敏感層更高的混合精度方案。硬體如下:GPU 和手機晶片現在包含原生 INT8、INT4 和 FP8 數學單元。 FP8 和 MXFP4 等格式旨在將浮點數的範圍與整數的大小結合。與 QLoRA 等技術相結合,量化將持續降低前沿模型在日常設備上運行和微調的成本。
現實世界的實施
使用 llama.cpp 或使用 4 位元 GGUF 檔案的 Ollama 在筆記型電腦上運行 7B 或 13B Llama 模型。
QLoRA 透過將基本權重凍結在 4 位元 NF4 中來微調單一 GPU 上的大型模型。
在具有設備運行時的手機上部署 INT8 模型,以便助手可以離線且私密地工作。
為更便宜的 API 端點提供服務,其中 INT8/FP8 量化使吞吐量大致翻倍並降低記憶體成本。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是模型量化?
模型量化透過將數字儲存在更少的位元中來縮小神經網絡,因此相同的模型可以在更小的硬體上運行得更快。這是大型車型可以安裝在單一 GPU、筆記型電腦甚至手機上的主要原因。
模型量化主要改變神經網路的什麼?
量化以更少的位元儲存相同的參數(例如 INT8 或 INT4,而不是 16 位元或 32 位元浮點數),從而減少記憶體並加快數學運算速度。
將模型從 16 位元轉換為 4 位元大約可以節省多少記憶體?
從每個權重 16 位元變為 4 位,儲存空間減少了約四倍,這就是為什麼大型型號可以安裝在單一 GPU 上的原因。
激進的低位量化的主要缺點是什麼?
將廣泛的值映射到幾個離散的級別會失去細節,這會降低質量,除非智慧縮放可以保護敏感權重。
量化感知訓練與訓練後量化有何不同?
量化感知訓練將舍入誤差建構到訓練循環中,因此網路可以適應並通常在低位寬下保持更高的準確性。
哪種技術使用 4 位元量化來在一個 GPU 上實現大型模型的微調?
QLoRA 將基本模型保持在 4 位元 NF4 格式並訓練小型適配器權重,從而使大型模型可以在適度的硬體上進行微調。