量化
量化透過以較低精度儲存數字來縮小人工智慧模型,因此需要資料中心 GPU 的模型有時可以在筆記型電腦或手機上運行。
概述
It is the main trick that makes large language models cheap and fast enough to deploy widely.
深入探討
神經網路主要是一大堆稱為權重的數字,通常儲存為 16 位元或 32 位元浮點數值。量化使用更少的位元(通常是 8 位元 (INT8) 甚至 4 位元整數)來重新儲存這些權重。從 16 位元到 4 位元可將記憶體減少約四倍,因此 700 億個參數的型號在 16 位元時需要約 140GB,在 4 位元時可容納約 35GB。較小的數字在記憶體中的移動速度也更快,這通常會加快生成速度。問題在於準確度:將大範圍的值壓縮到幾個等級會引入舍入誤差。好的方法可以透過仔細選擇比例因子並保護最敏感的權重來最大限度地減少損失,因此模型在使用一小部分資源時表現幾乎相同。
技術洞察
每組權重都有一個比例因子,將實際值對應到一小組整數上;乘以比例即可近似重建原始數字。 GPTQ 和 AWQ 等訓練後量化方法會分析小型校準資料集,以確定哪些權重最重要,並設定比例以最小化輸出誤差,而不是盲目舍入所有內容。激活通常保持較高的精度,因為它們在運行時變化更大。結果是一個儲存 4 位元整數但計算結果非常接近全精度版本的模型。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
量化的未來
預計量化將成為預設而不是優化。硬體供應商正在添加原生 4 位甚至更低位支持,並且量化感知訓練等技術從一開始就將低精度的容差融入模型中,從而進一步減少精度損失。對 2 位元和 1 位元(二進位)表示形式的研究正在進行中,旨在在手機和嵌入式晶片上運行可用的模型。隨著設備上和私有人工智慧的發展,高效的量化模型將成為本地運行助手而不將資料發送到雲端的核心。
現實世界的實施
使用 4 位元 GGUF 或 GPTQ 檔案在消費者 GPU 上本地運行 Llama 等聊天模型,而不需要多個資料中心卡。
手機上的設備助手,其中 8 位元或 4 位元型號允許在沒有網路連線的情況下運行語音和文字功能。
透過提供 INT8 模型,在每個 GPU 上適應更多請求,降低客戶支援機器人的雲端推理成本。
智慧相機或物聯網感測器等邊緣設備在嚴格的記憶體限制內運行緊湊的量化視覺語言模型。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Quantization?
量化透過以較低精度儲存數字來縮小人工智慧模型,因此需要資料中心 GPU 的模型有時可以在筆記型電腦或手機上運行。這是使大型語言模型足夠便宜且足夠快以進行廣泛部署的主要技巧。
量化主要改變神經網路的什麼?
量化以較低的數值精確度重新儲存模型的權重,例如 8 位元或 4 位元整數,而不是 16 位元或 32 位元浮點數。
將權重從 16 位元移至 4 位元大約可以節省多少記憶體?
4 位是 16 位的四分之一,因此權重儲存下降到大約四分之一,大約減少了 4 倍。
激進量化的主要缺點是什麼?
以較少的等級表示值會引入舍入誤差,如果不仔細管理,可能會降低輸出品質。
GPTQ 和 AWQ 等方法使用小型校準資料集有何用途?
這些訓練後方法分析一些樣本輸入以設定比例因子並保護敏感權重,使輸出保持接近原始值。
為什麼量化通常會使模型更快,而不僅僅是更小?
較低精度的值需要較少的記憶體頻寬來載入和移動,這通常是生成過程中的瓶頸,因此推理速度會加快。