Műszaki ÚTMUTATÓ

GPTQ és AWQ edzés utáni kvantálás

A GPTQ és az AWQ a két vezető módszer a már betanított nyelvi modellek 4 bites pontosságra való zsugorítására, így olcsóbb, kisebb hardveren futnak.

2 perc olvasásUtoljára frissítve

Áttekintés

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Mély merülés

A tréning utáni kvantálás (PTQ) a kész modellt újraképzés nélkül tömöríti, nagy pontosságú súlyokat leképezve 4 bitre a memória nagyjából negyedére. A kihívás abban rejlik, hogy ezt a roncsolási pontosság nélkül tegyük. A GPTQ (az OBQ finomítása) rétegről rétegre kvantálja a súlyokat, egy kis kalibrációs adatkészletből származó másodrendű információkat használva a fennmaradó súlyok beállításához és az egyes kerekítési hibák kompenzálásához. Az AWQ (Activation-aware Weight Quantization) más szemszögből néz: megfigyeli, hogy a súlycsatornák egy kis része aránytalanul fontos, az aktiválási nagyságok alapján azonosítható, és védi ezeket a kiemelkedő csatornákat méretezéssel, nem pedig agresszív kvantálással. Mindkettő lehetővé teszi a Llama-hoz hasonló modellek 4 bites futtatását, és az olyan eszközök, mint a vLLM, llama.cpp és az AutoGPTQ, általánossá tették őket a helyi és költséghatékony következtetések érdekében.

Technikai betekintés

A GPTQ a Hess-féle (a veszteség görbülete) közelítését használja annak eldöntésére, hogy az egyik súly kerekítése hogyan tolja el a többit, minimalizálva a bevezetett hibát. Az AWQ teljesen kihagyja a hessenieket: csatornánkénti skálázási tényezőt számít ki, hogy a fontos súlycsatornák megőrizzék hatékony pontosságukat, majd egyenletesen kvantálja. Mindkettő nagyobb pontossággal tartja az aktiválásokat, és csak a súlyokat tömöríti, mivel a súlyok uralják a memóriát, míg az aktiválás kvantálása inkább rontja a pontosságot.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

A GPTQ és az AWQ edzés utáni kvantálás jövője

A kvantálás 4 bit alá tolja a 3 bites, 2 bites és vegyes pontosságú sémákat, gyakran ritkasággal kombinálva. Várható szorosabb kapcsolat a kiszolgáló motorokkal, hogy a kvantálás, a KV-gyorsítótár tömörítése és a spekulatív dekódolás együtt működjön. Az alacsony bites formátumok, például az NVFP4 és az MXFP4 hardveres támogatása fejlődik, és az automatizált eszközök egyre inkább rétegenkénti bitszélességet választanak. Az általános cél a majdnem veszteségmentes 4 bites (és alacsonyabb) alapértelmezés, így az erős modellek olcsón használhatók mindenhol.

Valós megvalósítás

Egy 70 milliárd paraméterű Llama modell futtatása egyetlen 24 GB-os fogyasztói GPU-n 4 bites GPTQ súlyozással.

Az AWQ-kvantizált modellek nagy átviteli sebességgel szolgáltak a vLLM-ben a költséghatékony gyártási API-k érdekében.

llama.cpp kvantált GGUF-súlyok használatával nyelvi modellek helyi futtatásához laptop CPU-n.

A Hugging Face AutoGPTQ és AutoAWQ könyvtárai lehetővé teszik a fejlesztők számára, hogy a letöltött modellt néhány sornyi kóddal kvantáljuk.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Befolyásolási függvények a képzési adatok hozzárendeléséhez

Gyakran ismételt kérdések

What is GPTQ and AWQ Post-Training Quantization?

A GPTQ és az AWQ a két vezető módszer a már betanított nyelvi modellek 4 bites pontosságra való zsugorítására, így olcsóbb, kisebb hardveren futnak. Ezért futtathat egy alkalmas modellt egyetlen fogyasztói GPU-n adatközponti rack helyett.

Mit jelent a „képzés utáni kvantálás”?

Az edzés utáni kvantálás csökkenti a kész modell súlyozásának pontosságát (például 4 bitre), anélkül, hogy a nulláról újra betanítaná.

Milyen információkat használ fel a GPTQ a kerekítési hibák kompenzálására a kvantálás során?

A GPTQ hozzávetőleges Hessian-t használ annak megértésére, hogy egy súly kvantálása hogyan befolyásolja a veszteséget, majd módosítja a fennmaradó súlyokat a kompenzáció érdekében.

Milyen kulcsfontosságú betekintés ösztönzi az AWQ-t (az aktiválás-tudatos súlykvantizálást)?

Az AWQ aktiválási nagyságrendekkel azonosítja a kiemelkedő súlycsatornákat, és skálázással védi őket, mivel néhány csatorna aránytalanul számít.

Körülbelül mennyi memóriát takarít meg a 4 bites kvantálás a 16 bites súlyokkal szemben?

A súlyonkénti 16 bitről 4 bitre való váltás körülbelül negyedére csökkenti a súlymemóriát, ami nagyjából 4-szeres csökkenést jelent.

Miért általában a GPTQ és az AWQ is számszerűsíti a súlyokat, de az aktiválásokat nagyobb pontossággal tartja?

A súlyok jelentik a fő memóriaköltséget, míg az aktiválások érzékenyebbek a precíziós veszteségre, így a csak súly szerinti kvantálás a gyakori édes pont.