Nyelvi AI ÚTMUTATÓ

Kvantálás

A kvantálás csökkenti az AI-modellt azáltal, hogy kisebb pontossággal tárolja a számokat, így az adatközponti GPU-t igénylő modellek néha laptopon vagy telefonon is futhatnak.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the main trick that makes large language models cheap and fast enough to deploy widely.

Mély merülés

A neurális hálózat többnyire egy hatalmas számhalmaz, amelyet súlyoknak neveznek, és amelyeket általában 16 vagy 32 bites lebegőpontos értékként tárolnak. A kvantálás újratárolja ezeket a súlyokat kevesebb bittel, általában 8 bites (INT8) vagy akár 4 bites egész számokkal. A 16 bitesről a 4 bitesre való átállás nagyjából négyszeresére csökkenti a memóriát, így egy 70 milliárdos paraméterű modellben, amelynek 16 bitesnél körülbelül 140 GB-ra van szüksége, nagyjából 35 GB fér el 4 bitesnél. Kisebb számok is gyorsabban mozognak a memóriában, ami általában felgyorsítja a generálást. A lényeg a pontosságban rejlik: az értékek széles tartományának néhány szintre szorítása kerekítési hibát okoz. A jó módszerek minimalizálják ezt a veszteséget azáltal, hogy gondosan választják meg a skálázási tényezőket és védik a legérzékenyebb súlyokat, így a modell az erőforrások töredékét használva szinte azonosan viselkedik.

Technikai betekintés

Minden súlycsoport kap egy léptéktényezőt, amely a valós értékeket egész számok kis halmazára képezi le; a skálával való visszaszorzás megközelítőleg rekonstruálja az eredeti számot. A képzés utáni kvantálási módszerek, például a GPTQ és az AWQ egy kis kalibrációs adatkészletet elemeznek, hogy eldöntsék, melyik súlyok számítanak leginkább, és skálákat állítanak be a kimeneti hiba minimalizálása érdekében, ahelyett, hogy mindent vakon kerekítenek. Az aktiválásokat gyakran nagyobb pontossággal tartják, mert futás közben jobban változnak. Az eredmény egy olyan modell, amely 4 bites egész számokat tárol, de a teljes precíziós verzióhoz rendkívül közeli eredményeket számít ki.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A kvantálás jövője

Várhatóan a kvantálás lesz az alapértelmezett, nem pedig az optimalizálás. A hardvergyártók natív 4 bites és még alacsonyabb bites támogatást, valamint olyan technikákat adnak hozzá, mint a kvantálás-tudatos képzés, az alacsony pontosság érdekében a kezdetektől fogva, tovább csökkentve a pontosságveszteséget. A 2-bites és az 1-bites (bináris) reprezentációk kutatása aktív, célja a telefonokon és a beágyazott chipeken való megfelelő modellek futtatása. Az eszközön lévő és a privát mesterségesintelligencia növekedésével a hatékony kvantált modellek központi szerepet fognak játszani az asszisztensek helyben történő futtatásában anélkül, hogy adatokat küldenének a felhőbe.

Valós megvalósítás

A Llama-hoz hasonló csevegési modell helyi futtatása fogyasztói GPU-n 4 bites GGUF- vagy GPTQ-fájlok használatával, ahelyett, hogy több adatközponti kártyára lenne szüksége.

Eszközön található asszisztensek telefonokon, ahol a 8 vagy 4 bites modellek hálózati kapcsolat nélkül is lehetővé teszik a beszéd- és szövegfunkciók futtatását.

Csökkentse az ügyfélszolgálati robotok felhőkövetkeztetési költségeit az INT8 modell kiszolgálásával, és több kérést illeszt minden egyes GPU-ra.

Edge eszközök, például intelligens kamerák vagy IoT-érzékelők, amelyek kompakt kvantált képi nyelvű modelleket futtatnak szűk memóriakorlátokon belül.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Maradék vektor kvantálás

Gyakran ismételt kérdések

What is Quantization?

A kvantálás csökkenti az AI-modellt azáltal, hogy kisebb pontossággal tárolja a számokat, így az adatközponti GPU-t igénylő modellek néha laptopon vagy telefonon is futhatnak. Ez a fő trükk, amely a nagy nyelvi modelleket olcsóvá és elég gyorssá teszi a széles körben történő bevezetéshez.

Mit változtat meg elsősorban a kvantálás egy neurális hálózaton?

A kvantálás a modell súlyait alacsonyabb numerikus pontossággal tárolja, például 8 bites vagy 4 bites egész számokat a 16 vagy 32 bites lebegés helyett.

Körülbelül mennyi memóriát takarít meg a súlyok 16 bitről 4 bitesre való áthelyezése?

A 4 bit a 16 bit egynegyede, így a súlytárolás nagyjából a negyedére csökken, ami körülbelül 4-szeres csökkenést jelent.

Mi az agresszív kvantálás fő hátránya?

Az értékek kevesebb szinttel való megjelenítése kerekítési hibát okoz, amely ronthatja a kimeneti minőséget, ha nem kezelik gondosan.

Mire használnak olyan módszerek, mint a GPTQ és az AWQ egy kis kalibrációs adatkészletet?

Ezek az edzés utáni módszerek néhány minta bemenetet elemeznek a skálázási tényezők beállításához és az érzékeny súlyok védelméhez, miközben a kimeneteket az eredetihez közel tartják.

Miért teszi a kvantálás gyakran gyorsabbá a modellt, nem csak kisebbé?

A kisebb pontosságú értékek kevesebb memória sávszélességet igényelnek a betöltéshez és mozgatáshoz, ami gyakran a szűk keresztmetszet a generálás során, így felgyorsul a következtetés.