Nyelvi AI ÚTMUTATÓ

QLoRA és 4 bites finomhangolás

A QLoRA egy olyan technika, amely lehetővé teszi egy hatalmas nyelvi modell finomhangolását egyetlen fogyasztói GPU-n úgy, hogy a fagyasztott modellt súlyonként mindössze 4 bitben tárolja.

2 perc olvasásUtoljára frissítve

Áttekintés

It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.

Mély merülés

Általában egy nagy modell finomhangolása azt jelenti, hogy minden súlyt 16 bites pontossággal kell betölteni, és mindegyiket frissíteni kell, ami óriási memóriát igényel. A QLoRA két ötletet egyesít. Először is lefagyasztja az előképzett modellt, és 4 bitre kvantálja, nagyjából négyszeresére csökkentve a memóriát. Másodszor, LoRA-t használ: az óriási súlymátrixok frissítése helyett apró, betanítható alacsony rangú adaptermátrixokat fecskendez melléjük, így csak néhány millió paraméter frissül. A 4 bites alap rögzített marad, míg a színátmenetek csak a kis adaptereken keresztül áramlanak. A Dettmers és munkatársai által 2023-ban bevezetett QLoRA megmutatta, hogy egy 65B modell egyetlen 48 GB-os GPU-n történő finomhangolása megfelel a teljes 16 bites finomhangolás minőségének.

Technikai betekintés

A QLoRA három trükköt mutatott be. Az NF4 (4 bites NormalFloat) a neurális súlyok haranggörbe eloszlására optimalizált adattípus, amely jobb pontosságot biztosít, mint a sima int4. A kettős kvantálás magát a kvantálási állandókat tömöríti, így extra memóriát takarít meg. A lapozható optimalizálók GPU-CPU egyesített memóriát használnak a kiugrások elnyelésére a hosszú sorozatok során, megakadályozva ezzel a kifogyott memória összeomlását. Az előre- és visszalépés során a 4 bites súlyokat a mátrix szorzása érdekében 16 bitesre dekvantálják, majd eldobják.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A QLoRA és a 4 bites finomhangolás jövője

A 4 bites finomhangolás bevett gyakorlattá vált, és a kutatás most még alacsonyabb pontosság felé törekszik, beleértve a 2 bites és az 1 bites (hármas) reprezentációkat is. Az újabb kvantálási sémák, mint például az AWQ, GPTQ és HQQ tovább finomítják a pontosságot, míg az olyan technikák, mint a QA-LoRA, arra törekszenek, hogy a modellt még az adapterek összevonása után is kvantáljuk. A nyitott súlyú modellek növekedésével elvárható, hogy az olyan szerszámok rutinszerűvé váljanak, amelyek lehetővé teszik a hobbibarátok 70B-plusz modellek finomhangolását egyetlen játék GPU-n, ami demokratizálja a testreszabást.

Valós megvalósítás

Egy induló vállalkozás finomhangolja a 70B Llama modellt egyetlen 48 GB-os GPU-n, hogy saját márkájú hangon ügyféltámogatási asszisztenst építsen anélkül, hogy szerverfürtöt bérelne.

Egy kutató egy fogyasztói RTX 4090-el egy nyitott modellt egyik napról a másikra adaptál egy szűk körű orvosi kérdések megválaszolására szolgáló adatkészlethez.

Egy fejlesztő több tucat kis, cserélhető LoRA-adaptert hoz létre különböző feladatokhoz, amelyek mindegyike megosztja a memóriába betöltött 4 bites alapmodellt.

A hobbibarátok az ingyenes Colab-minőségű hardver segítségével finomhangolják a modellt a személyes csevegési naplóikban, hogy utánozzák az adott írási stílust.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the QLoRA and 4-Bit Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Elutasítási mintavételi finomhangolás

Gyakran ismételt kérdések

What is QLoRA and 4-Bit Fine-Tuning?

A QLoRA egy olyan technika, amely lehetővé teszi egy hatalmas nyelvi modell finomhangolását egyetlen fogyasztói GPU-n úgy, hogy a fagyasztott modellt súlyonként mindössze 4 bitben tárolja. Lehetővé tette a 65B-s paraméterű modellek testreszabását olyan hardveren, amely korábban csak ennek a méretű modelleknek a töredékét tudta kezelni.

Mi az alapvető memóriatakarékossági ötlet a QLoRA „4 bites” része mögött?

A QLoRA a lefagyott előképzett súlyokat 4 bit értékben tárolja, ami nagyjából négyszeresére csökkenti a memóriát a 16 biteshez képest.

A QLoRA finomhangolása során mely paraméterek frissülnek ténylegesen a gradiens süllyedéssel?

Az alapmodell lefagyott; csak a beinjektált alacsony rangú adaptermátrixok kapnak gradiensfrissítést, ami a paramétereknek csak egy töredéke.

Mi az NF4 a QLoRA kontextusában?

Az NF4 (NormalFloat 4-bit) egy adattípus, amelyet a neurális hálózatok súlyainak haranggörbe eloszlása ​​köré terveztek a sima int4-nél jobb pontosság érdekében.

Milyen problémát oldanak meg a QLoRA-ban a „lapozott optimalizálók”?

A lapozható optimalizálók GPU-CPU egyesített memóriát használnak a memóriacsúcsok elnyelésére, megakadályozva a memóriakiesés összeomlását a hosszú bemeneteken végzett edzés során.

Mikor konvertálják vissza a 4 bites súlyokat nagyobb pontosságra az edzés során?

A 4 bites súlyokat menet közben 16 bites pontossággal dekvantálják minden mátrixszorzásnál, majd a nagyobb pontosságú másolatot kidobják a memória megtakarítása érdekében.