QLoRA és 4 bites finomhangolás
A QLoRA egy olyan technika, amely lehetővé teszi egy hatalmas nyelvi modell finomhangolását egyetlen fogyasztói GPU-n úgy, hogy a fagyasztott modellt súlyonként mindössze 4 bitben tárolja.
Áttekintés
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
Mély merülés
Általában egy nagy modell finomhangolása azt jelenti, hogy minden súlyt 16 bites pontossággal kell betölteni, és mindegyiket frissíteni kell, ami óriási memóriát igényel. A QLoRA két ötletet egyesít. Először is lefagyasztja az előképzett modellt, és 4 bitre kvantálja, nagyjából négyszeresére csökkentve a memóriát. Másodszor, LoRA-t használ: az óriási súlymátrixok frissítése helyett apró, betanítható alacsony rangú adaptermátrixokat fecskendez melléjük, így csak néhány millió paraméter frissül. A 4 bites alap rögzített marad, míg a színátmenetek csak a kis adaptereken keresztül áramlanak. A Dettmers és munkatársai által 2023-ban bevezetett QLoRA megmutatta, hogy egy 65B modell egyetlen 48 GB-os GPU-n történő finomhangolása megfelel a teljes 16 bites finomhangolás minőségének.
Technikai betekintés
A QLoRA három trükköt mutatott be. Az NF4 (4 bites NormalFloat) a neurális súlyok haranggörbe eloszlására optimalizált adattípus, amely jobb pontosságot biztosít, mint a sima int4. A kettős kvantálás magát a kvantálási állandókat tömöríti, így extra memóriát takarít meg. A lapozható optimalizálók GPU-CPU egyesített memóriát használnak a kiugrások elnyelésére a hosszú sorozatok során, megakadályozva ezzel a kifogyott memória összeomlását. Az előre- és visszalépés során a 4 bites súlyokat a mátrix szorzása érdekében 16 bitesre dekvantálják, majd eldobják.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A QLoRA és a 4 bites finomhangolás jövője
A 4 bites finomhangolás bevett gyakorlattá vált, és a kutatás most még alacsonyabb pontosság felé törekszik, beleértve a 2 bites és az 1 bites (hármas) reprezentációkat is. Az újabb kvantálási sémák, mint például az AWQ, GPTQ és HQQ tovább finomítják a pontosságot, míg az olyan technikák, mint a QA-LoRA, arra törekszenek, hogy a modellt még az adapterek összevonása után is kvantáljuk. A nyitott súlyú modellek növekedésével elvárható, hogy az olyan szerszámok rutinszerűvé váljanak, amelyek lehetővé teszik a hobbibarátok 70B-plusz modellek finomhangolását egyetlen játék GPU-n, ami demokratizálja a testreszabást.
Valós megvalósítás
Egy induló vállalkozás finomhangolja a 70B Llama modellt egyetlen 48 GB-os GPU-n, hogy saját márkájú hangon ügyféltámogatási asszisztenst építsen anélkül, hogy szerverfürtöt bérelne.
Egy kutató egy fogyasztói RTX 4090-el egy nyitott modellt egyik napról a másikra adaptál egy szűk körű orvosi kérdések megválaszolására szolgáló adatkészlethez.
Egy fejlesztő több tucat kis, cserélhető LoRA-adaptert hoz létre különböző feladatokhoz, amelyek mindegyike megosztja a memóriába betöltött 4 bites alapmodellt.
A hobbibarátok az ingyenes Colab-minőségű hardver segítségével finomhangolják a modellt a személyes csevegési naplóikban, hogy utánozzák az adott írási stílust.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Elutasítási mintavételi finomhangolás
Gyakran ismételt kérdések
What is QLoRA and 4-Bit Fine-Tuning?
A QLoRA egy olyan technika, amely lehetővé teszi egy hatalmas nyelvi modell finomhangolását egyetlen fogyasztói GPU-n úgy, hogy a fagyasztott modellt súlyonként mindössze 4 bitben tárolja. Lehetővé tette a 65B-s paraméterű modellek testreszabását olyan hardveren, amely korábban csak ennek a méretű modelleknek a töredékét tudta kezelni.
Mi az alapvető memóriatakarékossági ötlet a QLoRA „4 bites” része mögött?
A QLoRA a lefagyott előképzett súlyokat 4 bit értékben tárolja, ami nagyjából négyszeresére csökkenti a memóriát a 16 biteshez képest.
A QLoRA finomhangolása során mely paraméterek frissülnek ténylegesen a gradiens süllyedéssel?
Az alapmodell lefagyott; csak a beinjektált alacsony rangú adaptermátrixok kapnak gradiensfrissítést, ami a paramétereknek csak egy töredéke.
Mi az NF4 a QLoRA kontextusában?
Az NF4 (NormalFloat 4-bit) egy adattípus, amelyet a neurális hálózatok súlyainak haranggörbe eloszlása köré terveztek a sima int4-nél jobb pontosság érdekében.
Milyen problémát oldanak meg a QLoRA-ban a „lapozott optimalizálók”?
A lapozható optimalizálók GPU-CPU egyesített memóriát használnak a memóriacsúcsok elnyelésére, megakadályozva a memóriakiesés összeomlását a hosszú bemeneteken végzett edzés során.
Mikor konvertálják vissza a 4 bites súlyokat nagyobb pontosságra az edzés során?
A 4 bites súlyokat menet közben 16 bites pontossággal dekvantálják minden mátrixszorzásnál, majd a nagyobb pontosságú másolatot kidobják a memória megtakarítása érdekében.