QLoRA и 4-битова фина настройка
QLoRA е техника, която ви позволява да настроите фино масивен езиков модел на един потребителски GPU, като съхранявате замразения модел само в 4 бита на тегло.
Преглед
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
Дълбоко гмуркане
Обикновено фината настройка на голям модел означава зареждане на всяко тегло с 16-битова точност и актуализиране на всички, което изисква огромна памет. QLoRA съчетава две идеи. Първо, той замразява предварително обучения модел и го квантува до 4 бита, намалявайки паметта приблизително четири пъти. Второ, той използва LoRA: вместо да актуализира гигантските матрици за тегло, той инжектира малки обучаеми адаптерни матрици с нисък ранг заедно с тях, така че само няколко милиона параметъра се актуализират. 4-битовата основа остава фиксирана, докато градиентите протичат само през малките адаптери. Представена през 2023 г. от Dettmers и колеги, QLoRA показа, че фината настройка на модел 65B на един 48GB GPU може да достигне качеството на пълната 16-битова фина настройка.
Техническа информация
QLoRA представи три трика. NF4 (4-bit NormalFloat) е тип данни, оптимизиран за разпределение на невронни тегла по камбанообразна крива, което дава по-добра точност от обикновения int4. Двойното квантуване компресира самите константи на квантуване, спестявайки допълнителна памет. Странираните оптимизатори използват унифицирана памет GPU-CPU, за да абсорбират пикове по време на дълги последователности, предотвратявайки сривове при недостиг на памет. По време на преминаването напред и назад 4-битовите тегла се деквантуват до 16-битови точно навреме за умножението на матрицата, след което се отхвърлят.
Стратегическо въздействие
Speed and scale
Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.
Access and reach
Той разширява достъпа между езици и стилове на комуникация.
Clearer decisions
Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.
Бъдещето на QLoRA и 4-битовата фина настройка
4-битовата фина настройка се превърна в стандартна практика и сега изследванията се насочват към още по-ниска прецизност, включително 2-битови и 1-битови (троични) представяния. По-новите схеми за квантуване като AWQ, GPTQ и HQQ усъвършенстват допълнително точността, докато техники като QA-LoRA имат за цел да запазят модела квантован дори след сливане на адаптери. Тъй като моделите с отворено тегло растат, очаквайте инструменти, които позволяват на любителите да прецизират моделите 70B-plus на един GPU за игри, за да се превърнат в рутинна, демократизираща персонализация.
Внедряване в реалния свят
Стартираща компания настройва фино модел 70B Llama на единичен 48GB GPU, за да изгради асистент за поддръжка на клиенти в собствената си марка, без да наема сървърен клъстер.
Изследовател с един потребителски RTX 4090 за една нощ адаптира отворен модел към нишов набор от данни за медицински въпроси.
Разработчикът създава десетки малки, сменяеми LoRA адаптери за различни задачи, като всички споделят един 4-битов базов модел, зареден в паметта.
Любител настройва фино модел в личните си дневници за чат, за да имитира определен стил на писане, използвайки безплатен хардуер от клас Colab.
Рискове и предпазни огради
Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.
Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.
Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.
Пътна карта за изпълнение
Определете изходен формат, тон и стандарти за качество преди внедряване.
Наземни отговори с доверени източници винаги, когато точността има значение.
Поддържайте контролна точка за човешки преглед за изходи с високи залози.
Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Фина настройка на извадката за отхвърляне
Frequently asked questions
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA е техника, която ви позволява да настроите фино масивен езиков модел на един потребителски GPU, като съхранявате замразения модел само в 4 бита на тегло. Това направи възможно персонализирането на модели с 65B-параметър на хардуер, който преди можеше да обработва само модели с малка част от този размер.
Каква е основната идея за спестяване на памет зад „4-битовата“ част на QLoRA?
QLoRA съхранява замразените предварително обучени тегла при 4 бита на стойност, намалявайки паметта приблизително четири пъти в сравнение с 16-битовата.
По време на фината настройка на QLoRA кои параметри всъщност се актуализират чрез градиентно спускане?
Базовият модел е замразен; само инжектираните адаптерни матрици с нисък ранг получават градиентни актуализации, което е само малка част от параметрите.
Какво е NF4 в контекста на QLoRA?
NF4 (NormalFloat 4-bit) е тип данни, проектиран около разпределението на камбанообразната крива на теглата на невронната мрежа за по-добра точност от обикновения int4.
Какъв проблем решават „оптимизаторите за страници“ в QLoRA?
Странираните оптимизатори използват унифицирана памет GPU-CPU, за да абсорбират пикове на паметта, предотвратявайки сривове при недостиг на памет по време на обучение при дълги входове.
Кога 4-битовите тегла се преобразуват обратно в по-висока точност по време на тренировка?
4-битовите тегла се деквантуват до 16-битова точност в движение за всяко умножение на матрица, след което копието с по-висока точност се изхвърля, за да се спести памет.