Мова AI GUIDE

QLoRA і 4-бітне тонке налаштування

QLoRA — це техніка, яка дозволяє точніше налаштувати масивну мовну модель на одному споживчому графічному процесорі, зберігаючи заморожену модель лише в 4 бітах на вагу.

2 хвилини читанняОстаннє оновлення

Огляд

It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.

Глибоке занурення

Зазвичай тонке налаштування великої моделі означає завантаження кожної ваги з 16-бітною точністю та їхнє оновлення всіх, що потребує величезної пам’яті. QLoRA поєднує дві ідеї. По-перше, він заморожує попередньо підготовлену модель і квантує її до 4 бітів, скорочуючи пам’ять приблизно в чотири рази. По-друге, він використовує LoRA: замість того, щоб оновлювати гігантські вагові матриці, він вставляє поряд з ними крихітні адаптерні матриці низького рангу, які можна навчити, тому оновлюється лише кілька мільйонів параметрів. 4-розрядна основа залишається фіксованою, а градієнти проходять лише через маленькі адаптери. QLoRA, представлений у 2023 році Деттмерсом та його колегами, показав, що точне налаштування моделі 65B на одному графічному процесорі 48 ГБ може відповідати якості повного 16-бітного тонкого налаштування.

Технічне розуміння

QLoRA представила три прийоми. NF4 (4-bit NormalFloat) — це тип даних, оптимізований для розподілу нейронних ваг у формі дзвона, що забезпечує кращу точність, ніж звичайний int4. Подвійне квантування стискає самі константи квантування, зберігаючи додаткову пам’ять. Странічні оптимізатори використовують уніфіковану пам’ять GPU-CPU для поглинання стрибків під час довгих послідовностей, запобігаючи збоям через нестачу пам’яті. Під час прямого та зворотного проходу 4-бітні вагові коефіцієнти деквантуються до 16-бітних точно вчасно для множення матриці, а потім відкидаються.

Стратегічний вплив

Швидкість і масштаб

Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.

Доступ і охоплення

Це розширює доступ до різних мов і стилів спілкування.

Чіткіші рішення

Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.

Майбутнє QLoRA і 4-Bit Fine-Tuning

4-бітове точне налаштування стало стандартною практикою, і тепер дослідження підштовхують до ще нижчої точності, включаючи 2-бітове та 1-бітне (трійкове) представлення. Новіші схеми квантування, такі як AWQ, GPTQ і HQQ, ще більше покращують точність, тоді як методи, такі як QA-LoRA, спрямовані на те, щоб модель залишалася квантованою навіть після об’єднання адаптерів. Оскільки відкриті моделі зростають, очікуйте, що інструменти, які дозволять любителям точно налаштовувати моделі 70B-plus на одному ігровому графічному процесорі, стануть рутинною демократизацією налаштування.

Реалізація в реальному світі

Стартап налаштовує модель 70B Llama на одному графічному процесорі 48 ГБ, щоб побудувати помічника служби підтримки клієнтів, що відповідає голосу власного бренду, не орендуючи кластер серверів.

Дослідник з одним споживчим RTX 4090 за одну ніч адаптує відкриту модель до нішевого набору даних із відповідями на медичні запитання.

Розробник створює десятки невеликих змінних адаптерів LoRA для різних завдань, усі мають одну 4-розрядну базову модель, завантажену в пам’ять.

Любитель налаштовує модель у своїх особистих журналах чату, щоб імітувати певний стиль написання, використовуючи безкоштовне обладнання рівня Colab.

Ризики та огорожі

Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.

Делікатність підказок може створити суперечливі результати для подібних запитів.

Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.

Дорожня карта впровадження

1

Визначте вихідний формат, тон і стандарти якості перед розгортанням.

2

Якщо точність має значення, зв’яжіться з надійними джерелами.

3

Тримайте контрольну точку перевірки людьми для отримання високих ставок.

4

Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the QLoRA and 4-Bit Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Тонка настройка вибірки відхилення

Часті запитання

What is QLoRA and 4-Bit Fine-Tuning?

QLoRA — це техніка, яка дозволяє точніше налаштувати масивну мовну модель на одному споживчому графічному процесорі, зберігаючи заморожену модель лише в 4 бітах на вагу. Це дозволило налаштовувати моделі з параметрами 65B на апаратному забезпеченні, яке раніше могло працювати лише з моделями невеликого розміру.

Яка основна ідея економії пам’яті стоїть за «4-розрядною» частиною QLoRA?

QLoRA зберігає заморожені попередньо підготовлені ваги з 4 бітами на значення, скорочуючи пам’ять приблизно вчетверо порівняно з 16-бітами.

Під час тонкого налаштування QLoRA, які параметри фактично оновлюються градієнтним спуском?

Базова модель заморожена; лише впроваджені низькорангові адаптерні матриці отримують градієнтні оновлення, що становить лише крихітну частку параметрів.

Що таке NF4 у контексті QLoRA?

NF4 (NormalFloat 4-bit) — це тип даних, розроблений на основі дзвоноподібної кривої розподілу ваг нейронної мережі для кращої точності, ніж звичайний int4.

Яку проблему вирішують «сторінкові оптимізатори» в QLoRA?

Странічні оптимізатори використовують уніфіковану пам’ять GPU-CPU для поглинання стрибків пам’яті, запобігаючи збоям у зв’язку з нестачею пам’яті під час навчання на довгих введеннях.

Коли 4-бітні вагові коефіцієнти повертаються до вищої точності під час навчання?

4-бітні ваги деквантуються до 16-бітної точності на льоту для кожного множення матриці, потім копія з вищою точністю викидається для збереження пам’яті.