Технічний КЕРІВНИЦТВО

Квантування GPTQ і AWQ після навчання

GPTQ і AWQ є двома провідними методами для скорочення вже навчених мовних моделей до 4-бітної точності, щоб вони працювали на дешевшому, меншому обладнанні.

2 хвилини читанняОстаннє оновлення

Огляд

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Глибоке занурення

Квантування після навчання (PTQ) стискає готову модель без її повторного навчання, відображаючи високоточні ваги до 4 бітів, щоб приблизно четвертувати пам’ять. Завдання полягає в тому, щоб зробити це без руйнування точності. GPTQ (удосконалення OBQ) квантує ваги шар за шаром, використовуючи інформацію другого порядку з невеликого набору даних калібрування для коригування решти ваг і компенсації кожної помилки округлення. AWQ (квантування ваги з урахуванням активації) має іншу точку зору: вона помічає, що невелика частка вагових каналів є непропорційно важливою, визначеною за величинами активації, і захищає ці основні канали шляхом масштабування, а не агресивного квантування. Обидва дозволяють таким моделям, як Llama, працювати в 4-розрядному режимі, а такі інструменти, як vLLM, llama.cpp і AutoGPTQ, зробили їх основними для локального та економічно ефективного висновку.

Технічне розуміння

GPTQ використовує наближення Гессе (кривизна втрати), щоб вирішити, як округлення однієї ваги має підштовхнути інші, мінімізуючи внесену помилку. AWQ повністю пропускає Hessians: він обчислює коефіцієнт масштабування для кожного каналу, щоб важливі вагові канали зберігали свою ефективну точність, а потім рівномірно квантує. Обидва зберігають активації з високою точністю та лише стискають ваги, оскільки ваги домінують у пам’яті, тоді як квантування активації має тенденцію більше шкодити точності.

Стратегічний вплив

Вартість і бюджет

Архітектурні рішення збільшують продуктивність і експлуатаційні витрати протягом багатьох років.

Чіткіші рішення

Технічна освіта допомагає командам вибрати правильний стек, а не лише найновіший.

Контроль якості

Кращий інженерний вибір зменшує проблеми з надійністю у виробництві.

Майбутнє квантування після навчання GPTQ і AWQ

Квантування підштовхує нижче 4 бітів до 3-бітних, 2-бітових і схем змішаної точності, часто в поєднанні з розрідженістю. Очікуйте більш тісного зв’язку з обслуговуючими механізмами, щоб квантування, стиснення KV-кешу та спекулятивне декодування працювали разом. Апаратна підтримка низькорозрядних форматів, таких як NVFP4 і MXFP4, розвивається, і автоматизовані інструменти все частіше вибиратимуть бітову ширину для кожного шару. Загальна мета — 4-бітний (і нижчий) майже без втрат за замовчуванням, що робить потужні моделі дешевими для обслуговування всюди.

Реалізація в реальному світі

Запуск моделі Llama із 70 мільярдами параметрів на одному споживчому графічному процесорі ємністю 24 ГБ із використанням 4-бітових ваг GPTQ.

AWQ-квантовані моделі обслуговуються з високою пропускною здатністю у vLLM для економічно ефективних виробничих API.

llama.cpp використовує квантовані ваги GGUF для запуску мовних моделей локально на процесорі ноутбука.

Бібліотеки AutoGPTQ і AutoAWQ Hugging Face дозволяють розробникам квантувати завантажену модель у кількох рядках коду.

Ризики та огорожі

Оптимізація одного тесту може приховати ширші слабкі сторони системи.

Витрати на інфраструктуру та обслуговування часто недооцінюються.

Прогалини в безпеці та спостережуваності можуть зростати в міру ускладнення систем.

Дорожня карта впровадження

1

Визначте цільові показники затримки, якості та вартості перед впровадженням.

2

Тест за реалістичних умов навантаження та даних.

3

Моніторинг інструментів на наявність помилок, дрейфу та впливу користувача.

4

Перед масштабуванням підготуйте шляхи відкату та реагування на інциденти.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Функції впливу для навчання атрибуції даних

Часті запитання

What is GPTQ and AWQ Post-Training Quantization?

GPTQ і AWQ є двома провідними методами для скорочення вже навчених мовних моделей до 4-бітної точності, щоб вони працювали на дешевшому, меншому обладнанні. Саме тому ви можете запускати продуктивну модель на одному споживацькому GPU замість стійки центру обробки даних.

Що означає «квантування після навчання»?

Квантування після навчання знижує точність ваг готової моделі (наприклад, до 4 біт) без повторного навчання з нуля.

Яку інформацію використовує GPTQ для компенсації помилок округлення під час квантування?

GPTQ використовує приблизний Гессе, щоб зрозуміти, як квантування однієї ваги впливає на втрату, а потім коригує інші ваги для компенсації.

Яке ключове розуміння керує AWQ (квантування ваги з урахуванням активації)?

AWQ визначає основні вагові канали за допомогою величин активації та захищає їх за допомогою масштабування, оскільки кілька каналів мають непропорційне значення.

Приблизно скільки пам’яті зберігає 4-бітне квантування порівняно з 16-бітними вагами?

Перехід від 16 біт до 4 біт на вагу скорочує вагу пам’яті приблизно на чверть, приблизно в 4 рази.

Чому і GPTQ, і AWQ зазвичай квантують ваги, але зберігають активації з вищою точністю?

Вагові коефіцієнти є основною витратою пам’яті, тоді як активації більш чутливі до втрати точності, тому квантування лише за вагою є загальною перевагою.