Техническо РЪКОВОДСТВО

GPTQ и AWQ Квантоване след обучение

GPTQ и AWQ са два водещи метода за свиване на вече обучени езикови модели до 4-битова точност, така че да работят на по-евтин, по-малък хардуер.

2 min readПоследна актуализация

Преглед

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Дълбоко гмуркане

Квантуването след обучение (PTQ) компресира завършен модел, без да го преобучава, картографирайки високопрецизни тегла до 4 бита, за да намалят паметта приблизително на четвърт. Предизвикателството е да направите това, без да нарушавате точността. GPTQ (усъвършенстване на OBQ) квантува теглата слой по слой, като използва информация от втори ред от малък набор от данни за калибриране, за да коригира останалите тегла и да компенсира всяка грешка при закръгляване. AWQ (Activation-aware Weight Quantization) приема различен ъгъл: той забелязва, че малка част от каналите за тегло са непропорционално важни, идентифицирани чрез разглеждане на величините на активиране, и защитава тези изпъкнали канали чрез мащабиране, вместо да ги квантува агресивно. И двете позволяват на модели като Llama да работят в 4-битов режим, а инструменти като vLLM, llama.cpp и AutoGPTQ ги превърнаха в масови за локални и рентабилни изводи.

Техническа информация

GPTQ използва приближение на Hessian (кривината на загубата), за да реши как закръгляването на една тежест трябва да подтикне останалите, минимизирайки въведената грешка. AWQ пропуска напълно Hessians: той изчислява коефициент на мащабиране за канал, така че важните канали за тегло да запазят ефективната си прецизност, след което квантува равномерно. И двете поддържат активациите с по-висока прецизност и компресират само тегла, тъй като теглата доминират в паметта, докато квантуването при активиране има тенденция да вреди повече на точността.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на GPTQ и AWQ квантуване след обучение

Квантуването натиска под 4 бита към 3-битови, 2-битови и схеми със смесена точност, често съчетани с рядкост. Очаквайте по-тясно свързване с обслужващи машини, така че квантуването, KV-кеш компресията и спекулативното декодиране да работят заедно. Хардуерната поддръжка за нискобитови формати като NVFP4 и MXFP4 се развива и автоматизираните инструменти все повече ще избират битови ширини на слой. Общата цел е почти без загуби 4-битови (и по-ниски) като стандарт, което прави силните модели евтини за обслужване навсякъде.

Внедряване в реалния свят

Изпълнение на Llama модел със 70 милиарда параметъра на един 24 GB потребителски графичен процесор, използвайки 4-битови GPTQ тегла.

AWQ-квантувани модели, обслужвани при висока производителност във vLLM за рентабилни производствени API.

llama.cpp, използващ квантувани тегла на GGUF за изпълнение на езикови модели локално на процесор на лаптоп.

Библиотеките AutoGPTQ и AutoAWQ на Hugging Face позволяват на разработчиците да квантуват изтеглен модел в няколко реда код.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Функции за влияние за приписване на данни за обучение

Frequently asked questions

What is GPTQ and AWQ Post-Training Quantization?

GPTQ и AWQ са два водещи метода за свиване на вече обучени езикови модели до 4-битова точност, така че да работят на по-евтин, по-малък хардуер. Те са причината, поради която можете да стартирате способен модел на един потребителски графичен процесор, вместо на шкаф за център за данни.

Какво означава „квантуване след обучение“?

Квантуването след обучение намалява прецизността на теглата на готовия модел (например до 4 бита), без да го обучава отново от нулата.

Каква информация използва GPTQ, за да компенсира грешките при закръгляване при квантуване?

GPTQ използва приблизителен Хесиан, за да разбере как квантуването на едно тегло влияе на загубата, след което коригира останалите тегла, за да компенсира.

Каква ключова информация задвижва AWQ (Quantization-aware Weight Quantization)?

AWQ идентифицира изпъкнали канали за тегло, използвайки величини на активиране и ги защитава чрез мащабиране, тъй като няколко канала имат непропорционално значение.

Приблизително колко памет спестява 4-битовото квантуване в сравнение с 16-битовите тегла?

Преминаването от 16 бита на 4 бита на тегло намалява паметта за тегло до около една четвърт, приблизително 4 пъти намаление.

Защо GPTQ и AWQ обикновено квантуват теглата, но поддържат активирането с по-висока точност?

Теглата са основната цена на паметта, докато активациите са по-чувствителни към загуба на прецизност, така че квантуването само с тегло е обичайното сладко място.