Квантование после обучения GPTQ и AWQ
GPTQ и AWQ — два ведущих метода сокращения уже обученных языковых моделей до 4-битной точности, чтобы они работали на более дешевом и меньшем по размеру оборудовании.
Обзор
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
Глубокое погружение
Квантование после обучения (PTQ) сжимает готовую модель без ее повторного обучения, отображая высокоточные веса до 4 бит, чтобы примерно четверть памяти. Задача состоит в том, чтобы сделать это, не нарушая точности. GPTQ (усовершенствованная версия OBQ) квантовает веса слой за слоем, используя информацию второго порядка из небольшого набора калибровочных данных для корректировки оставшихся весов и компенсации каждой ошибки округления. AWQ (квантование веса с учетом активации) использует другую точку зрения: он отмечает, что небольшая часть весовых каналов непропорционально важна, определяется путем рассмотрения величин активации, и защищает эти заметные каналы путем масштабирования, а не агрессивного квантования. Оба позволяют моделям, таким как Llama, работать в 4-битном режиме, а такие инструменты, как vLLM, llama.cpp и AutoGPTQ, сделали их популярными для локального и экономичного вывода.
Техническая информация
GPTQ использует аппроксимацию гессиана (кривизны потерь), чтобы решить, как округление одного веса должно подталкивать другие, сводя к минимуму вносимую ошибку. AWQ полностью пропускает гессианцы: он вычисляет коэффициент масштабирования для каждого канала, чтобы важные весовые каналы сохраняли свою эффективную точность, а затем выполняет равномерное квантование. Оба сохраняют активацию с более высокой точностью и сжимают только веса, поскольку веса доминируют в памяти, а квантование активации имеет тенденцию еще больше ухудшать точность.
Стратегическое воздействие
Стоимость и бюджет
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Более четкие решения
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Контроль качества
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Будущее квантования после обучения GPTQ и AWQ
Квантование смещает размерность ниже 4 бит в сторону 3-битных, 2-битных схем и схем смешанной точности, часто в сочетании с разреженностью. Ожидайте более тесной связи с обслуживающими механизмами, чтобы квантование, сжатие KV-кэша и спекулятивное декодирование работали вместе. Аппаратная поддержка низкобитных форматов, таких как NVFP4 и MXFP4, становится все более зрелой, и автоматизированные инструменты все чаще будут выбирать разрядность каждого слоя. Общая цель — 4-битный код (и ниже) практически без потерь по умолчанию, что делает надежные модели дешевыми для обслуживания повсюду.
Реальная реализация
Запуск модели Llama с 70 миллиардами параметров на одном потребительском графическом процессоре объемом 24 ГБ с использованием 4-битных весов GPTQ.
Квантованные AWQ модели обрабатываются с высокой пропускной способностью в vLLM для экономически эффективных производственных API.
llama.cpp использует квантованные веса GGUF для локального запуска языковых моделей на процессоре ноутбука.
Библиотеки Hugging Face AutoGPTQ и AutoAWQ позволяют разработчикам квантовать загруженную модель с помощью нескольких строк кода.
Риски и ограничения
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Дорожная карта реализации
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Функции влияния для атрибуции обучающих данных
Часто задаваемые вопросы
What is GPTQ and AWQ Post-Training Quantization?
GPTQ и AWQ — это два ведущих метода сокращения уже обученных языковых моделей до 4-битной точности, чтобы они работали на более дешевом и меньшем по размеру оборудовании. Именно поэтому вы можете запустить работоспособную модель на одном потребительском графическом процессоре вместо стойки в центре обработки данных.
Что означает «квантование после обучения»?
Квантование после обучения снижает точность весов готовой модели (например, до 4 битов) без ее повторного обучения с нуля.
Какую информацию использует GPTQ для компенсации ошибок округления при квантовании?
GPTQ использует приблизительный гессиан, чтобы понять, как квантование одного веса влияет на потерю, а затем корректирует оставшиеся веса для компенсации.
Какая ключевая информация лежит в основе AWQ (квантования веса с учетом активации)?
AWQ идентифицирует каналы существенного веса, используя величины активации, и защищает их посредством масштабирования, поскольку несколько каналов имеют непропорционально большое значение.
Сколько примерно памяти экономит 4-битное квантование по сравнению с 16-битным взвешиванием?
Переход от 16 бит к 4 битам на вес сокращает память веса примерно на четверть, то есть примерно в 4 раза.
Почему и GPTQ, и AWQ обычно квантуют веса, но сохраняют активацию с более высокой точностью?
Веса являются основной статьей затрат памяти, в то время как активации более чувствительны к потере точности, поэтому квантование только по весу является наиболее распространенным вариантом.