GUIA Técnico

Quantização pós-treinamento GPTQ e AWQ

GPTQ e AWQ são dois métodos líderes para reduzir modelos de linguagem já treinados para precisão de 4 bits, para que sejam executados em hardware menor e mais barato.

  • 2 minutos de leitura
  • Última atualização
Nesta página2 minutos de leitura
  1. Visão geral
  2. Mergulho profundo
  3. Impacto Estratégico
  4. O futuro da quantização pós-treinamento GPTQ e AWQ
  5. Implementação no mundo real
  6. Riscos e guarda-corpos
  7. Roteiro de implementação
  8. Continue explorando
  9. Perguntas frequentes

Visão geral

They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.

Mergulho profundo

A quantização pós-treinamento (PTQ) compacta um modelo finalizado sem treiná-lo novamente, mapeando pesos de alta precisão em até 4 bits para aproximadamente um quarto da memória. O desafio é fazer isso sem prejudicar a precisão. O GPTQ (um refinamento do OBQ) quantiza os pesos camada por camada, usando informações de segunda ordem de um pequeno conjunto de dados de calibração para ajustar os pesos restantes e compensar cada erro de arredondamento. AWQ (Quantização de Peso com Consciência de Ativação) adota um ângulo diferente: observa que uma pequena fração dos canais de peso é desproporcionalmente importante, identificada observando as magnitudes de ativação, e protege esses canais salientes escalonando-os em vez de quantizá-los agressivamente. Ambos permitem que modelos como o Llama sejam executados em 4 bits, e ferramentas como vLLM, llama.cpp e AutoGPTQ os tornaram populares para inferência local e econômica.

Impacto Estratégico

Custo e orçamento

As decisões de arquitetura impulsionam o desempenho e os custos operacionais durante anos.

Decisões mais claras

A educação técnica ajuda as equipes a escolher a pilha certa, não apenas a mais nova.

Controle de qualidade

Melhores escolhas de engenharia reduzem incidentes de confiabilidade na produção.

O futuro da quantização pós-treinamento GPTQ e AWQ

A quantização está empurrando abaixo de 4 bits em direção a esquemas de 3 bits, 2 bits e de precisão mista, muitas vezes combinados com dispersão. Espere um acoplamento mais próximo com os mecanismos de serviço para que a quantização, a compactação do cache KV e a decodificação especulativa funcionem juntas. O suporte de hardware para formatos de poucos bits, como NVFP4 e MXFP4, está amadurecendo, e as ferramentas automatizadas escolherão cada vez mais larguras de bits por camada. O objetivo geral é 4 bits quase sem perdas (e inferior) como padrão, tornando modelos fortes baratos para servir em qualquer lugar.

Implementação no mundo real

Executando um modelo Llama de 70 bilhões de parâmetros em uma única GPU de consumo de 24 GB usando pesos GPTQ de 4 bits.

Modelos quantizados por AWQ servidos com alto rendimento em vLLM para APIs de produção econômicas.

llama.cpp usando pesos GGUF quantizados para executar modelos de linguagem localmente em uma CPU de laptop.

As bibliotecas AutoGPTQ e AutoAWQ do Hugging Face permitem que os desenvolvedores quantizem um modelo baixado em algumas linhas de código.

Riscos e guarda-corpos

  • A otimização de um benchmark pode ocultar fraquezas mais amplas do sistema.

  • Os custos de infraestrutura e manutenção são frequentemente subestimados.

  • As lacunas de segurança e observabilidade podem aumentar à medida que os sistemas se tornam mais complexos.

Roteiro de implementação

  1. Defina metas de latência, qualidade e custo antes da implementação.

  2. Benchmark sob condições realistas de carga e dados.

  3. Monitoramento de instrumentos para erros, desvios e impacto no usuário.

  4. Prepare caminhos de reversão e resposta a incidentes antes de escalar.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the GPTQ and AWQ Post-Training Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is GPTQ and AWQ Post-Training Quantization?

GPTQ e AWQ são dois métodos líderes para reduzir modelos de linguagem já treinados para precisão de 4 bits, para que sejam executados em hardware menor e mais barato. É por isso que você pode executar um modelo capaz em uma única GPU de consumidor, em vez de em um rack de datacenter.

O que significa 'quantização pós-treinamento'?

A quantização pós-treinamento reduz a precisão dos pesos de um modelo finalizado (por exemplo, para 4 bits) sem treiná-lo novamente do zero.

Que informações o GPTQ usa para compensar erros de arredondamento durante a quantização?

O GPTQ usa um Hessian aproximado para entender como a quantização de um peso afeta a perda e, em seguida, ajusta os pesos restantes para compensar.

Qual é o principal insight que impulsiona o AWQ (quantização de peso com reconhecimento de ativação)?

AWQ identifica canais de peso salientes usando magnitudes de ativação e os protege por meio de escalonamento, uma vez que alguns canais são desproporcionalmente importantes.

Aproximadamente quanta memória a quantização de 4 bits economiza em comparação com pesos de 16 bits?

Passar de 16 bits para 4 bits por peso reduz o peso da memória para cerca de um quarto, uma redução de aproximadamente 4x.

Por que tanto o GPTQ quanto o AWQ normalmente quantizam os pesos, mas mantêm as ativações com maior precisão?

Os pesos são o principal custo de memória, enquanto as ativações são mais sensíveis à perda de precisão, portanto, a quantização apenas do peso é o ponto ideal comum.