QLoRA e ajuste fino de 4 bits
QLoRA é uma técnica que permite ajustar um modelo de linguagem massivo em uma única GPU de consumidor, armazenando o modelo congelado em apenas 4 bits por peso.
Visão geral
It made customizing 65B-parameter models possible on hardware that previously could only handle models a fraction of that size.
Mergulho profundo
Normalmente, ajustar um modelo grande significa carregar cada peso com precisão de 16 bits e atualizar todos eles, o que exige uma memória enorme. QLoRA combina duas ideias. Primeiro, ele congela o modelo pré-treinado e o quantiza em 4 bits, reduzindo a memória em aproximadamente quatro vezes. Em segundo lugar, ele usa LoRA: em vez de atualizar as matrizes de peso gigantes, ele injeta pequenas matrizes adaptadoras treináveis de baixa classificação ao lado delas, de modo que apenas alguns milhões de parâmetros são atualizados. A base de 4 bits permanece fixa enquanto os gradientes fluem apenas através dos pequenos adaptadores. Introduzido em 2023 por Dettmers e colegas, o QLoRA mostrou que o ajuste fino de um modelo de 65B em uma GPU de 48GB poderia corresponder à qualidade do ajuste fino completo de 16 bits.
Visão Técnica
QLoRA introduziu três truques. NF4 (NormalFloat de 4 bits) é um tipo de dados otimizado para a distribuição em curva de sino de pesos neurais, proporcionando melhor precisão do que int4 simples. A quantização dupla comprime as próprias constantes de quantização, economizando memória extra. Os otimizadores paginados usam memória unificada GPU-CPU para absorver picos durante sequências longas, evitando travamentos por falta de memória. Durante a passagem para frente e para trás, os pesos de 4 bits são desquantizados para just-in-time de 16 bits para a multiplicação da matriz e depois descartados.
Impacto Estratégico
Velocidade e escala
Os fluxos de trabalho de idiomas podem avançar mais rapidamente sem sacrificar a consistência.
Acesso e alcance
Ele expande o acesso entre idiomas e estilos de comunicação.
Decisões mais claras
As equipes podem gastar mais tempo julgando enquanto a automação cuida da repetição.
O futuro do QLoRA e do ajuste fino de 4 bits
O ajuste fino de 4 bits tornou-se uma prática padrão, e a pesquisa agora busca uma precisão ainda menor, incluindo representações (ternárias) de 2 e 1 bit. Esquemas de quantização mais recentes, como AWQ, GPTQ e HQQ, refinam ainda mais a precisão, enquanto técnicas como QA-LoRA visam manter o modelo quantizado mesmo após a fusão dos adaptadores. À medida que os modelos abertos crescem, espere ferramentas que permitam aos amadores ajustar os modelos 70B ou mais em uma única GPU de jogos para se tornarem rotineiros, democratizando a personalização.
Implementação no mundo real
Uma startup ajusta um modelo Llama de 70B em uma única GPU de 48GB para construir um assistente de suporte ao cliente com a voz de sua própria marca, sem alugar um cluster de servidor.
Um pesquisador com um consumidor RTX 4090 adapta um modelo aberto a um conjunto de dados de resposta a perguntas médicas de nicho durante a noite.
Um desenvolvedor cria dezenas de adaptadores LoRA pequenos e trocáveis para diferentes tarefas, todos compartilhando um modelo básico de 4 bits carregado na memória.
Um hobby ajusta um modelo em seus registros de bate-papo pessoais para imitar um estilo de escrita específico usando hardware gratuito de nível Colab.
Riscos e guarda-corpos
Fatos alucinados podem entrar silenciosamente em relatórios, fluxos de apoio ou resultados de pesquisas.
A sensibilidade do prompt pode criar resultados inconsistentes em solicitações semelhantes.
Dados de texto confidenciais podem ser expostos se os controles de acesso forem fracos.
Roteiro de implementação
Defina o formato de saída, o tom e os padrões de qualidade antes da implementação.
Respostas terrestres com fontes confiáveis sempre que a precisão for importante.
Mantenha um ponto de verificação de revisão humana para resultados de alto risco.
Rastreie padrões de falha e treine novamente prompts ou fluxos de trabalho regularmente.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the QLoRA and 4-Bit Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Ajuste fino de amostragem de rejeição
Perguntas frequentes
What is QLoRA and 4-Bit Fine-Tuning?
QLoRA é uma técnica que permite ajustar um modelo de linguagem massivo em uma única GPU de consumidor, armazenando o modelo congelado em apenas 4 bits por peso. Ele tornou possível a personalização de modelos de parâmetros de 65B em hardware que anteriormente só conseguia lidar com modelos com uma fração desse tamanho.
Qual é a ideia central de economia de memória por trás da parte de '4 bits' do QLoRA?
QLoRA armazena os pesos pré-treinados congelados em 4 bits por valor, reduzindo a memória aproximadamente quatro vezes em comparação com 16 bits.
Durante o ajuste fino do QLoRA, quais parâmetros são realmente atualizados pela descida do gradiente?
O modelo básico está congelado; apenas as matrizes adaptadoras de baixa classificação injetadas recebem atualizações de gradiente, o que é apenas uma pequena fração dos parâmetros.
O que é NF4 no contexto do QLoRA?
NF4 (NormalFloat 4 bits) é um tipo de dados projetado em torno da distribuição em curva de sino dos pesos da rede neural para melhor precisão do que o int4 simples.
Qual problema os 'otimizadores paginados' no QLoRA abordam?
Os otimizadores paginados usam memória unificada GPU-CPU para absorver picos de memória, evitando falhas de falta de memória durante o treinamento em entradas longas.
Quando os pesos de 4 bits são convertidos novamente para maior precisão durante o treinamento?
Os pesos de 4 bits são desquantizados para uma precisão de 16 bits dinamicamente para cada multiplicação da matriz e, em seguida, a cópia de maior precisão é descartada para economizar memória.