GUIA de fundamentos

Decadência de peso e regularização L2

A redução de peso é uma técnica simples e poderosa que leva os pesos de um modelo a zero durante o treinamento, desencorajando-o de depender demais de um único recurso.

2 minutos de leituraÚltima atualização

Visão geral

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Mergulho profundo

Quando um modelo é treinado, ele pode capturar ruídos nos dados, aumentando pesos grandes e ajustados que se ajustam perfeitamente ao conjunto de treinamento, mas generalizam mal. A regularização L2 combate isso adicionando uma penalidade proporcional à soma dos pesos quadrados à função de perda. O otimizador agora tem dois objetivos: ajustar os dados e manter os pesos pequenos, para que ele opte por soluções mais suaves e robustas. A redução de peso é a ideia intimamente relacionada de reduzir cada peso em uma pequena fração em cada etapa de atualização. Com a descida gradiente simples, os dois são matematicamente equivalentes, mas com otimizadores adaptativos como o Adam eles diferem, e é por isso que o AdamW foi introduzido para dissociar a deterioração da atualização baseada em gradiente e fazer com que ela se comporte corretamente.

Visão Técnica

A regularização L2 adiciona lambda vezes a soma dos pesos quadrados à perda, de modo que seu gradiente adiciona um termo proporcional a cada peso, puxando-o para zero. Em vez disso, a redução de peso dissociada multiplica cada peso por um fator como (1 menos taxa de aprendizagem vezes lambda) diretamente. Nos métodos adaptativos, o acoplamento de L2 à perda permite que o escalonamento por parâmetro distorça a penalidade, de modo que AdamW aplica a contração separadamente, restaurando a tração uniforme pretendida em direção a pesos menores.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro da redução de peso e da regularização L2

A redução de peso continua sendo um ingrediente padrão em receitas de treinamento para grandes modelos de linguagem e transformadores de visão, e AdamW agora é o otimizador padrão para eles. A pesquisa continua sobre como o decaimento interage com os cronogramas de taxa de aprendizagem, as camadas de normalização e a escala do modelo, uma vez que sua força efetiva muda à medida que os modelos crescem. Espere um ajuste de decaimento mais baseado em princípios, possivelmente por camada ou com reconhecimento de cronograma, à medida que a pesquisa automatizada de hiperparâmetros e os estudos de lei de escala amadurecem.

Implementação no mundo real

Adicionando peso_decay no otimizador AdamW ou SGD do PyTorch ao treinar classificadores de imagem para reduzir o overfitting

Ajustando o coeficiente lambda na regressão de crista, o modelo linear clássico penalizado por L2, para estabilizar previsões em recursos correlacionados

Receitas de pré-treinamento de modelos de linguagem grandes que definem uma pequena redução de peso (geralmente em torno de 0,1) junto com um cronograma de taxa de aprendizagem

Combinar redução de peso com aumento e abandono de dados para evitar que um pequeno modelo de imagens médicas memorize varreduras de treinamento limitadas

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde a redução de peso e a regularização L2 ajudam e onde métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Perguntas frequentes

What is Weight Decay and L2 Regularization?

A redução de peso é uma técnica simples e poderosa que leva os pesos de um modelo a zero durante o treinamento, desencorajando-o de depender demais de um único recurso. Ele reduz o overfitting e é um dos regularizadores mais utilizados no aprendizado profundo.

O que a regularização L2 adiciona à função de perda?

A regularização L2 adiciona lambda vezes a soma dos pesos quadrados, penalizando pesos grandes e incentivando soluções menores e mais suaves.

Qual é o principal problema que a perda de peso ajuda a prevenir?

Ao manter os pesos pequenos, a redução dos pesos desencoraja o modelo de ajustar o ruído, melhorando a generalização para novos dados.

Em que direção a redução do peso empurra os pesos do modelo?

A redução de peso reduz os pesos para zero em cada atualização, e é por isso que às vezes é descrita como 'decadência' dos pesos.

Por que AdamW foi introduzido?

Em Adam, incluir L2 na perda interage mal com o escalonamento por parâmetro; AdamW aplica o decaimento separadamente para restaurar o encolhimento uniforme pretendido.

Para descida gradiente estocástica simples, como a regularização L2 e a queda de peso se relacionam?

Com SGD simples, adicionar uma penalidade L2 à perda produz a mesma atualização que reduzir diretamente os pesos, portanto os dois são equivalentes.