GUIA de fundamentos

Dropout e regularização estocástica

Dropout é um truque de regularização que desliga aleatoriamente uma fração de neurônios durante cada etapa de treinamento, forçando a rede a construir representações redundantes e robustas.

2 minutos de leituraÚltima atualização

Visão geral

It became one of the most influential techniques for fighting overfitting in deep learning.

Mergulho profundo

Introduzido pelo grupo de Hinton por volta de 2012, o abandono aborda uma fraqueza fundamental das grandes redes: os neurônios podem co-adaptar-se, aprendendo a corrigir os erros uns dos outros de maneiras que só funcionam nos dados de treinamento. Em cada passagem para frente durante o treinamento, o dropout define aleatoriamente a saída de cada neurônio para zero com alguma probabilidade p (geralmente 0,5 em camadas densas). Dado que qualquer neurónio pode desaparecer, a rede não pode apoiar-se em parcerias frágeis e deve espalhar informações úteis por muitas unidades. Isso funciona como treinar um enorme conjunto de redes estreitas que compartilham pesos. No momento do teste, o dropout é desativado e toda a rede é usada, com ativações dimensionadas para que a saída esperada corresponda ao treinamento. O resultado normalmente é uma generalização melhor ao custo de um treinamento um pouco mais longo.

Visão Técnica

Durante o treinamento, cada unidade é mantida com probabilidade (1 menos p) por meio de uma máscara binária aleatória, de modo que diferentes sub-redes são amostradas a cada lote. Estruturas modernas usam dropout invertido: as ativações sobreviventes são divididas por (1 menos p) no tempo do trem, portanto, nenhum escalonamento é necessário na inferência. Essa aleatoriedade injeta ruído que desencoraja a co-adaptação e aproxima a média de um número exponencial de sub-redes de peso compartilhado, uma forma barata de agrupamento.

Impacto Estratégico

Decisões mais claras

Ajuda a separar afirmações técnicas claras da linguagem de marketing.

Custo e orçamento

Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.

Equipe e fluxo de trabalho

Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.

O futuro do abandono e da regularização estocástica

Em redes de visão convolucional, a normalização em lote substituiu amplamente o abandono padrão, mas as variantes prosperam em outros lugares: os transformadores aplicam o abandono às camadas de atenção e feed-forward, e o DropPath (profundidade estocástica) elimina blocos residuais inteiros. O abandono de Monte Carlo, que mantém o abandono ativo na inferência, é usado para estimar a incerteza do modelo. Espere que a regularização estocástica continue sendo um kit de ferramentas flexível, adaptado por arquitetura, em vez de uma única receita fixa.

Implementação no mundo real

Adicionando uma camada Dropout com p em torno de 0,5 entre camadas densas de uma imagem ou classificador de texto em PyTorch ou Keras

Modelos de transformadores aplicando abandono a pesos de atenção e ativações de feed-forward durante o pré-treinamento

Abandono de Monte Carlo, onde o abandono permanece ativado na inferência para produzir estimativas de incerteza para previsões médicas ou críticas de segurança

Profundidade estocástica (DropPath) ignorando aleatoriamente blocos residuais para regularizar redes muito profundas como ResNets e transformadores de visão

Riscos e guarda-corpos

Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.

Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.

Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.

Roteiro de implementação

1

Comece com uma definição em linguagem simples do resultado que você precisa.

2

Escolha uma métrica de sucesso e uma condição de falha antes de testar.

3

Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.

4

Documente onde o Dropout e a Regularização Estocástica ajudam e onde os métodos mais simples são melhores.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Descida Gradiente Estocástica com Momentum

Perguntas frequentes

What is Dropout and Stochastic Regularization?

Dropout é um truque de regularização que desliga aleatoriamente uma fração de neurônios durante cada etapa de treinamento, forçando a rede a construir representações redundantes e robustas. Tornou-se uma das técnicas mais influentes para combater o overfitting no aprendizado profundo.

O que o abandono faz durante o treinamento?

O dropout zera aleatoriamente cada neurônio com probabilidade p durante o treinamento, portanto, uma sub-rede diluída diferente é usada a cada etapa.

Por que o abandono melhora a generalização?

Ao remover unidades aleatoriamente, o abandono impede que os neurônios formem parcerias frágeis que funcionam apenas em dados de treinamento, melhorando a robustez.

O que acontece com a desistência na hora do teste (inferência)?

Na inferência, toda a rede funciona com o dropout desabilitado e as ativações são escalonadas para que os resultados esperados correspondam à distribuição do treinamento.

Uma taxa de abandono de p = 0,5 em uma camada significa aproximadamente o que durante o treinamento?

Com p = 0,5, cada neurônio tem 50% de chance de ser zerado, então, em média, cerca de metade é descartada por passagem para frente.

O que é o abandono frequentemente descrito como aproximado?

A amostragem de uma sub-rede diferente em cada etapa aproxima a média de um número exponencial de redes de peso compartilhado, uma forma de montagem barata.