Dropout e regularização estocástica
Dropout é um truque de regularização que desliga aleatoriamente uma fração de neurônios durante cada etapa de treinamento, forçando a rede a construir representações redundantes e robustas.
Visão geral
It became one of the most influential techniques for fighting overfitting in deep learning.
Mergulho profundo
Introduzido pelo grupo de Hinton por volta de 2012, o abandono aborda uma fraqueza fundamental das grandes redes: os neurônios podem co-adaptar-se, aprendendo a corrigir os erros uns dos outros de maneiras que só funcionam nos dados de treinamento. Em cada passagem para frente durante o treinamento, o dropout define aleatoriamente a saída de cada neurônio para zero com alguma probabilidade p (geralmente 0,5 em camadas densas). Dado que qualquer neurónio pode desaparecer, a rede não pode apoiar-se em parcerias frágeis e deve espalhar informações úteis por muitas unidades. Isso funciona como treinar um enorme conjunto de redes estreitas que compartilham pesos. No momento do teste, o dropout é desativado e toda a rede é usada, com ativações dimensionadas para que a saída esperada corresponda ao treinamento. O resultado normalmente é uma generalização melhor ao custo de um treinamento um pouco mais longo.
Visão Técnica
Durante o treinamento, cada unidade é mantida com probabilidade (1 menos p) por meio de uma máscara binária aleatória, de modo que diferentes sub-redes são amostradas a cada lote. Estruturas modernas usam dropout invertido: as ativações sobreviventes são divididas por (1 menos p) no tempo do trem, portanto, nenhum escalonamento é necessário na inferência. Essa aleatoriedade injeta ruído que desencoraja a co-adaptação e aproxima a média de um número exponencial de sub-redes de peso compartilhado, uma forma barata de agrupamento.
Impacto Estratégico
Decisões mais claras
Ajuda a separar afirmações técnicas claras da linguagem de marketing.
Custo e orçamento
Você pode fazer perguntas melhores sobre implementação antes de gastar dinheiro ou tempo.
Equipe e fluxo de trabalho
Equipes com entendimento compartilhado tomam melhores decisões sobre produtos, políticas e aprendizado.
O futuro do abandono e da regularização estocástica
Em redes de visão convolucional, a normalização em lote substituiu amplamente o abandono padrão, mas as variantes prosperam em outros lugares: os transformadores aplicam o abandono às camadas de atenção e feed-forward, e o DropPath (profundidade estocástica) elimina blocos residuais inteiros. O abandono de Monte Carlo, que mantém o abandono ativo na inferência, é usado para estimar a incerteza do modelo. Espere que a regularização estocástica continue sendo um kit de ferramentas flexível, adaptado por arquitetura, em vez de uma única receita fixa.
Implementação no mundo real
Adicionando uma camada Dropout com p em torno de 0,5 entre camadas densas de uma imagem ou classificador de texto em PyTorch ou Keras
Modelos de transformadores aplicando abandono a pesos de atenção e ativações de feed-forward durante o pré-treinamento
Abandono de Monte Carlo, onde o abandono permanece ativado na inferência para produzir estimativas de incerteza para previsões médicas ou críticas de segurança
Profundidade estocástica (DropPath) ignorando aleatoriamente blocos residuais para regularizar redes muito profundas como ResNets e transformadores de visão
Riscos e guarda-corpos
Equipes diferentes podem usar o mesmo termo de maneira diferente, portanto, defina o escopo com antecedência.
Os benchmarks podem parecer fortes, enquanto o desempenho no mundo real é irregular.
Ignorar a qualidade dos dados e os planos de avaliação cria frequentemente resultados frágeis.
Roteiro de implementação
Comece com uma definição em linguagem simples do resultado que você precisa.
Escolha uma métrica de sucesso e uma condição de falha antes de testar.
Execute um pequeno piloto com dados representativos, não um conjunto de demonstração sofisticado.
Documente onde o Dropout e a Regularização Estocástica ajudam e onde os métodos mais simples são melhores.
Continue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dropout and Stochastic Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Próximo guia
Descida Gradiente Estocástica com Momentum
Perguntas frequentes
What is Dropout and Stochastic Regularization?
Dropout é um truque de regularização que desliga aleatoriamente uma fração de neurônios durante cada etapa de treinamento, forçando a rede a construir representações redundantes e robustas. Tornou-se uma das técnicas mais influentes para combater o overfitting no aprendizado profundo.
O que o abandono faz durante o treinamento?
O dropout zera aleatoriamente cada neurônio com probabilidade p durante o treinamento, portanto, uma sub-rede diluída diferente é usada a cada etapa.
Por que o abandono melhora a generalização?
Ao remover unidades aleatoriamente, o abandono impede que os neurônios formem parcerias frágeis que funcionam apenas em dados de treinamento, melhorando a robustez.
O que acontece com a desistência na hora do teste (inferência)?
Na inferência, toda a rede funciona com o dropout desabilitado e as ativações são escalonadas para que os resultados esperados correspondam à distribuição do treinamento.
Uma taxa de abandono de p = 0,5 em uma camada significa aproximadamente o que durante o treinamento?
Com p = 0,5, cada neurônio tem 50% de chance de ser zerado, então, em média, cerca de metade é descartada por passagem para frente.
O que é o abandono frequentemente descrito como aproximado?
A amostragem de uma sub-rede diferente em cada etapa aproxima a média de um número exponencial de redes de peso compartilhado, uma forma de montagem barata.