Decaimiento de peso y regularización L2
La caída de peso es una técnica simple y poderosa que empuja los pesos de un modelo hacia cero durante el entrenamiento, disuadiéndolo de depender demasiado de una sola característica.
Descripción general
It reduces overfitting and is one of the most widely used regularizers in deep learning.
Buceo profundo
Cuando un modelo se entrena, puede captar el ruido de los datos mediante el aumento de pesos grandes y finamente ajustados que se ajustan perfectamente al conjunto de entrenamiento pero que se generalizan mal. La regularización L2 combate esto agregando una penalización proporcional a la suma de pesos al cuadrado a la función de pérdida. El optimizador ahora tiene dos objetivos: ajustar los datos y mantener los pesos pequeños, para poder optar por soluciones más fluidas y sólidas. La disminución del peso es la idea estrechamente relacionada de reducir cada peso en una pequeña fracción en cada paso de actualización. Con el descenso de gradiente simple, los dos son matemáticamente equivalentes, pero con optimizadores adaptativos como Adam difieren, razón por la cual se introdujo AdamW para desacoplar el deterioro de la actualización basada en gradiente y hacer que se comporte correctamente.
Información técnica
La regularización L2 agrega lambda multiplicada por la suma de los pesos al cuadrado a la pérdida, por lo que su gradiente agrega un término proporcional a cada peso, llevándolo hacia cero. En cambio, la caída de peso desacoplada multiplica cada peso por un factor como (1 menos tasa de aprendizaje por lambda) directamente. En los métodos adaptativos, acoplar L2 a la pérdida permite que la escala por parámetro distorsione la penalización, por lo que AdamW aplica la contracción por separado, restaurando la atracción uniforme prevista hacia pesos más pequeños.
Impacto Estratégico
Decisiones más claras
Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.
Costo y presupuesto
Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.
Equipo y flujo de trabajo
Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.
El futuro de la caída de peso y la regularización de L2
La reducción de peso sigue siendo un ingrediente predeterminado en las recetas de entrenamiento para modelos de lenguaje grandes y transformadores de visión, y AdamW es ahora el optimizador estándar para ellos. Continúan las investigaciones sobre cómo la decadencia interactúa con los programas de tasa de aprendizaje, las capas de normalización y la escala del modelo, ya que su fuerza efectiva cambia a medida que los modelos crecen. Espere un ajuste de decaimiento más basado en principios, posiblemente por capa o en función de la programación, a medida que maduren la búsqueda automatizada de hiperparámetros y los estudios de ley de escala.
Implementación en el mundo real
Agregar Weight_decay en el optimizador AdamW o SGD de PyTorch al entrenar clasificadores de imágenes para frenar el sobreajuste
Ajuste del coeficiente lambda en la regresión de crestas, el clásico modelo lineal penalizado por L2, para estabilizar las predicciones sobre características correlacionadas
Recetas de preentrenamiento de modelos de lenguaje grandes que establecen una pequeña caída de peso (a menudo alrededor de 0,1) junto con un programa de tasa de aprendizaje
Combinando la disminución de peso con el aumento y abandono de datos para evitar que un pequeño modelo de imágenes médicas memorice escaneos de entrenamiento limitados
Riesgos y barandillas
Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.
Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.
Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.
Hoja de ruta de implementación
Comience con una definición en lenguaje sencillo del resultado que necesita.
Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.
Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.
Documente dónde ayudan la reducción de peso y la regularización L2 y dónde son mejores los métodos más simples.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Weight Decay and L2 Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Regularización
Preguntas frecuentes
What is Weight Decay and L2 Regularization?
La caída de peso es una técnica simple y poderosa que empuja los pesos de un modelo hacia cero durante el entrenamiento, disuadiéndolo de depender demasiado de una sola característica. Reduce el sobreajuste y es uno de los regularizadores más utilizados en el aprendizaje profundo.
¿Qué agrega la regularización L2 a la función de pérdida?
La regularización L2 agrega tiempos lambda a la suma de pesos al cuadrado, penalizando pesos grandes y fomentando soluciones más pequeñas y más fluidas.
¿Cuál es el principal problema que la caída de peso ayuda a prevenir?
Al mantener los pesos pequeños, la disminución del peso disuade al modelo de ajustar el ruido, lo que mejora la generalización a nuevos datos.
¿En qué dirección la caída del peso empuja los pesos del modelo?
La disminución del peso reduce los pesos hacia cero en cada actualización, por lo que a veces se describe como "disminución" de los pesos.
¿Por qué se presentó AdamW?
En Adam, incorporar L2 a la pérdida interactúa mal con el escalado por parámetro; AdamW aplica la descomposición por separado para restaurar la contracción uniforme deseada.
Para el descenso de gradiente estocástico simple, ¿cómo se relacionan la regularización L2 y la caída de peso?
Con SGD simple, agregar una penalización L2 a la pérdida produce la misma actualización que reducir directamente los pesos, por lo que los dos son equivalentes.