GUÍA DE FUNDAMENTOS

Decaimiento de peso y regularización L2

La caída de peso es una técnica simple y poderosa que empuja los pesos de un modelo hacia cero durante el entrenamiento, disuadiéndolo de depender demasiado de una sola característica.

2 minutos de lecturaÚltima actualización

Descripción general

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Buceo profundo

Cuando un modelo se entrena, puede captar el ruido de los datos mediante el aumento de pesos grandes y finamente ajustados que se ajustan perfectamente al conjunto de entrenamiento pero que se generalizan mal. La regularización L2 combate esto agregando una penalización proporcional a la suma de pesos al cuadrado a la función de pérdida. El optimizador ahora tiene dos objetivos: ajustar los datos y mantener los pesos pequeños, para poder optar por soluciones más fluidas y sólidas. La disminución del peso es la idea estrechamente relacionada de reducir cada peso en una pequeña fracción en cada paso de actualización. Con el descenso de gradiente simple, los dos son matemáticamente equivalentes, pero con optimizadores adaptativos como Adam difieren, razón por la cual se introdujo AdamW para desacoplar el deterioro de la actualización basada en gradiente y hacer que se comporte correctamente.

Información técnica

La regularización L2 agrega lambda multiplicada por la suma de los pesos al cuadrado a la pérdida, por lo que su gradiente agrega un término proporcional a cada peso, llevándolo hacia cero. En cambio, la caída de peso desacoplada multiplica cada peso por un factor como (1 menos tasa de aprendizaje por lambda) directamente. En los métodos adaptativos, acoplar L2 a la pérdida permite que la escala por parámetro distorsione la penalización, por lo que AdamW aplica la contracción por separado, restaurando la atracción uniforme prevista hacia pesos más pequeños.

Impacto Estratégico

Decisiones más claras

Le ayuda a separar las afirmaciones técnicas claras del lenguaje de marketing.

Costo y presupuesto

Puede hacer mejores preguntas sobre implementación antes de gastar dinero o tiempo.

Equipo y flujo de trabajo

Los equipos con conocimientos compartidos toman mejores decisiones sobre productos, políticas y aprendizaje.

El futuro de la caída de peso y la regularización de L2

La reducción de peso sigue siendo un ingrediente predeterminado en las recetas de entrenamiento para modelos de lenguaje grandes y transformadores de visión, y AdamW es ahora el optimizador estándar para ellos. Continúan las investigaciones sobre cómo la decadencia interactúa con los programas de tasa de aprendizaje, las capas de normalización y la escala del modelo, ya que su fuerza efectiva cambia a medida que los modelos crecen. Espere un ajuste de decaimiento más basado en principios, posiblemente por capa o en función de la programación, a medida que maduren la búsqueda automatizada de hiperparámetros y los estudios de ley de escala.

Implementación en el mundo real

Agregar Weight_decay en el optimizador AdamW o SGD de PyTorch al entrenar clasificadores de imágenes para frenar el sobreajuste

Ajuste del coeficiente lambda en la regresión de crestas, el clásico modelo lineal penalizado por L2, para estabilizar las predicciones sobre características correlacionadas

Recetas de preentrenamiento de modelos de lenguaje grandes que establecen una pequeña caída de peso (a menudo alrededor de 0,1) junto con un programa de tasa de aprendizaje

Combinando la disminución de peso con el aumento y abandono de datos para evitar que un pequeño modelo de imágenes médicas memorice escaneos de entrenamiento limitados

Riesgos y barandillas

Diferentes equipos pueden usar el mismo término de manera diferente, por lo tanto, defina el alcance con anticipación.

Los puntos de referencia pueden parecer sólidos, mientras que el desempeño en el mundo real es desigual.

Ignorar la calidad de los datos y los planes de evaluación a menudo genera resultados frágiles.

Hoja de ruta de implementación

1

Comience con una definición en lenguaje sencillo del resultado que necesita.

2

Elija una métrica de éxito y una condición de fracaso antes de realizar la prueba.

3

Ejecute un pequeño piloto con datos representativos, no un conjunto de demostración pulido.

4

Documente dónde ayudan la reducción de peso y la regularización L2 y dónde son mejores los métodos más simples.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is Weight Decay and L2 Regularization?

La caída de peso es una técnica simple y poderosa que empuja los pesos de un modelo hacia cero durante el entrenamiento, disuadiéndolo de depender demasiado de una sola característica. Reduce el sobreajuste y es uno de los regularizadores más utilizados en el aprendizaje profundo.

¿Qué agrega la regularización L2 a la función de pérdida?

La regularización L2 agrega tiempos lambda a la suma de pesos al cuadrado, penalizando pesos grandes y fomentando soluciones más pequeñas y más fluidas.

¿Cuál es el principal problema que la caída de peso ayuda a prevenir?

Al mantener los pesos pequeños, la disminución del peso disuade al modelo de ajustar el ruido, lo que mejora la generalización a nuevos datos.

¿En qué dirección la caída del peso empuja los pesos del modelo?

La disminución del peso reduce los pesos hacia cero en cada actualización, por lo que a veces se describe como "disminución" de los pesos.

¿Por qué se presentó AdamW?

En Adam, incorporar L2 a la pérdida interactúa mal con el escalado por parámetro; AdamW aplica la descomposición por separado para restaurar la contracción uniforme deseada.

Para el descenso de gradiente estocástico simple, ¿cómo se relacionan la regularización L2 y la caída de peso?

Con SGD simple, agregar una penalización L2 a la pérdida produce la misma actualización que reducir directamente los pesos, por lo que los dos son equivalentes.