Décroissance du poids et régularisation L2
La perte de poids est une technique simple et puissante qui pousse le poids d'un modèle vers zéro pendant l'entraînement, le décourageant de trop s'appuyer sur une seule fonctionnalité.
Aperçu
It reduces overfitting and is one of the most widely used regularizers in deep learning.
Plongée profonde
Lorsqu'un modèle s'entraîne, il peut s'accrocher au bruit dans les données en augmentant des poids importants et finement réglés qui s'adaptent parfaitement à l'ensemble d'entraînement mais se généralisent mal. La régularisation L2 combat cela en ajoutant une pénalité proportionnelle à la somme des poids au carré à la fonction de perte. L'optimiseur a désormais deux objectifs : ajuster les données et maintenir des pondérations faibles, afin d'opter pour des solutions plus fluides et plus robustes. La perte de poids est l’idée étroitement liée de réduire chaque poids d’une petite fraction à chaque étape de mise à jour. Avec une descente de gradient simple, les deux sont mathématiquement équivalents, mais avec des optimiseurs adaptatifs comme Adam, ils diffèrent, c'est pourquoi AdamW a été introduit pour découpler la décroissance de la mise à jour basée sur le gradient et la faire se comporter correctement.
Aperçu technique
La régularisation L2 ajoute lambda fois la somme des poids au carré à la perte, donc son gradient ajoute un terme proportionnel à chaque poids, le tirant vers zéro. La dégradation du poids découplée multiplie à la place chaque poids par un facteur tel que (1 moins learning_rate fois lambda) directement. Dans les méthodes adaptatives, le couplage de L2 à la perte permet à la mise à l'échelle par paramètre de fausser la pénalité, de sorte qu'AdamW applique le retrait séparément, rétablissant l'attraction uniforme prévue vers des poids plus petits.
Impact stratégique
Décisions plus claires
Il vous aide à séparer les affirmations techniques claires du langage marketing.
Coût et budget
Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.
Équipe et flux de travail
Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.
L'avenir de la perte de poids et de la régularisation L2
La perte de poids reste un ingrédient par défaut dans les recettes de formation pour les grands modèles de langage et les transformateurs de vision, et AdamW est désormais l'optimiseur standard pour eux. Les recherches se poursuivent sur la façon dont la dégradation interagit avec les calendriers de taux d'apprentissage, les couches de normalisation et l'échelle du modèle, puisque sa force effective change à mesure que les modèles se développent. Attendez-vous à un réglage de la décroissance plus fondé sur des principes, éventuellement par couche ou en fonction du calendrier, à mesure que la recherche automatisée d'hyperparamètres et les études de lois d'échelle mûrissent.
Mise en œuvre dans le monde réel
Ajout deweight_decay dans l'optimiseur AdamW ou SGD de PyTorch lors de la formation des classificateurs d'images pour limiter le surajustement
Ajustement du coefficient lambda dans la régression de crête, le modèle linéaire classique pénalisé par L2, pour stabiliser les prédictions sur les caractéristiques corrélées
Recettes de pré-entraînement de grands modèles de langage qui établissent une légère perte de poids (souvent autour de 0,1) parallèlement à un calendrier de taux d'apprentissage
Combiner la perte de poids avec l'augmentation et l'abandon des données pour empêcher un petit modèle d'imagerie médicale de mémoriser des analyses d'entraînement limitées
Risques et garde-fous
Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.
Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.
Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.
Feuille de route de mise en œuvre
Commencez par une définition en langage simple du résultat dont vous avez besoin.
Choisissez une mesure de réussite et une condition d’échec avant de tester.
Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.
Documentez où la perte de poids et la régularisation L2 sont utiles et où les méthodes plus simples sont meilleures.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Weight Decay and L2 Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Régularisation
Questions fréquemment posées
What is Weight Decay and L2 Regularization?
La perte de poids est une technique simple et puissante qui pousse le poids d'un modèle vers zéro pendant l'entraînement, le décourageant de trop s'appuyer sur une seule fonctionnalité. Il réduit le surapprentissage et est l’un des régularisateurs les plus utilisés en apprentissage profond.
Qu'ajoute la régularisation L2 à la fonction de perte ?
La régularisation L2 ajoute lambda fois la somme des poids au carré, pénalisant les poids importants et encourageant des solutions plus petites et plus fluides.
Quel est le principal problème que la perte de poids aide à prévenir ?
En gardant des poids petits, la dégradation des poids décourage le modèle d'ajuster le bruit, améliorant ainsi la généralisation à de nouvelles données.
Dans quelle direction la dégradation du poids pousse-t-elle les poids du modèle ?
La diminution du poids réduit les poids vers zéro à chaque mise à jour, c'est pourquoi elle est parfois décrite comme une « dégradation » des poids.
Pourquoi AdamW a-t-il été introduit ?
Chez Adam, l'intégration de L2 dans la perte interagit mal avec la mise à l'échelle par paramètre ; AdamW applique la décroissance séparément pour restaurer le retrait uniforme prévu.
Pour une descente de gradient stochastique simple, quel est le rapport entre la régularisation L2 et la décroissance du poids ?
Avec SGD simple, l'ajout d'une pénalité L2 à la perte produit la même mise à jour qu'une diminution directe des poids, donc les deux sont équivalents.