Régularisation
La régularisation est un ensemble de techniques qui contraignent délibérément un modèle afin qu'il se généralise à de nouvelles données au lieu de mémoriser l'ensemble d'apprentissage.
Aperçu
Il s’agit de la principale boîte à outils pour lutter contre le surapprentissage.
Plongée profonde
Si rien n'est fait, un modèle flexible se tordra pour s'adapter à chaque point des données d'entraînement, y compris le bruit. La régularisation repousse en ajoutant une pénalité ou une contrainte qui favorise des solutions plus simples. Les formes les plus courantes ajoutent un terme à la fonction de perte en fonction de la taille des poids du modèle. La régularisation L2 (dégradation du poids) pénalise progressivement les poids importants, les réduisant vers zéro et produisant des modèles plus fluides. La régularisation L1 pénalise la valeur absolue des poids et peut en conduire certains jusqu'à zéro, sélectionnant ainsi un sous-ensemble de caractéristiques. Au-delà des pénalités de poids, l'abandon éteint les neurones de manière aléatoire pendant l'entraînement, l'arrêt précoce interrompt l'entraînement avant que le surentraînement ne s'installe et l'augmentation des données élargit l'ensemble d'entraînement efficace. Chacun échange un peu de précision d’entraînement contre de bien meilleures performances dans le monde réel.
Aperçu technique
La plupart des régularisations remodèlent l'objectif minimisé par l'optimiseur. Au lieu de simplement minimiser l'erreur de prédiction, vous minimisez l'erreur plus lambda fois une pénalité sur les poids, où lambda contrôle la force. L2 ajoute la somme des poids au carré, encourageant de nombreux petits poids ; L1 ajoute la somme des poids absolus, encourageant la parcimonie avec des zéros exacts. Le dropout fonctionne différemment : en remettant à zéro les activations de manière aléatoire à chaque étape, il empêche les neurones de s'adapter et se rapproche de l'entraînement d'un ensemble de sous-réseaux. Tous ces éléments réduisent la variance au prix d’un biais légèrement accru.
Impact stratégique
Décisions plus claires
Il vous aide à séparer les affirmations techniques claires du langage marketing.
Coût et budget
Vous pouvez poser de meilleures questions de mise en œuvre avant de dépenser de l'argent ou du temps.
Équipe et flux de travail
Les équipes partageant une compréhension commune prennent de meilleures décisions en matière de produits, de politiques et d’apprentissage.
L’avenir de la régularisation
Les pénalités explicites telles que L2 et l'abandon restent la norme, mais l'attention se tourne vers la régularisation implicite, la manière dont les optimiseurs comme la descente de gradient stochastique orientent discrètement les énormes modèles vers des solutions généralisables, même sans pénalité supplémentaire. Des techniques telles que le lissage des étiquettes, la confusion et une augmentation plus forte des données sont de plus en plus essentielles à la formation de modèles de vision et de langage à grande échelle. Attendez-vous à davantage de recherches sur les raisons pour lesquelles les réseaux surparamétrés résistent au surajustement et sur les méthodes adaptatives qui ajustent automatiquement la force de régularisation pendant l'entraînement plutôt que de s'appuyer sur une recherche manuelle.
Mise en œuvre dans le monde réel
Ajout de la dégradation du poids L2 à un classificateur d'images profond afin qu'il généralise des milliers de photos d'entraînement à des photos invisibles.
Utilisation de la régularisation L1 dans un modèle génomique pour sélectionner automatiquement la poignée de gènes qui prédisent réellement un résultat parmi des milliers.
Appliquer l'abandon dans un réseau de recommandation afin qu'il ne dépende pas trop du signal d'un seul utilisateur.
Arrêter la formation plus tôt une fois que la perte de validation cesse de s'améliorer, même si la perte de formation pourrait continuer de baisser.
Risques et garde-fous
Différentes équipes peuvent utiliser le même terme différemment, alors définissez la portée dès le début.
Les benchmarks peuvent paraître solides alors que les performances réelles sont inégales.
Ignorer la qualité des données et les plans d’évaluation crée souvent des résultats fragiles.
Feuille de route de mise en œuvre
Commencez par une définition en langage simple du résultat dont vous avez besoin.
Choisissez une mesure de réussite et une condition d’échec avant de tester.
Exécutez un petit pilote avec des données représentatives, pas un ensemble de démonstration raffiné.
Documentez où la régularisation est utile et où les méthodes plus simples sont meilleures.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Regularization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Décroissance du poids et régularisation L2
Questions fréquemment posées
Qu’est-ce que la régularisation ?
La régularisation est un ensemble de techniques qui contraignent délibérément un modèle afin qu'il se généralise à de nouvelles données au lieu de mémoriser l'ensemble d'apprentissage. Il s’agit de la principale boîte à outils pour lutter contre le surapprentissage.
Quel est l’objectif principal de la régularisation ?
La régularisation contraint délibérément un modèle pour décourager la mémorisation des données d'entraînement, améliorant ainsi les performances sur des exemples invisibles.
Quelle technique de régularisation est la plus susceptible de ramener certains poids exactement à zéro, sélectionnant ainsi efficacement les caractéristiques ?
L1 pénalise la valeur absolue des poids, ce qui tend à pousser les poids moins utiles à exactement zéro, effectuant ainsi une sélection automatique des caractéristiques. L2 réduit les poids en douceur mais rarement jusqu'à exactement zéro.
Comment le décrochage régularise-t-il un réseau de neurones pendant l’entraînement ?
L'abandon remet à zéro de manière aléatoire une fraction des activations à chaque étape d'entraînement, empêchant les neurones de trop dépendre les uns des autres et de se rapprocher d'un ensemble de sous-réseaux.
Dans la perte régularisée « erreur + lambda × pénalité », à quoi sert l'augmentation de lambda ?
Lambda contrôle la force de régularisation. Un lambda plus grand donne plus d'influence à la pénalité, réduisant les poids de manière plus agressive vers des modèles plus simples.
Pourquoi l’arrêt précoce peut-il être considéré comme une forme de régularisation ?
S'arrêter lorsque les performances de validation cessent de s'améliorer empêche le modèle de continuer dans le régime où il mémorise le bruit, tout comme d'autres régulariseurs limitent la complexité.