GUIDE Technique

Normalisation par lots

La normalisation par lots est une technique qui redimensionne les entrées de chaque couche d'un réseau neuronal pendant l'entraînement, ce qui rend l'entraînement des réseaux profonds plus rapide et plus fiable.

2 minutes de lectureDernière mise à jour

Aperçu

It became one of the most widely used tricks in deep learning.

Plongée profonde

À mesure que les données circulent à travers un réseau profond, la distribution des valeurs alimentant chaque couche ne cesse de changer à mesure que les couches précédentes se mettent à jour, ce qui ralentit et déstabilise la formation. La normalisation par lots, introduite par Ioffe et Szegedy en 2015, résout ce problème en normalisant les entrées de chaque couche dans le mini-lot actuel afin qu'elles aient une moyenne et une variance unitaire à peu près nulles. Il applique ensuite deux paramètres apprenables, gamma et bêta, qui permettent au réseau d'évoluer et de décaler les valeurs normalisées si cela aide, de sorte qu'il ne perd aucun pouvoir de représentation. Les bénéfices sont importants : les réseaux tolèrent des taux d’apprentissage plus élevés, convergent sur moins d’époques, sont moins sensibles à l’initialisation du poids et généralisent souvent un peu mieux. Le problème est que le comportement dépend des statistiques des lots, donc de très petits lots peuvent le rendre instable.

Aperçu technique

Pour chaque caractéristique d'un mini-lot, la norme de lot calcule la moyenne et la variance du lot, soustrait la moyenne et divise par l'écart type (plus un petit epsilon pour la stabilité). Il génère ensuite le gamma multiplié par la valeur normalisée plus bêta, où le gamma et le bêta sont appris. Pendant la formation, il utilise des statistiques de lots en direct tout en conservant les moyennes courantes ; au moment de l'inférence, il passe à ces moyennes courantes stockées afin que les prédictions ne dépendent pas des autres exemples qui partagent le lot. Il est généralement inséré entre le pas linéaire d'une couche et sa fonction d'activation.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de la normalisation par lots

La normalisation par lots reste un outil essentiel dans les modèles de vision convolutive, mais sa dépendance aux statistiques par lots est délicate pour les réseaux récurrents, les petits lots et la formation distribuée. Cela a conduit à l'adoption d'alternatives telles que la normalisation des couches, qui normalise les fonctionnalités dans un seul exemple et domine désormais les architectures de transformateurs, ainsi que la normalisation des groupes et des instances pour des domaines spécifiques. La recherche se poursuit sur des réseaux sans normalisation qui correspondent à leurs avantages grâce à une initialisation et une mise à l'échelle minutieuses. Attendez-vous à ce que la normalisation reste essentielle, la variante spécifique étant choisie pour s'adapter à l'architecture.

Mise en œuvre dans le monde réel

Insertion de couches de normes par lots dans un classificateur d'images ResNet afin qu'il puisse s'entraîner avec un taux d'apprentissage plus élevé et converger en beaucoup moins d'époques.

Stabiliser la formation d'un réseau convolutif profond pour l'imagerie médicale qui divergeait auparavant sans normalisation.

Réduire la sensibilité à l'initialisation du poids dans un CNN personnalisé, afin que les ingénieurs passent moins de temps à régler manuellement les valeurs de départ.

Passage des statistiques par lots en mode formation aux moyennes courantes stockées lors du déploiement d'un modèle afin que les prédictions d'une seule image restent cohérentes.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Batch Normalization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

RMSNorm et normalisation de pré-couche

Questions fréquemment posées

What is Batch Normalization?

La normalisation par lots est une technique qui redimensionne les entrées de chaque couche d'un réseau neuronal pendant l'entraînement, ce qui rend l'entraînement des réseaux profonds plus rapide et plus fiable. C’est devenu l’une des astuces les plus utilisées en matière d’apprentissage profond.

Que normalise la normalisation par lots ?

La norme par lots standardise les entrées d'une couche à l'aide de la moyenne et de la variance calculées sur le mini-lot actuel, maintenant ainsi les activations dans une plage stable au fur et à mesure de la progression de l'entraînement.

Pourquoi la normalisation par lots inclut-elle les paramètres apprenables gamma et bêta ?

Après avoir normalisé la moyenne et la variance unitaire à zéro, gamma et bêta permettent au réseau de redimensionner et de re-décaler les valeurs si cela est bénéfique, de sorte que la normalisation ne limite pas ce que la couche peut représenter.

Quel est l’avantage pratique fréquemment cité de la normalisation par lots ?

En maintenant les entrées de couche à bonne échelle, la norme par lots permet aux réseaux de s'entraîner avec des taux d'apprentissage plus élevés, de converger plus rapidement et d'être moins sensibles à l'initialisation.

Au moment de l'inférence (prédiction sur de nouvelles données), quelles statistiques la normalisation par lots utilise-t-elle ?

L'utilisation de statistiques de lots en direct lors de l'inférence ferait dépendre une prédiction des autres exemples partageant le lot. Au lieu de cela, la norme par lots utilise des moyennes courantes fixes stockées pendant l'entraînement.

Pourquoi la normalisation des lots peut-elle mal se comporter avec des lots de très petite taille ?

La norme du lot dépend de l'estimation de la moyenne et de la variance par rapport au lot. Avec très peu d’exemples, ces estimations sont bruitées, ce qui peut déstabiliser la formation.