GUIDE Technique

Planification du taux d'apprentissage

Un programme de rythme d'apprentissage modifie la taille des pas pendant l'entraînement au lieu de la maintenir fixe.

2 minutes de lectureDernière mise à jour

Aperçu

Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.

Plongée profonde

Le taux d'apprentissage contrôle l'ampleur du pas effectué par l'optimiseur à chaque mise à jour. Trop élevé et la formation diverge ; trop bas et il rampe ou reste bloqué. La planification ajuste cette valeur au fil du temps. Une recette moderne courante est l'échauffement suivi d'une décroissance : commencez près de zéro et augmentez au cours des premières centaines ou milliers de pas (si tôt, les gradients bruyants ne font pas exploser les poids instables), puis diminuez progressivement. Les formes de désintégration populaires incluent la désintégration par étapes (chute d'un facteur à des époques définies), la désintégration exponentielle et le recuit cosinus, qui suit en douceur une courbe demi-cosinus jusqu'à près de zéro. Les programmes cosinus avec échauffement linéaire sont désormais standard pour la formation de grands modèles de langage, tandis que les politiques cycliques et à un cycle peuvent accélérer la formation de modèles plus petits.

Aperçu technique

L'échauffement est important car les optimiseurs adaptatifs comme Adam ont des estimations peu fiables du deuxième instant dans les premières étapes ; un faible taux d'apprentissage évite de déstabiliser les poids avant que ces statistiques ne se stabilisent. Le recuit cosinus définit lr = lr_min + 0,5 * (lr_max - lr_min) * (1 + cos(pi * t / T)), donnant des progrès rapides au début et de minuscules étapes de réglage fin vers la fin. Certains programmes ajoutent des redémarrages à chaud, augmentant ainsi le taux pour échapper à des minimums brusques.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de la planification des taux d'apprentissage

À mesure que les cycles de formation deviennent de plus en plus coûteux, les calendriers sont co-conçus avec des optimiseurs et des tailles de lots, et les chercheurs étudient les lois de mise à l'échelle pour prédire le meilleur taux de pointe avant la formation. Les optimiseurs sans planification qui éliminent le besoin de choisir une courbe de décroissance à l'avance gagnent du terrain, et des planifications adaptatives et basées sur la rétroaction qui répondent aux courbes de perte en direct peuvent réduire les essais et erreurs qui dominent encore la formation à grande échelle.

Mise en œuvre dans le monde réel

Échauffement linéaire et désintégration du cosinus utilisés lors de la pré-entraînement des modèles de langage de transformateur.

Décroissance progressive qui réduit le taux d'apprentissage de 10 fois aux époques 30, 60 et 90 lors de la formation des classificateurs d'images sur ImageNet.

La politique d'un cycle dans fast.ai pour former un modèle avec une bonne précision en très peu d'époques.

Recuit cosinus avec redémarrages à chaud pour échapper périodiquement aux minima de pertes brusques et améliorer la généralisation.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Learning Rate Scheduling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Taux d'apprentissage cyclique

Questions fréquemment posées

What is Learning Rate Scheduling?

Un programme de rythme d'apprentissage modifie la taille des pas pendant l'entraînement au lieu de la maintenir fixe. Bien faire les choses est souvent le principal levier pour déterminer si un modèle converge rapidement et atteint une précision élevée.

Quel est l'objectif d'une phase de « préchauffage » dans un barème de taux d'apprentissage ?

Le préchauffage commence près de zéro et augmente le taux afin que les premières mises à jour instables ne déstabilisent pas le modèle avant que les statistiques de l'optimiseur ne se stabilisent.

Quel horaire suit en douceur une courbe demi-cosinus jusqu'à un taux minimum ?

Le recuit cosinus diminue le taux d'apprentissage selon une forme en demi-cosinus, donnant de grands pas au début et de petits pas vers la fin.

Que se passe-t-il si le taux d’apprentissage est beaucoup trop élevé ?

Un taux trop élevé provoque un dépassement, de sorte que la perte peut rebondir ou exploser plutôt que de se stabiliser.

Quel est l'effet de la désintégration sur le taux d'apprentissage ?

La décroissance des échelons multiplie le taux par un facteur (par exemple, 0,1) aux jalons choisis, créant ainsi un motif en escalier.

Pourquoi des « redémarrages à chaud » sont-ils parfois ajoutés à un calendrier ?

Les redémarrages à chaud augmentent le taux d'apprentissage à intervalles réguliers, aidant l'optimiseur à sortir des minima étroits et à explorer de meilleures solutions.