GUIDE Technique

Programmes d'échauffement et de recuit cosinus

L'échauffement augmente doucement le taux d'apprentissage à partir de près de zéro avant l'entraînement, puis le recuit cosinus le diminue progressivement en suivant une courbe cosinus.

2 minutes de lectureDernière mise à jour

Aperçu

Together they stabilize early training and squeeze out better final accuracy, which is why nearly every modern transformer is trained this way.

Plongée profonde

Lorsque la formation commence, les pondérations du modèle sont aléatoires et les gradients peuvent être énormes, donc passer directement à un taux d'apprentissage élevé provoque souvent des pics de perte ou des divergences, en particulier avec des optimiseurs adaptatifs comme Adam, dont les estimations de variance ne sont pas fiables dans les premières étapes. Warmup résout ce problème en augmentant linéairement la vitesse sur quelques centaines à quelques milliers d'étapes. Une fois que le modèle est sur une base stable, le recuit cosinus prend le relais, diminuant le taux de 0,5 * (1 + cos(pi * t / T)) de son pic. La forme en cosinus maintient le taux élevé au début pour des progrès rapides, puis diminue progressivement afin que l'optimiseur puisse s'installer à un bon minimum au lieu de rebondir autour de lui.

Aperçu technique

Le recuit cosinus augmente le taux d'apprentissage de 0,5 * (1 + cos(pi * t / T)), où t est l'étape actuelle et T est le total. Celui-ci reste longtemps proche du taux de crête, décroît le plus rapidement au milieu, puis s'aplatit près de zéro à la fin – contrairement à une désintégration linéaire droite. L'échauffement est généralement linéaire et court. La courbe combinée ressemble à une colline douce : en montée, en forme de plateau, puis une glisse douce jusqu'à presque zéro.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir des programmes d'échauffement et de recuit cosinus

Warmup-plus-cosinus reste la recette par défaut pour les grands modèles de langage, mais des variantes se répandent. Warmup-stable-decay (WSD) maintient un taux constant puis décroît brusquement à la fin, ce qui facilite la prolongation des courses sans se réengager sur une longueur fixe. Les chercheurs étudient également pourquoi l’échauffement fonctionne – en le liant au bruit de gradient et à la courbure du paysage – et les outils ajustent de plus en plus automatiquement la durée de l’échauffement et la fréquence maximale, réduisant ainsi les essais et erreurs manuels qui dominent aujourd’hui.

Mise en œuvre dans le monde réel

Les modèles de langage de style GPT et BERT utilisent un échauffement linéaire sur les premiers 1 à 2 % des étapes, suivi d'une désintégration du cosinus jusqu'à près de zéro.

Les transformateurs de vision (ViT) s'entraînent avec un recuit cosinus et un court échauffement pour éviter une divergence précoce sur ImageNet.

Hugging Face Transformers propose « get_cosine_schedule_with_warmup » comme planificateur sur une seule ligne pour affiner les tâches.

La diffusion stable et d'autres modèles de diffusion s'ajustent avec l'échauffement pour éviter les explosions de gradient lors de l'adaptation de poids pré-entraînés.

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Minimisation sensible à la netteté

Questions fréquemment posées

What is Warmup and Cosine Annealing Schedules?

L'échauffement augmente doucement le taux d'apprentissage à partir de près de zéro avant l'entraînement, puis le recuit cosinus le diminue progressivement en suivant une courbe cosinus. Ensemble, ils stabilisent la formation initiale et permettent d'obtenir une meilleure précision finale, c'est pourquoi presque tous les transformateurs modernes sont formés de cette façon.

Quel est l’objectif principal de la phase d’échauffement en début d’entraînement ?

Commencer à un taux d'apprentissage élevé sur des poids aléatoires peut provoquer des pics de perte ou des divergences, c'est pourquoi l'échauffement augmente doucement le taux pour maintenir la stabilité des premières étapes.

Le recuit cosinus diminue le taux d'apprentissage selon quelle forme ?

Le taux est échelonné de 0,5 * (1 + cos(pi * t / T)), produisant une colline douce qui reste élevée au début et glisse jusqu'à près de zéro à la fin.

Quel optimiseur bénéficie particulièrement du préchauffage car ses estimations de variance ne sont pas fiables au début ?

Les estimations de variance courante d'Adam sont basées sur très peu d'échantillons dans les premières étapes, ce qui rend la taille de pas effective erratique – l'échauffement atténue cela.

Dans la formule du cosinus, que représente T ?

T est l’horizon sur lequel le taux décroît depuis son sommet jusqu’à près de zéro ; t est l’étape actuelle dans cet horizon.

Quel est l'un des avantages de la variante Warmup-Stable-Decay (WSD) par rapport au cosinus de longueur fixe ?

WSD maintient un taux constant puis décroît fortement à la fin, vous pouvez donc maintenir la phase stable plus longtemps et décider du point d'arrêt plus tard.