Technische GIDS

Opwarm- en cosinus-gloeischema's

Met de warming-up wordt het leertempo voorzichtig verhoogd vanaf bijna nul vóór de training, waarna cosinus-gloeien het leerproces soepel weer laat afnemen volgens een cosinus-curve.

2 min readLaatst bijgewerkt

Overzicht

Together they stabilize early training and squeeze out better final accuracy, which is why nearly every modern transformer is trained this way.

Diepe duik

Wanneer de training begint, zijn de modelgewichten willekeurig en kunnen de gradiënten enorm zijn, dus als je meteen naar een hoog leertempo gaat, veroorzaakt dit vaak verliespieken of divergentie – vooral bij adaptieve optimizers zoals Adam, wiens variantieschattingen in de eerste stappen onbetrouwbaar zijn. Warmup lost dit op door de snelheid lineair te verhogen over een paar honderd tot een paar duizend stappen. Zodra het model stabiel staat, neemt cosinus-gloeien het over, waardoor de snelheid afneemt tot 0,5 * (1 + cos (pi * t / T)) van de piek. De cosinusvorm houdt de snelheid vroeg hoog voor snelle vooruitgang, en neemt vervolgens geleidelijk af, zodat de optimizer zich op een goed minimum kan vestigen in plaats van er omheen te stuiteren.

Technisch inzicht

Cosinus-gloeien schaalt de leersnelheid met 0,5 * (1 + cos(pi * t / T)), waarbij t de huidige stap is en T het totaal. Dit blijft lange tijd in de buurt van de pieksnelheid, vervalt het snelst in het midden en vlakt vervolgens af tot bijna nul aan het einde - in tegenstelling tot een recht lineair verval. De opwarming is doorgaans lineair en kort. De gecombineerde curve ziet eruit als een gladde heuvel: omhoog, plateau-achtig, en dan zacht glijdend naar bijna nul.

Strategische impact

Cost and budget

Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.

Clearer decisions

Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.

Quality control

Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.

De toekomst van opwarm- en cosinus-gloeischema's

Warmup-plus-cosinus blijft het standaardrecept voor grote taalmodellen, maar varianten verspreiden zich. Warmup-stable-decay (WSD) houdt een constante snelheid aan en vervalt vervolgens scherp aan het einde, waardoor het gemakkelijk wordt om runs uit te breiden zonder opnieuw een vaste lengte vast te leggen. Onderzoekers bestuderen ook waarom de opwarming werkt – door dit te koppelen aan gradiëntruis en verlies-landschapskromming – en tools stemmen de opwarmlengte en pieksnelheid steeds vaker automatisch af, waardoor het handmatige vallen en opstaan ​​dat tegenwoordig domineert, wordt verminderd.

Implementatie in de echte wereld

Taalmodellen in GPT-stijl en BERT-stijl gebruiken een lineaire opwarming gedurende de eerste ~1-2% van de stappen, gevolgd door cosinusverval tot bijna nul.

Visietransformatoren (ViT) trainen met cosinus-gloeien en een korte opwarming om vroegtijdige divergentie op ImageNet te voorkomen.

Hugging Face Transformers biedt `get_cosine_schedule_with_warmup` als een éénregelige planner voor het verfijnen van taken.

Stabiele diffusie- en andere diffusiemodellen worden nauwkeurig afgesteld met opwarming om gradiëntexplosies te voorkomen bij het aanpassen van vooraf getrainde gewichten.

Risico's en vangrails

Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.

Infrastructuur- en onderhoudskosten worden vaak onderschat.

De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.

Implementatie routekaart

1

Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.

2

Benchmark onder realistische belasting- en gegevensomstandigheden.

3

Instrumentbewaking op fouten, drift en gebruikersimpact.

4

Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.

Blijf verkennen

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Scherptebewuste minimalisatie

Frequently asked questions

What is Warmup and Cosine Annealing Schedules?

Met de warming-up wordt het leertempo voorzichtig verhoogd vanaf bijna nul vóór de training, waarna cosinus-gloeien het leerproces soepel weer laat afnemen volgens een cosinus-curve. Samen stabiliseren ze de vroege training en zorgen ze voor een betere eindnauwkeurigheid. Daarom wordt bijna elke moderne transformator op deze manier getraind.

Wat is het hoofddoel van de opwarmfase aan het begin van de training?

Beginnen met een hoog leertempo op willekeurige gewichten kan verliespieken of divergentie veroorzaken, dus bij het opwarmen wordt het tempo langzaam opgevoerd om de eerste stappen stabiel te houden.

Cosinus-gloeien vervalt de leersnelheid volgens welke vorm?

De snelheid wordt geschaald met 0,5 * (1 + cos(pi * t / T)), waardoor een gladde heuvel ontstaat die vroeg hoog blijft en aan het eind naar bijna nul glijdt.

Welke optimizer profiteert vooral van opwarming omdat de variantieschattingen in een vroeg stadium onbetrouwbaar zijn?

Adams schattingen van de lopende variantie zijn gebaseerd op zeer weinig steekproeven in de eerste stappen, waardoor de effectieve stapgrootte grillig is; de opwarming verzacht dit.

Wat vertegenwoordigt T in de cosinusformule?

T is de horizon waarover de snelheid vervalt van de piek naar bijna nul; t is de huidige stap binnen die horizon.

Wat is een voordeel van de warmup-stable-decay (WSD)-variant ten opzichte van de cosinus met vaste lengte?

WSD heeft een constante snelheid en vervalt aan het einde scherp, zodat je de stabiele fase langer kunt laten voortduren en later het stoppunt kunt bepalen.