Teknisk GUIDE

Schema för uppvärmning och cosinusglödgning

Warmup ökar försiktigt inlärningshastigheten från nästan noll före träning, sedan cosinusglödgning avtar den mjukt igen efter en cosinuskurva.

2 min readSenast uppdaterad

Översikt

Together they stabilize early training and squeeze out better final accuracy, which is why nearly every modern transformer is trained this way.

Djupdykning

När träningen startar är modellvikterna slumpmässiga och gradienterna kan vara enorma, så att hoppa direkt till en hög inlärningshastighet orsakar ofta förlusttoppar eller divergens – särskilt med adaptiva optimerare som Adam, vars variansuppskattningar är otillförlitliga i de första stegen. Warmup fixar detta genom att linjärt öka hastigheten över några hundra till några tusen steg. När modellen väl står på stabilt underlag tar cosinusglödgning över, vilket minskar hastigheten till 0,5 * (1 + cos(pi * t / T)) av dess topp. Cosinusformen håller frekvensen hög tidigt för snabba framsteg, och avtar sedan gradvis så att optimeraren kan sätta sig på ett bra minimum istället för att studsa runt den.

Teknisk insikt

Cosinusglödgning skalar inlärningshastigheten med 0,5 * (1 + cos(pi * t / T)), där t är det aktuella steget och T är summan. Detta tillbringar lång tid nära topphastigheten, avtar snabbast i mitten och plattar sedan till nära noll i slutet - till skillnad från en rak linjär avklingning. Uppvärmning är vanligtvis linjär och kort. Den kombinerade kurvan ser ut som en jämn backe: upp, platåaktig, sedan en mjuk glidning till nästan noll.

Strategisk inverkan

Cost and budget

Arkitekturbeslut driver prestanda och driftskostnader i flera år.

Clearer decisions

Teknisk utbildning hjälper team att välja rätt stack, inte bara den nyaste.

Quality control

Bättre tekniska val minskar tillförlitlighetsincidenter i produktionen.

The Future of Warmup och Cosinusglödgningsscheman

Warmup-plus-cosinus är fortfarande standardreceptet för stora språkmodeller, men varianter sprider sig. Warmup-stable-decay (WSD) håller en konstant hastighet för att sedan avta kraftigt i slutet, vilket gör det enkelt att förlänga körningar utan att återgå till en fast längd. Forskare studerar också varför uppvärmning fungerar - kopplar det till gradientbrus och förlust-landskapskrökning - och verktyg ställer allt mer automatiskt in uppvärmningslängden och topphastigheten, vilket minskar det manuella försök och fel som dominerar idag.

Real-World Implementation

GPT-stil och BERT-stil språkmodeller använder en linjär uppvärmning under de första ~1-2% av stegen följt av cosinus sönderfall till nära noll.

Visionstransformatorer (ViT) tränar med cosinusglödgning och en kort uppvärmning för att undvika tidig divergens på ImageNet.

Hugging Face Transformers erbjuder "get_cosine_schedule_with_warmup" som en enradsschemaläggare för finjustering av jobb.

Stabil diffusionsmodell och andra diffusionsmodeller finjusteras med uppvärmning för att förhindra gradientexplosioner vid anpassning av förtränade vikter.

Risker & skyddsräcken

Att optimera ett riktmärke kan dölja bredare systemsvagheter.

Infrastruktur- och underhållskostnader underskattas ofta.

Säkerhets- och observerbarhetsluckor kan växa i takt med att systemen blir mer komplexa.

Färdplan för genomförande

1

Definiera latens-, kvalitet- och kostnadsmål före implementering.

2

Benchmark under realistiska belastnings- och dataförhållanden.

3

Instrumentövervakning för fel, drift och användarpåverkan.

4

Förbered återställnings- och incidentsvarsvägar innan skalning.

Fortsätt utforska

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Starta frågesport

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Skärpa-medveten minimering

Frequently asked questions

What is Warmup and Cosine Annealing Schedules?

Warmup ökar försiktigt inlärningshastigheten från nästan noll före träning, sedan cosinusglödgning avtar den mjukt igen efter en cosinuskurva. Tillsammans stabiliserar de tidig träning och pressar ut bättre slutnoggrannhet, vilket är anledningen till att nästan alla moderna transformatorer tränas på detta sätt.

Vad är huvudsyftet med uppvärmningsfasen i början av träningen?

Att börja med en hög inlärningshastighet på slumpmässiga vikter kan orsaka förlusttoppar eller divergens, så uppvärmningen ökar hastigheten försiktigt för att hålla tidiga steg stabila.

Cosinusglödgning minskar inlärningshastigheten efter vilken form?

Hastigheten skalas med 0,5 * (1 + cos(pi * t / T)), vilket ger en jämn backe som förblir hög tidigt och glider till nära noll i slutet.

Vilken optimerare gynnas särskilt av uppvärmning eftersom dess variansskattningar är otillförlitliga tidigt?

Adams uppskattningar av löpande varians är baserade på väldigt få prover i de första stegen, vilket gör den effektiva stegstorleken oregelbunden – uppvärmning mildrar detta.

Vad representerar T i cosinusformeln?

T är den horisont över vilken hastigheten avtar från sin topp till nära noll; t är det aktuella steget inom den horisonten.

Vad är en fördel med varianten warmup-stable-decay (WSD) jämfört med cosinus med fast längd?

WSD håller en konstant hastighet och avtar sedan kraftigt i slutet, så du kan hålla den stabila fasen igång längre och bestämma stopppunkten senare.