Planning van leersnelheid
Een leersnelheidschema verandert de stapgrootte tijdens de training in plaats van deze vast te houden.
Overzicht
Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.
Diepe duik
De leersnelheid bepaalt hoe groot de stap is die de optimizer bij elke update zet. Te hoog en de opleiding loopt uiteen; te laag en hij kruipt of komt vast te zitten. Planning past deze waarde in de loop van de tijd aan. Een gebruikelijk modern recept is opwarmen gevolgd door verval: begin bij nul en voer de eerste paar honderd of duizend stappen op (zo vroeg, luidruchtige hellingen blazen onstabiele gewichten niet op), en nemen dan geleidelijk af. Populaire vormen van verval zijn onder meer stapsgewijs verval (daling met een factor op vaste tijdstippen), exponentieel verval en cosinus-gloeien, dat vloeiend een half-cosinuscurve volgt tot bijna nul. Cosinusschema's met lineaire opwarming zijn nu standaard voor het trainen van grote taalmodellen, terwijl cyclisch en één-cyclusbeleid de training van kleinere modellen kan versnellen.
Technisch inzicht
Opwarming is belangrijk omdat adaptieve optimizers zoals Adam bij de eerste stappen onbetrouwbare schattingen van het tweede moment hebben; een klein leertempo voorkomt dat de gewichten worden gedestabiliseerd voordat deze statistieken zich vestigen. Cosinus-gloeiende sets lr = lr_min + 0,5 * (lr_max - lr_min) * (1 + cos(pi * t / T)), wat snelle vooruitgang in het begin en kleine, fijnafstemmingsstappen tegen het einde oplevert. Sommige schema's voegen warme herstarts toe, waardoor de snelheid weer omhoog gaat om aan scherpe minima te ontsnappen.
Strategische impact
Cost and budget
Architectuurbeslissingen bepalen jarenlang de prestaties en bedrijfskosten.
Clearer decisions
Technisch onderwijs helpt teams bij het kiezen van de juiste stapel, niet alleen de nieuwste.
Quality control
Betere technische keuzes verminderen het aantal betrouwbaarheidsincidenten in de productie.
De toekomst van leersnelheidplanning
Naarmate trainingsruns duurder worden, worden schema's samen met optimizers en batchgroottes ontworpen, en onderzoeken onderzoekers schaalwetten om de beste pieksnelheid vóór de training te voorspellen. Schedule-free optimizers die de noodzaak wegnemen om van tevoren een vervalcurve te kiezen, winnen aan kracht, en adaptieve, feedbackgestuurde schema's die reageren op live-verliescurven kunnen het vallen en opstaan dat nog steeds grootschalige training domineert, verminderen.
Implementatie in de echte wereld
Lineaire opwarming plus cosinusverval gebruikt bij het voortrainen van transformatortaalmodellen.
Stapsgewijs verval dat de leersnelheid met 10x verlaagt in tijdperken 30, 60 en 90 bij het trainen van beeldclassificatoren op ImageNet.
Het één-cyclusbeleid in fast.ai om een model in zeer weinig tijdvakken tot goede nauwkeurigheid te trainen.
Cosinus-gloeien met warme herstarts om periodiek aan scherpe verliesminima te ontsnappen en de generalisatie te verbeteren.
Risico's en vangrails
Het optimaliseren van één benchmark kan bredere systeemzwakheden verbergen.
Infrastructuur- en onderhoudskosten worden vaak onderschat.
De lacunes op het gebied van beveiliging en waarneembaarheid kunnen groter worden naarmate systemen complexer worden.
Implementatie routekaart
Definieer latentie-, kwaliteits- en kostendoelen vóór implementatie.
Benchmark onder realistische belasting- en gegevensomstandigheden.
Instrumentbewaking op fouten, drift en gebruikersimpact.
Bereid rollback- en incidentresponspaden voor voordat u gaat schalen.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Learning Rate Scheduling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Cyclische leertarieven
Frequently asked questions
What is Learning Rate Scheduling?
Een leersnelheidschema verandert de stapgrootte tijdens de training in plaats van deze vast te houden. De juiste keuze is vaak de grootste factor die bepaalt of een model snel convergeert en een hoge nauwkeurigheid bereikt.
Wat is het doel van een 'opwarmfase' in een leertemposchema?
De opwarming begint bij nul en verhoogt de snelheid, zodat onstabiele vroege updates het model niet destabiliseren voordat de optimalisatiestatistieken zich vestigen.
Welk schema volgt soepel een halve cosinuscurve naar beneden richting een minimumtarief?
Door cosinus-gloeien vervalt de leersnelheid langs een halve cosinus-vorm, waardoor grote stappen vroeg en kleine stappen aan het einde ontstaan.
Wat gebeurt er als het leertempo veel te hoog wordt vastgesteld?
Een te hoog tarief veroorzaakt overschrijding, waardoor het verlies kan stuiteren of opblazen in plaats van zich te vestigen.
Wat doet stapverval met de leersnelheid?
Stapsgewijs verval vermenigvuldigt de snelheid met een factor (bijvoorbeeld 0,1) bij gekozen mijlpalen, waardoor een trappatroon ontstaat.
Waarom worden er soms 'warme herstarts' aan een schema toegevoegd?
Warme herstarts zorgen ervoor dat de leersnelheid met tussenpozen weer omhoog gaat, waardoor de optimizer uit de smalle minima kan stappen en betere oplossingen kan verkennen.