Техническо РЪКОВОДСТВО

Графици за загряване и косинусово отгряване

Warmup леко повишава скоростта на обучение от почти нула преди тренировка, след което косинусното отгряване плавно го намалява обратно след косинусова крива.

2 min readПоследна актуализация

Преглед

Together they stabilize early training and squeeze out better final accuracy, which is why nearly every modern transformer is trained this way.

Дълбоко гмуркане

Когато обучението започне, теглата на модела са произволни и градиентите могат да бъдат огромни, така че прескачането директно към голяма скорост на обучение често причинява пикове на загуба или отклонение - особено с адаптивни оптимизатори като Адам, чиито оценки на дисперсията са ненадеждни в първите стъпки. Warmup коригира това чрез линейно увеличаване на скоростта за няколкостотин до няколко хиляди стъпки. След като моделът е на стабилна основа, косинусното отгряване поема, намалявайки скоростта като 0,5 * (1 + cos(pi * t / T)) от неговия пик. Косинусната форма поддържа скоростта висока рано за бърз напредък, след което намалява постепенно, така че оптимизаторът да може да се установи на добър минимум, вместо да подскача около него.

Техническа информация

Косинусното отгряване мащабира скоростта на обучение с 0,5 * (1 + cos(pi * t / T)), където t е текущата стъпка, а T е общата сума. Това прекарва дълго време близо до пиковата скорост, затихва най-бързо в средата, след което се изравнява близо до нулата в края - за разлика от правия линеен затихване. Загряването обикновено е линейно и кратко. Комбинираната крива изглежда като плавен хълм: нагоре, като плато, след това меко плъзгане до почти нула.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на графиците за загряване и косинусово отгряване

Warmup-plus-cosine остава стандартната рецепта за големи езикови модели, но вариантите се разпространяват. Warmup-stable-decay (WSD) поддържа постоянна скорост, след което рязко намалява в края, което улеснява удължаването на серии без повторно обвързване с фиксирана дължина. Изследователите също така проучват защо загряването работи - свързвайки го с градиентния шум и изкривяването на ландшафта на загубата - и инструментите все повече автоматично настройват дължината на загряване и пиковата скорост, намалявайки ръчните проби и грешки, които доминират днес.

Внедряване в реалния свят

Езиковите модели в стил GPT и BERT използват линейно загряване през първите ~1-2% от стъпките, последвани от косинусово затихване до почти нула.

Визуалните трансформатори (ViT) тренират с косинусово отгряване и кратко загряване, за да се избегне ранно разминаване в ImageNet.

Hugging Face Transformers предлага `get_cosine_schedule_with_warmup` като едноредов планировчик за фина настройка на задачи.

Стабилна дифузия и други дифузионни модели се настройват фино със загряване, за да предотвратят градиентни експлозии при адаптиране на предварително обучени тежести.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Минимизиране с острота

Frequently asked questions

What is Warmup and Cosine Annealing Schedules?

Warmup леко повишава скоростта на обучение от почти нула преди тренировка, след което косинусното отгряване плавно го намалява обратно след косинусова крива. Заедно те стабилизират ранното обучение и изстискват по-добра крайна точност, поради което почти всеки модерен трансформатор се обучава по този начин.

Каква е основната цел на фазата на загряване в началото на тренировката?

Започването с голяма скорост на учене на произволни тегла може да доведе до скокове на загуба или отклонение, така че загрявката повишава леко скоростта, за да поддържа ранните стъпки стабилни.

Косинусното отгряване намалява скоростта на обучение, следвайки коя форма?

Скоростта се мащабира с 0,5 * (1 + cos(pi * t / T)), създавайки плавен хълм, който остава висок в началото и се плъзга почти до нула в края.

Кой оптимизатор има особена полза от загряването, тъй като неговите оценки на дисперсията са ненадеждни в началото?

Оценките на текущата дисперсия на Адам се основават на много малко проби в първите стъпки, което прави ефективния размер на стъпката непостоянен - ​​загряването смекчава това.

Във формулата за косинус какво представлява Т?

T е хоризонтът, над който скоростта намалява от своя връх до почти нула; t е текущата стъпка в рамките на този хоризонт.

Какво е едно от предимствата на варианта със стабилен разпад при загряване (WSD) пред косинуса с фиксирана дължина?

WSD поддържа постоянна скорост, след което рязко намалява в края, така че можете да поддържате стабилната фаза по-дълго и да решите точката на спиране по-късно.