Teknik KILAVUZ

Isınma ve Kosinüs Tavlama Programları

Isınma, eğitimden önce öğrenme oranını yavaşça sıfıra yakın bir seviyeden yukarıya çıkarır, ardından kosinüs tavlama, bir kosinüs eğrisini takip ederek yavaşça geri düşürür.

2 min readSon güncelleme

Genel Bakış

Together they stabilize early training and squeeze out better final accuracy, which is why nearly every modern transformer is trained this way.

Derin Dalış

Eğitim başladığında, model ağırlıkları rastgeledir ve gradyanlar çok büyük olabilir, bu nedenle doğrudan büyük bir öğrenme oranına atlamak genellikle kayıplarda ani artışlara veya sapmalara neden olur; özellikle de varyans tahminleri ilk adımlarda güvenilmez olan Adam gibi uyarlanabilir optimize edicilerde. Isınma, hızı birkaç yüzden birkaç bin adıma kadar doğrusal olarak artırarak bu sorunu giderir. Model istikrarlı bir temele oturduğunda, kosinüs tavlaması devreye girer ve oranı zirve noktasının 0,5 * (1 + cos(pi * t / T)) kadar bozar. Kosinüs şekli, hızlı ilerleme için hızı erkenden yüksek tutar, ardından yavaş yavaş azalır, böylece optimize edici, bunun etrafında zıplamak yerine iyi bir minimum seviyeye yerleşebilir.

Teknik Bilgi

Kosinüs tavlaması, öğrenme oranını 0,5 * (1 + cos(pi * t / T)) oranında ölçeklendirir; burada t, geçerli adımdır ve T, toplamdır. Bu, tepe hızının yakınında uzun bir süre geçirir, ortada en hızlı şekilde bozunur, ardından düz doğrusal bir bozunmanın aksine, sonunda sıfıra yakın düzleşir. Isınma genellikle doğrusal ve kısadır. Birleşik eğri düzgün bir tepeye benziyor: yukarı, plato benzeri, ardından neredeyse sıfıra doğru yumuşak bir süzülme.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Isınma ve Kosinüs Tavlama Programlarının Geleceği

Warmup artı kosinüs, büyük dil modelleri için varsayılan reçete olmaya devam ediyor, ancak çeşitleri yayılıyor. Isınma-kararlı-bozulma (WSD), sabit bir hızı korur ve sonunda keskin bir şekilde azalarak koşuları sabit bir uzunluğa yeniden bağlı kalmadan uzatmayı kolaylaştırır. Araştırmacılar aynı zamanda ısınmanın neden işe yaradığını (bunu gradyan gürültüsüne ve kayıp manzara eğriliğine bağlayarak) araştırıyor ve araçlar, ısınma uzunluğunu ve zirve hızını giderek daha fazla otomatik olarak ayarlayarak günümüzde hakim olan manuel deneme yanılma işlemini azaltıyor.

Gerçek Dünya Uygulaması

GPT tarzı ve BERT tarzı dil modelleri, adımların ilk ~%1-2'si boyunca doğrusal bir ısınma ve ardından sıfıra yakın kosinüs azalması kullanır.

Görüntü transformatörleri (ViT), ImageNet'te erken sapmayı önlemek için kosinüs tavlama ve kısa bir ısınma ile eğitilir.

Hugging Face Transformers, işlerin ince ayarı için tek satırlı bir zamanlayıcı olarak "get_cosine_schedule_with_warmup" özelliğini sunar.

Stabil Difüzyon ve diğer difüzyon modelleri, önceden eğitilmiş ağırlıklar uyarlanırken gradyan patlamalarını önlemek için ısınmayla ince ayar yapar.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Warmup and Cosine Annealing Schedules quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Keskinliğe Duyarlı Minimizasyon

Sık sorulan sorular

What is Warmup and Cosine Annealing Schedules?

Isınma, eğitimden önce öğrenme oranını yavaşça sıfıra yakın bir seviyeden yukarıya çıkarır, ardından kosinüs tavlama, bir kosinüs eğrisini takip ederek yavaşça geri düşürür. Birlikte erken eğitimi stabilize ederler ve daha iyi nihai doğruluk elde ederler; bu nedenle neredeyse her modern transformatör bu şekilde eğitilir.

Antrenman başlangıcındaki ısınma aşamasının temel amacı nedir?

Rastgele ağırlıklar üzerinde büyük bir öğrenme oranıyla başlamak, kayıplarda ani artışlara veya sapmalara neden olabilir; bu nedenle ısınma, ilk adımları sabit tutmak için hızı yavaşça artırır.

Kosinüs tavlaması hangi şekle göre öğrenme oranını bozar?

Oran 0,5 * (1 + cos(pi * t / T)) ile ölçeklendirilir ve erken dönemde yüksek kalan ve sonunda sıfıra yakın kayan düzgün bir tepe oluşturulur.

Varyans tahminleri başlangıçta güvenilmez olduğundan hangi optimize edici ısınmadan özellikle yararlanır?

Adam'ın devam eden varyans tahminleri, ilk adımlarda çok az sayıda örneğe dayanıyor ve bu da etkili adım boyutunu düzensiz hale getiriyor; ısınma bunu hafifletiyor.

Kosinüs formülünde T neyi temsil eder?

T, oranın zirveden sıfıra yakın bir noktaya doğru azaldığı ufuktur; t, bu ufuktaki mevcut adımdır.

Isınma-kararlı-bozunma (WSD) varyantının sabit uzunluklu kosinüse göre avantajı nedir?

WSD sabit bir hıza sahiptir ve sonunda keskin bir şekilde azalır, böylece kararlı aşamayı daha uzun süre devam ettirebilir ve durma noktasına daha sonra karar verebilirsiniz.