Öğrenme Oranı Planlama
Öğrenme hızı çizelgesi, eğitim sırasında adım boyutunu sabit tutmak yerine değiştirir.
Genel Bakış
Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.
Derin Dalış
Öğrenme oranı, optimize edicinin her güncellemede ne kadar büyük bir adım atacağını kontrol eder. Çok yüksek ve eğitim birbirinden farklı; çok alçakta sürünür veya sıkışır. Planlama bu değeri zaman içinde ayarlar. Yaygın olarak kullanılan modern bir tarif, ısınma ve ardından zayıflamadır: sıfıra yakın bir yerden başlayın ve ilk birkaç yüz veya bin adımı artırın (böylece erken, gürültülü eğimler dengesiz ağırlıkları havaya uçurmaz), sonra yavaş yavaş azalır. Popüler bozunum şekilleri arasında adımlı bozunma (belirlenen dönemlerde bir faktöre göre düşme), üstel bozunma ve sıfıra yakın bir yarı kosinüs eğrisini sorunsuz bir şekilde takip eden kosinüs tavlaması bulunur. Doğrusal ısınmaya sahip kosinüs programları artık büyük dil modellerinin eğitimi için standarttır; döngüsel ve tek döngülü politikalar ise daha küçük model eğitimini hızlandırabilir.
Teknik Bilgi
Isınma önemlidir çünkü Adam gibi uyarlanabilir optimizerlerin ilk adımlarda güvenilmez ikinci an tahminleri vardır; küçük bir öğrenme oranı, bu istatistikler yerleşmeden önce ağırlıkların istikrarsızlaştırılmasını önler. Kosinüs tavlaması lr = lr_min + 0,5 * (lr_max - lr_min) * (1 + cos(pi * t / T)) değerini ayarlar, bu da erkenden hızlı ilerleme sağlar ve sona doğru küçük, ince ayar adımları sağlar. Bazı programlar sıcak yeniden başlatmalar ekleyerek keskin minimumlardan kaçınmak için oranı tekrar yükseltir.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
Öğrenme Oranı Planlamanın Geleceği
Eğitim çalıştırmaları daha pahalı hale geldikçe, programlar optimize ediciler ve parti boyutlarıyla birlikte tasarlanıyor ve araştırmacılar, eğitimden önce en iyi zirve oranını tahmin etmek için ölçeklendirme yasalarını inceliyor. Önceden bir bozulma eğrisi seçme ihtiyacını ortadan kaldıran programdan bağımsız optimize ediciler ilgi kazanıyor ve canlı kayıp eğrilerine yanıt veren uyarlanabilir, geri bildirime dayalı programlar, hala büyük ölçekli eğitime hakim olan deneme yanılma sürecini azaltabilir.
Gerçek Dünya Uygulaması
Dönüştürücü dil modellerinin ön eğitimi sırasında kullanılan doğrusal ısınma artı kosinüs azalması.
ImageNet'te görüntü sınıflandırıcıları eğitirken 30, 60 ve 90. dönemlerde öğrenme oranını 10 kat düşüren adım azalması.
Fast.ai'deki tek döngü politikası, bir modeli çok az sayıda dönemde iyi bir doğrulukla eğitmek için kullanılır.
Keskin kayıp minimumlarından periyodik olarak kurtulmak ve genellemeyi geliştirmek için sıcak yeniden başlatmalarla kosinüs tavlaması.
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Learning Rate Scheduling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Döngüsel Öğrenme Oranları
Sık sorulan sorular
What is Learning Rate Scheduling?
Öğrenme hızı çizelgesi, eğitim sırasında adım boyutunu sabit tutmak yerine değiştirir. Doğru yapmak, genellikle bir modelin hızlı bir şekilde yakınsayıp yüksek doğruluğa ulaşıp ulaşmadığını belirleyen en büyük kaldıraçtır.
Öğrenme oranı çizelgesindeki 'ısınma' aşamasının amacı nedir?
Isınma sıfıra yakın bir yerde başlar ve oranı artırır, böylece kararsız erken güncellemeler, optimize edici istatistikleri yerleşmeden önce modelin istikrarını bozmaz.
Hangi program, minimum orana doğru yarım kosinüs eğrisini sorunsuz bir şekilde takip eder?
Kosinüs tavlaması, öğrenme oranını yarım kosinüs şekline göre azaltarak, büyük adımların erken ve küçük adımların sona yakın olmasını sağlar.
Öğrenme oranı çok yüksek ayarlanırsa ne olur?
Aşırı yüksek bir oran aşırıya kaçmaya neden olur, bu nedenle kayıp yerleşmek yerine sıçrayabilir veya patlayabilir.
Adım bozunması öğrenme oranına ne yapar?
Adım azalması, seçilen kilometre taşlarında oranı bir faktörle (örneğin 0,1) çarparak bir merdiven modeli oluşturur.
Neden bazen programa 'sıcak yeniden başlatmalar' ekleniyor?
Sıcak yeniden başlatmalar, öğrenme oranını aralıklarla yükselterek optimize edicinin dar minimumlardan çıkıp daha iyi çözümler keşfetmesine yardımcı olur.