Teknik KILAVUZ

Öğrenme Oranı Planlama

Öğrenme hızı çizelgesi, eğitim sırasında adım boyutunu sabit tutmak yerine değiştirir.

2 min readSon güncelleme

Genel Bakış

Getting it right is often the single biggest lever for whether a model converges quickly and reaches high accuracy.

Derin Dalış

Öğrenme oranı, optimize edicinin her güncellemede ne kadar büyük bir adım atacağını kontrol eder. Çok yüksek ve eğitim birbirinden farklı; çok alçakta sürünür veya sıkışır. Planlama bu değeri zaman içinde ayarlar. Yaygın olarak kullanılan modern bir tarif, ısınma ve ardından zayıflamadır: sıfıra yakın bir yerden başlayın ve ilk birkaç yüz veya bin adımı artırın (böylece erken, gürültülü eğimler dengesiz ağırlıkları havaya uçurmaz), sonra yavaş yavaş azalır. Popüler bozunum şekilleri arasında adımlı bozunma (belirlenen dönemlerde bir faktöre göre düşme), üstel bozunma ve sıfıra yakın bir yarı kosinüs eğrisini sorunsuz bir şekilde takip eden kosinüs tavlaması bulunur. Doğrusal ısınmaya sahip kosinüs programları artık büyük dil modellerinin eğitimi için standarttır; döngüsel ve tek döngülü politikalar ise daha küçük model eğitimini hızlandırabilir.

Teknik Bilgi

Isınma önemlidir çünkü Adam gibi uyarlanabilir optimizerlerin ilk adımlarda güvenilmez ikinci an tahminleri vardır; küçük bir öğrenme oranı, bu istatistikler yerleşmeden önce ağırlıkların istikrarsızlaştırılmasını önler. Kosinüs tavlaması lr = lr_min + 0,5 * (lr_max - lr_min) * (1 + cos(pi * t / T)) değerini ayarlar, bu da erkenden hızlı ilerleme sağlar ve sona doğru küçük, ince ayar adımları sağlar. Bazı programlar sıcak yeniden başlatmalar ekleyerek keskin minimumlardan kaçınmak için oranı tekrar yükseltir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Öğrenme Oranı Planlamanın Geleceği

Eğitim çalıştırmaları daha pahalı hale geldikçe, programlar optimize ediciler ve parti boyutlarıyla birlikte tasarlanıyor ve araştırmacılar, eğitimden önce en iyi zirve oranını tahmin etmek için ölçeklendirme yasalarını inceliyor. Önceden bir bozulma eğrisi seçme ihtiyacını ortadan kaldıran programdan bağımsız optimize ediciler ilgi kazanıyor ve canlı kayıp eğrilerine yanıt veren uyarlanabilir, geri bildirime dayalı programlar, hala büyük ölçekli eğitime hakim olan deneme yanılma sürecini azaltabilir.

Gerçek Dünya Uygulaması

Dönüştürücü dil modellerinin ön eğitimi sırasında kullanılan doğrusal ısınma artı kosinüs azalması.

ImageNet'te görüntü sınıflandırıcıları eğitirken 30, 60 ve 90. dönemlerde öğrenme oranını 10 kat düşüren adım azalması.

Fast.ai'deki tek döngü politikası, bir modeli çok az sayıda dönemde iyi bir doğrulukla eğitmek için kullanılır.

Keskin kayıp minimumlarından periyodik olarak kurtulmak ve genellemeyi geliştirmek için sıcak yeniden başlatmalarla kosinüs tavlaması.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Learning Rate Scheduling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Döngüsel Öğrenme Oranları

Sık sorulan sorular

What is Learning Rate Scheduling?

Öğrenme hızı çizelgesi, eğitim sırasında adım boyutunu sabit tutmak yerine değiştirir. Doğru yapmak, genellikle bir modelin hızlı bir şekilde yakınsayıp yüksek doğruluğa ulaşıp ulaşmadığını belirleyen en büyük kaldıraçtır.

Öğrenme oranı çizelgesindeki 'ısınma' aşamasının amacı nedir?

Isınma sıfıra yakın bir yerde başlar ve oranı artırır, böylece kararsız erken güncellemeler, optimize edici istatistikleri yerleşmeden önce modelin istikrarını bozmaz.

Hangi program, minimum orana doğru yarım kosinüs eğrisini sorunsuz bir şekilde takip eder?

Kosinüs tavlaması, öğrenme oranını yarım kosinüs şekline göre azaltarak, büyük adımların erken ve küçük adımların sona yakın olmasını sağlar.

Öğrenme oranı çok yüksek ayarlanırsa ne olur?

Aşırı yüksek bir oran aşırıya kaçmaya neden olur, bu nedenle kayıp yerleşmek yerine sıçrayabilir veya patlayabilir.

Adım bozunması öğrenme oranına ne yapar?

Adım azalması, seçilen kilometre taşlarında oranı bir faktörle (örneğin 0,1) çarparak bir merdiven modeli oluşturur.

Neden bazen programa 'sıcak yeniden başlatmalar' ekleniyor?

Sıcak yeniden başlatmalar, öğrenme oranını aralıklarla yükselterek optimize edicinin dar minimumlardan çıkıp daha iyi çözümler keşfetmesine yardımcı olur.