Teknik KILAVUZ

Q-Öğrenim

Q-Learning, deneme yanılma yoluyla her hareketin değerini kademeli olarak öğrenerek bir temsilciye hangi eylemlerin en iyi sonucu verdiğini öğreten bir takviyeli öğrenme algoritmasıdır.

2 min readSon güncelleme

Genel Bakış

It matters because it can find optimal behavior without ever being told the rules of its environment.

Derin Dalış

Q-Learning, Q(s, a) adı verilen bir işlevi öğrenir: 's' durumunda 'a' eylemini gerçekleştirmenin ve sonrasında en iyi şekilde hareket etmenin beklenen uzun vadeli ödülü. Temsilci hiçbir şey bilmemeye başlar, eylemleri dener ve ödülleri gözlemler. Her adımdan sonra, Q değeri tahminini yeni alınan ödül artı bir sonraki durumdan beklediği en iyi indirimli gelecek değere doğru iter. Daha da önemlisi, "politika dışı" ve "modelden bağımsız": Rastgele keşfederken en iyi politikayı öğrenebilir ve asla dünyanın nasıl geçiş yaptığına dair bir modele ihtiyaç duymaz. Her durum-eylem çiftinin yeterince araştırılması göz önüne alındığında, Q değerleri kanıtlanabilir şekilde optimal değerlere yakınsar ve herhangi bir durumdaki en iyi eylem, en yüksek Q'ya sahip olandır.

Teknik Bilgi

Çekirdek Bellman güncellemesidir: Q(s,a) <- Q(s,a) + alpha[r + gamma*max_a' Q(s',a') - Q(s,a)]. Alfa öğrenme oranıdır, gama gelecekteki ödülleri ağırlıklandıran indirim faktörüdür ve parantez içindeki terim zamansal fark hatasıdır. Sonraki eylemlerdeki 'maksimum', onu politika dışı yapan şeydir ve keşfederken bile açgözlü optimal politikayı öğrenmesine olanak tanır. Keşif genellikle epsilon açgözlü eylem seçimiyle gerçekleştirilir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Q-Learning'in Geleceği

Durumların bir tabloda depolanamayacak kadar fazla olması durumunda klasik tablolu Q-Learning zorlanır. Baskın yön, piksel gibi ham girdilerden Q değerlerine yaklaşan Derin Q-Ağlarında (DQN) olduğu gibi onu sinir ağlarıyla birleştirmek. Araştırmalar, deneyim tekrarı, hedef ağlar ve aşırı tahmin yanlılığını azaltan ve tekli ortalamalar yerine tam getiri dağılımlarını temsil eden Double DQN ve dağıtımsal Q-Öğrenim gibi değişkenlerle bunu dengelemeye devam ediyor.

Gerçek Dünya Uygulaması

Atari oyun oynayan ajanlar (DeepMind'in DQN'si) doğrudan ekran piksellerinden Breakout ve Pong oynamayı öğreniyor

Toplam araç bekleme süresini en aza indirmek için kavşaklarda trafik ışığı zamanlamasını optimize etme

Robotun, ödülü en üst düzeye çıkaracak en kısa yolu öğrendiği bir ızgara veya labirentte robot navigasyonu

Bir temsilcinin hangi eylemlerin uzun vadeli kârı en üst düzeye çıkardığını öğrendiği dinamik fiyatlandırma ve envanter kararları

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Q-Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Öğrenme Oranı Planlama

Sık sorulan sorular

What is Q-Learning?

Q-Learning, deneme yanılma yoluyla her hareketin değerini kademeli olarak öğrenerek bir temsilciye hangi eylemlerin en iyi sonucu verdiğini öğreten bir takviyeli öğrenme algoritmasıdır. Bu önemlidir çünkü çevresinin kuralları kendisine hiç söylenmeden en uygun davranışı bulabilir.

Q-değeri Q(s, a) neyi temsil eder?

Q(s, a), yalnızca anlık ödülü değil, s durumunda a eylemini yapmaktan ve sonrasında en iyi şekilde davranmaktan elde edilen toplam indirimli gelecekteki ödülü tahmin eder.

Q-Learning neden 'politika dışı' olarak tanımlanıyor?

Sonraki eylemlerin maksimumu, aracı farklı bir davranış politikasıyla araştırma yaparken bile Q-Learning'in açgözlü optimal politikasının değerini öğrendiği anlamına gelir.

Güncelleme kuralında indirim faktörü gama neyi kontrol eder?

Gama (0 ile 1 arasında) gelecekteki ödüllerde indirim sağlar; 1'e yakın değerler aracıyı uzak görüşlü, 0'a yakın değerler ise kısa görüşlü yapar.

Q-Learning'deki zamansal fark (TD) hatası nedir?

TD hatası, yeni hedef tahmini (ödül artı en iyi iskonto edilmiş gelecek değer) ile eski Q tahmini arasındaki boşluktur; güncelleme bu açığı daraltıyor.

Düz tablolu Q-Learning neden piksellerden kaynaklanan video oyunları gibi büyük sorunlarla mücadele ediyor?

Bir arama tablosunun durum-eylem çifti başına bir girişe ihtiyacı vardır; bu, durumların sayısı milyarlarca olduğunda mümkün değildir ve DQN gibi sinir ağı tahmincilerini motive eder.