Yakınsal Politika Optimizasyonu
Proksimal Politika Optimizasyonu (PPO), insan geri bildirimlerinden elde edilen dil modellerinin ince ayarıyla en çok ilişkilendirilen takviyeli öğrenme algoritmasıdır.
Genel Bakış
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Derin Dalış
PPO, OpenAI tarafından 2017'de tanıtıldı ve InstructGPT ve ChatGPT gibi sistemler için RLHF'nin arkasındaki güçlü güç haline geldi. Politika aşamalı RL'deki temel zorluk, tek bir aşırı büyük güncellemenin performansı çökertebilmesidir. PPO bunu 'kırpılmış bir yedek hedef' ile ele alıyor: bir eylemin eski politikaya göre ne kadar daha fazla (veya daha az) muhtemel hale geldiğini ölçer, bu oranı avantajla çarpar (eylem beklenenden ne kadar iyi oldu) ve oranı 0,8 ila 1,2 gibi küçük bir aralığa indirir. Bu, politikanın güncelleme başına ne kadar ilerleyebileceğini sınırlayarak öğrenmeyi istikrarlı tutarken istikrarlı iyileştirmeye de olanak tanır. RLHF dil modelinde, 'eylem' bir belirteç veya yanıt üretiyor, ödül bir ödül modelinden geliyor ve KL-sapma cezası, modelin orijinal davranışından çok uzaklaşmasını engelliyor.
Teknik Bilgi
PPO, kırpılmış bir hedefi maksimuma çıkarır: min(oran * avantaj, klip(oran, 1-eps, 1+eps) * avantaj), burada oran, yeni-eski eylem olasılığıdır. Avantajlar genellikle Genelleştirilmiş Avantaj Tahmini ve öğrenilmiş değer (eleştirmen) ağıyla tahmin edilir. RLHF'de toplam ödül, ödül modeli puanını referans politikasına göre token başına KL cezasıyla birleştirerek ödül kazancını orijinal modele yakın kalmayla dengeler.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Yakınsal Politika Optimizasyonunun Geleceği
PPO güçlü olmaya devam ediyor ancak oldukça beceriksiz olduğu biliniyor: ayrı bir değer ağına, dikkatli hiper parametre ayarına ve çok fazla hesaplamaya ihtiyaç duyuyor. Örneklenmiş yanıt gruplarının avantajlarını tahmin ederek değer ağını düşüren ve son akıl yürütme modellerini güçlendiren DPO (hiç RL yok) ve GRPO dahil olmak üzere daha basit alternatifler zemin kazanıyor. PPO, politikaya uygun araştırmanın gerçekten yardımcı olduğu durumlarda varlığını sürdürecektir, ancak alan aktif olarak karmaşıklığının bir kısmını daha ucuz yöntemler için takas etmektedir.
Gerçek Dünya Uygulaması
RLHF aracılığıyla talimatları ve insan tercihlerini takip etmek için InstructGPT ve ChatGPT üzerinde ince ayar yapılması
PPO'nun dil modellerinden önceki orijinal alanı olan oyun oynama ve robotik kontrol aracılarının eğitimi
KL kısıtlaması altında ödül modeli puanını en üst düzeye çıkararak toksisiteyi azaltmak veya yararlılığı artırmak
Bir modelin görevleri doğru bir şekilde tamamlaması karşılığında ödüllendirildiği araç kullanımını veya çok adımlı aracı davranışını optimize etme
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Grup Göreli Politika Optimizasyonu
Sık sorulan sorular
What is Proximal Policy Optimization?
Proksimal Politika Optimizasyonu (PPO), insan geri bildirimlerinden elde edilen dil modellerinin ince ayarıyla en çok ilişkilendirilen takviyeli öğrenme algoritmasıdır. Naif politika değişim yöntemlerine musallat olan istikrarsızlığı önlemek için dikkatli ve küçük adımlarla bir politikayı geliştirir.
PPO'nun 'kırpılması' öncelikle hangi sorunu çözüyor?
Olasılık oranının kırpılması, herhangi bir güncellemenin politikayı çok ileri taşımasını önler; bu, politika kademeli yöntemlerdeki istikrarsızlığın ana kaynağıdır.
PPO'lu RLHF dil modelinde ödül sinyali genellikle nereden geliyor?
Bir ödül modeli, oluşturulan yanıtlar için skaler ödül sağlar, çünkü insanların RL sırasında her çıktıyı puanlaması mümkün değildir.
PPO tabanlı RLHF'de KL-sapma cezası ne işe yarar?
Orijinal (referans) politikaya karşı token başına KL cezası, modelin ödül peşinde koşarken davranışını çok sert bir şekilde değiştirmesini engelliyor.
PPO'da değer (eleştirmen) ağının rolü nedir?
PPO bir aktör-eleştirme yöntemidir; değer ağı, beklenen ödülü tahmin ederek, varyansı azaltan avantaj tahminlerini (genellikle GAE yoluyla) mümkün kılar.
PPO'da 'avantaj' neyi temsil ediyor?
Avantaj, seçilen bir eylemin değer tahminine göre ne kadar iyi (ya da kötü) olduğunu ölçer ve politikaya hangi eylemlerin güçlendirilmesi gerektiğini söyler.