Dil AI KILAVUZU

Yakınsal Politika Optimizasyonu

Proksimal Politika Optimizasyonu (PPO), insan geri bildirimlerinden elde edilen dil modellerinin ince ayarıyla en çok ilişkilendirilen takviyeli öğrenme algoritmasıdır.

2 min readSon güncelleme

Genel Bakış

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Derin Dalış

PPO, OpenAI tarafından 2017'de tanıtıldı ve InstructGPT ve ChatGPT gibi sistemler için RLHF'nin arkasındaki güçlü güç haline geldi. Politika aşamalı RL'deki temel zorluk, tek bir aşırı büyük güncellemenin performansı çökertebilmesidir. PPO bunu 'kırpılmış bir yedek hedef' ile ele alıyor: bir eylemin eski politikaya göre ne kadar daha fazla (veya daha az) muhtemel hale geldiğini ölçer, bu oranı avantajla çarpar (eylem beklenenden ne kadar iyi oldu) ve oranı 0,8 ila 1,2 gibi küçük bir aralığa indirir. Bu, politikanın güncelleme başına ne kadar ilerleyebileceğini sınırlayarak öğrenmeyi istikrarlı tutarken istikrarlı iyileştirmeye de olanak tanır. RLHF dil modelinde, 'eylem' bir belirteç veya yanıt üretiyor, ödül bir ödül modelinden geliyor ve KL-sapma cezası, modelin orijinal davranışından çok uzaklaşmasını engelliyor.

Teknik Bilgi

PPO, kırpılmış bir hedefi maksimuma çıkarır: min(oran * avantaj, klip(oran, 1-eps, 1+eps) * avantaj), burada oran, yeni-eski eylem olasılığıdır. Avantajlar genellikle Genelleştirilmiş Avantaj Tahmini ve öğrenilmiş değer (eleştirmen) ağıyla tahmin edilir. RLHF'de toplam ödül, ödül modeli puanını referans politikasına göre token başına KL cezasıyla birleştirerek ödül kazancını orijinal modele yakın kalmayla dengeler.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Yakınsal Politika Optimizasyonunun Geleceği

PPO güçlü olmaya devam ediyor ancak oldukça beceriksiz olduğu biliniyor: ayrı bir değer ağına, dikkatli hiper parametre ayarına ve çok fazla hesaplamaya ihtiyaç duyuyor. Örneklenmiş yanıt gruplarının avantajlarını tahmin ederek değer ağını düşüren ve son akıl yürütme modellerini güçlendiren DPO (hiç RL yok) ve GRPO dahil olmak üzere daha basit alternatifler zemin kazanıyor. PPO, politikaya uygun araştırmanın gerçekten yardımcı olduğu durumlarda varlığını sürdürecektir, ancak alan aktif olarak karmaşıklığının bir kısmını daha ucuz yöntemler için takas etmektedir.

Gerçek Dünya Uygulaması

RLHF aracılığıyla talimatları ve insan tercihlerini takip etmek için InstructGPT ve ChatGPT üzerinde ince ayar yapılması

PPO'nun dil modellerinden önceki orijinal alanı olan oyun oynama ve robotik kontrol aracılarının eğitimi

KL kısıtlaması altında ödül modeli puanını en üst düzeye çıkararak toksisiteyi azaltmak veya yararlılığı artırmak

Bir modelin görevleri doğru bir şekilde tamamlaması karşılığında ödüllendirildiği araç kullanımını veya çok adımlı aracı davranışını optimize etme

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Grup Göreli Politika Optimizasyonu

Sık sorulan sorular

What is Proximal Policy Optimization?

Proksimal Politika Optimizasyonu (PPO), insan geri bildirimlerinden elde edilen dil modellerinin ince ayarıyla en çok ilişkilendirilen takviyeli öğrenme algoritmasıdır. Naif politika değişim yöntemlerine musallat olan istikrarsızlığı önlemek için dikkatli ve küçük adımlarla bir politikayı geliştirir.

PPO'nun 'kırpılması' öncelikle hangi sorunu çözüyor?

Olasılık oranının kırpılması, herhangi bir güncellemenin politikayı çok ileri taşımasını önler; bu, politika kademeli yöntemlerdeki istikrarsızlığın ana kaynağıdır.

PPO'lu RLHF dil modelinde ödül sinyali genellikle nereden geliyor?

Bir ödül modeli, oluşturulan yanıtlar için skaler ödül sağlar, çünkü insanların RL sırasında her çıktıyı puanlaması mümkün değildir.

PPO tabanlı RLHF'de KL-sapma cezası ne işe yarar?

Orijinal (referans) politikaya karşı token başına KL cezası, modelin ödül peşinde koşarken davranışını çok sert bir şekilde değiştirmesini engelliyor.

PPO'da değer (eleştirmen) ağının rolü nedir?

PPO bir aktör-eleştirme yöntemidir; değer ağı, beklenen ödülü tahmin ederek, varyansı azaltan avantaj tahminlerini (genellikle GAE yoluyla) mümkün kılar.

PPO'da 'avantaj' neyi temsil ediyor?

Avantaj, seçilen bir eylemin değer tahminine göre ne kadar iyi (ya da kötü) olduğunu ölçer ve politikaya hangi eylemlerin güçlendirilmesi gerektiğini söyler.