İnsan Geri Bildiriminden Takviyeli Öğrenme
RLHF, ham bir dil modelini insan tercihlerine göre eğiterek yardımsever, kibar bir asistana dönüştüren tekniktir.
Genel Bakış
It matters because it aligns model behavior with what people actually want, not just what is statistically likely.
Derin Dalış
Önceden eğitilmiş bir dil modeli makul metni tahmin eder ancak makul, yararlı, dürüst veya güvenli ile aynı şey değildir. RLHF bunu aşamalı olarak düzeltir. İlk olarak, denetimli ince ayar, modele, insan tarafından yazılan örnek yanıtları kullanarak talimatları izlemeyi öğretir. Daha sonra insanlar aynı istemle verilen model yanıt çiftlerini karşılaştırır ve daha iyi olanı seçer; bu karşılaştırmalar, her türlü yanıtı puanlayan ayrı bir ödül modeli geliştirir. Son olarak, ödül modelinin yüksek oranda değerlendirdiği yanıtlar üretmek için dil modeli, takviyeli öğrenmeyle optimize edilir. Bir ceza, orijinal modelden çok uzaklaşmasını önler, böylece akıcı kalır ve ödül modelinin tuhaflıklarından yararlanmaz. RLHF, ChatGPT tarzı asistanların kullanılabilir hale getirilmesinde merkezi bir rol oynadı.
Teknik Bilgi
Ödül modeli genellikle Bradley-Terry tarzı kayıplı tercih çiftleri üzerinde eğitilir ve insan tarafından tercih edilen cevaba daha yüksek bir skaler puan vermeyi öğrenir. Politika daha sonra ödülü maksimuma çıkaran PPO (Yakın Politika Optimizasyonu) ile güncellenirken referans modele karşı uygulanan KL-ıraksama cezası aşırı optimizasyonu ve 'ödül korsanlığını' önler. PPO karmaşık olduğundan, DPO (Doğrudan Tercih Optimizasyonu) gibi daha yeni yöntemler açık ödül modelini ve takviye döngüsünü atlayarak politikayı doğrudan tercih çiftlerinden optimize eder.
Stratejik Etki
Maliyet ve bütçe
Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.
Daha net kararlar
Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.
Quality control
Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.
İnsan Geri Bildiriminden Takviyeli Öğrenmenin Geleceği
RLHF kolaylaştırılıyor ve kısmen otomatikleştiriliyor. DPO ve ilgili doğrudan tercih yöntemleri, birçok ekip için ağır PPO hattının yerini alıyor ve RLAIF, etiketleme maliyetlerini azaltmak için yapay zeka tarafından oluşturulan geri bildirimi (Anayasal Yapay Zeka'da olduğu gibi) kullanıyor. Araştırma, süreç denetimi ve tartışma gibi tekniklerle ödül korsanlığı, açıklamacı önyargısı ve uzun veya uzman yanıtlarını değerlendirmenin zorluğuyla mücadele ediyor. İnsan ve yapay zeka geri bildirimlerini harmanlayacak uyum, tek bir beğeninin ötesinde daha zengin ödül sinyalleri ve tercihleri kimin sağladığına ve bunların hangi değerleri kodladığına ilişkin artan incelemeyi bekleyin.
Gerçek Dünya Uygulaması
Bir sohbet asistanını, zararlı istekleri reddedecek ve yalnızca makul metinler yerine yararlı, iyi yapılandırılmış yanıtlar verecek şekilde ayarlamak.
İnsanların gerçekten yararlı bulduğu özetleri yazan bir model yetiştirmek için özet çiftlerini insan tercihine göre sıralamak.
İnsan değerlendiricilerin saygılı ve güvenli olarak değerlendirdiği yanıtları ödüllendirerek toksik veya önyargılı çıktıları azaltmak.
Tam bir PPO döngüsü çalıştırmadan açık kaynaklı bir modeli hizalamak için tercih edilen ve reddedilen yanıtlardan oluşan bir veri kümesinde DPO kullanma.
Riskler ve Korkuluklar
Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.
Altyapı ve bakım maliyetleri genellikle hafife alınır.
Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.
Uygulama Yol Haritası
Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.
Gerçekçi yük ve veri koşulları altında kıyaslama yapın.
Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.
Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Takviyeli Öğrenme
Sık sorulan sorular
What is Reinforcement Learning From Human Feedback?
RLHF, ham bir dil modelini insan tercihlerine göre eğiterek yardımsever, kibar bir asistana dönüştüren tekniktir. Bu önemlidir çünkü model davranışını yalnızca istatistiksel olarak olası olanla değil, insanların gerçekte istedikleriyle de uyumlu hale getirir.
Bir dil modeli için RLHF'nin temel amacı nedir?
RLHF, bir modeli insanların tercih ettiği yanıtlara yönlendirerek onu yalnızca makul olmaktan ziyade daha yararlı, dürüst ve güvenli hale getirir.
RLHF'deki ödül modeli aslında ne yapmayı öğreniyor?
Ödül modeli, politikanın optimize ettiği sinyali sağlayarak yanıtları puanlamak için insan tercihi karşılaştırmaları üzerine eğitilir.
RL adımı sırasında neden orijinal modele karşı KL-ıraksama cezası kullanılıyor?
KL cezası, optimize edilmiş politikayı referans modele yakın tutarak ödül korsanlığına ve akıcılık kaybına karşı koruma sağlar.
Ödül modeli için tercih verileri genellikle nasıl toplanır?
Ek açıklamalar yapanlar, ödül modelini Bradley-Terry tarzı bir kayıpla eğiten ikili karşılaştırmalarda tercih edilen yanıtı seçer.
DPO (Doğrudan Tercih Optimizasyonu), klasik RLHF hattına göre ne gibi avantajlar sunuyor?
DPO, ayrı ödül modelinden ve karmaşık takviyeli öğrenme adımından kaçınarak hedefi doğrudan tercihlerden alır.