Bradley-Terry Ödül Modellemesi
Bradley-Terry modeli, ikili karşılaştırmaları (A, B'yi yener) sayısal puanlara dönüştürmek için kullanılan asırlık bir istatistiksel yöntemdir.
Genel Bakış
In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.
Derin Dalış
1952'de tanıtılan Bradley-Terry, her maddenin gizli bir güç puanına sahip olduğunu ve A maddesinin B maddesini geçme olasılığının, puan farkının lojistik fonksiyonu olduğunu varsayar. Yapay zeka hizalamasında bu, tercih verileriyle düzgün bir şekilde eşleşir: İnsan etiketleyiciler, kalibre edilmesi zor mutlak derecelendirmeler vermek yerine iki model yanıtını görür ve daha iyi olanı seçer. Genellikle skaler çıktı kafasına sahip dil modeli olan bir ödül modeli, insanların tercih ettiği yanıtın daha yüksek bir skaler ödül alması için eğitilir. Kayıp, Bradley-Terry olasılığının negatif log-olasılığıdır: Log-sigmoid'i maksimuma çıkarın (seçilenin ödülü eksi reddedilenlerin ödülü). Ortaya çıkan ödül modeli daha sonra rastgele çıktıları puanlayarak PPO gibi takviyeli öğrenme algoritmalarının modelleri daha yararlı ve uyumlu hale getirmek için optimize ettiği sinyali sağlar.
Teknik Bilgi
Bir karşılaştırma için eğitim kaybı basitçe (r_chosen – r_rejected) eksi log-sigmoid'dir, dolayısıyla model yalnızca göreceli farklılıkları öğrenir. Bu, ödüllerin yalnızca toplamsal bir sabite kadar tanımlanabileceği anlamına gelir; mutlak ölçek keyfidir. Karşılaştırmalar insanlar için 1'den 10'a kadar puanlara göre daha kolay ve daha tutarlı olduğundan, Bradley-Terry verileri daha az gürültülüdür. Doğrudan Tercih Optimizasyonu daha sonra ayrı ödül modelini atlayıp Bradley-Terry hedefini doğrudan politika üzerinde optimize edebileceğinizi gösterdi.
Stratejik Etki
Daha net kararlar
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Maliyet ve bütçe
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ekip ve iş akışı
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Bradley-Terry Ödül Modellemesinin Geleceği
Bradley-Terry, insanlar aynı fikirde olmadığında veya tercihler döngüsüne girdiğinde bozulan tek bir tutarlı sıralama ve geçişli tercihler varsayar. Araştırma, tercih dağılımlarını, çok boyutlu ödülleri (yardımseverlik, güvenlik, dürüstlük ayrı ayrı puanlanır) ve Nash'in tek puan varsayımını ortadan kaldıran insan geri bildirimlerinden öğrenmesi gibi yöntemleri yakalayan modellere doğru ilerliyor. DPO ve çeşitleri, Bradley-Terry hedefini giderek doğrudan politika eğitimine katıyor. Ödül korsanlığını azaltmak için ikiden fazla öğenin sıralaması ve güven ağırlıklı tercihler dahil olmak üzere daha zengin karşılaştırma şemaları bekleyebilirsiniz.
Gerçek Dünya Uygulaması
Ödül modelini, iki chatbot yanıtını derecelendiren ve PPO ince ayarına daha iyi-kötü sinyalini besleyen RLHF'de eğitmek.
Doğrudan Tercih Optimizasyonu, Bradley-Terry log-sigmoid kaybını kullanarak seçilen ve reddedilen yanıt çiftleri üzerinde doğrudan bir modele ince ayar yapar.
Satranç veya e-spor oyuncularını, oyun sonuçlarına ilişkin Bradley-Terry modelinin matematiksel olarak yakın kuzeni olan Elo aracılığıyla sıralamak.
Mutlak yıldız derecelendirmeleri yerine "kullanıcılar A'yı B yerine A'yı tercih etti" tıklama verilerinden bir içerik önerisi sıralayıcısı oluşturmak.
Riskler ve Korkuluklar
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
Uygulama Yol Haritası
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Bradley-Terry Ödül Modellemesinin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Bradley-Terry Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Ödül Modelleme
Sık sorulan sorular
What is Bradley-Terry Reward Modeling?
Bradley-Terry modeli, ikili karşılaştırmaları (A, B'yi yener) sayısal puanlara dönüştürmek için kullanılan asırlık bir istatistiksel yöntemdir. Modern yapay zeka, insan tercihlerini 'hangi yanıt daha iyi?' sorusundan öğrenen ödül modellerini güçlendirir. Etiketler, RLHF'nin omurgasıdır.
Bradley-Terry modeli sayısal puanlara neyi dönüştürüyor?
Bradley-Terry 'A, B'yi yener' karşılaştırmalarını ikili olarak alıyor ve her öğe için gizli bir güç puanı çıkarıyor; bu da insanların tercih etiketlemesine bu kadar iyi uymasının nedeni de bu.
Bradley-Terry'de A'nın B'yi yenme olasılığı neyin fonksiyonudur?
Model, P(A, B'yi yener)'i, A'nın ve B'nin gizli güç puanları arasındaki farkın lojistik (sigmoid) değerine eşit olarak ayarlar.
Bradley-Terry ödülleri neden yalnızca toplamsal bir sabite kadar tanımlanabilir?
Eğitim kaybı yalnızca seçilen ve reddedilen ödüller arasındaki farkı kullanır, dolayısıyla tüm puanları aynı sabitle kaydırmak kaybı değiştirmeden bırakır; mutlak ölçek keyfidir.
Ödül modellemede tek tercih karşılaştırmasının standart kaybı nedir?
Bradley-Terry negatif log-olasılığı, seçilen eksi reddedilen ödül farkının eksi log-sigmoid'ine düşerek seçilen yanıtın ödülünü daha yükseğe çıkarır.
Hangi yöntem Bradley-Terry hedefini doğrudan politika üzerinde optimize ederek ayrı bir ödül modelini atlar?
DPO, Bradley-Terry tercih hedefini doğrudan politika modeline uygulanabilecek şekilde yeniden formüle ederek bağımsız bir ödül modelini eğitme ve sorgulama ihtiyacını ortadan kaldırır.