Alapok ÚTMUTATÓ

Bradley-Terry Jutalommodellezés

A Bradley-Terry modell egy évszázados statisztikai módszer a páronkénti összehasonlítások (A veri B-t) numerikus pontszámokká alakítására.

2 perc olvasásUtoljára frissítve

Áttekintés

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Mély merülés

Az 1952-ben bemutatott Bradley-Terry azt feltételezi, hogy minden elemnek rejtett erősségi pontszáma van, és annak valószínűsége, hogy az A elem legyőzi a B elemet, a pontszám különbségének logisztikai függvénye. A mesterséges intelligencia igazítása során ez szépen leképez a preferenciaadatokra: az emberi címkézők két modellválaszt látnak, és a jobbat választják, ahelyett, hogy nehezen kalibrálható abszolút értékeléseket adnának. A jutalmazási modell, általában a skaláris kimeneti fejjel rendelkező nyelvi modell, úgy van kiképezve, hogy az emberek által preferált válasz magasabb skaláris jutalmat kapjon. A veszteség a Bradley-Terry valószínűség negatív log-valószínűsége: maximalizálja a log-szigmoidot (a választott jutalma mínusz az elutasított jutalma). Az eredményül kapott jutalmazási modell ezután tetszőleges kimeneteket pontoz, és azt a jelet adja, amelyre a megerősítő tanulási algoritmusok (például a PPO) optimalizálnak, hogy a modelleket hasznosabbá és összehangoltabbá tegyék.

Technikai betekintés

Az összehasonlítás képzési vesztesége egyszerűen mínusz log-szigmoid (r_chosen − r_rejected), így a modell mindig csak a relatív különbségeket tanulja meg. Ez azt jelenti, hogy a jutalmak csak egy additív állandóig azonosíthatók; az abszolút skála tetszőleges. Mivel az összehasonlítás egyszerűbb és következetesebb az emberek számára, mint az 1-től 10-ig terjedő pontszám, a Bradley-Terry adatok kevésbé zajosak. A közvetlen preferenciaoptimalizálás később megmutatta, hogy kihagyhatja a külön jutalmazási modellt, és közvetlenül a szabályzaton optimalizálhatja a Bradley-Terry célkitűzést.

Stratégiai hatás

Tisztább döntések

Segít elkülöníteni a világos technikai állításokat a marketing nyelvezettől.

Költség és költségvetés

Feltehet jobb végrehajtási kérdéseket, mielőtt pénzt vagy időt költene.

Csapat és munkafolyamat

A közös tudással rendelkező csapatok jobb döntéseket hoznak a termékekkel, irányelvekkel és tanulással kapcsolatban.

A Bradley-Terry jutalommodellezés jövője

Bradley-Terry egyetlen következetes rangsorolást és tranzitív preferenciákat feltételez, amelyek felbomlanak, ha az emberek nem értenek egyet, vagy a preferenciák körbefordulnak. A kutatás olyan modellek felé halad, amelyek megragadják a preferenciaeloszlást, a többdimenziós jutalmakat (a segítőkészséget, a biztonságot, az őszinteséget külön pontozzák) és az olyan módszereket, mint a Nash az emberi visszajelzésekből való tanulás, amelyek elvetik az egypontos feltételezést. Az adatvédelmi tisztviselő és változatai a Bradley-Terry-célkitűzést egyre inkább közvetlenül a szakpolitikai képzésbe építik be. Gazdagabb összehasonlítási sémákra számíthat, beleértve a kettőnél több elem rangsorolását és a bizalommal súlyozott preferenciákat, a jutalomhackelés csökkentése érdekében.

Valós megvalósítás

A jutalommodell betanítása RLHF-ben, amely rangsorol két chatbot-választ, és a jobb-rosszabb jelet továbbítja a PPO finomhangolásához.

A közvetlen preferenciaoptimalizálás a modell finomhangolása közvetlenül a kiválasztott-elutasított válaszpárokon a Bradley-Terry log-szigmoid veszteséggel.

A sakk- vagy esportjátékosok rangsorolása az Elo-n keresztül, amely matematikailag közeli rokona a Bradley-Terry-modellnek a játék kimenetelével kapcsolatban.

Tartalmi ajánlások rangsorának felépítése az abszolút csillagos értékelések helyett az „A-t preferált felhasználók B helyett” kattintási adatokból.

Kockázatok és védőkorlátok

A különböző csapatok eltérően használhatják ugyanazt a kifejezést, ezért korán határozza meg a hatókört.

A benchmarkok erősnek tűnhetnek, miközben a valós teljesítmény egyenetlen.

Az adatminőségi és értékelési tervek figyelmen kívül hagyása gyakran törékeny eredményekhez vezet.

Végrehajtási ütemterv

1

Kezdje a kívánt eredmény egyszerű nyelvű meghatározásával.

2

A tesztelés előtt válasszon egy sikermutatót és egy hibafeltételt.

3

Futtasson egy kis pilotot reprezentatív adatokkal, ne egy csiszolt demókészlettel.

4

Dokumentálja, hol segít a Bradley-Terry Jutalommodellezés, és hol jobbak az egyszerűbb módszerek.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Bradley-Terry Reward Modeling?

A Bradley-Terry modell egy évszázados statisztikai módszer a páronkénti összehasonlítások (A veri B-t) numerikus pontszámokká alakítására. A modern AI-ban olyan jutalmazási modelleket hoz létre, amelyek abból tanulják meg az emberi preferenciákat, hogy „melyik válasz a jobb?” címkék, az RLHF gerince.

Mit konvertál a Bradley-Terry modell numerikus pontszámokká?

Bradley-Terry páronként veszi az „A legyőzi B-t” összehasonlításokat, és kikövetkezteti az egyes tételek rejtett erősségi pontszámát, ezért olyan jól illeszkedik az emberi preferenciák címkézéséhez.

Bradley-Terryben annak a valószínűsége, hogy A veri B-t, minek a függvénye?

A modell P(A veri B-t) egyenlőnek állítja az A és B rejtett erősségi pontszámai közötti különbség logisztikus (szigmoid) értékével.

Miért csak egy additív állandóig azonosíthatók a Bradley-Terry-jutalmak?

Az edzési veszteség csak a választott és az elutasított jutalmak közötti különbséget használja fel, így ha az összes pontszámot ugyanazzal a konstanssal eltolja, a veszteség változatlan marad; az abszolút skála tetszőleges.

Mennyi a standard veszteség egyetlen preferencia-összehasonlítás esetén a jutalommodellezésben?

A Bradley-Terry negatív log-valószínűség a választott-mínusz-elutasított jutalom különbség mínusz log-szigmoidjára csökken, magasabbra tolva a választott válasz jutalmát.

Melyik módszer hagyja ki a külön jutalmazási modellt azáltal, hogy a Bradley-Terry célt közvetlenül a szabályzaton optimalizálja?

Az adatvédelmi tisztviselő újrafogalmazza a Bradley-Terry preferencia célkitűzést, így közvetlenül alkalmazható a politikai modellre, így nincs szükség önálló jutalmazási modell betanítására és lekérdezésére.