PODSTAWOWY PRZEWODNIK

Modelowanie nagrody Bradleya-Terry'ego

Model Bradleya-Terry'ego to stuletnia metoda statystyczna służąca do przekształcania porównań parami (A pokonuje B) na wyniki liczbowe.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Głębokie nurkowanie

Bradley-Terry, wprowadzony w 1952 roku, zakłada, że ​​każdy przedmiot ma ukrytą siłę, a prawdopodobieństwo, że przedmiot A przewyższa przedmiot B, jest logistyczną funkcją różnicy ich wyników. W przypadku dostosowania sztucznej inteligencji przekłada się to na dane dotyczące preferencji: osoby odpowiedzialne za etykietowanie widzą dwie modelowe odpowiedzi i wybierają lepszą, zamiast podawać trudne do skalibrowania oceny bezwzględne. Model nagrody, zwykle model językowy ze skalarną głową wyjściową, jest szkolony w taki sposób, że reakcja preferowana przez ludzi zapewnia wyższą nagrodę skalarną. Strata jest ujemnym logarytmem prawdopodobieństwa prawdopodobieństwa Bradleya-Terry'ego: maksymalizuj log-esigmoidę (nagroda za wybrane miejsce minus nagroda za odrzucenie). Powstały model nagrody następnie ocenia dowolne wyniki, dostarczając sygnał, który algorytmy uczenia się przez wzmacnianie, takie jak PPO, optymalizują, aby uczynić modele bardziej pomocnymi i dostosowanymi.

Wgląd techniczny

Strata treningowa dla porównania wynosi po prostu minus log-esigmoida z (r_chosen - r_rejected), więc model uczy się tylko różnic względnych. Oznacza to, że nagrody można zidentyfikować tylko do stałej addytywnej; skala absolutna jest dowolna. Ponieważ porównania są dla ludzi łatwiejsze i bardziej spójne niż wyniki od 1 do 10, dane Bradleya-Terry'ego są mniej zaszumione. Optymalizacja preferencji bezpośrednich pokazała później, że można pominąć oddzielny model nagrody i zoptymalizować cel Bradleya-Terry'ego bezpośrednio w polityce.

Wpływ strategiczny

Jaśniejsze decyzje

Pomaga oddzielić jasne twierdzenia techniczne od języka marketingowego.

Koszt i budżet

Możesz zadawać pytania dotyczące lepszego wdrożenia, zanim wydasz pieniądze lub czas.

Zespół i przepływ pracy

Zespoły charakteryzujące się wspólnym zrozumieniem podejmują lepsze decyzje dotyczące produktów, zasad i uczenia się.

Przyszłość modelowania nagród Bradleya-Terry'ego

Bradley-Terry zakłada jeden spójny ranking i preferencje przechodnie, które załamują się, gdy ludzie się nie zgadzają lub preferencje zmieniają się. Badania zmierzają w kierunku modeli, które wychwytują rozkład preferencji, wielowymiarowe nagrody (przydatność, bezpieczeństwo, uczciwość oceniane osobno) oraz metody takie jak uczenie się Nasha na podstawie informacji zwrotnych od ludzi, które rezygnują z założenia o pojedynczym wyniku. DPO i jego warianty w coraz większym stopniu uwzględniają cel Bradleya-Terry'ego bezpośrednio w szkoleniu politycznym. Spodziewaj się bogatszych schematów porównań, w tym rankingów więcej niż dwóch elementów i preferencji ważonych pewnością, aby ograniczyć hakowanie nagród.

Implementacja w świecie rzeczywistym

Trenowanie modelu nagrody w RLHF, który klasyfikuje dwie odpowiedzi chatbota i przekazuje sygnał lepszy-gorszy do dostrajania PPO.

Optymalizacja preferencji bezpośrednich polegająca na dostrajaniu modelu bezpośrednio na parach odpowiedzi wybranych i odrzuconych przy użyciu straty log-esigmoidalnej Bradleya-Terry'ego.

Ranking szachistów i graczy e-sportowych za pośrednictwem Elo, który jest matematycznie bliskim kuzynem modelu Bradleya-Terry'ego dotyczącego wyników gier.

Tworzenie rankingu rekomendacji treści na podstawie danych o kliknięciach typu „użytkownicy preferują A zamiast B”, a nie bezwzględnych ocen w postaci gwiazdek.

Zagrożenia i poręcze

Różne zespoły mogą odmiennie używać tego samego terminu, dlatego należy wcześniej zdefiniować zakres.

Testy porównawcze mogą wyglądać dobrze, podczas gdy wydajność w świecie rzeczywistym jest nierówna.

Ignorowanie planów dotyczących jakości danych i oceny często skutkuje kruchymi wynikami.

Plan wdrożenia

1

Zacznij od jasnej definicji potrzebnego wyniku.

2

Przed testowaniem wybierz jedną metrykę sukcesu i jeden warunek niepowodzenia.

3

Przeprowadź mały pilotaż z reprezentatywnymi danymi, a nie dopracowanym zestawem demonstracyjnym.

4

Dokumentuj, gdzie pomaga modelowanie nagrody Bradleya-Terry'ego i gdzie prostsze metody są lepsze.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Bradley-Terry Reward Modeling?

Model Bradleya-Terry'ego to stuletnia metoda statystyczna służąca do przekształcania porównań parami (A pokonuje B) na wyniki liczbowe. We współczesnej sztucznej inteligencji obsługuje modele nagród, które uczą się ludzkich preferencji na podstawie pytania „która odpowiedź jest lepsza?” etykiety, kręgosłup RLHF.

Co model Bradleya-Terry’ego przekształca na wyniki liczbowe?

Bradley-Terry dokonuje porównań parami „A pokonuje B” i wnioskuje o ukrytą siłę każdego elementu, dlatego tak dobrze pasuje to do etykietowania preferencji ludzkich.

U Bradleya-Terry’ego prawdopodobieństwo, że A pokona B, jest funkcją czego?

Model wyznacza P(A pokonuje B) jako równą logistycznej (esigmoidzie) różnicy pomiędzy ukrytymi wynikami siły A i B.

Dlaczego nagrody Bradleya-Terry'ego można zidentyfikować tylko do stałej addytywnej?

Strata treningowa uwzględnia jedynie różnicę pomiędzy wybranymi i odrzuconymi nagrodami, więc przesunięcie wszystkich wyników o tę samą stałą pozostawia stratę niezmienioną; skala absolutna jest dowolna.

Jaka jest standardowa strata w przypadku porównania pojedynczych preferencji w modelowaniu nagród?

Ujemny logarytm wiarygodności Bradleya-Terry'ego zmniejsza się do minus log-esigmoidy różnicy nagrody wybrana-minus-odrzucona, podnosząc nagrodę za wybraną odpowiedź wyżej.

Która metoda pomija oddzielny model nagrody, optymalizując cel Bradleya-Terry'ego bezpośrednio w polityce?

IOD przeformułowuje cel preferencji Bradleya-Terry’ego, tak aby można go było zastosować bezpośrednio w modelu polityki, eliminując potrzebę szkolenia i sprawdzania samodzielnego modelu wynagrodzeń.