PRZEWODNIK Językowy AI

Modelowanie nagród

Model nagrody to sieć neuronowa przeszkolona do przewidywania, jak dobra będzie reakcja sztucznej inteligencji, działająca jako automatyczny zastępca ludzkiej oceny.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

Głębokie nurkowanie

Modelowanie nagród rozwiązuje problem praktyczny: ludzie nie są w stanie ocenić każdego z milionów wyników generowanych przez model podczas szkolenia. Zamiast tego osoby etykietujące porównują mały zestaw odpowiedzi i zwykle wybierają, która z dwóch odpowiedzi na ten sam monit jest lepsza. Następnie na podstawie tych porównań trenuje się model nagrody, aby uzyskać pojedynczy wynik skalarny dla dowolnej pary wymagającej szybkiej odpowiedzi. Standardowym celem szkoleniowym jest model Bradleya-Terry'ego, który zamienia preferencje dotyczące par na prawdopodobieństwo, że jedna odpowiedź będzie lepsza od drugiej. Po przeszkoleniu ten model nagrody może tanio ocenić nieograniczoną liczbę nowych wyników, dostarczając sygnał, którego algorytmy takie jak PPO wykorzystują do ulepszenia modelu językowego. Modele nagród są również ponownie wykorzystywane w czasie wnioskowania do próbkowania typu best-of-N, podczas którego generowanych jest wielu kandydatów i zwracany jest ten, który uzyskał najwyższy wynik.

Wgląd techniczny

Model nagrody jest zwykle modelem języka podstawowego, w którym głowa przewidywania tokenów została zastąpiona pojedynczą warstwą liniową, która emituje jeden skalar. Trening maksymalizuje logarytm prawdopodobieństwa, że ​​wybrana odpowiedź uzyska wyższy wynik niż odpowiedź odrzucona: strata = -log(sigmoid(r_chosen - r_rejected)). Liczy się tylko różnica względna, więc skala bezwzględna jest dowolna. Jakość zależy od spójności etykiety i szerokiego zakresu stylów reakcji.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość modelowania nagród

Badania eliminują największe słabości modeli nagród: można je „zhakować” (modele wykorzystują takie dziwactwa, jak faworyzowanie długości) i wycofują się z dystrybucji w miarę ulepszania polityki. Obiecujące kierunki obejmują modele nagród w procesie, które oceniają każdy etap rozumowania, zespoły i szacunki niepewności zapobiegające włamaniom, etykiety preferencji generowane przez sztuczną inteligencję (RLAIF) oraz generatywne modele nagród, które dostarczają krytyki i uzasadnień, a nie samych liczb.

Implementacja w świecie rzeczywistym

Wspieranie RLHF dla asystentów takich jak ChatGPT i Claude poprzez ocenianie odpowiedzi kandydatów podczas szkolenia PPO

Próbkowanie typu Best-of-N, w którym model generuje wiele odpowiedzi, a model nagrody wybiera najlepszą dla użytkownika

„Weryfikatory” matematyczne i kodowania lub modele nagród za proces, które oceniają pośrednie etapy rozumowania w celu poprawy rozwiązywania problemów

Ranking i filtrowanie syntetycznych danych szkoleniowych, zachowywanie tylko generacji o wysokich wynikach do dalszego dostrajania

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Modelowanie nagrody Bradleya-Terry'ego

Często zadawane pytania

What is Reward Modeling?

Model nagrody to sieć neuronowa przeszkolona do przewidywania, jak dobra będzie reakcja sztucznej inteligencji, działająca jako automatyczny zastępca ludzkiej oceny. To silnik punktacji umożliwia na dużą skalę uczenie się przez wzmacnianie na podstawie informacji zwrotnych od ludzi.

Jaki jest główny wynik modelu nagrody dla danej pary szybkiej reakcji?

Model nagrody odwzorowuje zachętę i odpowiedź na jedną liczbę skalarną reprezentującą przewidywaną jakość lub preferencje ludzkie.

Jakiego rodzaju dane ludzkie są najczęściej wykorzystywane do uczenia modeli nagród?

Osoby zajmujące się etykietowaniem zazwyczaj porównują dwie odpowiedzi na ten sam monit i wybierają lepszą; model Bradleya-Terry'ego przekształca je w nagrodę skalarną.

Co optymalizuje stratę w standardowym modelu nagrody?

Strata Bradleya-Terry'ego, -log(sigmoid(r_chosen - r_rejected)), dotyczy tylko względnego uporządkowania, więc skala bezwzględna jest dowolna.

Co to jest „hakowanie nagród”?

Hakowanie nagród ma miejsce, gdy model znajduje skróty (takie jak nadmierna długość lub pochlebstwa), które niedoskonały model nagrody ocenia wysoko, ale ludzie nie.

W jaki sposób model nagrody wywodzi się architektonicznie z modelu językowego?

Model nagrody zazwyczaj ponownie wykorzystuje szkielet LM, ale zamienia ostatnią warstwę na taką, która generuje pojedynczą nagrodę skalarną.