PRZEWODNIK techniczny

Uczenie się ze wzmocnieniem na podstawie informacji zwrotnej od ludzi

RLHF to technika, która zmienia surowy model języka w pomocnego, uprzejmego asystenta, ucząc go ludzkich preferencji.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

Głębokie nurkowanie

Wstępnie wytrenowany model języka przewiduje wiarygodny tekst, ale wiarygodny to nie to samo, co pomocny, uczciwy lub bezpieczny. RLHF rozwiązuje ten problem etapami. Po pierwsze, nadzorowane dostrajanie uczy model postępować zgodnie z instrukcjami na podstawie przykładowych odpowiedzi napisanych przez człowieka. Następnie ludzie porównują pary modelowych odpowiedzi na ten sam monit i wybierają lepszą; te porównania trenują oddzielny model nagrody, który ocenia każdą odpowiedź. Wreszcie, model językowy jest zoptymalizowany za pomocą uczenia się przez wzmacnianie, aby generować reakcje, które model nagrody jest bardzo ceniony. Kara powstrzymuje go przed nadmiernym odejściem od oryginalnego modelu, dzięki czemu pozostaje płynny i nie wykorzystuje dziwactw modelu nagrody. RLHF odegrał kluczową rolę w zapewnieniu użyteczności asystentów w stylu ChatGPT.

Wgląd techniczny

Model nagrody jest zwykle trenowany na parach preferencji ze stratą w stylu Bradleya-Terry'ego, ucząc się, jak nadawać preferowanej przez człowieka odpowiedzi wyższy wynik skalarny. Polityka jest następnie aktualizowana za pomocą PPO (Proximal Policy Optimization), która maksymalizuje nagrodę, podczas gdy kara za rozbieżność KL w stosunku do modelu referencyjnego zapobiega nadmiernej optymalizacji i „hackowaniu nagród”. Ponieważ PPO jest kłopotliwe, nowsze metody, takie jak DPO (Direct Preference Optimization), pomijają jawny model nagrody i pętlę wzmocnień, optymalizując politykę bezpośrednio na podstawie par preferencji.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość uczenia się przez wzmacnianie na podstawie informacji zwrotnych od ludzi

RLHF jest usprawniany i częściowo zautomatyzowany. DPO i powiązane metody bezpośrednich preferencji zastępują w wielu zespołach ciężki rurociąg PPO, a RLAIF wykorzystuje informacje zwrotne generowane przez sztuczną inteligencję (jak w przypadku konstytucyjnej sztucznej inteligencji), aby obniżyć koszty etykietowania. Badania zajmują się hakowaniem nagród, stronniczością autorów komentarzy i trudnościami w ocenie długich lub eksperckich odpowiedzi za pomocą technik takich jak nadzór procesu i debata. Oczekuj dostosowania, które połączy informacje zwrotne od ludzi i sztucznej inteligencji, bogatszych sygnałów nagrody wykraczających poza pojedynczy kciuk w górę oraz coraz większej kontroli tego, kto zapewnia preferencje i jakie wartości one kodują.

Implementacja w świecie rzeczywistym

Dostosowywanie asystenta czatu tak, aby odrzucał szkodliwe żądania i zapewniał pomocne, dobrze zorganizowane odpowiedzi, a nie tylko wiarygodny tekst.

Ranking par podsumowań według ludzkich preferencji trenowania modelu, który pisze podsumowania, które ludzie faktycznie uznają za przydatne.

Ograniczanie toksycznych lub stronniczych wyników poprzez nagradzanie odpowiedzi, które ludzie oceniają jako pełne szacunku i bezpieczne.

Używanie DPO na zestawie danych preferowanych i odrzuconych odpowiedzi w celu dostosowania modelu open source bez uruchamiania pełnej pętli PPO.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Uczenie się przez wzmacnianie

Często zadawane pytania

What is Reinforcement Learning From Human Feedback?

RLHF to technika, która zmienia surowy model języka w pomocnego, uprzejmego asystenta, ucząc go ludzkich preferencji. Ma to znaczenie, ponieważ dostosowuje zachowanie modelu do tego, czego ludzie rzeczywiście chcą, a nie tylko do tego, co jest statystycznie prawdopodobne.

Jaki jest główny cel RLHF w modelu językowym?

RLHF kieruje model w stronę reakcji preferowanych przez ludzi, czyniąc go bardziej pomocnym, uczciwym i bezpiecznym, a nie tylko wiarygodnym.

Czego właściwie uczy się model nagrody w RLHF?

Model nagrody jest szkolony na podstawie porównań preferencji ludzi w celu uzyskania odpowiedzi, co stanowi sygnał, pod kątem którego polityka jest optymalizowana.

Dlaczego na etapie RL stosowana jest kara za rozbieżność KL w stosunku do oryginalnego modelu?

Kara KL utrzymuje zoptymalizowaną politykę blisko modelu referencyjnego, chroniąc przed hakowaniem nagród i utratą płynności.

W jaki sposób zazwyczaj zbierane są dane dotyczące preferencji na potrzeby modelu nagrody?

Adnotatorzy wybierają preferowaną odpowiedź w porównaniach parami, co uczy modelu nagrody poprzez stratę w stylu Bradleya-Terry'ego.

Jaką przewagę oferuje DPO (Direct Preference Optimization) w porównaniu z klasycznym rurociągiem RLHF?

DPO wyprowadza cel bezpośrednio z preferencji, unikając oddzielnego modelu nagrody i kłopotliwego etapu uczenia się przez wzmacnianie.