Bliższa optymalizacja polityki
Proximal Policy Optimization (PPO) to algorytm uczenia się przez wzmacnianie, najczęściej kojarzony z dostrajaniem modeli językowych na podstawie informacji zwrotnych od ludzi.
Przegląd
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Głębokie nurkowanie
PPO zostało wprowadzone przez OpenAI w 2017 roku i stało się podstawą RLHF dla systemów takich jak InstructGPT i ChatGPT. Głównym wyzwaniem w RL z gradientem zasad jest to, że pojedyncza, zbyt duża aktualizacja może obniżyć wydajność. PPO rozwiązuje ten problem za pomocą „przyciętego celu zastępczego”: mierzy, o ile bardziej (lub mniej) prawdopodobne stało się dane działanie w porównaniu ze starą polityką, mnoży ten współczynnik przez przewagę (o ile lepsze było działanie niż oczekiwano) i przycina współczynnik do małego zakresu, np. 0,8 do 1,2. Ogranicza to, jak daleko polityka może się posunąć w ramach jednej aktualizacji, zapewniając stabilność uczenia się, a jednocześnie umożliwiając ciągłe doskonalenie. W modelu językowym RLHF „akcja” generuje token lub odpowiedź, nagroda pochodzi z modelu nagrody, a kara za rozbieżność KL zapobiega zbytniemu oddalaniu się modelu od jego pierwotnego zachowania.
Wgląd techniczny
PPO maksymalizuje obcięty cel: min (stosunek * przewaga, klip (stosunek, 1-eps, 1+eps) * przewaga), gdzie stosunek to prawdopodobieństwo działania nowego do starego. Korzyści są zwykle szacowane za pomocą uogólnionej oceny korzyści i sieci wartości wyuczonych (krytycznych). W RLHF całkowita nagroda łączy wynik modelu nagrody z karą za token KL w stosunku do zasad referencyjnych, równoważąc zysk nagrody z pozostawaniem blisko oryginalnego modelu.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość najbliższej optymalizacji polityki
PPO pozostaje silny, ale notorycznie skomplikowany: wymaga osobnej sieci wartości, dokładnego dostrajania hiperparametrów i dużej ilości obliczeń. Coraz popularniejsze stają się prostsze alternatywy, w tym DPO (bez RL) i GRPO, które porzucają sieć wartości poprzez oszacowanie korzyści na podstawie grup wybranych odpowiedzi i stanowią podstawę najnowszych modeli rozumowania. PPO będzie obowiązywać tam, gdzie eksploracja zgodna z polityką rzeczywiście pomaga, ale dziedzina ta aktywnie zamienia część swojej złożoności na tańsze metody.
Implementacja w świecie rzeczywistym
Dostrajanie InstructGPT i ChatGPT, aby postępować zgodnie z instrukcjami i preferencjami ludzi za pośrednictwem RLHF
Szkolenie agentów zajmujących się grami i robotyką, pierwotna domena PPO przed modelami językowymi
Zmniejszenie toksyczności lub poprawa przydatności poprzez maksymalizację wyniku modelu nagrody w ramach ograniczenia KL
Optymalizacja użycia narzędzi lub wieloetapowego zachowania agenta, w ramach którego model jest nagradzany za prawidłowe wykonanie zadań
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Optymalizacja polityki względnej grupy
Często zadawane pytania
What is Proximal Policy Optimization?
Proximal Policy Optimization (PPO) to algorytm uczenia się przez wzmacnianie, najczęściej kojarzony z dostrajaniem modeli językowych na podstawie informacji zwrotnych od ludzi. Ulepsza politykę poprzez ostrożne, małe kroki, aby uniknąć niestabilności, która jest plagą naiwnych metod gradientu polityki.
Jaki problem rozwiązuje przede wszystkim „obcinanie” PPO?
Obcięcie współczynnika prawdopodobieństwa zapobiega przesunięciu polityki zbyt daleko przez pojedynczą aktualizację, co jest głównym źródłem niestabilności metod gradientu polityki.
Skąd zwykle pochodzi sygnał nagrody w modelu językowym RLHF z PPO?
Model nagrody zapewnia nagrodę skalarną za wygenerowane odpowiedzi, ponieważ niewykonalne byłoby ocenianie przez ludzi każdego wyniku podczas RL.
Co robi kara za rozbieżność KL w RLHF opartym na PPO?
Kara za token KL w porównaniu z pierwotną (referencyjną) polityką zniechęca model do zbyt drastycznej zmiany swojego zachowania w pogoni za nagrodą.
Jaka jest rola sieci wartości (krytycznej) w PPO?
PPO to metoda oparta na aktorze-krytyku; sieć wartości szacuje oczekiwaną nagrodę, umożliwiając oszacowanie korzyści (często za pomocą GAE), które zmniejszają wariancję.
Co oznacza „przewaga” w PPO?
Korzyść mierzy, o ile lepsze (lub gorsze) było wybrane działanie w stosunku do oszacowanej wartości, informując politykę, które działania należy wzmocnić.