Awọn ipilẹ Itọsọna

Iṣọkan Ere Iṣe deede ni RLHF

Iṣe deede ere ti a ṣe akojọpọ ṣe iwọn awọn ere awoṣe kan laarin ipele awọn idahun si itọsi kanna, titan awọn ikun ariwo sinu ami ikẹkọ iduroṣinṣin.

2 min kakẹhin imudojuiwọn

Akopọ

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Jin Dive

Ni ẹkọ imuduro lati awọn esi eniyan (RLHF), awoṣe kan n ṣe awọn idahun ati awoṣe ere kan jẹ wọn, ṣugbọn awọn ere aise jẹ alariwo ati pe o yatọ lọpọlọpọ kọja awọn ta. Iṣe deede ere ti a ṣe akojọpọ ṣe atunṣe eyi nipa ṣiṣe ayẹwo ẹgbẹ kan ti ọpọlọpọ awọn idahun si itọsi kanna, lẹhinna ṣe deede ere kọọkan nipasẹ iyokuro itumọ ẹgbẹ ati pipin nipasẹ iyapa boṣewa ẹgbẹ. Eleyi z-Dimegilio di anfani. Ọna naa jẹ agbedemeji si Iṣapejuwe Ilana ibatan Ẹgbẹ (GRPO), ti a ṣe nipasẹ DeepSeek, eyiti o ṣe agbara olokiki imọran DeepSeek-R1. Ni pataki, GRPO imukuro nẹtiwọọki iye lọtọ (alariwisi) ti PPO lo, niwọn igba ti apapọ ẹgbẹ n ṣiṣẹ bi ipilẹ. Eyi jẹ ki ikẹkọ rọrun, din owo, ati agbara-iranti diẹ sii lakoko titọju ifihan agbara gradient ni iwọn daradara.

Imọ-imọ-ẹrọ

Fun ẹgbẹ kan ti awọn abajade pẹlu awọn ere r_1 ... r_G, anfani ni A_i = (r_i - tumọ (r)) / std (r). Awọn idahun ti o dara julọ ju apapọ ẹgbẹ wọn gba anfani rere ati pe a fikun; buru ju-apapọ eyi ti wa ni titari si isalẹ. Nitoripe lafiwe jẹ ibatan laarin itọka kan, iwọn ere pipe ati iṣoro lẹsẹkẹsẹ fagilee, idinku iyatọ. GRPO ntọju ibi-afẹde gige ti PPO ati ijiya KL lodi si eto imulo itọkasi lati ṣe idiwọ fun awoṣe lati lọ jina ju.

Ipa Ilana

Awọn ipinnu diẹ sii

O ṣe iranlọwọ fun ọ lati ya sọtọ awọn iṣeduro imọ-ẹrọ lati ede tita.

Iye owo ati isuna

O le beere awọn ibeere imuse to dara julọ ṣaaju lilo owo tabi akoko.

Ẹgbẹ ati ṣiṣan iṣẹ

Awọn ẹgbẹ pẹlu oye pinpin ṣe ọja to dara julọ, eto imulo, ati awọn ipinnu ikẹkọ.

Ọjọ iwaju ti Isọdọtun Ere ti a ṣe akojọpọ ni RLHF

Iṣe deede ti a ṣe akojọpọ n mu ariwo ero-awoṣe pọ si, nibiti awọn awoṣe ti kọ ẹkọ lati awọn ere idaniloju bi awọn idahun iṣiro to pe laisi alariwisi ti o kọ ẹkọ. Iwadi n ṣatunṣe rẹ: awọn ijiyan lori boya lati pin nipasẹ iyapa boṣewa, mimu gbogbo awọn ti o tọ tabi awọn ẹgbẹ ti ko tọ ti o gbe awọn anfani odo jade, ati iwọn ẹgbẹ iwọn. Reti akojọpọ, awọn ọna ti ko ni alariwisi lati tan kaakiri si lilo irinṣẹ aṣoju ati iran koodu, nibiti awọn oludaniloju adaṣe ṣe pese olowo poku, awọn ifihan agbara ere lọpọlọpọ.

Real-World imuse

Ikẹkọ awoṣe ero-iṣiro nipa iṣapẹẹrẹ awọn ojutu 16 fun iṣoro ati ẹsan fun awọn ti o ga ju deede deede ẹgbẹ naa.

Ṣiṣatunṣe iranlọwọ ti chatbot ti o dara nipasẹ ṣiṣe deede awọn ikun-apẹẹrẹ ere kọja ọpọlọpọ awọn idahun oludije si tọ olumulo kọọkan.

Ilọsiwaju oluranlọwọ ifaminsi nibiti ojutu ayẹwo kọọkan ti gba wọle nipasẹ boya o kọja awọn idanwo ẹyọkan, lẹhinna ṣe deede laarin ẹgbẹ naa.

Idinku iranti GPU ni opo gigun ti epo RLHF nipa sisọ nẹtiwọọki alariwisi PPO silẹ ati lilo ẹgbẹ tumọ si bi ipilẹ dipo.

Awọn ewu & Awọn ọna iṣọ

Awọn ẹgbẹ oriṣiriṣi le lo ọrọ kanna ni oriṣiriṣi, nitorinaa ṣalaye iwọn ni kutukutu.

Awọn aṣepari le wo lagbara lakoko ti iṣẹ-aye gidi ko ṣe deede.

Aibikita didara data ati awọn ero igbelewọn nigbagbogbo ṣẹda awọn abajade ẹlẹgẹ.

Ilana Ilana imuse

1

Bẹrẹ pẹlu itumọ-ede itele ti abajade ti o nilo.

2

Mu metiriki aṣeyọri kan ati ipo ikuna kan ṣaaju idanwo.

3

Ṣiṣe awakọ kekere kan pẹlu data aṣoju, kii ṣe eto demo didan.

4

Iwe-ipamọ nibiti Isọdọtun Esan Ẹgbẹ ni RLHF ṣe iranlọwọ ati nibiti awọn ọna ti o rọrun dara julọ.

Tesiwaju Ṣiṣawari

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bẹrẹ adanwo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Itọsọna atẹle

Iṣe deede Gigun ni Iṣapeye Iyanfẹ

Awọn ibeere ti a beere nigbagbogbo

What is Grouped Reward Normalization in RLHF?

Iṣe deede ere ti a ṣe akojọpọ ṣe iwọn awọn ere awoṣe kan laarin ipele awọn idahun si itọsi kanna, titan awọn ikun ariwo sinu ami ikẹkọ iduroṣinṣin. O jẹ ẹtan mojuto lẹhin GRPO, algorithm ti o ṣe agbara ọpọlọpọ awọn awoṣe ero ode oni.

Ninu isọdọtun ere akojọpọ, kini ere idahun kọọkan ni akawe si?

Ẹsan kọọkan jẹ iyipada si z-score nipa lilo aropin ati iyatọ boṣewa ti ẹgbẹ ti awọn idahun si iyara kanna.

Iru algoridimu wo ni o ni nkan ṣe pẹlu isọdọtun ere akojọpọ?

GRPO, ti a ṣe nipasẹ DeepSeek ati lilo ninu DeepSeek-R1, ni itumọ ti ni ayika deede awọn ere laarin ẹgbẹ kan.

Apakan wo ni PPO boṣewa ṣe GRPO ni pataki imukuro?

Nipa lilo apapọ ẹgbẹ bi ipilẹ, GRPO ju alariwisi ti ẹkọ silẹ, fifipamọ iranti ati iṣiro.

Kini yoo ṣẹlẹ si idahun ti ere rẹ wa labẹ itumọ ẹgbẹ rẹ?

Iyokuro ẹgbẹ tumọ si jẹ ki awọn idahun ni isalẹ-apapọ ni anfani odi, titari eto imulo kuro lọdọ wọn.

Kini idi ti ṣiṣe deede laarin ẹgbẹ kan dinku iyatọ ikẹkọ?

Nitoripe awọn afiwera jẹ ibatan laarin itọka kọọkan, awọn iyatọ ninu iwọn pipe ati iṣoro iyara wẹ jade.