Nyelvi AI ÚTMUTATÓ

Jutalommodellezés

A jutalommodell egy neurális hálózat, amelyet arra képeztek ki, hogy előre jelezze, mennyire jó egy mesterséges intelligencia válasza, és automatizáltan segíti az emberi megítélést.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

Mély merülés

A jutalommodellezés egy gyakorlati problémát old meg: az emberek nem tudják értékelni a modell által a képzés során generált milliónyi kimenet mindegyikét. Ehelyett a címkézők a válaszok egy kis csoportját hasonlítják össze, általában kiválasztva, hogy ugyanarra a kérdésre adott két válasz közül melyik a jobb. Ezután ezekre az összehasonlításokra egy jutalmazási modellt képeznek ki, amely egyetlen skaláris pontszámot ad ki bármely azonnali válaszpárhoz. A standard képzési cél a Bradley-Terry modell, amely a páronkénti preferenciákat annak valószínűségévé alakítja, hogy az egyik válasz felülmúlja a másikat. A betanítás után ez a jutalommodell olcsón képes korlátlan számú új kimenetet kiértékelni, és azt a jelet adja, amelyet az olyan algoritmusok, mint a PPO, a nyelvi modell fejlesztésére használnak. A jutalmazási modelleket a következtetési időpontban újra felhasználják az N legjobb mintavételéhez, ahol sok jelöltet generálnak, és a legmagasabb pontszámot elérőt adják vissza.

Technikai betekintés

A jutalommodell általában az alapnyelvi modell, amelynek token-előrejelző fejét egyetlen lineáris réteg váltja fel, amely egyetlen skalárt bocsát ki. A képzés maximalizálja annak log-valószínűségét, hogy a kiválasztott válasz magasabb pontszámot érjen el, mint az elutasított: loss = -log(sigmoid(r_chosen - r_rejected)). Csak a relatív különbség számít, ezért az abszolút skála tetszőleges. A minőség a címke egységességétől és a válaszstílusok széles körű lefedettségétől függ.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A jutalommodellezés jövője

A kutatás a jutalmazási modellek legnagyobb gyengeségeivel foglalkozik: „feltörhetők” (a modellek olyan furcsaságokat használnak ki, mint a hosszúság előnyben részesítése), és a politika javulásával kikerülnek a terjesztésből. Az ígéretes irányvonalak közé tartoznak az egyes érvelési lépéseket pontozó folyamat-jutalmazási modellek, a hackelést ellenálló együttesek és bizonytalansági becslések, a mesterséges intelligencia által generált preferenciacímkék (RLAIF) és a generatív jutalmazási modellek, amelyek kritikát és indoklást állítanak elő, nem pedig puszta számot.

Valós megvalósítás

Az RLHF tápellátása olyan asszisztensek számára, mint ChatGPT és Claude a jelöltek válaszainak pontozásával a PPO képzés során

Best-of-N mintavétel, ahol egy modell sok választ generál, és a jutalommodell kiválasztja a legjobbat a felhasználó számára

Matematikai és kódolási „ellenőrzők” vagy folyamat-jutalmazó modellek, amelyek köztes érvelési lépéseket pontoznak a problémamegoldás javítása érdekében

A szintetikus edzésadatok rangsorolása és szűrése, csak a magas pontszámot elért generációk megtartása a további finomhangolás érdekében

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Bradley-Terry Jutalommodellezés

Gyakran ismételt kérdések

What is Reward Modeling?

A jutalommodell egy neurális hálózat, amelyet arra képeztek ki, hogy előre jelezze, mennyire jó egy mesterséges intelligencia válasza, és automatizáltan segíti az emberi megítélést. Ez a pontozási motor, amely lehetővé teszi az emberi visszajelzésekből történő megerősítő tanulást.

Mi a jutalommodell elsődleges kimenete egy adott azonnali válasz pár esetében?

A jutalommodell egy felszólítást és választ egy skalárszámra térképez fel, amely az előre jelzett minőséget vagy az emberi preferenciát jelenti.

Milyen emberi adatokat használnak leggyakrabban a jutalmazási modellek képzéséhez?

A címkézők általában összehasonlítanak két választ ugyanarra a felszólításra, és kiválasztják a jobbat; a Bradley-Terry modell ezeket skaláris jutalommá alakítja át.

Mit optimalizál a szabványos jutalommodell veszteség?

A Bradley-Terry veszteség, -log(sigmoid(r_chosen - r_rejected)), csak a relatív sorrenddel törődik, tehát az abszolút skála tetszőleges.

Mi az a „jutalmak hackelése”?

A jutalomhackelés akkor történik, amikor a modell olyan parancsikonokat talál (például túlzott hosszúság vagy hízelgés), amelyeket a tökéletlen jutalommodell magasra értékel, de az emberek nem.

Hogyan származik a jutalommodell építészetileg egy nyelvi modellből?

A jutalommodell általában újrahasználja az LM gerincét, de a végső réteget felcseréli egy olyanra, amely egyetlen skaláris jutalmat ad ki.