Műszaki ÚTMUTATÓ

Az emberi visszajelzésekből való tanulás megerősítése

Az RLHF az a technika, amely egy nyers nyelvi modellt segítőkész, udvarias asszisztenssé varázsol azáltal, hogy az emberi preferenciákra tanítja.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

Mély merülés

Az előképzett nyelvi modell hihető szöveget jósol, de a plauzibilis nem egyenlő a segítőkész, őszinte vagy biztonságos szöveggel. Az RLHF ezt szakaszosan javítja. Először is, a felügyelt finomhangolás megtanítja a modellt, hogy kövesse az utasításokat ember által írt példaválaszok segítségével. Ezután az emberek összehasonlítják a modellválaszok párjait ugyanarra a felszólításra, és kiválasztják a jobbat; ezek az összehasonlítások egy külön jutalmazási modellt képeznek, amely bármilyen választ értékel. Végül a nyelvi modellt megerősítő tanulással optimalizálták, hogy a jutalommodellnek megfelelő válaszokat adjon. A büntetés megakadályozza, hogy túl messze sodródjon az eredeti modelltől, így gördülékeny marad, és nem használja ki a jutalommodell furcsaságait. Az RLHF központi szerepet játszott a ChatGPT típusú asszisztensek használhatóvá tételében.

Technikai betekintés

A jutalmazási modellt általában Bradley-Terry stílusvesztésű preferenciapárokra képezik, megtanulva, hogy az ember által preferált válasznak magasabb skaláris pontszámot adjon. A házirendet ezután frissítik a PPO-val (Proximal Policy Optimization), amely maximalizálja a jutalmat, míg a KL-divergencia büntetés a referenciamodellhez képest megakadályozza a túloptimalizálást és a „jutalmak feltörését”. Mivel a PPO macerás, az újabb módszerek, mint például a DPO (Direct Preference Optimization) kihagyják az explicit jutalmazási modellt és a megerősítési hurkot, és közvetlenül preferenciapárokból optimalizálják a házirendet.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

Az emberi visszajelzésekből való tanulás megerősítésének jövője

Az RLHF áramvonalasítása és részben automatizálása folyamatban van. Az adatvédelmi tisztviselő és a kapcsolódó közvetlen preferenciális módszerek sok csapatnál felváltják a nehéz PPO-folyamatot, és az RLAIF mesterséges intelligencia által generált visszajelzést használ (mint az alkotmányos mesterségesintelligencia esetében) a címkézési költségek csökkentése érdekében. A kutatás a jutalmazási hackelés, a jegyzők torzítása és a hosszú vagy szakértői válaszok megítélésének nehézségei ellen küzd olyan technikákkal, mint a folyamatfelügyelet és a vita. Várható, hogy az összehangolás ötvözze az emberi és a mesterséges intelligencia visszajelzéseit, gazdagabb jutalomjeleket az egyetlen hüvelykujj felütésen túl, és egyre nagyobb ellenőrzést kap, hogy ki adja meg a preferenciákat és milyen értékeket kódol.

Valós megvalósítás

A csevegési asszisztens hangolása úgy, hogy az elutasítsa a káros kéréseket, és hasznos, jól strukturált válaszokat adjon, nem csak elfogadható szöveget.

Az összefoglaló párok rangsorolása emberi preferenciák alapján, hogy olyan modellt képezzenek ki, amely összefoglalókat ír, amelyeket az emberek valóban hasznosnak találnak.

A mérgező vagy elfogult kimenetek csökkentése az értékelők által tiszteletteljesnek és biztonságosnak ítélt válaszok jutalmazásával.

DPO használata előnyben részesített és elutasított válaszok adathalmazán egy nyílt forráskódú modell összehangolásához teljes PPO-hurok futtatása nélkül.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Reinforcement Learning From Human Feedback?

Az RLHF az a technika, amely egy nyers nyelvi modellt segítőkész, udvarias asszisztenssé varázsol azáltal, hogy az emberi preferenciákra tanítja. Ez azért fontos, mert a modell viselkedését hozzáigazítja ahhoz, amit az emberek valójában akarnak, nem csak azzal, ami statisztikailag valószínű.

Mi az RLHF fő célja egy nyelvi modell szempontjából?

Az RLHF az emberek által preferált válaszok felé irányítja a modellt, és segítőkészebbé, őszintébbé és biztonságosabbá teszi, mint pusztán elfogadhatóvá.

Mit tanul meg valójában az RLHF jutalmazási modellje?

A jutalmazási modellt az emberi preferenciák összehasonlítására képezik a válaszok pontozása érdekében, így biztosítva azt a jelet, amelyre a politika optimalizál.

Miért használnak KL-divergencia büntetést az eredeti modellel szemben az RL lépés során?

A KL-büntetés az optimalizált irányelvet a referenciamodellhez közel tartja, védve a jutalomhackelést és a folyékonyság elvesztését.

Általában hogyan gyűjtik a preferenciaadatokat a jutalommodellhez?

Az annotátorok páronkénti összehasonlításban választják ki az előnyben részesített választ, ami egy Bradley-Terry-stílusú veszteségen keresztül képezi a jutalommodellt.

Milyen előnyöket kínál a DPO (Direct Preference Optimization) a klasszikus RLHF-folyamattal szemben?

Az adatvédelmi tisztviselő a célt közvetlenül a preferenciákból vezeti le, elkerülve a külön jutalmazási modellt és a nehézkes megerősítő tanulási lépést.