Nyelvi AI ÚTMUTATÓ

Elutasítási mintavételi finomhangolás

Az elutasító mintavételi finomhangolás (RFT) számos jelölt választ generál, csak a legjobb pontszámot elérteket tartja meg, és a modellt ezekre a nyertesekre tanítja át.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Mély merülés

Az elutasítás mintavételezésének finomhangolása, amelyet néha az N legjobb finomhangolásnak is neveznek, kulcsfontosságú összetevője annak, ahogyan a Meta Llama 2-je és Llama 3 modelljei egymáshoz igazításra kerültek. A recept egyszerű: minden felszólításhoz vegyen mintát az aktuális modell több válaszából (mondjuk 4-től 64-ig), mindegyiket értékelje jutalommodellel vagy egy automatikus ellenőrzővel, majd dobja el („elutasítja”) a legjobb eredményt kivéve. A fennmaradt kiváló minőségű minták egy friss, felügyelt finomhangoló adatkészletté válnak, és a modellt szokásos next-token veszteséggel képezik rájuk. Ennek a ciklusnak a megismétlése ismétlődően arra ösztönzi a modellt, hogy önmagában jobb válaszokat generáljon. Mivel a modell tanul a saját szűrt kimeneteiből, az RFT elkerüli a politika-gradiens RL instabilitását és hangolási fejfájását, miközben továbbra is kihasználja a jutalomjelet.

Technikai betekintés

Az RFT azt a tényt használja ki, hogy a sokszoros mintavételezés és a maximális jutalom válaszának megtartása közelíti a kiélezett, jobb minőségű eloszlásból történő válogatást. Az ezekre a nyertesekre vonatkozó szabványos kereszt-entrópiával történő képzés hatékonyan visszaadja ezt a legjobb N viselkedést a modell egymintás kimeneteibe. Az olyan ellenőrizhető tartományok esetében, mint a matematika vagy a kód, a „jutalom” egyszerűen az lehet, hogy a végső válasz vagy az egységteszt sikeres volt, így teljesen szükségtelenné válik a tanult jutalommodell.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

Az elutasításos mintavétel finomhangolásának jövője

Az RFT központi szerepet tölt be a modern utóképzésben, gyakran használják az RL módszerek, például a PPO és a DPO előtt vagy mellett. A vonzereje az olcsó következtetésekkel és az erős automatikus hitelesítőkkel nő: ahogy a modellek egyre jobbak az öngenerálásban és az önellenőrzésben, az iterált elutasítás mintavételezése támogatja a szintetikus adatokat és az önfejlesztő hurkokat. Szorosabb integrációra számíthat az igazolható gondolati láncokat létrehozó érvelési modellekkel, valamint folyamatos tanulmányozással, hogyan lehet elkerülni a jutalom hackelést és a diverzitás összeomlását, amikor ismételten a modell saját kimeneteire oktat.

Valós megvalósítás

A láma-stílusú modellek összehangolása felszólításonkénti több válasz mintavételével, a legmagasabb jutalommodell-pontszámok megtartásával, majd ezeken az SFT-vel

A matematikai megoldó fejlesztése sok megoldás generálásával és csak azok megtartásával, amelyek elérik a helyes, ellenőrizhető választ

Kódgenerálás, ahol a jelölteket csak akkor tartják meg, ha sikeresen teljesítenek az egységteszteken, majd képzési adatként használják őket

Szintetikus utasítás-adatkészletek létrehozása a modell saját legjobb saját maga által generált válaszainak szűrésével a következő képzési körhöz

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

QLoRA és 4 bites finomhangolás

Gyakran ismételt kérdések

What is Rejection Sampling Fine-Tuning?

Az elutasító mintavételi finomhangolás (RFT) számos jelölt választ generál, csak a legjobb pontszámot elérteket tartja meg, és a modellt ezekre a nyertesekre tanítja át. Ez azért fontos, mert az RLHF előnyének nagy részét kínálja, ha az egyszerű felügyelt tanulást a komplex megerősítő tanulás helyett.

Mi a Rejection Sampling Fine-Tuning alapötlete?

Az RFT több válaszból mintát vesz, a legjobb pontszámot elértekre szűri, és ezekre a nyertesekre finomhangolja a modellt.

Az olyan ellenőrizhető tartományokban, mint a matematika vagy a kód, mi szolgálhat jutalomként?

Ellenőrizhető feladatokhoz az RFT használhat pontos helyességet vagy egységteszteket, elkerülve a tanult jutalmazási modellt.

Melyik modellcsalád használt híresen elutasító mintavételt az igazítás során?

Meta a Llama 2 és Llama 3 modellek edzés utáni receptje részeként az elutasítási mintavételt írja le.

Miért részesíthetik előnyben a csapatok az RFT-t az irányelv-gradienssel szemben, mint például a PPO?

Az RFT a szűrt mintákon a szokásos next-token veszteséggel tanít újra, elkerülve a hangolási nehézségeket és az irányelv-gradiens módszerek instabilitását.

Mire jó a képzés a maximális jutalommal járó mintákon?

A legjobban szűrt válaszokból tanulva a modell egyetlen generáció alatt magasabb színvonalú viselkedést internalizál.